בדף הזה מוסבר איך לחבר את שרשרת מקורות הנתונים לכלים למפתחים, כמו Gemini CLI ולקוחות אחרים של Model Context Protocol (MCP). קישור של שושלת הנתונים לכלים האלה מאפשר מעקב אחרי שושלת הנתונים מבוסס-AI וניתוח של מקור הנתונים ישירות בסביבת הפיתוח.
אפשר לחבר סביבות פיתוח משולבות (IDE) וכלים למפתחים שתומכים ב-MCP באמצעות MCP Toolbox for Databases מקומי. לאחר מכן תוכלו להשתמש בסוכני AI בסביבת הפיתוח המשולבת הקיימת כדי לשלוח שאילתות לתרשימי שושלת נתונים, לגלות את מקור הנתונים במעלה הזרם ולנתח את ההשפעה במורד הזרם על הנכסים שלכם.
מידע נוסף על MCP זמין במאמר Introduction to Model Context Protocol.
במדריך הזה מוסבר תהליך החיבור של הכלים הבאים:
- Gemini CLI
- Gemini Code Assist
- Claude Code
- Claude למחשב
- Codex
- Cline (תוסף ל-VS Code)
- Cursor
- Visual Studio Code (Copilot)
- Windsurf (לשעבר Codeium)
אילו כלים של MCP מספקת שושלת הנתונים?
השילוב של מעקב אחר מקורות נתונים מאפשר לסוכני AI לשלוח שאילתות ולנתח את מקורות הנתונים, שמייצגים את זרימת הנתונים בין נכסי המקור (במעלה הזרם) לנכסי היעד (במורד הזרם). הוא תומך גם בתיעוד של מקורות נתונים ברמת הישות (מעקב אחרי זרימת נתונים בין נכסים שלמים כמו טבלאות וקבצים) וגם בתיעוד של מקורות נתונים ברמת העמודה (מעקב אחרי זרימת נתונים בין שדות או עמודות ספציפיים בתוך נכסים).
הכלי datalineage-search-lineage מספק שושלת נתונים. הכלי מאחזר תגובה של קישורי שושלת שמתחברים לנכסים המבוקשים.
מידע נוסף על מקור שושלת הנתונים והכלים שזמינים בו מופיע במאמרי העזרה בנושא מקור שושלת הנתונים.
התפקידים הנדרשים
כדי לקבל את ההרשאות שדרושות לחיבור לנתוני שושלת נתונים באמצעות MCP Toolbox, צריך לבקש מהאדמין להקצות לכם בפרויקט את תפקידי ה-IAM הבאים:
-
כדי להפעיל ממשקי API:
אדמין של שימוש בשירות (
roles/serviceusage.serviceUsageAdmin) -
כדי להשתמש בהרשאות של שושלת נתונים:
צפייה בשושלת נתונים (
roles/datalineage.viewer)
להסבר על מתן תפקידים, ראו איך מנהלים את הגישה ברמת הפרויקט, התיקייה והארגון.
התפקידים המוגדרים מראש האלה כוללים את ההרשאות שנדרשות להתחבר ל-Data Lineage באמצעות MCP Toolbox. כדי לראות בדיוק אילו הרשאות נדרשות, אפשר להרחיב את הקטע ההרשאות הנדרשות:
ההרשאות הנדרשות
כדי להתחבר לנתוני שרשרת המקור באמצעות MCP Toolbox, נדרשות ההרשאות הבאות:
-
כדי להפעיל ממשקי API:
serviceusage.services.enable -
כדי להשתמש במיומנויות של שושלת נתונים:
-
datalineage.lineage.searchLinks -
datalineage.processes.get -
datalineage.runs.get
-
יכול להיות שתקבלו את ההרשאות האלה באמצעות תפקידים בהתאמה אישית או תפקידים מוגדרים מראש אחרים.
הפעלת ממשקי ה-API הנדרשים
-
נכנסים לדף לבחירת הפרויקט במסוף Google Cloud .
-
בוחרים או יוצרים Google Cloud פרויקט.
תפקידים שנדרשים כדי לבחור או ליצור פרויקט
- Select a project (בחירת פרויקט): כדי לבחור פרויקט לא צריך תפקיד IAM ספציפי – אפשר לבחור כל פרויקט שהוקצה לכם בו תפקיד.
-
יצירת פרויקט: כדי ליצור פרויקט, צריך את התפקיד Project Creator (יצירת פרויקטים) (
roles/resourcemanager.projectCreator), שכולל את ההרשאהresourcemanager.projects.create. איך מקצים תפקידים
מפעילים את Data lineage API.
תפקידים שנדרשים להפעלת ממשקי API
כדי להפעיל ממשקי API, נדרשת ההרשאה
serviceusage.services.enable. אם יצרתם את הפרויקט, סביר להניח שכבר יש לכם את ההרשאה הזו דרך התפקיד 'בעלים' (roles/owner). אחרת, תוכלו לקבל את ההרשאה הזו דרך התפקיד 'אדמין בממשק 'שימוש בשירות'' (roles/serviceusage.serviceUsageAdmin). איך מקצים תפקידים-
אם אתם משתמשים במעטפת מקומית, אתם צריכים ליצור פרטי כניסה לאימות מקומי עבור חשבון המשתמש:
gcloud auth application-default login
אם אתם משתמשים ב-Cloud Shell, אין צורך לבצע את הפעולה הזו.
אם מוחזרת שגיאת אימות ואתם משתמשים בספק זהויות חיצוני (IdP), ודאו ש נכנסתם ל-CLI של gcloud באמצעות המאגר המאוחד לניהול זהויות.
התקנה של MCP Toolbox
אם אתם מתכננים להשתמש רק ב-Gemini Code Assist, אתם לא צריכים להתקין את MCP Toolbox, כי הוא כולל את היכולות הנדרשות של השרת. כדי להתקין את MCP Toolbox בכלי IDE ובכלים אחרים, צריך לפעול לפי השלבים שבקטע הזה.
מורידים את הגרסה האחרונה של MCP Toolbox כקובץ בינארי. בוחרים את הגרסה הבינארית של MCP Toolbox שמתאימה למערכת ההפעלה ולארכיטקטורת המעבד. צריך להשתמש ב-MCP Toolbox
v0.31.0או בגרסה מתקדמת יותר.Linux/amd64
curl -O https://storage.googleapis.com/mcp-toolbox-for-databases/VERSION/linux/amd64/toolbox
מחליפים את
VERSIONבגרסה של MCP Toolbox – לדוגמה,v0.31.0.macOS (Darwin)/arm64
curl -O https://storage.googleapis.com/mcp-toolbox-for-databases/VERSION/darwin/arm64/toolbox
מחליפים את
VERSIONבגרסה של MCP Toolbox – לדוגמה,v0.31.0.macOS (Darwin)/amd64
curl -O https://storage.googleapis.com/mcp-toolbox-for-databases/VERSION/darwin/amd64/toolbox
מחליפים את
VERSIONבגרסה של MCP Toolbox – לדוגמה,v0.31.0.Windows/amd64
curl -O https://storage.googleapis.com/mcp-toolbox-for-databases/VERSION/windows/amd64/toolbox
מחליפים את
VERSIONבגרסה של MCP Toolbox – לדוגמה,v0.31.0.הופכים את הקובץ הבינארי לקובץ הפעלה:
chmod +x toolboxמאמתים את ההתקנה:
./toolbox --versionהתקנה מוצלחת מחזירה את מספר הגרסה, לדוגמה,
0.15.0.
הגדרה של לקוחות וחיבורים לשושלת נתונים
בקטע הזה מוסבר איך לקשר את מקורות הנתונים לכלי שלכם.
כדי לחבר את כלי ה-IDE וכלי MCP אחרים שמתאימים ל-data lineage, צריך קודם להתקין את MCP Toolbox וליצור קובץ הגדרה מותאם אישית למקור ה-lineage ולכלים.
בתיקיית השורש של הפרויקט או בתיקיית ההגדרות, יוצרים קובץ YAML בשם
lineage-config.yamlעם ההגדרות הבאות:kind: source name: lineage-source type: datalineage project: ${DATALINEAGE_PROJECT} --- kind: tool name: search_lineage type: datalineage-search-lineage source: lineage-source description: Retrieves a streaming response of lineage links connected to requested assets.מגדירים את משתנה הסביבה של הפרויקט: Google Cloud
export DATALINEAGE_PROJECT=PROJECT_IDמחליפים את
PROJECT_IDבמזהה הפרויקט. Google Cloudבמקום להשתמש בהגדרה מובנית מראש, מגדירים את הלקוח הספציפי באמצעות הדגל
--config, כמו שמוסבר בקטעים הבאים.
Gemini CLI
אתם יכולים להשתמש ב-Gemini CLI כדי לעקוב אחרי מקורות הנתונים. לשם כך, צריך להגדיר אותו כשרת MCP מקומי באמצעות MCP Toolbox וקובץ lineage-config.yaml בהתאמה אישית.
- בספריית העבודה של הפרויקט, יוצרים תיקייה בשם
.gemini(או פותחים את הספרייה הגלובלית~/.gemini). - בתוך הספרייה הזו, יוצרים או פותחים את הקובץ
settings.json. מוסיפים את ההגדרה הבאה:
{ "mcpServers": { "dataLineage": { "command": "./PATH/TO/toolbox", "args": ["--config","/PATH/TO/lineage-config.yaml","--stdio"], "env": { "DATALINEAGE_PROJECT": "PROJECT_ID" } } } }מחליפים את
PROJECT_IDבמזהה הפרויקט. Google Cloudשומרים את ההגדרה.
מפעילים את Gemini CLI במצב אינטראקטיבי:
geminiב-Gemini CLI, משתמשים בפקודה
/mcpכדי לוודא שהשרתdataLineageמחובר.
Gemini Code Assist
ב-Gemini Code Assist כלולות היכולות הנדרשות של שרת ה-MCP, כך שאין צורך להתקין את MCP Toolbox בנפרד.
- ב-VS Code, מתקינים את התוסף Gemini Code Assist.
- מפעילים את מצב הסוכן בצ'אט של Gemini Code Assist.
- בספריית העבודה, יוצרים תיקייה בשם
.gemini. בתוך התיקייה הזו, יוצרים קובץsettings.json. מוסיפים את ההגדרה הבאה:
{ "mcpServers": { "dataLineage": { "command": "./PATH/TO/toolbox", "args": ["--config","/PATH/TO/lineage-config.yaml","--stdio"], "env": { "DATALINEAGE_PROJECT": "PROJECT_ID" } } } }מחליפים את
PROJECT_IDבמזהה הפרויקט. Google Cloudשומרים את ההגדרה.
Claude Code
התוסף הרשמי מספק כלים ל-Knowledge Catalog, אבל אתם יכולים להשתמש ב-data lineage ב-Claude Code על ידי הגדרת שרת מקומי של MCP Toolbox עם קובץ ההגדרות המותאם אישית שלכם.
מגדירים את משתנה הסביבה כדי להתחבר לפרויקט של מעקב אחר מקורות נתונים:
export DATALINEAGE_PROJECT=PROJECT_IDמחליפים את
PROJECT_IDבמזהה הפרויקט. Google Cloudמגדירים את Claude Code כך שישתמש בשרת MCP Toolbox:
claude mcp add datalineage -- /PATH/TO/toolbox --config=/PATH/TO/lineage-config.yaml --stdioמפעילים את הסוכן:
claude
Codex
כדי להשתמש בתיעוד מקורות הנתונים ב-Codex, צריך להגדיר חיבור לשרת MCP בתצורת Codex כדי להריץ את MCP Toolbox עם קובץ lineage-config.yaml בהתאמה אישית:
מגדירים את משתנה הסביבה כדי להתחבר לפרויקט של מעקב אחר מקורות נתונים:
export DATALINEAGE_PROJECT="PROJECT_ID"מחליפים את
PROJECT_IDבמזהה הפרויקט. Google Cloudבתצורת ה-MCP של Codex, מוסיפים את השרת באמצעות MCP Toolbox:
{ "mcpServers": { "dataLineage": { "command": "./PATH/TO/toolbox", "args": ["--config","/PATH/TO/lineage-config.yaml","--stdio"], "env": { "DATALINEAGE_PROJECT": "PROJECT_ID" } } } }מחליפים את
PROJECT_IDבמזהה הפרויקט. Google Cloud
Claude למחשב
- פותחים את Claude למחשב ועוברים אל הגדרות.
- כדי לפתוח את קובץ ההגדרות, בכרטיסייה Developer (מפתחים), לוחצים על Edit config (עריכת ההגדרות).
מוסיפים את ההגדרה:
{ "mcpServers": { "dataLineage": { "command": "./PATH/TO/toolbox", "args": ["--config","/PATH/TO/lineage-config.yaml","--stdio"], "env": { "DATALINEAGE_PROJECT": "PROJECT_ID" } } } }מחליפים את
PROJECT_IDבמזהה הפרויקט. Google Cloudשומרים את ההגדרה.
מפעילים מחדש את Claude למחשב. במסך הצ'אט החדש מוצג סמל MCP שמייצג את שרת ה-MCP החדש.
קלין
- ב-VS Code, פותחים את התוסף Cline ואז לוחצים על הסמל MCP Servers.
- כדי לפתוח את קובץ ההגדרות, מקישים על Configure MCP Servers (הגדרת שרתי MCP).
מוסיפים את ההגדרה הבאה:
{ "mcpServers": { "dataLineage": { "command": "./PATH/TO/toolbox", "args": ["--config","/PATH/TO/lineage-config.yaml","--stdio"], "env": { "DATALINEAGE_PROJECT": "PROJECT_ID" } } } }מחליפים את
PROJECT_IDבמזהה הפרויקט. Google Cloudשומרים את ההגדרה. אחרי שהשרת מתחבר בהצלחה, מופיע סטטוס פעיל בצבע ירוק.
סמן
- אם התיקייה
.cursorלא קיימת, יוצרים אותה בתיקיית הבסיס של הפרויקט. - יוצרים את הקובץ
.cursor/mcp.jsonאם הוא לא קיים ופותחים אותו. מוסיפים את ההגדרה הבאה:
{ "mcpServers": { "dataLineage": { "command": "./PATH/TO/toolbox", "args": ["--config","/PATH/TO/lineage-config.yaml","--stdio"], "env": { "DATALINEAGE_PROJECT": "PROJECT_ID" } } } }מחליפים את
PROJECT_IDבמזהה הפרויקט. Google Cloudשומרים את ההגדרה.
פותחים את Cursor ועוברים אל הגדרות > הגדרות הסמן > MCP. כשמתבצע חיבור לשרת, מופיע סטטוס פעיל בצבע ירוק.
VS Code (Copilot)
- פותחים את VS Code ויוצרים את התיקייה
.vscodeבתיקיית השורש של הפרויקט, אם היא לא קיימת. - יוצרים את הקובץ
.vscode/mcp.jsonאם הוא לא קיים, ופותחים אותו. מוסיפים את ההגדרה הבאה:
{ "servers": { "dataLineage": { "command": "./PATH/TO/toolbox", "args": ["--config","/PATH/TO/lineage-config.yaml","--stdio"], "env": { "DATALINEAGE_PROJECT": "PROJECT_ID" } } } }מחליפים את
PROJECT_IDבמזהה הפרויקט. Google Cloudשומרים את ההגדרה.
גלישת רוח
- פותחים את Windsurf ועוברים אל Cascade assistant.
- כדי לפתוח את קובץ ההגדרות, לוחצים על סמל ה-MCP ואז על Configure (הגדרה).
מוסיפים את ההגדרה הבאה:
{ "mcpServers": { "dataLineage": { "command": "./PATH/TO/toolbox", "args": ["--config","/PATH/TO/lineage-config.yaml","--stdio"], "env": { "DATALINEAGE_PROJECT": "PROJECT_ID" } } } }מחליפים את
PROJECT_IDבמזהה הפרויקט. Google Cloudשומרים את ההגדרה.
שימוש במיומנויות
העוזר הדיגיטלי מבוסס-AI מקושר עכשיו לתיעוד מקורות הנתונים. אתם יכולים לבקש מהעוזר הדיגיטלי מבוסס-AI לעקוב אחרי שושלת הנתונים במעלה הזרם ובמורד הזרם בין הנכסים שלכם.
לדוגמה, אתם יכולים לבקש מהעוזר הדיגיטלי מבוסס ה-AI:
- מעקב אחרי המקור של הנתונים בטבלה ב-BigQuery (השיוך במעלה הזרם).
- לגלות אילו טבלאות או דוחות במורד הזרם תלויים בנכס נתונים ספציפי (שושלת נתונים במורד הזרם).
- בדיקת שושלת נתונים ברמת העמודה בין שדות ספציפיים בנכסים.
אופציונלי: מוסיפים הוראות למערכת
הוראות מערכת הן דרך לספק הנחיות ספציפיות ל-LLM, כדי לעזור לו להבין את ההקשר ולתת תשובות מדויקות יותר. מגדירים הוראות למערכת על סמך ההנחיה המומלצת למערכת בנושא שושלת הנתונים.
לדוגמה, אפשר להוסיף הוראות שינחו את מודל ה-LLM לגבי אופן השימוש במיומנויות של שרשרת מקורות הנתונים:
- כשמתבקשים לעקוב אחרי זרימת נתונים במעלה או במורד הזרם בין נכסים או עמודות, משתמשים במיומנות
search_lineageאו בכליdatalineage-search-lineage.
מידע נוסף על הגדרת ההוראות זמין במאמר בנושא שימוש בהוראות כדי לקבל עריכות מ-AI בהתאם לסגנון התכנות.
המאמרים הבאים
- מה ההבדל בין שרתי MCP מקומיים לשרתי MCP מרוחקים?
- איך משתמשים בשרת המקומי של MCP Toolbox עבור Knowledge Catalog
- מידע נוסף על כלי MCP של שושלת נתונים
- מידע נוסף על שושלת נתונים
- חיפוש משאבים ב-Knowledge Catalog