לכל הרצה של צינור עיבוד נתונים שנוצר באמצעות Agent Platform Pipelines יש כמה ארטיפקטים ופרמטרים משויכים, כמו מודלים, מערכי נתונים, תבניות של צינורות עיבוד נתונים ורכיבים. שושלת הנתונים של ארטיפקט של פייפליין כוללת את הגורמים שתרמו ליצירה שלו, וגם ארטיפקטים ומטא-נתונים שנגזרים מהארטיפקט. לדוגמה, שושלת של מודל יכולה לכלול את המידע הבא:
נתוני האימון, הבדיקה וההערכה ששימשו ליצירת המודל.
ההיפר-פרמטרים שבהם נעשה שימוש במהלך אימון המודל.
מטא-נתונים שתועדו במהלך תהליך האימון וההערכה, כמו רמת הדיוק של המודל.
ארטיפקטים שנובעים מהמודל הזה, כמו תוצאות של חיזויים באצווה.
אפשר להשתמש במטא-נתונים האלה כדי לענות על שאלות כמו:
למה הרצת צינור מסוים הניבה מודל מדויק במיוחד?
איזה מודל הופק מהרצת צינורות הנתונים הכי מדויקת, ואילו היפרפרמטרים שימשו לאימון המודל?
בהתאם לשלבים בצינור, יכול להיות שתוכלו לענות על שאלות לגבי ניהול המערכת. לדוגמה, אפשר להשתמש במטא-נתונים כדי לקבוע איזו גרסה של המודל הייתה בייצור בנקודת זמן מסוימת.
כדי לראות ולנתח את שושלת הנתונים של ארטיפקטים של פייפליין, אפשר להשתמש ב-Vertex ML Metadata או ב-Knowledge Catalog.
בטבלה הבאה מפורטים ההבדלים בין Vertex ML Metadata לבין Knowledge Catalog:
| תכונה | Vertex ML Metadata | Knowledge Catalog |
|---|---|---|
| סוגי המטא-נתונים של צינורות שמתועדים | כל הארטיפקטים של הקלט והפלט שנוצרו בהרצת צינור. | פריטי קלט ופלט שאפשר למפות לשמות מלאים (FQNs) שנתמכים על ידי Knowledge Catalog, בדרך כלל באמצעות Google Cloud רכיבי צינור. |
| גיאוגרפיה | קריאות מאזור יחיד. | קריאות גלובליות, כלומר קריאות שמתבצעות במספר אזורים. |
| פרויקטים | קריאות של פרויקט יחיד. | קריאה בכל הארגון בכמה פרויקטים. |
| שירותים משולבים | משולבת עם Agent Platform Pipelines, Gemini Enterprise Agent Platform Experiments, Gemini Enterprise Agent Platform מרשם המודלים ו-Datasets. | משולב עם מספר Google Cloud מוצרים, כמו Gemini Enterprise Agent Platform, BigQuery, Managed Service for Apache Airflow ו-Managed Service for Apache Spark. |
| רוצה להצטרף? | לא, תמיד מופעל. | כדי להצטרף, מפעילים את Data Lineage API בכל פרויקט. |
מיפוי ארטיפקטים של Vertex ML Metadata ל-Knowledge Catalog
כדי למפות ארטיפקטים של Vertex ML Metadata ל-FQNs ב-Knowledge Catalog, צריך לבצע את הפעולות הבאות:
אפשר להשתמש ב Google Cloud רכיבי צינור עיבוד הנתונים כשיוצרים מודלים של Agent Platform ומערכי נתונים מנוהלים.
משתמשים בשמות של סכימות מותאמות אישית (
google.VertexDatasetאוgoogle.VertexModel) כשמציינים את שם המשאב של המודל או של מערך הנתונים המנוהל בשדהmetadata, כפי שמוצג בדוגמה הבאה:
{
"name": "projects/example-project/locations/us-central1/metadataStores/default/artifacts/example-artifact",
"displayName": "My dataset",
"uri": "https://us-central1-aiplatform.googleapis.com/v1/projects/example-project/locations/us-central1/datasets/example-dataset",
...
"schemaTitle": "google.VertexDataset",
"schemaVersion": "0.0.1",
"metadata": {
"resourceName": "projects/example-project/locations/us-central1/datasets/example-dataset"
}
}
ניתוח שושלת נתונים של ארטיפקטים של פייפליין באמצעות Vertex ML Metadata
כשמריצים פייפליין באמצעות Agent Platform Pipelines, הארטיפקטים והפרמטרים של הפעלת הפייפליין מאוחסנים באמצעות Vertex ML Metadata. Vertex ML Metadata מקל על ניתוח שושלת הנתונים של הארטיפקטים של הפייפליין, כי הוא חוסך לכם את הקושי שבמעקב אחרי המטא-נתונים של הפייפליין.
אם זו הפעם הראשונה שאתם משתמשים ב-Vertex ML Metadata, כדאי לקרוא את המבוא ל-Vertex ML Metadata.
כדי לראות את תרשים שושלת הנתונים של ארטיפקט של פייפליין באמצעות Vertex ML Metadata, פועלים לפי ההוראות הבאות:
במסוף Google Cloud , בקטע Gemini Enterprise Agent Platform, עוברים לדף Metadata.
בדף המטא-נתונים מפורטים הארטיפקטים שנוצרו במאגר המטא-נתונים שמוגדר כברירת מחדל.
בתפריט הנפתח Region, בוחרים את האזור שבו נוצר הריצה.
לוחצים על השם לתצוגה של ארטיפקט כדי לראות את תרשים השושלת שלו.
מוצג תרשים סטטי שבו רואים את הארטיפקטים וההפעלות שכלולים בתרשים השושלת הזה.
אפשר ללחוץ על ארטיפקט או על ביצוע כדי לקבל מידע נוסף עליהם.
ניתוח שושלת נתונים של ארטיפקטים של פייפליין באמצעות Knowledge Catalog
Knowledge Catalog מגלה מטא-נתונים מGoogle Cloud משאבים, שכוללים ארטיפקטים של צינורות נתונים של Agent Platform כמו מודלים, מערכי נתונים מנוהלים וGoogle Cloud משאבים אחרים שאפשר לגלות ב-Knowledge Catalog. אפשר לגלות את הארטיפקטים האלה באמצעות יכולת חיפוש המטא-נתונים של Knowledge Catalog ולצפות בתרשימי השושלת שלהם.
מידע נוסף על יכולת החיפוש של מטא-נתונים ב-Knowledge Catalog זמין במאמר חיפוש משאבים ב-Knowledge Catalog.
שימו לב: יכול להיות ש-Knowledge Catalog לא יהיה זמין בכל האזורים שבהם יש תמיכה ב-Agent Platform Pipelines. אם Knowledge Catalog לא נתמך באזור שלכם, אתם יכולים להשתמש ב-Vertex ML Metadata. רשימת האזורים הנתמכים ב-Knowledge Catalog
כדי לראות את תרשים שושלת הנתונים של ארטיפקט של פייפליין ב-Knowledge Catalog:
כדי להריץ שאילתת חיפוש ב-Knowledge Catalog במסוף Google Cloud , עוברים לדף חיפוש ב-Knowledge Catalog.
אפשר לחפש את הארטיפקטים בעזרת המסננים. לדוגמה, אפשר להשתמש במסנן סוגי נתונים כדי לציין את סוג הארטיפקט, כמו מודל, מערך נתונים או טבלה ב-BigQuery. מידע נוסף זמין במאמר חיפוש משאבים ב-Knowledge Catalog.
אפשר גם להגדיר את השאילתה בשדה החיפוש.
כדי לראות את שושלת הנתונים של ארטיפקט, לוחצים על שם הארטיפקט ואז על הכרטיסייה שושלת נתונים.
בתרשים של שושלת הנתונים, התהליכים של Agent Platform מסומנים ב-
.
הם כוללים ארטיפקטים של צינורות, רכיבים של צינורות ותבניות של צינורות.כדי לראות את הפרטים של תהליך, לוחצים על התהליך בגרף של שושלת נתונים.
בתהליכים שמבוססים על משימות של צינורות מריצות של צינורות, אפשר לבצע את הפעולות הבאות:
- כדי לראות את ההרצה של צינור העיבוד ב-Agent Platform, לוחצים על Open in Agent Platform (פתיחה ב-Agent Platform) בDetails tab (כרטיסיית הפרטים). כדי לראות את פרטי זמן הריצה של הפעלת צינור, כמו מצבים, חותמות זמן ומאפיינים, לוחצים על עוד. כדי לראות את הפעלת הפייפליין ב-Agent Platform, לוחצים על פתיחה ב-Agent Platform.
בתהליכים שמבוססים על תבנית של צינור, אפשר לבצע את הפעולות הבאות:
כדי לראות את פרטי התבנית ב-Agent Platform, לוחצים על פתיחה ב-Agent Platform בכרטיסיית הפרטים.
אפשר לראות את רשימת המשימות של צינור עיבוד הנתונים שנוצרו בהרצות של צינור עיבוד הנתונים בכרטיסייה Runs. כדי לראות את הפרטים של תבנית צינור הנתונים ב-Agent Platform, לוחצים על עוד ואז על פתיחה ב-Agent Platform.
המאמרים הבאים
- איך מריצים צינור
- מתחילים להציג ולנתח את התוצאות של משפך המכירות.
- איך יוצרים צינור נתונים של למידת מכונה