סקירה כללית על תהליך הכנת הנתונים

יש כמה אפשרויות לפיתוח נתוני האימון.

הבחירה שלכם תלויה במספר רב של גורמים.

‫Cloud Storage כמערכת קבצים שנטענת (Cloud Storage FUSE)

כדאי להשתמש ב-Cloud Storage כמערכת קבצים שנטענת (Cloud Storage FUSE) מהסיבות הבאות:

  • כשנתוני האימון לא מובְנים, כמו תמונות, טקסט או סרטונים: Cloud Storage הוא פתרון טבעי לאחסון של סוגי הקבצים הגדולים האלה, שלרוב הם קבצים בודדים.
  • כשנתוני האימון מובְנים בפורמטים כמו TFRecord: בדרך כלל משתמשים ב-Cloud Storage בפורמטים האלה שספציפיים ל-ML.
  • כשעובדים עם קבצים גדולים מאוד: Cloud Storage FUSE מעביר את הנתונים בסטרימינג למשימת האימון, במקום לדרוש הורדה של הקובץ כולו לרפליקות. הדבר יכול להוביל לטעינת נתונים מהירה יותר ולקיצור זמני ההפעלה של משימות במערכי נתונים גדולים.
  • כשמבצעים אימון מבוזר: Cloud Storage FUSE מספק תפוקה גבוהה לקריאות סדרתיות של קבצים גדולים, וזה יתרון בתרחישי אימון מבוזר שבהם כמה עובדים צריכים לגשת לנתונים במקביל.
  • כשאתם מעדיפים את הנוחות של גישה לנתונים ב-Cloud Storage כאילו הם היו מערכת קבצים מקומית, בלי שתצטרכו לבצע קריאות API מפורשות בקוד האימון.
  • אם הצורך העיקרי שלכם הוא אחסון שניתן להרחבה, ואתם פחות מודאגים לגבי זמן האחזור הנמוך ביותר לגישה אקראית למספר רב של קבצים קטנים.

ספציפי ל-Ray ב-Agent Platform

  • אתם יכולים לאחסן את הנתונים שלכם בקטגוריות של Cloud Storage, שאפשר לגשת אליהן מ-Ray on Agent Platform.
  • ‫Ray יכול לקרוא נתונים ישירות מ-Cloud Storage. לדוגמה, כשמריצים Spark on Ray, אפשר לקרוא קבצים מ-Cloud Storage.
  • Agent Platform משתמשת ב-Cloud Storage FUSE כדי לטעון קטגוריות של Cloud Storage כמערכות קבצים מקומיות בתוך משימות האימון שפועלות ב-Ray. כך אפליקציות Ray יכולות לגשת לנתונים כאילו הם נמצאים בדיסק מקומי, באמצעות פעולות קלט/פלט רגילות של קבצים.
  • כדי להשיג ביצועים אופטימליים, מומלץ להשתמש בקטגוריות של Cloud Storage באותו אזור שבו פועל אשכול Ray.

מידע נוסף

שיתוף Network File System ‏ (NFS)

  • כשנדרשת תפוקה גבוהה מאוד וגישה עם השהיה נמוכה לקבצים מרוחקים, כאילו הם מאוחסנים באופן מקומי. זה יכול להיות חשוב לסוגים מסוימים של נתונים או לאינטראקציות מורכבות עם קבצים במהלך אימון.
  • כשצריך להפוך קבצים מרוחקים לזמינים לכל הצמתים באשכול מחשוב, כמו אשכול Ray ב-Agent Platform.
  • כשהאפליקציה שלכם נהנית מממשק מערכת קבצים סטנדרטי יותר עם תאימות חזקה יותר ל-POSIX בהשוואה ל-Cloud Storage FUSE.
  • יש לכם תשתית NFS קיימת בענן הווירטואלי הפרטי (VPC) שאתם רוצים להשתמש בה.
  • אתם צריכים לשתף קבצים או ספריות בין כמה משימות או אשכולות עם גישה עקבית וזמן אחזור נמוך, ועדיף לנהל את ההרשאות ברמת מערכת הקבצים.

ספציפי ל-Ray ב-Agent Platform

  • אתם יכולים לטעון שיתופי NFS באשכול Ray בפלטפורמת Agent, וכך לגשת לקבצים מרוחקים כאילו הם מקומיים.
  • האפשרות הזו מועילה לגישה למערכות קבצים משותפות עם תפוקה גבוהה וזמן אחזור נמוך.
  • אפשר להגדיר נקודות טעינה של NFS כשיוצרים את אשכול Ray באמצעות Agent Platform SDK for Python. צריך לציין את השרת, הנתיב ונקודת הטעינה. אחרי הטעינה, קוד Ray יכול לקרוא ולכתוב בכרכים האלה של NFS באמצעות פעולות קבצים רגילות.

מידע נוסף

מערך נתונים מנוהל

  • ניהול ושליטה ריכוזיים בנתונים: מערכי נתונים מנוהלים מספקים מיקום מרכזי לארגון ולניהול של מערכי הנתונים ב-Agent Platform. כך אפשר לעקוב אחרי נכסי הנתונים ולנהל אותם בפרויקטים ובניסויים שונים.
  • תיוג נתונים: אתם יכולים ליצור משימות תיוג ולנהל קבוצות של הערות ישירות במערך הנתונים המנוהל.
  • מעקב אחרי השתלשלות הנתונים: מערכי נתונים מנוהלים עוקבים באופן אוטומטי אחרי השתלשלות הנתונים עד למודלים שאומנו על בסיס הנתונים האלה. המידע הזה חשוב כדי להבין את מקורות הנתונים שמשמשים למודלים ספציפיים, וכדי להבטיח שניתן יהיה לשחזר את התוצאות ולפקח על המודלים.
  • השוואה בין מודלים בהתאמה אישית לבין מודלים של AutoML: קבוצות נתונים מנוהלות מאפשרות לאמן מודלים בהתאמה אישית ומודלים של AutoML באמצעות אותם נתונים. כך תוכלו להשוות ישירות את הביצועים שלהם באותו מערך נתונים, ולבחור את הגישה הטובה ביותר לפתרון הבעיה.
  • יצירת נתונים סטטיסטיים ותרשימים: Agent Platform יכול ליצור באופן אוטומטי נתונים סטטיסטיים ותרשימים לנתונים בתוך מערך נתונים מנוהל. זה יכול לעזור בניתוח נתונים לצורך גילוי תובנות, ולהבין את המאפיינים של הנתונים.
  • פיצול נתונים אוטומטי: כשמשתמשים במערכי נתונים מנוהלים בצינורות אימון, Agent Platform יכול לפצל את הנתונים באופן אוטומטי למערכי אימון, אימות ובדיקה על סמך שברים שצוינו, מסננים, פיצולים מוגדרים מראש או חותמות זמן. כך תהליך הכנת הנתונים פשוט יותר.
  • שימוש בגרסאות של מערכי נתונים: מערכי נתונים מנוהלים מאפשרים ניהול גרסאות, כך שאפשר לעקוב אחרי שינויים בנתונים לאורך זמן ולחזור לגרסאות קודמות אם צריך.

ספציפי ל-Ray ב-Vertex AI

  • אם משתמשים במערך נתונים מנוהל בצינור עיבוד נתונים לאימון בפלטפורמת Agent Platform שמשתמש ב-Ray לאימון מבוזר, הנתונים ממערך הנתונים המנוהל יהיו זמינים למאגרי האימון, שאליהם אפליקציית Ray יכולה לגשת (דרך Cloud Storage או BigQuery שמוגדרים כנקודות גישה, אם מערך הנתונים מקושר למקורות האלה). משתני הסביבה AIP_TRAINING_DATA_URI, ‏ AIP_VALIDATION_DATA_URI ו-AIP_TEST_DATA_URI יצביעו על הנתונים.

מידע נוסף

BigQuery

  • כשמתחברים לנתונים ברכיבים של Agent Platform: הרבה כלים ושירותים של Agent Platform משתלבים ישירות עם BigQuery. אפשר להריץ שאילתות על נתונים ב-BigQuery מתוך JupyterLab. כך תוכלו ליצור אינטראקציה ישירה עם הנתונים שלכם ב-BigQuery כדי לחקור אותם, להציג אותם באופן חזותי ולפתח מודלים, בלי שתצטרכו להעביר אותם למערכת אחסון אחרת.
  • כשיוצרים צינורות אימון: כשיוצרים צינורות אימון בפלטפורמת הסוכנים, אפשר להשתמש בנתונים ישירות מ-BigQuery. לדוגמה, צינור יכול לשלוף נתונים מ-BigQuery, לעבד אותם מראש ואז לאמן מודל.
  • צינורות להדרכה רציפה של מודלים: כדי להגדיר הדרכה רציפה של מודלים, אפשר להפעיל הרצות של צינורות על סמך נתונים חדשים שמגיעים לטבלה ב-BigQuery. כך אפשר להפעיל אוטומציה של אימון מחדש של המודל. אתם יכולים להגדיר טריגר Eventarc כדי להפעיל צינור כשטוענים משימה חדשה לטבלה ספציפית ב-BigQuery.
  • מעקב אחרי מודלים: אפשר להשתמש ב-BigQuery כמקור למעקב אחרי הטיה של תכונות וסחיפה של המודלים שפרסתם. כדי לזהות הטיה, אפשר לציין את ה-URI של מערך הנתונים לאימון ב-BigQuery. בנוסף, אפשר לאחסן ב-BigQuery את היומנים מנקודות הקצה של ההסקה אונליין, ואז להשתמש בהם כמקור נתונים למעקב רציף. לשם כך, מומלץ שלטבלת BigQuery יהיה עמודה של חותמת זמן.
  • שילוב של BigQuery ML: אתם יכולים להשתמש במערכי נתונים של BigQuery כשאתם נעזרים ב-BigQuery ML כדי ליצור מודלים של למידת מכונה באמצעות SQL. ‏Vertex AI Workbench מאפשר ניתוח אינטראקטיבי של נתוני BigQuery ושימוש ב-BigQuery ML בסביבת מחברת.
  • ניתוח והכנת נתונים: לפני ההדרכה, אפשר להשתמש ב-BigQuery כדי לנתח את הנתונים ולהציג אותם באופן חזותי. אפשר גם לבצע טרנספורמציות של נתונים באמצעות שאילתות SQL ישירות ב-BigQuery לפני שמשתמשים בנתונים לצורך הדרכה.
  • גישה למערכי נתונים ציבוריים: ב-BigQuery יש הרבה מערכי נתונים ציבוריים, כמו מערך הנתונים של נסיעות במוניות בשיקגו, שאפשר להשתמש בהם בקלות לניסויים ולאימון ב-Vertex AI Workbench.

ספציפי ל-Ray ב-Vertex AI

  • ל-Ray ב-Vertex AI יש יכולות לקרוא נתונים ישירות מ-BigQuery. אתם יכולים להשתמש ב-SDK של Agent Platform ל-Python במשימת Ray כדי להריץ שאילתות BigQuery ולממש את התוצאות לשימוש באפליקציות Ray.
  • כשקוראים מ-BigQuery, חשוב לשים לב לגודל המקסימלי של תגובת השאילתה, שהוא 10GB.
  • אפשר גם לכתוב נתונים מהאפליקציות שלכם ב-Ray בחזרה ל-BigQuery באמצעות Agent Platform SDK ל-Python.

מידע נוסף