במסמך הזה מפורטת סקירה כללית על הצינור והרכיבים של AutoML מקצה לקצה. כדי ללמוד איך לאמן מודל באמצעות End-to-End AutoML, אפשר לעיין במאמר אימון מודל באמצעות End-to-End AutoML.
Tabular Workflow for End-to-End AutoML הוא צינור AutoML מלא למשימות סיווג ורגרסיה. הוא דומה ל-AutoML API, אבל מאפשר לכם לבחור מה לשלוט ומה להפוך לאוטומטי. במקום אמצעי בקרה לכל הצינור, יש אמצעי בקרה לכל שלב בצינור. אמצעי הבקרה של הצינור כוללים:
- פיצול נתונים
- Feature engineering
- חיפוש אדריכלות
- אימון המודל
- שילוב מודלים
- זיקוק מודלים
יתרונות
הנה כמה מהיתרונות של Tabular Workflow for End-to-End AutoML:
- תמיכה במערכי נתונים גדולים בגודל של כמה טרה-בייט, עם עד 1,000 עמודות.
- האפשרות הזו מאפשרת לכם לשפר את היציבות ולקצר את זמן האימון על ידי הגבלת מרחב החיפוש של סוגי הארכיטקטורה או דילוג על חיפוש הארכיטקטורה.
- האפשרות הזו מאפשרת לכם לשפר את מהירות האימון על ידי בחירה ידנית של החומרה שמשמשת לאימון ולחיפוש ארכיטקטורה.
- מאפשרת להקטין את גודל המודל ולשפר את זמן האחזור באמצעות זיקוק או שינוי גודל האנסמבל.
- אפשר לבדוק כל רכיב של AutoML בממשק גרפי רב-עוצמה של צינורות, שמאפשר לראות את טבלאות הנתונים שעברו טרנספורמציה, את ארכיטקטורות המודלים שנבדקו ועוד הרבה פרטים.
- כל רכיב AutoML מקבל גמישות ושקיפות מורחבות, כמו היכולת להתאים אישית פרמטרים, חומרה, להציג את סטטוס התהליך, יומנים ועוד.
AutoML מקצה לקצה בצינורות של Gemini Enterprise Agent Platform
Tabular Workflow for End-to-End AutoML הוא מופע מנוהל של צינורות של Gemini Enterprise Agent Platform.
Gemini Enterprise Agent Platform Pipelines הוא שירות ללא שרת (serverless) שמריץ צינורות של Kubeflow. אתם יכולים להשתמש בצינורות כדי להפוך לאוטומטיות את המשימות שלכם בלמידת מכונה ובהכנת נתונים, ולעקוב אחריהן. כל שלב בצינור העברת נתונים מבצע חלק מזרימת העבודה של צינור העברת הנתונים. לדוגמה, צינור יכול לכלול שלבים לפיצול נתונים, המרה של סוגי נתונים ואימון מודל. מכיוון ששלבים הם מופעים של רכיבי צינור עיבוד נתונים, יש להם קלט, פלט וקובץ אימג' של קונטיינר. אפשר להגדיר את נתוני הקלט של השלב מתוך נתוני הקלט של צינור העיבוד, או שהם יכולים להיות תלויים בפלט של שלבים אחרים בצינור העיבוד הזה. התלויות האלה מגדירות את תהליך העבודה של צינור הנתונים כגרף אציקלי מכוון.
סקירה כללית של צינורות ורכיבים
בתרשים הבא מוצג צינור עיבוד הנתונים של יצירת מודלים בתהליך העבודה של AutoML מקצה לקצה:
הרכיבים של צינור עיבוד הנתונים הם:
- split-materialized-data:
פיצול הנתונים המגובשים לקבוצת נתונים לאימון, לקבוצת הערכה ולקבוצת נתונים לבדיקה.
קלט:
- נתונים מהותיים
materialized_data.
פלט:
- חלוקת האימון שהתממשה
materialized_train_split. - פיצול הערכה מגובש
materialized_eval_split. - קבוצת נתונים לבדיקה שהוגדרה כחומר גלם
materialized_test_split.
- נתונים מהותיים
- merge-materialized-splits – מיזוג של פיצול ההערכה המגובה בחומרים ופיצול האימון המגובה בחומרים.
automl-tabular-stage-1-tuner – מבצע חיפוש של ארכיטקטורת מודל ומכוונן היפר-פרמטרים.
- ארכיטקטורה מוגדרת על ידי קבוצה של היפרפרמטרים.
- היפר-פרמטרים כוללים את סוג המודל ואת הפרמטרים של המודל.
- סוגי המודלים שנלקחים בחשבון הם רשתות נוירונים ועצים מחוזקים.
- המערכת מאמנת מודל לכל ארכיטקטורה שנבדקת.
automl-tabular-cv-trainer – מאמת את הארכיטקטורות באמצעות אימון מודלים על קפלים שונים של נתוני הקלט.
- הארכיטקטורות שנלקחות בחשבון הן אלה שמניבות את התוצאות הכי טובות בשלב הקודם.
- המערכת בוחרת כעשר ארכיטקטורות שהכי מתאימות. המספר המדויק מוגדר בתקציב ההדרכה.
automl-tabular-ensemble – משלב את הארכיטקטורות הטובות ביותר כדי ליצור מודל סופי.
- התרשים הבא ממחיש אימות צולב של K-fold עם bagging:
condition-is-distill – אופציונלי. יוצר גרסה קטנה יותר של מודל האנסמבל.
- מודל קטן יותר מקצר את זמן האחזור ומפחית את העלות של ההסקה.
automl-tabular-infra-validator – מאמת אם המודל שאומן הוא מודל תקין.
model-upload – העלאת המודל.
condition-is-evaluation – אופציונלי. משתמשים בקבוצת נתונים לבדיקה כדי לחשב את מדדי ההערכה.