סקירה כללית של הפתרון
Google Cloud Cortex Framework מספק מאיצי פתרונות שעוזרים לכם לבנות מוצרי נתונים מהימנים ואיכותיים שמוכנים לניתוח מתקדם ולתרחישי שימוש מבוססי-סוכנים. המסגרת משתמשת במוצרים של Google Cloud, כולל BigQuery, Dataform, Knowledge Catalog ו-Gemini Enterprise Agent Platform.
מאיצי הפתרונות של Cortex Framework זמינים כמודולים גמישים עם קוד פתוח שאפשר לפרוס בצורה מאובטחת בסביבה Google Cloud שלכם כדי ליצור, להתאים אישית ולהרחיב במהירות מוצרי נתונים ממערכות מקוריות של ארגונים.
ה-Cortex Framework מייעל את האופן שבו צוותים יוצרים, מתזמנים ופורסים, ומקצר את הזמן עד להפקת ערך. הוא מספק בסיס מהימן לניתוח נתונים ארגוני ולתרחישי שימוש בסוכני AI.
מקורות נתונים נתמכים
מאיצי הפתרונות של Cortex Framework זמינים למקורות הנתונים הבאים:
רכיבים מרכזיים
Cortex Framework מורכב מרכיבי הפתרון הכלליים הבאים:
מסגרת לבנייה ולפריסה
מסגרת הבנייה והפריסה מתזמנת את המעבר מתצורות מקומיות לצינורות Dataform, למערכי נתונים פעילים ב-BigQuery, והיא מופעלת באמצעות סקריפטים של ממשק שורת הפקודה (CLI) (cortex-build, cortex-deploy, cortex-build-and-deploy) שמבוססים על כלים סטנדרטיים של Python (uv).
אפשר להריץ את הסקריפטים האלה בסביבות שונות:
- מכונות פיתוח מקומיות: להגדרה ראשונית, להתאמה אישית, לבדיקה ולניפוי באגים.
- Google Cloud Cloud Shell / תחנות עבודה וירטואליות: סביבות פיתוח מאובטחות שמתארחות בענן.
- פייפליינים של CI/CD: אוטומציה של בנייה ופריסה באמצעות מערכות כמו Cloud Build או GitHub Actions כדי להבטיח אינטגרציה רציפה.
המסגרת קומפיילת קובצי הגדרה (כמו config.yaml ו-table_settings.yaml), מנתחת את הסכימות של נכסי נתוני המקור (כולל עמודות בהתאמה אישית) ומפיקה באופן דינמי קוד JavaScript ו-SQLX של Dataform. אחר כך הקוד מועבר אל מאגר Dataform ב- Google Cloud והוא מוכן מיידית להרצת צינור הנתונים.
מודולים של נתונים
מודולים של נתונים מספקים את מסגרת הפיתוח והפריסה עם מטא-נתונים של פתרונות ארוזים שמגדירים את המבנה והרכיבים של צינורות עיבוד הנתונים ב-Dataform. יש סוגים שונים של מודולים:
- מודולים של שכבת בסיס הנתונים: הגדרה של מערכי הנתונים שמייצגים את המצב העדכני של טבלאות התפעול הגולמיות. הם מבצעים סטנדרטיזציה של סוגי הנתונים, משנים את השם של שדות הנתונים למונחים עסקיים שקלים לקריאה, מטפלים בשינויים בנתונים ומבצעים התאמות של אזורי זמן.
- מודולים של מוצרי נתונים: הגדרה של מודלים אנליטיים שנבנו על בסיס התוכן של מודול בסיס הנתונים. הם מטמיעים כללים עסקיים מורכבים, מדדי ביצועים מרכזיים (KPI), צבירות וצירופים חוצי-פונקציות (לדוגמה, שילוב של רשומות מכירות עם שערי חליפין) כדי לחשוף מערכי נתונים נקיים ומוכנים לשימוש.
- מודולים של קטלוג נתונים: הגדרת קטלוגים חיצוניים של lakehouse שנתמכים בהפניות לטבלאות חיצוניות ללא מניפסטים פיזיים.
המודולים הם בקוד פתוח וניתנים להתאמה אישית, כך שתוכלו להתאים אותם לדרישות העסקיות הייחודיות שלכם.
קטלוגים חיצוניים של נתונים
Cortex Framework תומך בשילוב ישיר עם קטלוגים חיצוניים של נתונים באמצעות מודולים של קטלוג נתונים. באמצעות קטלוג זמן הריצה של Lakehouse, אפשר להשתמש ב-framework כדי לשלוח שאילתות לטבלאות שמנוהלות באגמי נתונים חיצוניים או בשיתופי דלתא (כמו מוצרי נתונים שמקורם ב-SAP Business Data Cloud Connect for BigQuery) ללא תקורה של העתקה.
כך ארגונים יכולים לשלב תוכן שמועבר על ידי Cortex Framework עם מוצרי נתונים חיצוניים, וליצור תובנות עסקיות מאוחדות בלי לשמור נתונים כפולים או לתחזק צינורות נתונים.
תזמור ב-Dataform
ב-Cortex Framework נעשה שימוש ב-Dataform כדי לנהל את מחזור החיים של טרנספורמציות נתונים. Dataform מספק סביבה ללא שרתים (serverless) לבנייה, לבדיקה, לבקרת גרסאות ולתזמון של צינורות SQL מורכבים בתוך BigQuery.
במקום לכתוב SQL סטטי, המסגרת יוצרת באופן דינמי את קוד Dataform במהלך שלב הבנייה, כדי לשקף את ההגדרות וההתאמות האישיות הספציפיות שלכם. אחרי שהנתונים מוכנים במאגר היעד של Dataform ב- Google Cloud, אפשר להריץ את צינורות הנתונים שנוצרו כדי ליצור את הטבלאות והתצוגות המותאמות ולאכלס אותן.
מודלים של נתונים ב-BigQuery
כל הנתונים שעוברים עיבוד על ידי Cortex Framework מאורגנים ומאוחסנים ב-BigQuery. ה-framework תומך ב:
- טבלאות ותצוגות רגילות של BigQuery: מערכי נתונים של BigQuery שעברו אופטימיזציה באמצעות חלוקה למחיצות וסידור באשכולות כדי לשפר את ביצועי השאילתות ולשלוט בעלויות.
- מקורות נתונים מאוחדים: שאילתות שכוללות מערכי נתונים חיצוניים, ומאפשרות לכם לשלב אחסון ב-BigQuery עם טבלאות חיצוניות מאוחדות.
- קטלוג זמן ריצה של Lakehouse: שאילתות ישירות ללא העתקה של קטלוגים חיצוניים (כמו שיתוף דלתא) שנחשפים כטבלאות ב-BigQuery, עם תמיכה ביצירת מוצרי נתונים במקורות נתונים שונים.
שילוב עם Knowledge Catalog
Knowledge Catalog משמש כקטלוג מאוחד של נכסי נתונים לניהול ולגילוי של כל נכסי הנתונים בארגון. Cortex Framework משתלב באופן טבעי עם Knowledge Catalog באמצעות כלי ייעודי לסנכרון cortex-kc-sync.
כשמריצים את הכלי הזה, הוא רושם באופן אוטומטי את מוצרי הנתונים שפרסתם בקטלוג, ומייבא שמות שקריאים לבני אדם, תיאורים עסקיים מפורטים וקישורים לתיעוד. הוא מקשר בין טבלאות פיזיות ב-BigQuery לבין דומיינים עסקיים לוגיים, וכך מאפשר למנתחים עסקיים, למנהלי נתונים ולסוכני AI לגלות נכסי נתונים, תוך הקפדה על מעקב חזק אחר מקורות הנתונים. מידע נוסף זמין במאמר בנושא שילוב עם Knowledge Catalog.
ארכיטקטורת נתונים
מסגרת Cortex מאפשרת לעבד נתונים ב-BigQuery באופן סטנדרטי. הארכיטקטורה מאורגנת בשלוש שכבות נתונים מובְנות נפרדות, בהתאם לעקרונות של data mesh ארגוני, כדי לקדם בעלות ברורה, שימוש חוזר רב והפרדה ברורה בין שכבות הנתונים.
מערכת המקור
מערכות מקור הן המקורות של הנתונים העסקיים שלכם. הם יכולים לכלול אפליקציות ארגוניות שונות, מסדי נתונים או פלטפורמות שמהם מופקים נתונים. רשימה מלאה של מקורות נתונים נתמכים זמינה במאמר הזה.
שכבה גולמית
שכבת הנתונים הגולמיים מייצגת מערך נתונים של אזור נחיתה ב-BigQuery שלא ניתן לשינוי, לנתוני מקור, ליומני סימון נתונים שהשתנו (CDC) או למנות נתונים שעברו עיבוד של CDC. למרות שהוא מאחסן לעיתים קרובות יומני CDC (לדוגמה, מ-SAP ECC או מ-S/4HANA באמצעות כלי שכפול כמו BigQuery Connector for SAP או BigQuery Toolkit for SAP), הוא מיועד לייצוג של כל פורמט גולמי. במקורות שלא מספקים יומני CDC, כמו Salesforce או פידים חיצוניים של API, השכבה הזו מייצגת את כל החילוצים של האצוות או את מטען המידע (payload) של האירועים הגולמיים בדיוק כפי שהם מגיעים. השכבה הזו מספקת נתונים לשכבת בסיס הנתונים.
שכבת התשתית לנתונים
שכבת בסיס הנתונים מנקה, מתקננת וממירה נתוני נחיתה גולמיים לייצוג אמין יחיד של נתוני המקור העדכניים. הוא ממפה טבלאות גולמיות למבנים תואמים, מבצע סטנדרטיזציה של סוגי נתונים, מבצע אופטימיזציה של הביצועים באמצעות חלוקה למחיצות ואשכולות, מאחד סכימות כדי להבטיח עקביות ומוסיף הערות של מטא-נתונים לנכסים. במקורות של לכידת נתונים לשינוי (CDC), השכבה הזו ממזגת רשומות נכנסות באופן מצטבר כדי לשפר את הביצועים ולהפחית את עלויות השאילתות. מידע נוסף זמין במאמר בנושא הבסיס לנתונים.
שכבת מוצרי נתונים
שכבת מוצרי הנתונים מכילה נכסי נתונים שמוכנים לשימוש ומיועדים לקבלת החלטות עסקיות. היא מיישמת לוגיקה עסקית, משנה את השם של שדות מערכת מורכבים למונחים עסקיים שקל להבין, מתרגמת קודי סטטוס, מבצעת התאמות של אזורי זמן ומטבעות, מצברת מדדים ומצטרפת לנתונים בכמה טבלאות גולמיות. הטבלאות והתצוגות שמתקבלות עוברות אופטימיזציה לצריכה ישירה על ידי מרכזי בקרה של BI, כלי דיווח, צינורות למידת מכונה ופלטפורמות AI כמו Gemini Enterprise Agent Platform וסוכני ניתוח שיחות של BigQuery. מידע נוסף זמין במאמר בנושא מוצרי נתונים.
הרחבת הפתרון
מערכת Cortex Framework משלבת בין גמישות מבוססת-הגדרות לבין אוטומציה בעזרת AI, כדי לפשט את האופן שבו מרחיבים את סביבת הנתונים. בין אם אתם משתמשים בעוזרי תכנות אוטונומיים מבוססי-AI כדי ליצור טבלאות בהתאמה אישית, או כותבים לוגיקה מותאמת אישית של קומפילציה למקורות נתונים חדשים, המסגרת מספקת את הכלים, הבידוד ושערי הבטיחות שנדרשים כדי להרחיב את מוצרי הנתונים שלכם בצורה מאובטחת.
מסגרת הרחבה
מסגרת ההרחבה מספקת שיטה מובנית להתאמה אישית של בסיס הנתונים וליצירת מוצרי נתונים חדשים. היכולות העיקריות:
- מרחבי שמות בהתאמה אישית: כדי להגן על ההתאמות האישיות מפני החלפה כשחבילות הליבה של המסגרת מתעדכנות, אפשר לבודד את השינויים בספרייה בהתאמה אישית (לדוגמה,
src/data_modules/custom_namespace/). - הגדרה כקוד: אפשר לרשום מקורות נתונים חדשים, יעדים ומודולים מותאמים אישית ישירות בקובץ ההגדרות הגלובלי
config/config.yaml. - כלים ליצירת קומפילציה בהתאמה אישית: אפשר להטמיע מחלקות של כלים ליצירת קומפילציה ב-Python (
builder.py) במודולים כדי להפוך לאוטומטי את יצירת ה-SQL הדינמי, את כללי הניקוי בהתאמה אישית או את ההמרות הספציפיות למקור במהלך שלב הקומפילציה.
מידע נוסף זמין במדריך ההרחבות.
כלי ליצירת מוצרי נתונים מבוססי-סוכנים
כדי לעזור למפתחים ולמנתחים עסקיים להרחיב את המסגרת, Cortex Framework מספק מיומנויות ארוזות. המיומנויות האלה עוזרות לעוזרי תכנות מבוססי-AI (כמו Antigravity בשילוב עם Gemini) לבצע את הפעולות הבאות:
- בדיקת סכימות פיזיות: אחזור מדויק של שמות, סוגים ותיאורים של עמודות ישירות מטבלאות משוכפלות של מילון הנתונים של SAP (DDIC) בלי הזיות.
- יצירת מודולים של תבניות: יצירה אוטומטית של מרחבי שמות, מניפסטים, הגדרות טבלה, מודלים של SQLX/JS והערות.
- אימות שינויים: מריצים כללי לינטינג, ביקורות על שמות ובדיקות קומפילציה כדי לשפר את איכות הקוד לפני הפריסה.
מידע נוסף זמין במאמר בנושא יכולות אג'נטיות.
השלבים הבאים
מוכנים ליצור ולפרוס? כדי להגדיר את הסביבה ולהתחיל להשתמש בה, כדאי לעיין במדריכים הבאים:
- מוצרי נתונים: עיון בקטלוג של מוצרי הנתונים הזמינים.
- בסיס הנתונים: הסבר על הטבלאות והשדות הבסיסיים.
- פריסת הדגמה: אפשר לפרוס תוכן של פתרון עם נתוני הדגמה תוך דקות כדי לראות במהירות את הפעולה של Cortex Framework.
- פריסה בסביבת ייצור: פועלים לפי ההוראות המפורטות כדי להגדיר ולפרוס את Cortex Framework לנתונים של הארגון.