הכנת מקור הנתונים

כדי להתחיל להציג תכונות אונליין באמצעות Vertex AI Feature Store, צריך להגדיר את מקור נתוני התכונות ב-BigQuery באופן הבא:

  1. יוצרים טבלה ב-BigQuery או תצוגה מפורטת באמצעות נתוני התכונות. כדי לטעון נתוני תכונות לטבלה או לתצוגה ב-BigQuery, אפשר ליצור מערך נתונים ב-BigQuery באמצעות הנתונים, ליצור טבלה ב-BigQuery ואז לטעון את נתוני התכונות ממערך הנתונים לטבלה.

  2. אחרי שמעלים את נתוני התכונות לטבלה או לתצוגה ב-BigQuery, צריך להפוך את מקור הנתונים הזה לזמין ל-Vertex AI Feature Store לצורך הצגה אונליין. יש שתי דרכים לחבר את מקור הנתונים למשאבי הצגה אונליין, כמו חנויות אונליין ומופעים של תצוגת תכונות:

    • רישום מקור הנתונים על ידי יצירת קבוצות של תכונות ותכונות: אפשר לשייך קבוצות של תכונות ותכונות למופעים של תצוגת תכונות בחנות הווירטואלית. אפשר לעצב את הנתונים באחת מהדרכים הבאות:

      • כדי לעצב את הנתונים כסדרת זמנים, צריך לכלול עמודה של חותמת זמן של מאפיין. Vertex AI Feature Store מציג רק את הערכים האחרונים של המאפיינים לכל מזהה ייחודי של ישות, על סמך חותמת הזמן של המאפיין בעמודה הזו.

      • עיצוב הנתונים בלי לכלול עמודות של חותמות זמן של תכונות. ‫Vertex AI Feature Store מנהל את חותמות הזמן ומציג רק את ערכי התכונות האחרונים לכל מזהה ייחודי של ישות.

      מידע על יצירת קבוצות תכונות זמין במאמר יצירת קבוצת תכונות. כאן אפשר לקבל מידע על יצירת תכונות בקבוצת תכונות.

    • הצגת תכונות ישירות ממקור הנתונים בלי ליצור קבוצות תכונות ותכונות: אפשר לציין את ה-URI של מקור הנתונים בתצוגת התכונות. שימו לב שבתרחיש הזה, אי אפשר לעצב את הנתונים כסדרת זמן או לכלול נתונים היסטוריים במקור BigQuery. בכל שורה צריך להיות ערך ייחודי של מזהה, עם הערכים העדכניים של התכונות שמתאימים לו. אין תמיכה בכמה מופעים של אותו מזהה ישות בשורות שונות.

מאחר ש-Vertex AI Feature Store מאפשר לכם לשמור נתוני תכונות ב-BigQuery ולספק תכונות ממקור הנתונים של BigQuery, אין צורך לייבא או להעתיק את התכונות למאגר אופליין.

הנחיות להכנת מקורות נתונים

כדי להבין את הסכימה והאילוצים בזמן הכנת מקור הנתונים ב-BigQuery, חשוב לפעול בהתאם להנחיות הבאות:

  1. מקור הנתונים צריך לכלול את העמודות הבאות:

    • עמודות של מזהי ישויות: מקור הנתונים צריך לכלול לפחות עמודה אחת של מזהי ישויות עם ערכים של string או int. שם ברירת המחדל של העמודה הזו הוא entity_id. אפשר גם להשתמש בשם אחר לעמודה הזו. הגודל של כל ערך בעמודה הזו צריך להיות קטן מ-4KB.

      שימו לב שאפשר גם להגדיר רשומה של תכונה באמצעות יצירת מזהה הישות באמצעות תכונות מכמה עמודות. במקרה כזה, אפשר לכלול במקור הנתונים כמה עמודות של מזהי ישויות. השם של כל עמודה של מזהה ישות חייב להיות ייחודי. אם רושמים את מקור הנתונים על ידי יצירת קבוצות תכונות, צריך להגדיר את עמודות מזהה הישות לכל קבוצת תכונות. אחרת, אם אתם משייכים ישירות את מקור הנתונים לתצוגת תכונות, אתם צריכים להגדיר את תצוגות התכונות כדי לציין את העמודות של מזהה הישות.

      שימו לב, אפשר לכלול כמה עמודות של מזהים במקור נתונים. בתרחיש כזה, השם של כל עמודה של מזהה ישות חייב להיות ייחודי. אתם יכולים להגדיר את קבוצות התכונות או את תצוגות התכונות כדי ליצור את מזהה הישות באמצעות הערכים מכל עמודה של רשומה של תכונה.

    • עמודת חותמת זמן של מאפיין: אופציונלי. אם אתם רושמים את מקור הנתונים באמצעות קבוצות מאפיינים ומאפיינים, ואתם צריכים לעצב את הנתונים כסדרת זמן, אתם צריכים לכלול עמודת חותמת זמן של מאפיין. עמודת חותמת הזמן מכילה ערכים מהסוג timestamp. שם ברירת המחדל של עמודת חותמת הזמן הוא feature_timestamp. אם אתם רוצים להשתמש בשם עמודה אחר, אתם יכולים להשתמש בפרמטר time_series כדי להגדיר את עמודת חותמת הזמן לקבוצת המאפיינים.

      אם לא מציינים עמודת חותמות זמן כדי לעצב את הנתונים כסדרת זמנים, Feature Store של Vertex AI מנהל את חותמות הזמן של התכונות ומציג את הערכים העדכניים ביותר של התכונות.

      אם משייכים ישירות מקור נתונים של BigQuery לתצוגת תכונות, העמודה feature_timestamp לא נדרשת. בתרחיש הזה, אתם צריכים לכלול במקור הנתונים רק את הערכים האחרונים של המאפיינים, ו-Vertex AI Feature Store לא יחפש את חותמת הזמן.

    • הטמעה וסינון של עמודות: אופציונלי. אם אתם רוצים להשתמש בניהול הטמעה בחנות אונליין שנוצרה לצורך הצגת מודעות אונליין שעברה אופטימיזציה (הוצאה משימוש), מקור הנתונים צריך לכלול את העמודות הבאות:

      • עמודה embedding שמכילה מערכים מסוג float.

      • אופציונלי: עמודה אחת או יותר לסינון מסוג string או מערך string.

      • אופציונלי: עמודת מיקור המונים מסוג int.

  2. כל שורה במקור הנתונים היא רשומה מלאה של ערכי תכונות שמשויכים למזהה ישות. אם חסר ערך של מאפיין באחת מהעמודות, המערכת מתייחסת אליו כאל ערך null.

  3. כל עמודה בטבלה ב-BigQuery או בתצוגה של BigQuery מייצגת תכונה. צריך לספק את הערכים של כל תכונה בעמודה נפרדת. אם משייכים את מקור הנתונים לקבוצת תכונות ולתכונות, צריך לשייך כל עמודה לתכונה נפרדת.

  4. סוגי הנתונים הנתמכים לערכי מאפיינים כוללים bool,‏ int,‏ float,‏ string,‏ timestamp, מערכים של סוגי הנתונים האלה ובייטים. הערה: במהלך סנכרון הנתונים, ערכי תכונות מסוג timestamp מומרים ל-int64.

  5. מקור הנתונים צריך להיות ממוקם באותו אזור שבו נמצאת הדוגמה של החנות הווירטואלית, או באזור רב-אזורי שכולל את האזור של החנות הווירטואלית או חופף לו. לדוגמה, אם החנות הווירטואלית נמצאת ב-us-central, יכול להיות שמקור BigQuery נמצא ב-us-central או ב-US.

  6. מסנכרנים את הנתונים בתצוגת תכונות לפני הצגת מודעות אונליין כדי לוודא שיוצגו רק ערכי התכונות העדכניים ביותר. אם אתם משתמשים בסנכרון נתונים מתוזמן, יכול להיות שתצטרכו לסנכרן את הנתונים באופן ידני בתצוגת התכונות. עם זאת, אם אתם משתמשים בסנכרון נתונים רציף עם הצגת מודעות אונליין שעברה אופטימיזציה, לא תצטרכו לסנכרן את הנתונים באופן ידני.

המאמרים הבאים