במסמך הזה מפורטות תשובות לשאלות נפוצות בנושא Google Cloud Knowledge Catalog (לשעבר Dataplex Universal Catalog).
מידע נוסף על Knowledge Catalog זמין במאמר סקירה כללית על Knowledge Catalog.
מושגים כלליים
אפשר לקבל מידע מפורט על התכונות של Knowledge Catalog ועל הקשר שלו ל-Data Catalog בדף השאלות הנפוצות.
מה זה Knowledge Catalog?
Google Knowledge Catalog הוא פתרון חכם לניהול נכסי נתונים ו-AI ב- Google Cloud. הוא מספק מלאי מרכזי שבו אפשר לגלות, לנהל ולפקח על הנתונים במקורות נתונים כמו BigQuery, Cloud Storage, Pub/Sub ו-Spanner. Google Cloud
Knowledge Catalog משתמש ב-AI כדי לבצע אוטומציה של גילוי נתונים, העשרה של מטא-נתונים ושיפור איכות הנתונים. באמצעות קטלוג הנתונים המנוהל שלו, Knowledge Catalog מספק את הבסיס החיוני שסוכני AI צריכים כדי ליצור תוכן באיכות גבוהה.
מהו קטלוג נתונים?
Data Catalog היה השם המקורי של שירות המטא-נתונים של Google Cloud. עם הזמן הוא התפתח ל-Dataplex Universal Catalog, ועכשיו הוא עבר שינוי שם והתפתח ל-Knowledge Catalog.
המונח 'קטלוג נתונים' עדיין משמש לתיאור של סוג כזה של אינדקס נתונים, אבל בהקשר של Google Cloud, הוא מתייחס למוצר מדור קודם. כדאי להשתמש ב-Knowledge Catalog בכל הפרויקטים החדשים כדי ליהנות מתכונות מבוססות-AI ומניהול משופר.
האם יש הבדל בין Knowledge Catalog לבין Data Catalog?
כן, Knowledge Catalog היא פלטפורמה לניהול נתונים מבוססת-AI, שתחליף בסופו של דבר את Data Catalog הקיים. הם מבוססים על אותם מושגים, אבל ב-Knowledge Catalog יש כמה שיפורים:
הקשר מבוסס-AI: בניגוד לקטלוג הנתונים, קטלוג הידע משתמש ב-Gemini כדי לחלץ באופן אוטומטי הקשר עסקי, ליצור תיאורים בשפה טבעית ולספק 'שאילתות זהב' של SQL כדי להנחות סוכני AI.
תמיכה במטא-נתונים עשירים: Knowledge Catalog תומך בסוגים מורכבים יותר של מטא-נתונים, כמו מערכים, מפות ורשומות מקוננים.
גישה באמצעות סוכנים: סוכני AI יכולים לגלות ולהשתמש באופן אדפטיבי בכלים של Knowledge Catalog דרך שרת MCP מקומי או מרוחק.
גילוי נתונים: אפשר להגדיר ב-Knowledge Catalog הוספה אוטומטית של מטא-נתונים ממגוון רחב יותר של Google Cloud שירותים וממקורות נתונים חיצוניים.
משילות בהיקף נרחב: הפתרון מציע יכולות משופרות ליצירת פרופיל נתונים, לאיכות נתונים אוטומטית ולמשילות מרכזית.
למה משמש Knowledge Catalog?
Knowledge Catalog של Google פותר את בעיית הנתונים של 'הפעלה במצב התחלתי (cold start)' – הזמן שמבוזבז בניסיון למצוא נתונים, להבין אותם ולסמוך עליהם לפני שאפשר להשתמש בהם בפועל. השימושים העיקריים שלו כוללים:
גילוי נתונים מהיר יותר: במקום לנווט במאגרי מידע מורכבים של הארגון כדי לאתר נתונים, אפשר להשתמש בחיפוש בשפה טבעית (לדוגמה, "תראה לי את נתוני נטישת הלקוחות האחרונים") כדי למצוא נכסים במשאביGoogle Cloud באופן מיידי, וכך לשפר את הפרודוקטיביות של צרכני הנתונים.
הארקה של סוכני AI: הוא פועל בתור "מקור האמת" ל-AI גנרטיבי או ל-ADK. הקישור בין נתונים פיזיים להגדרות עסקיות מבטיח שסוכני AI (כמו אלה שמבוססים על Vertex AI) ישתמשו בנתונים באיכות גבוהה, וכך יפחיתו באופן משמעותי את ההזיות של ה-AI וישפרו את האמון בתובנות שמבוססות על AI.
שליטה אוטומטית בנתונים: המערכת סורקת את הנתונים באופן אוטומטי כדי לזהות מידע רגיש (כלומר, פרטים אישיים מזהים), עוקבת אחרי המקור של הנתונים (שיוך) ועוקבת אחרי הדיוק שלהם (איכות נתונים אוטומטית). היכולות האלה עוזרות לשפר את האמון בנתונים, את האבטחה ואת התאימות, עם פחות מאמץ ידני.
גילוי 'נתונים לא גלויים': הוא יכול לסרוק קבצים לא מובְנים (לדוגמה, קובצי PDF או תמונות ב-Cloud Storage), לחלץ את המידע שבהם ולאפשר חיפוש ושליחת שאילתות ב-BigQuery, וכך לעזור לכם להפיק תובנות מנתונים שלא הייתה לכם גישה אליהם בעבר.
כדי להתחיל לעבוד עם התרחישים האלה, אפשר לעיין במאמר בנושא תרחישים לדוגמה לשימוש ב-Knowledge Catalog.
אילו סוגים של מטא-נתונים מאוחסנים ב-Knowledge Catalog?
ב-Knowledge Catalog נשמרים שלושה סוגים של מטא-נתונים:
מטא-נתונים טכניים: סכימות, שמות טבלאות ומאפייני מערכת שנאספים באופן אוטומטי.
מטא-נתונים עסקיים: הקשר שהמשתמש מגדיר, כמו תיאורי עסקים, מונחים במילון מונחים ובעלות.
מטא-נתונים בזמן ריצה: מידע על שושלת נתונים, ציוני איכות נתונים ונתונים סטטיסטיים של פרופיל נתונים.
מיגרציה מקטלוג הנתונים
בדף השאלות הנפוצות אפשר לקבל מידע על לוחות הזמנים למעבר, פרטים על ההשפעה והנחיות להעברת תהליכי עבודה של מטא-נתונים מ-Data Catalog ל-Knowledge Catalog.
איך מעבירים נתונים מקטלוג הנתונים?
המעבר לקטלוג הידע נועד להיות חלק, בלי שיידרש העברה ידנית של נתונים. בהתאם לשימוש הנוכחי שלכם, התהליך כולל שני שלבים עיקריים:
שלב ההכנה: אם יש לכם מטא-נתונים מותאמים אישית (לדוגמה, תגים, תבניות תגים או רשומות מותאמות אישית), התוכן הזה מועבר באופן אוטומטי ל-Knowledge Catalog כתוכן לקריאה בלבד. במהלך השלב הזה, מבצעים משימות הגדרה כדי שהתוכן הקיים בקטלוג הנתונים יהיה זמין בו-זמנית בממשק החדש.
שלב ההעברה: אחרי ההכנה, מעבירים את המצב הפעיל של המטא-נתונים כדי שיהיה אפשר לקרוא ולכתוב אותם ב-Knowledge Catalog. צריך לתאם את השלב הזה עם עדכון של עומסי עבודה פרוגרמטיים (ממשקי API, ספריות לקוח או מודולים של Terraform) כך שיצביעו על נקודות הקצה החדשות של Knowledge Catalog.
אם אין לכם מטא-נתונים מותאמים אישית או אם אתם חדשים בפלטפורמה, תוכלו להשלים את המעבר על ידי הגדרת קטלוג הידע כחוויית ברירת המחדל של ממשק המשתמש ב Google Cloud מסוף.
מידע נוסף זמין במאמר מעבר מ-Data Catalog ל-Knowledge Catalog.
חיוב על תובנות מנתונים
בדף השאלות הנפוצות אפשר לקבל מידע מפורט על חיוב מבוסס-אסימונים, על מדידת השימוש ועל אמצעי בקרה אדמיניסטרטיביים לתכונת התובנות לגבי נתונים ב-Knowledge Catalog.
מתי אתחיל לשלם על השימוש בתובנות לגבי נתונים?
החיוב הפעיל על תובנות לגבי נתונים יתחיל ב-27 באוקטובר 2026.
איך מתבצע חיוב על השימוש בתובנות לגבי נתונים?
השימוש נמדד באסימוני נתונים. אסימוני נתונים מייצגים את היחידות הבסיסיות של טקסט ומטא-נתונים שעובדו על ידי מודל Gemini. האסימונים האלה מחולקים לשתי קטגוריות:
- טוקנים של קלט: ההקשר, ההוראות וההיסטוריה שנשלחים למודל.
- טוקנים של פלט: תיאורים, קשרים ושאילתות בשפה טבעית שנוצרו על ידי המודל.
מידע נוסף זמין במאמר בנושא תמחור של Data Cloud Agent.
האם חשבונות שירות מקבלים מכסת שימוש בחינם לתובנות לגבי נתונים?
לא. חשבונות שירות לא מקבלים מכסה חינמית לכל משתמש. עם זאת, השימוש שלהם נמדד באותו אופן כמו של משתמשים רגילים.
איך אפשר למנוע חיוב אוטומטי על תובנות לגבי נתונים?
כדי להימנע מחיובים, צריך לאמת את הסריקות המתמשכות ולהפסיק להפעיל סריקות חדשות. אדמינים יכולים גם להשבית את היכולת לקבל תובנות מהנתונים על ידי השבתת Dataplex API בפרויקט הרלוונטי.
איך אפשר לדעת כמה יחויב על תובנות לגבי נתונים?
Google Cloud מספק מדידה של אסימוני נתונים. המדד הזה מאפשר לאדמינים ולבעלי סוכנים לעקוב אחרי צריכת האסימונים שלהם. היכולת הזו של מדידת השימוש זמינה לפני תחילת החיוב הפעיל באוקטובר 2026.