במסמך הזה מפורטות תשובות לשאלות נפוצות בנושא Google Cloud Knowledge Catalog (לשעבר Dataplex Universal Catalog).
מידע נוסף על Knowledge Catalog זמין במאמר סקירה כללית על Knowledge Catalog.
מושגים כלליים
אפשר לקבל מידע מפורט על התכונות של Knowledge Catalog ועל הקשר שלו ל-Data Catalog בדף השאלות הנפוצות.
מה זה Knowledge Catalog?
Google Knowledge Catalog הוא פתרון חכם לניהול נכסי נתונים ו-AI ב- Google Cloud. הוא מספק מלאי מרכזי שבו אפשר לגלות, לנהל ולפקח על הנתונים ב Google Cloud מקורות נתונים כמו BigQuery, Cloud Storage, Pub/Sub ו-Spanner.
Knowledge Catalog משתמש ב-AI כדי לבצע אוטומציה של גילוי נתונים, העשרה של מטא-נתונים ושיפור איכות הנתונים. באמצעות קטלוג הנתונים המנוהל שלו, Knowledge Catalog מספק את הבסיס החיוני שסוכני AI צריכים כדי ליצור תוכן באיכות גבוהה.
מהו קטלוג נתונים?
Data Catalog היה השם המקורי של שירות המטא-נתונים של Google Cloud. עם הזמן הוא התפתח ל-Dataplex Universal Catalog, ועכשיו הוא קיבל שם חדש והתפתח ל-Knowledge Catalog.
המונח 'קטלוג נתונים' עדיין משמש לתיאור של סוג כזה של אינדקס נתונים, אבל בהקשר של Google Cloud, הוא מתייחס למוצר מדור קודם. כדאי להשתמש ב-Knowledge Catalog בכל הפרויקטים החדשים כדי ליהנות מתכונות מבוססות-AI ומניהול משופר.
האם יש הבדל בין Knowledge Catalog לבין Data Catalog?
כן, Knowledge Catalog היא פלטפורמה לניהול נתונים מבוססת-AI, שתחליף בסופו של דבר את Data Catalog הקיים. הם מבוססים על אותם מושגים, אבל Knowledge Catalog מציע כמה שיפורים:
הקשר מבוסס-AI: בניגוד ל-Data Catalog, Knowledge Catalog משתמש ב-Gemini כדי לחלץ באופן אוטומטי הקשר עסקי, ליצור תיאורים בשפה טבעית ולספק 'שאילתות מוזהבות' של SQL כדי להנחות סוכני AI.
תמיכה במטא-נתונים עשירים: Knowledge Catalog תומך בסוגים מורכבים יותר של מטא-נתונים, כמו מערכים, מפות ורשומות מקוננים.
גישה אג'נטית: סוכני AI יכולים לגלות ולהשתמש באופן אדפטיבי בכלים של Knowledge Catalog דרך שרת MCP מקומי או מרוחק.
גילוי נתונים: אפשר להגדיר ב-Knowledge Catalog הוספה אוטומטית של מטא-נתונים ממגוון רחב יותר של Google Cloud שירותים וממקורות נתונים חיצוניים.
משילות בהיקף נרחב: הפתרון מציע יכולות משופרות ליצירת פרופיל נתונים, לאיכות נתונים אוטומטית ולמשילות מרכזית.
למה משמש Knowledge Catalog?
Knowledge Catalog של Google פותר את הבעיה של "הפעלה במצב התחלתי (cold start) של נתונים" – הזמן שמבוזבז בניסיון למצוא נתונים, להבין אותם ולסמוך עליהם לפני שאפשר להשתמש בהם בפועל. אלה חלק מהשימושים העיקריים שלו:
גילוי נתונים מהיר יותר: במקום לנווט במאגרי מידע מורכבים כדי לאתר נתונים, אפשר להשתמש בחיפוש בשפה טבעית (לדוגמה, "תראה לי את נתוני נטישת הלקוחות האחרונים") כדי למצוא נכסים במקורות מידע שלGoogle Cloud באופן מיידי, וכך לשפר את הפרודוקטיביות של צרכני הנתונים.
הארקה של סוכני AI: הוא משמש כ "מקור האמת" ל-AI גנרטיבי או ל-ADK. הקישור בין נתונים פיזיים להגדרות עסקיות מבטיח שסוכני AI (כמו אלה שמבוססים על Vertex AI) ישתמשו בנתונים באיכות גבוהה, וכך יפחיתו באופן משמעותי את ההזיות של ה-AI וישפרו את האמון בתובנות שמבוססות על AI.
שליטה אוטומטית בנתונים: המערכת סורקת את הנתונים באופן אוטומטי כדי לזהות מידע רגיש (כלומר, פרטים אישיים מזהים), עוקבת אחרי המקור של הנתונים (שיוך) ועוקבת אחרי הדיוק שלהם (איכות נתונים אוטומטית). היכולות האלה עוזרות לשפר את האמון בנתונים, את האבטחה ואת התאימות, עם פחות מאמץ ידני.
גילוי 'נתונים לא גלויים': הוא יכול לסרוק קבצים לא מובְנים (לדוגמה, קובצי PDF או תמונות ב-Cloud Storage), לחלץ את המידע שבהם ולאפשר חיפוש ושליחת שאילתות ב-BigQuery, וכך לעזור לכם להפיק תובנות מנתונים שלא הייתה לכם גישה אליהם בעבר.
כדי להתחיל לעבוד עם התרחישים האלה, אפשר לעיין במאמר בנושא תרחישים לדוגמה לשימוש ב-Knowledge Catalog.
אילו סוגים של מטא-נתונים מאוחסנים ב-Knowledge Catalog?
ב-Knowledge Catalog נשמרים שלושה סוגים של מטא-נתונים:
מטא-נתונים טכניים: סכימות, שמות טבלאות ומאפייני מערכת שנאספים באופן אוטומטי.
מטא-נתונים עסקיים: הקשר שהמשתמש מגדיר, כמו תיאורי עסקים, מונחים במילון מונחים ובעלות.
מטא-נתונים בזמן ריצה: מידע על שושלת נתונים, ציוני איכות נתונים ונתונים סטטיסטיים של פרופיל נתונים.
מיגרציה מ-Data Catalog
בדף השאלות הנפוצות אפשר לקבל מידע מפורט על לוחות הזמנים למעבר, על ההשפעה של המעבר ועל הנחיות להעברת תהליכי עבודה של מטא-נתונים מ-Data Catalog ל-Knowledge Catalog.
איך מעבירים נתונים מקטלוג הנתונים?
המעבר לקטלוג הידע מתוכנן להיות חלק, ולא נדרשת העברה ידנית של נתונים. בהתאם לשימוש הנוכחי שלכם, התהליך כולל שני שלבים עיקריים:
שלב ההכנה: אם יש לכם מטא-נתונים מותאמים אישית (לדוגמה, תגים, תבניות תגים או רשומות מותאמות אישית), התוכן הזה מועבר באופן אוטומטי ל-Knowledge Catalog כתוכן לקריאה בלבד. במהלך השלב הזה, מבצעים משימות הגדרה כדי שהתוכן הקיים בקטלוג הנתונים יהיה זמין בו-זמנית בממשק החדש.
שלב ההעברה: אחרי ההכנה, מעבירים את המצב הפעיל של המטא-נתונים כדי שיהיה אפשר לקרוא ולכתוב אותם ב-Knowledge Catalog. צריך לתאם את השלב הזה עם עדכון של עומסי עבודה פרוגרמטיים (ממשקי API, ספריות לקוח או מודולים של Terraform) כך שיצביעו על נקודות הקצה החדשות של Knowledge Catalog.
אם אין לכם מטא-נתונים מותאמים אישית או אם אתם חדשים בפלטפורמה, תוכלו להשלים את המעבר על ידי הגדרת קטלוג הידע כחוויית ברירת המחדל של ממשק המשתמש ב Google Cloud מסוף.
מידע נוסף זמין במאמר מעבר מ-Data Catalog ל-Knowledge Catalog.
חיוב על תובנות מנתונים
בדף השאלות הנפוצות אפשר לקבל מידע מפורט על חיוב מבוסס-טוקן, על מדידת השימוש ועל אמצעי בקרה אדמיניסטרטיביים לתכונת התובנות לגבי נתונים ב-Knowledge Catalog.
מתי אתחיל לשלם על השימוש בתובנות לגבי נתונים?
החיוב הפעיל על תובנות לגבי נתונים יתחיל ב-27 באוקטובר 2026.
איך מתבצע חיוב על השימוש בתובנות לגבי נתונים?
השימוש נמדד באסימוני נתונים. אסימוני נתונים מייצגים את היחידות הבסיסיות של טקסט ומטא-נתונים שעוברים עיבוד על ידי מודל Gemini. האסימונים האלה מחולקים לשתי קטגוריות:
- טוקנים של קלט: ההקשר, ההוראות וההיסטוריה שנשלחים למודל.
- טוקנים של פלט: תיאורים, קשרים ושאילתות בשפה טבעית שנוצרו על ידי המודל.
מידע נוסף זמין במאמר בנושא תמחור של Data Cloud Agent.
האם חשבונות שירות מקבלים מכסת שימוש בחינם לתובנות לגבי נתונים?
לא. חשבונות שירות לא מקבלים מכסה חינמית לכל משתמש. עם זאת, השימוש שלהם נמדד באותו אופן כמו של משתמשים רגילים.
איך אפשר למנוע חיוב אוטומטי על תובנות לגבי נתונים?
כדי להימנע מחיובים, צריך לאמת את הסריקות המתמשכות ולהפסיק להפעיל סריקות חדשות. אדמינים יכולים גם להשבית את היכולת לקבל תובנות מהנתונים על ידי השבתת Dataplex API בפרויקט הרלוונטי.
איך אפשר לדעת כמה יחויב על תובנות לגבי נתונים?
Google Cloud מספק מדידה של אסימוני נתונים. המדד הזה מאפשר לאדמינים ולבעלי הסוכנים לעקוב אחרי צריכת האסימונים שלהם. היכולת הזו של מדידת השימוש זמינה לפני תחילת החיוב הפעיל באוקטובר 2026.