הערכת התוצאה והאיכות

הסבר על התוצאה

‫Enterprise Knowledge Graph כותב את התוצאות לטבלה חדשה ב-BigQuery לכל משימה. זוהי תמונת מצב של הנתונים בזמן ההרצה של העבודה. כברירת מחדל, כל משימה יוצרת cluster_id אקראי לכל אשכול ישויות. עם זאת, אם רוצים שהמזהה יישאר יציב בין הרצות שונות של משימות, צריך להשתמש בprevious BigQuery result tableאפשרות המתקדמת.

בדיקת טבלת התוצאות

סכימת הפלט

שם השדה סוג תיאור
cluster_id מחרוזת מזהה האשכול הזה הוא מזהה מכונה (MID) של Knowledge Graph פרטי, שמוקצה לאשכול הזה של רשומות. אפשר להשתמש בו כדי לזהות באופן ייחודי את הרשומה במערך הנתונים. אתם יכולים להשתמש בטבלה ב-BigQuery הקודמת באפשרויות המתקדמות כדי לשמור על יציבות ועקביות של cluster_id בכמה הפעלות.
source_name מחרוזת שם המקור שצוין בהגדרת הקלט, כדי לעזור לכם לצרף את מערך הנתונים.
source_key מחרוזת המפתח הייחודי בטבלת המקור, שיעזור לכם לאחד את מערך הנתונים.
מובהקות FLOAT ציון מהימנות שקובע עד כמה הרשומות האלה שייכות לאשכול הזה.
assignment_age מספר שלם משמש באופן פנימי לייצוב של cluster_id (MID) במשימות שונות.
cloud_kg_mid מחרוזת ה-MID של הישות המקושרת בגרף הידע של Google Cloud. אפשר להשתמש ב-MID הזה כמזהה קבוע או לחפש פרטים נוספים ב-Cloud Knowledge Graph API.

שימוש ב-SQL כדי לאחד את מערך הנתונים

הפלט של Enterprise Knowledge Graph כולל ישויות מקובצות לפי מזהה אשכול. הדרך הכי פשוטה לראות את התוצאה היא להשתמש במזהה האשכול כדי לבצע 'קיבוץ לפי' של התוצאה. בדוגמה הבאה מבוצעת בדיקה מהירה של תקינות הנתונים על ידי צירוף של טבלת הפלט לטבלה המקורית.

# get all entity clusters
SELECT distinct (cluster_id) FROM `ekg-test.<dataset>.clusters_9425187210682344597` order by cluster_id LIMIT 1000;
 
# join data with original table
SELECT confidence, RS., SRC. FROM `ekg-test.<dataset>.clusters_9425187210682344597` as RS join `ekg-api-test.demo.organization` as SRC
on RS.source_key = SRC.source_key where cluster_id = "r-02b72jsgrbws18";

אוסף הישויות הזה מייצג שני רשומות שונות ששייכות לאותו אוסף. אותו cluster_id מציין שצריך לאחד ולמזג את שתי הרשומות האלה.

שימוש ב-SQL כדי לאחד את התוצאות

מדידת ההצלחה

השוואה בין זוגות

  • דיוק: היחס בין ישויות נפרדות שזוהו בטעות כדומות (קל יותר לזהות בבדיקה ידנית).

  • החזרה: היחס בין ישויות דומות שלא זוהו כשליליות כוזבות או שקשה יותר לזהות אותן.

Cluster V-measure

  • מדד V של אשכול: (‎1 + beta) * homogeneity * completeness / (beta * homogeneity + completeness) where beta=1.

  • הומוגניות של אשכולות: היחס בין אשכולות שיש בהם ישויות ששייכות לאותה ישות.

  • מידת השלמות של האשכול: היחס בין מספר האשכולות שבהם כל הישויות ששייכות לאותה ישות ממוקמות באותו אשכול.