במאמר הזה מוסבר איך להשתמש בגילוי אוטומטי של Knowledge Catalog, תכונה ב-Knowledge Catalog שמאפשרת לסרוק נתונים בקטגוריות של Cloud Storage כדי לחלץ מטא-נתונים ואז לקטלג אותם. במסגרת סריקת הגילוי, גילוי אוטומטי יוצר טבלאות BigLake או טבלאות חיצוניות לנתונים מובְנים וטבלאות אובייקטים לנתונים לא מובְנים. טבלאות BigLake וטבלאות חיצוניות מאפשרות לשלוח שאילתות לנתונים מובְנים במאגרי נתונים חיצוניים (ראו מבוא לטבלאות BigLake ומבוא לטבלאות חיצוניות), ואילו טבלאות אובייקטים מספקות אינדקס מטא-נתונים של נתונים לא מובְנים ב-Cloud Storage (ראו מבוא לטבלאות אובייקטים). הנתונים המרוכזים בטבלה מאפשרים לקבל תובנות מבוססות-AI, לשמור על אבטחת הנתונים ולנהל אותם.
כדי להשתמש בגילוי אוטומטי של נתונים ב-Cloud Storage, יוצרים ומריצים סריקת גילוי.
גילוי אוטומטי נקרא גם גילוי עצמאי.
סקירה כללית של סריקת Discovery
סריקת Discovery מבצעת את הפעולות הבאות:
- סורק את הנתונים בנתיב או בקטגוריה של Cloud Storage.
- קיבוץ של נתונים מובְנים ונתונים חצי-מובְנים בטבלאות.
- איסוף מטא-נתונים, כמו שם הטבלה, הסכימה והגדרת המחיצה.
- יוצר ומעדכן טבלאות חיצוניות של BigLake, חיצוניות שאינן של BigLake או אובייקטים של BigLake ב-BigQuery באמצעות הסכימה והגדרת החלוקה.
נתונים מובְנים ונתונים חצי מובְנים
נתונים מובְנים ונתונים חצי-מובְנים כוללים פורמטים כמו Avro, Parquet ו-CSV. סריקת הגילוי רושמת קבוצות של הקבצים האלה כטבלאות חיצוניות של BigLake. הסריקה מזהה קבצים רק אם הם נמצאים בתיקיות שמכילות את אותו פורמט נתונים וסכימה תואמת.
- תרחיש לדוגמה: ריכוז קבצים מובְנים עם הקלדה חזקה ב-BigQuery כדי להריץ שאילתות SQL אנליטיות בלי להגדיר סכימות באופן ידני.
- תהליך העבודה:
- ארגון הקבצים המובנים בתיקיות. חשוב לוודא שלכל הקבצים בכל תיקייה יש את אותו פורמט נתונים וסכימה תואמת.
- יוצרים סריקת גילוי ומספקים את Google Cloud מזהה החיבור למשאב.
- הסריקה מקבצת את הנתונים ורושמת אותם כטבלאות חיצוניות של BigLake.
- להריץ שאילתות בטבלאות שפורסמו ישירות ב-BigQuery באמצעות SQL.
פורמטים נתמכים
- Parquet
- Avro
- ORC
- JSON (רק הפורמט שמופרד בתו שורה חדשה)
- CSV (אבל לא קובצי CSV עם שורות הערות)
פורמטים של דחיסה
לגבי נתונים מובְנים ונתונים חצי-מובְנים, סריקת הגילוי תומכת בפורמטים הדחיסה הבאים:
דחיסה פנימית לפורמטים הבאים:
דחיסת נתונים דוגמה לסיומת קובץ פורמט נתמך gzip .gz.parquetParquet lz4 .lz4.parquetParquet Snappy .snappy.parquetParquet, ORC, Avro lzo .lzo.parquetParquet, ORC דחיסה חיצונית של קובצי JSON ו-CSV:
- gzip
- bzip2
נתונים לא מובנים
במקרה של נתונים לא מובְנים, כמו תמונות וסרטונים, סריקת הגילוי מזהה ומקליטה קבוצות של קבצים עם אותו פורמט של קובץ נתונים. הקבצים צריכים להיות בתיקיות שמכילות את אותו פורמט קובץ. לדוגמה, gs://images/group1 צריך להכיל רק תמונות GIF, ו-gs://images/group2 צריך להכיל רק תמונות JPEG, כדי שסריקת הגילוי תזהה ותירשום שתי טבלאות אובייקטים של BigLake.
- תרחיש לדוגמה: יצירת קטלוג של קבצים לא מובנים כמו תמונות או מסמכים כדי לבצע הסקה של למידת מכונה באמצעות BigQuery ML או פונקציות מרוחקות.
- תהליך העבודה:
- ארגון הקבצים הלא מובנים בתיקיות. מוודאים שלכל הקבצים בכל תיקייה יש את אותו פורמט.
- יצירת סריקת Discovery.
- הסריקה מקבצת את הנתונים הלא מובנים ורושמת אותם כטבלאות אובייקטים ב-BigLake.
- אפשר לבצע הסקה בקבצים לא מובְנים ישירות ב-BigQuery.
פורמטים נתמכים
הסריקה לגילוי תומכת בפורמטים הלא מובנים הבאים:
- תמונה (לדוגמה, JPEG, PNG ו-BMP)
- מסמכים (כמו קובצי PDF, מצגות ודוחות טקסט)
- אודיו או וידאו (כמו WAV, MP3 ו-MP4)
מידע נוסף זמין במאמר בנושא קבצים של אובייקטים נתמכים.
פורמטים של דחיסה
בטבלאות של אובייקטים, הדחיסה מנוהלת בעיקר באמצעות מטא-נתונים של אובייקטים ב-Cloud Storage, ולא באמצעות הגדרות פנימיות של BigQuery.
- דחיסה של מטא-נתונים סטנדרטיים: מערכת BigQuery מזהה באופן אוטומטי קבצים שנדחסו באמצעות gzip ו-bzip2 אם הם משתמשים בסיומות הסטנדרטיות .gz או .bz2.
- Content-Encoding: אפשר להשתמש במטא-נתונים Content-Encoding gzip ב-Cloud Storage כדי להציג קבצים דחוסים תוך שמירה על סוג התוכן המקורי שלהם.
- דחיסה פנימית של מדיה: יש תמיכה מקורית בפורמטים שדחוסים באופן מובנה (כמו JPEG לתמונות, MP3 לאודיו ו-MP4 לווידאו).
רישום טבלאות וזמינות
הטבלאות שמתגלות נרשמות ב-BigQuery כאחד מסוגי הטבלאות הבאים, בהתאם לפורמט הנתונים ולהגדרת הסריקה:
- טבלאות אובייקטים ב-BigLake. נוצר לנתונים לא מובנים, כמו תמונות וסרטונים.
- טבלאות חיצוניות של BigLake. נוצר לנתונים מובנים ולנתונים חצי-מובנים כשמספקים מזהה של חיבור למשאב Google Cloud במהלך הגדרת הסריקה.
- טבלאות חיצוניות (לא BigLake): נוצרות לנתונים מובְנים ולנתונים חצי מובְנים אם לא מציינים מזהה של חיבור למשאב.
ההרשמה הזו מאפשרת לנתח את הנתונים שלהם ב-BigQuery. מופעל גם מטמון של מטא-נתונים לטבלאות BigLake ולטבלאות אובייקטים. כל הטבלאות ב-BigLake מוזנות אוטומטית ל-Knowledge Catalog לצורך חיפוש וגילוי.
כדי להתחיל לעבוד עם הטבלאות החדשות שרשמתם, אתם יכולים:
- מריצים שאילתה ב-BigQuery.
- חיפוש משאבים ב-Knowledge Catalog.
מגבלות ומכסות
סריקת גילוי לא תומכת בפורמטים של טבלאות Apache Iceberg ו-Delta Lake.
כדי לראות את המגבלה של מספר הטבלאות שסריקת גילוי תומכת בהן, אפשר לעיין במאמר בנושא מכסות ומגבלות.
לפני שמתחילים
מפעילים את Dataplex API.
תפקידים שנדרשים להפעלת ממשקי API
כדי להפעיל ממשקי API, נדרשת ההרשאה serviceusage.services.enable. אם יצרתם את הפרויקט, סביר להניח שכבר יש לכם את ההרשאה הזו דרך התפקיד 'בעלים' (roles/owner). אחרת, תוכלו לקבל את ההרשאה הזו דרך התפקיד 'אדמין בממשק 'שימוש בשירות'' (roles/serviceusage.serviceUsageAdmin). איך מקצים תפקידים
תפקידים נדרשים לחשבון השירות של Knowledge Catalog
לפני שמתחילים, צריך להקצות את הרשאות ה-IAM לחשבון השירות של Knowledge Catalog בפרויקט.
service-PROJECT_NUMBER@gcp-sa-dataplex.iam.gserviceaccount.com
מחליפים את PROJECT_NUMBER בפרויקט שבו מופעל Dataplex API.
כדי לוודא שלחשבון השירות של Knowledge Catalog יש את ההרשאות שנדרשות ליצירה ולהרצה של סריקת גילוי, צריך לבקש מהאדמין להקצות לחשבון השירות של Knowledge Catalog את תפקידי ה-IAM הבאים:
- סוכן של חשבון שירות ב-Dataplex Discovery Service (
roles/dataplex.discoveryServiceAgent) במאגר האחסון - Dataplex Discovery Publishing Service Agent (
roles/dataplex.discoveryPublishingServiceAgent) בפרויקט של המשתמש -
יצירת טבלאות BigLake:
Dataplex Discovery BigLake Publishing Service Agent (
roles/dataplex.discoveryBigLakePublishingServiceAgent) בחיבור BigQuery
להסבר על מתן תפקידים, ראו איך מנהלים את הגישה ברמת הפרויקט, התיקייה והארגון.
התפקידים המוגדרים מראש האלה כוללים את ההרשאות שנדרשות ליצירה ולהרצה של סריקת גילוי. כדי לראות בדיוק אילו הרשאות נדרשות, אפשר להרחיב את הקטע ההרשאות הנדרשות:
ההרשאות הנדרשות
כדי ליצור ולהריץ סריקת גילוי, נדרשות ההרשאות הבאות:
-
bigquery.datasets.createבפרויקט של מקור הנתונים -
storage.buckets.getבקטגוריית מקור הנתונים -
storage.objects.getבקטגוריית מקור הנתונים -
storage.objects.listבקטגוריית מקור הנתונים -
bigquery.datasets.getבפרויקט של מקור הנתונים -
הוספת חיבור:
-
bigquery.connections.delegateבחיבור ל-BigQuery -
bigquery.connections.useבחיבור ל-BigQuery
-
יכול להיות שהאדמין יוכל גם להעניק לחשבון השירות של Knowledge Catalog את ההרשאות האלה באמצעות תפקידים בהתאמה אישית או תפקידים מוגדרים מראש אחרים.
תפקידים שנדרשים לחשבון השירות של חיבור BigQuery
כדי לוודא שלחשבון השירות של BigQuery Connection יש את ההרשאות הנדרשות ליצירת סריקת גילוי, צריך לבקש מהאדמין לתת לחשבון השירות של BigQuery Connection את תפקיד ה-IAM Dataplex Discovery Service Agent (roles/dataplex.discoveryServiceAgent) בדליקט Cloud Storage.
זהו תפקיד שמוגדר מראש וכולל את ההרשאות שנדרשות ליצירת סריקת גילוי. כדי לראות בדיוק אילו הרשאות נדרשות, אפשר להרחיב את הקטע ההרשאות הנדרשות:
ההרשאות הנדרשות
כדי ליצור סריקת Discovery, נדרשות ההרשאות הבאות:
-
bigquery.datasets.createבפרויקט של מקור הנתונים -
storage.buckets.getבקטגוריית מקור הנתונים -
storage.objects.getבקטגוריית מקור הנתונים -
storage.objects.listבקטגוריית מקור הנתונים -
bigquery.datasets.getבפרויקט של מקור הנתונים -
הוספת חיבור:
-
bigquery.connections.delegateבחיבור ל-BigQuery -
bigquery.connections.useבחיבור ל-BigQuery
-
יכול להיות שהאדמין יוכל גם להעניק לחשבון השירות של BigQuery Connection את ההרשאות האלה באמצעות תפקידים בהתאמה אישית או תפקידים מוגדרים מראש אחרים.
התפקידים הנדרשים למשתמשי קצה
כדי לקבל את ההרשאות שדרושות ליצירה ולניהול של סריקות לגילוי נתונים, צריך לבקש מהאדמין להקצות לכם את תפקידי ה-IAM הבאים בקטגוריית Cloud Storage:
-
גישה מלאה למשאבי DataScan:
אדמין DataScan של Dataplex (
roles/dataplex.dataScanAdmin) – הפרויקט שלכם -
גישת כתיבה למשאבי DataScan:
Dataplex DataScan Editor (
roles/dataplex.dataScanEditor) – הפרויקט שלכם -
הרשאת קריאה למשאבי DataScan, לא כולל התוצאות:
Dataplex DataScan Viewer (
roles/dataplex.dataScanViewer) – הפרויקט שלכם -
הרשאת קריאה למשאבי DataScan, כולל התוצאות:
Dataplex DataScan DataViewer (
roles/dataplex.dataScanDataViewer) – הפרויקט שלכם
להסבר על מתן תפקידים, ראו איך מנהלים את הגישה ברמת הפרויקט, התיקייה והארגון.
התפקידים המוגדרים מראש האלה מכילים את ההרשאות שנדרשות ליצירה ולניהול של סריקות לגילוי נתונים. כדי לראות בדיוק אילו הרשאות נדרשות, אפשר להרחיב את הקטע ההרשאות הנדרשות:
ההרשאות הנדרשות
כדי ליצור ולנהל סריקות של גילוי נתונים, נדרשות ההרשאות הבאות:
-
יוצרים DataScan:
dataplex.datascans.createבפרויקט -
מחיקת DataScan:
dataplex.datascans.deleteבפרויקט או במשאב DataScan -
הצגת פרטים של DataScan ללא תוצאות:
dataplex.datascans.getבמקרן שלכם משאב DataScan -
הצגת פרטים של DataScan, כולל התוצאות:
dataplex.datascans.getDataבפרויקט או במשאב DataScan -
מציגים ברשימה את סריקות הנתונים:
dataplex.datascans.listבפרויקט או במשאב DataScan -
מריצים DataScan:
dataplex.datascans.runבפרויקט או במשאב DataScan -
עדכון התיאור של DataScan:
dataplex.datascans.updateבמקרן שלכם, מקור DataScan -
צפייה בהרשאות IAM של DataScan:
dataplex.datascans.getIamPolicyבפרויקט או במשאב DataScan -
הגדרת הרשאות IAM ב-DataScan:
dataplex.datascans.setIamPolicyבפרויקט או במשאב DataScan
יכול להיות שתקבלו את ההרשאות האלה באמצעות תפקידים בהתאמה אישית או תפקידים מוגדרים מראש אחרים.
יצירת סריקה של Discovery
כדי לגלות נתונים, צריך ליצור ולהריץ סריקת גילוי. אתם יכולים להגדיר לוח זמנים לסריקה או להפעיל את הסריקה לפי דרישה.
כשסריקת הגילוי מופעלת, היא יוצרת מערך נתונים חדש ב-BigQuery שתואם למאגר Cloud Storage שנסרק. השם של מערך הנתונים ב-BigQuery זהה לשם של קטגוריה של Cloud Storage. תווים לא חוקיים בשם של הקטגוריה מוחלפים בקו תחתון. אם שם מערך הנתונים לא זמין, הסיומת מורחבת (לדוגמה, _discovered_001). מערך הנתונים מכיל את הטבלאות החיצוניות של BigLake או טבלאות חיצוניות אחרות שנוצרו על ידי סריקת הגילוי לצורך ניתוח נוסף.
המסוף
במסוף Google Cloud , עוברים לדף Cloud Storage discovery.
לוחצים על יצירה.
מזינים שם לסריקה.
בשדה ID, מזינים מזהה ייחודי בהתאם למוסכמות למתן שמות למשאבים ב- Google Cloud. אם לא מספקים מזהה, הסריקה לאיתור יוצרת את מזהה הסריקה.
אופציונלי: מוסיפים תיאור לסריקה.
כדי לציין את הקטגוריה של Cloud Storage שמכילה את הקבצים לסריקה, בשדה Bucket (קטגוריה), עוברים לקטגוריה ובוחרים אותה.
אופציונלי: מגדירים את הנתונים שרוצים לכלול או להחריג מסריקת הגילוי על ידי ציון רשימה של תבניות glob לסינון קבצים.
- Include: אם רוצים לסרוק רק קבוצת משנה של הנתונים, צריך לספק רשימה של תבניות glob שתואמות לאובייקטים שרוצים לכלול.
- Exclude: מספקים רשימה של דפוסי glob שתואמים לאובייקטים שרוצים להחריג.
לדוגמה, אם רוצים להחריג את
gs://test_bucket/foo/..מסריקת הגילוי, מזינים את**/foo/**כנתיב להחרגה. מירכאות גורמות לשגיאות. חשוב להזין**/foo/**במקום"**/foo/**".אם מספקים גם דפוסי הכללה וגם דפוסי החרגה, דפוסי ההחרגה מוחלים קודם.
בקטע אפשרויות לנתונים לא מובְנים, בוחרים באפשרות הפעלת הסקה סמנטית.
האפשרות הזו נדרשת אם רוצים להציג תובנות לגבי נתונים לא מובְנים ב-Knowledge Catalog. מידע נוסף על תובנות מנתונים לא מובְנים
אופציונלי: במזהה הפרויקט, בוחרים את פרויקט מערך הנתונים ב-BigQuery שמכיל את הטבלאות החיצוניות של BigLake או את הטבלאות החיצוניות שאינן של BigLake שנוצרו על ידי סריקת הגילוי. אם לא מציינים פרויקט, קבוצת הנתונים נוצרת בפרויקט שמכיל את קטגוריה של Cloud Storage.
בקטע Location type, בוחרים באפשרות Region או Multi-region (האפשרות שזמינה) שבה ייצור מערך הנתונים לפרסום ב-BigQuery.
כדי ליצור טבלאות BigLake מהנתונים שנסרקו, בשדה Connection ID (מזהה החיבור), מציינים את מזהה החיבור של משאב Google Cloud . מידע נוסף זמין במאמר בנושא Google Cloud קישורי משאבים ב-BigQuery.
אתם יכולים ליצור מזהה חיבור חדש באותו מיקום של מערך הנתונים ב-BigQuery, שהוא תואם למיקום של קטגוריית Cloud Storage.
אם לא מציינים מזהה של חיבור למשאב, הסריקה לגילוי יוצרת טבלאות חיצוניות שאינן BigLake. כדי להבין את ההבדלים בין סוגי הטבלאות החיצוניות האלה ולמה שירות הגילוי עשוי לבחור באחת מהן ולא באחרת, אפשר לעיין בהשוואה של ההבדלים בהתנהגות.
בקטע תדירות הסריקה, מגדירים מתי רוצים שהסריקה תפעל:
חזרה: הסריקה מופעלת לפי לוח זמנים מוגדר מראש. מציינים את שעת ההתחלה, הימים שבהם הסריקה תפעל והתדירות, למשל כל שעה.
על פי דרישה: הסריקה מופעלת על פי דרישה.
אופציונלי: בקטע JSON or CSV specifications (מפרטים של JSON או CSV), מציינים איך הסריקה צריכה לעבד קובצי JSON ו-CSV. לוחצים על מפרטים של JSON או CSV.
- כדי להגדיר אפשרויות JSON, בוחרים באפשרות Enable JSON parsing options (הפעלת אפשרויות לניתוח JSON).
- השבתת הסקת סוגים: האם סריקת הגילוי צריכה להסיק סוגי נתונים כשסורקים נתונים. אם משביתים את ההסקה של סוגי נתונים עבור נתוני JSON, כל העמודות נרשמות כסוגי הנתונים הפרימיטיביים שלהן, כמו מחרוזת, מספר או ערך בוליאני.
- פורמט הקידוד: קידוד התווים של הנתונים, כמו UTF-8, US-ASCII או ISO-8859-1. אם לא מציינים ערך, המערכת משתמשת ב-UTF-8 כברירת מחדל.
- כדי להגדיר אפשרויות של קובץ CSV, בוחרים באפשרות הפעלת אפשרויות לניתוח קובץ CSV.
- השבתת הסקת סוגים: האם סריקת הגילוי צריכה להסיק סוגי נתונים כשסורקים נתונים. אם משביתים את ההסקה של סוג הנתונים עבור נתוני CSV, כל העמודות נרשמות כמחרוזות.
- שורות כותרת: מספר שורות הכותרת,
0או1. אם מציינים את הערך0, סריקת הגילוי מסיקה כותרות ומחלצת את שמות העמודות מהקובץ. ערך ברירת המחדל הוא0. - תו מפריד עמודות: התו שמשמש להפרדת הערכים. צריך לספק תו יחיד,
\r(החזרת כרכרה) או\n(שורה חדשה). ברירת המחדל היא פסיק (,). - פורמט הקידוד: קידוד התווים של הנתונים, כמו
UTF-8,US-ASCIIאוISO-8859-1. אם לא מציינים ערך, המערכת משתמשת ב-UTF-8 כברירת מחדל.
- כדי להגדיר אפשרויות JSON, בוחרים באפשרות Enable JSON parsing options (הפעלת אפשרויות לניתוח JSON).
לוחצים על יצירה (לסריקה מתוזמנת), על הפעלה מיידית (לסריקה לפי דרישה) או על יצירה והפעלה (לסריקה חד-פעמית).
- סריקה מתוזמנת: מופעלת לפי לוח הזמנים שהגדרתם.
- סריקה לפי דרישה: מופעלת פעם אחת בהתחלה כשיוצרים אותה, ואפשר להפעיל את הסריקה בכל שלב. יכול להיות שיעברו כמה דקות עד שהסריקה תפעל.
- סריקה חד-פעמית: מתבצעת באופן אוטומטי. הוא נמחק אוטומטית כשהוא מגיע לסף אורך החיים (TTL) שהוגדר לו, שהוא ערך שקובע את משך הזמן שסריקת גילוי נשארת פעילה אחרי ההפעלה. ערך ה-TTL יכול לנוע בין 0 שניות (מחיקה מיידית) לבין 365 ימים. סריקת גילוי ללא TTL מוגדר נמחקת אוטומטית אחרי 24 שעות.
gcloud
כדי ליצור סריקת גילוי, משתמשים בפקודה gcloud dataplex datascans create data-discovery.
gcloud dataplex datascans create data-discovery --location=LOCATION \ --data-source-resource=BUCKET_PATH
מחליפים את מה שכתוב בשדות הבאים:
-
LOCATION: המיקום שבו רוצים ליצור את הסריקה לגילוי -
BUCKET_PATH: הנתיב ב-Cloud Storage של הקטגוריה שרוצים לסרוק
REST
כדי ליצור סריקת גילוי, משתמשים ב-dataScans.create method.
שליחת שאילתות לטבלאות BigLake שפורסמו
אחרי שמריצים את סריקת הגילוי, טבלאות BigLake מתפרסמות במערך נתונים חדש ב-BigQuery. אחרי הייצוא, הטבלאות זמינות לניתוח ב-BigQuery באמצעות SQL.
אתם יכולים להציג טבלאות ב-BigQuery או לשלוח שאילתות לגביהן. מידע נוסף על הרצת שאילתות ב-BigQuery זמין במאמר הרצת שאילתה.
ניהול טבלאות BigLake שפורסמו
טבלאות BigLake שמתפרסמות נוצרות ומנוהלות ב-BigQuery על ידי סריקת הגילוי. כברירת מחדל, סריקת הגילוי מטפלת בגילוי נתונים חדשים, בהסקת מסקנות לגבי סכימות ובשינויים בסכימות בכל פעם שהסריקות המתוזמנות או הסריקות לפי דרישה מופעלות. כדי לציין שהמטא-נתונים מנוהלים על ידי הסריקה, הסריקה מפרסמת טבלאות עם התווית metadata-managed-mode שהערך שלה מוגדר ל-discovery-managed.
אם רוצים לנהל את הסכימה ומטא-נתונים אחרים כמו אפשרויות CSV או JSON באופן עצמאי, צריך להגדיר את התווית metadata-managed-mode לערך user_managed. כך הסכימה לא משתנה כשמריצים את הסריקה הבאה של גילוי המקורות. הגישה הזו יכולה להיות שימושית בתרחישים שבהם הסכימה שמוסקת על ידי סריקת הגילוי שגויה או שונה מהסכימה הצפויה לטבלה מסוימת. כשהתווית metadata-managed-mode מוגדרת לערך user_managed, היא יכולה להפחית את העלות.
כדי לעדכן את התווית, אפשר לערוך את הערך של מפתח התווית
metadata-managed-mode ל-user_managed במקום ל-discovery-managed. במקרה הזה, סריקת הגילוי לא מעדכנת את הסכימה של הטבלה כל עוד התווית user_managed מצורפת לטבלה.
עדכון של טבלאות BigLake שפורסמו
בטבלאות BigLake שפורסמו באמצעות משימות סריקה לגילוי עם הגדרות ברירת המחדל, הסכימה ומטא-נתונים אחרים מתעדכנים אוטומטית בכל הפעלה של משימת סריקה לגילוי בתדירות המתוזמנת.
כדי לעדכן טבלת BigLake שפורסמה, פועלים לפי השלבים הבאים:
במסוף Google Cloud , עוברים לדף BigQuery.
בחלונית הימנית, לוחצים על כלי הניתוחים:

אם החלונית הימנית לא מוצגת, לוחצים על הרחבת החלונית הימנית כדי לפתוח אותה.
בחלונית Explorer, מרחיבים את הפרויקט, לוחצים על Datasets ובוחרים מערך נתונים.
לוחצים על סקירה כללית > טבלאות ובוחרים את הטבלה.
בכרטיסייה פרטים, בקטע תוויות, מוודאים שהתווית metadata-managed-mode מוגדרת לערך user_managed. אם הערך שמוגדר שונה, פועלים לפי השלבים הבאים:
לוחצים על עריכת הפרטים.
לצד המפתח metadata-managed-mode, בשדה value, מזינים
user_managed.
מחיקת טבלאות BigLake שפורסמו
כדי למחוק טבלת BigLake שפורסמה, פועלים לפי השלבים הבאים:
במסוף Google Cloud , עוברים לדף BigQuery.
בחלונית הימנית, לוחצים על כלי הניתוחים:

בחלונית Explorer, מרחיבים את הפרויקט, לוחצים על Datasets ובוחרים מערך נתונים.
לוחצים על סקירה כללית > טבלאות ובוחרים את הטבלה.
בחלונית פרטים, בקטע תוויות, מוודאים שהתווית metadata-managed-mode לא מוגדרת לערך
user_managed. אם הערך הואuser_managed, צריך לבצע את השלבים הבאים:לוחצים על עריכת הפרטים .
לצד המפתח metadata-managed-mode, בשדה value, מזינים
discovery-managed.
לוחצים על Run. סריקת הגילוי מופעלת לפי דרישה.
אחרי סיום הסריקה לגילוי, הטבלה ב-BigLake נמחקת ב-BigQuery ולא ניתן להציג אותה או לשלוח אליה שאילתות באמצעות Spark.
הפעלת סריקת גילוי לפי דרישה
כדי להפעיל סריקת גילוי לפי דרישה, בוחרים באחת מהאפשרויות הבאות:
המסוף
במסוף Google Cloud , עוברים לדף Cloud Storage discovery.
לוחצים על הסריקה לגילוי שרוצים להריץ.
לוחצים על הפעלה מיידית.
gcloud
כדי להריץ סריקת גילוי, משתמשים בפקודה gcloud dataplex datascans run:
gcloud dataplex datascans runDATASCAN\ --location=LOCATION
מחליפים את המשתנים הבאים:
-
LOCATION: Google Cloud האזור שבו נוצרה סריקת הגילוי. -
DATASCAN: השם של סריקת הגילוי.
REST
כדי להריץ סריקת גילוי על פי דרישה, משתמשים ב-method dataScans.run ב-Dataplex API.
הצגת רשימה של סריקות לגילוי
כדי להציג את הסריקות לגילוי, בוחרים באחת מהאפשרויות הבאות.
המסוף
במסוף Google Cloud , עוברים לדף Cloud Storage discovery.
מוצגת רשימה של סריקות הגילוי שנוצרו בפרויקט.
gcloud
gcloud dataplex datascans list --location=LOCATION --project=PROJECT_ID
מחליפים את מה שכתוב בשדות הבאים:
-
LOCATION: המיקום של הפרויקט -
PROJECT_ID: מזהה הפרויקט ב- Google Cloud
REST
כדי לאחזר את רשימת הסריקות של גילוי הנתונים בפרויקט, משתמשים בשיטה dataScans.list ב-Dataplex API.
הצגת סריקת גילוי
כדי לראות סריקה של גילוי, בוחרים באחת מהאפשרויות הבאות.
המסוף
במסוף Google Cloud , עוברים לדף Cloud Storage discovery.
לוחצים על סריקת הגילוי שרוצים לראות את הפרטים שלה.
- בקטע פרטי הסריקה מוצגים פרטים על סריקת הגילוי.
- בקטע סטטוס הסריקה מוצגות תוצאות הגילוי של משימת הסריקה האחרונה.
gcloud
gcloud dataplex datascans jobs describe JOB \ --location=LOCATION \ --datascan=DATASCAN \ --view=FULL
מחליפים את מה שכתוב בשדות הבאים:
-
JOB: מזהה המשימה של משימת הסריקה לגילוי. -
LOCATION: Google Cloud האזור שבו נוצרה סריקת הגילוי. -
DATASCAN: השם של סריקת הגילוי שאליה שייך הג'וב.
REST
כדי לראות את התוצאות של סריקת גילוי נתונים, משתמשים ב-method dataScans.get ב-Dataplex API.
צפייה בתוצאות היסטוריות של סריקת גילוי
כדי לראות את התוצאות של סריקות היסטוריות של גילוי, בוחרים באחת מהאפשרויות הבאות.
המסוף
במסוף Google Cloud , עוברים לדף Cloud Storage discovery.
לוחצים על סריקת הגילוי שרוצים לראות את הפרטים שלה.
לוחצים על החלונית היסטוריית הסריקות. בחלונית היסטוריית הסריקות מוצג מידע על משימות קודמות, כולל מספר הרשומות שנסרקו בכל משימה, הסטטוס של כל משימה והשעה שבה המשימות הופעלו.
כדי לראות מידע מפורט על משימה, לוחצים על המשימה בעמודה מזהה משימה.
gcloud
gcloud dataplex datascans jobs list \ --location=LOCATION \ --datascan=DATASCAN
מחליפים את מה שכתוב בשדות הבאים:
-
LOCATION: Google Cloud האזור שבו נוצרה סריקת הגילוי. -
DATASCAN: השם של סריקת הגילוי שאליה שייך הג'וב.
REST
כדי לראות את כל העבודות של סריקת גילוי, משתמשים ב-method dataScans.jobs.list ב-Dataplex API.
עדכון סריקת Discovery
כדי לשנות את התזמון של סריקת גילוי, למשל כדי לשנות את התזמון מסריקה לפי דרישה לסריקה חוזרת, צריך לעדכן את סריקת הגילוי.
המסוף
במסוף Google Cloud , עוברים לדף Cloud Storage discovery.
בסריקת הגילוי שרוצים לעדכן, לוחצים על פעולות > עריכה.
עורכים את הערכים.
לוחצים על Save.
gcloud
כדי לעדכן סריקת Discovery, משתמשים בפקודה gcloud dataplex datascans update data-discovery.
gcloud dataplex datascans update data-discovery SCAN_ID --location=LOCATION --description=DESCRIPTION
מחליפים את מה שכתוב בשדות הבאים:
-
SCAN_ID: המזהה של סריקת הגילוי שרוצים לעדכן -
LOCATION: האזור שבו נוצרה סריקת הגילוי Google Cloud -
DESCRIPTION: התיאור החדש של הסריקה לגילוי
REST
כדי לעדכן סריקת גילוי, משתמשים ב-method dataScans.patch ב-Dataplex API.
מחיקת סריקת גילוי
כדי למחוק סריקת גילוי, בוחרים באחת מהאפשרויות הבאות.
המסוף
במסוף Google Cloud , עוברים לדף Cloud Storage discovery.
בסריקת הגילוי שרוצים למחוק, לוחצים על פעולות > מחיקה.
לוחצים על Delete.
gcloud
gcloud dataplex datascans delete SCAN_ID --location=LOCATION --async
מחליפים את מה שכתוב בשדות הבאים:
-
SCAN_ID: המזהה של סריקת הגילוי שרוצים למחוק. -
LOCATION: Google Cloud האזור שבו נוצרה סריקת הגילוי.
REST
כדי למחוק סריקת גילוי, משתמשים ב-method dataScans.delete ב-Dataplex API.
המאמרים הבאים
- איך מחפשים משאבים ב-Knowledge Catalog
- מידע נוסף על תובנות מנתונים לא מובְנים
- איך משתמשים בסריקות לגילוי נתונים לא מובנים
- איך משתמשים בספריות לקוח של Knowledge Catalog