יצירת פרופיל של איכות הנתונים ואימות שלהם
במדריך הזה נסביר איך להשתמש ב-Knowledge Catalog (לשעבר Dataplex Universal Catalog) כדי ליצור פרופיל של טבלה ב-BigQuery, להגדיר כללים לאיכות הנתונים על סמך תובנות מהפרופיל ולהריץ סריקה של איכות הנתונים.
מבצעים את השלבים הבאים:
- יוצרים מערך נתונים וטבלה ב-BigQuery עם נתונים לדוגמה של שיתוף אופניים, שכוללים אנומליות מכוונות כמו כפילויות וערכים ריקים, כדי לבדוק את יכולות הסריקה.
- יוצרים ומריצים סריקה של פרופיל נתונים בטבלה. במסגרת פרופיל הנתונים מחושבים נתונים סטטיסטיים ברמת העמודה, כמו אחוזים של ערכי null, ספירות של ערכים ייחודיים והתפלגויות של ערכים. מידע נוסף מופיע במאמר מידע על פרופיל נתונים.
- בודקים את תוצאות הסריקה של פרופיל הנתונים כדי למצוא דפוסים ואנומליות פוטנציאליות.
- מגדירים כללים לאיכות הנתונים על סמך הממצאים בפרופיל ומריצים סריקה של איכות הנתונים. בסריקות של איכות הנתונים, המערכת מאמתת את הנתונים בהתאם לכללים מוגדרים כדי לזהות אנומליות. מידע נוסף זמין במאמר בנושא איכות נתונים אוטומטית.
- בודקים את תוצאות ההערכה כדי לראות אילו כללי איכות עברו את הבדיקה ואילו לא.
לפני שמתחילים
מגדירים את הפרויקט:
- נכנסים לחשבון Google Cloud . אם אתם משתמשים חדשים ב- Google Cloud, צרו חשבון כדי שתוכלו להעריך את הביצועים של המוצרים שלנו בתרחישים מהעולם האמיתי. לקוחות חדשים מקבלים בחינם גם קרדיט בשווי 300$ להרצה, לבדיקה ולפריסה של עומסי העבודה.
-
In the Google Cloud console, on the project selector page, select or create a Google Cloud project.
Roles required to select or create a project
- Select a project: Selecting a project doesn't require a specific IAM role—you can select any project that you've been granted a role on.
-
Create a project: To create a project, you need the Project Creator role
(
roles/resourcemanager.projectCreator), which contains theresourcemanager.projects.createpermission. Learn how to grant roles.
-
If you're using an existing project for this guide, verify that you have the permissions required to complete this guide. If you created a new project, then you already have the required permissions.
-
Verify that billing is enabled for your Google Cloud project.
Enable the Knowledge Catalog and BigQuery APIs.
Roles required to enable APIs
To enable APIs, you need the
serviceusage.services.enablepermission. If you created the project, then you likely already have this permission through the Owner role (roles/owner). Otherwise, you can get this permission through the Service Usage Admin role (roles/serviceusage.serviceUsageAdmin). Learn how to grant roles.-
In the Google Cloud console, on the project selector page, select or create a Google Cloud project.
Roles required to select or create a project
- Select a project: Selecting a project doesn't require a specific IAM role—you can select any project that you've been granted a role on.
-
Create a project: To create a project, you need the Project Creator role
(
roles/resourcemanager.projectCreator), which contains theresourcemanager.projects.createpermission. Learn how to grant roles.
-
If you're using an existing project for this guide, verify that you have the permissions required to complete this guide. If you created a new project, then you already have the required permissions.
-
Verify that billing is enabled for your Google Cloud project.
Enable the Knowledge Catalog and BigQuery APIs.
Roles required to enable APIs
To enable APIs, you need the
serviceusage.services.enablepermission. If you created the project, then you likely already have this permission through the Owner role (roles/owner). Otherwise, you can get this permission through the Service Usage Admin role (roles/serviceusage.serviceUsageAdmin). Learn how to grant roles.
התפקידים הנדרשים
כדי לקבל את ההרשאות שדרושות ליצירה ולהרצה של סריקות פרופיל נתונים ואיכות נתונים, ולניהול משאבי BigQuery, צריך לבקש מהאדמין את התפקידים הבאים ב-IAM בפרויקט:
-
יצירה, הפעלה ומחיקה של סריקות נתונים:
עורך סריקות נתונים ב-Dataplex (
roles/dataplex.dataScanEditor) -
יצירה, מילוי ומחיקה של טבלאות לדוגמה:
BigQuery Data Owner (
roles/bigquery.dataOwner) -
הפעלת שאילתות SQL ב-BigQuery:
BigQuery Job User (
roles/bigquery.jobUser)
להסבר על מתן תפקידים, ראו איך מנהלים את הגישה ברמת הפרויקט, התיקייה והארגון.
יכול להיות שאפשר לקבל את ההרשאות הנדרשות גם באמצעות תפקידים בהתאמה אישית או תפקידים מוגדרים מראש.
אם יש לכם את ההרשאות הנדרשות לניהול גישת IAM בפרויקט, אתם יכולים להקצות את התפקידים האלה לחשבון המשתמש שלכם על ידי הפעלת הפקודות הבאות של gcloud:
gcloud projects add-iam-policy-binding PROJECT_ID \
--member="user:USER_EMAIL" \
--role="roles/dataplex.dataScanEditor"
gcloud projects add-iam-policy-binding PROJECT_ID \
--member="user:USER_EMAIL" \
--role="roles/bigquery.dataOwner"
gcloud projects add-iam-policy-binding PROJECT_ID \
--member="user:USER_EMAIL" \
--role="roles/bigquery.jobUser"
מחליפים את מה שכתוב בשדות הבאים:
-
PROJECT_ID: מזהה הפרויקט ב- Google Cloud . -
USER_EMAIL: כתובת האימייל בחשבון המשתמש (לדוגמה,name@example.com).
מתן הרשאות לסוכן השירות של Knowledge Catalog
סוכן שירות הוא חשבון שירות בניהול Google שמשמש את Knowledge Catalog להפעלת שאילתות סריקה ב-BigQuery בשמכם.
במסוף Google Cloud , לוחצים על Activate Cloud Shell בסרגל הכלים. יחלפו כמה רגעים עד שההקצאה והחיבור לסביבת העבודה יושלמו.
יצירת סוכן השירות של Knowledge Catalog:
gcloud beta services identity create --service=dataplex.googleapis.comהפקודה הזו יוצרת את סוכן השירות אם הוא עדיין לא הוקצה, ומציגה את כתובת האימייל שלו. אם בפרויקט כבר יש סוכן שירות של Knowledge Catalog, הפקודה מחזירה את הזהות הקיימת בלי לבצע שינויים.
הפלט אמור להיראות כך:
serviceAccount:service-PROJECT_NUMBER@gcp-sa-dataplex.iam.gserviceaccount.comשימו לב ל
PROJECT_NUMBERבפלט כדי לדעת מה השלבים הבאים.נותנים את התפקיד BigQuery Job User (
roles/bigquery.jobUser) כדי ש-Knowledge Catalog יוכל להריץ משימות של שאילתות בפרויקט:gcloud projects add-iam-policy-binding PROJECT_ID \ --member="serviceAccount:service-PROJECT_NUMBER@gcp-sa-dataplex.iam.gserviceaccount.com" \ --role="roles/bigquery.jobUser"
מחליפים את מה שכתוב בשדות הבאים:
-
PROJECT_ID: מזהה הפרויקט ב- Google Cloud . -
PROJECT_NUMBER: מספר הפרויקט ב- Google Cloud .
-
צריך להעניק את התפקיד BigQuery Data Viewer (
roles/bigquery.dataViewer) כדי שסוכן השירות יוכל לקרוא את נתוני הטבלה והסכימה:gcloud projects add-iam-policy-binding PROJECT_ID \ --member="serviceAccount:service-PROJECT_NUMBER@gcp-sa-dataplex.iam.gserviceaccount.com" \ --role="roles/bigquery.dataViewer"
מחליפים את מה שכתוב בשדות הבאים:
-
PROJECT_ID: מזהה הפרויקט ב- Google Cloud . -
PROJECT_NUMBER: מספר הפרויקט ב- Google Cloud .
-
יצירת טבלה ומערך נתונים לדוגמה
כדי לנסות את הפרופילים ואת הסריקות של איכות הנתונים בצורה בטוחה בלי לגעת בנתוני הייצור, מגדירים מערך נתונים ייעודי ב-BigQuery ויוצרים טבלה שמכילה נתונים לדוגמה ישירות בפרויקט.
המסוף
במסוף Google Cloud , עוברים לדף BigQuery.
בחלונית Explorer, לוחצים על View actions לצד מזהה הפרויקט ואז על Create dataset.
בשדה Dataset ID (מזהה מערך הנתונים), מזינים את הערך
quickstart_data_profile.ברשימה Data location, בוחרים באפשרות us-central1 (Iowa).
לוחצים על יצירת מערך נתונים.
בעורך השאילתות, מזינים את שאילתת ה-SQL הבאה כדי ליצור נתונים לדוגמה של שיתוף אופניים בטבלה
bikeshare_trips:CREATE OR REPLACE TABLE `PROJECT_ID.quickstart_data_profile.bikeshare_trips` AS SELECT -- Duplicate and null IDs IF(MOD(x, 100) = 0, NULL, IF(x > 9900, 1000 + (x - 9900), 1000 + x)) AS trip_id, -- Nulls and unrecognized category values CASE WHEN MOD(x, 50) = 0 THEN 'INVALID_TIER' WHEN MOD(x, 25) = 0 THEN NULL WHEN MOD(x, 4) = 0 THEN 'Local Rider' WHEN MOD(x, 4) = 1 THEN 'Walk Up' WHEN MOD(x, 4) = 2 THEN 'Student Membership' ELSE 'Weekender' END AS subscriber_type, -- Nulls and malformed bike IDs CASE WHEN MOD(x, 60) = 0 THEN 'UNKNOWN' WHEN MOD(x, 30) = 0 THEN NULL ELSE CAST(2000 + x AS STRING) END AS bike_id, -- Null dates and future timestamps CASE WHEN MOD(x, 70) = 0 THEN NULL WHEN MOD(x, 40) = 0 THEN TIMESTAMP_ADD(CURRENT_TIMESTAMP(), INTERVAL x MINUTE) ELSE TIMESTAMP_SUB(CURRENT_TIMESTAMP(), INTERVAL x MINUTE) END AS start_time, -- Nulls and placeholder station values CASE WHEN MOD(x, 20) = 0 THEN 'STATION_UNKNOWN' WHEN MOD(x, 10) = 0 THEN NULL ELSE CAST(100 + MOD(x, 50) AS STRING) END AS start_station_id, -- Negative durations, zeros, and extreme outliers CASE WHEN MOD(x, 15) = 0 THEN -10.0 WHEN MOD(x, 35) = 0 THEN 0.0 WHEN MOD(x, 200) = 0 THEN 99999.0 ELSE CAST(MOD(x, 120) + 1.5 AS FLOAT64) END AS duration_minutes FROM UNNEST(GENERATE_ARRAY(1, 10000)) AS x;
מחליפים את
PROJECT_IDבמזהה הפרויקט ב- Google Cloud .לוחצים על הפעלה.
gcloud
ב-Cloud Shell, יוצרים את מערך הנתונים
quickstart_data_profileבאזורus-central1:bq --location=us-central1 mk --dataset PROJECT_ID:quickstart_data_profile
מחליפים את
PROJECT_IDבמזהה הפרויקט ב-Google Cloud .יוצרים את טבלת הדוגמה
bikeshare_tripsומאכלסים אותה:bq query \ --use_legacy_sql=false \ "CREATE OR REPLACE TABLE \`PROJECT_ID.quickstart_data_profile.bikeshare_trips\` AS SELECT IF(MOD(x, 100) = 0, NULL, IF(x > 9900, 1000 + (x - 9900), 1000 + x)) AS trip_id, CASE WHEN MOD(x, 50) = 0 THEN 'INVALID_TIER' WHEN MOD(x, 25) = 0 THEN NULL WHEN MOD(x, 4) = 0 THEN 'Local Rider' WHEN MOD(x, 4) = 1 THEN 'Walk Up' WHEN MOD(x, 4) = 2 THEN 'Student Membership' ELSE 'Weekender' END AS subscriber_type, CASE WHEN MOD(x, 60) = 0 THEN 'UNKNOWN' WHEN MOD(x, 30) = 0 THEN NULL ELSE CAST(2000 + x AS STRING) END AS bike_id, CASE WHEN MOD(x, 70) = 0 THEN NULL WHEN MOD(x, 40) = 0 THEN TIMESTAMP_ADD(CURRENT_TIMESTAMP(), INTERVAL x MINUTE) ELSE TIMESTAMP_SUB(CURRENT_TIMESTAMP(), INTERVAL x MINUTE) END AS start_time, CASE WHEN MOD(x, 20) = 0 THEN 'STATION_UNKNOWN' WHEN MOD(x, 10) = 0 THEN NULL ELSE CAST(100 + MOD(x, 50) AS STRING) END AS start_station_id, CASE WHEN MOD(x, 15) = 0 THEN -10.0 WHEN MOD(x, 35) = 0 THEN 0.0 WHEN MOD(x, 200) = 0 THEN 99999.0 ELSE CAST(MOD(x, 120) + 1.5 AS FLOAT64) END AS duration_minutes FROM UNNEST(GENERATE_ARRAY(1, 10000)) AS x;"
יצירה והפעלה של סריקת פרופיל נתונים
בסריקה של פרופיל נתונים נבדקות השורות בטבלה כדי לחשב תובנות סטטיסטיות, כולל ספירת ערכים ייחודיים, יחסי null וטווחים של חלוקת נתונים.
המסוף
במסוף Google Cloud , עוברים לדף Data profiling & quality.
לוחצים על יצירת סריקה של פרופיל נתונים.
בקטע Choose type (בחירת סוג), משאירים את האפשרות Data profile scan (סריקת פרופיל נתונים) מסומנת.
בקטע כללי, בשדה שם לתצוגה, מזינים
bikeshare-trips-profile.בקטע Table to scan (טבלה לסריקה), בשדה Table (טבלה), לוחצים על Browse (עיון), בוחרים את הטבלה
quickstart_data_profile.bikeshare_tripsבפרויקט ואז לוחצים על Select (בחירה).בשדה Mode (מצב), בוחרים באפשרות Standard (רגיל).
בקטע היקף, בוחרים באפשרות כל הנתונים.
בקטע תזמון, בוחרים באפשרות על פי דרישה.
משאירים את שאר ההגדרות כברירת המחדל.
לוחצים על הפעלת הסריקה.
עבודת הסריקה מתחילה. בדרך כלל נדרשות 3 עד 5 דקות עד ש-Knowledge Catalog מריץ את הסריקה ומחשב את הנתונים הסטטיסטיים של הטבלה.
gcloud
ב-Cloud Shell, יוצרים את סריקת פרופיל הנתונים:
gcloud dataplex datascans create data-profile bikeshare-trips-profile \ --location=us-central1 \ --data-source-resource="//bigquery.googleapis.com/projects/PROJECT_ID/datasets/quickstart_data_profile/tables/bikeshare_trips" \ --description="Data profile scan for sample bikeshare dataset"
מחליפים את
PROJECT_IDבמזהה הפרויקט ב-Google Cloud .מריצים את סריקת פרופיל הנתונים:
gcloud dataplex datascans run bikeshare-trips-profile \ --location=us-central1
משימת הסריקה מתחילה ברקע. בדרך כלל הסריקה מסתיימת תוך 3 עד 5 דקות.
בדיקת התוצאות של סריקת פרופיל נתונים
אחרי שהסריקה מסתיימת, בודקים את הנתונים הסטטיסטיים של העמודות כדי להבין את המאפיינים של הנתונים.
במסוף Google Cloud , עוברים לדף Data profiling & quality.
ברשימת הסריקות, לוחצים על bikeshare-trips-profile.
אם הסריקה עוד לא הופעלה, לוחצים על הפעלה מיידית.
בקטע סקירה כללית, מחכים עד שיוצג הצלחה בסריקה האחרונה.
בתמונה הבאה מוצג סריקת העבודה בקטע סקירה כללית עם הסטטוס הושלם:
בודקים את תוצאות הסריקה כדי להבין את פיזור הנתונים בטבלה ולזהות יעדים פוטנציאליים לאימות איכות הנתונים. בכרטיסייה תוצאות העבודה האחרונה, Knowledge Catalog מציג מדדים ברמת העמודה, כולל אחוז הערכים הריקים, ספירה ואחוז של ערכים ייחודיים, הערכים המובילים וסיכום נתונים סטטיסטיים.
בטבלה הבאה מפורט איזה מדד פרופיל צריך לבדוק בכל עמודה בטבלה, איך לפרש את התוצאות ואיזה כלל איכות נתונים צריך להגדיר:
עמודה בטבלה מדד תוצאות הפרופיל מה לחפש ואיך לפרש יעד לאימות איכות הנתונים duration_minutesנתונים סטטיסטיים של סיכום זוהו ערכים שליליים: ערך המינימום הוא -10.0דקות. משך הנסיעה שחלף לא יכול להיות שלילי, מה שמצביע על הקלטות לא תקינות של החיישן או הנסיעה.טירגוט באמצעות כלל תוקף (טווח) (כמו duration_minutes ≥ 1.0) כדי לדרוש זמני נסיעה חיוביים.start_station_idNull % כ-5% ערכי null: אחוז ה-null גדול מ-0%, מה שמראה שבחלק מהרשומות חסרים מזהים של תחנות (למשל, נסיעות ללא תחנות עגינה או ללא עמדות השכרה). מטרגטים באמצעות כלל Completeness (Non-null) כדי לזהות ולסמן רשומות שחסרים בהן מזהי תחנות. subscriber_typeהערכים המובילים קטגוריות לא צפויות: רשימת הערכים הנפוצים כוללת קטגוריות לא סטנדרטיות (כמו INVALID_TIER) לצד רמות חברות תקינות, מה שמצביע על קלט של משתמשים לא מאומת או על בעיות בהטמעת נתונים.כדי לוודא שכל הערכים הנכנסים שייכים לרשימת סוגי החברות המותרים, מטמיעים כלל תוקף (הגדרה) לטירגוט. trip_idספירה ייחודית ואחוז זוהו מזהים כפולים: הייחודיות נמוכה מ-100% (בערך 98%), מה שמצביע על רשומות חוזרות של מזהים. מפתחות ראשיים ומזהי נסיעות צריכים להיות ייחודיים לחלוטין. מטרגטים באמצעות כלל ייחודיות כדי לסמן ולמנוע רשומות כפולות של נסיעות.
הממצאים בפרופיל מספקים לכם בסיס מבוסס-ראיות ליצירת כללים ממוקדים לאיכות הנתונים.
יצירה והפעלה של סריקה לבדיקת איכות הנתונים
אחרי שראיתם איך הנתונים נראים, הגיע הזמן להגדיר כללים אוטומטיים לאיכות הנתונים כדי לזהות אנומליות. בשלב הזה מגדירים ארבעה סוגים נפוצים של כללים על סמך הממצאים בפרופיל.
המסוף
במסוף Google Cloud , עוברים לדף Data profiling & quality.
לוחצים על יצירת סריקה של איכות הנתונים.
בקטע כללי, בשדה שם לתצוגה, מזינים
bikeshare-trips-quality.בקטע טבלה לסריקה, בשדה טבלה, לוחצים על עיון, בוחרים בטבלה
quickstart_data_profile.bikeshare_tripsואז לוחצים על בחירה.בקטע היקף, בוחרים באפשרות כל הנתונים.
בקטע תזמון, בוחרים באפשרות על פי דרישה.
משאירים את שאר ההגדרות כברירות המחדל ולוחצים על המשך.
בקטע כללים לאיכות נתונים, לוחצים על הוספת כללים ובוחרים באפשרות סוגי כללים מובנים.
בחלונית הוספת כללים, בוחרים את העמודות ואת סוגי הכללים:
- בשדה בחירת עמודות, לוחצים על עיון ובוחרים באפשרויות
duration_minutes,start_station_id,subscriber_typeו-trip_id. - לוחצים על בחירה.
- ברשימה Choose rule types (בחירת סוגי כללים), בוחרים באפשרויות Range check (בדיקת טווח), NULL check (בדיקת ערך NULL), Value-set check (בדיקת קבוצת ערכים) ו-Uniqueness check (בדיקת ייחודיות), ואז לוחצים על OK (אישור).
ברשימת הכללים שנוצרו, מסמנים את התיבה לצד כל אחד מהכללים הבאים:
-
duration_minutes: בדיקת טווח start_station_id: בדיקת ערך NULL-
subscriber_type: בדיקת קבוצת ערכים trip_id: בדיקת ייחודיות
-
לוחצים על בחירה.
- בשדה בחירת עמודות, לוחצים על עיון ובוחרים באפשרויות
בטבלה כללים לאיכות נתונים, מגדירים פרמטרים לכללים שדורשים ערכים:
- בשורה
duration_minutes(בדיקת טווח), לוחצים על עריכה, מזינים את הערך1.0בשדה ערך מינימלי ולוחצים על שמירה. - בשביל
subscriber_type(בדיקת קבוצת ערכים), לוחצים על עריכה, לוחצים על הוספת ערך כדי להוסיף כל אחד מהערכים המותרים (Local Rider,Walk Up,Student Membershipו-Weekender), ואז לוחצים על שמירה.
- בשורה
לוחצים על המשך ואז על הפעלת הסריקה.
gcloud
ב-Cloud Shell, יוצרים קובץ בשם
dq_bikeshare.yamlעם מפרטי כללים שמטרתם לטפל באנומליות שנמצאו בפרופיל:cat << 'EOF' > dq_bikeshare.yaml rules: - column: trip_id dimension: UNIQUENESS uniquenessExpectation: {} - column: start_station_id dimension: COMPLETENESS nonNullExpectation: {} - column: duration_minutes dimension: VALIDITY rangeExpectation: minValue: "1.0" - column: subscriber_type dimension: VALIDITY setExpectation: values: - "Local Rider" - "Walk Up" - "Student Membership" - "Weekender" EOFיוצרים סריקה של איכות הנתונים:
gcloud dataplex datascans create data-quality bikeshare-trips-quality \ --location=us-central1 \ --data-source-resource="//bigquery.googleapis.com/projects/PROJECT_ID/datasets/quickstart_data_profile/tables/bikeshare_trips" \ --data-quality-spec-file="dq_bikeshare.yaml" \ --description="Data quality scan for sample bikeshare dataset"
מחליפים את
PROJECT_IDבמזהה הפרויקט ב-Google Cloud .מריצים את הסריקה של איכות הנתונים:
gcloud dataplex datascans run bikeshare-trips-quality \ --location=us-central1
בדיקת ההערכות של כללי איכות הנתונים
בודקים את התוצאות של איכות הנתונים כדי לראות איך הכללים העריכו את נתוני המדגם וזיהו אנומליות.
במסוף Google Cloud , עוברים לדף Data profiling & quality.
בטבלה Scans (סריקות), לוחצים על הסריקה bikeshare-trips-quality.
בקטע סקירה כללית, לוחצים על הצגת התוצאות כדי לפתוח את פרטי המשרה.
בחלונית פרטי המשרה, בודקים את תוצאות ההערכה:
סטטוס איכות הנתונים: כמו שציפינו, הסטטוס של כל 3 המאפיינים שנבדקו הוא נכשל.
- תוקף: נכשל. העמודה
duration_minutesמכילה ערכים שליליים, והעמודהsubscriber_typeמכילה ערכים לא תקינים של חברות (INVALID_TIER). - השלמות: נכשל. העמודה
start_station_idמכילה ערכי null. - ייחודיות: נכשל. העמודה
trip_idמכילה רשומות כפולות.
- תוקף: נכשל. העמודה
כללים: בטבלה כללים, כל 4 הכללים שנבדקו מציגים סטטוס של נכשל.
-
duration_minutes: בדיקת טווח (נכשלה) -
start_station_id: בדיקת ערך NULL (Failed) -
subscriber_type: בדיקת ערכים (נכשלה) -
trip_id: בדיקת ייחודיות (נכשלה)
לכל כלל שנכשל, אפשר להעתיק את שאילתת ה-SQL בעמודה Query to get failed records ולהריץ אותה ב-BigQuery כדי לבודד את השורות הלא תקינות ולבדוק אותן.
-
יצרתם פרופיל של טבלה ב-BigQuery כדי לגלות נתונים סטטיסטיים של עמודות, והשתמשתם בתובנות האלה כדי להגדיר ולאמת כללים אוטומטיים לאיכות הנתונים.
הסרת המשאבים
כדי לא לצבור חיובים לחשבון Google Cloud על המשאבים שבהם השתמשתם בדף הזה, פועלים לפי השלבים הבאים:
המסוף
במסוף Google Cloud , עוברים לדף Data profiling & quality.
בטבלה Scans, בוחרים באפשרויות bikeshare-trips-quality ו-bikeshare-trips-profile.
לוחצים על מחיקה ומאשרים.
עוברים לדף BigQuery.
בחלונית Explorer, לוחצים על Datasets.
בוחרים את מערך הנתונים
quickstart_data_profileולוחצים על מחיקה.
gcloud
ב-Cloud Shell, מוחקים את סריקת איכות הנתונים, את סריקת פרופיל הנתונים ואת מערך הנתונים לדוגמה:
gcloud dataplex datascans delete bikeshare-trips-quality --location=us-central1 --quiet gcloud dataplex datascans delete bikeshare-trips-profile --location=us-central1 --quiet bq rm -r -f -d PROJECT_ID:quickstart_data_profile
מחליפים את PROJECT_ID במזהה הפרויקט ב-Google Cloud .