יצירת סטרימינג ב-Spanner באמצעות התהליך האוטומטי

בדף הזה מוסבר איך ליצור זרם Spanner באמצעות תהליך ההגדרה האוטומטי.

ההגדרה האוטומטית של הזרם מפשטת את תהליך העברת הנתונים ממסדי נתונים של Spanner ליעדים כמו BigQuery, כי היא מצמצמת את מספר השלבים שצריך לבצע. התהליך מאפשר לכם ליצור מקור נתונים ישירות מדף הסקירה הכללית של מופע או מסד נתונים של Spanner. ‫Datastream מבצע אוטומציה של אבטחת החיבור בין הזרם לבין מסד הנתונים המקור, ויוצר הגדרות של מסד הנתונים ומשאבי חיבור של הזרם.

תוכנית בחינם

באמצעות Datastream אפשר להזרים נתונים מ-Spanner ל-BigQuery במסגרת התוכנית בחינם, ולקבל עד 100GiB של נתוני סימון נתונים שהשתנו (CDC) בחינם בכל חודש. מידע נוסף על תמחור Datastream

לפני שמתחילים

לפני שמגדירים זרם Datastream ל-Spanner, צריך לוודא שהסביבה עומדת בדרישות המוקדמות הבאות:

  1. מפעילים את ממשקי ה-API הנדרשים ב Google Cloud פרויקט:
    • Datastream API ‏ (datastream.googleapis.com)
    • Cloud Spanner API (spanner.googleapis.com)
    • ‫BigQuery API ‏ (bigquery.googleapis.com).
  2. כדאי לוודא שיש לכם את ההרשאות הנדרשות לניהול זהויות והרשאות גישה (IAM) כדי ליצור ולנהל משאבי Datastream. מידע נוסף זמין במאמר בנושא הרשאות נדרשות.
  3. בודקים את ההגבלות על מקורות Spanner:

    • עמודות עם סוג הנתונים PROTO ו-ENUM לא נתמכות.
    • מערכים של סוגי הנתונים DATE או TIMESTAMP לא נתמכים.
    • מוודאים שהגדרתם נכון את חלון השמירה של זרם השינויים. אם Datastream לא מצליח לעמוד בקצב של חלון השמירה, יכול להיות שנתונים יאבדו וההזרמה תיכשל.

ההרשאות הנדרשות

כדי להשתמש בתהליך האוטומטי ליצירת פיד, צריך לוודא שלמשתמש או לחשבון השירות שמגדירים את הפיד יש את תפקידי ה-IAM או ההרשאות הבאים:

  • אדמין של Datastream (roles/datastream.admin) או עורך של Datastream (roles/datastream.editor) כדי ליצור ולנהל את מקור הנתונים ואת פרופילי החיבור.
  • Spanner Database Reader ‏ (roles/spanner.databaseReader) או Spanner Admin ‏ (roles/spanner.admin) במסד הנתונים של המקור כדי לגשת לנתונים ולעקוב אחרי שינויים.
  • BigQuery Data Editor (עריכת נתונים ב-BigQuery) במערך הנתונים של היעד.

יצירה והתחלה של השידור

כדי ליצור ולהתחיל שידור באמצעות התהליך האוטומטי, מבצעים את השלבים הבאים:

המסוף

  1. במסוף Google Cloud , עוברים לדף Spanner Instances.

כניסה לדף Spanner Instances

  1. בוחרים את מופע Spanner ואת מסד הנתונים שמהם רוצים להזרים נתונים.
  2. אפשר ליצור ולהתחיל את השידור באופן אוטומטי באחת מהדרכים הבאות:

    • בדף הסקירה הכללית של המופעים, לוחצים על התחלת הזרמה בקטע שכפול נתונים ל-BigQuery.
    • בדף הסקירה הכללית של מסד הנתונים, בכרטיסייה שילובים, לוחצים על יצירת מקור נתונים בקטע שכפול נתונים ל-BigQuery.
  3. נפתחת החלונית Start stream to replicate data (הפעלת הזרם לשכפול נתונים).

  4. בקטע הגדרות השידור, בודקים את הגדרות ברירת המחדל של השידור שיצרתם.

  5. אם יוצרים את הזרם מדף הסקירה הכללית של המופעים, אפשר לשנות את מסד הנתונים של המקור על ידי הרחבת התפריט הנפתח המתאים ובחירת ערך אחר.

  6. כדי לשנות את הזרם, מרחיבים את התפריט הנפתח Change stream ובוחרים ערך אחר.

  7. כשתהיו מוכנים ליצור ולהתחיל את השידור, לחצו על התחלת השידור.

מעקב אחרי השידור

כדי לעקוב אחרי פרטים בסיסיים של סנכרון שינויים בזרמי נתונים מתוך דף הסקירה הכללית של מסד הנתונים של Spanner ב- Google Cloud console, לוחצים על הכרטיסייה סנכרון שינויים בזרמי נתונים ואז על סנכרון שינויים בזרמי נתונים שרוצים להציג.

מחיקת השידור

כשמוחקים מקור נתונים שנוצר באמצעות התהליך האוטומטי, Datastream מוחק את אובייקט מקור הנתונים ואת פרופילי החיבור המשויכים שנוצרו עבור מקור הנתונים.

עם זאת, אם כבר לא צריך את סנכרון שינויים בזרמי נתונים ב-Spanner או את משאבי היעד שנוצרו באופן עצמאי, צריך למחוק אותם באופן ידני.

המאמרים הבאים