בדף הזה מוסבר איך לנהל את בקרת הגישה כשפורסים ומריצים צינור (pipeline) שמשתמש באשכולות של Managed Service for Apache Spark בפרויקט אחר של Google Cloud .
תרחיש
כברירת מחדל, כשמפעילים מופע של Cloud Data Fusion בפרויקט ב-Google Cloud , המערכת פורסת ומריצה צינורות עיבוד נתונים באמצעות אשכולות של Managed Service for Apache Spark באותו פרויקט. עם זאת, יכול להיות שהארגון שלכם ידרוש מכם להשתמש באשכולות בפרויקט אחר. בתרחיש השימוש הזה, אתם צריכים לנהל את הגישה בין הפרויקטים. בדף הבא מוסבר איך לשנות את הגדרות הבסיס (ברירת המחדל) ולהחיל את אמצעי בקרת הגישה המתאימים.
לפני שמתחילים
כדי להבין את הפתרונות במקרה השימוש הזה, צריך להכיר את ההקשר הבא:
- היכרות עם מושגים בסיסיים ב-Cloud Data Fusion
- הכרת ניהול הזהויות והרשאות הגישה (IAM) ב-Cloud Data Fusion
- היכרות עם הגדרת הרשת ב-Cloud Data Fusion
הנחות והיקף
הדרישות לתרחיש השימוש הזה הן:
- מכונת Cloud Data Fusion פרטית. מטעמי אבטחה, יכול להיות שהארגון ידרוש שתשתמשו בסוג הזה של מופע.
- מקור ויעד ב-BigQuery.
- בקרת גישה באמצעות IAM, ולא בקרת גישה מבוססת-תפקידים (RBAC).
פתרון
הפתרון הזה משווה בין ארכיטקטורה ובין הגדרות של ערך בסיס ושל תרחיש לדוגמה.
ארכיטקטורה
בתרשימים הבאים מוצגת השוואה בין ארכיטקטורת הפרויקט ליצירת מופע של Cloud Data Fusion ולהרצת צינורות עיבוד נתונים כשמשתמשים באשכולות באותו פרויקט (בסיס) ובפרויקט אחר באמצעות ה-VPC של פרויקט הדייר.
ארכיטקטורה בסיסית
התרשים הזה מציג את ארכיטקטורת הבסיס של הפרויקטים:

במקרה של הגדרת בסיס, יוצרים מכונת Cloud Data Fusion פרטית ומריצים צינור בלי לבצע התאמה אישית נוספת:
- אתם משתמשים באחד מפרופילי החישוב המובנים
- מקור הנתונים ויעד הנתונים נמצאים באותו פרויקט כמו המופע
- לא הוקצו תפקידים נוספים לאף אחד מחשבונות השירות
מידע נוסף על פרויקטים של דיירים ולקוחות זמין במאמר בנושא רשתות.
ארכיטקטורה של תרחיש לדוגמה
בתרשים הזה מוצגת ארכיטקטורת הפרויקט כשמשתמשים באשכולות בפרויקט אחר:

הגדרות אישיות
בקטעים הבאים מוצגות השוואות בין הגדרות הבסיס לבין הגדרות ספציפיות לתרחישי שימוש, להפעלת אשכולות של Managed Service for Apache Spark בפרויקט אחר דרך ה-VPC של פרויקט הדייר שמוגדר כברירת מחדל.
בתיאורי תרחישי השימוש הבאים, פרויקט הלקוח הוא המקום שבו מופעל מופע Cloud Data Fusion, ופרויקט Managed Service for Apache Spark הוא המקום שבו מופעל אשכול Managed Service for Apache Spark.
מכונה וירטואלית ו-VPC של פרויקט דייר (tenant)
| בסיס להשוואה | תרחיש שימוש |
|---|---|
בתרשים הארכיטקטורה הבסיסית שלמעלה, פרויקט הדייר
כולל את הרכיבים הבאים:
|
לא נדרשת הגדרה נוספת לתרחיש השימוש הזה. |
פרויקט של לקוח
| בסיס להשוואה | תרחיש שימוש |
|---|---|
| בפרויקט Google Cloud פורסים ומריצים צינורות. כברירת מחדל, אשכולות של Managed Service for Apache Spark מופעלים בפרויקט הזה כשמריצים את צינורות הנתונים. | בתרחיש לדוגמה הזה, אתם מנהלים שני פרויקטים. בדף הזה, המונח פרויקט הלקוח מתייחס למקום שבו פועלת מכונת Cloud Data Fusion. הפרויקט Managed Service for Apache Spark מתייחס למיקום שבו מופעלים אשכולות של Managed Service for Apache Spark. |
VPC של הלקוח
| בסיס להשוואה | תרחיש שימוש |
|---|---|
מנקודת המבט שלכם (הלקוח), ה-VPC של הלקוח הוא המקום שבו Cloud Data Fusion ממוקם באופן לוגי. נקודה חשובה: פרטי ה-VPC של הלקוח מופיעים בדף 'רשתות VPC' בפרויקט. |
לא נדרשת הגדרה נוספת לתרחיש השימוש הזה. |
רשת משנה של Cloud Data Fusion
| בסיס להשוואה | תרחיש שימוש |
|---|---|
מנקודת המבט שלכם (הלקוח), רשת המשנה הזו היא המקום שבו Cloud Data Fusion ממוקם באופן לוגי. נקודה חשובה: האזור של רשת המשנה הזו זהה למיקום של מכונת Cloud Data Fusion בפרויקט הדייר. |
לא נדרשת הגדרה נוספת לתרחיש השימוש הזה. |
רשת משנה של Managed Service for Apache Spark
| בסיס להשוואה | תרחיש שימוש |
|---|---|
רשת המשנה שבה מופעלים אשכולות של Managed Service for Apache Spark כשמריצים צינור. נקודות עיקריות:
|
זוהי רשת משנה חדשה שבה מופעלים אשכולות של Managed Service for Apache Spark כשמריצים צינור. נקודות עיקריות:
|
מקורות ו-sinks
| בסיס להשוואה | תרחיש שימוש |
|---|---|
המקורות שמהם הנתונים נשלפים והיעדים שאליהם הנתונים נטענים, כמו מקורות ויעדים של BigQuery. נקודה מרכזית:
|
ההגדרות הספציפיות של בקרת הגישה בדף הזה מיועדות למקורות וליעדים של BigQuery. |
Cloud Storage
| בסיס להשוואה | תרחיש שימוש |
|---|---|
קטגוריית האחסון בפרויקט של הלקוח, שעוזרת להעביר קבצים בין Cloud Data Fusion לבין Managed Service for Apache Spark. נקודות עיקריות:
|
לא נדרשת הגדרה נוספת לתרחיש השימוש הזה. |
קטגוריות זמניות שמשמשות את המקור ואת היעד
| בסיס להשוואה | תרחיש שימוש |
|---|---|
מאגרי זמניים שנוצרו על ידי תוספים למקורות וליעדים שלכם, כמו משימות טעינה שהופעלו על ידי התוסף BigQuery Sink. נקודות עיקריות:
|
בתרחיש השימוש הזה, אפשר ליצור את הקטגוריה בכל פרויקט. |
קטגוריות שהן מקורות או יעדים של נתונים לתוספים
| בסיס להשוואה | תרחיש שימוש |
|---|---|
| קטגוריות של לקוחות, שמצוינות בהגדרות של תוספים, כמו התוסף Cloud Storage והתוסף FTP to Cloud Storage. | לא נדרשת הגדרה נוספת לתרחיש השימוש הזה. |
IAM: סוכן שירות של Cloud Data Fusion API
| בסיס להשוואה | תרחיש שימוש |
|---|---|
כשמפעילים את Cloud Data Fusion API, התפקיד Cloud Data Fusion API Service Agent ( נקודות עיקריות:
|
בתרחיש השימוש הזה, מעניקים את התפקיד Cloud Data Fusion API Service Agent (סוכן שירות של Cloud Data Fusion API) לחשבון השירות בפרויקט Managed Service for Apache Spark. לאחר מכן, מעניקים את התפקידים הבאים בפרויקט הזה:
|
IAM: חשבון שירות של Managed Service for Apache Spark
| בסיס להשוואה | תרחיש שימוש |
|---|---|
חשבון השירות שמשמש להרצת צינור עיבוד הנתונים כמשימה באשכול Managed Service for Apache Spark. כברירת מחדל, זהו חשבון השירות של Compute Engine. אופציונלי: בהגדרת הבסיס, אפשר לשנות את חשבון השירות שמוגדר כברירת מחדל לחשבון שירות אחר מאותו פרויקט. מקצים לחשבון השירות החדש את התפקידים הבאים ב-IAM:
|
בדוגמה הזו לתרחיש שימוש מניחים שאתם משתמשים בחשבון השירות שמוגדר כברירת מחדל ב-Compute Engine ( מקצים לחשבון השירות שמוגדר כברירת מחדל ב-Compute Engine בפרויקט Managed Service for Apache Spark את התפקידים הבאים.
מקצים את התפקיד 'משתמש בחשבון שירות' לחשבון השירות של Cloud Data Fusion בחשבון השירות שמשמש כברירת המחדל של Compute Engine בפרויקט Managed Service for Apache Spark. צריך לבצע את הפעולה הזו בפרויקט Managed Service for Apache Spark. מוסיפים את חשבון השירות שמוגדר כברירת מחדל ב-Compute Engine של פרויקט Managed Service for Apache Spark לפרויקט Cloud Data Fusion. מקצים גם את התפקידים הבאים:
|
ממשקי API
| בסיס להשוואה | תרחיש שימוש |
|---|---|
כשמפעילים את Cloud Data Fusion API, מופעלים גם ממשקי ה-API הבאים: מידע נוסף על ממשקי ה-API האלה זמין בדף APIs & services בפרויקט.
כשמפעילים את Cloud Data Fusion API, חשבונות השירות הבאים מתווספים אוטומטית לפרויקט:
|
בתרחיש השימוש הזה, צריך להפעיל את ממשקי ה-API הבאים בפרויקט שמכיל את הפרויקט Managed Service for Apache Spark:
|
מפתחות הצפנה
| בסיס להשוואה | תרחיש שימוש |
|---|---|
בהגדרת הבסיס, מפתחות ההצפנה יכולים להיות בניהול Google או CMEK . נקודות עיקריות: אם אתם משתמשים ב-CMEK, הגדרת הבסיס שלכם צריכה לכלול את הדברים הבאים:
בהתאם לשירותים שבהם נעשה שימוש בצינור עיבוד הנתונים, כמו BigQuery או Cloud Storage, צריך גם להעניק לחשבונות השירות את התפקיד Cloud KMS CryptoKey Encrypter/Decrypter:
|
אם אתם לא משתמשים ב-CMEK, לא צריך לבצע שינויים נוספים לתרחיש השימוש הזה. אם משתמשים ב-CMEK, צריך להקצות את התפקיד Cloud KMS CryptoKey Encrypter/Decrypter לחשבון השירות הבא ברמת המפתח בפרויקט שבו הוא נוצר:
בהתאם לשירותים שבהם נעשה שימוש בצינור עיבוד הנתונים, כמו BigQuery או Cloud Storage, צריך גם להעניק לחשבונות שירות אחרים את התפקיד Cloud KMS CryptoKey Encrypter/Decrypter ברמת המפתח. לדוגמה:
|
אחרי שתבצעו את ההגדרות הספציפיות לתרחיש השימוש, צינור הנתונים יוכל להתחיל לפעול באשכולות בפרויקט אחר.
המאמרים הבאים
- מידע נוסף על רשתות ב-Cloud Data Fusion
- במאמר מסמך עזר בנושא תפקידים בסיסיים ומוגדרים מראש ב-IAM אפשר לקרוא פרטים נוספים.