במאמר הזה מוסבר איך להתקין את התוסף JupyterLab ולהשתמש בו במכונה או במכונה וירטואלית בניהול עצמי שיש לה גישה לשירותי Google. בנוסף, אנחנו מסבירים איך לפתח ולפרוס קוד של מחברת Spark בלי שרת (serverless).
אפשר להתקין את התוסף תוך דקות ספורות וליהנות מהתכונות הבאות:
- השקת מחברות BigQuery ו-Spark ללא שרת (serverless) כדי לפתח קוד במהירות
- עיון בתצוגה מקדימה של מערכי נתונים ב-BigQuery ב-JupyterLab
- עריכת קבצים ב-Cloud Storage ב-JupyterLab
- תזמון מחברת ב-Composer
שימוש בערכה של סוכני נתונים ב-Google Cloud: בנוסף ל-JupyterLab, אפשר גם לפתח ולנהל את עומסי העבודה של Managed Service for Apache Spark ב-VS Code באמצעות הערכה של סוכני נתונים. ערכת Data Agent Kit מאפשרת לכם לנהל את כל מחזור החיים של עומס העבודה של הנתונים בסביבת הפיתוח המשולבת (IDE), כולל בניית צינורות נתונים.
לפני שמתחילים
- נכנסים לחשבון Google Cloud . אם אתם משתמשים חדשים ב- Google Cloud, צרו חשבון כדי שתוכלו להעריך את הביצועים של המוצרים שלנו בתרחישים מהעולם האמיתי. לקוחות חדשים מקבלים בחינם גם קרדיט בשווי 300$ להרצה, לבדיקה ולפריסה של עומסי העבודה.
-
In the Google Cloud console, on the project selector page, select or create a Google Cloud project.
Roles required to select or create a project
- Select a project: Selecting a project doesn't require a specific IAM role—you can select any project that you've been granted a role on.
-
Create a project: To create a project, you need the Project Creator role
(
roles/resourcemanager.projectCreator), which contains theresourcemanager.projects.createpermission. Learn how to grant roles.
-
Verify that you have the permissions required to complete this guide.
-
Verify that billing is enabled for your Google Cloud project.
Enable the Dataproc API.
Roles required to enable APIs
To enable APIs, you need the
serviceusage.services.enablepermission. If you created the project, then you likely already have this permission through the Owner role (roles/owner). Otherwise, you can get this permission through the Service Usage Admin role (roles/serviceusage.serviceUsageAdmin). Learn how to grant roles.-
התקינו את ה-CLI של Google Cloud.
-
אם אתם משתמשים בספק זהויות חיצוני (IdP), קודם אתם צריכים להיכנס ל-CLI של gcloud באמצעות המאגר המאוחד לניהול זהויות.
-
כדי לאתחל את ה-CLI של gcloud, הריצו את הפקודה הבאה:
gcloud init -
In the Google Cloud console, on the project selector page, select or create a Google Cloud project.
Roles required to select or create a project
- Select a project: Selecting a project doesn't require a specific IAM role—you can select any project that you've been granted a role on.
-
Create a project: To create a project, you need the Project Creator role
(
roles/resourcemanager.projectCreator), which contains theresourcemanager.projects.createpermission. Learn how to grant roles.
-
Verify that you have the permissions required to complete this guide.
-
Verify that billing is enabled for your Google Cloud project.
Enable the Dataproc API.
Roles required to enable APIs
To enable APIs, you need the
serviceusage.services.enablepermission. If you created the project, then you likely already have this permission through the Owner role (roles/owner). Otherwise, you can get this permission through the Service Usage Admin role (roles/serviceusage.serviceUsageAdmin). Learn how to grant roles.-
התקינו את ה-CLI של Google Cloud.
-
אם אתם משתמשים בספק זהויות חיצוני (IdP), קודם אתם צריכים להיכנס ל-CLI של gcloud באמצעות המאגר המאוחד לניהול זהויות.
-
כדי לאתחל את ה-CLI של gcloud, הריצו את הפקודה הבאה:
gcloud init
התפקידים הנדרשים
כדי להריץ את הדוגמאות בדף הזה, צריך תפקידים מסוימים ב-IAM. יכול להיות שהתפקידים האלה כבר הוקצו, בהתאם למדיניות הארגון. כדי לבדוק את התפקידים שהוקצו, ראו האם צריך להקצות תפקידים?.
כדי לקרוא הסבר על מתן תפקידים, קראו איך מנהלים את הגישה ברמת הפרויקט, התיקייה והארגון.
תפקידי משתמשים
כדי לקבל את ההרשאות שדרושות ליצירת סשן של מחברת אינטראקטיבית, צריך לבקש מהאדמין להקצות לכם את תפקידי ה-IAM הבאים:
- עריכת פרויקטים ב-Dataproc (
roles/dataproc.editor) בפרויקט - משתמש בחשבון שירות (
roles/iam.serviceAccountUser) בחשבון השירות של Compute Engine שמוגדר כברירת מחדל
תפקיד בחשבון שירות
כדי לוודא שלחשבון השירות שמוגדר כברירת מחדל ב-Compute Engine יש את ההרשאות שנדרשות ליצירת סשן אינטראקטיבי, צריך לבקש מהאדמין להקצות לחשבון השירות שמוגדר כברירת מחדל ב-Compute Engine את תפקיד ה-IAM Dataproc Worker (roles/dataproc.worker) בפרויקט.
התקנת התוסף JupyterLab
אפשר להתקין את התוסף JupyterLab ולהשתמש בו במכונה או במכונה וירטואלית שיש להן גישה לשירותי Google, כמו המכונה המקומית או מכונה וירטואלית (VM) של Compute Engine.
כדי להתקין את התוסף, מבצעים את השלבים הבאים:
מורידים ומתקינים את Python בגרסה 3.11 ואילך מהכתובת
python.org/downloads.- מאמתים את ההתקנה של Python 3.11 ואילך.
python3 --version
- מאמתים את ההתקנה של Python 3.11 ואילך.
יוצרים סביבה וירטואלית של Python.
pip3 install pipenv
- יוצרים תיקיית התקנה.
mkdir jupyter
- עוברים לתיקיית ההתקנה.
cd jupyter
- יוצרים סביבה וירטואלית.
pipenv shell
- יוצרים תיקיית התקנה.
מתקינים את JupyterLab בסביבה הווירטואלית.
pipenv install jupyterlab
מתקינים את התוסף JupyterLab.
pipenv install bigquery-jupyter-plugin
jupyter lab
הדף Launcher של JupyterLab ייפתח בדפדפן. הוא כולל קטע Dataproc Jobs and Sessions. הוא יכול להכיל גם קטעים של Dataproc Serverless Notebooks ושל Dataproc Cluster Notebooks אם יש לכם גישה למחברות או לאשכולות של השירות המנוהל ל-Apache Spark עם רכיב Jupyter אופציונלי שפועל בפרויקט.
כברירת מחדל, הסשן האינטראקטיבי פועל בפרויקט ובאזור שהגדרתם כשמריצים את הפקודה
gcloud initבקטע לפני שמתחילים. אפשר לשנות את הגדרות הפרויקט והאזור של הסשנים מ-JupyterLab הגדרות > Google Cloud הגדרות > Google Cloud הגדרות הפרויקט.כדי שהשינויים ייכנסו לתוקף, צריך להפעיל מחדש את התוסף.
יצירת תבנית של זמן ריצה של Managed Service for Apache Spark
תבניות זמן ריצה של Managed Service for Apache Spark (נקראות גם תבניות סשן) מכילות הגדרות תצורה להרצת קוד Spark בסשן. אפשר ליצור ולנהל תבניות של סביבת ריצה באמצעות Jupyterlab או Google Cloud CLI.
JupyterLab
בקטע Dataproc Serverless Notebooks בדף Launcher של JupyterLab, לוחצים על הכרטיס
New runtime template.
ממלאים את הטופס Runtime template (תבנית של סביבת זמן הריצה).
פרטי התבנית:
- שם לתצוגה, מזהה זמן ריצה ותיאור: מאשרים או ממלאים שם לתצוגה של התבנית, מזהה זמן ריצה של התבנית ותיאור של התבנית.
הגדרת הפעלה: בוחרים באפשרות חשבון משתמש כדי להפעיל מחברות עם זהות המשתמש במקום עם זהות חשבון השירות של Dataproc.
- חשבון שירות: אם לא מציינים חשבון שירות, נעשה שימוש בחשבון השירות שמוגדר כברירת מחדל ב-Compute Engine.
- גרסת זמן ריצה: מאשרים או בוחרים את
2.3גרסת זמן הריצה. - קובץ אימג' מותאם אישית של קונטיינר: אפשר לציין את ה-URI של קובץ אימג' מותאם אישית של קונטיינר.
- קטגוריית ביניים: אפשר לציין שם של קטגוריית ביניים ב-Cloud Storage לשימוש ב-Managed Service for Apache Spark.
- מאגר חבילות Python: כברירת מחדל, חבילות Python מורדות ומוגדרות ממטמון PyPI pull-through כשמשתמשים מריצים פקודות התקנה
pipב-notebooks שלהם. אתם יכולים לציין את מאגר הארטפיקטים הפרטי של הארגון שלכם לחבילות Python, כדי להשתמש בו כמאגר ברירת המחדל של חבילות Python.
הצפנה: מאשרים את ברירת המחדל Google-owned and Google-managed encryption key או בוחרים באפשרות מפתח הצפנה בניהול הלקוח (CMEK). אם בחרתם באפשרות CMEK, צריך לבחור מפתח או לספק את פרטי המפתח.
הגדרת רשת: בוחרים רשת משנה בפרויקט או רשת משנה ששותפה מפרויקט מארח (אפשר לשנות את הפרויקט מ-JupyterLab הגדרות > Google Cloud הגדרות > Google Cloud הגדרות פרויקט). אפשר לציין תגי רשת להחלה על הרשת שצוינה. הערה: שירות Managed Service for Apache Spark מאפשר גישה פרטית ל-Google (PGA) ברשת המשנה שצוינה. למידע על דרישות הקישוריות לרשת, אפשר לעיין במאמר בנושא הגדרת הרשת של Managed Service for Apache Spark.
הגדרת סשן: אפשר למלא את השדות האלה כדי להגביל את משך הסשנים שנוצרו באמצעות התבנית.
- זמן מקסימלי ללא פעילות: הזמן המקסימלי ללא פעילות לפני שהסשן מסתיים. הטווח המותר: 10 דקות עד 336 שעות (14 ימים).
- משך הסשן המקסימלי: משך החיים המקסימלי של סשן לפני שהסשן מסתיים. הטווח המותר: 10 דקות עד 336 שעות (14 ימים).
Metastore: כדי להשתמש בשירות Dataproc Metastore בסשנים, בוחרים את מזהה הפרויקט ואת השירות של Metastore.
שרת היסטוריה מתמשך: אתם יכולים לבחור שרת היסטוריה מתמשך של Spark זמין כדי לאפשר לכם לגשת ליומני סשנים במהלך הסשנים ואחריהם.
מאפייני Spark: אפשר לבחור ואז להוסיף מאפייני Spark של הקצאת משאבים, שינוי גודל אוטומטי או GPU. לוחצים על הוספת נכס כדי להוסיף עוד נכסי Spark. מידע נוסף זמין במאמר בנושא מאפייני Spark.
תוויות: לוחצים על הוספת תווית לכל תווית שרוצים להגדיר לביקורים שנוצרו באמצעות התבנית.
לוחצים על שמירה כדי ליצור את התבנית.
כדי להציג או למחוק תבנית זמן ריצה.
- לוחצים על הגדרות > Google Cloud הגדרות.
ברשימה Dataproc Settings > Serverless Runtime Templates מוצגות תבניות זמן הריצה.
- כדי לראות את פרטי התבנית, לוחצים על שם התבנית.
- אפשר למחוק תבנית מהתפריט פעולה של התבנית.
פותחים וטוענים מחדש את דף מרכז האפליקציות של JupyterLab כדי לראות את כרטיס התבנית של ה-notebook שנשמר בדף מרכז האפליקציות של JupyterLab.
gcloud
יוצרים קובץ YAML עם הגדרות תבנית זמן הריצה.
YAML פשוט
environmentConfig: executionConfig: networkUri: default jupyterSession: kernel: PYTHON displayName: Team A labels: purpose: testing description: Team A Development Environment
YAML מורכב
description: Example session template environmentConfig: executionConfig: serviceAccount: sa1 # Choose either networkUri or subnetworkUri networkUri: subnetworkUri: default networkTags: - tag1 kmsKey: key1 idleTtl: 3600s ttl: 14400s stagingBucket: staging-bucket peripheralsConfig: metastoreService: projects/my-project-id/locations/us-central1/services/my-metastore-id sparkHistoryServerConfig: dataprocCluster: projects/my-project-id/regions/us-central1/clusters/my-cluster-id jupyterSession: kernel: PYTHON displayName: Team A labels: purpose: testing runtimeConfig: version: "2.3" containerImage: gcr.io/my-project-id/my-image:1.0.1 properties: "p1": "v1" description: Team A Development Environment
כדי ליצור תבנית של סשן (זמן ריצה) מקובץ ה-YAML, מריצים את הפקודה הבאה gcloud beta dataproc session-templates import באופן מקומי או ב-Cloud Shell:
gcloud beta dataproc session-templates import TEMPLATE_ID \ --source=YAML_FILE \ --project=PROJECT_ID \ --location=REGION
- במאמר gcloud beta dataproc session-templates מפורטות פקודות לתיאור, להצגה, לייצוא ולמחיקה של תבניות סשנים.
הפעלה וניהול של מחברות
אחרי התקנת התוסף Managed Service for Apache Spark JupyterLab, אפשר ללחוץ על כרטיסי התבניות בדף Launcher של JupyterLab כדי:
הפעלת מחברת Jupyter
בקטע Dataproc Serverless Notebooks בדף JupyterLab Launcher מוצגים כרטיסי תבניות של מחברות שמשויכים לתבניות של זמן ריצה של Managed Service for Apache Spark (ראו יצירת תבנית של זמן ריצה של Managed Service for Apache Spark).
לוחצים על כרטיס כדי ליצור סשן של Managed Service for Apache Spark ולהפעיל מחברת. אחרי שהסשן נוצר והליבה של המחברת מוכנה לשימוש, הסטטוס של הליבה משתנה מ-
Startingל-Idle (Ready).כתיבה ובדיקה של קוד במחברת.
מעתיקים את קוד PySpark
Pi estimationהבא ומדביקים אותו בתא של מחברת PySpark, ואז לוחצים על Shift+Return כדי להריץ את הקוד.import random def inside(p): x, y = random.random(), random.random() return x*x + y*y < 1 count = sc.parallelize(range(0, 10000)) .filter(inside).count() print("Pi is roughly %f" % (4.0 * count / 10000))
תוצאת ה-Notebook:
אחרי שיוצרים Notebook ומשתמשים בו, אפשר לסיים את סשן ה-Notebook בלחיצה על Shut Down Kernel בכרטיסייה Kernel.
- כדי לעשות שימוש חוזר בסשן, יוצרים נוטבוק חדש על ידי בחירה באפשרות Notebook (נוטבוק) בתפריט File>>New (קובץ >> חדש). אחרי שיוצרים את הנוטבוק החדש, בוחרים את הסשן הקיים מתיבת הדו-שיח לבחירת ליבה. המחברת החדשה תשתמש שוב בסשן ותשמור על הקשר של הסשן מהמחברת הקודמת.
אם לא תסיימו את הסשן, שירות Managed Service for Apache Spark יסיים את הסשן כשהטיימר של הסשן יפוג. אפשר להגדיר את הזמן שבו המשתמש לא פעיל בסשן בהגדרות של תבנית זמן הריצה. זמן חוסר הפעילות בסשן שמוגדר כברירת מחדל הוא שעה אחת.
הפעלת מחברת באשכול
אם יצרתם אשכול Jupyter של שירות מנוהל ל-Apache Spark, בדף Launcher של JupyterLab יש קטע Dataproc Cluster Notebook עם כרטיסי ליבה שהותקנו מראש.
כדי להפעיל Jupyter Notebook ב-Managed Service for Apache Spark באשכול Compute Engine:
לוחצים על כרטיס בקטע Dataproc Cluster Notebook.
כשהסטטוס של ליבת ה-Kernel משתנה מ-
Startingל-Idle (Ready), אפשר להתחיל לכתוב ולהריץ קוד במחברת.אחרי שיוצרים Notebook ומשתמשים בו, אפשר לסיים את סשן ה-Notebook בלחיצה על Shut Down Kernel בכרטיסייה Kernel.
ניהול קבצי קלט ופלט ב-Cloud Storage
ניתוח נתונים לצורך גילוי תובנות ובניית מודלים של למידת מכונה (ML) כוללים לרוב קבצים כקלט ופלט. השירות המנוהל ל-Apache Spark ניגש לקבצים האלה ב-Cloud Storage.
כדי לגשת לדפדפן Cloud Storage, לוחצים על סמל הדפדפן Cloud Storage בסרגל הצד של דף Launcher ב-JupyterLab, ואז לוחצים לחיצה כפולה על תיקייה כדי לראות את התוכן שלה.
אתם יכולים ללחוץ על סוגי קבצים שנתמכים ב-Jupyter כדי לפתוח ולערוך אותם. כששומרים שינויים בקבצים, הם נכתבים ב-Cloud Storage.
כדי ליצור תיקייה חדשה ב-Cloud Storage, לוחצים על סמל התיקייה החדשה ומזינים את שם התיקייה.
כדי להעלות קבצים לקטגוריה או לתיקייה ב-Cloud Storage, לוחצים על סמל ההעלאה ובוחרים את הקבצים שרוצים להעלות.
פיתוח קוד ב-Spark Notebook
אחרי התקנת התוסף JupyterLab, אפשר להפעיל מחברות Jupyter מדף Launcher של JupyterLab כדי לפתח קוד של אפליקציה.
פיתוח קוד ב-PySpark וב-Python
שירות מנוהל לאשכולות Apache Spark תומך ב-PySpark ובליבות Python.
לוחצים על כרטיס PySpark בקטע Dataproc Serverless Notebooks או Dataproc Cluster Notebook בדף Launcher של JupyterLab כדי לפתוח מחברת PySpark.
לוחצים על כרטיס של ליבת Python בקטע Dataproc Cluster Notebook בדף Launcher של JupyterLab כדי לפתוח מחברת Python.
פיתוח קוד SQL
כדי לפתוח מחברת PySpark כדי לכתוב ולהריץ קוד SQL, בדף Launcher של JupyterLab, בקטע Dataproc Serverless Notebooks או Dataproc Cluster Notebook, לוחצים על כרטיס ליבת PySpark.
פקודות Magic של Spark SQL: ליבת PySpark שמפעילה את Dataproc Serverless Notebooks טעונה מראש עם פקודות Magic של Spark SQL. לכן, במקום להשתמש ב-spark.sql('SQL STATEMENT').show() כדי להקיף את משפט ה-SQL, אפשר להקליד %%sparksql magic בראש התא ואז להקליד את משפט ה-SQL בתא.
BigQuery SQL: המחבר של BigQuery Spark מאפשר לקוד של מחברת הנתונים לטעון נתונים מטבלאות BigQuery, לבצע ניתוח ב-Spark ואז לכתוב את התוצאות בטבלת BigQuery.
זמני הריצה של Managed Service for Apache Spark 2.2 מגרסה 3.2.0 ואילך כוללים את BigQuery Spark connector.
אם אתם משתמשים בגרסה קודמת של זמן הריצה כדי להפעיל מחברות של Managed Service for Apache Spark, אתם יכולים להתקין את Spark BigQuery Connector על ידי הוספת המאפיין הבא של Spark לתבנית זמן הריצה של Managed Service for Apache Spark:
spark.jars: gs://spark-lib/bigquery/spark-bigquery-with-dependencies_2.12-0.25.2.jar
פיתוח קוד Scala
אשכולות של Managed Service for Apache Spark שנוצרו עם גרסאות של תמונות 2.0 ואילך כוללים את Apache Toree, ליבת Scala לפלטפורמת Jupyter Notebook שמספקת גישה אינטראקטיבית ל-Spark.
לוחצים על הכרטיס Apache Toree בקטע Dataproc cluster Notebook בדף Launcher ב-JupyterLab כדי לפתוח מחברת לפיתוח קוד Scala.
איור 1. כרטיס ליבת Apache Toree בדף ההפעלה של JupyterLab.
פיתוח קוד באמצעות התוסף Visual Studio Code
תוסף Google Cloud Visual Studio Code (VS Code) מאפשר לכם:
- פיתוח והרצה של קוד Spark בפריטי Notebook של Managed Service for Apache Spark.
- יצירה וניהול של תבניות זמן ריצה (סשן) של Managed Service for Apache Spark, סשנים אינטראקטיביים ועומסי עבודה ברצף (batch).
התוסף ל-Visual Studio Code הוא בחינם, אבל תחויבו על כל השירותים שלGoogle Cloud , כולל Managed Service for Apache Spark, Managed Service for Apache Spark ומשאבי Cloud Storage שבהם אתם משתמשים.
שימוש ב-VS Code עם BigQuery: אפשר גם להשתמש ב-VS Code עם BigQuery כדי לבצע את הפעולות הבאות:
- פיתוח והרצה של מחברות BigQuery.
- עיון במערכי נתונים של BigQuery, בדיקה שלהם ותצוגה מקדימה שלהם.
לפני שמתחילים
- מורידים ומתקינים את VS Code.
- פותחים את VS Code, ובסרגל הפעילות לוחצים על Extensions (תוספים).
בסרגל החיפוש, מחפשים את התוסף Jupyter ולוחצים על Install (התקנה). התוסף Jupyter של מיקרוסופט הוא תלות נדרשת.
התקנת התוסף Google Cloud
- פותחים את VS Code, ובסרגל הפעילות לוחצים על Extensions (תוספים).
בסרגל החיפוש, מחפשים את התוסף Google Cloud Code ולוחצים על Install (התקנה).
אם מוצגת בקשה, מפעילים מחדש את VS Code.
הסמל Google Cloud קוד מוצג עכשיו בסרגל הפעילות של VS Code.
הגדרת התוסף
- פותחים את VS Code, ואז בסרגל הפעילות לוחצים על Google Cloud Code (קוד).
- פותחים את הקטע Dataproc.
- לוחצים על התחברות אל Google Cloud. תופנו לדף הכניסה כדי להזין את פרטי הכניסה.
- משתמשים בסרגל המשימות של האפליקציה ברמה העליונה כדי לנווט אל קוד > הגדרות > הגדרות > תוספים.
- מחפשים את Google Cloud Code ולוחצים על סמל הניהול כדי לפתוח את התפריט.
- לוחצים על Settings.
- בשדות Project ו-Managed Service for Apache Spark Region, מזינים את השם של פרויקט Google Cloud ואת האזור שבו רוצים להשתמש כדי לפתח מחברות ולנהל משאבים של Managed Service for Apache Spark.
פיתוח מחברות
- פותחים את VS Code, ואז בסרגל הפעילות לוחצים על Google Cloud Code (קוד).
- פותחים את הקטע Notebooks (מחברות) ולוחצים על New Serverless Spark Notebook (מחברת Spark חדשה ללא שרת).
- בוחרים תבנית חדשה של זמן ריצה (סשן) או יוצרים תבנית חדשה לשימוש בסשן של הנוטבוק.
נוצר קובץ
.ipynbחדש שמכיל קוד לדוגמה, והוא נפתח בכלי העריכה.
עכשיו אפשר לכתוב ולהריץ קוד במחברת של Managed Service for Apache Spark.
יצירה וניהול של משאבים
- פותחים את VS Code, ואז בסרגל הפעילות לוחצים על Google Cloud Code (קוד).
פותחים את הקטע Dataproc ולוחצים על שמות המשאבים הבאים:
- אשכולות: יצירה וניהול של אשכולות ועבודות.
- Serverless: יצירה וניהול של עומסי עבודה (workloads) של אצווה וסשנים אינטראקטיביים.
- תבניות של סביבת זמן הריצה של Spark: יצירה וניהול של תבניות סשנים.
סייר מערכי נתונים
אפשר להשתמש בכלי Dataset explorer של JupyterLab כדי להציג מערכי נתונים של BigLake metastore.
כדי לפתוח את הכלי Dataset Explorer של JupyterLab, לוחצים על הסמל שלו בסרגל הצד.
אפשר לחפש מסד נתונים, טבלה או עמודה בכלי לבדיקת קבוצת נתונים. לוחצים על שם של מסד נתונים, טבלה או עמודה כדי לראות את המטא-נתונים שמשויכים אליהם.
פריסת הקוד
אחרי התקנת התוסף JupyterLab, תוכלו להשתמש ב-JupyterLab כדי:
הפעלת קוד המחברת בתשתית של Managed Service for Apache Spark
תזמון של הפעלת מחברת ב-Managed Service for Apache Airflow
שליחת משימות באצווה לתשתית של Managed Service for Apache Spark או לאשכול של Managed Service for Apache Spark.
תזמון של ביצוע notebook ב-Managed Airflow
כדי לתזמן את קוד המחברת ב-Managed Airflow כך שיפעל כמשימה באצווה ב-Managed Service for Apache Spark או באשכול Managed Service for Apache Spark, צריך לבצע את השלבים הבאים.
לוחצים על הלחצן Job Scheduler (מתזמן משימות) בפינה השמאלית העליונה של המחברת.
ממלאים את הטופס Create A Scheduled Job (יצירת משימה מתוזמנת) ומזינים את הפרטים הבאים:
- שם ייחודי לעבודת ההרצה של המחברת
- סביבת Airflow מנוהלת שבה רוצים לפרוס את ה-Notebook
- הזנת פרמטרים של קלט אם המחברת היא פרמטרית
- תבנית זמן הריצה של Managed Service for Apache Spark או של Serverless שבה רוצים להשתמש כדי להריץ את המחברת
- אם נבחר אשכול, האם להפסיק את האשכול אחרי שהמחברת מסיימת את ההרצה באשכול
- מספר הניסיונות החוזרים וההשהיה בין הניסיונות בדקות, אם הפעלת המחברת נכשלת בניסיון הראשון
- התראות על ביצוע שיש לשלוח ורשימת הנמענים. ההתראות נשלחות באמצעות הגדרת SMTP של Airflow.
- תזמון ההרצה של ה-notebook
לוחצים על יצירה.
אחרי שהמחברת מתוזמנת בהצלחה, שם העבודה מופיע ברשימת העבודות המתוזמנות בסביבת Managed Airflow.
שליחת עבודה לעיבוד ברצף אל Managed Service for Apache Spark
בקטע Dataproc Jobs and Sessions בדף Launcher של JupyterLab, לוחצים על הכרטיס Serverless.
לוחצים על הכרטיסייה Batch (אצווה), ואז על Create Batch (יצירת אצווה) וממלאים את השדות בBatch Info (פרטי האצווה).
לוחצים על שליחה כדי לשלוח את העבודה.
שליחת משימה באצווה לאשכול Managed Service for Apache Spark
בקטע Dataproc Jobs and Sessions בדף Launcher של JupyterLab, לוחצים על הכרטיס Clusters.
לוחצים על הכרטיסייה משרות ואז על שליחת משרה.
בוחרים אשכול וממלאים את השדות Job.
לוחצים על שליחה כדי לשלוח את העבודה.
הצגה וניהול של משאבים
אחרי התקנת התוסף JupyterLab, אפשר להציג ולנהל את Managed Service for Apache Spark ואת Managed Service for Apache Spark מהקטע Dataproc Jobs and Sessions בדף Launcher של JupyterLab.
לוחצים על הקטע Dataproc Jobs and Sessions (משימות וסשנים של Dataproc) כדי להציג את הכרטיסים Clusters (אשכולות) ו-Serverless (ללא שרת).
כדי להציג ולנהל סשנים של Managed Service for Apache Spark:
- לוחצים על הכרטיס Serverless.
- לוחצים על הכרטיסייה סשנים ואז על מזהה סשן כדי לפתוח את הדף פרטי סשן, שבו אפשר לראות את מאפייני הסשן, להציג את Google Cloud היומנים בכלי Logs Explorer ולסיים סשן. הערה: כדי להפעיל כל מחברת של Managed Service for Apache Spark, המערכת יוצרת סשן ייחודי של Managed Service for Apache Spark.
כדי לראות ולנהל עיבודים ברצף (batch processing) של Managed Service for Apache Spark:
- לוחצים על הכרטיסייה Batches (אצוות) כדי לראות את רשימת האצוות של Managed Service for Apache Spark בפרויקט ובאזור הנוכחיים. לוחצים על מזהה של קבוצת בקשות כדי לראות את הפרטים שלה.
כדי להציג ולנהל אשכולות של Managed Service for Apache Spark:
- לוחצים על הכרטיס Clusters (אשכולות). הכרטיסייה Clusters (אשכולות) נבחרה כדי להציג רשימה של אשכולות פעילים של Managed Service for Apache Spark בפרויקט ובאזור הנוכחיים. אפשר ללחוץ על הסמלים בעמודה פעולות כדי להתחיל, להפסיק או להפעיל מחדש אשכול. לוחצים על שם האשכול כדי לראות את הפרטים שלו. אפשר ללחוץ על הסמלים בעמודה פעולות כדי לשכפל, לעצור או למחוק עבודה.
כדי להציג ולנהל משימות של Managed Service for Apache Spark:
- לוחצים על הכרטיס משימות כדי לראות את רשימת המשימות בפרויקט הנוכחי. לוחצים על מזהה משימה כדי לראות את פרטי המשימה.