אפשר להתקין רכיבים נוספים כמו Jupyter כשיוצרים אשכול של Managed Service for Apache Spark באמצעות התכונה Optional components. בדף הזה מתואר הרכיב Jupyter.
רכיב Jupyter הוא מחברת למשתמש יחיד מבוססת-אינטרנט לניתוח אינטראקטיבי של נתונים, והוא תומך בממשק המשתמש האינטרנטי של JupyterLab. ממשק המשתמש של Jupyter באינטרנט זמין ביציאה 8123 בצומת הראשי הראשון של האשכול.
הפעלת מחברות לכמה משתמשים. אתם יכולים ליצור מכונה של Vertex AI Workbench עם Managed Service for Apache Spark, או להתקין את הפלאגין Managed Service for Apache Spark JupyterLab במכונה וירטואלית כדי להציג מחברות למספר משתמשים.
הגדרת Jupyter אפשר להגדיר את Jupyter על ידי ציון dataproc:jupyter
מאפייני אשכול.
כדי להפחית את הסיכון להרצת קוד מרחוק דרך ממשקי API לא מאובטחים של שרת מחברות, הגדרת ברירת המחדל של מאפיין האשכול dataproc:jupyter.listen.all.interfaces היא false, שמגבילה את החיבורים ל-localhost (127.0.0.1) כשComponent Gateway מופעל (נדרשת הפעלה של Component Gateway כשמתקינים את רכיב Jupyter).
מחברת Jupyter מספקת ליבת Python להרצת קוד Spark וליבת PySpark. כברירת מחדל, מחברות נשמרות ב-Cloud Storage בקטגוריית האחסון הזמני של Managed Service for Apache Spark, שמוגדרת על ידי המשתמש או נוצרת באופן אוטומטי כשהאשכול נוצר. אפשר לשנות את המיקום בזמן יצירת האשכול באמצעות מאפיין האשכול dataproc:jupyter.notebook.gcs.dir.
עבודה עם קובצי נתונים אתם יכולים להשתמש במחברת Jupyter כדי לעבוד עם קובצי נתונים שהועלו ל-Cloud Storage. מכיוון שמחבר Cloud Storage מותקן מראש באשכול של שירות מנוהל ל-Apache Spark, אפשר להפנות לקבצים ישירות במחברת. דוגמה לגישה לקובצי CSV ב-Cloud Storage:
df = spark.read.csv("gs://bucket/path/file.csv")
df.show()
דוגמאות ל-PySpark מופיעות במאמר פונקציות כלליות לטעינה ולשמירה.
התקנה של Jupyter
מתקינים את הרכיב כשיוצרים אשכול של Managed Service for Apache Spark. כדי להשתמש ברכיב Jupyter, צריך להפעיל את Component Gateway של Managed Service for Apache Spark.
מסוףGoogle Cloud
- במסוף Google Cloud , פותחים את הדף Create cluster.
- לוחצים על הגדרה נוספת כדי להרחיב את הקטע.
- עורכים את הרכיבים האופציונליים.
- בחלונית שנפתחת, מסמנים את התיבה Jupyter Notebook ולוחצים על שמירה.
CLI של gcloud
כדי ליצור אשכול של Managed Service for Apache Spark שכולל את רכיב Jupyter, משתמשים בפקודה gcloud dataproc clusters create cluster-name עם הדגל --optional-components.
דוגמה לגרסה האחרונה של תמונת ברירת המחדל
בדוגמה הבאה מותקן רכיב Jupyter באשכול שמשתמש בגרסת התמונה העדכנית ביותר שמוגדרת כברירת מחדל.
gcloud dataproc clusters create cluster-name \ --optional-components=JUPYTER \ --region=region \ --enable-component-gateway \ ... other flags
API בארכיטקטורת REST
אפשר להתקין את רכיב Jupyter דרך Dataproc API באמצעות SoftwareConfig.Component כחלק מבקשת clusters.create.
- מגדירים את המאפיין EndpointConfig.enableHttpPortAccess
לערך
trueכחלק מהבקשהclusters.createכדי לאפשר התחברות לממשק האינטרנט של מחברת Jupyter באמצעות Component Gateway.
פתיחת ממשקי המשתמש של Jupyter ו-JupyterLab
לוחצים על Google Cloud הקישורים של Component Gateway במסוף כדי לפתוח בדפדפן המקומי את ממשק המשתמש של Jupyter notebook או JupyterLab שפועל בצומת הראשי של האשכול.
בוחרים באפשרות GCS או Local Disk כדי ליצור Jupyter Notebook חדש באחד מהמיקומים.
צירוף מעבדי GPU לצמתים ראשיים ולצמתים של עובדים
אתם יכולים להוסיף יחידות GPU לצמתי ה-master וה-worker של האשכול כשמשתמשים במחברת Jupyter כדי:
- מבצעים עיבוד מוקדם של הנתונים ב-Spark, ואז אוספים DataFrame אל המאסטר ומריצים TensorFlow
- שימוש ב-Spark כדי לתזמן הפעלות של TensorFlow במקביל
- הפעלת Tensorflow-on-YARN
- שימוש בתרחישים אחרים של למידת מכונה שמשתמשים במעבדי GPU