תרחישים לדוגמה לשימוש ב-Dataflow

‫Dataflow נועד לתמוך בצינורות עיבוד נתונים בסטרימינג ובאצווה בקנה מידה גדול. ‫Dataflow מבוסס על מסגרת Apache Beam בקוד פתוח.

בדף הזה יש קישורים למדריכים ולתרחישים לדוגמה שיעזרו לכם להתחיל.

העברת נתונים

במאמר הזה נסביר איך להשתמש בכלי ליצירת משימות Dataflow כדי להטמיע נתונים מקטלוגים חיצוניים של Apache Iceberg REST בטבלאות מנוהלות של Lakehouse.
במאמר הזה מוסבר איך להשתמש בכלי ליצירת משימות Dataflow כדי להוסיף קובצי Apache Parquet קיימים מ-Cloud Storage לטבלת Apache Iceberg ב-Lakehouse.
איך משתמשים בכלי ליצירת משימות Dataflow כדי לייבא טבלאות קיימות של Delta Lake מ-Google Cloud Storage אל Lakehouse.
במדריך הזה מוסבר איך להריץ תבנית Dataflow שקוראת מתוך השירות המנוהל ל-Apache Kafka וכותבת את הרשומות לטבלה ב-BigQuery.
במדריך הזה נסביר איך להריץ תבנית Dataflow שקוראת הודעות בקידוד JSON מ-Pub/Sub וכותבת אותן לטבלה ב-BigQuery.

Dataflow ML

במחברת הזו מוסבר איך להשתמש במודלים של ML בצינורות של Apache Beam שמשתמשים בטרנספורמציה RunInference.
במחברת הזו מוסבר איך להריץ הסקה של למידת מכונה באמצעות vLLM ו-GPU. ‏vLLM היא ספרייה להסקה ולהצגה של LLM.

משאבים אחרים

קישורים לדוגמאות קוד ולמדריכים טכניים בנושא תרחישי שימוש נפוצים ב-Dataflow.
במדריך הזה תיצרו צינור לטרנספורמציה של נתונים ממסחר אלקטרוני מ-Pub/Sub, ותייצאו את הנתונים ל-BigQuery ול-Bigtable.
בעזרת Dataflow, אתם יכולים להריץ עומסי עבודה מקבילים מאוד בצינור עיבוד נתונים יחיד, לשפר את היעילות ולנהל את תהליך העבודה בקלות רבה יותר.