הקשר רחב

‫Gemini מגיע עם חלון הקשר של מיליון טוקנים כברירת מחדל. בעבר, מודלים גדולים של שפה (LLM) היו מוגבלים באופן משמעותי בכמות הטקסט (או הטוקנים) שאפשר להעביר למודל בכל פעם. חלון ההקשר הארוך של Gemini, עם אחזור כמעט מושלם (>99%), פותח הרבה תרחישי שימוש חדשים ופרדיגמות פיתוח.

הקוד שבו אתם כבר משתמשים במקרים כמו יצירת תוכן או קלט רב-אופני יפעל באופן אוטומטי עם הקשר ארוך הטווח.

במדריך הזה נסביר בקצרה את העקרונות הבסיסיים של חלון ההקשר, איך מפתחים צריכים להתייחס להקשר ארוך, נציג תרחישים שונים מהעולם האמיתי לשימוש בהקשר ארוך ונסביר איך לייעל את השימוש בהקשר ארוך.

מה זה חלון הקשר?

הדרך הבסיסית שבה משתמשים במודלים של Gemini היא העברת מידע (הקשר) למודל, שיצור בתגובה תשובה. אפשר להשוות את חלון ההקשר לזיכרון לטווח קצר. יש כמות מוגבלת של מידע שאפשר לאחסן בזיכרון לטווח קצר, וזה נכון גם לגבי מודלים גנרטיביים.

מידע נוסף על אופן הפעולה של המודלים זמין במדריך שלנו בנושא מודלים גנרטיביים.

תחילת העבודה עם הקשר רחב

רוב המודלים הגנרטיביים שנוצרו בשנים האחרונות יכלו לעבד רק 8,000 טוקנים בכל פעם. בדגמים חדשים יותר, המגבלה הזו גדולה יותר, והם יכולים לקבל 32,000 או 128,000 טוקנים. ‫Gemini הוא המודל הראשון שיכול לקבל מיליון טוקנים, ועכשיו 2 מיליון טוקנים עם Gemini 1.5 Pro.

בפועל, מיליון טוקנים ייראו כך:

  • ‫50,000 שורות קוד (עם 80 תווים סטנדרטיים בכל שורה)
  • כל הודעות הטקסט ששלחתם ב-5 השנים האחרונות
  • ‫8 רומנים באנגלית באורך ממוצע
  • תמלילים של יותר מ-200 פרקים של פודקאסטים באורך ממוצע

למרות שהמודלים יכולים לקבל יותר ויותר הקשר, הרבה מהידע המקובל לגבי שימוש במודלים גדולים של שפה מניח את המגבלה המובנית הזו על המודל, אבל נכון לשנת 2024, זה כבר לא המצב.

בין האסטרטגיות הנפוצות להתמודדות עם המגבלה של חלונות הקשר הקטנים:

  • מחיקה שרירותית של הודעות או טקסט ישנים מחלון ההקשר כשמגיע טקסט חדש
  • סיכום של תוכן קודם והחלפתו בסיכום כשהחלון של ההקשר מתקרב למצב מלא
  • שימוש ב-RAG עם חיפוש סמנטי כדי להעביר נתונים מחוץ לחלון ההקשר אל מסד נתונים וקטורי
  • שימוש במסננים דטרמיניסטיים או גנרטיביים כדי להסיר טקסט או תווים מסוימים מההנחיות כדי לחסוך באסימונים

הרבה מהשיטות האלה עדיין רלוונטיות במקרים מסוימים, אבל כברירת מחדל, עכשיו פשוט מכניסים את כל האסימונים לחלון ההקשר. המודלים של Gemini נבנו במיוחד עם חלון הקשר ארוך, ולכן הם מסוגלים ללמוד מתוך ההקשר בצורה טובה יותר. לדוגמה, עם חומרי הדרכה בלבד (דקדוק של 500 עמודים, מילון וכ-400 משפטים מקבילים נוספים) שסופקו כולם בהקשר, Gemini 1.5 Pro ו-Gemini 1.5 Flash מסוגלים ללמוד לתרגם מאנגלית לקלמנג – שפה פפואנית עם פחות מ-200 דוברים, ולכן כמעט ללא נוכחות באינטרנט – באיכות דומה לאיכות של אדם שלמד מאותם חומרים.

הדוגמה הזו ממחישה איך אפשר להתחיל לחשוב על האפשרויות שזמינות לכם עם הקשר ארוך והיכולות של Gemini ללמידה בהקשר.

תרחישים לדוגמה לשימוש בהקשר ארוך

תרחיש השימוש הסטנדרטי ברוב המודלים הגנרטיביים הוא עדיין קלט טקסט, אבל קבוצת מודלי Gemini מאפשרת פרדיגמה חדשה של תרחישי שימוש מולטימודאליים. המודלים האלה יכולים להבין באופן טבעי טקסט, סרטונים, אודיו ותמונות. לנוחיותכם, הם מגיעים עם Gemini Enterprise API ל-Gemini, שמקבל סוגים של קבצים מולטי-מודאליים.

טקסט ארוך

הטקסט הוכיח את עצמו כשכבת האינטליגנציה שעומדת בבסיס רוב המומנטום סביב מודלים מסוג LLM. כמו שצוין קודם, חלק גדול מהמגבלות המעשיות של מודלים מסוג LLM נבעו מכך שלא היה להם חלון הקשר גדול מספיק כדי לבצע משימות מסוימות. זה הוביל לאימוץ מהיר של יצירה משופרת באחזור (RAG) וטכניקות אחרות שמספקות למודל באופן דינמי מידע רלוונטי מההקשר. עכשיו, עם חלונות הקשר גדולים יותר ויותר (נכון לעכשיו עד 2 מיליון ב-Gemini 1.5 Pro), יש טכניקות חדשות שמאפשרות תרחישי שימוש חדשים.

הנה כמה תרחישי שימוש חדשים וסטנדרטיים בהקשר ארוך מבוסס-טקסט:

  • סיכום של מאגרי מידע גדולים של טקסט
    • אפשרויות קודמות לסיכום עם מודלים קטנים יותר של הקשר היו דורשות חלון הזזה או טכניקה אחרת כדי לשמור את המצב של קטעים קודמים כשמועברים טוקנים חדשים למודל
  • שאילת שאלות ומתן תשובות
    • בעבר, היה אפשר לעשות את זה רק באמצעות RAG, כי כמות ההקשר הייתה מוגבלת והיכולת של המודלים לשחזר עובדות הייתה נמוכה
  • תהליכי עבודה אג'נטיים
    • טקסט הוא הבסיס לאופן שבו סוכנים שומרים על מצב הפעולה שלהם, כלומר מה הם עשו ומה הם צריכים לעשות. חוסר מידע מספיק על העולם ועל המטרה של הסוכן הוא מגבלה על מהימנות הסוכנים.

למידה בהקשר עם הרבה דוגמאות היא אחת מהיכולות הייחודיות ביותר שמתאפשרות על ידי מודלים עם הקשר ארוך. מחקרים הראו שאם לוקחים את הפרדיגמה הנפוצה של דוגמה אחת או כמה דוגמאות, שבה המודל מקבל דוגמה אחת או כמה דוגמאות למשימה, ומרחיבים אותה למאות, אלפים או אפילו מאות אלפים של דוגמאות, אפשר להגיע ליכולות חדשות של המודל. הוכח גם שהגישה הזו של למידה עם הרבה דוגמאות פועלת באופן דומה למודלים שעברו כוונון עדין לביצוע משימה ספציפית. במקרים שבהם הביצועים של מודל Gemini עדיין לא מספיקים להשקה בסביבת ייצור, אפשר לנסות את הגישה של many-shot. כפי שאפשר לראות בהמשך בקטע על אופטימיזציה של הקשר הארוך, שמירת הקשר במטמון הופכת את סוג העומס הזה של טוקנים עם קלט גבוה להרבה יותר משתלם מבחינה כלכלית, ואפילו מקצרת את זמן האחזור במקרים מסוימים.

סרטון ארוך

השימוש בתוכן וידאו מוגבל כבר הרבה זמן בגלל חוסר הנגישות של המדיום עצמו. היה קשה לסרוק את התוכן, התמלילים לרוב לא הצליחו לתעד את הניואנסים של סרטון, ורוב הכלים לא מעבדים תמונה, טקסט ואודיו יחד. היכולות של Gemini לעיבוד טקסט עם הקשר ארוך מאפשרות לו להסיק מסקנות ולענות על שאלות לגבי קלט מולטי-מודאלי עם ביצועים טובים לאורך זמן.

הנה כמה תרחישי שימוש חדשים ונפוצים בהקשר ארוך של סרטונים:

  • שאלות ותשובות בסרטון
  • זיכרון וידאו, כפי שמוצג ב-פרויקט Astra של Google
  • כתוביות לסרטונים
  • מערכות המלצות לסרטונים, על ידי העשרת מטא-נתונים קיימים בהבנה חדשה של מודלים מרובי-מוֹדָלִים
  • התאמה אישית של סרטונים על ידי ניתוח מאגר נתונים ומטא-נתונים של סרטונים, ואז הסרת חלקים בסרטונים שלא רלוונטיים לצופה
  • ניהול תוכן בסרטונים
  • עיבוד סרטונים בזמן אמת

כשעובדים עם סרטונים, חשוב להבין איך הסרטונים מעובדים לטוקנים, כי זה משפיע על החיוב ועל מגבלות השימוש. מידע נוסף על יצירת הנחיות עם קובצי וידאו זמין במדריך ליצירת הנחיות.

תוכן אודיו ארוך

מודלי Gemini היו הראשונים מסוגם – מודלים גדולים של שפה (LLM) מולטי-מודאליים שיכולים להבין אודיו. בעבר, תהליך העבודה הטיפוסי של מפתחים כלל שרשור של כמה מודלים ספציפיים לתחום, כמו מודל של המרת דיבור לטקסט ומודל של יצירת טקסט על סמך טקסט, כדי לעבד אודיו. התהליך הזה הוביל לזמן טעינה נוסף שנדרש לביצוע של כמה בקשות הלוך ושוב, ולירידה בביצועים שנובעת בדרך כלל מארכיטקטורות לא מקושרות של הגדרת כמה מודלים.

בבדיקות סטנדרטיות של חיפוש מחט בערימת שחת, Gemini 1.5 Pro מצליח למצוא את האודיו המוסתר ב-100% מהבדיקות, ו-Gemini 1.5 Flash מצליח למצוא אותו ב-98.7% מהבדיקות. ‏Gemini 1.5 Flash יכול לקבל עד 9.5 שעות של אודיו בבקשה אחת, ו-Gemini 1.5 Pro יכול לקבל עד 19 שעות של אודיו באמצעות חלון ההקשר של 2 מיליון טוקנים. בנוסף, ב<High Priority Term>קבוצת נתונים לבדיקה</High Priority Term> של קטעי אודיו באורך 15 דקות, Gemini 1.5 Pro משיג שיעור שגיאות במילים (WER) של כ-5.5%, נמוך בהרבה אפילו ממודלים מיוחדים של תמלול, בלי המורכבות הנוספת של פילוח קלט ועיבוד מקדים.

הנה כמה תרחישי שימוש חדשים ונפוצים בהקשר של אודיו:

  • תמלול ותרגום בזמן אמת
  • שאלות ותשובות לגבי פודקאסטים או סרטונים
  • תמלול וסיכום של פגישות
  • עוזרים קוליים

במדריך ליצירת הנחיות יש מידע נוסף על יצירת הנחיות עם קובצי אודיו.

אופטימיזציות של הקשר ארוך

כשעובדים עם הקשר ארוך ועם מודלים של Gemini, האופטימיזציה העיקרית היא שימוש בשמירת נתונים במטמון של ההקשר. בעבר, לא הייתה אפשרות לעבד הרבה טוקנים בבקשה אחת, והמגבלה העיקרית הייתה העלות. אם יש לכם אפליקציה של 'צ'אט עם הנתונים שלך' שבה משתמש מעלה 10 קובצי PDF, סרטון וכמה מסמכים, בעבר הייתם צריכים לעבוד עם כלי או מסגרת מורכבים יותר של שליפה מוגברת של דור (RAG) כדי לעבד את הבקשות האלה ולשלם סכום משמעותי על טוקנים שהועברו לחלון ההקשר. עכשיו, אתם יכולים לשמור במטמון את הקבצים שהמשתמש מעלה ולשלם על האחסון שלהם לפי שעה. עלות הקלט והפלט לכל בקשה נמוכה מעלות הקלט והפלט הרגילה, כך שאם המשתמש ינהל צ'אט עם הנתונים שלו מספיק זמן, תוכלו לחסוך בעלויות באופן משמעותי.

מגבלות של הקשר ארוך

בקטעים שונים במדריך הזה, הסברנו איך מודלים של Gemini משיגים ביצועים גבוהים במגוון רחב של הערכות של חיפוש מחט בערימת שחת. הבדיקות האלה מתבססות על ההגדרה הבסיסית ביותר, שבה מחפשים מחט אחת. במקרים שבהם מחפשים כמה 'מחטים' או פיסות מידע ספציפיות, המודל לא משיג את אותה רמת דיוק. הביצועים יכולים להשתנות במידה רבה בהתאם להקשר. חשוב לזכור שיש פה פשרה מובנית בין קבלת המידע הנכון לבין העלות. אפשר לקבל דיוק של 99% בשאילתה אחת, אבל צריך לשלם על טוקנים של קלט בכל פעם ששולחים את השאילתה הזו. לכן, כדי לאחזר 100 פיסות מידע, אם נדרשים ביצועים ברמה של 99%, סביר להניח שתצטרכו לשלוח 100 בקשות. זהו מקרה טוב שבו שמירת מטמון של הקשר יכולה להפחית באופן משמעותי את העלות שקשורה לשימוש במודלים של Gemini, תוך שמירה על רמת ביצועים גבוהה.

המאמרים הבאים

מדריך

אתם יכולים להשתמש ב-Google Gen AI SDK כדי לראות רשימה של האסימונים ומזהי האסימונים של הנחיה, ולקבל את המספר הכולל של האסימונים בהנחיה.