מודלים של AI גנרטיבי כמו Gemini דורשים אמצעי בטיחות חזקים כדי לצמצם סיכונים כמו יצירת תוכן פוגעני, דליפת מידע רגיש או שימוש לרעה. Google CloudGemini Enterprise Agent Platform מספקת חבילה של כלים ושיטות להטמעת בטיחות הוליסטית במודלים של Gemini.
סיכוני בטיחות פוטנציאליים ואסטרטגיות לצמצום הסיכונים
כשפורסים מודלים של Gemini, חשוב לזהות ולצמצם סיכונים פוטנציאליים שונים. גישה פרואקטיבית להבנת הסיכונים האלה מאפשרת הטמעה יעילה יותר של אמצעי בטיחות. גישה רב-שכבתית לבטיחות היא קריטית, כי היא יכולה לצמצם או למנוע:
- סיכוני תוכן: יכולים לכלול תוכן מזיק, שפה גסה ומיניות, אלימות ושפיכות דמים.
- סיכונים לשמירה על תדמית המותג: יכול להיות שהתוכן שנוצר לא יתאים לטון או לערכים של המותג שלכם, שהוא יתמוך במתחרים או במוצרים לא הולמים, או שהוא ייצור תוכן שעלול לפגוע במוניטין שלכם.
- סיכוני התאמה: התוכן שנוצר עלול להיות לא רלוונטי או לא מדויק.
- סיכוני אבטחה ופרטיות: יכול להיות שתוכן שנוצר ידלוף נתונים רגישים או הנחיות לאימון, או שמשתמשים בעלי כוונות זדוניות ינסו לגרום למודל לעקוף פרוטוקולי בטיחות או להתנהג בדרכים לא רצויות.
המודלים שפרסנו מציעים מגוון תכונות לטיפול בבעיות הפוטנציאליות האלה:
- המודל שמוגדר כברירת מחדל והמסננים שלא ניתן להגדיר מספקים רשת ביטחון כללית.
- הוראות למערכת מספקות למודל הנחיות ישירות לגבי התנהגות מועדפת ונושאים שכדאי להימנע מהם.
- מסנני תוכן מאפשרים להגדיר ספים ספציפיים לסוגים נפוצים של נזק.
- Gemini כמסנן מציע נקודת ביקורת מתקדמת וניתנת להתאמה אישית לבעיות בטיחות מורכבות או בעלות ניואנסים, שאולי לא זוהו בשכבות הקודמות או שנדרשת להן הערכה מודעת-הקשר.
- הגנה מוגברת על המודל מספקת הגנה ברמה שמתאימה לארגונים מפני החדרת הנחיות ופריצת Jailbreak, פגיעות בתוכן, Sensitive Data Protection, זיהוי תוכנות זדוניות וגלישה בטוחה.
- DLP מיועדת לטיפול בסיכון הקריטי של זליגת מידע אישי רגיש, במקרה שלמודל יש גישה למידע אישי רגיש. בעזרת IAM אפשר גם ליצור רשימות חסימה בהתאמה אישית.
- Content Credentials מוסיף מטא-נתונים של C2PA עם חתימה קריפטוגרפית לתמונות שנוצרו באמצעות מודל התמונות Gemini 3 Pro. המטא-נתונים האלה מציינים שהתמונות נוצרו על ידי AI ומספקים היסטוריה שניתנת לאימות של המקור שלהן.
כלי בטיחות שזמינים ב-Gemini Enterprise Agent Platform ל-Gemini
Gemini Enterprise Agent Platform מציעה כמה כלים לניהול הבטיחות של מודלים של Gemini. הבנה של אופן הפעולה של כל אחד מהם, השיקולים שלהם ותרחישי השימוש האידיאליים שלהם תעזור לכם לבנות פתרון בטיחות מותאם.
| גישה | איך זה עובד | הגנה מסופקת | הסיכונים | מתי משתמשים |
|---|---|---|---|---|
| הגדרות ברירת מחדל: Gemini + מסננים שלא ניתן להגדיר | מודלים של Gemini מתוכננים מראש עם דגש על בטיחות והוגנות, גם כשהם נתקלים בהנחיות מתנגדות. Google השקיעה בהערכות מקיפות של בטיחות, כולל הטיה ורעילות. הגדרות ברירת המחדל כוללות שכבת הגנה עצמאית שנועדה למנוע יצירה של תוכן שקשור לתוכן ויזואלי של התעללות מינית בילדים (CSAM) או לתוכן מוגן בזכויות יוצרים (דקלום). | הגנה בסיסית מפני תוכן ויזואלי של התעללות מינית בילדים (CSAM) וזכויות יוצרים (הקראה) | יכול להיות שהגדרות הבטיחות שמוגדרות כברירת מחדל ב-Gemini לא יתאימו לצרכים של הארגון שלכם. המודל יכול להמציא תשובות או לא לפעול לפי ההוראות. תוקפים נחושים עדיין יכולים להצליח בפריצות ובשימוש בהנחיות זדוניות | תהליכי עבודה שלא צפוי בהם קלט זדוני |
| מסננים שניתן להגדיר |
מסנני התוכן המובנים של Gemini מספקים הגנה נוספת מפני קטגוריות שונות של תוכן מזיק, כמו תוכן מיני, דברי שטנה, הטרדה או תוכן מסוכן. אתם יכולים להגדיר סף חסימה לכל קטגוריית נזק (לדוגמה, BLOCK_LOW_AND_ABOVE, BLOCK_MEDIUM_AND_ABOVE, BLOCK_ONLY_HIGH) על סמך ההסתברות ו/או חומרת התוכן המזיק. הם מהווים שכבה עצמאית מהמודל, ולכן הם חסינים מפני פריצות.
|
עמידות גבוהה מפני הפרות בקטגוריות מוגדרות מראש, רגישות שניתנת להתאמה | אין אפשרות להתאמה אישית מעבר להגדרות הסף לקטגוריות מוגדרות מראש. יכול להיות שהמערכת תחסום מדי פעם תוכן לא מזיק (תוצאות חיוביות כוזבות) או תפספס תוכן מזיק (תוצאות שליליות כוזבות). האפשרות הזו זמינה רק לסינון תגובות, ולא לסינון הנחיות. | לספק רמת בטיחות בסיסית לאפליקציות או לסוכנים שפונים למשתמשים. אם המטרה שלכם היא לוודא שהתוכן והמותג בטוחים, כדאי לשלב בין מסנני תוכן לבין הוראות למערכת. |
| הוראות מערכת | אתם יכולים לתת למודל הנחיות לגבי המותג שלכם וההנחיות לבטיחות התוכן באמצעות הוראות מערכת או מבואות. לדוגמה, אתם יכולים להגיד למודל "אל תענה על שאלות שקשורות לפוליטיקה" או לבקש ממנו לפעול בהתאם להנחיות ספציפיות לגבי הטון והסגנון של המותג. הוראות המערכת מנחות ישירות את התנהגות המודל. | אפשר להתאים אישית את ההגדרות כדי להגן על התוכן או על המותג, והן יכולות להיות יעילות מאוד. | יכול להיות שהמודל יפיק הזיות או לא יפעל לפי ההוראות. תוקפים בעלי מוטיבציה גבוהה עדיין יכולים להצליח בפריצות ובשיבוש הנחיות | אפליקציות או סוכנים שנדרשים לפעול בהתאם להנחיות ספציפיות למותג או למדיניות תוכן מורכבת. אם המטרה שלכם היא להבטיח את בטיחות התוכן והמותג, כדאי לשלב בין הוראות המערכת לבין מסנני תוכן. |
| הגנה מוגברת על המודל | Model Armor הוא שירות שנועד לשפר את האבטחה והבטיחות של אפליקציות ה-AI שלכם. Google Cloud הוא פועל על ידי סינון פרואקטיבי של הנחיות ותשובות של מודלים גדולים של שפה (LLM), ומגן מפני סיכונים שונים. כך הוא מבטיח שיטות לפיתוח אחראי של AI. בין אם אתם פורסים AI ב- Google Cloud או בספקי ענן אחרים, הגנה מוגברת על המודל יכול לעזור לכם למנוע קלט זדוני, לאמת את בטיחות התוכן, להגן על מידע אישי רגיש, לשמור על תאימות ולאכוף את מדיניות הבטיחות והאבטחה של ה-AI באופן עקבי בכל יישומי ה-AI שלכם. | סינון של החדרת הנחיות ופריצה של מודלים, מסנני תוכן, הגנה על נתונים רגישים, זיהוי של תוכנות זדוניות וגלישה בטוחה. | עלות וזמן האחזור. | מוצר בתשלום ללקוחות עם צרכים של ארגונים גדולים. |
| DLP לרשימות חסימה מותאמות אישית ולהגנה על נתונים רגישים | DLP API יכול לבדוק טקסט כדי לזהות ולסווג מידע רגיש על סמך מגוון רחב של גלאי infoType מוגדרים מראש ומותאמים אישית. אחרי שהמערכת מזהה את המידע, היא יכולה להחיל עליו טכניקות להסרת פרטים מזהים, כמו צנזור, התממה (אנונימיזציה) או טוקניזציה. אפשר גם להשתמש ב-DLP API כדי לחסום מילות מפתח. הגנה על קלט: לפני ששולחים הנחיות או נתונים של משתמשים אל Gemini, אפשר להעביר את הטקסט דרך DLP API כדי לצנזר או להסתיר מידע רגיש. כך נמנע מצב שבו המודל מעבד או מתעד מידע אישי רגיש. הגנה על הפלט: אם יש סיכון ש-Gemini יפיק או יחשוף בטעות מידע רגיש (למשל, אם הוא מסכם מסמכי מקור שמכילים פרטים אישיים מזהים), אפשר לסרוק את הפלט של המודל באמצעות DLP API לפני שהוא נשלח למשתמש. | סינון חזק של מילים גסות או מילים מותאמות אישית. סינון חזק של מידע אישי רגיש. | מוסיף זמן אחזור. עלול לגרום לחסימת יתר. | הגנה מפני אובדן נתונים לסוכנים שיש להם גישה למידע אישי רגיש. |
| Gemini כמסנן | אתם יכולים להשתמש ב-Gemini כדי לסנן הנחיות ותשובות עבור הסוכן או האפליקציה שלכם. התהליך כולל ביצוע שיחה שנייה למודל Gemini מהיר וחסכוני (כמו Gemini Flash או Flash Lite) כדי להעריך אם הקלט ממשתמש או מכלי, או הפלט ממודל Gemini הראשי, בטוח. מודל הסינון מקבל הוראות להחליט אם התוכן בטוח או לא בטוח על סמך המדיניות שהגדרתם, כולל בטיחות תוכן, בטיחות מותג וחוסר התאמה של הסוכן. המודל הזה מציע הגנה חזקה וניתנת להתאמה אישית מפני הפרות של בטיחות תוכן, בעיות שקשורות לבטיחות המותג, סחף מודל והזיות. הוא יכול לנתח טקסט, תמונות, סרטונים ואודיו כדי לספק הבנה הוליסטית. | חזק מאוד וניתן להתאמה אישית לצורך בטיחות תוכן/מותג, סחף, הזיות; הבנה מולטי-מודאלית. | עלות נוספת וזמן אחזור. יש סיכוי נמוך מאוד לתוצאות שליליות כוזבות. | הגדרת רמת בטיחות מותאמת אישית לאפליקציות או לסוכנים שפונים למשתמשים |
| גישה רב-שכבתית: מסננים שאפשר להגדיר + הוראות מערכת + DLP + Gemini כמסנן | חזק מאוד וניתן להתאמה אישית לצורך בטיחות תוכן/מותג, סחף, הזיות; הבנה מולטי-מודאלית | עלות נוספת וזמן אחזור. | לספק רמת בטיחות גבוהה לאפליקציות או לסוכנים שפונים למשתמשים, במיוחד במקרים שבהם צפוי שימוש זדוני או שימוש לרעה | |
| Content Credentials של C2PA | במודלים נתמכים, Gemini Enterprise Agent Platform מוסיפה באופן אוטומטי Content Credentials עם חתימה קריפטוגרפית לתמונות שנוצרו, כדי לציין שהן נוצרו על ידי AI ולספק היסטוריה שניתנת לאימות של המקור שלהן בהתאם לתקן C2PA. מידע נוסף זמין במאמר בנושא Content Credentials. | שקיפות לגבי מקור התוכן; עוזרת למשתמשים לזהות תמונות שנוצרו על ידי AI. | שימוש בכלים שלא עומדים בדרישות עלול לפגוע באותנטיות של הקובץ; לא מובטח שהמקור של המדיה מהימן. | תרחישי שימוש ביצירת מדיה, שבהם שקיפות לגבי המקור וההיסטוריה של הקובץ חשובה לאמון המשתמשים. |
הערכת בטיחות מתמשכת
הערכה מתמשכת של בטיחות היא חיונית למערכות AI, כי תחום ה-AI ושיטות השימוש לרעה משתנים כל הזמן. הערכות קבועות עוזרות לזהות נקודות חולשה, להעריך את יעילות הפעולות לצמצום הסיכונים, להתאים את עצמנו לסיכונים משתנים, לוודא התאמה למדיניות ולערכים, לבנות אמון ולשמור על תאימות. כדי להשיג את המטרה הזו, אנחנו משתמשים בסוגים שונים של הערכות, כולל הערכות פיתוח, הערכות אבטחה, בדיקות חדירה, הערכות חיצוניות ובדיקות השוואה. היקף הבדיקה צריך לכלול את בטיחות התוכן, ההגנה על המותג, הרלוונטיות, ההטיה וההוגנות, האמינות והעמידות בפני מתקפות יריבות. כלים כמו שירות ההערכה של AI גנרטיבי בפלטפורמת הסוכנים של Gemini Enterprise יכולים לעזור במאמצים האלה. חשוב להדגיש ששיפורים חוזרים שמבוססים על ממצאי ההערכה חיוניים לפיתוח אתיקה של בינה מלאכותית.