本文件說明我們在設計 Google Cloud中的 Gemini 產品 (例如 Gemini Code Assist) 時,如何考量生成式 AI 的功能、限制與風險。
大型語言模型的功能和風險
大型語言模型 (LLM) 可執行許多實用工作,例如:
- 翻譯語言。
- 製作文字摘要。
- 生成程式碼和創意寫作內容。
- 為聊天機器人和虛擬助理提供支援。
- 輔助搜尋引擎和推薦系統。
但隨著 LLM 的技術能力不斷演進,也可能出現誤用、濫用,以及未預期或無法預見的後果。
LLM 可能會生成預期外的輸出內容,包括令人反感、未顧及感受或違反事實的文字。由於 LLM 的功能相當多元,因此難以準確預測會輸出什麼出乎意料或未預期的內容。
考量到這些風險和複雜性,Gemini Code Assist 等產品的設計都以 Google 的 AI 開發原則為依據。不過,使用者必須瞭解 Gemini 產品的某些限制,才能安全且負責任地使用。
Gemini 產品在 Google Cloud的限制
使用 Gemini 產品 時 Google Cloud 可能會遇到以下限制 (但不限於此):
極端案例。極端情況是指訓練資料中未充分呈現的異常、罕見或特殊情況。在這些情況下,Gemini 模型可能會出現過度自信、誤解脈絡或輸出不當內容等限制。
模型幻覺、建立基準和事實性。Gemini 模型可能缺乏真實世界知識、物理性質或準確理解方面的基礎和事實性。這項限制可能會導致模型產生幻覺,也就是生成看似合理,但實際上違反事實、無關、不當或毫無意義的內容。這類內容也可能包括捏造連結,連往不存在的網頁。詳情請參閱「撰寫更有效的 Gemini 提示詞 Google Cloud」。
資料品質和微調。輸入 Gemini 產品的提示資料品質、準確度和偏誤程度, Google Cloud 可能會對模型成效造成重大影響。如果使用者輸入不準確或錯誤的提示,Gemini 可能會傳回不盡理想或錯誤的回覆。
偏誤放大。語言模型可能會在無意間放大訓練資料中既有的偏誤,導致輸出內容進一步加深社會偏見,並對特定群體造成不平等待遇。
語言品質。雖然 Gemini 產品在 Google Cloud我們評估的基準中,展現了令人驚豔的多語言能力,但我們的大多數基準 (包括所有公平性評估) 都是以美式英語進行。
語言模型可能會為不同使用者提供品質不一致的服務。 舉例來說,由於訓練資料中缺少某些方言或語言變體,因此文字生成功能可能無法有效處理這些語言。 如果語言並非英文,或是英文變體的使用人數較少,則成效可能會較差。
公平性基準和子群組。Google Research 對 Gemini 模型進行的公平性分析,並未詳盡說明各種潛在風險。舉例來說,我們著重於性別、種族、族裔和宗教軸向的偏誤,但只對美國英語資料和模型輸出內容執行分析。
領域專業知識有限。Gemini 模型經過 Google Cloud 技術訓練,但可能缺乏深入的知識,無法針對高度專業或技術性主題提供準確詳細的回覆,導致資訊不夠深入或有誤。
在 Google Cloud 控制台中使用 Gemini 窗格時,Gemini 不會瞭解您的特定環境,因此無法回答「我上次建立 VM 是什麼時候?」等問題。
在某些情況下,Gemini 產品會 Google Cloud 將特定情境片段傳送給模型,以取得情境專屬的回覆,例如在 Error Reporting 服務頁面中點選「疑難排解建議」按鈕時。
Gemini 安全與有害內容篩選
系統會根據各個用途,比對 Gemini 產品 (例如 Gemini Code Assist) 的提示和回覆與完整安全屬性清單。 Google Cloud這些安全屬性旨在過濾違反《使用限制政策》的內容。如果系統判定輸出內容有害,就會封鎖回覆。
後續步驟
- 進一步瞭解 Gemini 在協助您生成程式碼時如何引用來源。