準備 Translation LLM 模型的訓練資料
本文說明如何為 Translation LLM 模型定義監督式微調資料集。您可以調整文字資料類型。
關於監督式微調資料集
監督式微調資料集可用於微調預先訓練模型,使其適用於特定領域。輸入資料應與模型在實際應用環境中遇到的資料類似。輸出標籤應代表每個輸入內容的正確答案或結果。
訓練資料集
如要調整模型,請提供訓練資料集。為獲得最佳結果,建議您先提供 100 個樣本。如有需要,您可以擴充至數千個範例。資料集的品質遠比數量重要。
限制:
- 每個範例的輸入和輸出符記數量上限:1,000
- 訓練資料集檔案大小上限:JSONL 格式為 1 GB。
驗證資料集
強烈建議您提供驗證資料集。驗證資料集可協助您評估微調作業的成效。
限制:
- 每個範例的輸入和輸出符記數量上限:1,000
- 驗證資料集中的範例數量上限:1024
- 驗證資料集檔案大小上限:JSONL 格式為 1 GB。
資料集格式
模型調整資料集必須採用 JSON Lines (JSONL) 格式,其中每一行都包含一個調整範例。
微調模型前,請務必將資料集上傳至 Cloud Storage 值區。請務必上傳至 us-central1。
「translation-llm-002」的資料集範例
{
"contents": [
{
"role": "user",
"parts": [
{
"text": "English: Hello. Spanish:",
}
]
},
{
"role": "model",
"parts": [
{
"text": "Hola.",
}
]
}
]
}
目錄
包含郵件多部分內容的基本結構化資料類型。這個類別包含兩個主要屬性:role 和 parts。role 屬性代表內容的製作人,而 parts 屬性包含多個元素,每個元素代表訊息中的資料區隔。
| 參數 | |
|---|---|
|
選填: 建立訊息的實體身分。支援的值如下:
|
|
組成單一郵件的排序部分清單。 如要瞭解輸入內容的限制 (例如詞元或圖片數量上限),請參閱「Google 模型」頁面的模型規格。 如要計算要求中的權杖數量,請參閱「取得權杖數量」。 |
零件
包含媒體的資料類型,是多部分 Content 訊息的一部分。
| 參數 | |
|---|---|
|
選填: 文字提示或程式碼片段。 |
將微調資料集上傳至 Cloud Storage
如要執行微調工作,請將一或多個資料集上傳至 Cloud Storage bucket。您可以建立新的 Cloud Storage bucket,也可以使用現有 bucket 儲存資料集檔案。bucket 的所在區域不重要,但建議使用與您打算微調模型的Google Cloud 專案相同的值區。
值區準備就緒後,請將資料集檔案上傳至值區。
準備資料的筆記本範例
以下提供一些 Colab 筆記本範例,協助您快速上手。
AutoML Translation 資料集
如果您已將 Translation 資料集上傳至 AutoML Translation,可以按照 Colab 範例匯出資料集,用於調整 TLLM。
![]() 在 Colab 中執行 |
![]() 在 Colab Enterprise 中執行 |
![]() 在 GitHub 上查看 |
本機資料集
如果資料是以 TSV、CSV 或 TMX 格式儲存在本機,可以上傳至 Colab 進行 TLLM 微調。
![]() 在 Colab 中執行 |
![]() 在 Colab Enterprise 中執行 |
![]() 在 GitHub 上查看 |
後續步驟
- 執行監督式微調工作。


