Method: projects.locations.collections.dataStores.trainCustomModel

מאמן מודל בהתאמה אישית.

בקשת HTTP

POST https://discoveryengine.googleapis.com/v1beta/{dataStore=projects/*/locations/*/collections/*/dataStores/*}:trainCustomModel

כתובת ה-URL כתובה בתחביר של gRPC Transcoding.

פרמטרים של נתיב

פרמטרים
dataStore

string

חובה. שם המשאב של מאגר הנתונים, למשל projects/*/locations/global/collections/default_collection/dataStores/default_data_store. השדה הזה משמש לזיהוי מאגר הנתונים שבו יאומנו המודלים.

גוף הבקשה

גוף הבקשה מכיל נתונים במבנה הבא:

ייצוג JSON
{
  "modelType": string,
  "errorConfig": {
    object (ImportErrorConfig)
  },
  "modelId": string,

  // The following is a list of mutually exclusive fields. At most one of the
  // fields will be set in a response:
  "gcsTrainingInput": {
    object (GcsTrainingInput)
  }
  // End of mutually exclusive fields.
}
שדות
modelType

string

המודל שאותו רוצים לאמן. הערכים הנתמכים הם:

  • search-tuning (התאמת החיפוש): התאמה מדויקת של מערכת החיפוש על סמך הנתונים שסופקו.
errorConfig

object (ImportErrorConfig)

המיקום הרצוי של השגיאות שמתרחשות במהלך הטמעת הנתונים והאימון.

modelId

string

אם לא מספקים מזהה ייחודי אוניברסלי (UUID), המערכת יוצרת אותו.

הקלט של אימון המודל. בהמשך מפורטת רשימה של שדות שאי אפשר להשתמש בהם בו-זמנית. רק אחד מהשדות הבאים יוגדר בתשובה:
gcsTrainingInput

object (GcsTrainingInput)

קלט להדרכה ב-Cloud Storage.

סוף השדות הבלעדיים.

גוף התשובה

אם הפעולה בוצעה ללא שגיאות, גוף התגובה יכיל מופע של Operation.

היקפי הרשאות

נדרש אחד מהיקפי ההרשאות הבאים של OAuth:

  • https://www.googleapis.com/auth/cloud-platform
  • https://www.googleapis.com/auth/discoveryengine.readwrite
  • https://www.googleapis.com/auth/discoveryengine.serving.readwrite

ניתן למצוא מידע נוסף כאן: Authentication Overview.

הרשאות IAM

נדרשת הרשאת IAM הבאה במשאב dataStore:

  • discoveryengine.dataStores.trainCustomModel

מידע נוסף מופיע במאמרי העזרה בנושא IAM.

GcsTrainingInput

קלט נתוני אימון של Cloud Storage.

ייצוג JSON
{
  "corpusDataPath": string,
  "queryDataPath": string,
  "trainDataPath": string,
  "testDataPath": string
}
שדות
corpusDataPath

string

נתוני הקורפוס של Cloud Storage שאפשר לשייך לנתוני האימון. הפורמט של נתיב הנתונים הוא gs://<bucket_to_data>/<jsonl_file_name>. קובץ JSONL או NDJSON שמופרד בתו שורה חדשה.

במודל לשיפור החיפוש, כל שורה צריכה לכלול את המזהה, הכותרת והטקסט. לדוגמה: {"Id": "doc1", title: "relevant doc", "text": "relevant text"}

queryDataPath

string

נתוני השאילתות ב-GCS שאפשר לשייך לנתוני האימון. הפורמט של נתיב הנתונים הוא gs://<bucket_to_data>/<jsonl_file_name>. קובץ JSONL או NDJSON שמופרד בתו שורה חדשה.

במודל להתאמת החיפוש, כל שורה צריכה לכלול את המזהה והטקסט. דוגמה: {"Id": "query1", "text": "example query"}

trainDataPath

string

נתיב נתוני האימון ב-Cloud Storage, שהפורמט שלו צריך להיות gs://<bucket_to_data>/<tsv_file_name>. הקובץ צריך להיות בפורמט TSV. כל שורה צריכה לכלול את docId,‏ queryId וציון (מספר).

במודל להתאמת החיפוש, הכותרת של קובץ ה-TSV צריכה להיות query-id corpus-id score. הניקוד צריך להיות מספר בטווח [0, inf+). ככל שהמספר גדול יותר, כך הצמד רלוונטי יותר. דוגמה:

  • query-id\tcorpus-id\tscore
  • query1\tdoc1\t1
testDataPath

string

נתוני בדיקה של Cloud Storage. אותו פורמט כמו trainDataPath. אם לא תציינו את הנתיב, המערכת תבצע חלוקה אקראית של trainDataPath ל-80% נתונים לאימון ו-20% נתונים לבדיקה.