Method: projects.locations.collections.dataStores.trainCustomModel

מאמן מודל בהתאמה אישית.

בקשת HTTP

POST https://discoveryengine.googleapis.com/v1/{dataStore=projects/*/locations/*/collections/*/dataStores/*}:trainCustomModel

כתובת ה-URL כתובה בתחביר של gRPC Transcoding.

פרמטרים של נתיב

פרמטרים
dataStore

string

חובה. שם המשאב של מאגר הנתונים, למשל projects/*/locations/global/collections/default_collection/dataStores/default_data_store. השדה הזה משמש לזיהוי מאגר הנתונים שבו יאומנו המודלים.

גוף הבקשה

גוף הבקשה מכיל נתונים במבנה הבא:

ייצוג JSON
{
  "modelType": string,
  "errorConfig": {
    object (ImportErrorConfig)
  },
  "modelId": string,

  // The following is a list of mutually exclusive fields. At most one of the
  // fields will be set in a response:
  "gcsTrainingInput": {
    object (GcsTrainingInput)
  }
  // End of mutually exclusive fields.
}
שדות
modelType

string

המודל שאותו רוצים לאמן. הערכים הנתמכים הם:

  • search-tuning (התאמת החיפוש): התאמה מדויקת של מערכת החיפוש על סמך הנתונים שסופקו.
errorConfig

object (ImportErrorConfig)

המיקום הרצוי של השגיאות שמתרחשות במהלך הטמעת הנתונים והאימון.

modelId

string

אם לא מספקים מזהה ייחודי אוניברסלי (UUID), המערכת יוצרת אותו.

הקלט של אימון המודל. בהמשך מפורטת רשימה של שדות שאי אפשר להשתמש בהם בו-זמנית. רק אחד מהשדות הבאים יוגדר בתשובה:
gcsTrainingInput

object (GcsTrainingInput)

קלט להדרכה ב-Cloud Storage.

סוף השדות הבלעדיים.

גוף התשובה

אם הפעולה בוצעה ללא שגיאות, גוף התגובה יכיל מופע של Operation.

היקפי הרשאות

נדרש אחד מהיקפי ההרשאות הבאים של OAuth:

  • https://www.googleapis.com/auth/cloud-platform
  • https://www.googleapis.com/auth/discoveryengine.readwrite
  • https://www.googleapis.com/auth/discoveryengine.serving.readwrite

ניתן למצוא מידע נוסף כאן: Authentication Overview.

הרשאות IAM

נדרשת הרשאת IAM הבאה במשאב dataStore:

  • discoveryengine.dataStores.trainCustomModel

מידע נוסף מופיע במאמרי העזרה בנושא IAM.

GcsTrainingInput

קלט נתוני אימון של Cloud Storage.

ייצוג JSON
{
  "corpusDataPath": string,
  "queryDataPath": string,
  "trainDataPath": string,
  "testDataPath": string
}
שדות
corpusDataPath

string

נתוני קורפוס אחסון הענן אשר עשויים להיות משויכים לנתוני הרכבה. הפורמט של נתיב הנתונים הוא gs://<bucket_to_data>/<jsonl_file_name>. קובץ jsonl/ndjson מופרד בשורות חדשות.

עבור מודל כוונון חיפוש, כל שורה צריכה לכלול את המזהה, הכותרת והטקסט. לדוגמה: {"Id": "doc1", title: "relevant doc", "text": "relevant text"}

queryDataPath

string

נתוני שאילתת gcs אשר עשויים להיות משויכים לנתוני רכבת. הפורמט של נתיב הנתונים הוא gs://<bucket_to_data>/<jsonl_file_name>. קובץ jsonl/ndjson מופרד בשורות חדשות.

במודל להתאמת החיפוש, כל שורה צריכה לכלול את המזהה והטקסט. דוגמה: {"Id": "query1", "text": "example query"}

trainDataPath

string

נתיב נתוני האימון ב-Cloud Storage, שהפורמט שלו צריך להיות gs://<bucket_to_data>/<tsv_file_name>. הקובץ צריך להיות בפורמט TSV. כל שורה צריכה לכלול את docId,‏ queryId וציון (מספר).

במודל להתאמת החיפוש, הכותרת של קובץ ה-TSV צריכה להיות query-id corpus-id score. הניקוד צריך להיות מספר בטווח [0, inf+). ככל שהמספר גדול יותר, כך הצמד רלוונטי יותר. דוגמה:

  • query-id\tcorpus-id\tscore
  • query1\tdoc1\t1
testDataPath

string

נתוני בדיקה של Cloud Storage. אותו פורמט כמו trainDataPath. אם לא תציינו את הנתיב, המערכת תבצע חלוקה אקראית של trainDataPath ל-80% נתונים לאימון ו-20% נתונים לבדיקה.