פריסת מודלים עם משקלים מותאמים אישית

פריסת מודלים עם משקלים מותאמים אישית היא תכונה בגרסת טרום-השקה. אתם יכולים לבצע כוונון עדין של מודלים על סמך קבוצה מוגדרת מראש של מודלים בסיסיים, ולפרוס את המודלים המותאמים אישית שלכם ב-Gemini Enterprise Agent Platform Model Garden. אתם יכולים לפרוס את המודלים המותאמים אישית שלכם באמצעות ייבוא משקלים מותאמים אישית. לשם כך, צריך להעלות את ארטיפקטים של המודל לקטגוריה של Cloud Storage בפרויקט שלכם. הפעולה הזו מתבצעת בלחיצה אחת ב-Agent Platform.

יש תמיכה ב-VPC Service Controls למשקלים מותאמים אישית.

מודלים נתמכים

הגרסה הפתוחה לכולם של פריסת מודלים עם משקלים מותאמים אישית נתמכת על ידי המודלים הבסיסיים הבאים:

שם המודל גרסה
Llama
  • Llama-2: 7B, 13B
  • Llama-3.1: 8B, 70B
  • ‫Llama-3.2: 1B, 3B
  • Llama-4: Scout-17B, Maverick-17B
  • CodeLlama-13B
‏Gemma
  • ‫Gemma-2: 9B, 27B
  • ‫Gemma-3: 1B, 4B, 3-12B, 27B
  • ‫Gemma-4: 26B-A4B-it, 31B-it, E2B-it, E4B-it
  • Medgemma: 4B, 27B-text
Qwen
  • Qwen2: 1.5B
  • Qwen2.5: 0.5B, 1.5B, 7B, 32B
  • ‫Qwen3: ‏ 0.6B, ‏ 1.7B, ‏ 4B, ‏ 8B, ‏ 32B, ‏ Qwen3-Coder-480B-A35B-Instruct, ‏ Qwen3-Next-80B-A3B-Instruct, ‏ Qwen3-Next-80B-A3B-Thinking, ‏ Qwen3-VL-8B-Instruct
  • Qwen3.5: 9B
  • Qwen3.6: 27B, 35B A3B
Deepseek
  • Deepseek-R1
  • Deepseek-V3
  • DeepSeek-V3.1
‫Mistral ו-Mixtral
  • Mistral-7B-v0.1
  • Mixtral-8x7B-v0.1
  • Mistral-Nemo-Base-2407
Phi-4
  • Phi-4-reasoning
OpenAI OSS
  • ‫gpt-oss: 20B, 120B

מגבלות

משקלים מותאמים אישית לא תומכים בייבוא של מודלים שעברו קוונטיזציה.

קבצים של מודלים

צריך לספק את קובצי המודל בפורמט המשקלים של Hugging Face. מידע נוסף על פורמט המשקלים של Hugging Face זמין במאמר שימוש במודלים של Hugging Face.

אם לא מספקים את הקבצים הנדרשים, יכול להיות שפריסת המודל תיכשל.

בטבלה הזו מפורטים סוגי קבצי המודלים, שמשתנים בהתאם לארכיטקטורה של המודל:

תוכן קובץ המודל סוג קובץ
הגדרת המודל
  • config.json
משקלים של מודלים
  • *.safetensors
  • *.bin
אינדקס משקלים
  • *.index.json
קובצי טוקנייזר
  • tokenizer.model
  • tokenizer.json
  • tokenizer_config.json

מיקומים

אפשר לפרוס מודלים בהתאמה אישית בכל האזורים משירותי Model Garden.

דרישות מוקדמות

בקטע הזה מוסבר איך פורסים מודל בהתאמה אישית.

לפני שמתחילים

  1. נכנסים לחשבון Google Cloud . אם אתם משתמשים חדשים ב- Google Cloud, צרו חשבון כדי שתוכלו להעריך את הביצועים של המוצרים שלנו בתרחישים מהעולם האמיתי. לקוחות חדשים מקבלים בחינם גם קרדיט בשווי 300$ להרצה, לבדיקה ולפריסה של עומסי העבודה.
  2. In the Google Cloud console, on the project selector page, select or create a Google Cloud project.

    Roles required to select or create a project

    • Select a project: Selecting a project doesn't require a specific IAM role—you can select any project that you've been granted a role on.
    • Create a project: To create a project, you need the Project Creator role (roles/resourcemanager.projectCreator), which contains the resourcemanager.projects.create permission. Learn how to grant roles.

    Go to project selector

  3. Verify that billing is enabled for your Google Cloud project.

  4. Enable the Agent Platform API.

    Roles required to enable APIs

    To enable APIs, you need the serviceusage.services.enable permission. If you created the project, then you likely already have this permission through the Owner role (roles/owner). Otherwise, you can get this permission through the Service Usage Admin role (roles/serviceusage.serviceUsageAdmin). Learn how to grant roles.

    Enable the API

  5. In the Google Cloud console, on the project selector page, select or create a Google Cloud project.

    Roles required to select or create a project

    • Select a project: Selecting a project doesn't require a specific IAM role—you can select any project that you've been granted a role on.
    • Create a project: To create a project, you need the Project Creator role (roles/resourcemanager.projectCreator), which contains the resourcemanager.projects.create permission. Learn how to grant roles.

    Go to project selector

  6. Verify that billing is enabled for your Google Cloud project.

  7. Enable the Agent Platform API.

    Roles required to enable APIs

    To enable APIs, you need the serviceusage.services.enable permission. If you created the project, then you likely already have this permission through the Owner role (roles/owner). Otherwise, you can get this permission through the Service Usage Admin role (roles/serviceusage.serviceUsageAdmin). Learn how to grant roles.

    Enable the API

  8. במסוף Google Cloud , מפעילים את Cloud Shell.

    הפעלת Cloud Shell

    בחלק התחתון של Google Cloud המסוף יתחיל סשן של Cloud Shell ותופיע הודעה של שורת הפקודה. Cloud Shell היא סביבת מעטפת שבה ה-CLI של Google Cloud מותקן ומוגדרים ערכים לפרויקט הקיים. הסשן יופעל תוך כמה שניות.

במדריך הזה מניחים שאתם משתמשים ב-Cloud Shell כדי ליצור אינטראקציה עם Google Cloud. אם אתם רוצים להשתמש במעטפת אחרת במקום ב-Cloud Shell, אתם צריכים לבצע את ההגדרה הנוספת הבאה:

  1. התקינו את ה-CLI של Google Cloud.

  2. אם אתם משתמשים בספק זהויות חיצוני (IdP), קודם אתם צריכים להיכנס ל-CLI של gcloud באמצעות המאגר המאוחד לניהול זהויות.

  3. כדי לאתחל את ה-CLI של gcloud, הריצו את הפקודה הבאה:

    gcloud init

פריסת המודל בהתאמה אישית

בקטע הזה מוסבר איך פורסים מודל בהתאמה אישית.

אם אתם משתמשים בממשק שורת הפקודה (CLI), ב-Python או ב-JavaScript, צריך להחליף את המשתנים הבאים בערך כדי שדוגמאות הקוד יפעלו:

  • REGION: האזור שלכם. לדוגמה, uscentral1.
  • MODEL_GCS: המודל של Google Cloud . לדוגמה, gs://custom-weights-fishfooding/meta-llama/Llama-3.2-1B-Instruct.
  • PROJECT_ID: מזהה הפרויקט.
  • MODEL_ID: מזהה המודל.
  • MACHINE_TYPE: סוג המכונה. לדוגמה: g2-standard-12.
  • ACCELERATOR_TYPE: סוג המאיץ. לדוגמה: NVIDIA_L4.
  • ACCELERATOR_COUNT: מספר המאיצים.
  • PROMPT: הפרומפט הטקסטואלי.

המסוף

בשלבים הבאים מוסבר איך להשתמש במסוף Google Cloud כדי לפרוס את המודל עם משקלים בהתאמה אישית.

  1. נכנסים לדף Model Garden במסוף Google Cloud .

    כניסה ל-Model Garden

  2. לוחצים על פריסת המודל עם משקלים מותאמים אישית. מופיעה החלונית Deploy a model with custom weights.

  3. בקטע Model source (מקור המודל), מבצעים את הפעולות הבאות:

    1. לוחצים על עיון, בוחרים את הקטגוריה שבה המודל מאוחסן ולוחצים על בחירה.

    2. אופציונלי: מזינים את שם המודל בשדה שם המודל.

  4. בקטע Deployment settings (הגדרות פריסה):

    1. בשדה אזור בוחרים את האזור ולוחצים על אישור.

    2. בשדה Machine Spec, בוחרים את מפרט המכונה שמשמש לפריסת המודל.

    3. אופציונלי: בשדה Endpoint name (שם נקודת הקצה), נקודת הקצה של המודל מופיעה כברירת מחדל. עם זאת, אפשר להזין שם אחר של נקודת קצה בשדה.

    4. אם בפרויקט שלכם נאכף VPC-SC או אם אתם מעדיפים גישה פרטית, צריך לבחור באפשרות פרטי (Private Service Connect) בשדה גישה לנקודת קצה. אחרת, בוחרים באפשרות ציבורי.

    5. אם אתם משתמשים ב-Private Service Connect, צריך להזין את מזהי הפרויקטים בשדה Project IDs. אלה הפרויקטים שבהם מופעלים לקוחות השאילתות. לחלופין, אפשר ללחוץ על Select project IDs כדי להציג תיבת דו-שיח עם מזהי הפרויקטים.

      אם לוחצים על Select project IDs (בחירת מזהי פרויקטים), מבצעים את הפעולות הבאות:

      1. מוצאים את הפרויקט שמכיל את הקוד שמנסה לגשת למודל.
      2. לוחצים על תיבת הסימון של הפרויקט.
      3. לוחצים על בחירה.
  5. לוחצים על פריסה.

‫CLI של gcloud

הפקודה הזו מדגימה איך לפרוס את המודל לאזור ספציפי.

gcloud ai model-garden models deploy --model=${MODEL_GCS} --region ${REGION}

בדוגמה הבאה מוצגת פקודה להטמעת המודל באזור ספציפי עם סוג המכונה, סוג המאיץ ומספר המאיצים. אם רוצים לבחור הגדרה ספציפית של מכונה, צריך להגדיר את כל שלושת השדות.

gcloud ai model-garden models deploy --model=${MODEL_GCS} --machine-type=${MACHINE_TYE} --accelerator-type=${ACCELERATOR_TYPE} --accelerator-count=${ACCELERATOR_COUNT} --region ${REGION}

Python

import vertexai
from google.cloud import aiplatform
from vertexai.preview import model_garden

vertexai.init(project=${PROJECT_ID}, location=${REGION})
custom_model = model_garden.CustomModel(
  gcs_uri=GCS_URI,
)
endpoint = custom_model.deploy(
  machine_type="${MACHINE_TYPE}",
  accelerator_type="${ACCELERATOR_TYPE}",
  accelerator_count="${ACCELERATOR_COUNT}",
  model_display_name="custom-model",
  endpoint_display_name="custom-model-endpoint")

endpoint.predict(instances=[{"prompt": "${PROMPT}"}], use_dedicated_endpoint=True)

לחלופין, לא צריך להעביר פרמטר לשיטה custom_model.deploy().

import vertexai
from google.cloud import aiplatform
from vertexai.preview import model_garden

vertexai.init(project=${PROJECT_ID}, location=${REGION})
custom_model = model_garden.CustomModel(
  gcs_uri=GCS_URI,
)
endpoint = custom_model.deploy()

endpoint.predict(instances=[{"prompt": "${PROMPT}"}], use_dedicated_endpoint=True)

curl


curl -X POST \
  -H "Authorization: Bearer $(gcloud auth print-access-token)" \
  -H "Content-Type: application/json" \
  "https://${REGION}-aiplatform.googleapis.com/v1beta1/projects/${PROJECT_ID}/locations/${REGION}:deploy" \
  -d '{
    "custom_model": {
    "gcs_uri": "'"${MODEL_GCS}"'"
  },
  "destination": "projects/'"${PROJECT_ID}"'/locations/'"${REGION}"'",
  "model_config": {
     "model_user_id": "'"${MODEL_ID}"'",
  },
}'

אפשרות אחרת היא להשתמש ב-API כדי להגדיר במפורש את סוג המכונה.


curl -X POST \
  -H "Authorization: Bearer $(gcloud auth print-access-token)" \
  -H "Content-Type: application/json" \
  "https://${REGION}-aiplatform.googleapis.com/v1beta1/projects/${PROJECT_ID}/locations/${REGION}:deploy" \
  -d '{
    "custom_model": {
    "gcs_uri": "'"${MODEL_GCS}"'"
  },
  "destination": "projects/'"${PROJECT_ID}"'/locations/'"${REGION}"'",
  "model_config": {
     "model_user_id": "'"${MODEL_ID}"'",
  },
  "deploy_config": {
    "dedicated_resources": {
      "machine_spec": {
        "machine_type": "'"${MACHINE_TYPE}"'",
        "accelerator_type": "'"${ACCELERATOR_TYPE}"'",
        "accelerator_count": '"${ACCELERATOR_COUNT}"'
      },
      "min_replica_count": 1
    }
  }
}'

פריסה באמצעות ה-API

התכונה VPC Service Controls פועלת רק עם נקודת הקצה הפרטית הייעודית. לכן, צריך להגדיר את private_service_connect_config בדוגמת הקוד הבאה, שמראה איך פורסים באמצעות ה-API:

curl

  curl -X POST \
    -H "Authorization: Bearer $(gcloud auth print-access-token)" \
    -H "Content-Type: application/json" \
    "https://us-central1-aiplatform.googleapis.com/v1beta1/projects/YOUR_PROJECT/locations/us-central1:deploy" \
    -d '{
      "custom_model": {
        "model_id": "test-mg-deploy-092301",
        "gcs_uri": "gs://YOUR_GCS_BUCKET"
      },
      "destination": "projects/YOUR_PROJECT/locations/us-central1",
      "endpoint_config": {
        "endpoint_display_name": "psc-ep1",
        "private_service_connect_config": {
          "enablePrivateServiceConnect": true,
          "projectAllowlist": ["YOUR_PROJECT"]
        }
      },
      "deploy_config": {
        "dedicated_resources": {
          "machine_spec": {
            "machine_type": "g2-standard-24",
            "accelerator_type": "NVIDIA_L4",
            "accelerator_count": 2
          },
          "min_replica_count": 1,
          "max_replica_count": 1
        }
      }
    }'

קבלת מזהה נקודת הקצה ומזהה המודל באמצעות Google Cloud המסוף

אחרי שהפריסה מסתיימת, מבצעים את השלבים הבאים:

  1. נכנסים לדף Model Garden במסוף Google Cloud .

    כניסה ל-Model Garden

  2. לוחצים על View my endpoints & models (הצגת נקודות הקצה והמודלים שלי).

  3. בטבלה My endpoints, בודקים את נקודת הקצה שפרסתם זה עתה מהעמודה Name. יוצג הדף Details.

  4. לוחצים על המודל בטבלה Deployed models (מודלים שהופעלו).

  5. בוחרים בדף פרטי הגרסה. מזהה המודל מוצג בשורה Environment variables בטבלה.

הגדרת Private Service Connect

אתם מוסיפים נקודת קצה (endpoint) חדשה כדי לגשת אל Google ממשקי API. אפשר להשתמש בנקודת הקצה הזו בכל האזורים ברשת ה-VPC שבוחרים. כדאי גם לשים לב לנקודות הבאות:

  • לקוחות ברשתות שמחוברות לרשת ה-VPC של נקודת הקצה באמצעות קישוריות היברידית יכולים לגשת לנקודת הקצה. מידע נוסף זמין במאמר גישה לממשקי API דרך נקודות קצה.Google
  • ללקוחות ברשתות VPC מקושרות אין גישה לנקודת הקצה.

רשימת נקודות קצה כדי לקבל את הקישור לשירות

דוגמת קוד זו מדגימה איך להציג נקודת קצה כדי לקבל קובץ מצורף של שירות.

curl

$ curl \
  -H "Authorization: Bearer $(gcloud auth print-access-token)" \
  -H "Content-Type: application/json" \
  "https://us-central1-aiplatform.googleapis.com/v1beta1/projects/YOUR_PROJECT/locations/us-central1/endpoints/YOUR_ENDPOINT_ID"

זו התגובה של נקודת הקצה של הרשימה.

  {
  "name": "projects/440968033208/locations/us-central1/endpoints/mg-endpoint-2c6ae2be-1491-43fe-b179-cb5a63e2c955",
  "displayName": "psc-ep1",
  "deployedModels": [
    {
      "id": "4026753529031950336",
      "model": "projects/440968033208/locations/us-central1/models/mg-custom-1758645924",
      "displayName": "null-null-null-1758645933",
      "createTime": "2025-09-23T16:45:45.169195Z",
      "dedicatedResources": {
        "machineSpec": {
          "machineType": "g2-standard-24",
          "acceleratorType": "NVIDIA_L4",
          "acceleratorCount": 2
        },
        "minReplicaCount": 1,
        "maxReplicaCount": 1
      },
      "enableContainerLogging": true,
      "privateEndpoints": {
        "serviceAttachment": "projects/qdb392d34e2a11149p-tp/regions/us-central1/serviceAttachments/gkedpm-fbbc4061323c91c14ab4d961a2f8b0"
      },
      "modelVersionId": "1",
      "status": {
        "lastUpdateTime": "2025-09-23T17:26:10.031652Z",
        "availableReplicaCount": 1
      }
    }
  ],
  "trafficSplit": {
    "4026753529031950336": 100
  },
  "etag": "AMEw9yPIWQYdbpHu6g6Mhpu1_10J062_oR9Jw9txrp8dFFbel7odLgSK8CGIogAUkR_r",
  "createTime": "2025-09-23T16:45:45.169195Z",
  "updateTime": "2025-09-23T17:13:36.320873Z",
  "privateServiceConnectConfig": {
    "enablePrivateServiceConnect": true,
    "projectAllowlist": [
      "ucaip-vpc-s-1605069239-dut-24"
    ]
  }
}

יצירת Private Service Connect

כדי ליצור Private Service Connect ‏ (PSC), פועלים לפי השלבים הבאים:

  1. נכנסים לדף Private Service Connect במסוף Google Cloud . יוצג הדף Connected endpoints.

    כניסה אל Private Service Connect

  2. לוחצים על + Connect endpoint. יופיע הדף Connect endpoint.

  3. בוחרים אפשרות בשדה יעד. אפשר לבחור Google APIs כדי לקבל גישה לרוב ממשקי ה-API והשירותים, או Published service כדי לקבל גישה לשירות שפורסם. Google

  4. בקטע פרטי היעד, בוחרים ערך מהרשימה היקף וערך מהרשימה סוג החבילה.

  5. בקטע Endpoint details (פרטי נקודת הקצה), מבצעים את הפעולות הבאות:

    1. נותנים לה שם בשדה Endpoint name.
    2. בוחרים ערך מהרשימה רשת. בוחרים רשת VPC שנמצאת בפרויקט. אם אתם חייבים ליצור נקודת קצה של PSC בפרויקט שירות שמשתמש ברשת VPC משותפת בפרויקט מארח, אתם יכולים להשתמש ב-Google Cloud CLI או לשלוח בקשת API.
    3. בוחרים ערך מהרשימה כתובת IP.
  6. מרחיבים את הקטע Service directory.

  7. בוחרים אזור מהרשימה אזור.

  8. בוחרים מרחב שמות מהרשימה Namespace (מרחב שמות).

  9. לוחצים על הוספת נקודת קצה. הטבלה Endpoints מתעדכנת בשורה של נקודת הקצה החדשה.

יצירת שאילתה

בקטע הזה מוסבר איך ליצור נקודת קצה ציבורית ונקודת קצה פרטית.

ביצוע שאילתה לנקודת קצה ציבורית

אחרי פריסת המודל, משקלים מותאמים אישית תומכים בנקודת הקצה הציבורית הייעודית. אפשר לשלוח שאילתות באמצעות ה-API או ה-SDK.

לפני ששולחים שאילתות, צריך לקבל את כתובת ה-URL של נקודת הקצה, את מזהה נקודת הקצה ואת מזהה המודל. הפרטים האלה זמינים במסוף Google Cloud .

כדי לקבל את המידע, פועלים לפי השלבים הבאים:

  1. נכנסים לדף Model Garden במסוף Google Cloud .

    Model Garden

  2. לוחצים על View my endpoints & models (הצגת נקודות הקצה והמודלים שלי).

  3. בוחרים את האזור מהרשימה אזור.

  4. כדי לקבל את מזהה נקודת הקצה ואת כתובת ה-URL של נקודת הקצה, לוחצים על נקודת הקצה בקטע My endpoints.

    מזהה נקודת הקצה מופיע בשדה Endpoint ID.

    כתובת ה-URL של נקודת הקצה הציבורית מוצגת בשדה Dedicated endpoint (נקודת קצה ייעודית).

  5. כדי למצוא את מזהה המודל, מאתרים את המודל שלכם ברשימה בקטע מודלים שפרסנו ופועלים לפי השלבים הבאים:

    1. לוחצים על שם המודל שהופעל בשדה Model (מודל).
    2. לוחצים על פרטי הגרסה. מזהה המודל מוצג בשדה Model ID.

אחרי שמקבלים את נקודת הקצה ואת פרטי המודל שפרסתם, אפשר לעיין בדוגמאות הקוד הבאות כדי ללמוד איך לשלוח בקשת הסקה, או לעיין במאמר שליחת בקשת הסקה אונליין לנקודת קצה ציבורית ייעודית.

API

בדוגמאות הקוד הבאות מוצגות דרכים שונות לשימוש ב-API בהתאם לתרחיש השימוש.

השלמת צ'אט (unary)

בדוגמה הזו, בקשה לשליחת הודעת צ'אט מלאה למודל וקבלת תשובה בחלק אחד אחרי יצירת התשובה כולה. זה דומה לשליחת הודעת טקסט ולקבלת תשובה מלאה אחת.

  curl -X POST \
    -H "Authorization: Bearer $(gcloud auth print-access-token)" \
    -H "Content-Type: application/json" \
    "https://${ENDPOINT_URL}/v1beta1/projects/${PROJECT_ID}/locations/${LOCATION}/endpoints/${ENDPOINT_ID}/chat/completions" \
    -d '{
    "model": "'"${MODEL_ID}"'",
    "temperature": 0,
    "top_p": 1,
    "max_tokens": 154,
    "ignore_eos": true,
    "messages": [
      {
        "role": "user",
        "content": "How to tell the time by looking at the sky?"
      }
    ]
  }'

השלמת צ'אט (סטרימינג)

הבקשה הזו היא גרסת הסטרימינג של בקשת השלמת הצ'אט האונרית. אם מוסיפים את "stream": true לבקשה, המודל שולח את התשובה שלו חלק אחרי חלק בזמן שהיא נוצרת. התכונה הזו שימושית ליצירת אפקט של מכונת כתיבה בזמן אמת באפליקציית צ'אט.

  curl -X POST \
    -H "Authorization: Bearer $(gcloud auth print-access-token)" \
    -H "Content-Type: application/json" \  "https://${ENDPOINT_URL}/v1beta1/projects/${PROJECT_ID}/locations/${LOCATION}/endpoints/${ENDPOINT_ID}/chat/completions" \
    -d '{
    "model": "'"${MODEL_ID}"'",
    "stream": true,
    "temperature": 0,
    "top_p": 1,
    "max_tokens": 154,
    "ignore_eos": true,
    "messages": [
      {
        "role": "user",
        "content": "How to tell the time by looking at the sky?"
      }
    ]
  }'

חיזוי

הבקשה הזו שולחת הנחיה ישירה כדי לקבל מסקנה ממודל. השימוש הזה מתאים בדרך כלל למשימות שלא בהכרח כוללות שיחה, כמו סיכום או סיווג של טקסט.

  curl -X POST \
    -H "Authorization: Bearer $(gcloud auth print-access-token)" \
    -H "Content-Type: application/json" \
  "https://${ENDPOINT_URL}/v1beta1/projects/${PROJECT_ID}/locations/${LOCATION}/endpoints/${ENDPOINT_ID}:predict" \
    -d '{
    "instances": [
      {
        "prompt": "How to tell the time by looking at the sky?",
        "temperature": 0,
        "top_p": 1,
        "max_tokens": 154,
        "ignore_eos": true
      }
    ]
  }'

Raw predict

הבקשה הזו היא גרסת סטרימינג של הבקשה Predict. באמצעות נקודת הקצה :streamRawPredict והכללת "stream": true, הבקשה הזו שולחת הנחיה ישירה ומקבלת את הפלט של המודל כזרם רציף של נתונים בזמן שהוא נוצר, בדומה לבקשה להשלמת צ'אט בסטרימינג.

  curl -X POST \
    -N \
    --output - \
    -H "Authorization: Bearer $(gcloud auth print-access-token)" \
    -H "Content-Type: application/json" \
    "https://${ENDPOINT_URL}/v1beta1/projects/${PROJECT_ID}/locations/${LOCATION}/endpoints/${ENDPOINT_ID}:streamRawPredict" \
    -d '{
    "instances": [
      {
        "prompt": "How to tell the time by looking at the sky?",
        "temperature": 0,
        "top_p": 1,
        "max_tokens": 154,
        "ignore_eos": true,
        "stream": true
      }
    ]
  }'

SDK

בדוגמת הקוד הזו נעשה שימוש ב-SDK כדי לשלוח שאילתה למודל ולקבל תשובה מהמודל.

  from google.cloud import aiplatform

  project_id = ""
  location = ""
  endpoint_id = "" # Use the short ID here

  aiplatform.init(project=project_id, location=location)

  endpoint = aiplatform.Endpoint(endpoint_id)

  prompt = "How to tell the time by looking at the sky?"
  instances=[{"text": prompt}]
  response = endpoint.predict(instances=instances, use_dedicated_endpoint=True)
  print(response.predictions)

שליחת שאילתה לנקודת קצה פרטית

אפשר לבדוק את השאילתה באמצעות מחברת או מכונה וירטואלית בפרויקט המורשה.

בדוגמה הזו של שאילתה אפשר להחליף את המשתנים בכתובת ה-IP, בפרויקט, במזהה נקודת הקצה ובמזהה המודל (שמתקבל משלב הפריסה שלמעלה)

curl

השלמת צ'אט

curl -X POST -H "Authorization: Bearer $(gcloud auth print-access-token)" -H "Content-Type: application/json" 'https://YOUR_IP/v1beta1/projects/YOUR_PROJECT_ID/locations/YOUR_LOCATION/endpoints/YOUR_ENDPOINT_ID/chat/completions' -d '{ "model": "YOUR_MODEL_ID", "max_tokens": 300, "messages": [{ "role": "user", "content": "how to tell the time by looking at sky?" }]}'

חיזוי

$ curl -k -X POST -H "Authorization: Bearer $(gcloud auth print-access-token)" -H "Content-Type: application/json" 'https:/YOUR_IP/v1beta1/projects/YOUR_PROJECT_ID/locations/YOUR_LOCATION/endpoints/YOUR_ENDPOINT_ID:predict' -d '{
  "instances": [
    {
      "prompt": "Summarize Goog stock performance",
      "temperature": 0,
      "top_p": 1,
      "max_tokens": 154,
      "ignore_eos": true
    }
  ]
}'

דוגמה נוספת לשימוש ב-API מופיעה ב-notebook בנושא ייבוא משקלים בהתאמה אישית.

מידע נוסף על מודלים שמוטמעים באופן עצמאי בפלטפורמת הסוכנים של Gemini Enterprise