Cloud Run vous permet d'associer des GPU pour déployer des modèles ouverts et diffuser l'inférence d'IA. Vous pouvez entraîner, affiner et exécuter des modèles avec des performances accélérées.
Si vous n'êtes pas familier avec les concepts d'IA, consultez GPU pour l'IA. Pour en savoir plus sur les options de configuration, consultez la section sur la compatibilité des GPU avec les services, les jobs et les pools de nœuds de calcul.
Tutoriels pour les services
- Exécuter Gemma sur Cloud Run
- Exécuter l'inférence LLM sur les GPU Cloud Run avec Gemma et Ollama
- Exécuter OpenCV sur Cloud Run avec l'accélération du GPU
- Exécuter l'inférence LLM sur les GPU Cloud Run avec Hugging Face Transformers.js
Tutoriels pour les jobs
- Ajuster précisément les LLM à l'aide de GPU avec les jobs Cloud Run
- Exécuter une inférence par lot à l'aide de GPU sur des jobs Cloud Run
- Transcodage vidéo accéléré par GPU avec FFmpeg sur les jobs Cloud Run