Modèle TabFM
Ce document décrit le modèle de régression et de classification tabulaire TabFM intégré à BigQuery.
Le modèle TabFM intégré est une implémentation du modèle TabFM Open Source de Google Research. Le modèle Google Research TabFM est un modèle de fondation pour les données tabulaires qui permet la régression et la classification zero-shot sur les données structurées grâce à l'apprentissage en contexte. Étant donné que le modèle TabFM est pré-entraîné sur des centaines de millions d'ensembles de données synthétiques générés à l'aide de modèles causaux structurels, il capture des interactions complexes entre les caractéristiques et se généralise bien aux tableaux réels invisibles dans de nombreux domaines.
Vous pouvez utiliser le modèle TabFM avec la fonction AI.PREDICT pour effectuer une régression et une classification sur des données structurées en une seule passe directe, sans avoir à entraîner un modèle, à optimiser les hyperparamètres ni à concevoir des caractéristiques.
Les résultats de prédiction sont comparables aux algorithmes classiques supervisés basés sur des arbres, tels que XGBoost et les forêts aléatoires. Si vous souhaitez disposer de plus d'options de réglage de modèle que celles proposées par le modèle TabFM, vous pouvez entraîner un modèle supervisé tel qu'un modèle d'arbre optimisé ou de forêt d'arbres décisionnels, et l'utiliser à la place avec la fonction ML.PREDICT.
Pour générer des prédictions avec le modèle TabFM sur des données tabulaires, utilisez la fonction AI.PREDICT.
Pour évaluer les valeurs prédites du modèle TabFM par rapport aux valeurs réelles, utilisez la fonction AI.EVALUATE.
Pour en savoir plus sur le modèle Google Research TabFM, consultez les ressources suivantes :
Lorsque vous utilisez TabFM via BigQuery, votre utilisation est régie par les Conditions d'utilisation de Google Cloud et autorise les utilisations commerciales. La licence à usage non commercial associée aux pondérations TabFM téléchargeables publiquement sur GitHub et Hugging Face ne s'applique qu'aux téléchargements auto-hébergés et ne limite pas l'utilisation dans BigQuery.