O modelo TabFM

Este documento descreve o modelo de regressão e classificação tabular TabFM integrado do BigQuery.

O modelo TabFM integrado é uma implementação do modelo TabFM de código aberto do Google Research. O modelo TabFM do Google Research é um modelo de fundação para dados tabulares que permite regressão e classificação de poucos disparos em dados estruturados usando o aprendizado no contexto. Como o modelo TabFM é pré-treinado com centenas de milhões de conjuntos de dados sintéticos gerados usando modelos causais estruturais, ele captura interações complexas de recursos e generaliza bem para tabelas do mundo real não vistas em muitos domínios.

É possível usar o modelo TabFM com a função AI.PREDICT para realizar regressão e classificação em dados estruturados em uma única transmissão direta sem precisar treinar um modelo, otimizar hiperparâmetros ou criar atributos. Os resultados da previsão são comparáveis aos algoritmos convencionais supervisionados baseados em árvores, como XGBoost e florestas aleatórias. Se você quiser mais opções de ajuste de modelo do que o TabFM oferece, treine um modelo supervisionado, como uma árvore de reforço ou floresta aleatória, e use-o com a função ML.PREDICT.

Para gerar previsões com o modelo TabFM em dados tabulares, use a função AI.PREDICT.

Para avaliar os valores previstos do modelo TabFM em relação aos valores reais, use a função AI.EVALUATE.

Para saber mais sobre o modelo TabFM do Google Research, use os seguintes recursos:

Quando você usa o TabFM pelo BigQuery, seu uso é regido pelos Termos de Serviço do Google Cloud e permite usos comerciais. A licença não comercial associada aos pesos do TabFM disponíveis para download público no GitHub e no Hugging Face se aplica apenas a downloads auto-hospedados e não restringe o uso no BigQuery.