É possível explorar os resultados da consulta usando células SQL ou células de código nos notebooks do Colab Enterprise do BigQuery.
Neste tutorial, você consulta dados de um conjunto de dados público do BigQuery e explora os resultados de consulta em um notebook.
Objetivos
- Criar e executar uma consulta no BigQuery
- Explorar resultados de consulta em um notebook usando células SQL e de código
Custos
Neste tutorial, usamos um conjunto de dados disponibilizado pelo Google Cloud programa de conjuntos de dados públicos. O Google paga pelo armazenamento desses conjuntos de dados e oferece acesso público a eles. Você receberá cobranças pelas consultas realizadas nos dados. Para mais informações, acesse a página Preços do BigQuery.
Antes de começar
-
No Google Cloud console do, na página do seletor de projetos, escolha ou crie um Google Cloud projeto do.
Papéis necessários para selecionar ou criar um projeto
- Selecionar um projeto: a seleção de um projeto não exige um papel específico do IAM. Você pode selecionar qualquer projeto em que tenha recebido um papel.
-
Criar um projeto: para criar um projeto, você precisa do papel Criador de projetos
(
roles/resourcemanager.projectCreator), que contém aresourcemanager.projects.createpermissão. Saiba como conceder papéis.
-
Verifique se o faturamento está ativado para o Google Cloud projeto.
-
Ative a API BigQuery.
Funções necessárias para ativar APIs
Para ativar as APIs, é necessário ter a permissão
serviceusage.services.enable. Se você criou o projeto, provavelmente já tem essa permissão pelo papel Proprietário (roles/owner). Caso contrário, você pode receber essa permissão pelo papel Administrador de uso do serviço (roles/serviceusage.serviceUsageAdmin). Saiba como conceder papéis.O BigQuery é ativado automaticamente para novos projetos.
Definir a região padrão para recursos de código
Todos os novos recursos de código no seu Google Cloud projeto usam uma região padrão. Depois que o recurso é criado, não é possível mudar a região dele.
Para definir a região padrão dos novos recursos de código, faça o seguinte:
Acessar a página do BigQuery.
No painel à esquerda, clique em Arquivos para abrir o navegador de arquivos:
Ao lado do nome do projeto, clique em Ver ações do painel de arquivos > Mudar região do código.
Selecione a região de código que você quer usar como padrão.
Clique em Salvar.
Para conferir uma lista de regiões compatíveis, consulte Locais do BigQuery Studio.
Permissões necessárias
Para criar e executar notebooks, você precisa dos seguintes papéis do Identity and Access Management (IAM):
- Usuário do BigQuery (
roles/bigquery.user) - Usuário do ambiente de execução do notebook (
roles/aiplatform.notebookRuntimeUser) - Criador de código (
roles/dataform.codeCreator)
Abrir resultados de consulta em um notebook
É possível executar uma consulta SQL e depois usar um notebook para explorar os dados. Essa abordagem é útil quando você quer modificar os dados no BigQuery antes de trabalhar com eles ou quando precisa apenas de um subconjunto dos campos na tabela.
No Google Cloud console, acesse a página BigQuery.
No painel à esquerda, clique em Explorer.
Acesse o projeto
bigquery-public-data, clique Alternar nó para expandi lo e clique em Conjuntos de dados. Uma nova guia será aberta no painel de detalhes mostrando uma lista de todos os conjuntos de dados no projeto.Na caixa Filtro , escolha ID do conjunto de dados e insira ml_datasets.
Na página Conjuntos de dados, clique em ml_datasets > pinguins.
Clique em Consulta.
Adicione um asterisco (
*) para seleção de campo à consulta gerada, de modo que ela fique parecida com o exemplo a seguir:SELECT * FROM `bigquery-public-data.ml_datasets.penguins` LIMIT 1000;
Clique em Executar.
Na seção Resultados da consulta, clique em Abrir em e em Notebook.
Preparar o notebook para uso
Prepare o notebook para uso conectando-se a um ambiente de execução e definindo os valores padrão do aplicativo.
No cabeçalho do notebook, clique em Conectar para se conectar ao ambiente de execução padrão.
No bloco de código Setup, clique em Executar célula.
explore os dados
Clique em Opções de inserir célula de código > Adicionar célula SQL.
Insira a consulta a seguir na célula SQL:
SELECT * FROM `bigquery-public-data.ml_datasets.penguins` LIMIT 1000;Clique em Executar célula.
Os resultados da consulta são mostrados em um BigQuery DataFrame.
Como alternativa, para carregar os resultados da consulta em um DataFrame do BigQuery usando o job de consulta executado anteriormente no editor de consultas, siga estas etapas:
Acesse a seção Conjunto de resultados carregado do job do BigQuery como um DataFrame.
No bloco de código, clique em Executar célula.
Os resultados da consulta são mostrados em um DataFrame do BigQuery.
Para receber métricas descritivas dos dados, siga estas etapas:
Acesse a seção Mostrar estatísticas descritivas usando describe().
No bloco de código, clique em Executar célula.
Os resultados são mostrados em um DataFrame do BigQuery.
Opcional: use outras funções ou pacotes do Python para explorar e analisar os dados.
O exemplo de código a seguir mostra o uso de
bigframes.pandas
para analisar dados e o bigframes.ml
para criar um modelo de regressão linear de pinguins em um
DataFrame do BigQuery:
Limpar
Para evitar cobranças na sua conta do Google Cloud pelos recursos usados neste tutorial, exclua o projeto que os contém ou mantenha o projeto e exclua os recursos individuais.
O jeito mais fácil de evitar cobranças é excluindo o Google Cloud projeto que você criou para este tutorial.
- No Google Cloud console, acesse a página Gerenciar recursos.
- Na lista de projetos, selecione o projeto que você quer excluir e clique em Excluir.
- Na caixa de diálogo, digite o ID do projeto e clique em Desligar para excluir o projeto.
A seguir
- Saiba mais sobre como criar notebooks no BigQuery.
- Saiba como explorar dados com o BigQuery DataFrames.