Gerenciar o preenchimento dos objetos de um stream

Um stream no Datastream pode preencher dados históricos e fazer streaming de alterações em andamento para um destino. Como parte da criação de um stream, você configurou informações sobre o banco de dados de origem para o stream.

Se você tiver marcado a caixa de seleção Preencher dados históricos, o Datastream vai transmitir todos os dados existentes, além das alterações, da origem para o destino.

Se você não marcar essa caixa de seleção, o Datastream vai transmitir apenas as mudanças nos dados. Para que o Datastream transmita um snapshot de todos os dados existentes da origem até o destino, é necessário iniciar o preenchimento dos objetos que contêm esses dados. Os objetos estão na forma de esquemas, tabelas e colunas de banco de dados.

Outro motivo para iniciar o preenchimento de um objeto é se os dados não estiverem sincronizados entre a origem e o destino. Por exemplo, um usuário pode excluir dados no destino acidentalmente, e os dados serão perdidos. Nesse caso, o preenchimento do objeto será iniciado como um mecanismo de redefinição, porque todos os dados serão transmitidos para o destino em uma única captura. Como resultado, os dados são sincronizados entre a origem e o destino.

Depois de iniciar o preenchimento de um objeto, você poderá interromper o preenchimento desse objeto. No exemplo anterior, o usuário modifica o esquema do banco de dados, e os dados ou o esquema ficam corrompidos. Você não quer que o esquema ou os dados sejam transmitidos para o destino, então o preenchimento do objeto é interrompido.

Também é possível interromper o preenchimento de objetos para fins de balanceamento de carga. O Datastream pode executar vários preenchimentos em paralelo. Isso pode sobrecarregar a origem. Se a carga for significativa, interrompa o preenchimento dos objetos e, em seguida, inicie o preenchimento para eles, um por um.

Status do objeto

Os vários status no ciclo de vida de iniciar e interromper o preenchimento de um objeto incluem:

  • Sem status (representado na UI como -): os motivos para um objeto receber esse status incluem:

    • O stream não foi iniciado.
    • A caixa de seleção Preenchimento de dados históricos não foi marcada. Portanto, o preenchimento é definido como manual.
    • O objeto é excluído explicitamente para ser preenchido automaticamente.
    • O stream está configurado para incluir tabelas futuras. Se isso acontecer, quando novas tabelas forem adicionadas à origem, nenhuma tarefa de preenchimento automático será criada para elas (porque as novas tabelas normalmente não têm dados históricos para preenchimento).
  • Pending: o preenchimento ainda não foi iniciado para o objeto.

  • Active: o preenchimento está em andamento para o objeto.

  • Completed: o preenchimento do objeto é concluído.

  • Stopped: o preenchimento é interrompido para o objeto. Se o preenchimento for iniciado novamente para o objeto, o Datastream transmitirá todos os dados existentes associados ao objeto da origem para o destino.

  • Failed: o preenchimento falhou para o objeto e deve ser iniciado novamente.

Iniciar preenchimento

  1. Acesse a página Streams no console do Google Cloud .

    Acessar a página "Mural"

  2. Clique no stream que contém objetos para os quais você quer iniciar o preenchimento.

  3. Clique na guia Objetos.

  4. Marque a caixa de seleção de cada objeto para o qual você quer iniciar o preenchimento.

  5. Clique em Iniciar preenchimento.

  6. Se você selecionou apenas um objeto, clique em INICIAR PREENCHIMENTO DE OBJETOS na caixa de diálogo. Se você selecionou vários objetos, clique em INICIAR PREENCHIMENTOS DE OBJETIVOS.

    O Datastream vai iniciar o preenchimento dos objetos selecionados, e o status de cada um deles vai mudar de Pending para Active e depois para Completed. Quando um objeto tem o status Completed, isso significa que o Datastream leu todos os dados do objeto, mas eles ainda podem estar sendo carregados para o destino.

Iniciar preenchimento parcial

Além dos preenchimentos completos, é possível fazer um preenchimento parcial para carregar um subconjunto específico de dados da origem para o destino. Para fazer isso, forneça uma cláusula WHERE do SQL como um filtro personalizado.

O Datastream é compatível com o backfill parcial para as seguintes origens:

  • SQL Server
  • Spanner
  • Oracle
  • PostgreSQL

Para iniciar um preenchimento parcial:

  1. Acesse a página Streams no console do Google Cloud .

    Acessar a página "Mural"

  2. Clique no stream que contém objetos para os quais você quer iniciar o preenchimento.

  3. Clique na guia Objetos.

  4. Selecione o objeto para o qual você quer iniciar o preenchimento.

  5. Clique em Iniciar preenchimento.

  6. No painel exibido, marque a caixa de seleção Ativar filtro personalizado.

  7. Insira sua cláusula WHERE do SQL. Por exemplo, product_id > 12 AND timestamp = '2025-01-06T22:00:00.00'.

  8. Clique em Iniciar preenchimento.

O Datastream valida o filtro. Se a validação falhar, uma mensagem de erro vai aparecer acima do editor. Se a validação for bem-sucedida, o Datastream vai iniciar o job de preenchimento.

Sintaxe de filtro personalizado aceita

Quando você fornece um filtro personalizado, o Datastream é compatível com um subconjunto fundamental da sintaxe da cláusula WHERE do SQL. Os elementos compatíveis incluem:

  • Operadores lógicos: AND, OR
  • Operadores de comparação: =, <, >, <=, >=, !=
  • Condições: IN, NOT IN, IS NULL, IS NOT NULL
  • Agrupamento: parênteses () para definir grupos de condições
  • Valores:

    • Strings: texto entre aspas simples, por exemplo, 'value'.
    • Números: inteiros (123), decimais (123.45), negativos (-10) e com expoentes (1.2e3).
    • Valores booleanos: palavras-chave TRUE ou FALSE que diferenciam maiúsculas de minúsculas.
  • Identificadores:

    • Qualificação: os nomes de colunas podem ser totalmente qualificados usando pontos para especificar o esquema ou a tabela, por exemplo, myColumn, myTable.myColumn ou mySchema.myTable.myColumn.
    • Identificadores sem aspas: podem conter letras, números e sublinhados e precisam começar com uma letra ou um sublinhado. A diferenciação entre maiúsculas e minúsculas para nomes de colunas ou tabelas depende do banco de dados de destino.
    • Identificadores entre aspas duplas: precisam estar entre aspas duplas (").

Limitações do preenchimento parcial

Algumas instruções, operadores e palavras-chave são explicitamente proibidos, e o uso deles resulta em um erro. São eles:

  • Comentários, como -- ou /* */.
  • Funções, por exemplo, UPPER(column) e NOW().
  • Expressões aritméticas, por exemplo, column + 1 > 10.
  • O operador LIKE. Caracteres curinga, como % ou _, não são aceitos com LIKE.
  • O operador BETWEEN. Use >= e <=.
  • Subconsultas, por exemplo, (SELECT ...) na cláusula WHERE.
  • Instruções CASE, por exemplo, CASE WHEN ... END.
  • Comparações de colunas, como column1 = column2. As comparações precisam ser com literais.
  • DATE e TIME tipos ou funções específicas.
  • Operadores específicos de matriz ou JSON.
  • Conversão explícita: por exemplo, CAST(column AS INT).

Parar preenchimento

  1. Acesse a página Streams no console do Google Cloud .

    Acessar a página "Mural"

  2. Clique no stream que contém objetos com o preenchimento que você quer interromper.

  3. Clique na guia Objetos.

  4. Marque a caixa de seleção de cada objeto para o qual você quer interromper o preenchimento.

  5. Clique em Interromper preenchimento.

  6. Se você selecionou apenas um objeto, clique em Interromper preenchimento de objeto na caixa de diálogo. Se você selecionou vários objetos, clique em Interromper preenchimentos de objetos.

    O Datastream interromperá o preenchimento dos objetos selecionados e o status de cada um deles será alterado para Stopped.

    Quando um objeto tem esse status, o preenchimento é interrompido para ele. Se o preenchimento for iniciado novamente para o objeto, o Datastream transmitirá todos os dados existentes associados ao objeto da origem para o destino.

A seguir