Copilot de Pipeline — Guia do Usuário
Montar um pipeline de dados completo — conexão, descoberta de schema, transformação, análise e visualização — exige encadear várias ferramentas e bastante tentativa e erro. O Copilot de Pipeline elimina esse atrito: você descreve o objetivo em português e um time de agentes de IA especializados planeja e executa cada etapa, criando pipelines ETL, notebooks Jupyter e dashboards DATTABI enquanto você acompanha o progresso em tempo real.
1. O que ele faz
Você descreve o que quer em português. O copilot:
- Planeja as etapas automaticamente usando IA.
- Conecta à fonte de dados (banco JDBC ou nativo).
- Descobre o schema e amostras dos dados.
- Gera o código DATTAX de transformação.
- Executa scripts R (se solicitado).
- Cria o notebook Jupyter ou o dashboard DATTABI.
- Grava os resultados no destino escolhido (Neo4j, OpenSearch, Trino).
Tudo isso de forma automática, com progresso em tempo real na tela.
2. Como acessar
No menu lateral, clique em . Ou acesse diretamente em /copilot/pipeline.
3. Exemplos de uso
3.1 Criar pipeline ETL simples
Objetivo: Extrair a tabela "vendas" do PostgreSQL analytics.empresa.com,
remover registros com valor nulo, e gravar no Neo4j como nos (:Venda).O copilot:
- Cria/resolve a conexão com o PostgreSQL.
- Descobre o schema da tabela
vendas. - Gera código DATTAX de transformação (filtrar nulos).
- Grava em Neo4j via
MATERIALIZE AS NEO4J.
3.2 Criar notebook com análise R
Objetivo: Conectar ao MySQL do CRM, extrair clientes com mais de 1 ano de cadastro,
aplicar clustering K-Means em R com tidyverse, e criar um notebook com os resultados.O copilot:
- Resolve a conexão MySQL.
- Descobre o schema da tabela de clientes.
- Gera DATTAX para extrair os dados.
- Submete o script R (K-Means via
cluster+tidyverse). - Cria o notebook
.dattanbcom as células de análise e resultado.
3.3 Criar dashboard DATTABI automático
Objetivo: Pegar os dados de faturamento do Trino (schema finance.faturamento),
calcular receita por regiao e por mes, e criar um dashboard com graficos de barra e linha.O copilot:
- Resolve a conexão Trino.
- Gera DATTAX de agregação (região + mês).
- Cria o dashboard com gráfico de barra (por região) e de linha (por mês).
4. Progresso em tempo real
Durante a execução, a interface exibe o progresso de cada etapa:
| Evento | O que significa |
|---|---|
| PLAN | O copilot planejou as próximas tarefas |
| AGENT_START | Um agente iniciou uma tarefa |
| AGENT_DONE | Tarefa concluída com sucesso |
| AGENT_ERROR | Uma tarefa falhou (o pipeline pode continuar) |
| COMPLETE | Objetivo atingido — links para os artefatos |
| ERROR | Erro fatal — verifique o objetivo e tente novamente |
5. Agentes disponíveis
O copilot aciona o agente certo para cada necessidade:
| Agente | Quando é usado |
|---|---|
Agente de conexão (ConnectionAgent) | Sempre que uma conexão a dados é necessária |
Agente de schema (SchemaDiscoveryAgent) | Para descobrir tabelas e colunas antes de transformar |
Agente de transformação (DataTransformAgent) | Para gerar o código DATTAX de transformação |
Agente R (RExecutorAgent) | Quando o objetivo menciona R, tidyverse, estatística |
Agente de notebook (NotebookAgent) | Quando o objetivo pede notebook ou análise exploratória |
Agente de dashboard (DashboardAgent) | Quando o objetivo pede dashboard, gráficos ou visualização |
Agente de gravação (SinkWriterAgent) | Quando o objetivo pede gravar em Neo4j, OpenSearch ou Trino |
6. Pacotes R suportados
O ambiente R gerenciado da plataforma já vem com os pacotes abaixo pré-instalados, prontos para o agente R usar:
| Categoria | Pacotes disponíveis |
|---|---|
| Data wrangling | tidyverse, dplyr, tidyr, stringr, lubridate |
| Banco de dados | DBI, RJDBC, RPostgres, RMySQL |
| Grafo | neo4r (Neo4j) |
| Busca | elastic (OpenSearch/Elasticsearch) |
| Arquivos | arrow (Parquet), readr (CSV), openxlsx (Excel) |
| Stats / ML | cluster, factoextra, caret, randomForest |
| Visualização | ggplot2, plotly |
Se precisar de um pacote adicional, contate o administrador para incluí-lo no ambiente R da plataforma.
7. Destinos suportados
| Engine | Formato de escrita | Observação |
|---|---|---|
| NEO4J | MATERIALIZE AS NEO4J INTO <label> | Cria/atualiza nós e relações |
| OPENSEARCH | MATERIALIZE AS OPENSEARCH INTO <index> | Indexação com mapping inferido |
| TRINO | MATERIALIZE AS TRINO INTO <catalog.schema.tab> | INSERT/MERGE via JDBC |
| ICEBERG | MATERIALIZE AS ICEBERG INTO <schema.table> | MERGE/OVERWRITE/APPEND |
8. Limitações
- Máximo de 8 rodadas de planejamento por pipeline. Objetivos muito complexos devem ser divididos em pipelines menores.
- Scripts R podem demorar até 10 minutos. Operações maiores devem ser agendadas como execução recorrente.
- O copilot não tem acesso a credenciais — conexões com usuário/senha precisam estar cadastradas previamente em .
- Fontes nativas (Neo4j, OpenSearch como fonte) exigem que o agente de banco de dados correspondente esteja configurado.
9. Dicas
- Seja específico sobre o destino:
"gravar em Neo4j como (:Venda {id, valor, data})". - Mencione o tipo de gráfico para dashboards:
"grafico de barra por regiao". - Para R, descreva o algoritmo:
"clustering K-Means com k=5". - Se a conexão já existir em , o copilot a reutiliza automaticamente.
- O notebook fica salvo no ambiente de notebooks (
/jupyter) e pode ser aberto e editado livremente.
10. Solução de problemas
| Problema | Solução |
|---|---|
| AGENT_ERROR logo na conexão | Verifique se a conexão existe em |
| Pipeline parado em PLAN | O modelo de IA pode ter excedido o tempo de resposta — tente novamente em instantes |
| Notebook não aparece no ambiente de notebooks | Verifique se o ambiente Jupyter está disponível na sua instalação (/jupyter) |
| Dashboard criado sem gráficos | Verifique o DATTAX gerado — pode ter erro de schema |
Erro Engine nao suportada | Use apenas NEO4J, OPENSEARCH, TRINO ou ICEBERG como destino |
11. Referências
- Arquitetura do Captain — o agente que substituiu o copilot multi-agente.
- Guia de conexões.
- Guia da linguagem DATTAX.
- DATTABI.
- Notebooks.