Pular para o conteúdo
Tópicos

Agentes IA e Automação: RAG, Workflows e Guias

Entenda agentes IA, RAG e workflows de automação. Dos conceitos às aplicações reais e guias de implementação.

46 artigos

Ordene os artigos para encontrar o que precisa

Artigos em Agentes IA e Automação

O Dispatch do Claude — como o seu celular conduz o seu próprio PC, e o quanto isso é seguro

O Dispatch do Claude — como o seu celular conduz o seu próprio PC, e o quanto isso é seguro

O Dispatch é o recurso em que você manda uma instrução pelo celular e o Claude executa o trabalho no seu próprio computador (beta, planos Pro e Max). Ele não roda na nuvem; é a sua máquina real que se mexe, e esse fato único produz tanto o valor quanto o perigo. A ajuda oficial diz que você pode mandar uma mensagem ao Claude pelo celular e fazer com que ele trabalhe no seu computador de mesa, usando os mesmos conectores, plugins e acesso a arquivos que você já configurou no Cowork, dentro do que a Anthropic enquadra como uma conversa contínua acessível a partir de qualquer um dos aparelhos. Para funcionar, ele exige o PC acordado e com o aplicativo de desktop aberto, e o uso do computador tem suporte apenas em macOS e Windows, sem uso do computador no Linux. Mecanicamente ele desce por três níveis de prioridade: um conector, se houver um disponível; navegação no navegador, se não houver; e interação direta com a tela como último recurso, com capturas de tela tiradas pelo caminho para entender o que está exibido. A avaliação começa depois disso. Os lugares em que ele para são projetados: o uso do computador vem desligado por padrão e é habilitado em Settings, General; a permissão é pedida para cada novo aplicativo; excluir um arquivo em definitivo exige permissão explícita; e plataformas de investimento e negociação e aplicativos de criptomoedas estão fora de alcance por padrão. Mas há lugares em que ele não para. Ações individuais dentro de um aplicativo já aprovado não são confirmadas com você, e o texto oficial diz que o Claude clica, digita e navega na sua tela diretamente, sem as verificações de permissão que controlam as outras ferramentas do Cowork. A documentação acrescenta que não há sandbox entre o Claude e o que está na sua tela, e que ações tomadas em um aplicativo podem impactar outros aplicativos. O maior risco é a injeção de prompt, que a Anthropic descreve com as próprias palavras: o conteúdo da web é um vetor primário de ataques de injeção de prompt, e uma instrução manipulada, um comando inesperado ou um link de phishing aberto no seu navegador podem desencadear ações difíceis ou impossíveis de desfazer. A Anthropic diz que examina as ativações do modelo para detectar esse tipo de comportamento, mas isso reduz as chances em vez de eliminar a necessidade de você traçar uma linha, e a orientação continua mandando mudar para aprovação manual sempre que uma tarefa tocar arquivos, contas ou sites sensíveis. A Anthropic nomeia o limite sem meias-palavras: não dê à permissão de uso do computador acesso a aplicativos sensíveis, como os de bancos, saúde e governo, e evite contas financeiras, documentos jurídicos, informações médicas e dados pessoais. O artigo também cobre o lado do celular. O que vaza se você perder o aparelho não são os dados guardados nele, e sim a prerrogativa de instruir o seu PC, mais o conteúdo da conversa contínua — e a ajuda oficial do Dispatch não documenta desemparelhamento nem o que fazer com um aparelho perdido, então os remédios vêm do lado da conta: encerrar a sessão individual em Settings, Account, Active sessions; desconectar todas as sessões pelo claude.ai (o que não está disponível nos aplicativos móveis e portanto exige um navegador web); ou simplesmente cortar o lado do PC fechando o aplicativo de desktop ou deixando a máquina suspender, o que é de fato o mais rápido, já que o Dispatch precisa do PC acordado e do aplicativo aberto. Ele encerra separando o Dispatch do uso do computador como dois interruptores distintos, distinguindo ambos do agent view do Claude Code (que a documentação oficial também chama de dispatch) e traçando uma linha prática: comece por trabalho que dá para desfazer.

O agent view do Claude Code — como as sessões rodam em paralelo e por onde o isolamento vaza

O agent view do Claude Code — como as sessões rodam em paralelo e por onde o isolamento vaza

O agent view do Claude Code, aberto com claude agents, é o recurso para iniciar sessões independentes em segundo plano uma atrás da outra e gerenciá-las a partir de uma única tela. A documentação oficial chama de dispatch a operação que você executa ali, o que colide com o recurso homônimo e separado do aplicativo de desktop, então a primeira tarefa é distinguir os dois. A documentação descreve o agent view como o recurso que permite despachar e gerenciar muitas sessões do Claude Code a partir de uma só tela, e ele é um research preview que exige a v2.1.139 ou posterior. Este artigo fica no mecanismo e no modelo de segurança. A primeira surpresa é que cada prompt digitado na caixa de entrada inicia uma nova sessão própria: digite um segundo e você ganha uma segunda sessão ao lado da primeira, não uma instrução extra somada a ela. Instruções adicionais passam pelo painel de espiada, aberto com Space, que mostra a saída mais recente ou a pergunta pela qual a sessão está esperando em vez da transcrição inteira. O coração do modelo de segurança é o isolamento por worktree. Antes de editar qualquer arquivo, uma sessão em segundo plano se muda para um git worktree isolado dentro de .claude/worktrees/, de modo que sessões paralelas leem o mesmo checkout mas cada uma escreve no seu — leituras compartilhadas, escritas separadas. Tudo o que alcançaria o checkout principal é cortado por três verificações: edições de arquivo via Edit, Write e NotebookEdit; diretórios de trabalho de comandos que resolvem para o checkout principal ou que não dá para verificar que ficam fora dele; e tentativas de redirecionar o git via git -C, --git-dir, GIT_DIR, GIT_WORK_TREE ou um cd colocado antes da chamada do git. A decisão é deliberadamente tomada pelo lado seguro, recusando o que não pode ser verificado, e a mesma proteção é herdada por todo subagent que a sessão gerar. Não é um muro no nível do sistema operacional, porém: arquivos fora do repositório e a rede estão fora do escopo, e comandos do PowerShell recebem apenas a verificação do diretório de trabalho. As permissões também não são escolhidas na hora do dispatch; elas são herdadas do defaultMode daquele diretório, ou do permissionMode no frontmatter de um subagent despachado, o que significa que quanto mais frouxa for a sua configuração habitual, mais sessões sem supervisão e com permissões frouxas você cria de uma vez. Três coisas então vazam do isolamento. Escolher "Sim, não pergunte de novo" salva a regra no .claude/settings.local.json do checkout principal, então ela vale no checkout principal e em todos os outros worktrees e sobrevive à remoção do worktree em que foi criada. Excluir uma sessão no agent view exclui junto o worktree criado pelo Claude, de modo que trabalho não commitado desaparece — e o Ctrl+X para no primeiro toque e exclui no segundo. E o .worktreeinclude copia arquivos ignorados pelo git, como o .env, para todo worktree novo, multiplicando as suas credenciais pelo número de sessões que você despacha. Além disso, a cota se esgota em proporção ao paralelismo (dez agentes a consomem cerca de dez vezes mais rápido), e as sessões rodam localmente, sobrevivendo à suspensão mas parando quando a máquina é desligada. O artigo encerra situando o agent view entre as quatro formas oficiais de paralelizar, ao lado dos subagents, dos agent teams e dos fluxos de trabalho dinâmicos, e dá uma rotina concreta para antes, durante e depois de um dispatch.

ChatGPT Work: o que é e como usar o agente do GPT-5.6

ChatGPT Work: o que é e como usar o agente do GPT-5.6

ChatGPT Work é o "agente de IA para o trabalho" que a OpenAI anunciou em 9 de julho de 2026, junto com o GPT-5.6. Diferente de um chat comum que só responde, ele reúne contexto dos seus apps e arquivos conectados para construir produtos finais prontos — documentos, planilhas, slides e até web apps. Seu cérebro é o novo carro-chefe GPT-5.6 Sol (construído sobre o Codex), e ele consegue dividir um projeto complexo em passos e seguir trabalhando por horas (Thurrott). Dentro do app desktop unificado, três modos convivem — Work (entregáveis), Codex (técnico, mostra os detalhes) e chat comum (conversa) — com o Work posicionado como a "versão de negócios" que esconde o detalhe técnico do Codex (9to5Mac). O modelo depende do seu plano: Grátis/Go usam Terra por padrão, enquanto Plus/Pro/Business/Enterprise escolhem entre Sol/Terra/Luna (conforme noticiado). Sua força é puxar "o seu contexto" via conectores como Google Drive, SharePoint e Slack, mais o MCP — e, para empresas, os dados não são usados para treinamento por padrão. Com base em Axios, TechCrunch, 9to5Mac, Thurrott e OpenAI, este artigo explica o que é o ChatGPT Work, como ele difere do ChatGPT comum e do Codex, quais planos podem usá-lo e a quais apps ele se conecta — com rótulos de confiança sobre o que ainda não é oficial.

GPT-5.6 Sol vs Gemini: agente vs multimodal — comparação completa

GPT-5.6 Sol vs Gemini: agente vs multimodal — comparação completa

Comparação entre o GPT-5.6 "Sol" da OpenAI e o Gemini do Google, cujos pontos fortes quase não se sobrepõem. O Sol é esmagador em codificação de terminal e agêntica (Terminal-Bench 88.8% vs 68.5%, SWE-bench Pro 64.6% vs 54.2%), enquanto o Gemini 3.1 Pro responde com multimodalidade nativa (voz e vídeo), preço cerca de metade e liderança em MMLU, ARC-AGI-2 e WebDev Arena. Como o verdadeiro adversário, o Gemini 3.5 Pro, ainda não estava disponível (previsto para meados de julho de 2026), este é um instantâneo do confronto com o Gemini 3.1 Pro — com escolha por caso de uso, custo e FAQ.

GPT-5.6 vs GPT-5.5: o que mudou e para qual modelo migrar (Luna/Terra/Sol)

GPT-5.6 vs GPT-5.5: o que mudou e para qual modelo migrar (Luna/Terra/Sol)

Dois meses e meio após o GPT-5.5, a OpenAI lançou o GPT-5.6 e a maior mudança não é desempenho: o carro-chefe único vira 3 modelos (Luna/Terra/Sol). O intermediário Terra entrega qualidade equivalente à do GPT-5.5 por muito menos: era metade do preço no lançamento e, com o corte de 30 de julho de 2026, passou a 40% do preço unitário ($2/$12). O Sol mantém $5/$30 e eleva o SWE-Bench Pro de 58.6 para 64.6% (estimado). Comparamos especificações, benchmarks e custo real (de $1,100 para $440 por mês no exemplo), e mostramos para qual modelo você deve migrar.

GPT-5.6 Sol vs Claude Fable 5: comparação completa — custo vs desempenho de topo

GPT-5.6 Sol vs Claude Fable 5: comparação completa — custo vs desempenho de topo

Comparação entre o Claude Fable 5, topo de linha da Anthropic, e o GPT-5.6 Sol, flagship da OpenAI pela metade do preço. O Fable 5 domina a codificação de produção real (SWE-Bench Pro 80.3% vs 64.6% estimado do Sol) e a autonomia de até 12 horas, com a migração de 50 milhões de linhas da Stripe em 1 dia. O Sol lidera operação de terminal (TerminalBench 88.8%), capacidade agentiva geral e eficiência de tokens, custando cerca de metade ($5/$30 vs $10/$50). Veja como escolher por custo, taxa de sucesso e caso de uso.

GPT-5.6 Sol vs Claude Opus 4.8: comparação completa de benchmarks, programação, preço e como escolher

GPT-5.6 Sol vs Claude Opus 4.8: comparação completa de benchmarks, programação, preço e como escolher

Uma comparação detalhada dos dois gigantes da programação com IA de 2026, Claude Opus 4.8 (28 de maio) e o topo de linha do GPT-5.6, o Sol (9 de julho). Suas forças são quase opostas: o Sol lidera na operação de terminal e na capacidade agêntica geral (TerminalBench 2.1 88.8% vs Opus 78.9%, Agents' Last Exam 53.6, Coding Agent Index 80), enquanto o Opus 4.8 lidera na programação de nível de produção, matemática e contexto longo (SWE-bench Pro 69.2% vs Sol 64.6%, USAMO 2026 96.7%, GraphWalks 1M 68.1%) e coloca a honestidade em primeiro plano (excesso de confiança reduzido a um décimo, 0% de relato de resultados falhos sem crítica). A OpenAI ainda deixa muitos benchmarks do Sol sem divulgar (SWE-bench Pro, GPQA, AIME, MMLU), então, na fortaleza da programação, o Opus, já divulgado, leva vantagem. Cobrimos a tabela de especificações, os detalhes dos benchmarks, o problema dos benchmarks não divulgados, o custo real ($25 vs $30 de preço unitário vs +54% de eficiência de tokens), um mapa de forças e fraquezas, escolhas por caso de uso e uma estratégia de dois fornecedores.

Lançamento do GPT-5.6: guia completo — Luna/Terra/Sol, benchmarks, preços e vs. Claude

Lançamento do GPT-5.6: guia completo — Luna/Terra/Sol, benchmarks, preços e vs. Claude

A OpenAI disponibilizou o GPT-5.6 de forma geral em 9 de julho de 2026, substituindo a antiga estrutura "padrão + Pro" por uma linha de três modelos: Luna (rápido e barato, $0.20/$1.20), Terra (equilibrado, $2/$12, equivalente ao GPT-5.5 por 40% do preço unitário do Sol) e Sol (carro-chefe, $5/$30) — preços após a revisão de 30 de julho de 2026. O Sol assume o primeiro lugar no Agents' Last Exam (53.6) e no Coding Agent Index (80), e seus 88.8% no TerminalBench 2.1 superam o Claude Fable 5 (86.0%) — mas na programação de nível de produção do SWE-Bench Pro, o Claude Fable 5 lidera com folga, 80.0% contra 64.6% do Sol. Este artigo cobre as diferenças entre os três modelos, os preços, os benchmarks, os novos recursos (Programmatic Tool Calling, ChatGPT Work e o modelo de voz full-duplex GPT-Live), a disponibilidade por plano do ChatGPT, a comparação com o Claude (Fable 5 / Opus 4.8) e como escolher conforme o uso — tudo baseado no anúncio oficial da OpenAI e em benchmarks independentes.

O Que É um LLM Gateway (Proxy)? Uma API para Todo Provedor — Guia 2026

O Que É um LLM Gateway (Proxy)? Uma API para Todo Provedor — Guia 2026

Você construiu sobre a OpenAI, depois quis testar o Claude e comparar o Gemini — e perdeu horas com os SDKs, formatos e tratamentos de erro diferentes por provedor. Um LLM gateway (AI gateway / LLM proxy) é um relay que você encaixa entre a sua aplicação e os provedores: ele expõe uma única API compatível com OpenAI para alcançar todos os modelos e assume as tarefas transversais — fallback, controle de custos, chaves virtuais, cache, rate limiting e observabilidade. Este guia cobre por que você precisa de um, o que um gateway realmente é, os três tipos (proxy self-hosted = LiteLLM / hospedado = OpenRouter / SDK = Vercel AI SDK), como escolher entre LiteLLM, OpenRouter e o Vercel AI SDK, o código de configuração mínima que só troca o endpoint, e os limites — um salto de latência, o gateway como novo ponto de falha, taxas (o OpenRouter cobra 5,5% sobre compras), perda de recursos e privacidade.

Evals de Agentes de IA: 5 Formas de Medir a Qualidade (2026)

Evals de Agentes de IA: 5 Formas de Medir a Qualidade (2026)

Depois de construir um agente de IA, você sempre esbarra no mesmo muro: "Certo, mas será que funciona de verdade?" O mecanismo que decide se uma mudança de prompt ou modelo deixou as coisas melhores ou piores com dados em vez de intuição são os evals. LLMs produzem uma saída diferente a cada vez para a mesma entrada, então testes unitários de correspondência exata não se encaixam. Este artigo cobre o que são evals, cinco formas de medir a qualidade (① correspondência com o gabarito ② verificações baseadas em regras ③ LLM-as-judge ④ teste de regressão ⑤ monitoramento em produção), avaliação específica de agentes (taxa de sucesso da tarefa, chamadas de ferramenta corretas, trajetória, custo), como começar pequeno a partir de 20 exemplos de falha, armadilhas comuns e ferramentas principais (Anthropic Console/Evals, OpenAI Evals, LangSmith, Langfuse, Ragas) — escrito para quem põe a mão na massa.

Agentes de IA vs RPA: a diferença e quando usar cada um (2026)

Agentes de IA vs RPA: a diferença e quando usar cada um (2026)

A eterna pergunta da automação: "agentes de IA ou RPA?" A resposta não é um ou outro — escolha pelo papel, e o padrão vencedor de 2026 é um híbrido dos dois. O RPA são "mãos" determinísticas que executam um procedimento fixo de forma rápida e precisa (mas quebram quando a tela/especificação muda); um agente de IA é um "cérebro" probabilístico que lê a situação e decide (forte diante de ambiguidade e exceções, mas não idêntico a cada vez). Este artigo cobre a diferença de princípio de funcionamento, uma tabela comparativa (o trade-off entre reprodutibilidade e resistência à mudança), como escolher (o eixo é "dá para escrever tudo como regras?" — sim → RPA, julgamento que você não consegue escrever → agente de IA), a tendência de 2026 (os líderes de RPA UiPath, Automation Anywhere, Blue Prism tornando-se agênticos — convergência; a pergunta já não é "qual dos dois", mas "onde deve morar o raciocínio" = orquestração primeiro) e a resposta prática: um híbrido em que o cérebro (agente de IA) cuida do julgamento/orquestração e as mãos (RPA) executam a parte determinística — não coloque um agente onde se exige determinismo e combine o julgamento delegado com guardrails e aprovação humana. Com base nas informações oficiais dos fornecedores, com um FAQ.

Como deixar a IA gerenciar a AWS: métodos, vantagens e desvantagens (2026)

Como deixar a IA gerenciar a AWS: métodos, vantagens e desvantagens (2026)

Dá para entregar a operação da AWS à IA? Em 2026 você pode delegar bastante. A própria AWS oferece o Amazon Q Developer e o Agent Toolkit for AWS (maio de 2026 — mais de 40 skills de agente + um AWS MCP Server gerenciado + plugins), então a IA vai da geração de IaC até a operação de recursos. Este guia enquadra o "delegar" em três níveis (① geração de código/IaC, ② operação/investigação orientada a leitura, ③ um agente autônomo que opera a AWS de verdade), cobre as principais ferramentas (Amazon Q Developer, Agent Toolkit, AWS MCP Server, Terraform MCP, Bedrock AgentCore) — incluindo a rota traga o seu próprio de dar ao Claude Code ou ao Codex a AWS CLI para rodar "aws" pelo shell — as vantagens (IaC rápido, triagem automatizada, ideias de otimização de custos, conhecimento democratizado) e, então, o ponto que importa, as desvantagens (proliferação de permissões IAM, excesso de privilégio como amplificador do raio de destruição de erros/injeção de prompt, permissões que sobrevivem à tarefa, custos fora de controle — com incidentes reais de exclusão de bancos de dados de produção em 2025-26), com base em fontes oficiais da AWS e de fornecedores de segurança. A virada essencial: a pergunta não é "dá para fazer?", mas "como delegar sem que a coisa saia do controle ou a fatura exploda" — e o fato de a própria AWS ter embutido guardrails de IAM, auditoria via CloudTrail e sandbox no Agent Toolkit revela o formato da resposta. Inclui os cinco princípios (IAM de menor privilégio, aprovação humana para operações destrutivas, observabilidade, credenciais JIT de curta duração, sandbox) e um FAQ.