Pular para o conteúdo
Tópicos

Agentes IA e Automação: RAG, Workflows e Guias

Entenda agentes IA, RAG e workflows de automação. Dos conceitos às aplicações reais e guias de implementação.

50 artigos

Ordene os artigos para encontrar o que precisa

Artigos em Agentes IA e Automação

O que é Jev? Usos, preços e limites da IA de decisão da TypeSafe

O que é Jev? Usos, preços e limites da IA de decisão da TypeSafe

Jev é o modelo de IA da TypeSafe que retorna opções, pontuações e probabilidades de Sim/Não em vez de gerar texto. Explicamos as diferenças entre Choice, Score e Noul, o significado de confidence e a estrutura de uma solicitação de API para encaminhar casos de suporte. A garantia de tipo não garante decisões corretas. O guia apresenta limitações documentadas em cálculos, datas e entradas enganosas, além dos preços, dos dois limites de entrada e da avaliação antes do uso em japonês. Baseia-se em fontes oficiais, não em testes práticos de desempenho da API.

O que é o Projects do Claude Code: como o Claude distribui as threads, quem pode usar, a exigência do GitHub e o custo em tokens

O que é o Projects do Claude Code: como o Claude distribui as threads, quem pode usar, a exigência do GitHub e o custo em tokens

O Projects do Claude Code foi reconstruído. Até agora um projeto era uma pasta que guardava conversas e material de referência; o novo Projects é uma única conversa. Você escreve o que precisa, o Claude divide aquilo em threads, as threads rodam em paralelo na nuvem e cada uma abre um pull request e volta com um relato quando termina. Fechar o notebook não as interrompe. Antes de mergulhar, porém, vale conferir três coisas: as contas que podem usar ainda são poucas (um beta público de Pro e Max, que chega primeiro às contas sem projetos existentes), o github.com e o Claude GitHub App são exigências na prática, e a velocidade com que isso devora o seu limite de uso não tem nada a ver com a de uma sessão única. Este artigo percorre como saber se a liberação já chegou até você, com o que uma thread começa (incluindo a armadilha em que regras de permissão e hooks deixam de valer assim que um projeto tem mais de um repositório), de onde vem o custo em tokens, inclusive o padrão de Opus em esforço high, e como escolher entre as cinco formas de trabalhar em paralelo: subagents, agent view, Agent Teams, dynamic workflows e Projects, tudo a partir da documentação e do blog oficiais.

O GPT-6 Astra em low é mesmo mais barato? Consumo de tokens, custo e velocidade medidos contra o GPT-5.6 Sol em high

O GPT-6 Astra em low é mesmo mais barato? Consumo de tokens, custo e velocidade medidos contra o GPT-5.6 Sol em high

Um modelo mais novo é mais inteligente, mas mais caro — costuma ser assim que se pensa. Só que comparar o GPT-6 Astra com o GPT-5.6 Sol apenas pelo preço unitário não resolve nada, porque o Astra termina o mesmo trabalho com menos tokens. Nas medições da Artificial Analysis, empresa independente de benchmarks, rodar o Astra na sua configuração mais fraca, low, custa quase exatamente o que o Sol custa em high para uma tarefa ($0.82 contra $0.81) e ainda pontua mais (46 contra 42), com um terço dos tokens de saída e um quarto da espera até a resposta começar. Partindo dos valores em 18 de setembro de 2026, este artigo apresenta custo, tokens e velocidade em cada nível de esforço de raciocínio, o detalhamento que explica por que um preço unitário 2.5 vezes maior ainda chega ao mesmo total, como ficam os números quando o preço promocional do Sol acabar, o modo como a diferença de preço diminui no trabalho de agentes de codificação e os passos para medir tudo isso no seu próprio trabalho.

GPT-6 Astra: o guia completo do lançamento — preço, planos com acesso, mudanças na migração e comparação com o Claude

GPT-6 Astra: o guia completo do lançamento — preço, planos com acesso, mudanças na migração e comparação com o Claude

A OpenAI lançou o GPT-6 Astra em 3 de setembro de 2026. A API está em disponibilidade geral, sem gate, o ID do modelo é gpt-6-astra, a janela de contexto é de 1,050,000 tokens, o preço é de $10 na entrada e $50 na saída por milhão de tokens, e o corte de conhecimento é 30 de abril de 2026. Só que "foi lançado" e "o meu plano consegue usar" são coisas diferentes: no ChatGPT Plus ele não aparece na tela de conversa comum, e a porta de entrada é o ChatGPT Work e o Codex. Este artigo organiza a disponibilidade plano a plano, a forma certa de olhar o preço quando um valor unitário duas vezes maior ainda pode sair mais barato por tarefa, o detalhamento dos benchmarks que a OpenAI de fato citou, a capacidade cibernética que atingiu "Critical" pela primeira vez no Preparedness Framework e a linha que a empresa traçou em torno dela, os quatro pontos que quebram na migração (remoção dos parâmetros de amostragem, Responses API, fim do esforço de raciocínio none e a configuração de cache renomeada) e a comparação com Claude Opus 5, Fable 5.1 e Gemini 3.8 Flash — tudo restrito ao que pôde ser confirmado em fontes primárias. Também explicamos por que não publicamos a tabela do tipo "Astra 74.1% contra Opus 5 96%" que circula por aí.

O Dispatch do Claude — como o seu celular conduz o seu próprio PC, e o quanto isso é seguro

O Dispatch do Claude — como o seu celular conduz o seu próprio PC, e o quanto isso é seguro

O Dispatch é o recurso em que você manda uma instrução pelo celular e o Claude executa o trabalho no seu próprio computador (beta, planos Pro e Max). Ele não roda na nuvem; é a sua máquina real que se mexe, e esse fato único produz tanto o valor quanto o perigo. A ajuda oficial diz que você pode mandar uma mensagem ao Claude pelo celular e fazer com que ele trabalhe no seu computador de mesa, usando os mesmos conectores, plugins e acesso a arquivos que você já configurou no Cowork, dentro do que a Anthropic enquadra como uma conversa contínua acessível a partir de qualquer um dos aparelhos. Para funcionar, ele exige o PC acordado e com o aplicativo de desktop aberto, e o uso do computador tem suporte apenas em macOS e Windows, sem uso do computador no Linux. Mecanicamente ele desce por três níveis de prioridade: um conector, se houver um disponível; navegação no navegador, se não houver; e interação direta com a tela como último recurso, com capturas de tela tiradas pelo caminho para entender o que está exibido. A avaliação começa depois disso. Os lugares em que ele para são projetados: o uso do computador vem desligado por padrão e é habilitado em Settings, General; a permissão é pedida para cada novo aplicativo; excluir um arquivo em definitivo exige permissão explícita; e plataformas de investimento e negociação e aplicativos de criptomoedas estão fora de alcance por padrão. Mas há lugares em que ele não para. Ações individuais dentro de um aplicativo já aprovado não são confirmadas com você, e o texto oficial diz que o Claude clica, digita e navega na sua tela diretamente, sem as verificações de permissão que controlam as outras ferramentas do Cowork. A documentação acrescenta que não há sandbox entre o Claude e o que está na sua tela, e que ações tomadas em um aplicativo podem impactar outros aplicativos. O maior risco é a injeção de prompt, que a Anthropic descreve com as próprias palavras: o conteúdo da web é um vetor primário de ataques de injeção de prompt, e uma instrução manipulada, um comando inesperado ou um link de phishing aberto no seu navegador podem desencadear ações difíceis ou impossíveis de desfazer. A Anthropic diz que examina as ativações do modelo para detectar esse tipo de comportamento, mas isso reduz as chances em vez de eliminar a necessidade de você traçar uma linha, e a orientação continua mandando mudar para aprovação manual sempre que uma tarefa tocar arquivos, contas ou sites sensíveis. A Anthropic nomeia o limite sem meias-palavras: não dê à permissão de uso do computador acesso a aplicativos sensíveis, como os de bancos, saúde e governo, e evite contas financeiras, documentos jurídicos, informações médicas e dados pessoais. O artigo também cobre o lado do celular. O que vaza se você perder o aparelho não são os dados guardados nele, e sim a prerrogativa de instruir o seu PC, mais o conteúdo da conversa contínua — e a ajuda oficial do Dispatch não documenta desemparelhamento nem o que fazer com um aparelho perdido, então os remédios vêm do lado da conta: encerrar a sessão individual em Settings, Account, Active sessions; desconectar todas as sessões pelo claude.ai (o que não está disponível nos aplicativos móveis e portanto exige um navegador web); ou simplesmente cortar o lado do PC fechando o aplicativo de desktop ou deixando a máquina suspender, o que é de fato o mais rápido, já que o Dispatch precisa do PC acordado e do aplicativo aberto. Ele encerra separando o Dispatch do uso do computador como dois interruptores distintos, distinguindo ambos do agent view do Claude Code (que a documentação oficial também chama de dispatch) e traçando uma linha prática: comece por trabalho que dá para desfazer.

O agent view do Claude Code — como as sessões rodam em paralelo e por onde o isolamento vaza

O agent view do Claude Code — como as sessões rodam em paralelo e por onde o isolamento vaza

O agent view do Claude Code, aberto com claude agents, é o recurso para iniciar sessões independentes em segundo plano uma atrás da outra e gerenciá-las a partir de uma única tela. A documentação oficial chama de dispatch a operação que você executa ali, o que colide com o recurso homônimo e separado do aplicativo de desktop, então a primeira tarefa é distinguir os dois. A documentação descreve o agent view como o recurso que permite despachar e gerenciar muitas sessões do Claude Code a partir de uma só tela, e ele é um research preview que exige a v2.1.139 ou posterior. Este artigo fica no mecanismo e no modelo de segurança. A primeira surpresa é que cada prompt digitado na caixa de entrada inicia uma nova sessão própria: digite um segundo e você ganha uma segunda sessão ao lado da primeira, não uma instrução extra somada a ela. Instruções adicionais passam pelo painel de espiada, aberto com Space, que mostra a saída mais recente ou a pergunta pela qual a sessão está esperando em vez da transcrição inteira. O coração do modelo de segurança é o isolamento por worktree. Antes de editar qualquer arquivo, uma sessão em segundo plano se muda para um git worktree isolado dentro de .claude/worktrees/, de modo que sessões paralelas leem o mesmo checkout mas cada uma escreve no seu — leituras compartilhadas, escritas separadas. Tudo o que alcançaria o checkout principal é cortado por três verificações: edições de arquivo via Edit, Write e NotebookEdit; diretórios de trabalho de comandos que resolvem para o checkout principal ou que não dá para verificar que ficam fora dele; e tentativas de redirecionar o git via git -C, --git-dir, GIT_DIR, GIT_WORK_TREE ou um cd colocado antes da chamada do git. A decisão é deliberadamente tomada pelo lado seguro, recusando o que não pode ser verificado, e a mesma proteção é herdada por todo subagente que a sessão gerar. Não é um muro no nível do sistema operacional, porém: arquivos fora do repositório e a rede estão fora do escopo, e comandos do PowerShell recebem apenas a verificação do diretório de trabalho. As permissões também não são escolhidas na hora do dispatch; elas são herdadas do defaultMode daquele diretório, ou do permissionMode no frontmatter de um subagente despachado, o que significa que quanto mais frouxa for a sua configuração habitual, mais sessões sem supervisão e com permissões frouxas você cria de uma vez. Três coisas então vazam do isolamento. Escolher "Sim, não pergunte de novo" salva a regra no .claude/settings.local.json do checkout principal, então ela vale no checkout principal e em todos os outros worktrees e sobrevive à remoção do worktree em que foi criada. Excluir uma sessão no agent view exclui junto o worktree criado pelo Claude, de modo que trabalho não commitado desaparece — e o Ctrl+X para no primeiro toque e exclui no segundo. E o .worktreeinclude copia arquivos ignorados pelo git, como o .env, para todo worktree novo, multiplicando as suas credenciais pelo número de sessões que você despacha. Além disso, a cota se esgota em proporção ao paralelismo (dez agentes a consomem cerca de dez vezes mais rápido), e as sessões rodam localmente, sobrevivendo à suspensão mas parando quando a máquina é desligada. O artigo encerra situando o agent view entre as quatro formas oficiais de paralelizar, ao lado dos subagentes, dos agent teams e dos fluxos de trabalho dinâmicos, e dá uma rotina concreta para antes, durante e depois de um dispatch.

ChatGPT Work: o que é e como usar o agente do GPT-5.6

ChatGPT Work: o que é e como usar o agente do GPT-5.6

ChatGPT Work é o "agente de IA para o trabalho" que a OpenAI anunciou em 9 de julho de 2026, junto com o GPT-5.6. Diferente de um chat comum que só responde, ele reúne contexto dos seus apps e arquivos conectados para construir produtos finais prontos — documentos, planilhas, slides e até web apps. Seu cérebro é o novo carro-chefe GPT-5.6 Sol (construído sobre o Codex), e ele consegue dividir um projeto complexo em passos e seguir trabalhando por horas (Thurrott). Dentro do app desktop unificado, três modos convivem — Work (entregáveis), Codex (técnico, mostra os detalhes) e chat comum (conversa) — com o Work posicionado como a "versão de negócios" que esconde o detalhe técnico do Codex (9to5Mac). O modelo depende do seu plano: Grátis/Go usam Terra por padrão, enquanto Plus/Pro/Business/Enterprise escolhem entre Sol/Terra/Luna (conforme noticiado). Sua força é puxar "o seu contexto" via conectores como Google Drive, SharePoint e Slack, mais o MCP — e, para empresas, os dados não são usados para treinamento por padrão. Com base em Axios, TechCrunch, 9to5Mac, Thurrott e OpenAI, este artigo explica o que é o ChatGPT Work, como ele difere do ChatGPT comum e do Codex, quais planos podem usá-lo e a quais apps ele se conecta — com rótulos de confiança sobre o que ainda não é oficial.

GPT-5.6 Sol vs Gemini: agente vs multimodal — comparação completa

GPT-5.6 Sol vs Gemini: agente vs multimodal — comparação completa

Comparação entre o GPT-5.6 "Sol" da OpenAI e o Gemini do Google, cujos pontos fortes quase não se sobrepõem. O Sol é esmagador em codificação de terminal e agêntica (Terminal-Bench 88.8% vs 68.5%, SWE-bench Pro 64.6% vs 54.2%), enquanto o Gemini 3.1 Pro responde com multimodalidade nativa (voz e vídeo), preço cerca de metade e liderança em MMLU, ARC-AGI-2 e WebDev Arena. Como o verdadeiro adversário, o Gemini 3.5 Pro, ainda não estava disponível (previsto para meados de julho de 2026), este é um instantâneo do confronto com o Gemini 3.1 Pro — com escolha por caso de uso, custo e FAQ.

GPT-5.6 vs GPT-5.5: o que mudou e para qual modelo migrar (Luna/Terra/Sol)

GPT-5.6 vs GPT-5.5: o que mudou e para qual modelo migrar (Luna/Terra/Sol)

Dois meses e meio após o GPT-5.5, a OpenAI lançou o GPT-5.6 e a maior mudança não é desempenho: o carro-chefe único vira 3 modelos (Luna/Terra/Sol). O intermediário Terra entrega qualidade equivalente à do GPT-5.5 por muito menos: era metade do preço no lançamento e, com o corte de 30 de julho de 2026, passou a 40% do preço unitário ($2/$12). O Sol mantém $5/$30 e eleva o SWE-Bench Pro de 58.6 para 64.6% (estimado). Comparamos especificações, benchmarks e custo real (de $1,100 para $440 por mês no exemplo), e mostramos para qual modelo você deve migrar.

GPT-5.6 Sol vs Claude Fable 5: comparação completa — custo vs desempenho de topo

GPT-5.6 Sol vs Claude Fable 5: comparação completa — custo vs desempenho de topo

Comparação entre o Claude Fable 5, topo de linha da Anthropic, e o GPT-5.6 Sol, flagship da OpenAI pela metade do preço. O Fable 5 domina a codificação de produção real (SWE-Bench Pro 80.3% vs 64.6% estimado do Sol) e a autonomia de até 12 horas, com a migração de 50 milhões de linhas da Stripe em 1 dia. O Sol lidera operação de terminal (TerminalBench 88.8%), capacidade agentiva geral e eficiência de tokens, custando cerca de metade ($5/$30 vs $10/$50). Veja como escolher por custo, taxa de sucesso e caso de uso.

GPT-5.6 Sol vs Claude Opus 4.8: comparação completa de benchmarks, programação, preço e como escolher

GPT-5.6 Sol vs Claude Opus 4.8: comparação completa de benchmarks, programação, preço e como escolher

Uma comparação detalhada dos dois gigantes da programação com IA de 2026, Claude Opus 4.8 (28 de maio) e o topo de linha do GPT-5.6, o Sol (9 de julho). Suas forças são quase opostas: o Sol lidera na operação de terminal e na capacidade agêntica geral (TerminalBench 2.1 88.8% vs Opus 78.9%, Agents' Last Exam 53.6, Coding Agent Index 80), enquanto o Opus 4.8 lidera na programação de nível de produção, matemática e contexto longo (SWE-bench Pro 69.2% vs Sol 64.6%, USAMO 2026 96.7%, GraphWalks 1M 68.1%) e coloca a honestidade em primeiro plano (excesso de confiança reduzido a um décimo, 0% de relato de resultados falhos sem crítica). A OpenAI ainda deixa muitos benchmarks do Sol sem divulgar (SWE-bench Pro, GPQA, AIME, MMLU), então, na fortaleza da programação, o Opus, já divulgado, leva vantagem. Cobrimos a tabela de especificações, os detalhes dos benchmarks, o problema dos benchmarks não divulgados, o custo real ($25 vs $30 de preço unitário vs +54% de eficiência de tokens), um mapa de forças e fraquezas, escolhas por caso de uso e uma estratégia de dois fornecedores.

Lançamento do GPT-5.6: guia completo — Luna/Terra/Sol, benchmarks, preços e vs. Claude

Lançamento do GPT-5.6: guia completo — Luna/Terra/Sol, benchmarks, preços e vs. Claude

A OpenAI disponibilizou o GPT-5.6 de forma geral em 9 de julho de 2026, substituindo a antiga estrutura "padrão + Pro" por uma linha de três modelos: Luna (rápido e barato, $0.20/$1.20), Terra (equilibrado, $2/$12, equivalente ao GPT-5.5 por 40% do preço unitário do Sol) e Sol (carro-chefe, $5/$30) — preços após a revisão de 30 de julho de 2026. O Sol assume o primeiro lugar no Agents' Last Exam (53.6) e no Coding Agent Index (80), e seus 88.8% no TerminalBench 2.1 superam o Claude Fable 5 (86.0%) — mas na programação de nível de produção do SWE-Bench Pro, o Claude Fable 5 lidera com folga, 80.0% contra 64.6% do Sol. Este artigo cobre as diferenças entre os três modelos, os preços, os benchmarks, os novos recursos (Programmatic Tool Calling, ChatGPT Work e o modelo de voz full-duplex GPT-Live), a disponibilidade por plano do ChatGPT, a comparação com o Claude (Fable 5 / Opus 4.8) e como escolher conforme o uso — tudo baseado no anúncio oficial da OpenAI e em benchmarks independentes.