Pular para o conteúdo
Tópicos

Desenvolvimento com IA e Programação: Crie Apps

Desenvolva melhor com IA. Guias de geração de código, criação de apps, depuração e automação.

97 artigos

Ordene os artigos para encontrar o que precisa

Artigos em Dev IA e Programação

O limite semanal do Claude Code reseta mesmo a cada 7 dias? Investigando a recuperação antecipada (setembro de 2026)

O limite semanal do Claude Code reseta mesmo a cada 7 dias? Investigando a recuperação antecipada (setembro de 2026)

Você atingiu o limite semanal de tokens do Claude Code, mas a cota foi totalmente reabastecida antes de passarem sete dias — mais de uma vez. Na internet há até textos sobre um "mecanismo secreto" alegando que o limite semanal reseta a cada 72 horas. Isso é verdade? Este artigo rastreia o fenômeno até as fontes primárias. Mas a Anthropic não documentou o mecanismo interno de reset, e os limites seguem mudando, então rotulamos claramente três tipos de informação: fatos verificáveis em fontes oficiais, eventos que vários usuários observam de forma reproduzível mas sobre os quais a Anthropic nunca se pronunciou, e especulação de fonte única, não confirmada. O ponto central: a recuperação total antecipada é, na maioria dos casos, os resets globais irregulares da Anthropic (anunciados repetidamente pela @ClaudeDevs); o horário de reset exibido também é comprovadamente instável; e a "cadência de 72 horas" que circula vem de um único observador, sem replicação e contradita por outra observação (24h), então não pode ser tomada como fato. Quando algo não pode ser afirmado, nós dizemos isso — uma investigação de julho de 2026.

O Que É um LLM Gateway (Proxy)? Uma API para Todo Provedor — Guia 2026

O Que É um LLM Gateway (Proxy)? Uma API para Todo Provedor — Guia 2026

Você construiu sobre a OpenAI, depois quis testar o Claude e comparar o Gemini — e perdeu horas com os SDKs, formatos e tratamentos de erro diferentes por provedor. Um LLM gateway (AI gateway / LLM proxy) é um relay que você encaixa entre a sua aplicação e os provedores: ele expõe uma única API compatível com OpenAI para alcançar todos os modelos e assume as tarefas transversais — fallback, controle de custos, chaves virtuais, cache, rate limiting e observabilidade. Este guia cobre por que você precisa de um, o que um gateway realmente é, os três tipos (proxy self-hosted = LiteLLM / hospedado = OpenRouter / SDK = Vercel AI SDK), como escolher entre LiteLLM, OpenRouter e o Vercel AI SDK, o código de configuração mínima que só troca o endpoint, e os limites — um salto de latência, o gateway como novo ponto de falha, taxas (o OpenRouter cobra 5,5% sobre compras), perda de recursos e privacidade.

Como Criar Evals para Agentes de IA: Passos, Armadilhas e Ferramentas (2026)

Como Criar Evals para Agentes de IA: Passos, Armadilhas e Ferramentas (2026)

Depois de construir um agente de IA, você sempre esbarra no mesmo muro: "Certo, mas será que funciona de verdade?" O mecanismo que decide se uma mudança de prompt ou modelo deixou as coisas melhores ou piores com dados em vez de intuição são os evals. LLMs produzem uma saída diferente a cada vez para a mesma entrada, então testes unitários de correspondência exata não se encaixam. Este artigo se concentra nos passos para criar e rodar evals na prática, cobrindo cinco formas de medir a qualidade (① correspondência com o gabarito ② verificações baseadas em regras ③ LLM-as-judge ④ teste de regressão ⑤ monitoramento em produção), avaliação específica de agentes (taxa de sucesso da tarefa, chamadas de ferramenta corretas, trajetória, custo), como começar pequeno a partir de 20 exemplos de falha, armadilhas comuns e ferramentas principais (Anthropic Console/Evals, OpenAI Evals, LangSmith, Langfuse, Ragas) — escrito para quem põe a mão na massa.

Agentes de IA vs RPA: a diferença e quando usar cada um (2026)

Agentes de IA vs RPA: a diferença e quando usar cada um (2026)

A eterna pergunta da automação: "agentes de IA ou RPA?" A resposta não é um ou outro — escolha pelo papel, e o padrão vencedor de 2026 é um híbrido dos dois. O RPA são "mãos" determinísticas que executam um procedimento fixo de forma rápida e precisa (mas quebram quando a tela/especificação muda); um agente de IA é um "cérebro" probabilístico que lê a situação e decide (forte diante de ambiguidade e exceções, mas não idêntico a cada vez). Este artigo cobre a diferença de princípio de funcionamento, uma tabela comparativa (o trade-off entre reprodutibilidade e resistência à mudança), como escolher (o eixo é "dá para escrever tudo como regras?" — sim → RPA, julgamento que você não consegue escrever → agente de IA), a tendência de 2026 (os líderes de RPA UiPath, Automation Anywhere, Blue Prism tornando-se agênticos — convergência; a pergunta já não é "qual dos dois", mas "onde deve morar o raciocínio" = orquestração primeiro) e a resposta prática: um híbrido em que o cérebro (agente de IA) cuida do julgamento/orquestração e as mãos (RPA) executam a parte determinística — não coloque um agente onde se exige determinismo e combine o julgamento delegado com guardrails e aprovação humana. Com base nas informações oficiais dos fornecedores, com um FAQ.

Claude Fable 5 vs Opus 5: qual usar e quando? Um guia prático

Claude Fable 5 vs Opus 5: qual usar e quando? Um guia prático

O Claude Fable 5 e o Opus 5 são ambos de topo, mas a resposta não é nem "sempre o Fable 5" nem "sempre o Opus 5" — escolha pela tarefa. E a chegada do Opus 5 em 24 de julho de 2026 mudou bastante essa resposta: a geração anterior, o Opus 4.8, era "um degrau abaixo do Fable 5, mas pela metade do preço", enquanto o Opus 5 mantém o mesmo preço de $5 / $25 e ainda empata ou supera o Fable 5 nos benchmarks agênticos (Frontier-Bench 43,3% vs 33,7% e OSWorld 2.0 70,6% vs 66,1%, ambos de origem jornalística; no CursorBench 3.2 a Anthropic afirma que ele fica a menos de 0,5% do Fable 5 por cerca de metade do custo). O raciocínio mais difícil em uma única passada ainda pende para o Fable 5, mas por pouco — Humanity's Last Exam 56,5% vs 56,3% e DeepSWE v1.1 69,7% vs 68,8% (origem jornalística). As especificações coincidem na janela de contexto de 1M e na saída máxima de 128K; o modo rápido (cerca de 2,5x) é exclusivo do Opus 5, mas custa 2x e só funciona na API da Claude, e o Opus 5 traz o corte de conhecimento mais recente, de maio de 2026. O fluxo de decisão: teste primeiro o Opus 5 e escale para o Fable 5 apenas onde ele estaciona. Na prática, "Opus 5 como base, Fable 5 para as partes difíceis" é o ideal, apoiado pela troca automática do aplicativo em bloqueios de segurança e pelo novo modo "default" de fallback da API. Cobre disponibilidade (suspensão em junho, reimplantação em julho), como evitar a dependência de um único modelo, ajuste de effort para custo e um FAQ — ligando o cluster do Fable 5 ao guia de lançamento do Opus 5.

Frameworks de Agentes de IA Comparados 2026: LangGraph, CrewAI, AutoGen, OpenAI, Google, Claude — Qual Escolher?

Frameworks de Agentes de IA Comparados 2026: LangGraph, CrewAI, AutoGen, OpenAI, Google, Claude — Qual Escolher?

O primeiro obstáculo ao colocar um agente de IA em trabalho real é "em qual framework construí-lo". Da ótica do desenvolvedor e de quem seleciona a tecnologia, este artigo compara seis frameworks principais — LangGraph, CrewAI, AutoGen (integrado ao Microsoft Agent Framework, GA em abril de 2026), OpenAI Agents SDK, Google ADK e Claude Agent SDK — por abordagem de orquestração (grafo dirigido / crew baseada em papéis / GroupChat conversacional / handoffs / árvore hierárquica / laço autônomo de ferramentas), linguagem, curva de aprendizado, controle, maturidade em produção, custo de tokens e caso de uso ideal. A ressalva central: o framework "mais rápido de prototipar" (CrewAI) pode ser o mais caro em produção — cerca de 3× os tokens (41k contra 18,5k do LangGraph em um benchmark) e não determinístico, o que o torna inadequado para finanças e saúde. Também explica como 2026 trouxe interoperabilidade via MCP (ferramentas) e A2A (agente a agente), de modo que agentes de frameworks diferentes agora trabalham juntos e o lock-in desapareceu. Inclui um guia de seleção por caso de uso e FAQ.

Ollama: o guia completo para iniciantes em LLM local [2026]

Ollama: o guia completo para iniciantes em LLM local [2026]

O Ollama é a ferramenta de referência para começar com LLMs locais: ele cuida de quase toda a configuração trabalhosa para que você baixe um modelo e converse com um único comando. Este guia para iniciantes percorre tudo do começo ao fim — instalação no Windows, Mac e Linux, os comandos essenciais, como obter e escolher modelos pelo tamanho e pela VRAM, usar uma GUI como o Open WebUI, integrar a API local (inclusive a compatível com OpenAI) aos seus próprios apps, personalizar com Modelfile e variáveis de ambiente, além de soluções para os problemas mais comuns.

Os melhores modelos de LLM local: comparação por uso, tamanho e país [2026]

Os melhores modelos de LLM local: comparação por uso, tamanho e país [2026]

Um guia prático para escolher qual modelo de LLM local instalar em 2026, organizado por desenvolvedor, país de origem, caso de uso, tamanho e licença. Cobre as principais famílias (Qwen, Llama, Gemma, DeepSeek, Mistral, Phi, GLM) e destaca modelos focados em português e regionais — Sabiá e Tucano (Brasil), Albertina e Gervásio (Portugal) —, além de modelos multilíngues fortes bem ajustados ao português, com recomendações por VRAM e alertas de licenciamento para uso comercial.

Requisitos de hardware para LLM local: a VRAM é tudo [2026]

Requisitos de hardware para LLM local: a VRAM é tudo [2026]

Quer rodar um LLM local mas não sabe se o seu PC dá conta? Cerca de 90% da especificação se resume à VRAM (a memória da GPU). Este guia traz uma tabela rápida de VRAM por tamanho de modelo, uma fórmula simples, a armadilha do cache KV que cresce com o contexto, velocidades realistas por GPU e Mac, e três níveis de configuração por orçamento. Com o jargão ao mínimo, até iniciantes descobrem qual hardware comprar.

LLM local vs LLM em nuvem: as diferenças e a distância de desempenho [2026]

LLM local vs LLM em nuvem: as diferenças e a distância de desempenho [2026]

Um LLM local que você roda no próprio PC ou LLMs em nuvem como Claude, ChatGPT e Gemini — ambos são "LLMs", mas diferem em desempenho, custo, privacidade e esforço. Este artigo coloca tudo lado a lado em uma única comparação e mostra com honestidade até onde a mal compreendida "diferença de desempenho" diminuiu em 2026, hoje desprezível para muitos casos de uso. Em seguida, ele guia você pela escolha na ordem confidencialidade → qualidade → volume, com um guia de decisão prático. Para a maioria das pessoas, a resposta é o híbrido: o local para o trabalho confidencial e rotineiro, a nuvem para as partes mais difíceis.

O que são Agent Evals? Medindo o resultado e a trajectory

O que são Agent Evals? Medindo o resultado e a trajectory

As avaliações de agentes são o processo de medir sistematicamente se um agente — que usa ferramentas e dá várias etapas para atingir um objetivo — consegue de fato cumprir suas tarefas. Elas são uma evolução das avaliações de LLM, expandindo o alvo de "uma saída" para "uma sequência de ações". Como um agente planeja, chama ferramentas e atualiza o estado, a saída final sozinha não basta; o Google observa que é preciso entender o "porquê" por trás das ações de um agente e divide a avaliação em resposta final e trajectory. As cinco dimensões são: resultado (sucesso da tarefa, julgado pelo estado final — se existe uma reserva no DB, não a fala "fiz a reserva"), trajectory (etapas razoáveis, ferramentas certas na ordem certa), correção do uso de ferramentas (ferramenta e argumentos certos, verificando nomes e tipos de funções), eficiência (etapas, tokens, custo, latência — muitas vezes sinais de observabilidade trazidos para a avaliação) e qualidade da resposta final (via LLM-as-judge ou uma rubrica). Os avaliadores são código (rápido/barato/reproduzível, mas frágil), LLM-as-judge (flexível, mas não determinístico e precisa de calibração) e humano (padrão-ouro, mas caro — evite se possível). A Anthropic recomenda pontuar o resultado, não o caminho: a correspondência mecânica de trajectory é "rígida e frágil demais" porque os agentes encontram alternativas válidas, enquanto Google e Microsoft oferecem métricas de correspondência de trajectory para diagnosticar falhas. As armadilhas exclusivas são o não determinismo (pass^k), os erros que se acumulam (p^t), o reward hacking (o braço robótico da DeepMind fingindo agarrar) e os conjuntos de avaliação obsoletos ou contaminados. A jogada prática, segundo a Anthropic: transformar 20 a 50 falhas de produção em casos de teste, executar pontuação automatizada no CI, separar avaliações de capacidade e de regressão e escrevê-las cedo. Benchmarks como SWE-bench, tau-bench, WebArena, GAIA, OSWorld e BFCL são referências úteis (as pontuações variam por versão, então não as tome ao pé da letra). Com base em informações oficiais, com as incertezas sinalizadas.