Aller au contenu
Thèmes

Agents IA et automatisation : RAG, workflows, guides

Comprenez les agents IA, le RAG et les workflows d'automatisation. Des concepts aux applications concrètes.

45 articles

Triez les articles pour trouver ce que vous cherchez

Articles dans Agents IA et automatisation

ChatGPT Work : comment l'utiliser (agent GPT-5.6)

ChatGPT Work : comment l'utiliser (agent GPT-5.6)

ChatGPT Work est l'« agent d'IA pour le travail » qu'OpenAI a annoncé le 9 juillet 2026 en même temps que GPT-5.6. Contrairement à un chat classique qui se contente de répondre, il rassemble le contexte de vos applis et fichiers connectés pour construire des livrables finis — documents, feuilles de calcul, diapositives et même applis web. Son cerveau est le nouveau modèle phare GPT-5.6 Sol (bâti sur Codex), et il peut découper un projet complexe en étapes et continuer à travailler pendant des heures (Thurrott). Au sein de l'appli de bureau unifiée, trois modes cohabitent — Work (livrables), Codex (technique, affiche les détails) et chat classique (conversation) — Work étant positionné comme la « version business » qui masque les détails techniques de Codex (9to5Mac). Le modèle dépend de votre forfait : Gratuit/Go par défaut sur Terra, tandis que Plus/Pro/Business/Enterprise choisissent parmi Sol/Terra/Luna (d'après les médias). Sa force est d'intégrer « votre contexte » via des connecteurs comme Google Drive, SharePoint et Slack, plus MCP — et pour l'entreprise, les données ne sont pas utilisées pour l'entraînement par défaut. En s'appuyant sur Axios, TechCrunch, 9to5Mac, Thurrott et OpenAI, cet article expose ce qu'est ChatGPT Work, en quoi il diffère du ChatGPT classique et de Codex, quels forfaits peuvent l'utiliser et à quelles applis il se connecte — avec des labels de confiance sur ce qui n'est pas encore officiel.

GPT-5.6 Sol vs Gemini 3.1 Pro : codage agentique contre multimodal natif

GPT-5.6 Sol vs Gemini 3.1 Pro : codage agentique contre multimodal natif

Comparaison entre le fleuron d'OpenAI GPT-5.6 « Sol » (9 juillet 2026) et Gemini de Google, dont les points forts ne se recoupent presque pas. Sol domine le codage en terminal et agentique (Terminal-Bench 2.1 88,8 % vs 68,5 %, SWE-bench Pro 64,6 % vs 54,2 %), tandis que Gemini 3.1 Pro riposte par un multimodal natif voix/vidéo, un prix environ moitié moins cher et une avance en MMLU, ARC-AGI-2 et WebDev Arena. Attention au facteur temporel : le véritable rival Gemini 3.5 Pro n'est pas encore sorti (disponibilité générale prévue à la mi-juillet). Nous détaillons les benchmarks, le multimodal, le coût réel et le choix selon l'usage.

GPT-5.6 vs GPT-5.5 : ce qui change et vers quel modèle migrer (Luna/Terra/Sol)

GPT-5.6 vs GPT-5.5 : ce qui change et vers quel modèle migrer (Luna/Terra/Sol)

Deux mois et demi après GPT-5.5, GPT-5.6 ne fait pas que gagner en performance : il remplace le modèle phare unique par un dispositif à 3 modèles (Luna/Terra/Sol). L'élément le plus décisif est Terra, qui offre une qualité équivalente à GPT-5.5 pour bien moins cher : moitié prix au lancement, puis 40 % du prix unitaire de GPT-5.5 ($2/$12) depuis la baisse du 30 juillet 2026. Sol, lui, reste à $5/$30 en améliorant le codage (SWE-Bench Pro 58,6→64,6 %, estimé). Cet article compare specs, benchmarks et coût réel, et explique vers quel modèle basculer.

GPT-5.6 Sol vs Claude Fable 5 : comparatif détaillé — coût, benchmarks et autonomie longue durée

GPT-5.6 Sol vs Claude Fable 5 : comparatif détaillé — coût, benchmarks et autonomie longue durée

Le fleuron d'OpenAI GPT-5.6 « Sol » face au haut de gamme d'Anthropic Claude Fable 5 : un arbitrage entre coût et performance. Fable 5 domine le codage de niveau production (SWE-Bench Pro 80,3 %) et l'autonomie jusqu'à 12 h, avec la migration Stripe de 50 millions de lignes en un jour. Sol l'emporte sur TerminalBench (88,8 %), l'Agents' Last Exam et la polyvalence d'agent, tout en coûtant moitié moins ($5/$30 vs $10/$50). À l'appui des annonces officielles et de benchmarks indépendants, comment répartir l'usage de ces deux poids lourds asymétriques.

GPT-5.6 Sol vs Claude Opus 4.8 : comparaison approfondie des benchmarks, du codage, du prix et du choix

GPT-5.6 Sol vs Claude Opus 4.8 : comparaison approfondie des benchmarks, du codage, du prix et du choix

Comparaison approfondie des deux géants du codage par IA de 2026, Claude Opus 4.8 (28 mai) et le modèle haut de gamme Sol de GPT-5.6 (9 juillet). Leurs forces sont quasiment opposées : Sol domine l'opération de terminal et la puissance agentique globale (TerminalBench 2.1 88,8 % vs Opus 78,9 %, Agents' Last Exam 53,6, Coding Agent Index 80), tandis qu'Opus 4.8 domine le codage de niveau production, les mathématiques et le long contexte (SWE-bench Pro 69,2 % vs Sol 64,6 %, USAMO 2026 96,7 %, GraphWalks 1M 68,1 %) et met en avant l'honnêteté (confiance excessive divisée par dix, 0 % de rapport non critique de résultats défectueux). OpenAI laisse aussi beaucoup de benchmarks de Sol non publiés (SWE-bench Pro, GPQA, AIME, MMLU) : sur le cœur du codage, l'Opus déjà divulgué a l'avantage. Nous couvrons le tableau des spécifications, le détail des benchmarks, le problème des benchmarks non publiés, le coût réel ($25 vs $30 de prix unitaire face à +54 % d'efficacité en tokens), une carte des forces et faiblesses, des choix par cas d'usage et une stratégie à double fournisseur.

Sortie de GPT-5.6 : le guide complet — Luna/Terra/Sol, benchmarks, tarifs et face à Claude

Sortie de GPT-5.6 : le guide complet — Luna/Terra/Sol, benchmarks, tarifs et face à Claude

OpenAI a lancé GPT-5.6 en disponibilité générale le 9 juillet 2026, remplaçant l'ancienne structure « standard + Pro » par une gamme à trois modèles : Luna (rapide, économique, $0.20/$1.20), Terra (équilibré, $2/$12, équivalent GPT-5.5 à 40 % du prix unitaire de Sol) et Sol (fleuron, $5/$30) — tarifs après la révision du 30 juillet 2026. Sol prend la première place sur l'Agents' Last Exam (53,6) et le Coding Agent Index (80), et ses 88,8 % sur TerminalBench 2.1 devancent Claude Fable 5 (86,0 %) — mais sur le SWE-Bench Pro de niveau production, Claude Fable 5 domine nettement avec 80,0 % contre 64,6 % pour Sol. Cet article couvre les différences entre les trois modèles, les prix, les benchmarks, les nouveautés (Programmatic Tool Calling, ChatGPT Work, le modèle vocal full-duplex GPT-Live), la disponibilité par forfait ChatGPT, la comparaison avec Claude (Fable 5 / Opus 4.8) et le choix selon l'usage — le tout fondé sur l'annonce officielle d'OpenAI et des benchmarks indépendants.

Qu'est-ce qu'une passerelle LLM (proxy) ? Une API pour tous les fournisseurs — Guide 2026

Qu'est-ce qu'une passerelle LLM (proxy) ? Une API pour tous les fournisseurs — Guide 2026

Vous avez construit sur OpenAI, puis voulu essayer Claude et comparer Gemini — et perdu des heures à cause des SDK, formats et gestions d'erreurs différents par fournisseur. Une passerelle LLM (passerelle IA / proxy LLM) est un relais que vous glissez entre votre application et les fournisseurs : elle expose une seule API compatible OpenAI pour atteindre tous les modèles et prend en charge les tâches transversales — bascule, suivi des coûts, clés virtuelles, mise en cache, limitation de débit et observabilité. Ce guide couvre pourquoi vous en avez besoin, ce qu'une passerelle est vraiment, les trois types (proxy auto-hébergé = LiteLLM / hébergé = OpenRouter / SDK = Vercel AI SDK), comment choisir parmi LiteLLM, OpenRouter et le Vercel AI SDK, le code de configuration minimal qui ne remplace que le point de terminaison, et les limites — un saut de latence, la passerelle comme nouveau point de défaillance, les frais (OpenRouter facture 5,5 % sur les achats), la perte de fonctionnalités et la confidentialité.

Evals d'agents IA : 5 façons de mesurer la qualité (2026)

Evals d'agents IA : 5 façons de mesurer la qualité (2026)

Après avoir construit un agent IA, on se heurte toujours au même mur : « D'accord, mais est-ce que ça marche vraiment ? » Le mécanisme qui permet de décider si un changement de prompt ou de modèle a rendu les choses meilleures ou pires avec des données plutôt qu'au feeling, ce sont les evals. Les LLM produisent une sortie différente à chaque fois pour la même entrée, si bien que les tests unitaires à correspondance exacte collent mal. Cet article couvre ce que sont les evals, cinq façons de mesurer la qualité (① correspondance à la vérité terrain ② vérifications par règles ③ LLM-as-judge ④ tests de régression ⑤ surveillance en production), l'évaluation propre aux agents (taux de réussite des tâches, appels d'outils corrects, trajectoire, coût), comment démarrer petit à partir de 20 exemples d'échec, les pièges courants et les outils clés (Anthropic Console/Evals, OpenAI Evals, LangSmith, Langfuse, Ragas) — écrit pour les praticiens.

Agents IA vs RPA : la différence et quand utiliser chacun (2026)

Agents IA vs RPA : la différence et quand utiliser chacun (2026)

La question éternelle de l'automatisation : « agents IA ou RPA ? » La réponse n'est pas l'un ou l'autre — on choisit selon le rôle, et le schéma gagnant de 2026 est un hybride des deux. La RPA, ce sont des « mains » déterministes qui exécutent une procédure fixe vite et avec précision (mais qui cassent quand l'écran/la spécification change) ; un agent IA est un « cerveau » probabiliste qui lit la situation et décide (solide sur l'ambiguïté et les exceptions, mais pas identique à chaque fois). Cet article couvre la différence de principe de fonctionnement, un tableau comparatif (le compromis reproductibilité-vs-résistance), la manière de choisir (l'axe est « peut-on l'écrire entièrement en règles ? » — oui → RPA, jugement impossible à formaliser → agent IA), la tendance 2026 (les leaders de la RPA UiPath, Automation Anywhere et Blue Prism deviennent agentiques — convergence ; la question n'est plus « lequel » mais « où placer le raisonnement » = orchestration d'abord), et la réponse pratique : un hybride où le cerveau (agent IA) gère le jugement/l'orchestration et les mains (RPA) assurent l'exécution déterministe — ne placez pas d'agent là où le déterminisme est requis, et associez le jugement délégué à des garde-fous et à une validation humaine. Sur la base des informations officielles des éditeurs, avec une FAQ.

Comment laisser l'IA gérer AWS : méthodes, avantages et inconvénients (2026)

Comment laisser l'IA gérer AWS : méthodes, avantages et inconvénients (2026)

Peut-on confier l'exploitation d'AWS à l'IA ? En 2026, on peut déléguer beaucoup. AWS propose lui-même Amazon Q Developer et l'Agent Toolkit for AWS (mai 2026 — plus de 40 compétences d'agent + un AWS MCP Server managé + des plugins), de sorte que l'IA peut aller de la génération d'IaC à l'exploitation des ressources. Ce guide cadre la « délégation » en trois niveaux (① génération de code/IaC, ② exploitation/investigation orientée lecture, ③ un agent autonome qui exploite réellement AWS), présente les principaux outils (Amazon Q Developer, Agent Toolkit, AWS MCP Server, Terraform MCP, Bedrock AgentCore) — dont la voie « apportez le vôtre » consistant à donner l'AWS CLI à Claude Code ou Codex pour exécuter « aws » depuis le shell — les avantages (IaC rapide, triage automatisé, idées d'optimisation des coûts, savoir démocratisé), puis le vrai enjeu, les inconvénients (prolifération des permissions IAM, le surdimensionnement comme amplificateur de rayon d'impact des erreurs/injections de prompt, permissions qui survivent à la tâche, emballement des coûts — avec de vrais incidents de suppression de BDD de prod en 2025-26), en s'appuyant sur des sources officielles AWS et d'éditeurs de sécurité. La clé : la question n'est pas « est-ce possible ? » mais « comment déléguer sans emballement ni explosion de la facture » — et le fait qu'AWS ait lui-même intégré garde-fous IAM, audit CloudTrail et bac à sable dans l'Agent Toolkit donne la forme de la réponse. Inclut les cinq principes (IAM au moindre privilège, approbation humaine pour les opérations destructrices, observabilité, identifiants JIT à durée de vie courte, bac à sable) et une FAQ.

Frameworks d'agents IA comparés 2026 : LangGraph, CrewAI, AutoGen, OpenAI, Google, Claude — Lequel choisir ?

Frameworks d'agents IA comparés 2026 : LangGraph, CrewAI, AutoGen, OpenAI, Google, Claude — Lequel choisir ?

Le premier obstacle pour intégrer un agent IA à un travail réel est « sur quel framework le construire ». Du point de vue d'un développeur et d'un décideur technique, cet article compare six frameworks majeurs — LangGraph, CrewAI, AutoGen (fondu dans le Microsoft Agent Framework, GA avril 2026), OpenAI Agents SDK, Google ADK et Claude Agent SDK — selon l'approche d'orchestration (graphe orienté / équipe par rôles / GroupChat conversationnel / passations / arborescence hiérarchique / boucle d'outils autonome), le langage, la courbe d'apprentissage, le contrôle, la maturité en production, le coût en tokens et le cas d'usage le mieux adapté. La mise en garde clé : le framework le plus « rapide à prototyper » (CrewAI) peut être le plus coûteux en production — environ 3× les tokens (41k contre 18,5k pour LangGraph dans un benchmark) et non déterministe, ce qui le rend peu adapté à la finance et à la santé. Il explique aussi comment 2026 a apporté l'interopérabilité via MCP (outils) et A2A (agent à agent), permettant aux agents de frameworks différents de coopérer et faisant disparaître le verrouillage. Inclut un guide de sélection par cas d'usage et une FAQ.

Qu'est-ce que l'observabilité de l'IA ? Monitoring et tracing des LLM et des agents, pour débutants

Qu'est-ce que l'observabilité de l'IA ? Monitoring et tracing des LLM et des agents, pour débutants

L'observabilité de l'IA rend visible ce que font réellement les LLM et les agents en production : quels outils, quelles recherches, ce qui est renvoyé, en combien de temps et à quel coût. Contrairement au monitoring classique, l'IA peut renvoyer 200 OK en 50ms et halluciner avec aplomb : la plupart des défaillances sont des problèmes de qualité, pas d'infrastructure. Trois piliers : traces, metrics, logs. On distingue observabilité (ce qui s'est passé) et évaluation (la réponse est-elle bonne), à utiliser en duo. Outils : LangSmith, Langfuse, Arize Phoenix, MLflow, AgentOps et le standard OpenTelemetry.