Aller au contenu
Thèmes

Agents IA et automatisation : RAG, workflows, guides

Comprenez les agents IA, le RAG et les workflows d'automatisation. Des concepts aux applications concrètes.

50 articles

Triez les articles pour trouver ce que vous cherchez

Articles dans Agents IA et automatisation

Qu'est-ce que Jev ? Usages, tarifs et limites de l'IA de décision de TypeSafe

Qu'est-ce que Jev ? Usages, tarifs et limites de l'IA de décision de TypeSafe

Jev est le modèle d'IA de TypeSafe qui renvoie des choix, des scores et des probabilités Oui/Non au lieu de générer du texte. Ce guide explique les différences entre Choice, Score et Noul, le sens de confidence et la structure d'une requête d'API pour orienter les demandes d'assistance. Une garantie de type ne garantit pas une décision correcte. Il couvre les faiblesses documentées concernant les calculs, les dates et les entrées trompeuses, ainsi que les tarifs, les deux limites d'entrée et l'évaluation avant un usage en japonais. Il repose sur des sources officielles, pas sur des tests pratiques des performances de l'API.

Ce qu'est Claude Code Projects : comment Claude répartit les threads, qui y a droit, l'exigence GitHub et le coût en tokens

Ce qu'est Claude Code Projects : comment Claude répartit les threads, qui y a droit, l'exigence GitHub et le coût en tokens

Projects dans Claude Code a été reconstruit. Jusqu'ici, un projet était un dossier contenant des conversations et de la matière de référence ; les nouveaux Projects sont une conversation unique. Vous écrivez ce dont vous avez besoin, Claude découpe la demande en threads, les threads tournent en parallèle dans le cloud, et chacun ouvre une pull request et rend compte une fois terminé. Fermer votre ordinateur portable ne les arrête pas. Trois points méritent toutefois d'être vérifiés avant de se lancer : les comptes qui peuvent s'en servir restent limités (bêta publique Pro et Max, servie d'abord aux comptes sans projets existants), github.com et la Claude GitHub App sont en pratique indispensables, et la vitesse à laquelle la fonctionnalité dévore votre limite d'usage n'a rien à voir avec celle d'une session unique. Cet article explique comment savoir si le déploiement vous est parvenu, ce qu'un thread possède au démarrage, y compris le piège qui fait cesser d'appliquer les règles de permission et les hooks dès qu'un projet contient plus d'un dépôt, d'où vient le coût en tokens, réglage Opus en high par défaut compris, et comment choisir entre les cinq façons de travailler en parallèle : sous-agents, agent view, équipes d'agents, workflows dynamiques et Projects, le tout à partir de la documentation et du blog officiels.

GPT-6 Astra en low est-il vraiment moins cher ? Tokens, coût et vitesse mesurés face à GPT-5.6 Sol en high

GPT-6 Astra en low est-il vraiment moins cher ? Tokens, coût et vitesse mesurés face à GPT-5.6 Sol en high

Un modèle plus récent est plus intelligent mais plus cher : c'est ainsi que l'on raisonne d'habitude. Pourtant, comparer GPT-6 Astra et GPT-5.6 Sol sur le seul prix unitaire ne tranche rien, parce qu'Astra termine le même travail avec moins de tokens. Dans les mesures de l'organisme indépendant Artificial Analysis, faire tourner Astra à son réglage le plus faible, low, coûte presque exactement ce que coûte Sol en high pour une tâche ($0.82 contre $0.81) tout en obtenant un meilleur score (46 contre 42), avec un tiers des tokens de sortie et un quart de l'attente avant que la réponse ne commence. À partir des chiffres au 18 septembre 2026, cet article couvre le coût, les tokens et la vitesse à chaque niveau de raisonnement, le détail qui explique pourquoi un prix unitaire 2,5 fois plus élevé aboutit malgré tout au même total, ce que deviennent les chiffres une fois le prix promotionnel de Sol terminé, la façon dont l'écart de prix se resserre sur le travail d'agent de codage, et les étapes pour mesurer tout cela sur votre propre travail.

GPT-6 Astra : le guide complet de la sortie — tarifs, accès par abonnement, changements de migration et face à Claude

GPT-6 Astra : le guide complet de la sortie — tarifs, accès par abonnement, changements de migration et face à Claude

OpenAI a publié GPT-6 Astra le 3 septembre 2026. L'API est disponible pour tous sans restriction d'accès, l'identifiant du modèle est gpt-6-astra, la fenêtre de contexte atteint 1,050,000 tokens, le tarif est de $10 en entrée / $50 en sortie par million de tokens et la coupure des connaissances est fixée au 30 avril 2026. Sauf que « le modèle est sorti » et « votre abonnement y donne accès » sont deux choses différentes : sur ChatGPT Plus, il n'apparaît pas dans la conversation habituelle, et la porte d'entrée reste ChatGPT Work et Codex. Cet article passe en revue la disponibilité plan par plan, la bonne façon de raisonner sur des tarifs deux fois plus élevés qui peuvent malgré tout revenir moins cher par tâche, les benchmarks réellement cités par OpenAI, la capacité de cybersécurité qui atteint pour la première fois le niveau « Critical » du Preparedness Framework et la ligne qu'OpenAI trace autour, les quatre points qui cassent à la migration (paramètres d'échantillonnage retirés, Responses API, disparition du niveau none, réglage de cache renommé) et la comparaison avec Claude Opus 5, Fable 5.1 et Gemini 3.8 Flash — le tout limité à ce que les sources primaires permettent de confirmer. Nous expliquons aussi pourquoi nous ne reprenons pas le tableau du type « Astra 74,1 % contre Opus 5 96 % » qui circule ailleurs.

Le Dispatch de Claude — quand votre téléphone fait travailler votre propre PC, et jusqu'où lui faire confiance

Le Dispatch de Claude — quand votre téléphone fait travailler votre propre PC, et jusqu'où lui faire confiance

Dispatch est la fonctionnalité qui vous permet d'envoyer une instruction depuis votre téléphone pour que Claude effectue le travail sur votre propre ordinateur (bêta, Pro et Max). Ça ne tourne pas dans le cloud : c'est votre machine réelle qui bouge, et ce seul fait produit à la fois la valeur et le danger. L'aide officielle indique que vous pouvez écrire à Claude depuis votre téléphone et lui faire travailler sur votre ordinateur de bureau, en utilisant les mêmes connecteurs, plugins et accès aux fichiers que vous avez déjà configurés dans Cowork, à l'intérieur de ce qu'Anthropic présente comme une conversation continue accessible depuis l'un ou l'autre appareil. Le fonctionnement exige que le PC soit réveillé avec l'application de bureau ouverte, et l'utilisation de l'ordinateur n'est prise en charge que sur macOS et Windows, pas sous Linux. Mécaniquement, tout descend trois étages de priorité : un connecteur s'il en existe un, la navigation dans le navigateur à défaut, et l'interaction directe avec l'écran en dernier recours, avec des captures d'écran prises en chemin pour comprendre l'affichage. L'évaluation commence après cela. Les endroits où ça s'arrête sont pensés dès la conception : l'utilisation de l'ordinateur est désactivée par défaut et s'active dans Réglages, Général ; l'autorisation est demandée pour chaque nouvelle application ; la suppression définitive d'un fichier exige une autorisation explicite ; et les plateformes d'investissement et de trading ainsi que les applications de cryptomonnaies sont hors limites par défaut. Mais il existe des endroits où ça ne s'arrête pas. Les actions individuelles à l'intérieur d'une application déjà approuvée ne vous sont pas soumises, et la formulation officielle est que Claude clique, saisit du texte et navigue directement sur votre écran, sans les contrôles de permission qui encadrent les autres outils de Cowork. La documentation ajoute qu'il n'y a pas de bac à sable entre Claude et ce qui s'affiche à votre écran, et que les actions prises dans une application peuvent avoir un impact sur d'autres applications. Le plus grand risque est l'injection de prompt, qu'Anthropic décrit dans ses propres mots : le contenu web est un vecteur principal d'attaques par injection de prompt, et une instruction manipulée, une commande inattendue ou un lien de phishing ouvert dans votre navigateur pourraient déclencher en cascade des actions difficiles voire impossibles à annuler. Anthropic déclare analyser les activations du modèle pour détecter ce type de comportement, mais cela fait baisser les probabilités sans vous dispenser de tracer une limite, et les recommandations disent toujours de basculer en approbation manuelle dès qu'une tâche touche des fichiers, des comptes ou des sites sensibles. Anthropic nomme la frontière sans détour : n'accordez pas la permission d'utilisation de l'ordinateur à des applications sensibles comme les applications bancaires, de santé ou administratives, et évitez les comptes financiers, les documents juridiques, les informations médicales et les données personnelles. L'article traite aussi le côté téléphone. Ce qui fuit si vous perdez le combiné, ce ne sont pas les données qui y sont stockées mais la faculté de donner des ordres à votre PC, plus le contenu de la conversation en cours — et l'aide officielle sur Dispatch ne documente ni le désappairage ni la conduite à tenir en cas de perte, si bien que les remèdes viennent du côté du compte : terminer la session concernée sous Réglages, Compte, Sessions actives ; se déconnecter de toutes les sessions depuis claude.ai, ce qui n'est pas disponible dans les applications mobiles et nécessite donc un navigateur web ; ou simplement couper le côté PC en fermant l'application de bureau ou en laissant la machine se mettre en veille, ce qui est en fait le plus rapide puisque Dispatch exige que le PC soit réveillé et l'application ouverte. Il se termine en séparant Dispatch et l'utilisation de l'ordinateur comme deux interrupteurs distincts, en distinguant les deux de l'agent view de Claude Code (que la documentation officielle appelle également dispatch), et en traçant une limite pratique : commencez par du travail que vous pouvez reprendre.

L'agent view de Claude Code — comment les sessions tournent en parallèle, et par où fuit l'isolation

L'agent view de Claude Code — comment les sessions tournent en parallèle, et par où fuit l'isolation

L'agent view de Claude Code, qu'on ouvre avec claude agents, est la fonctionnalité qui sert à démarrer les unes après les autres des sessions indépendantes en arrière-plan et à les gérer depuis un seul écran. La documentation officielle appelle « dispatch » l'opération que vous y effectuez, ce qui entre en collision avec la fonctionnalité du même nom présente dans l'application de bureau : le premier travail consiste donc à les distinguer. La documentation décrit l'agent view comme la fonctionnalité qui permet de dispatcher et de gérer de nombreuses sessions Claude Code depuis un seul écran, et il s'agit d'une research preview qui exige la v2.1.139 ou une version ultérieure. Cet article s'en tient à la mécanique et au modèle de sécurité. La première surprise est que chaque prompt tapé dans le champ de saisie démarre sa propre nouvelle session : tapez-en un deuxième et vous obtenez une deuxième session à côté de la première, pas une instruction ajoutée à celle-ci. Les instructions complémentaires passent par le panneau d'aperçu, ouvert avec Space, qui montre la dernière sortie ou la question en attente plutôt que la transcription entière. Le cœur du modèle de sécurité, c'est l'isolation par worktree. Avant de modifier le moindre fichier, une session en arrière-plan se déplace dans un worktree git isolé sous .claude/worktrees/, si bien que les sessions parallèles lisent la même copie de travail mais que chacune écrit dans la sienne : lectures partagées, écritures séparées. Tout ce qui atteindrait la copie de travail principale est coupé par trois contrôles : les modifications de fichiers via Edit, Write et NotebookEdit ; les répertoires de travail de commandes qui se résolvent vers la copie principale ou dont on ne peut pas vérifier qu'ils restent en dehors ; et les tentatives de détourner git par git -C, --git-dir, GIT_DIR, GIT_WORK_TREE ou un cd placé avant l'appel à git. L'arbitrage se fait délibérément du côté sûr, en refusant ce qui ne peut pas être vérifié, et la même protection est héritée par chaque sous-agent que la session engendre. Ce n'est pourtant pas un mur au niveau du système d'exploitation : les fichiers situés hors du dépôt et le réseau sont hors périmètre, et les commandes PowerShell ne reçoivent que le contrôle du répertoire de travail. Les permissions ne se choisissent pas non plus au moment du dispatch : elles sont héritées du defaultMode de ce répertoire, ou du permissionMode inscrit dans le frontmatter d'un sous-agent dispatché, ce qui signifie que plus votre configuration habituelle est permissive, plus vous créez d'un coup de sessions permissives et sans surveillance. Trois choses s'échappent ensuite de l'isolation. Choisir « Oui, ne plus demander » enregistre la règle dans le .claude/settings.local.json de la copie de travail principale : elle s'applique donc dans la copie principale et dans tous les autres worktrees, et elle survit à la suppression du worktree où elle a été accordée. Supprimer une session dans l'agent view supprime avec elle le worktree créé par Claude, donc le travail non commité disparaît — et Ctrl+X arrête à la première pression, supprime à la seconde. Enfin, .worktreeinclude copie les fichiers ignorés par git, comme .env, dans chaque nouveau worktree, ce qui multiplie vos identifiants par le nombre de sessions dispatchées. Par-dessus cela, le quota se vide proportionnellement au parallélisme (dix agents le consomment environ dix fois plus vite) et les sessions tournent en local : elles survivent à la mise en veille mais s'arrêtent quand la machine s'éteint. L'article se termine en situant l'agent view parmi les quatre façons officielles de paralléliser, aux côtés des sous-agents, des agent teams et des workflows dynamiques, et donne une routine concrète pour l'avant, le pendant et l'après d'un dispatch.

ChatGPT Work : comment l'utiliser (agent GPT-5.6)

ChatGPT Work : comment l'utiliser (agent GPT-5.6)

ChatGPT Work est l'« agent d'IA pour le travail » qu'OpenAI a annoncé le 9 juillet 2026 en même temps que GPT-5.6. Contrairement à un chat classique qui se contente de répondre, il rassemble le contexte de vos applis et fichiers connectés pour construire des livrables finis — documents, feuilles de calcul, diapositives et même applis web. Son cerveau est le nouveau modèle phare GPT-5.6 Sol (bâti sur Codex), et il peut découper un projet complexe en étapes et continuer à travailler pendant des heures (Thurrott). Au sein de l'appli de bureau unifiée, trois modes cohabitent — Work (livrables), Codex (technique, affiche les détails) et chat classique (conversation) — Work étant positionné comme la « version business » qui masque les détails techniques de Codex (9to5Mac). Le modèle dépend de votre forfait : Gratuit/Go par défaut sur Terra, tandis que Plus/Pro/Business/Enterprise choisissent parmi Sol/Terra/Luna (d'après les médias). Sa force est d'intégrer « votre contexte » via des connecteurs comme Google Drive, SharePoint et Slack, plus MCP — et pour l'entreprise, les données ne sont pas utilisées pour l'entraînement par défaut. En s'appuyant sur Axios, TechCrunch, 9to5Mac, Thurrott et OpenAI, cet article expose ce qu'est ChatGPT Work, en quoi il diffère du ChatGPT classique et de Codex, quels forfaits peuvent l'utiliser et à quelles applis il se connecte — avec des labels de confiance sur ce qui n'est pas encore officiel.

GPT-5.6 Sol vs Gemini 3.1 Pro : codage agentique contre multimodal natif

GPT-5.6 Sol vs Gemini 3.1 Pro : codage agentique contre multimodal natif

Comparaison entre le fleuron d'OpenAI GPT-5.6 « Sol » (9 juillet 2026) et Gemini de Google, dont les points forts ne se recoupent presque pas. Sol domine le codage en terminal et agentique (Terminal-Bench 2.1 88,8 % vs 68,5 %, SWE-bench Pro 64,6 % vs 54,2 %), tandis que Gemini 3.1 Pro riposte par un multimodal natif voix/vidéo, un prix environ moitié moins cher et une avance en MMLU, ARC-AGI-2 et WebDev Arena. Attention au facteur temporel : le véritable rival Gemini 3.5 Pro n'est pas encore sorti (disponibilité générale prévue à la mi-juillet). Nous détaillons les benchmarks, le multimodal, le coût réel et le choix selon l'usage.

GPT-5.6 vs GPT-5.5 : ce qui change et vers quel modèle migrer (Luna/Terra/Sol)

GPT-5.6 vs GPT-5.5 : ce qui change et vers quel modèle migrer (Luna/Terra/Sol)

Deux mois et demi après GPT-5.5, GPT-5.6 ne fait pas que gagner en performance : il remplace le modèle phare unique par un dispositif à 3 modèles (Luna/Terra/Sol). L'élément le plus décisif est Terra, qui offre une qualité équivalente à GPT-5.5 pour bien moins cher : moitié prix au lancement, puis 40 % du prix unitaire de GPT-5.5 ($2/$12) depuis la baisse du 30 juillet 2026. Sol, lui, reste à $5/$30 en améliorant le codage (SWE-Bench Pro 58,6→64,6 %, estimé). Cet article compare specs, benchmarks et coût réel, et explique vers quel modèle basculer.

GPT-5.6 Sol vs Claude Fable 5 : comparatif détaillé — coût, benchmarks et autonomie longue durée

GPT-5.6 Sol vs Claude Fable 5 : comparatif détaillé — coût, benchmarks et autonomie longue durée

Le fleuron d'OpenAI GPT-5.6 « Sol » face au haut de gamme d'Anthropic Claude Fable 5 : un arbitrage entre coût et performance. Fable 5 domine le codage de niveau production (SWE-Bench Pro 80,3 %) et l'autonomie jusqu'à 12 h, avec la migration Stripe de 50 millions de lignes en un jour. Sol l'emporte sur TerminalBench (88,8 %), l'Agents' Last Exam et la polyvalence d'agent, tout en coûtant moitié moins ($5/$30 vs $10/$50). À l'appui des annonces officielles et de benchmarks indépendants, comment répartir l'usage de ces deux poids lourds asymétriques.

GPT-5.6 Sol vs Claude Opus 4.8 : comparaison approfondie des benchmarks, du codage, du prix et du choix

GPT-5.6 Sol vs Claude Opus 4.8 : comparaison approfondie des benchmarks, du codage, du prix et du choix

Comparaison approfondie des deux géants du codage par IA de 2026, Claude Opus 4.8 (28 mai) et le modèle haut de gamme Sol de GPT-5.6 (9 juillet). Leurs forces sont quasiment opposées : Sol domine l'opération de terminal et la puissance agentique globale (TerminalBench 2.1 88,8 % vs Opus 78,9 %, Agents' Last Exam 53,6, Coding Agent Index 80), tandis qu'Opus 4.8 domine le codage de niveau production, les mathématiques et le long contexte (SWE-bench Pro 69,2 % vs Sol 64,6 %, USAMO 2026 96,7 %, GraphWalks 1M 68,1 %) et met en avant l'honnêteté (confiance excessive divisée par dix, 0 % de rapport non critique de résultats défectueux). OpenAI laisse aussi beaucoup de benchmarks de Sol non publiés (SWE-bench Pro, GPQA, AIME, MMLU) : sur le cœur du codage, l'Opus déjà divulgué a l'avantage. Nous couvrons le tableau des spécifications, le détail des benchmarks, le problème des benchmarks non publiés, le coût réel ($25 vs $30 de prix unitaire face à +54 % d'efficacité en tokens), une carte des forces et faiblesses, des choix par cas d'usage et une stratégie à double fournisseur.

Sortie de GPT-5.6 : le guide complet — Luna/Terra/Sol, benchmarks, tarifs et face à Claude

Sortie de GPT-5.6 : le guide complet — Luna/Terra/Sol, benchmarks, tarifs et face à Claude

OpenAI a lancé GPT-5.6 en disponibilité générale le 9 juillet 2026, remplaçant l'ancienne structure « standard + Pro » par une gamme à trois modèles : Luna (rapide, économique, $0.20/$1.20), Terra (équilibré, $2/$12, équivalent GPT-5.5 à 40 % du prix unitaire de Sol) et Sol (fleuron, $5/$30) — tarifs après la révision du 30 juillet 2026. Sol prend la première place sur l'Agents' Last Exam (53,6) et le Coding Agent Index (80), et ses 88,8 % sur TerminalBench 2.1 devancent Claude Fable 5 (86,0 %) — mais sur le SWE-Bench Pro de niveau production, Claude Fable 5 domine nettement avec 80,0 % contre 64,6 % pour Sol. Cet article couvre les différences entre les trois modèles, les prix, les benchmarks, les nouveautés (Programmatic Tool Calling, ChatGPT Work, le modèle vocal full-duplex GPT-Live), la disponibilité par forfait ChatGPT, la comparaison avec Claude (Fable 5 / Opus 4.8) et le choix selon l'usage — le tout fondé sur l'annonce officielle d'OpenAI et des benchmarks indépendants.