Aller au contenu
Thèmes

Développement IA et programmation : créez des apps

Développez mieux avec l'IA. Guides de génération de code, création d'apps, débogage et automatisation.

97 articles

Triez les articles pour trouver ce que vous cherchez

Articles dans Développement IA

La limite hebdomadaire de Claude Code se réinitialise-t-elle vraiment tous les 7 jours ? Enquête sur la récupération anticipée (septembre 2026)

La limite hebdomadaire de Claude Code se réinitialise-t-elle vraiment tous les 7 jours ? Enquête sur la récupération anticipée (septembre 2026)

Vous atteignez la limite hebdomadaire de tokens de Claude Code, et pourtant votre quota s'est entièrement reconstitué avant sept jours — plus d'une fois. En ligne, il existe même des articles sur un « mécanisme caché » affirmant que la limite hebdomadaire se réinitialise toutes les 72 heures. Est-ce vrai ? Cet article remonte le phénomène jusqu'à ses sources primaires. Mais Anthropic n'a pas documenté le mécanisme interne de réinitialisation, et les limites ne cessent d'évoluer ; nous étiquetons donc clairement trois types d'information : les faits vérifiables à partir de sources officielles, les événements que plusieurs utilisateurs observent de façon reproductible mais qu'Anthropic n'a jamais commentés, et les spéculations non confirmées reposant sur une source unique. L'essentiel : la récupération anticipée complète est, dans la plupart des cas, due aux réinitialisations globales irrégulières d'Anthropic (annoncées à plusieurs reprises par @ClaudeDevs) ; l'heure de réinitialisation affichée est aussi manifestement instable ; et la « cadence de 72 heures » qui circule repose sur un observateur unique, n'a pas été reproduite, et est contredite par une autre observation (24 h), elle ne peut donc pas être considérée comme un fait. Lorsqu'une chose ne peut pas être affirmée, nous le disons — une enquête de juillet 2026.

Qu'est-ce qu'une passerelle LLM (proxy) ? Une API pour tous les fournisseurs — Guide 2026

Qu'est-ce qu'une passerelle LLM (proxy) ? Une API pour tous les fournisseurs — Guide 2026

Vous avez construit sur OpenAI, puis voulu essayer Claude et comparer Gemini — et perdu des heures à cause des SDK, formats et gestions d'erreurs différents par fournisseur. Une passerelle LLM (passerelle IA / proxy LLM) est un relais que vous glissez entre votre application et les fournisseurs : elle expose une seule API compatible OpenAI pour atteindre tous les modèles et prend en charge les tâches transversales — bascule, suivi des coûts, clés virtuelles, mise en cache, limitation de débit et observabilité. Ce guide couvre pourquoi vous en avez besoin, ce qu'une passerelle est vraiment, les trois types (proxy auto-hébergé = LiteLLM / hébergé = OpenRouter / SDK = Vercel AI SDK), comment choisir parmi LiteLLM, OpenRouter et le Vercel AI SDK, le code de configuration minimal qui ne remplace que le point de terminaison, et les limites — un saut de latence, la passerelle comme nouveau point de défaillance, les frais (OpenRouter facture 5,5 % sur les achats), la perte de fonctionnalités et la confidentialité.

Comment créer des evals d'agents IA : étapes, pièges et outils (2026)

Comment créer des evals d'agents IA : étapes, pièges et outils (2026)

Après avoir construit un agent IA, on se heurte toujours au même mur : « D'accord, mais est-ce que ça marche vraiment ? » Le mécanisme qui permet de décider si un changement de prompt ou de modèle a rendu les choses meilleures ou pires avec des données plutôt qu'au feeling, ce sont les evals. Les LLM produisent une sortie différente à chaque fois pour la même entrée, si bien que les tests unitaires à correspondance exacte collent mal. Cet article se concentre sur les étapes pour les créer et les faire tourner en pratique, et couvre cinq façons de mesurer la qualité (① correspondance à la vérité terrain ② vérifications par règles ③ LLM-as-judge ④ tests de régression ⑤ surveillance en production), l'évaluation propre aux agents (taux de réussite des tâches, appels d'outils corrects, trajectoire, coût), comment démarrer petit à partir de 20 exemples d'échec, les pièges courants et les outils clés (Anthropic Console/Evals, OpenAI Evals, LangSmith, Langfuse, Ragas) — écrit pour les praticiens.

Agents IA vs RPA : la différence et quand utiliser chacun (2026)

Agents IA vs RPA : la différence et quand utiliser chacun (2026)

La question éternelle de l'automatisation : « agents IA ou RPA ? » La réponse n'est pas l'un ou l'autre — on choisit selon le rôle, et le schéma gagnant de 2026 est un hybride des deux. La RPA, ce sont des « mains » déterministes qui exécutent une procédure fixe vite et avec précision (mais qui cassent quand l'écran/la spécification change) ; un agent IA est un « cerveau » probabiliste qui lit la situation et décide (solide sur l'ambiguïté et les exceptions, mais pas identique à chaque fois). Cet article couvre la différence de principe de fonctionnement, un tableau comparatif (le compromis reproductibilité-vs-résistance), la manière de choisir (l'axe est « peut-on l'écrire entièrement en règles ? » — oui → RPA, jugement impossible à formaliser → agent IA), la tendance 2026 (les leaders de la RPA UiPath, Automation Anywhere et Blue Prism deviennent agentiques — convergence ; la question n'est plus « lequel » mais « où placer le raisonnement » = orchestration d'abord), et la réponse pratique : un hybride où le cerveau (agent IA) gère le jugement/l'orchestration et les mains (RPA) assurent l'exécution déterministe — ne placez pas d'agent là où le déterminisme est requis, et associez le jugement délégué à des garde-fous et à une validation humaine. Sur la base des informations officielles des éditeurs, avec une FAQ.

Claude Fable 5 vs Opus 5 : lequel utiliser et quand ? Guide pratique

Claude Fable 5 vs Opus 5 : lequel utiliser et quand ? Guide pratique

Claude Fable 5 et Opus 5 sont tous deux haut de gamme, mais la réponse n'est ni « toujours Fable 5 » ni « toujours Opus 5 » — choisissez selon la tâche. Et l'arrivée d'Opus 5 le 24 juillet 2026 a fait bouger cette réponse en profondeur : la génération précédente, Opus 4.8, occupait le créneau « un cran en dessous de Fable 5, mais moitié prix », alors qu'Opus 5 conserve le même tarif de 5 $ / 25 $ tout en égalant ou dépassant Fable 5 sur les benchmarks agentiques (Frontier-Bench 43,3 % contre 33,7 % et OSWorld 2.0 70,6 % contre 66,1 %, chiffres de presse ; sur CursorBench 3.2, Anthropic indique qu'il se situe à moins de 0,5 % de Fable 5 pour environ la moitié du coût). Le raisonnement le plus dur en une seule passe penche encore vers Fable 5, mais de peu — Humanity's Last Exam 56,5 % contre 56,3 % et DeepSWE v1.1 69,7 % contre 68,8 % (chiffres de presse). Les specs se rejoignent sur la fenêtre de contexte de 1M et la sortie maximale de 128K ; le mode rapide (environ 2,5×) est réservé à Opus 5 mais coûte 2× et n'existe que sur l'API Claude, et Opus 5 porte la date de coupure des connaissances la plus récente, mai 2026. L'arbre de décision : essayez d'abord Opus 5 et n'escaladez vers Fable 5 que là où il plafonne. En pratique, « Opus 5 en socle, Fable 5 pour les passages difficiles » est optimal, appuyé par la bascule automatique de l'application en cas de blocage de sécurité et par le nouveau mode de repli « default » de l'API. Couvre la disponibilité (suspension en juin, redéploiement en juillet), comment éviter la dépendance à un seul modèle, le réglage de l'effort pour maîtriser le coût et une FAQ — reliant le cluster Fable 5 au guide de sortie d'Opus 5.

Frameworks d'agents IA comparés 2026 : LangGraph, CrewAI, AutoGen, OpenAI, Google, Claude — Lequel choisir ?

Frameworks d'agents IA comparés 2026 : LangGraph, CrewAI, AutoGen, OpenAI, Google, Claude — Lequel choisir ?

Le premier obstacle pour intégrer un agent IA à un travail réel est « sur quel framework le construire ». Du point de vue d'un développeur et d'un décideur technique, cet article compare six frameworks majeurs — LangGraph, CrewAI, AutoGen (fondu dans le Microsoft Agent Framework, GA avril 2026), OpenAI Agents SDK, Google ADK et Claude Agent SDK — selon l'approche d'orchestration (graphe orienté / équipe par rôles / GroupChat conversationnel / passations / arborescence hiérarchique / boucle d'outils autonome), le langage, la courbe d'apprentissage, le contrôle, la maturité en production, le coût en tokens et le cas d'usage le mieux adapté. La mise en garde clé : le framework le plus « rapide à prototyper » (CrewAI) peut être le plus coûteux en production — environ 3× les tokens (41k contre 18,5k pour LangGraph dans un benchmark) et non déterministe, ce qui le rend peu adapté à la finance et à la santé. Il explique aussi comment 2026 a apporté l'interopérabilité via MCP (outils) et A2A (agent à agent), permettant aux agents de frameworks différents de coopérer et faisant disparaître le verrouillage. Inclut un guide de sélection par cas d'usage et une FAQ.

Ollama : le guide complet pour LLM en local [2026]

Ollama : le guide complet pour LLM en local [2026]

Ollama est l'outil de référence pour faire tourner un LLM en local : il prend en charge presque toute la configuration, de sorte qu'une seule commande suffit à télécharger un modèle et à commencer à discuter. Ce guide complet pour débutants couvre tout de bout en bout — l'installation sur Windows, Mac et Linux, les commandes essentielles, le choix des modèles selon votre VRAM, les interfaces graphiques comme Open WebUI, l'utilisation de l'API locale (y compris compatible OpenAI) pour l'intégrer dans vos propres applications, la personnalisation via Modelfile et variables d'environnement, ainsi que le dépannage des écueils les plus courants.

Quel LLM local choisir ? Comparatif des meilleurs modèles [2026]

Quel LLM local choisir ? Comparatif des meilleurs modèles [2026]

Une fois votre environnement prêt, quel LLM local installer vraiment ? Ce guide 2026 classe les grandes familles (Qwen, Llama, Gemma, DeepSeek, Mistral, Phi) par éditeur, pays d'origine, cas d'usage, taille et licence, et explique pourquoi, en local, vos données ne quittent jamais votre PC. Une section dédiée passe en revue les modèles français et européens — Mistral, Lucie-7B et CroissantLLM côté France, Teuken-7B (24 langues de l'UE) et Aleph Alpha côté Europe — pour qui privilégie le naturel du français, la souveraineté ou l'usage public/professionnel, avec des recommandations concrètes par taille de VRAM et par besoin.

Configuration requise pour un LLM local : guide VRAM/GPU/Mac [2026]

Configuration requise pour un LLM local : guide VRAM/GPU/Mac [2026]

Vous voulez faire tourner un LLM local mais vous ne savez pas si votre PC suivra ? 90 % de la réponse tient en un mot : la VRAM. Cet article propose un tableau express de la VRAM nécessaire par taille de modèle (7B à 70B), une formule simple pour estimer le besoin, le piège mémoire du cache KV qui grossit avec le contexte, et des vitesses réalistes par GPU et Mac. Il se termine par trois configurations recommandées selon votre budget, pour que même un débutant sache exactement quelle machine acheter.

LLM local vs LLM cloud : différences et écart de performance [2026]

LLM local vs LLM cloud : différences et écart de performance [2026]

Un LLM local que vous faites tourner sur votre propre PC, face à des LLM cloud comme Claude, ChatGPT et Gemini : les deux sont « LLM », mais ils diffèrent nettement en performance, coût, confidentialité et effort. Cet article met les différences côte à côte dans un seul comparatif et expose honnêtement jusqu'où le fameux « écart de performance » s'est réduit à l'horizon 2026. Puis il vous guide vers celui que vous devriez choisir selon votre usage — pour la plupart des gens, la réponse est l'hybride. Le tout écrit pour être lisible sans aucune connaissance préalable.

Que sont les agent evals ? Mesurer à la fois le résultat et la trajectory

Que sont les agent evals ? Mesurer à la fois le résultat et la trajectory

Les agent evals sont le processus consistant à mesurer systématiquement si un agent — qui utilise des outils et enchaîne plusieurs étapes pour atteindre un objectif — parvient réellement à accomplir ses tâches. Elles sont une évolution des évaluations de LLM, élargissant la cible de « une sortie » à « une séquence d'actions ». Comme un agent planifie, appelle des outils et met à jour son état, la seule sortie finale ne suffit pas ; Google note qu'il faut comprendre le « pourquoi » derrière les actions d'un agent et scinde l'évaluation en réponse finale et trajectory. Les cinq dimensions sont : résultat (réussite de la tâche, jugée par l'état final — qu'une réservation existe dans la DB, et non l'énoncé « j'ai réservé »), trajectory (étapes raisonnables, bons outils dans le bon ordre), justesse de l'usage des outils (bon outil et bons arguments, vérification des noms de fonctions et des types), efficacité (étapes, tokens, coût, latence — souvent des signaux d'observabilité ramenés dans l'évaluation) et qualité de la réponse finale (via LLM-as-judge ou une grille). Les correcteurs sont le code (rapide/peu coûteux/reproductible mais fragile), le LLM-as-judge (souple mais non déterministe et nécessitant une calibration) et l'humain (référence absolue mais coûteux — à éviter si possible). Anthropic recommande de noter le résultat, pas le chemin : la correspondance mécanique de trajectory est « trop rigide et fragile » car les agents trouvent des alternatives valides, tandis que Google et Microsoft proposent des métriques de correspondance de trajectory pour diagnostiquer les échecs. Les pièges propres à ce domaine sont le non-déterminisme (pass^k), les erreurs cumulatives (p^t), le reward hacking (le bras robotisé de DeepMind feignant une prise) et les jeux d'évaluation périmés ou contaminés. La démarche pratique, selon Anthropic : transformer 20-50 échecs de production en cas de test, exécuter une notation automatisée dans le CI, séparer évaluations de capacité et de régression, et les écrire tôt. Des benchmarks comme SWE-bench, tau-bench, WebArena, GAIA, OSWorld et BFCL sont des références utiles (les scores bougent selon la version, ne les prenez pas au pied de la lettre). Basé sur des informations officielles, incertitudes signalées.