Aller au contenu
Thèmes

Guide IA pour débutants : premiers pas avec les outils IA

Nouveau dans l'IA ? Commencez ici. Guides pour débutants sur les concepts IA et premiers pas pratiques.

142 articles

Triez les articles pour trouver ce que vous cherchez

Articles dans Débutants

Claude Code « command not found » : corriger l'erreur d'installation et de PATH

Claude Code « command not found » : corriger l'erreur d'installation et de PATH

L'erreur « command not found: claude » de Claude Code signifie presque toujours que le dossier d'installation (~/.local/bin) n'est pas dans le PATH : le binaire existe, le shell ne le trouve pas. Cet article couvre les méthodes d'installation, la correction du PATH, les conflits entre plusieurs installations, les pièges Windows et la mise à jour. Règle d'or : n'utilisez jamais sudo pour une erreur EACCES npm, passez à l'installeur natif.

Erreurs réseau/proxy de Claude Code : Unable to connect to API et certificats TLS

Erreurs réseau/proxy de Claude Code : Unable to connect to API et certificats TLS

Les erreurs « Unable to connect to API », fetch failed et SSL certificate vérification failed de Claude Code signifient que la requête n'a jamais atteint le serveur d'Anthropic. Causes : proxy d'entreprise, inspection TLS et pare-feu. Apprenez à configurer HTTPS_PROXY, NODE_EXTRA_CA_CERTS et les domaines à autoriser, avec un flux de diagnostic qui commence par curl.

Claude Code : erreur 529 Overloaded / 500 — que faire

Claude Code : erreur 529 Overloaded / 500 — que faire

Les erreurs 529 Overloaded et 500 de Claude Code sont des événements côté serveur d'Anthropic, sans rapport avec votre requête ou votre quota. Claude Code réessaie déjà automatiquement jusqu'à 10 fois avec un backoff exponentiel. Cet article explique comment patienter, basculer avec /model, vérifier la page de statut, distinguer 529 du 429, et concevoir côté API/SDK.

Claude Code : « usage limit reached » — comprendre les limites Pro / Max

Claude Code : « usage limit reached » — comprendre les limites Pro / Max

Le message « Claude usage limit reached » de Claude Code n'est ni une erreur ni un bug : c'est ainsi que fonctionnent les limites d'usage de l'abonnement Pro / Max. Cet article détaille la structure à deux niveaux (5 heures + hebdomadaire + plafond Opus sur Max), ce qui épuise le quota, quoi faire au moment où vous atteignez le plafond, comment voir ce qu'il reste, et la porte de sortie par l'API à l'usage.

Claude Code : « Prompt is too long » — corriger l'erreur de fenêtre de contexte

Claude Code : « Prompt is too long » — corriger l'erreur de fenêtre de contexte

L'erreur « Prompt is too long » de Claude Code et de l'API ne signifie pas que votre quota est épuisé : votre entrée (historique, fichiers, définitions d'outils) dépasse simplement la fenêtre de contexte du modèle. Cet article explique ce qui remplit la fenêtre, les tailles 200K et 1M, les correctifs rapides (/compact, /clear, déléguer les grosses lectures à un subagent) et comment distinguer cette erreur de l'usage limit et du plafond max_tokens.

Claude Code : « court » et les balises invoke qui fuient — quand l'appel d'outil ne s'exécute pas

Claude Code : « court » et les balises invoke qui fuient — quand l'appel d'outil ne s'exécute pas

Lors de longues sessions dans Claude Code, un mot « court » suivi de balises <invoke>/<parameter> brutes peut fuir à l'écran sans que l'outil ne s'exécute. Ce n'est ni votre environnement ni votre commande : c'est un dysfonctionnement côté modèle (Opus 4.8 / 4.7). Cet article détaille le mécanisme, les deux causes racines, les idées reçues, et les correctifs côté utilisateur et côté API/SDK.

Comment éviter le bannissement de vos comptes ChatGPT et Claude (OpenAI / Anthropic)

Comment éviter le bannissement de vos comptes ChatGPT et Claude (OpenAI / Anthropic)

Un jour, votre compte ChatGPT ou Claude cesse soudainement de fonctionner : en 2026, les signalements de suspensions (bans) et d'avertissements se multiplient, et le plus inquiétant, c'est qu'on peut être banni en enfreignant accidentellement les conditions, même sans mauvaise intention. Cet article fait le point sur ce qu'il faut savoir pour ne pas perdre son compte sur OpenAI (ChatGPT, Codex) et Anthropic (Claude, Claude Code), à partir des Usage Policy publiées et des signalements (pas un guide pour échapper à la détection, mais pour rester conforme). Cinq déclencheurs communs aux deux : contenus interdits / jailbreaks (génération illégale ou nuisible, tentative de contourner les filtres de sécurité via des prompts ; les violations graves peuvent être un bannissement définitif immédiat), automatisation / scraping non autorisés (bots, scripts, accès massif trompeur comme le spam/phishing), partage ou revente de comptes/clés API, schémas d'accès suspects (changements fréquents d'IP/de pays, VPN intensif, bascule d'appareils lue comme des connexions anormales) et incohérence de paiement/fraude (écarts géographiques, moyens de paiement suspects). Le plus gros piège de 2026 : utiliser des tokens OAuth d'abonnement personnel (Free/Pro/Max) de Claude dans tout produit autre que l'application officielle, y compris des harness comme l'Agent SDK, est une violation des Consumer ToS qui a causé une vague massive de bannissements ; la bonne approche est de faire tourner applications/agents via l'API (à l'usage) et de réserver les abonnements personnels au chat de l'application officielle. Spécificités OpenAI : contournement de la sécurité/des accès, automatisation/scraping, réutilisation abusive des clés API, usages illégaux. Spécificités Anthropic : mauvais usage des tokens OAuth d'abonnement personnel, accès tiers non officiel, clauses anti-distillation/sur les modèles concurrents, jailbreaks. Une checklist de prévention en 7 points (lire la politique, adapter l'abonnement à l'usage, ne pas mettre de tokens personnels dans des outils tiers, pas de jailbreaks/contenus interdits, ne pas partager ni revendre, paiement correspondant à la région et accès stable, agir immédiatement sur les avertissements). Les avertissements sont une occasion de se corriger et la plupart peuvent continuer ; les violations mineures ou accidentelles peuvent faire l'objet d'un recours, mais les violations graves sont définitives et difficiles à récupérer. Le bon abonnement, pour le bon usage, honnêtement. Vérifiez toujours les conditions officielles les plus récentes de chaque entreprise.

Qu'est-ce que LoRA ? Personnaliser l'IA avec un tout petit entraînement supplémentaire

Qu'est-ce que LoRA ? Personnaliser l'IA avec un tout petit entraînement supplémentaire

Réentraîner une IA géante de zéro coûte trop cher, mais vous voulez l'adapter rien que pour vous ; LoRA (Low-Rank Adaptation) exauce ce vœu en gelant le modèle d'origine et en n'entraînant qu'une minuscule pièce ajoutée (un adaptateur), réduisant les paramètres entraînables d'environ 90 %. LoRA rend le fine-tuning bien moins cher et plus rapide, et il est très populaire dans la génération d'images comme Stable Diffusion. Cet article l'explique avec une analogie de la pièce rapportée. LoRA est le fer de lance du fine-tuning efficace en paramètres (PEFT) : laisser les énormes poids d'origine gelés, insérer une petite matrice ajoutée dans chaque couche, et n'entraîner que celle-ci (W = W0 + BA). Avantages : environ 90 % de paramètres en moins, moins de mémoire GPU, entraînement plus rapide et moins cher, aucune latence d'inférence une fois l'adaptateur fusionné, et moins de surapprentissage. Son plus grand atout : des adaptateurs interchangeables. QLoRA combine la quantification, entraînant LoRA sur une base 4-bit. Comparé au fine-tuning complet, LoRA suffit pour la plupart des travaux.

Qu'est-ce que la quantification ? Réduire les modèles d'IA pour les exécuter sur votre propre machine

Qu'est-ce que la quantification ? Réduire les modèles d'IA pour les exécuter sur votre propre machine

Faire tourner un énorme modèle 70B sur un seul PC de gaming au lieu d'un rack de GPU de data center est rendu possible par la quantification, qui abaisse la précision numérique des poids d'un modèle pour réduire drastiquement sa taille et sa mémoire. Alors que la distillation transfère le savoir vers un modèle distinct plus petit, la quantification allège le même modèle. Cet article l'explique avec une analogie de compression de photo. La quantification remplace les poids stockés en décimaux FP16/FP32 par des entiers INT8 (8 bits) ou INT4 (4 bits), réduisant les octets par poids (FP32=4, INT8=1, INT4=0,5) ; comme compresser une photo RAW en JPEG, on sacrifie un peu de précision pour un gros gain, et la surprise est le peu qu'on y perd. Côté mémoire, le 4-bit utilise environ un quart du FP16 : un modèle 70B passe de ~140GB à ~35GB, et un 8B en 4-bit fait ~4.5-5GB, tenant dans un GPU de milieu de gamme à 8GB de VRAM pour un usage local (la démocratisation des LLM). Côté précision, INT8 est quasiment sans perte et INT4 se dégrade sous 4% sur les tâches générales, mais la perte est plus marquée pour les maths, le code et le raisonnement difficile (cela se voit par une légère hausse de la perplexité), donc choisissez le nombre de bits selon la tâche. Principales méthodes : GPTQ (pionnier du 4-bit précis), AWQ (protège le ~1% de poids les plus importants, souvent 1-2% plus précis et plus rapide), GGUF (format llama.cpp/Ollama, Q2_K-Q8_0, hybride CPU+GPU, pour le local) et QLoRA (base 4-bit plus LoRA pour le fine-tuning sur GPU grand public). Cela diffère de la distillation et du fine-tuning, et les trois se combinent généralement. Pour démarrer, exécutez un modèle GGUF avec Ollama en une commande, choisissez Q4/Q8 selon la VRAM et évitez l'INT4 pour le code ou les maths exactes. La plupart des grands modèles sont livrés déjà quantifiés, il suffit de les télécharger. Garder l'intelligence, ne perdre que le poids.

Qu'est-ce que la distillation de modèles ? Transférer le savoir d'une grande IA vers une petite

Qu'est-ce que la distillation de modèles ? Transférer le savoir d'une grande IA vers une petite

Une IA énorme et très performante est intelligente mais lourde et coûteuse ; la distillation de modèles (distillation des connaissances) résout cela en transférant le savoir d'un grand modèle enseignant vers un petit modèle élève, conservant plus de 95 % des performances de l'enseignant pour un dixième de la taille et de la vitesse. Cet article l'explique avec une analogie enseignant-élève. La clé, ce sont les soft labels : l'entraînement ordinaire n'enseigne que « la réponse est chat » (hard label), tandis que la distillation transmet toute la distribution de probabilités de l'enseignant comme « 90 % chat, 8 % chien, 2 % renard », dont le degré d'hésitation porte une information riche ; un paramètre température adoucit les probabilités pour révéler des relations subtiles (exemple réel : GPT-4o mini distillé de GPT-4o). Avantages : rapide et bon marché, ~10x plus compact tout en gardant plus de 95 % des performances, fonctionne sur l'edge, idéal pour la spécialisation. Deux approches : white-box (accès complet aux poids et représentations internes, transfert plus profond ; pour vos propres modèles ou OSS) et black-box (seules les sorties/réponses d'API sont visibles ; utiliser l'API d'une autre entreprise comme enseignant peut enfreindre les conditions). Elle diffère de la quantization (compresser la précision des poids du même modèle) et du fine-tuning (poursuivre l'entraînement d'un modèle existant pour une tâche) — la distillation transfère le savoir dans un petit modèle distinct, et les trois sont combinables. La réalité juridique/ToS a été un grand sujet en 2026 : la technique est légitime, mais OpenAI, Anthropic, Mistral et xAI incluent des clauses de distillation anti-concurrentielle interdisant d'utiliser les sorties pour construire des modèles concurrents. Le litige OpenAI contre DeepSeek montre que l'évaluation dépend des conditions d'API applicables, et Claude Fable 5/Mythos 5 restreindraient les réponses sur les travaux signalés. Conseils : utilisez vos propres modèles ou des OSS sous licence comme enseignant, vérifiez les clauses anti-distillation et jugez si l'usage revient à développer un concurrent. Les chiffres sont cités de documents publics, à titre indicatif.

Qu'est-ce que l'observabilité de l'IA ? Monitoring et tracing des LLM et des agents, pour débutants

Qu'est-ce que l'observabilité de l'IA ? Monitoring et tracing des LLM et des agents, pour débutants

L'observabilité de l'IA rend visible ce que font réellement les LLM et les agents en production : quels outils, quelles recherches, ce qui est renvoyé, en combien de temps et à quel coût. Contrairement au monitoring classique, l'IA peut renvoyer 200 OK en 50ms et halluciner avec aplomb : la plupart des défaillances sont des problèmes de qualité, pas d'infrastructure. Trois piliers : traces, metrics, logs. On distingue observabilité (ce qui s'est passé) et évaluation (la réponse est-elle bonne), à utiliser en duo. Outils : LangSmith, Langfuse, Arize Phoenix, MLflow, AgentOps et le standard OpenTelemetry.