Qu'est-ce que le contexte d'une IA ? — La réalité « lit mais ne lit pas » de l'ère du million de tokens
En 2026, Claude Opus 4.7, GPT-5.5, Gemini 3.1 Pro et DeepSeek V4-Pro ont tous déclaré « 1 million (1 M) de tokens » de fenêtre de contexte. Mais des benchmarks indépendants (NIAH multi-aiguilles) montrent que seul Gemini 3 Deep Think conserve sa précision sur la totalité du 1 M ; les autres commencent à perdre en précision entre 200 K et 400 K. « Prendre en charge » et « lire vraiment jusqu'au bout » sont deux choses différentes. Cet article explique comment fonctionnent les fenêtres de contexte, le panorama des modèles en mai 2026, ce que sont réellement Lost in the Middle et Context Rot, le piège du coût lié au surcoût long contexte d'OpenAI, et cinq tactiques pratiques d'économie — « couper la session », « envoyer des extraits », « reformuler à la fin », « mettre en cache », « adresses explicites » — appuyées sur des chiffres de benchmarks réels.