Le 16 avril 2026, Anthropic a officialise la sortie de Claude Opus 4.7, son modèle phare. Identifiant de modèle claude-opus-4-7, tarifs entrée/sortie $5 / $25 par MTok, identiques à ceux de 4.6. Mais sous le capot, la version est truffee d'évolutions qui transforment profondément l'expérience d'utilisation du modèle frontier : images haute résolution, nouvel effort xhigh, task budgets (bêta), nouveau tokeniseur, etc.

En contrepartie, certaines ruptures obligent à faire évoluer le code existant : l'API « extended thinking » disparaît, les paramètres de sampling temperature, top_p, top_k ne sont plus acceptes, et le prefill a été retire.

Cet article passe en revue tout ce qui change, ce qui a évolue depuis 4.6 et les cas où 4.7 fait vraiment la différence, sous un angle ingénieur.

2026.04.16 RELEASED

Claude Opus 4.7

Nouveau flagship — fonctionnalités, améliorations et changements cassants

Tarif (inchangé depuis 4.6)
$5 / $25 par MTok
Fenêtre de contexte
1M tokens (tarif standard)
Sortie maximale
128 000 tokens
Principales améliorations
Images haute résolution (jusqu'à 2576 px)
Nouveau tokeniseur (jusqu'à 1.35x)
Nouveau niveau d'effort xhigh
Pensée adaptative OFF par défaut
Budget de tâche (bêta) introduit
Cybersécurité renforcée
Disponible sur claude.ai / API / Bedrock / Vertex AI / Microsoft Foundry
model id: claude-opus-4-7

1. La sortie en bref : date, contenu, tarifs, disponibilité

ItemValeur
Date de sortie16 avril 2026
Identifiant de modèleclaude-opus-4-7
Tarif entrée$5 par million de tokens (identique à 4.6)
Tarif sortie$25 par million de tokens (identique à 4.6)
Fenêtre de contexte1 000 000 tokens (tarif API standard, pas de supplément long contexte)
Sortie maximale128 000 tokens
Plateformesclaude.ai, API Anthropic, AWS Bedrock, Google Vertex AI, Microsoft Foundry

Le point à retenir : la fenêtre de 1M tokens est accessible au tarif standard, sans supplément. Certaines versions précédentes facturaient un supplément au-delà de 200K tokens ; 4.7 traite 1M au même prix.

Opus 4.7 est disponible immédiatement pour les abonnés payants de claude.ai (web / mobile), et il suffit de specifier l'identifiant de modèle via API. La mise à disposition sur AWS Bedrock, Google Vertex AI et Microsoft Foundry est simultanée, donc la bascule est transparente pour les déploiements multi-cloud.

2. Résumé des nouveautés

Les principales évolutions de 4.7 :

Opus 4.7 — les nouveautés en détail

Images HD / effort xhigh / budget de tâche / nouveau tokeniseur

1. Images haute résolution Première Claude
Résolution max : 1568 px → 2576 px
MP max : 1,15 MP → 3,75 MP
Tokens / image : ~1 600 → ~4 784 (~3x)
Coordonnées au pixel réel (1:1, sans conversion)
Utile pour analyse de docs, Computer Use, captures UI
2. Niveau d'effort xhigh Nouveau
low / medium / high / xhigh / max
Niveau intermédiaire entre high et max
Optimisé pour code et agents
Résout le "high pas suffisant"
4.7 : calibration d'effort plus stricte
3. Budget de tâche BÊTA
Estimation pour la boucle d'agent entière
Pensée + appels d'outils + sortie
Minimum : 20 000 tokens
Indicatif (pas une limite stricte)
bêta header: task-budgets-2026-03-13
4. Nouveau tokeniseur Attention
1.0 à 1.35x de tokens vs ancien
Jusqu'à +35 % selon le contenu
Réviser les budgets de coût
Capacité réelle du 1M réduite
Limites TPM et cache à réévaluer aussi
  • Images haute résolution (première Claude) -- jusqu'à 2576 px / 3,75 megapixels (env. 3x plus qu'avant : 1568 px / 1,15 MP)
  • Meilleure perception bas niveau -- pointing, mesure, comptage, détection de bounding box plus précis
  • Nouveau niveau d'effort xhigh -- entre high et max, optimisé pour le code et les agents
  • Task budgets (bêta) -- estimation préalable du coût total d'une boucle d'agent
  • Nouveau tokeniseur -- 1,0 à 1,35x de tokens pour le même texte (jusqu'à +35 % selon le contenu)
  • Pensée adaptative -- OFF par défaut (opt-in explicite requis)
  • Mémoire fichiers renforcée -- meilleure exploitation des scratchpads et notes entre sessions
  • Travail de connaissance (.docx, .pptx) -- édition avec historique, mise en page de slides, meilleure analyse des graphiques
  • Intégration Claude Code -- nouvelle commande /ultrareview, effort par défaut xhigh sur Max, Auto mode étendu aux utilisateurs Max
  • Protections cybersécurité en temps réel -- nouvelles règles de refus sur les sujets sensibles
  • Comportement -- plus fidèle aux consignes, ton plus direct, moins d'appels d'outils

Les images haute résolution et le niveau xhigh sont particulièrement impactants pour l'analyse de documents, le Computer Use et les agents de code. Voyons cela en détail.

3. Images haute résolution -- une première chez Claude

Opus 4.7 est le premier Claude à prendre en charge directement la haute résolution.

Évolution des resolutions

ItemOpus 4.6 et avantOpus 4.7
Résolution maxi (côté long)1568 px2576 px
Pixels maxi1,15 megapixels3,75 megapixels
Tokens pour une image pleine résolution~1 600 tokens~4 784 tokens (~3x)
Échelle des coordonnéesPixels de l'image redimensionnee1:1 avec les pixels réels (sans conversion)

Ce que cela change

  • Analyse de documents -- caractères fins d'un scan A4, filets de tableau, graduations de graphique deviennent lisibles
  • Computer Use -- captures d'écran Full HD ou plus comprises telles quelles
  • Captures d'UI -- captures 4K ou haute densité traitées sans downsampling
  • Coordonnées 1:1 -- quand le modèle renvoie des coordonnées (clics, etc.), plus besoin de convertir l'échelle, le code est plus simple

Attention toutefois : une image pleine résolution coûte environ 4 784 tokens. Les agents qui échangent beaucoup de captures voient vite leur facture s'envoler. Quand la basse résolution suffit, il faut redimensionner en amont.

4. Niveaux d'effort -- le nouveau xhigh

Le réglage de la profondeur de la « extended thinking » passe par le « niveau d'effort (effort level) ». 4.7 ajoute xhigh.

Choisir le niveau d'effort (Effort Level)

Opus 4.7 ajoute "xhigh" — 5 paliers pour contrôler la profondeur

← Rapide / superficielProfond / lent →
low
Pensée minimale
Réactivité
Cas d'usage
Questions courtes
Tri / résumé
Réponses chat
medium
Raisonnement moyen
Équilibre
Cas d'usage
QA standard
Extraction
Génération légère
high
Raisonnement profond
Analyse complexe
Cas d'usage
Décisions design
Analyses poussées
Textes longs
NEW
xhigh
Très haute profondeur
Optimisé code
Cas d'usage
Implémentation
Multi-étapes
Agents
max
Profondeur max
Recherche
Pour
Défis extrêmes
Maths
Stratégie

Dans le doute, partez de xhigh ; passez à max si insuffisant. Pour les tâches légères, medium suffit.

Comment utiliser les 5 paliers

NiveauDescriptionCas d'usage
lowRéflexion minimale, priorité à la réactivitéQuestions courtes, classification, résumé simple, chat
mediumRaisonnement moyenQA standard, extraction, génération légère
highRaisonnement profondDécisions de conception, analyse complexe, textes longs
xhigh (nouveau)Entre high et max, optimisé pour code et agentsImplémentation, agents multi-étapes, refactoring
maxProfondeur maximaleRaisonnement extrême, analyses de niveau recherche

Jusqu'à 4.6, il existait un trou « high ne suffit pas, mais max c'est trop » pour le code et les agents. xhigh est ajoute pour exactement combler cet intervalle ; Anthropic le recommandé pour le code et les agents.

Conseils de choix

En 4.7, la calibration d'effort est plus stricte : low et medium gardent le périmètre demande sans déborder. Si une tâche qui fonctionnait en medium en 4.6 vous semble désormais « trop serrée », passez à high ou xhigh.

5. Task budgets (bêta)

Opus 4.7 introduit une fonctionnalité bêta, les task budgets : un moyen de communiquer à l'avance au modèle une estimation des tokens qu'il peut dépenser sur l'ensemble d'une boucle d'agent.

Specs

  • Bêta header : task-budgets-2026-03-13
  • Minimum : 20 000 tokens
  • Périmètre : pensée + appels d'outils + sortie (toute la boucle d'agent)
  • Comportement : limite indicative (advisory), pas de cap dur : il n'y a pas d'arrêt force en cas de dépassement

Pourquoi ?

Le max_tokens classique ne contrôle que la sortie d'une seule réponse. Or, en pratique, une exécution d'agent mélange tokens de pensée, allers-retours d'outils et sorties multi-étapes : il devenait difficile de prévoir combien de tokens serait dépense au total.

En spécifiant un task budget, le modèle utilisé cette enveloppe comme référence pour planifier son travail et ajuster profondeur et vitesse. « Reste léger, termine vite » ou, au contraire, « prends ton temps pour approfondir » : vous orientez le modèle depuis l'angle du coût.

Comme c'est indicatif, si vous devez imposer un cap strict, mettez un compteur côté application en complément.

6. Impact du nouveau tokeniseur

Opus 4.7 utilise un nouveau tokeniseur qui consomme 1,0 à 1,35x plus de tokens que les versions précédentes pour le même texte (jusqu'à +35 % selon le contenu).

Conséquences sur les coûts et l'espace de contexte

  • Facturation potentiellement supérieure à prompt identique -- tarif inchangé mais plus de tokens = addition plus grande
  • Moins d'informations tiennent réellement dans 1M -- c'est toujours 1M tokens, mais un document donne coûte plus cher en tokens
  • Estimations et alertes à recalibrer -- toute logique basée sur les anciens comptages de tokens doit être revue

À faire en pratique

Avant de basculer une application existante en 4.7, reevaluez les points suivants :

  1. Prévision de coût mensuel -- partir sur l'hypothèse +35 % dans le pire cas pour le même trafic
  2. Taux d'occupation du contexte -- surveiller les traitements qui étaient « tout juste sous 1M »
  3. Limites de rate-limit (TPM) -- revérifier la marge restante
  4. Stratégie de cache -- le taux de hit sur le prompt caching peut changer

Le détail de la migration de 4.6 vers 4.7 est traite dans notre guide de migration.

7. Changements de comportement vs 4.6

Opus 4.7 n'ajoute pas que des fonctionnalités : le style même des réponses à évolue par rapport à 4.6.

Évolutions principales

  • Plus fidèle aux consignes -- surtout aux niveaux d'effort bas et moyens : le modèle exécute la demande sans rajouter d'informations
  • Ton plus direct -- moins de phrases de validation (« Excellente question ! »), de politesses excessives, d'emojis
  • Longueur adaptative -- court pour les questions simples, plus développé pour les tâches complexes : la verbosité uniforme disparaît
  • Moins d'appels d'outils par défaut -- quand le raisonnement suffit, il raisonne au lieu d'appeler un outil inutilement
  • Moins de sous-agents spawnes -- il réfléchit d'abord lui-même avant de lancer des travaux parallèles
  • Calibration d'effort stricte -- low et medium restent dans le périmètre, sans extrapolation

Impact sur les prompts existants

Les prompts conçus pour 4.6, qui comptaient sur l'ajout d'éléments contextuels ou une utilisation abondante d'outils, peuvent se comporter différemment en 4.7.

  • Si vous voulez des compléments, dites-le : « explique aussi le raisonnement et propose des alternatives »
  • Si vous voulez plus d'outils : « utilise impérativement WebSearch pour vérifier les faits »
  • Si vous voulez une réponse plus longue : « rédiger au moins 500 mots »

L'évolution globale va dans le sens du « le modèle n'en fait pas trop » : écrivez explicitement ce que vous voulez et il le fait, pour un comportement plus prévisible.

Garde-fous de cybersécurité et sûreté

Opus 4.7 introduit de nouvelles protections de cybersécurité en temps réel : pentest, recherche de vulnérabilités, red-teaming peuvent être refuses selon le contexte, même pour un usage légitime. Pour ces cas d'usage en production, envisagez de postuler au Cyber Vérification Program d'Anthropic.

Points positifs côté sûreté annonces officiellement :

  • Meilleure honnêteté -- dire « je ne sais pas », éviter les affirmations non sourcees
  • Meilleure résistance à la prompt injection -- défense renforcée face aux instructions malveillantes
  • Mythos Preview reste le plus aligne aujourd'hui -- 4.7 a davantage de capacités, mais c'est Mythos Preview qui à la meilleure précision d'alignement

À l'inverse, le texte officiel signale que les conseils de réduction des risques concernant les substances controlees sont un peu plus verbeux. Pour les chatbots dans la pharma ou la santé, un filtrage en sortie est recommandé.

8. Ruptures (breaking changés)

4.7 introduit plusieurs ruptures par rapport à 4.6. Du code écrit pour 4.6 peut renvoyer un 400 tel quel.

Paramètres et fonctions supprimés

Fonction4.6 et avant4.7
Extended thinkingthinking: {type: "enabled", budget_tokens: N}400 avec le même payload ; passer à la pensée adaptative
Pensée adaptativeActivée par défautDésactivée par défaut ; opt-in explicite via thinking: {type: "adaptive"}
Contenu de penséeRenvoyé par défautOmis par défaut ; specifier display: "summarized" pour l'afficher
températureAjustable de 0,0 à 1,0Toute valeur non par défaut renvoie 400
top_p / top_kParametrablesToute valeur non par défaut renvoie 400
Prefill assistantMessage assistant en tête pour forcer la suite400 (heritage de 4.6)

Ce qu'il faut corriger

  1. Code utilisant l'extended thinking : passer thinking.type a "adaptive" et ajouter display si besoin
  2. Code tuning de temperature etc. : supprimer ces paramètres ; gérer le déterminisme via le prompt
  3. Code utilisant le prefill : intégrer la portion prefill dans le message utilisateur, ou specifier le format de sortie
  4. UI affichant la pensée : sans display: "summarized", le contenu de pensée n'est plus renvoyé

Voir notre guide de migration pour les détails.

9. Benchmarks

Les scores détaillés ne sont que partiellement publiés à la sortie, mais Anthropic annonce de larges améliorations en code, agents et vision.

Domaines annonces en progrès

Benchmarks officiels

Principaux chiffres présentés par Anthropic :

BenchmarkOpus 4.6Opus 4.7Domaine
CursorBench58 %70 %Code
CursorBench (précision visuelle)54,5 %98,5 %Compréhension captures UI
Rakuten-SWE-Benchbase3x plus de tâches résoluesModifications de code réel
CyberGym73,8-- (non publie)Sécurité
Finance Agent--state-of-the-artAgents finance
GDPval-AA--top-tierTravail de connaissance à forte valeur

Rapports de tiers et d'utilisateurs

  • Benchmark de codage sur 93 tâches : environ +13 % par rapport à Opus 4.6
  • OfficeQA Pro (raisonnement sur documents) : ~-21 % d'erreurs
  • Factory Droids (tâches en production) : taux de réussite en hausse de 10 a 15 %

Évaluation sur le terrain

Ces données viennent d'Anthropic et de ses partenaires. Dans tous les cas, la mesure la plus fiable reste votre propre charge de travail. Comme le nouveau tokeniseur modifie les comptages, une mesure préalable de coût et de latence est indispensable.

Les bons réflexes :

  1. Envoyer la même entrée a 4.6 et 4.7, comparer qualité, durée et consommation de tokens
  2. Pour le code, évaluer sur « premier jet fonctionnel » et « tests verts »
  3. Pour les agents, suivre « taux de complétion » et « nombre d'appels d'outils » (4.7 en fait moins, donc un taux qui monte = pur gain)
  4. Pour la vision, comparer sur des cas réels en haute résolution (captures UI, scans)

Positionnement par rapport à Mythos Preview

Anthropic indique que « Mythos Preview », un modèle non public, est actuellement le plus aligne et celui qui commet le moins d'erreurs. Opus 4.7 couvre un périmètre de capacités plus large, mais reste en retrait de Mythos Preview sur la sûreté cyber (Anthropic teste les mesures de sûreté sur des modèles plus capables avant déploiement progressif). À date, le modèle phare disponible au grand public reste Opus 4.7.

10. Comparatif Opus 4.6 / 4.5 / 4.1

ItemOpus 4.1Opus 4.5Opus 4.6Opus 4.7
Tarif entrée$15$5$5$5
Tarif sortie$75$25$25$25
Contexte max200K200K1M1M
Sortie max32K64K128K128K
Résolution image max1568 px1568 px1568 px2576 px
Niveaux d'effortlow/medium/highlow/medium/high/maxlow/medium/high/maxlow/medium/high/xhigh/max
Extended thinkingOuiOuiPensée adaptativePensée adaptative (OFF par défaut)
Task budgetNonNonNonOui (bêta)
température, etc.DisponibleDisponibleDisponibleSupprime
PrefillDisponibleDisponibleSupprimeSupprime
TokeniseurAncienAncienAncienNouveau (1,0-1,35x)

Chiffres au 16 avril 2026. Le point clé sur 4.6 -> 4.7 : plus de fonctionnalités, même tarif.

11. Quand choisir Opus 4.7 ?

Opus 4.7 est le flagship, mais Opus n'est pas toujours le meilleur choix.

Cas où 4.7 s'impose

  • Tâches de code complexes -- gros refactoring, décisions de design, changements multi-fichiers
  • Boucles d'agent longues -- automatisations multi-étapes, combinaison avec les task budgets
  • Vision avec images haute résolution -- Computer Use, captures d'UI, OCR de documents
  • Long contexte (jusqu'à 1M) -- compreshension d'une grosse codebase, analyse de documents longs
  • Raisonnement extrême -- maths, analyses de niveau recherche, décisions stratégiques

Quand envisager Sonnet

  • QA standardisé, classification, extraction
  • Traitement batch massif ou un modèle « correct » suffit
  • Réactivité temps réel plus importante que le raisonnement

Quand envisager Haiku

  • Classification, traduction, filtrage massifs à coût minimal
  • IoT, edge, exigences de latence extrêmes

La combinaison la plus rentable : Opus 4.7 côté visible (génération de code, raisonnement complexe, cerveau de l'agent), Sonnet ou Haiku côté arrière-plan (classification de logs, extraction, filtrage initial).

12. Nouveautés Claude Code -- /ultrareview

Claude Code (l'outil CLI officiel d'Anthropic) évolue aussi avec 4.7 : une nouvelle commande, /ultrareview, fait son apparition.

/ultrareview en bref

  • Effectue une revue du code modifie avec une profondeur équivalente à xhigh
  • Revue plus poussée que la simple relecture : reusabilite, gestion d'erreurs, pièges du parallélisme, risques de sécurité
  • Signale non seulement les bugs, mais aussi les mauvaises décisions de conception

Si /review correspond à « revue de PR classique », /ultrareview correspond à une revue de design par un senior. Utile avant un gros merge ou une release.

Comme elle mobilise la profondeur xhigh, /ultrareview consomme plus de temps et de tokens qu'une revue classique. Réservez-la aux moments clés ; /review reste votre outil quotidien.

Effort par défaut xhigh sur le plan Max

Pour les utilisateurs du plan Max de Claude Code, l'effort par défaut passe à xhigh avec Opus 4.7. Les tâches quotidiennes qui tournaient en high bénéficient automatiquement d'un raisonnement plus profond. Qualité en hausse, consommation en hausse -- à surveiller.

Auto mode étendu aux utilisateurs Max

L'Auto mode, jusqu'ici réservé à certains plans, est désormais disponible sur Claude Code Max. Il choisit automatiquement entre Opus, Sonnet et Haiku selon la tâche, pour un meilleur compromis coût / vitesse.

FAQ

Q. Puis-je basculer une appli 4.6 vers 4.7 sans rien changer ?

La plupart des applis fonctionnent en changeant juste l'identifiant de modèle. Mais une correction est indispensable si : (1) vous utilisez thinking: {type: "enabled"}, (2) vous utilisez temperature, top_p ou top_k hors valeurs par défaut, (3) vous utilisez le prefill assistant, (4) votre UI affiche la pensée. Ces cas déclenchent une erreur 400 ou un changement de comportement. Voir le guide de migration pour les détails.

Q. Les coûts augmentent-ils réellement avec le nouveau tokeniseur ?

Avec 1,0 à 1,35x de tokens pour le même texte, dans le pire cas la facture peut augmenter d'environ 35 %. En contrepartie, 4.7 appelle moins d'outils et produit des réponses plus concises, ce qui tire les coûts vers le bas. Le résultat net dépend de votre usage. Pour un trafic important, prévoyez une période en double run 4.6 / 4.7 afin de mesurer le coût réel avant la bascule définitive.

Q. Quand choisir xhigh plutôt que max ?

Anthropic recommande xhigh pour le code et les agents, max pour le « raisonnement extrême ». Pour l'implémentation, le refactoring, l'ajout de tests, la planification d'agent, xhigh offre le meilleur ratio coût / qualité. Pour des problèmes mathématiques difficiles, des analyses de niveau recherche ou du stratégique, préférez max. Dans le doute, commencez en xhigh et montez en max si ce n'est pas suffisant.

Q. Pourquoi le task budget n'est-il pas un cap dur ?

Les boucles d'agent incluent des appels d'outils dont la consommation varie fortement. Un cap strict couperait régulièrement la tâche juste avant l'aboutissement -- d'où le choix d'Anthropic de rester sur une limite indicative. Le modèle l'utilise pour planifier, mais peut dépasser si nécessaire. Si un arrêt strict est obligatoire, implémentez un compteur côté application.

Q. Les images haute résolution sont-elles activés automatiquement ?

Oui : spécifiez l'identifiant 4.7, et vos images sont traitées jusqu'à 2576 px sans opt-in. Mais une image pleine résolution coûte environ 4 784 tokens, donc un agent qui en échange beaucoup voit ses coûts bondir. Si la haute résolution n'apporte rien, redimensionnez en amont.

Q. Comment garder des sorties déterministes sans temperature ?

En 4.7, toute valeur non par défaut pour temperature, top_p ou top_k renvoie une 400. Pour stabiliser les sorties, spécifiez précisément le format dans le prompt (par exemple : « réponds en JSON strict selon le schéma suivant »). Combine avec une spécification de sortie structurée type response_format, la stabilité est améliorée.

Q. Pourquoi la pensée est-elle masquee par défaut ?

En 4.7, le contenu de pensée est omis par défaut ; ajoutez display: "summarized" pour l'afficher. L'idée : la pensée est un rouage interne, la réponse finale est le livrable. Si vous avez besoin de debug ou d'un affichage « en train de réfléchir », spécifiez summarized explicitement.

Q. /ultrareview et /review, quelle différence ?

/review correspond à une revue de PR standard : qualité, bugs, style. /ultrareview travaille à la profondeur xhigh : il traite aussi les questions de design, les pièges du parallélisme, les risques de sécurité, la réutilisabilité, la pertinence de la gestion d'erreurs. Plus coûteuse en temps et en tokens, mais idéale juste avant un merge important. /review au quotidien, /ultrareview aux moments clés.

Q. Quels sont les gains chiffres sur les benchmarks ?

D'après Anthropic et ses partenaires : CursorBench : 58 % -> 70 % (code), précision visuelle CursorBench : 54,5 % -> 98,5 % (captures UI), Rakuten-SWE-Bench : 3x plus de tâches résolues. D'autres rapports annoncent ~+13 % sur 93 tâches de code, ~-21 % d'erreurs sur OfficeQA Pro, +10 à 15 % de réussite sur Factory Droids. Sur Finance Agent et GDPval-AA, Anthropic parle de state-of-the-art / top-tier.

Q. C'est quoi Mythos Preview ? Est-il meilleur que 4.7 ?

Mythos Preview est un modèle interne non public. Anthropic déclaré qu'il est le plus aligne et le moins sujet aux erreurs à ce jour, mais ses capacités cyber ont été volontairement limitées le temps d'un déploiement progressif. En capacités générales, Opus 4.7 reste le modèle le plus puissant accessible au grand public. Mythos dépasse 4.7 sur certains benchmarks, mais reste en disponibilité limitée pour vérifier la sûreté avant une ouverture plus large.

Q. Mon usage sécurité (pentest, etc.) est maintenant refuse, que faire ?

4.7 introduit des protections de cybersécurité en temps réel qui peuvent refuser pentest, recherche de vulnérabilités ou red-teaming selon le contexte, même pour un usage légitime. Pour continuer en production, postulez au Cyber Vérification Program. Après validation, vous obtenez des réglages moins restrictifs.

Q. Où trouver les scores de benchmark complets ?

À la sortie, Anthropic publie des chiffres limites et parle de « larges progrès en code, agents et vision ». Pour les benchmarks standards type SWE-bench, attendez les publications officielles (blog Anthropic, model card) et les évaluations indépendantes. Dans tous les cas, la mesure la plus fiable est celle que vous effectuez sur votre propre charge : faites un A/B avant la mise en production.

Article rédige le 16 avril 2026 à partir des informations officielles. Les spécifications, tarifs et plateformes peuvent évoluer : vérifiez la documentation Anthropic avant toute mise en production. Pour la migration, voir notre guide de migration.