Mise à jour du 25 septembre 2026 : cet article compare Claude Fable 5 et GPT-5.6 Sol tels qu'ils étaient en juillet 2026. Depuis, Anthropic a publié Claude Opus 5 (24 juillet) et Claude Fable 5.1, successeur de Fable 5 (1er septembre), et OpenAI a publié GPT-6 Astra (3 septembre). Pour le coût, voir notre comparaison mesurée d'Astra en low et de Sol en high. Puis, le 22 septembre, Anthropic a publié Claude Opus 5.5 et OpenAI a publié GPT-6 Sol et GPT-6 Luna (heure des États-Unis), la génération qui suit GPT-5.6 Sol. Anthropic conseille désormais, en cas de doute, de commencer par Opus 5.5 pour la plupart des usages. Fable 5 reste disponible dans l'API en tant que modèle Legacy, et GPT-5.6 Sol reste disponible pendant la période de transition. Les termes « haut de gamme », « modèle phare » ou « en tête » ci-dessous, ainsi que les valeurs de benchmark, datent de la rédaction. Le 22 septembre, nous avons aussi corrigé les valeurs de benchmark d'après les sources primaires. Les « 86.0% » de Fable 5 sur TerminalBench 2.1 ne figurent dans le tableau d'aucune des deux entreprises : nous les avons remplacés par la valeur du tableau d'OpenAI, qui présente les deux modèles (83.1%), et là où SWE-Bench Pro est opposé à Sol, nous utilisons désormais les 80.0% de ce même tableau. Nous avons aussi reformulé avec les mots d'Anthropic elle-même les « 12 heures d'autonomie continue », qui venaient du témoignage d'un utilisateur et non d'Anthropic.

Le modèle haut de gamme d'OpenAI à l'époque, GPT-5.6 « Sol » (disponibilité générale le 9 juillet 2026), face à Claude Fable 5 (sortie le 9 juin 2026), qu'Anthropic présentait à sa sortie comme « le modèle le plus puissant jamais rendu disponible au grand public ». Là où la comparaison avec Opus 4.8 constituait un « duel direct à tarif équivalent », il s'agit ici du « Sol polyvalent à moitié prix » contre « Fable 5 deux fois plus cher mais haut de gamme », où le sujet central devient l'arbitrage entre coût et performance.

Pour aller droit au but — en codage de niveau production réel et en autonomie longue durée, Fable 5 est nettement supérieur ; pour le prix et l'étendue globale des capacités d'agent, c'est Sol qui l'emporte. L'écart sur SWE-bench Pro est encore plus marqué que dans le duel contre Opus 4.8. Dans cet article, en nous appuyant sur les annonces officielles des deux entreprises et sur des benchmarks indépendants, nous expliquons comment répartir l'usage de ces deux poids lourds asymétriques.

FLAGSHIP SHOWDOWN · 2026

Le polyvalent à moitié prix vs l'artisan haut de gamme

— Un prix du simple au double, mais un écart sur SWE-bench Pro plus grand encore

ANTHROPIC · HAUT DE GAMME À SA SORTIE
Claude Fable 5
Sortie le 9 juin 2026
SWE-bench Pro : 80.0%
TerminalBench 2.1 : 83.1%
Autonomie longue durée : la plus longue des Claude
Prix : $10 / $50 per MTok
VS
OPENAI · FLAGSHIP À SA SORTIE
GPT-5.6 Sol
Disponibilité générale le 9 juillet 2026
SWE-bench Pro : 64.6%
TerminalBench 2.1 : 88.8%
Efficacité en tokens : +54% (codage)
Prix : $5 / $30 per MTok

Fable 5 : la meilleure « capacité à aller au bout » en résolution de code réel et autonomie longue durée
Sol : le « rapport qualité-prix et la polyvalence » en manipulation de terminal, étendue et moitié prix

1. Positionnement des deux modèles — « le polyvalent à moitié prix » vs « l'artisan haut de gamme »

Claude Fable 5 — tout misé sur « la capacité à finir un marathon »

Fable 5 est le modèle qui libère, sous une forme accessible aux utilisateurs et développeurs grand public, les capacités du modèle frontière le plus puissant en interne chez Anthropic, de la classe « Mythos » (le cœur est identique à Mythos 5, seuls les dispositifs de sécurité diffèrent). Son slogan : « conçu pour les tâches longues et complexes ». Il enregistre 80.0% sur SWE-Bench Pro, qui mesure la correction de dépôts GitHub réels, laissant loin derrière Opus 4.8 (69.2%) et la génération précédente GPT-5.5 (58.6%) (d'après la fiche système d'Anthropic ; les 80.3% du tableau de l'annonce figurent dans une colonne partagée avec Mythos 5 et correspondent au score le plus élevé, celui de Mythos 5). Il reste concentré sur des millions de tokens et peut travailler en autonomie plus longtemps que tous les Claude précédents, et l'on cite le cas de Stripe qui a mené à bien la migration de 50 millions de lignes de code Ruby en une seule journée (source : annonce officielle d'Anthropic).

GPT-5.6 Sol — « le polyvalent à moitié prix »

Sol est le modèle haut de gamme de GPT-5.6 (Luna/Terra/Sol). Avec 88.8% sur TerminalBench 2.1, qui mesure l'opération autonome d'un terminal, et 53.6 à l'Agents' Last Exam, consacré aux tâches professionnelles de longue durée, il prend la première place en polyvalence globale d'agent, et voit son efficacité en tokens progresser de 54% en codage. Surtout, son prix — environ la moitié de celui de Fable 5 ($5/$30 contre $10/$50) — constitue son atout majeur. Il occupe une position du type « pas le plus puissant, mais qui se bat sur le rapport coût-efficacité » (source : annonce officielle d'OpenAI, Vellum, Artificial Analysis).

2. Tableau récapitulatif des spécifications

ÉlémentClaude Fable 5GPT-5.6 Sol
FournisseurAnthropic (modèle haut de gamme à sa sortie, disponible au grand public)OpenAI (modèle haut de gamme de GPT-5.6)
Date de sortie9 juin 20269 juillet 2026 (disponibilité générale)
ID du modèleclaude-fable-5gpt-5.6-sol
Longueur de contexte1,000,000 tokens1,050,000 tokens
Tokens de sortie max128,000 tokens128,000 tokens
Date de coupure des connaissancesPremier semestre 2026 (publication progressive)16 février 2026
Tarif API$10 / $50 per MTok$5 / $30 per MTok (environ la moitié de Fable ; tarif promotionnel de trois mois à partir du 21 août 2026 : $4 / $20)
RaisonnementToujours actif (réflexion adaptative, processus de pensée brut non restitué)reasoning effort (6 niveaux, de none à max)
Point fort centralSWE-Bench Pro 80.0% (chiffre d'Anthropic), l'autonomie la plus longue des Claude, capacité à aller au bout d'un marathonManipulation de terminal, polyvalence d'agent, efficacité en tokens, moitié prix
Conception de sécuritéRepli vers Opus 4.8 uniquement si un risque est détecté par 3 classifieurs (déclenchement dans moins de 5% des sessions)Se revendique « le modèle le plus sûr », pile de sécurité renforcée
Canaux de distributionClaude.ai, API, GitHub Copilot, etc.ChatGPT, ChatGPT Work, Codex, API OpenAI

* Les prix et spécifications reposent sur les annonces officielles des deux entreprises (Fable 5 = 9 juin 2026, GPT-5.6 = 9 juillet 2026). Les conditions de mesure, les périodes et les harnais des benchmarks diffèrent d'une entreprise à l'autre : il ne s'agit pas d'une comparaison stricte sur un pied d'égalité. Les valeurs mises face à face (SWE-Bench Pro 80.0% contre 64.6%, TerminalBench 2.1 83.1% contre 88.8%, Agents' Last Exam 40.5 contre 53.6, Coding Agent Index 77.2 contre 80) proviennent du tableau d'évaluation de l'annonce de GPT-5.6 par OpenAI, qui présente les deux modèles (les 53.6 de Sol à l'Agents' Last Exam sont la valeur du texte de l'annonce ; le tableau de la même page indique 52.7% ; le Coding Agent Index est un indicateur d'Artificial Analysis). Dans le tableau de l'annonce d'Anthropic elle-même, Fable 5 affiche 80.3% sur SWE-Bench Pro et 88.0% sur TerminalBench 2.1, mais ces deux valeurs figurent dans une colonne partagée avec Mythos 5 et correspondent au plus élevé des deux scores (la fiche système donne à Fable 5 seul 80.0% et 84.3%), et celle de TerminalBench 2.1 porte une note d'Anthropic : à cause des garde-fous qui renvoient certaines requêtes vers un autre modèle, Fable 5 se rapproche d'Opus 4.8 (82.7% dans le même tableau). La valeur de 86.0% ne figure dans aucun des deux tableaux.

3. Comparaison détaillée des benchmarks

Ce n'est ni « Fable 5 qui gagne partout » ni « Sol qui gagne partout ». La répartition se fait nettement selon le type de codage.

CODING & AGENT BENCHMARKS

La résolution de code réel à Fable, le terminal et l'étendue à Sol

SWE-bench Pro (correction de dépôts réels)Fable 80.0% vs Sol 64.6%
Fable 5
Sol
TerminalBench 2.1 (opération autonome de terminal)Sol 88.8% vs Fable 83.1%
Sol
Fable 5
Agents' Last Exam (tâches professionnelles longue durée)Sol 53.6 vs Fable 40.5
Sol 53.6
Fable 40.5
Coding Agent Index (Artificial Analysis)Sol 80 vs Fable 77.2
Sol 80
Fable 77.2

Source : tableau d'évaluation de l'annonce de GPT-5.6 par OpenAI (Agents' Last Exam de Sol d'après le texte de l'annonce ; Coding Agent Index d'Artificial Analysis)

L'essentiel tient à la différence de « ce que mesure chaque benchmark ». SWE-bench Pro mesure la génération de correctifs sur des issues GitHub réelles, c'est-à-dire la capacité à modifier une base de code existante, et ici Fable 5 devance de plus de 15 points, avec 80.0% contre les 64.6% de Sol. À l'inverse, TerminalBench 2.1 porte sur l'opération autonome en ligne de commande, où Sol l'emporte avec 88.8% face aux 83.1% de Fable 5. De plus, sur la polyvalence globale d'agent, Sol domine à l'Agents' Last Exam et au Coding Agent Index. On obtient un partage net : « la profondeur pour corriger réellement du code jusqu'au bout = Fable ; l'étendue en manipulation de terminal et en agents = Sol ».

4. Le « problème des benchmarks non publiés » — des scores tus et un SWE-bench Pro contesté

Dans cette comparaison aussi, il faut rester vigilant sur un point : certains indicateurs manquent au tableau d'évaluation d'OpenAI. Juste après le lancement, une analyse indépendante (Vellum) a souligné qu'OpenAI n'avait publié ni SWE-bench Verified, ni GPQA Diamond, ni AIME, ni MMLU, ni ARC-AGI-2, ni FrontierMath. Or le tableau d'évaluation de la page d'annonce d'OpenAI, consulté le 22 septembre 2026, contient bien GPQA Diamond (Sol 94.6%, Fable 5 92.6%) et FrontierMath (Tier 1-3 : Sol 89%, Fable 5 87% ; Tier 4 : Sol 83%, Fable 5 87.8%). Ce qui manque, ce sont SWE-bench Verified, AIME et MMLU, et le score de Sol sur ARC-AGI-2 (92.5%) n'est apparu que dans le tableau de l'annonce de GPT-6 Astra, le 3 septembre. Le « 64.6% » de SWE-bench Pro de cet article provient lui aussi du tableau d'évaluation publié par OpenAI avec GPT-5.6. Dans le même temps, OpenAI a toutefois publié une analyse estimant qu'environ 30% des tâches de SWE-bench Pro sont défectueuses (comme l'a relevé Simon Willison).

THE BENCHMARK PROBLEM

OpenAI conteste l'indicateur de codage le plus proche du réel

🟡 Sol : 64.6%
Valeur du propre tableau d'évaluation d'OpenAI, qui a aussi publié une analyse jugant environ 30% des tâches défectueuses
✅ Fable : divulgué
Anthropic publie 80.0% sur SWE-Bench Pro (chiffre de la fiche système, identique au tableau d'OpenAI ; les 80.3% du tableau de l'annonce sont le score de Mythos 5)
🔴 Certains indicateurs manquent
Pour Sol, aucune valeur sur SWE-bench Verified, AIME ni MMLU (GPQA Diamond figure au tableau : Sol 94.6% contre 92.6% pour Fable 5)

* Si vous privilégiez le codage de niveau production réel, Fable 5, autour de 80% sur SWE-bench Pro dans les tableaux des deux entreprises, est le choix fort. Ne jugez pas seulement sur des chiffres d'agent spectaculaires.

5. Autonomie longue durée — le domaine de Fable 5

La vraie valeur de Fable 5 réside moins dans ses scores de benchmarks que dans sa « capacité à finir un marathon ». Anthropic explique qu'il reste concentré sur des millions de tokens et peut travailler en autonomie plus longtemps que tous les Claude précédents (sans donner de limite en heures). L'exemple concret qu'elle cite est celui de Stripe, qui a achevé la migration de 50 millions de lignes de code Ruby en une journée (l'équivalent de plus de deux mois à la main). Juste après le lancement, un utilisateur a aussi raconté sur le blog Ten Past Tomorrow que le modèle avait travaillé seul plus de 12 heures à partir d'une seule consigne. Sur le benchmark d'analyse longue durée Hex, un dépassement inédit de 90% a également été rapporté.

Le plus long
Autonomie la plus longue des Claude

Concentré sur des millions de tokens, il mène seul des travaux de codage et d'analyse de longue haleine (selon Anthropic).

50 M de lignes / 1 jour
Migration à grande échelle de Stripe

Un cas réel où une migration Ruby de plus de deux mois à la main a été bouclée en une journée.

SWE-Bench Pro 80.0%
Au sommet en correction de code réel

Dans le tableau d'OpenAI, il laisse loin derrière Opus 4.8 (69.2%) et Sol (64.6%) (la fiche système d'Anthropic indique aussi 80.0%).

Sol occupe lui aussi la première place à l'Agents' Last Exam pour les tâches professionnelles de longue durée (53.6), mais ce benchmark mesure « des flux de travail professionnels étendus ». Pour la « profondeur du marathon » consistant à corriger jusqu'au bout une unique et gigantesque base de code, l'avantage est à Fable 5 — voilà la différence qualitative entre les deux. Pour les migrations à grande échelle, les analyses de longue durée et les agents de codage autonomes de première ligne, Fable 5 est mieux adapté.

6. Coût réel — comment interpréter un tarif deux fois plus élevé

Le tarif unitaire est de $10/$50 pour Fable 5 et $5/$30 pour Sol. Deux fois plus cher en entrée, 1,67 fois plus en sortie : Fable 5 coûte environ le double de Sol (environ 2,5 fois tant que Sol est à son tarif promotionnel de $4/$20, pendant trois mois à partir du 21 août 2026). C'est là que se joue le choix.

  • L'avantage de coût de Sol : non seulement son tarif est de moitié, mais son efficacité en tokens progresse de 54% en codage. Comme il consomme aussi moins de tokens pour un même travail, pour les usages « à fort volume », son coût total est nettement inférieur à celui de Fable 5.
  • La valeur de Fable 5 : son tarif est élevé, mais son taux de réussite à corriger correctement du premier coup (SWE-bench Pro autour de 80% dans les tableaux des deux entreprises) est haut. Si l'on inclut les coûts de reprise, de relecture et de retouches humaines, sur les tâches difficiles il peut être « cher mais finalement économique ». S'il peut migrer 50 millions de lignes en une journée, le coût converti en main-d'œuvre est imbattable.

Autrement dit, il faut raisonner non pas en « tarif au token » mais en « coût par tâche achevée ». Les tâches quotidiennes à fort volume et la manipulation de terminal reviennent à Sol (et, pour un accent encore plus fort sur le coût, à GPT-5.6 Terra ou Luna), tandis que les tâches à grande échelle et longue durée où l'échec coûte cher reviennent à Fable 5 — cette répartition tient aussi debout du point de vue de l'optimisation des coûts.

* Les deux entreprises ne publiant pas de comparaison des tokens de sortie à conditions égales, on ne peut affirmer de « multiplicateur de coût réel » précis. Nous recommandons de mesurer vous-même, sur vos tâches représentatives, le taux de réussite et les tokens de sortie, et de comparer en incluant les coûts de reprise.

7. Carte des forces et faiblesses

STRENGTHS & WEAKNESSES

La capacité d'achèvement haut de gamme vs la polyvalence à moitié prix

CLAUDE FABLE 5
◯ Forces
  • · Au sommet en codage réel avec environ 80% sur SWE-Bench Pro (deux tableaux)
  • · L'autonomie la plus longue des Claude et capacité à aller au bout
  • · Réalisations en migration à grande échelle (Stripe 50 M de lignes/1 jour)
  • · Devant Sol sur FrontierMath Tier 4 même dans le tableau d'OpenAI (87.8% contre 83%)
  • · Nouvelle conception de sécurité à 3 classifieurs (bridage des seules zones dangereuses)
△ Faiblesses
  • · Tarif élevé ($10/$50 = environ le double de Sol ; environ 2,5 fois pendant la période promotionnelle de Sol)
  • · Étendue inférieure à Sol en terminal et polyvalence d'agent
  • · Surdimensionné pour les tâches légères à fort volume
  • · Le processus de pensée brut n'est pas restitué
GPT-5.6 SOL
◯ Forces
  • · TerminalBench 88.8%, premier en manipulation de terminal
  • · Premier à l'Agents' Last Exam et au Coding Agent Index
  • · Meilleur rapport qualité-prix : moitié prix + efficacité en tokens +54%
  • · Optimisation par usage grâce aux 3 modèles Luna/Terra/Sol
  • · Intégration ChatGPT Work / Codex / GPT-Live
△ Faiblesses
  • · Défaite de plus de 15 pts sur SWE-bench Pro
  • · AIME, MMLU, etc. absents du tableau d'évaluation
  • · Inférieur à Fable pour la « profondeur du marathon » sur une base de code unique et massive
  • · Fable est mieux placé pour présenter des réalisations d'autonomie longue durée

8. Comment choisir selon les cas d'usage

Cas d'usageModèle recommandéRaison
Migration de code à grande échelle, modernisation d'un existantFable 5Autonomie longue durée + capacité d'achèvement Stripe 50 M de lignes/1 jour
Correction de bugs difficiles et gros PR sur dépôts réelsFable 5Taux de réussite élevé avec environ 80% sur SWE-Bench Pro (deux tableaux)
Agents d'investigation et d'analyse autonomes de longue duréeFable 5Optimisé pour la concentration sur des millions de tokens et l'achèvement
Tâches critiques où la reprise après échec coûte cherFable 5Haute probabilité de corriger correctement du premier coup
Agents opérant un CLI ou un terminal de façon autonomeSolPremier avec 88.8% sur TerminalBench 2.1
Automatisation de flux de travail professionnels étendusSolPremier avec 53.6 à l'Agents' Last Exam
Tâches à fort volume avec accent sur le coûtSolMoitié prix + efficacité en tokens +54%. Pour les travaux légers, Terra/Luna aussi
Exploitation intégrée incluant ChatGPT/Codex/voixSolNe fait qu'un avec ChatGPT Work, GPT-Live et Codex

Conclusion

  • Claude Fable 5 : au sommet en correction de code réel (SWE-Bench Pro autour de 80%) et en autonomie longue durée. Son domaine est la « capacité à aller au bout » des migrations à grande échelle et des tâches difficiles. Mais son tarif est environ le double de celui de Sol.
  • GPT-5.6 Sol : premier en manipulation de terminal (TerminalBench 88.8%) et en polyvalence globale d'agent, meilleur rapport qualité-prix avec moitié prix + efficacité en tokens +54%. Facile à optimiser par usage grâce à ses 3 modèles.
  • L'écart sur SWE-bench Pro s'est creusé par rapport au duel contre Opus 4.8 (80.0 vs 64.6 dans le tableau d'OpenAI, plus de 15 pts). Attention toutefois : OpenAI a aussi publié une analyse estimant qu'environ 30% des tâches de SWE-bench Pro sont défectueuses.
  • Le coût s'évalue non pas au « tarif au token » mais « par tâche achevée ». Le volume et le terminal à Sol, les tâches à grande échelle et longue durée où l'échec coûte cher à Fable 5.
  • La solution réaliste est l'usage combiné. L'idéal est de répartir : Sol (ou Terra) au quotidien, Fable 5 pour les grandes tâches décisives.

FAQ

Q1. GPT-5.6 Sol ou Claude Fable 5, lequel est le plus fort en codage ?

Cela dépend de l'indicateur. Sur SWE-Bench Pro, qui mesure la correction de bugs sur dépôts réels, Fable 5 dépasse de plus de 15 pts avec 80.0% contre les 64.6% de Sol. À l'inverse, sur TerminalBench 2.1, pour l'opération autonome de terminal, Sol l'emporte avec 88.8% face aux 83.1% de Fable 5 (les deux valeurs viennent du tableau d'évaluation d'OpenAI ; la fiche système d'Anthropic donne aussi 80.0% à Fable 5 sur SWE-Bench Pro). Le partage pratique : « corriger réellement du code jusqu'au bout = Fable ; l'étendue en terminal et agents = Sol ».

Q2. Vaut-il la peine de payer le double ?

Cela dépend de la tâche. Pour le volume quotidien et la manipulation de terminal, le Sol à moitié prix (et, pour les travaux légers, Terra/Luna) suffit. Mais sur les tâches « où la reprise après échec coûte cher », comme les migrations à grande échelle ou les corrections de bugs difficiles, Fable 5, à fort taux de réussite, revient finalement moins cher. À juger non pas au tarif au token mais au « coût par tâche achevée ».

Q3. Le « 64.6% » de Sol sur SWE-bench Pro est-il officiel ?

Oui. C'est la valeur du tableau d'évaluation publié par OpenAI avec GPT-5.6. Dans le même temps, OpenAI a publié une analyse estimant qu'environ 30% des tâches de SWE-bench Pro sont défectueuses, remettant en cause le benchmark lui-même. GPQA Diamond et FrontierMath, que Vellum disait non publiés juste après le lancement, figurent bien dans le tableau d'évaluation consulté le 22 septembre 2026 (GPQA : Sol 94.6%, Fable 5 92.6%). Ce qui manque au tableau, ce sont SWE-bench Verified, AIME et MMLU.

Q4. Lequel est le mieux adapté aux tâches autonomes de longue durée ?

Fable 5. Il reste concentré sur des millions de tokens et, selon Anthropic, peut travailler en autonomie plus longtemps que tous les Claude précédents, et il a permis à Stripe d'achever une migration Ruby de 50 millions de lignes en une journée. La « capacité à aller au bout » pour corriger jusqu'au bout une base de code unique et gigantesque est le domaine de Fable 5.

Q5. Quelle différence entre Fable 5 et Mythos 5 ?

Le cœur (les capacités) est identique, seuls les dispositifs de sécurité diffèrent. C'est Fable 5 qui est rendu disponible au grand public, et il dispose d'une conception de sécurité à 3 classifieurs qui ne se replie vers Opus 4.8 qu'en cas de détection de risque (déclenchement dans moins de 5% des sessions, plus de 95% du temps il fonctionne seul).

Q6. Comment le « Terra » de GPT-5.6 s'inscrit-il dans cette comparaison ?

GPT-5.6 compte 3 modèles : Luna/Terra/Sol. Cet article a retenu Sol comme fleuron face à fleuron de l'époque, mais si l'on privilégie le coût, Terra ($2/$12) offre l'équivalent de GPT-5.5 à 40 % du prix unitaire de Sol (après la baisse de prix du 30 juillet 2026). La combinaison « Fable 5 pour les tâches difficiles, Terra pour le volume » est aussi une piste solide en pratique. Pour les détails, voir l'analyse complète de la sortie de GPT-5.6.

Q7. Entre Opus 4.8, Fable 5 et Sol, lequel comparer ?

À choisir selon l'usage et le budget. Opus 4.8 ($5/$25) est dans la même gamme de prix que Sol, avec un codage au bon rapport qualité-prix à 69.2% sur SWE-bench Pro. Fable 5 ($10/$50) était alors le haut de gamme, avec 80.0% et une capacité d'achèvement à part, mais coûteux. Une utilisation à trois niveaux est réaliste : Opus 4.8/Sol au quotidien, Fable 5 pour les moments décisifs. Voir aussi la comparaison Sol vs Opus 4.8.

Articles liés