2026年9月25日追記:この記事は、2026年7月時点の Claude Fable 5 と GPT-5.6 Sol の比較です。その後、Anthropic は7月24日に Claude Opus 5 を、9月1日に Fable 5 の後継 Claude Fable 5.1 を、OpenAI は9月3日に GPT-6 Astra を公開しました。Astra と Sol の費用はAstra の low と Sol の high を実測で比べた記事で扱っています。さらに9月22日には、Anthropic が Claude Opus 5.5 を、OpenAI が比較相手の GPT-5.6 Sol の次の世代にあたる GPT-6 Sol と GPT-6 Luna を(米国時間)公開しました。いま Anthropic は、どれを使うか迷ったらほとんどの用途は Opus 5.5 から始めるよう案内しています。Fable 5 は旧モデル(Legacy)として API で、GPT-5.6 Sol は移行期間中も、引き続き使えます。本文中の「最上位」「フラッグシップ」「首位」などの表現とベンチマーク値は、執筆当時のものです。また9月22日に、ベンチマークの記述を一次情報で訂正しました。Fable 5 の TerminalBench 2.1「86.0%」はどちらの発表の表にも無い値だったため、両モデルが並ぶ OpenAI の表の値(83.1%)に改め、Sol と並べる SWE-Bench Pro も同じ表の80.0%にしました。また「最大12時間の連続自律」は Anthropic の説明ではなく利用者1人の報告だったため、Anthropic 自身の表現に直しました。

OpenAIの当時の最上位 GPT-5.6「Sol」(2026年7月9日一般提供)と、Anthropicが発表時に「一般提供する中で史上最強」と位置づけた Claude Fable 5(6月9日リリース)。Opus 4.8との比較が「同価格帯の直接対決」だったのに対し、こちらは「半額の万能型 Sol」対「2倍高いが最上位の Fable 5」という、コストと実力のトレードオフが主題になる。

結論を先に言えば——実プロダクション級コーディングと長時間自律では Fable 5 が明確に上、価格とエージェント総合力の幅では Sol が上。SWE-bench Proの差はOpus 4.8戦よりさらに開く。本記事では両社の公式発表・独立ベンチマークを基に、この非対称な2強をどう使い分けるかを整理する。

FLAGSHIP SHOWDOWN · 2026

半額の万能 vs 最上位の職人

— 価格2倍差、しかしSWE-bench Proの差はそれ以上

ANTHROPIC · 発表時の最上位
Claude Fable 5
2026年6月9日リリース
SWE-bench Pro: 80.0%
TerminalBench 2.1: 83.1%
長時間自律: 歴代Claudeで最長
価格: $10 / $50 per MTok
VS
OPENAI · 発表時のフラッグシップ
GPT-5.6 Sol
2026年7月9日 一般提供開始
SWE-bench Pro: 64.6%
TerminalBench 2.1: 88.8%
トークン効率: +54%(コーディング)
価格: $5 / $30 per MTok

Fable 5: 実コード解決・長時間自律で最強の「完走力」
Sol: 端末操作・幅・半額の「コスパと総合力」

1. 両モデルの立ち位置——「半額の万能」vs「最上位の職人」

Claude Fable 5——「長距離走の完走力」に全振り

Fable 5 は Anthropic 社内最強級の frontier モデル「Mythos」級の能力を、一般ユーザー・開発者が使える形で解放したモデルだ(中身は Mythos 5 と同一で、安全装置だけが異なる)。キャッチコピーは「長時間・複雑な仕事のために作られた」。実 GitHub リポジトリ修正を測る SWE-Bench Pro で80.0% を記録し、Opus 4.8(69.2%)や前世代GPT-5.5(58.6%)を大きく引き離す(Anthropic のシステムカードの値。発表の表で Mythos 5 と共通の欄に載る80.3%は、高いほうの Mythos 5 の値)。数百万トークンにわたって集中を保ち、これまでのどの Claude よりも長く自律して働けるとされ、Stripeが5000万行のRubyコード移行を1日で完了させた事例もある(出典: Anthropic公式発表)。

GPT-5.6 Sol——「半額の万能型」

Sol は GPT-5.6(Luna/Terra/Sol)の最上位。端末を自律操作する TerminalBench 2.1 で88.8%、長時間実務の Agents' Last Exam で53.6 とエージェント総合力で首位を取り、コーディングでのトークン効率が54%向上。何より、Fable 5 の約半額($5/$30 対 $10/$50)という価格が最大の武器だ。「最強ではないが、費用対効果で戦う」ポジションにある(出典: OpenAI公式発表・Vellum・Artificial Analysis)。

2. スペック早見表

項目Claude Fable 5GPT-5.6 Sol
提供元Anthropic(発表時の最上位・一般提供モデル)OpenAI(GPT-5.6の最上位)
リリース日2026年6月9日2026年7月9日(一般提供)
モデルIDclaude-fable-5gpt-5.6-sol
コンテキスト長1,000,000 tokens1,050,000 tokens
最大出力トークン128,000 tokens128,000 tokens
知識カットオフ2026年前半(段階的公表)2026年2月16日
API価格$10 / $50 per MTok$5 / $30 per MTok(Fableの約半額。2026年8月21日から3か月の販促価格では $4 / $20)
推論常時オン(適応的思考、生の思考過程は非返却)reasoning effort(none〜max の6段階)
強みの核SWE-Bench Pro 80.0%(Anthropic公表)、歴代Claudeで最長の自律、長距離走の完走力端末操作・エージェント総合力・トークン効率・半額
安全設計3分類器でリスク検知時のみOpus 4.8へフォールバック(作動はセッションの5%未満)「最強のセキュリティモデル」を標榜・safetyスタック強化
提供チャネルClaude.ai、API、GitHub Copilot ほかChatGPT、ChatGPT Work、Codex、OpenAI API

※価格・スペックは各社公式発表(Fable 5=2026年6月9日、GPT-5.6=2026年7月9日)に基づく。ベンチマークは測定条件・時期・harnessが両社で異なり、同一土俵の厳密比較ではない。両モデルを並べた値(SWE-Bench Pro 80.0% 対 64.6%、TerminalBench 2.1 83.1% 対 88.8%、Agents' Last Exam 40.5 対 53.6、Coding Agent Index 77.2 対 80)は、両方が載っている OpenAI の GPT-5.6 発表の評価表による(Sol の Agents' Last Exam 53.6 は発表本文の値で、同じページの表では52.7%。Coding Agent Index は Artificial Analysis の指標)。Anthropic 自身の発表の表では Fable 5 は SWE-Bench Pro 80.3%・TerminalBench 2.1 88.0% だが、どちらも Mythos 5 と共通の欄に載せた両者の高いほうの値で(システムカードでは Fable 5 単独で80.0%・84.3%)、TerminalBench 2.1 には「安全装置のフォールバックのため、Fable 5 は Opus 4.8(同じ表で82.7%)に近い値になる」という注記が付いている。86.0% という値はどちらの表にも無い。

3. ベンチマーク詳細比較

「Fable 5が全勝」でも「Solが全勝」でもない。コーディングの種類で綺麗に分かれる。

CODING & AGENT BENCHMARKS

実コード解決は Fable、端末・幅は Sol

SWE-bench Pro(実リポジトリ修正)Fable 80.0% vs Sol 64.6%
Fable 5
Sol
TerminalBench 2.1(端末自律操作)Sol 88.8% vs Fable 83.1%
Sol
Fable 5
Agents' Last Exam(長時間実務)Sol 53.6 vs Fable 40.5
Sol 53.6
Fable 40.5
Coding Agent Index(Artificial Analysis)Sol 80 vs Fable 77.2
Sol 80
Fable 77.2

出典: OpenAI の GPT-5.6 発表の評価表(Sol の Agents' Last Exam は発表本文の値、Coding Agent Index は Artificial Analysis)

ポイントは 「ベンチマークが測っているもの」 の違いだ。SWE-bench Pro は実 GitHub 課題のパッチ生成=既存コードベースの修正力を測り、ここでは Fable 5 が80.0%でSolの64.6%を15ポイント以上引き離す。一方の TerminalBench 2.1 はコマンドラインの自律操作で、Sol が88.8%でFable 5の83.1%を上回る。さらにエージェント総合の Agents' Last Exam・Coding Agent Index では Sol が優位。「実コードを直し切る深さ=Fable、端末操作とエージェントの幅=Sol」という綺麗な棲み分けになっている。

4. 「非公開ベンチ問題」——伏せられた指標と、SWE-bench Proへの疑義

この比較でも注意が要るのは、OpenAI の評価表に載っていない指標がある点だ。独立分析(Vellum)は発表直後、OpenAI が SWE-bench Verified・GPQA Diamond・AIME・MMLU・ARC-AGI-2・FrontierMath を公表していないと指摘した。ただし2026年9月22日に確認した OpenAI の発表ページの評価表には、GPQA Diamond(Sol 94.6%、Fable 5 92.6%)と FrontierMath(Tier 1〜3 で Sol 89%・Fable 5 87%、Tier 4 で Sol 83%・Fable 5 87.8%)が載っている。載っていないのは SWE-bench Verified・AIME・MMLU で、ARC-AGI-2 の Sol の値(92.5%)は9月3日の GPT-6 Astra の発表の表に初めて出てきた。本記事の SWE-bench Pro「64.6%」も、OpenAI が GPT-5.6 の発表時に公開した評価表の値だ。ただし OpenAI は同時に、SWE-bench Pro の課題の約30%に不備があるとする分析も公開している(Simon Willisonが指摘)。

THE BENCHMARK PROBLEM

最も実務に近いコーディング指標に、OpenAIが疑義

🟡 Solは64.6%
OpenAI自身の評価表の値。ただし課題の約30%に不備があるとする分析も同時に公開
✅ Fableは開示
AnthropicはSWE-Bench Pro 80.0%を公表(システムカードの値で、OpenAI の表とも一致。発表の表の80.3%は Mythos 5 の値)
🔴 表に無い指標もある
SolはSWE-bench Verified・AIME・MMLUの値が無い(GPQA DiamondはSol 94.6%対Fable 5 92.6%で表にある)

※ 実プロダクション級コーディングを重視するなら、SWE-bench Pro が両社の表とも80%前後の Fable 5 が有力。派手なエージェント数字だけで判断しない。

5. 長時間自律——Fable 5の本領

Fable 5 の真価はベンチのスコアより「長距離走の完走力」にある。Anthropicは、数百万トークンにわたって集中を保ち、これまでのどの Claude よりも長く自律して働けると説明している(時間の上限は示していない)。実例として挙げているのは Stripeが5000万行のRubyコード移行を1日で完了(手作業なら2か月超相当)した事例だ。発表直後には、利用者が1つの指示で12時間以上自走させた例も Ten Past Tomorrow のブログで報告されている。長時間分析ベンチ Hex では史上初の90%超も報告された。

歴代最長
Claudeで最も長い自律動作

数百万トークンにわたって集中を保ち、長丁場のコーディング・調査を自走(Anthropicの説明)。

5000万行 / 1日
Stripeの大規模移行

手作業なら2か月超のRuby移行を1日で完了させた実例。

SWE-Bench Pro 80.0%
実コード修正で首位級

OpenAI の表で Opus 4.8(69.2%)や Sol(64.6%)を大きく引き離す(Anthropic のシステムカードでも80.0%)。

Solも長時間実務のAgents' Last Examで首位(53.6)だが、こちらは「幅広い業務ワークフロー」を測るベンチ。単一の巨大コードベースを最後まで直し切る「深い完走力」ではFable 5に分がある——というのが両者の質的な違いだ。大規模移行・長時間調査・自律コーディングエージェントの主力にはFable 5が向く。

6. 実コスト——2倍の単価をどう見るか

単価は Fable 5 が $10/$50、Sol が $5/$30。入力で2倍、出力で1.67倍、Fable 5 はSolのおよそ2倍高い(Sol が2026年8月21日から3か月の販促価格 $4/$20 の間は約2.5倍)。ここが選択の分かれ目になる。

  • Solのコスト優位:単価が半額なうえ、コーディングでトークン効率が54%向上。同じ作業なら消費トークンも減るため、「量をこなす」用途では総コストがFable 5を大きく下回る。
  • Fable 5の価値:単価は高いが、1回で正しく直し切る成功率(SWE-bench Pro は両社の表とも約80%)が高い。やり直し・レビュー・人手の手戻りコストまで含めると、難タスクでは「高いが結局安い」ことがある。5000万行を1日で移行できるなら、人件費換算では破格だ。

つまり「トークン単価」ではなく「タスク完了あたりのコスト」で見るべきだ。日常の量産タスク・端末操作はSol(さらにコスト重視ならGPT-5.6 TerraやLuna)、失敗が高くつく大規模・長時間タスクはFable 5——という住み分けが、コスト最適の観点でも理にかなう。

※ 両社は同一条件の出力トークン比較を公表していないため、具体的な「実コスト倍率」は断定できない。自分の代表タスクで成功率と出力トークンを実測し、手戻りコストまで含めて比較することを推奨する。

7. 強み・弱みマップ

STRENGTHS & WEAKNESSES

最上位の完走力 vs 半額の総合力

CLAUDE FABLE 5
◯ 強み
  • ・SWE-Bench Pro 約80%(両社の表)で実コーディング最強級
  • ・歴代Claudeで最長の自律・完走力
  • ・大規模移行の実績(Stripe 5000万行/1日)
  • ・FrontierMath Tier 4 は OpenAI の表でも Sol より上(87.8%対83%)
  • ・3分類器の新安全設計(危険領域のみ抑制)
△ 弱み
  • ・単価が高い($10/$50=Solの約2倍。Solの販促価格の期間中は約2.5倍)
  • ・端末操作・エージェント総合の幅はSolに劣る
  • ・軽い量産タスクにはオーバースペック
  • ・生の思考過程は返却されない
GPT-5.6 SOL
◯ 強み
  • ・TerminalBench 88.8%・端末操作で首位
  • ・Agents' Last Exam・Coding Agent Index 首位
  • ・単価が半額+トークン効率+54%でコスパ最強
  • ・Luna/Terra/Solの3モデルで用途最適化
  • ・ChatGPT Work / Codex / GPT-Live 連携
△ 弱み
  • ・SWE-bench Proで15pt以上の大差負け
  • ・AIME・MMLU などは評価表に無い
  • ・単一巨大コードの「深い完走力」でFableに劣る
  • ・長時間自律の実績提示はFableが上

8. ユースケース別の選び方

ユースケース推奨モデル理由
大規模コード移行・レガシー刷新Fable 5長時間自律+Stripe 5000万行/1日の完走力
実リポジトリの難バグ修正・大PRFable 5SWE-Bench Pro 約80%(両社の表)で成功率が高い
長時間の自律調査・分析エージェントFable 5数百万トークン集中・完走力に最適化
失敗の手戻りコストが大きい重要タスクFable 51回で正しく直し切る確度が高い
CLI・端末を自律操作するエージェントSolTerminalBench 2.1 88.8% で首位
幅広い業務ワークフロー自動化SolAgents' Last Exam 53.6 で首位
コスト重視の量産タスクSol半額+トークン効率+54%。軽作業はTerra/Lunaも
ChatGPT/Codex/音声を含む統合運用SolChatGPT Work・GPT-Live・Codexと一体

まとめ

  • Claude Fable 5: 実コード修正(SWE-Bench Pro 約80%)と長時間自律で最強級。大規模移行・難タスクの「完走力」が本領。ただし単価はSolの約2倍。
  • GPT-5.6 Sol: 端末操作(TerminalBench 88.8%)・エージェント総合力で首位、半額+トークン効率+54%でコスパ最強。3モデルで用途最適化しやすい。
  • SWE-bench Proの差はOpus 4.8戦より拡大(OpenAI の表で 80.0 vs 64.6・15pt超)。ただしOpenAIは、SWE-bench Proの課題の約30%に不備があるとする分析も公開している点に注意。
  • コストは「トークン単価」でなく「タスク完了あたり」で見る。量産・端末はSol、失敗が高くつく大規模・長時間はFable 5。
  • 現実解はデュアル運用。日常はSol(またはTerra)、勝負どころの大タスクはFable 5、と使い分けるのが最適。

FAQ

Q1. GPT-5.6 Sol と Claude Fable 5、コーディングはどちらが強い?

指標による。実リポジトリのバグ修正を測るSWE-Bench ProではFable 5が80.0%でSolの64.6%を15pt以上上回る。一方、端末自律操作のTerminalBench 2.1ではSolが88.8%でFable 5の83.1%を上回る(いずれも OpenAI の評価表の値。Anthropic のシステムカードでも Fable 5 の SWE-Bench Pro は80.0%)。「実コードを直し切るならFable、端末操作・エージェントの幅ならSol」が実用的な棲み分け。

Q2. 価格差2倍を払う価値はある?

タスク次第。日常の量産・端末操作なら半額のSol(さらに軽作業はTerra/Luna)で十分。ただし大規模移行や難バグ修正など「失敗の手戻りが高くつくタスク」では、成功率の高いFable 5が結局安くつくことがある。トークン単価でなく「タスク完了あたりのコスト」で判断を。

Q3. SolのSWE-bench Pro「64.6%」は公式の値?

OpenAIがGPT-5.6の発表時に公開した評価表の値だ。ただしOpenAIは同時に、SWE-bench Proの課題の約30%に不備があるとする分析も公開しており、この指標自体に疑義を示している。発表直後にVellumが非公表と指摘したGPQA DiamondとFrontierMathも、2026年9月22日に確認した評価表には載っている(GPQAはSol 94.6%・Fable 5 92.6%)。表に無いのはSWE-bench Verified・AIME・MMLUだ。

Q4. 長時間の自律タスクにはどちらが向く?

Fable 5。数百万トークンにわたって集中を保ち、これまでのどの Claude よりも長く自律して働けるとされ(Anthropic の説明)、Stripeが5000万行のRuby移行を1日で完了させた実績がある。単一の巨大コードベースを最後まで直し切る「完走力」はFable 5の本領だ。

Q5. Fable 5とMythos 5は何が違う?

中身(能力)は同一で、安全装置だけが異なる。一般提供されるのがFable 5で、Fable 5はリスク検知時のみOpus 4.8へフォールバックする3分類器の安全設計を持つ(作動はセッションの5%未満で、95%超は自走)。

Q6. GPT-5.6の「Terra」はこの比較にどう絡む?

GPT-5.6はLuna/Terra/Solの3モデル。本記事は執筆当時のフラッグシップ同士としてSolを取り上げたが、コスト重視ならTerra($2/$12)がGPT-5.5相当をSolの4割の単価で提供する(2026年7月30日の値下げ後)。「Fable 5で難タスク、Terraで量産」という組み合わせも実務では有力。詳細はGPT-5.6リリース完全解説を参照。

Q7. Opus 4.8とFable 5、Solと比べるならどっち?

用途と予算で選ぶ。Opus 4.8($5/$25)はSolと同価格帯で、SWE-bench Pro 69.2%とコスパのよいコーディング。Fable 5($10/$50)は当時の最上位で80.0%と完走力が別格だが高価。日常はOpus 4.8/Sol、勝負どころはFable 5、という三段活用が現実的。Sol vs Opus 4.8の比較も参照。

関連記事