2026年9月25日追記:この記事は、2026年7月時点の Claude Fable 5 と GPT-5.6 Sol の比較です。その後、Anthropic は7月24日に Claude Opus 5 を、9月1日に Fable 5 の後継 Claude Fable 5.1 を、OpenAI は9月3日に GPT-6 Astra を公開しました。Astra と Sol の費用はAstra の low と Sol の high を実測で比べた記事で扱っています。さらに9月22日には、Anthropic が Claude Opus 5.5 を、OpenAI が比較相手の GPT-5.6 Sol の次の世代にあたる GPT-6 Sol と GPT-6 Luna を(米国時間)公開しました。いま Anthropic は、どれを使うか迷ったらほとんどの用途は Opus 5.5 から始めるよう案内しています。Fable 5 は旧モデル(Legacy)として API で、GPT-5.6 Sol は移行期間中も、引き続き使えます。本文中の「最上位」「フラッグシップ」「首位」などの表現とベンチマーク値は、執筆当時のものです。また9月22日に、ベンチマークの記述を一次情報で訂正しました。Fable 5 の TerminalBench 2.1「86.0%」はどちらの発表の表にも無い値だったため、両モデルが並ぶ OpenAI の表の値(83.1%)に改め、Sol と並べる SWE-Bench Pro も同じ表の80.0%にしました。また「最大12時間の連続自律」は Anthropic の説明ではなく利用者1人の報告だったため、Anthropic 自身の表現に直しました。
目次
OpenAIの当時の最上位 GPT-5.6「Sol」(2026年7月9日一般提供)と、Anthropicが発表時に「一般提供する中で史上最強」と位置づけた Claude Fable 5(6月9日リリース)。Opus 4.8との比較が「同価格帯の直接対決」だったのに対し、こちらは「半額の万能型 Sol」対「2倍高いが最上位の Fable 5」という、コストと実力のトレードオフが主題になる。
結論を先に言えば——実プロダクション級コーディングと長時間自律では Fable 5 が明確に上、価格とエージェント総合力の幅では Sol が上。SWE-bench Proの差はOpus 4.8戦よりさらに開く。本記事では両社の公式発表・独立ベンチマークを基に、この非対称な2強をどう使い分けるかを整理する。
半額の万能 vs 最上位の職人
— 価格2倍差、しかしSWE-bench Proの差はそれ以上
Fable 5: 実コード解決・長時間自律で最強の「完走力」
Sol: 端末操作・幅・半額の「コスパと総合力」
1. 両モデルの立ち位置——「半額の万能」vs「最上位の職人」
Claude Fable 5——「長距離走の完走力」に全振り
Fable 5 は Anthropic 社内最強級の frontier モデル「Mythos」級の能力を、一般ユーザー・開発者が使える形で解放したモデルだ(中身は Mythos 5 と同一で、安全装置だけが異なる)。キャッチコピーは「長時間・複雑な仕事のために作られた」。実 GitHub リポジトリ修正を測る SWE-Bench Pro で80.0% を記録し、Opus 4.8(69.2%)や前世代GPT-5.5(58.6%)を大きく引き離す(Anthropic のシステムカードの値。発表の表で Mythos 5 と共通の欄に載る80.3%は、高いほうの Mythos 5 の値)。数百万トークンにわたって集中を保ち、これまでのどの Claude よりも長く自律して働けるとされ、Stripeが5000万行のRubyコード移行を1日で完了させた事例もある(出典: Anthropic公式発表)。
GPT-5.6 Sol——「半額の万能型」
Sol は GPT-5.6(Luna/Terra/Sol)の最上位。端末を自律操作する TerminalBench 2.1 で88.8%、長時間実務の Agents' Last Exam で53.6 とエージェント総合力で首位を取り、コーディングでのトークン効率が54%向上。何より、Fable 5 の約半額($5/$30 対 $10/$50)という価格が最大の武器だ。「最強ではないが、費用対効果で戦う」ポジションにある(出典: OpenAI公式発表・Vellum・Artificial Analysis)。
2. スペック早見表
| 項目 | Claude Fable 5 | GPT-5.6 Sol |
|---|---|---|
| 提供元 | Anthropic(発表時の最上位・一般提供モデル) | OpenAI(GPT-5.6の最上位) |
| リリース日 | 2026年6月9日 | 2026年7月9日(一般提供) |
| モデルID | claude-fable-5 | gpt-5.6-sol |
| コンテキスト長 | 1,000,000 tokens | 1,050,000 tokens |
| 最大出力トークン | 128,000 tokens | 128,000 tokens |
| 知識カットオフ | 2026年前半(段階的公表) | 2026年2月16日 |
| API価格 | $10 / $50 per MTok | $5 / $30 per MTok(Fableの約半額。2026年8月21日から3か月の販促価格では $4 / $20) |
| 推論 | 常時オン(適応的思考、生の思考過程は非返却) | reasoning effort(none〜max の6段階) |
| 強みの核 | SWE-Bench Pro 80.0%(Anthropic公表)、歴代Claudeで最長の自律、長距離走の完走力 | 端末操作・エージェント総合力・トークン効率・半額 |
| 安全設計 | 3分類器でリスク検知時のみOpus 4.8へフォールバック(作動はセッションの5%未満) | 「最強のセキュリティモデル」を標榜・safetyスタック強化 |
| 提供チャネル | Claude.ai、API、GitHub Copilot ほか | ChatGPT、ChatGPT Work、Codex、OpenAI API |
※価格・スペックは各社公式発表(Fable 5=2026年6月9日、GPT-5.6=2026年7月9日)に基づく。ベンチマークは測定条件・時期・harnessが両社で異なり、同一土俵の厳密比較ではない。両モデルを並べた値(SWE-Bench Pro 80.0% 対 64.6%、TerminalBench 2.1 83.1% 対 88.8%、Agents' Last Exam 40.5 対 53.6、Coding Agent Index 77.2 対 80)は、両方が載っている OpenAI の GPT-5.6 発表の評価表による(Sol の Agents' Last Exam 53.6 は発表本文の値で、同じページの表では52.7%。Coding Agent Index は Artificial Analysis の指標)。Anthropic 自身の発表の表では Fable 5 は SWE-Bench Pro 80.3%・TerminalBench 2.1 88.0% だが、どちらも Mythos 5 と共通の欄に載せた両者の高いほうの値で(システムカードでは Fable 5 単独で80.0%・84.3%)、TerminalBench 2.1 には「安全装置のフォールバックのため、Fable 5 は Opus 4.8(同じ表で82.7%)に近い値になる」という注記が付いている。86.0% という値はどちらの表にも無い。
3. ベンチマーク詳細比較
「Fable 5が全勝」でも「Solが全勝」でもない。コーディングの種類で綺麗に分かれる。
実コード解決は Fable、端末・幅は Sol
出典: OpenAI の GPT-5.6 発表の評価表(Sol の Agents' Last Exam は発表本文の値、Coding Agent Index は Artificial Analysis)
ポイントは 「ベンチマークが測っているもの」 の違いだ。SWE-bench Pro は実 GitHub 課題のパッチ生成=既存コードベースの修正力を測り、ここでは Fable 5 が80.0%でSolの64.6%を15ポイント以上引き離す。一方の TerminalBench 2.1 はコマンドラインの自律操作で、Sol が88.8%でFable 5の83.1%を上回る。さらにエージェント総合の Agents' Last Exam・Coding Agent Index では Sol が優位。「実コードを直し切る深さ=Fable、端末操作とエージェントの幅=Sol」という綺麗な棲み分けになっている。
4. 「非公開ベンチ問題」——伏せられた指標と、SWE-bench Proへの疑義
この比較でも注意が要るのは、OpenAI の評価表に載っていない指標がある点だ。独立分析(Vellum)は発表直後、OpenAI が SWE-bench Verified・GPQA Diamond・AIME・MMLU・ARC-AGI-2・FrontierMath を公表していないと指摘した。ただし2026年9月22日に確認した OpenAI の発表ページの評価表には、GPQA Diamond(Sol 94.6%、Fable 5 92.6%)と FrontierMath(Tier 1〜3 で Sol 89%・Fable 5 87%、Tier 4 で Sol 83%・Fable 5 87.8%)が載っている。載っていないのは SWE-bench Verified・AIME・MMLU で、ARC-AGI-2 の Sol の値(92.5%)は9月3日の GPT-6 Astra の発表の表に初めて出てきた。本記事の SWE-bench Pro「64.6%」も、OpenAI が GPT-5.6 の発表時に公開した評価表の値だ。ただし OpenAI は同時に、SWE-bench Pro の課題の約30%に不備があるとする分析も公開している(Simon Willisonが指摘)。
最も実務に近いコーディング指標に、OpenAIが疑義
※ 実プロダクション級コーディングを重視するなら、SWE-bench Pro が両社の表とも80%前後の Fable 5 が有力。派手なエージェント数字だけで判断しない。
5. 長時間自律——Fable 5の本領
Fable 5 の真価はベンチのスコアより「長距離走の完走力」にある。Anthropicは、数百万トークンにわたって集中を保ち、これまでのどの Claude よりも長く自律して働けると説明している(時間の上限は示していない)。実例として挙げているのは Stripeが5000万行のRubyコード移行を1日で完了(手作業なら2か月超相当)した事例だ。発表直後には、利用者が1つの指示で12時間以上自走させた例も Ten Past Tomorrow のブログで報告されている。長時間分析ベンチ Hex では史上初の90%超も報告された。
数百万トークンにわたって集中を保ち、長丁場のコーディング・調査を自走(Anthropicの説明)。
手作業なら2か月超のRuby移行を1日で完了させた実例。
OpenAI の表で Opus 4.8(69.2%)や Sol(64.6%)を大きく引き離す(Anthropic のシステムカードでも80.0%)。
Solも長時間実務のAgents' Last Examで首位(53.6)だが、こちらは「幅広い業務ワークフロー」を測るベンチ。単一の巨大コードベースを最後まで直し切る「深い完走力」ではFable 5に分がある——というのが両者の質的な違いだ。大規模移行・長時間調査・自律コーディングエージェントの主力にはFable 5が向く。
6. 実コスト——2倍の単価をどう見るか
単価は Fable 5 が $10/$50、Sol が $5/$30。入力で2倍、出力で1.67倍、Fable 5 はSolのおよそ2倍高い(Sol が2026年8月21日から3か月の販促価格 $4/$20 の間は約2.5倍)。ここが選択の分かれ目になる。
- Solのコスト優位:単価が半額なうえ、コーディングでトークン効率が54%向上。同じ作業なら消費トークンも減るため、「量をこなす」用途では総コストがFable 5を大きく下回る。
- Fable 5の価値:単価は高いが、1回で正しく直し切る成功率(SWE-bench Pro は両社の表とも約80%)が高い。やり直し・レビュー・人手の手戻りコストまで含めると、難タスクでは「高いが結局安い」ことがある。5000万行を1日で移行できるなら、人件費換算では破格だ。
つまり「トークン単価」ではなく「タスク完了あたりのコスト」で見るべきだ。日常の量産タスク・端末操作はSol(さらにコスト重視ならGPT-5.6 TerraやLuna)、失敗が高くつく大規模・長時間タスクはFable 5——という住み分けが、コスト最適の観点でも理にかなう。
※ 両社は同一条件の出力トークン比較を公表していないため、具体的な「実コスト倍率」は断定できない。自分の代表タスクで成功率と出力トークンを実測し、手戻りコストまで含めて比較することを推奨する。
7. 強み・弱みマップ
最上位の完走力 vs 半額の総合力
- ・SWE-Bench Pro 約80%(両社の表)で実コーディング最強級
- ・歴代Claudeで最長の自律・完走力
- ・大規模移行の実績(Stripe 5000万行/1日)
- ・FrontierMath Tier 4 は OpenAI の表でも Sol より上(87.8%対83%)
- ・3分類器の新安全設計(危険領域のみ抑制)
- ・単価が高い($10/$50=Solの約2倍。Solの販促価格の期間中は約2.5倍)
- ・端末操作・エージェント総合の幅はSolに劣る
- ・軽い量産タスクにはオーバースペック
- ・生の思考過程は返却されない
- ・TerminalBench 88.8%・端末操作で首位
- ・Agents' Last Exam・Coding Agent Index 首位
- ・単価が半額+トークン効率+54%でコスパ最強
- ・Luna/Terra/Solの3モデルで用途最適化
- ・ChatGPT Work / Codex / GPT-Live 連携
- ・SWE-bench Proで15pt以上の大差負け
- ・AIME・MMLU などは評価表に無い
- ・単一巨大コードの「深い完走力」でFableに劣る
- ・長時間自律の実績提示はFableが上
8. ユースケース別の選び方
| ユースケース | 推奨モデル | 理由 |
|---|---|---|
| 大規模コード移行・レガシー刷新 | Fable 5 | 長時間自律+Stripe 5000万行/1日の完走力 |
| 実リポジトリの難バグ修正・大PR | Fable 5 | SWE-Bench Pro 約80%(両社の表)で成功率が高い |
| 長時間の自律調査・分析エージェント | Fable 5 | 数百万トークン集中・完走力に最適化 |
| 失敗の手戻りコストが大きい重要タスク | Fable 5 | 1回で正しく直し切る確度が高い |
| CLI・端末を自律操作するエージェント | Sol | TerminalBench 2.1 88.8% で首位 |
| 幅広い業務ワークフロー自動化 | Sol | Agents' Last Exam 53.6 で首位 |
| コスト重視の量産タスク | Sol | 半額+トークン効率+54%。軽作業はTerra/Lunaも |
| ChatGPT/Codex/音声を含む統合運用 | Sol | ChatGPT Work・GPT-Live・Codexと一体 |
まとめ
- Claude Fable 5: 実コード修正(SWE-Bench Pro 約80%)と長時間自律で最強級。大規模移行・難タスクの「完走力」が本領。ただし単価はSolの約2倍。
- GPT-5.6 Sol: 端末操作(TerminalBench 88.8%)・エージェント総合力で首位、半額+トークン効率+54%でコスパ最強。3モデルで用途最適化しやすい。
- SWE-bench Proの差はOpus 4.8戦より拡大(OpenAI の表で 80.0 vs 64.6・15pt超)。ただしOpenAIは、SWE-bench Proの課題の約30%に不備があるとする分析も公開している点に注意。
- コストは「トークン単価」でなく「タスク完了あたり」で見る。量産・端末はSol、失敗が高くつく大規模・長時間はFable 5。
- 現実解はデュアル運用。日常はSol(またはTerra)、勝負どころの大タスクはFable 5、と使い分けるのが最適。
FAQ
Q1. GPT-5.6 Sol と Claude Fable 5、コーディングはどちらが強い?
指標による。実リポジトリのバグ修正を測るSWE-Bench ProではFable 5が80.0%でSolの64.6%を15pt以上上回る。一方、端末自律操作のTerminalBench 2.1ではSolが88.8%でFable 5の83.1%を上回る(いずれも OpenAI の評価表の値。Anthropic のシステムカードでも Fable 5 の SWE-Bench Pro は80.0%)。「実コードを直し切るならFable、端末操作・エージェントの幅ならSol」が実用的な棲み分け。
Q2. 価格差2倍を払う価値はある?
タスク次第。日常の量産・端末操作なら半額のSol(さらに軽作業はTerra/Luna)で十分。ただし大規模移行や難バグ修正など「失敗の手戻りが高くつくタスク」では、成功率の高いFable 5が結局安くつくことがある。トークン単価でなく「タスク完了あたりのコスト」で判断を。
Q3. SolのSWE-bench Pro「64.6%」は公式の値?
OpenAIがGPT-5.6の発表時に公開した評価表の値だ。ただしOpenAIは同時に、SWE-bench Proの課題の約30%に不備があるとする分析も公開しており、この指標自体に疑義を示している。発表直後にVellumが非公表と指摘したGPQA DiamondとFrontierMathも、2026年9月22日に確認した評価表には載っている(GPQAはSol 94.6%・Fable 5 92.6%)。表に無いのはSWE-bench Verified・AIME・MMLUだ。
Q4. 長時間の自律タスクにはどちらが向く?
Fable 5。数百万トークンにわたって集中を保ち、これまでのどの Claude よりも長く自律して働けるとされ(Anthropic の説明)、Stripeが5000万行のRuby移行を1日で完了させた実績がある。単一の巨大コードベースを最後まで直し切る「完走力」はFable 5の本領だ。
Q5. Fable 5とMythos 5は何が違う?
中身(能力)は同一で、安全装置だけが異なる。一般提供されるのがFable 5で、Fable 5はリスク検知時のみOpus 4.8へフォールバックする3分類器の安全設計を持つ(作動はセッションの5%未満で、95%超は自走)。
Q6. GPT-5.6の「Terra」はこの比較にどう絡む?
GPT-5.6はLuna/Terra/Solの3モデル。本記事は執筆当時のフラッグシップ同士としてSolを取り上げたが、コスト重視ならTerra($2/$12)がGPT-5.5相当をSolの4割の単価で提供する(2026年7月30日の値下げ後)。「Fable 5で難タスク、Terraで量産」という組み合わせも実務では有力。詳細はGPT-5.6リリース完全解説を参照。
Q7. Opus 4.8とFable 5、Solと比べるならどっち?
用途と予算で選ぶ。Opus 4.8($5/$25)はSolと同価格帯で、SWE-bench Pro 69.2%とコスパのよいコーディング。Fable 5($10/$50)は当時の最上位で80.0%と完走力が別格だが高価。日常はOpus 4.8/Sol、勝負どころはFable 5、という三段活用が現実的。Sol vs Opus 4.8の比較も参照。
関連記事
- GPT-5.6 Sol vs Claude Opus 4.8 徹底比較 — 同価格帯の直接対決
- Claude Fable 5 リリース徹底解説 — 発表時の最上位モデルの詳細
- GPT-5.6 リリース完全解説 — Luna/Terra/Solの3モデル
- Claude Opus 4.8 リリース完全解説 — コスパ帯の実務モデル
- AIでシステム開発の工数はどれだけ減るのか — エージェント時代の実証データで検証