目次
2026年7月24日、Anthropic が Claude Opus 5 を公開した。前世代の Opus 4.8 から約2か月、番号は「4.8 → 5」と世代が繰り上がった。Anthropic 自身は公式ドキュメントで、これを 「Opus 4.8 からの段階的改善ではなく step-change(段差のある変化)」 と表現している。
結論から言う。料金は据え置き(入力 $5 / 出力 $25 per MTok)のまま、エージェント系ベンチで最上位モデル Claude Fable 5 に並ぶか上回る——しかも Fable 5 は $10 / $50 なので、価格は半分だ。一方で API の挙動には2つの破壊的変更があり、コードをそのまま動かすと 400 エラーや出力の途中切れが起きうる。本記事は、公式発表・公式ドキュメントと複数の報道を突き合わせ、性能・料金・移行時の落とし穴を実務目線で整理する。
値段は据え置き、実力は一段上へ
— 「フロンティア級の性能を Fable 5 の半額で」が公式の位置づけ
1. 3行でわかる Opus 5
エージェント型のコーディング・PC操作・長時間タスクで大幅向上。Anthropic はエージェント端末ベンチ Frontier-Bench v0.1 で「Opus 4.8 の2倍超、しかも1タスクあたりのコストは低い」としている。
値上げなし。入力 $5 / 出力 $25(100万トークンあたり)で Opus 4.8 と完全に同額。最上位の Fable 5($10 / $50)に対してはちょうど半額。
思考(thinking)が既定でONになり、思考を切れるのは effort が high 以下のときだけに。max_tokens を絞っていた処理は出力が途中で切れる恐れがある。
ひとことでまとめれば、「Opus 4.8 の価格のまま、Fable 5 に迫る仕事をさせられるようになった」のが Opus 5 だ。逆に言えば、純粋な最高性能が欲しい場面では依然 Fable 5 / Mythos 5 の出番が残る(後述の負けている領域を参照)。
2. 基本スペックと提供形態
まず数字で押さえる。Anthropic 公式のモデル一覧に基づく主要スペックは次のとおり。
| 項目 | Claude Opus 5 | Claude Opus 4.8(前世代) | Claude Fable 5(最上位) |
|---|---|---|---|
| API モデルID | claude-opus-5 |
claude-opus-4-8 |
claude-fable-5 |
| 料金(入力/出力) | $5 / $25 | $5 / $25 | $10 / $50 |
| コンテキスト | 100万トークン(既定かつ最大) | 100万トークン | 100万トークン |
| 最大出力 | 12.8万トークン | 12.8万トークン | 12.8万トークン |
| 知識の信頼カットオフ | 2026年5月 | 2026年1月 | 2026年1月 |
| 思考(thinking) | 既定でON | 既定OFF(明示指定で有効) | 常時ON(無効化不可) |
| effort 段階 | low / medium / high / xhigh / max | low / medium / high / xhigh / max | low / medium / high / xhigh / max |
出典:Anthropic「Models overview」および「What's new in Claude Opus 5」(2026年7月時点)
見落とされがちだが実務で効くのが知識カットオフの前進だ。Opus 4.8 / Fable 5 が2026年1月なのに対し、Opus 5 は2026年5月。ライブラリのバージョンや最近の仕様変更について、素の知識で答えられる範囲が数か月ぶん広い。もっとも、それでも「今日」は知らない——時事や最新の価格改定はWeb検索なしに断定させないこと。
提供プラットフォーム
Claude API(claude-opus-5)、Amazon Bedrock(anthropic.claude-opus-5)、Google Cloud、Microsoft Foundry。Opus 4.8 も引き続き利用可能。
claude.ai、Claude Code・Claude Cowork。Max プランでは既定モデル、Pro プランでは選べる最上位という位置づけ。
高速版はリサーチプレビューでClaude API 限定。Bedrock・Google Cloud・Microsoft Foundry では現時点で使えない。
3. 料金——据え置きで「Fable 5の半額」
今回いちばん実務に効くのは「性能が上がったのに値段が変わっていない」という一点だ。Anthropic 公式ドキュメントは料金について「$5 per million input tokens and $25 per million output tokens, unchanged from Claude Opus 4.8」と明記している。
100万トークンあたりの単価(Claude API)
出典:Anthropic 公式「What's new in Claude Opus 5」「Pricing」(2026年7月)。キャッシュ単価は公式の倍率(書込1.25倍・2倍、読取0.1倍)に基づく
ここで重要なのは「トークン単価」と「1タスクあたりのコスト」は別物だという点だ。Anthropic は Opus 5 の説明で、単価ではなく1タスクあたりのコストで比較したグラフを前面に出している。たとえば PC 操作ベンチ OSWorld 2.0 について、公式発表は「Fable 5 の最高スコアを、その約3分の1のコストで上回る」と述べている。単価が半分でも、賢く動いて手数が減れば実コストの差はさらに開く。
ただし注意:思考が既定ONになったぶん、同じプロンプトでも出力トークンが増えて実費が上がるケースがある。Opus 4.8 で思考OFFのまま安く回していた処理を単純に載せ替えると、請求額が増えることは十分ありうる。移行後は必ず usage を実測すること。
4. ベンチマーク徹底比較
Anthropic の公式発表は、今回数値表ではなくグラフ中心で、公式ページの本文から読み取れるのは「◯倍」「◯%以内」といった相対表現が中心だ。そこで本記事では、公式が本文で明言している相対値と、複数メディアが一致して報じている数値を分けて示す。
4-1. 公式が本文で明言している比較
エージェント型のターミナル・コーディング。他モデルをすべて上回り、Opus 4.8 の2倍超を、より低いタスク単価で達成。
max effort 時に Fable 5 の最高スコアと 0.5% 以内、しかもコストは約半分。
未知の問題を解く力の指標で、次点モデルの3倍のスコア。
PC操作ベンチ。あらゆる価格帯で競合を上回り、Fable 5 の最高スコアを約3分の1のコストで超える。
同コスト条件で、次点モデルの約1.5倍の合格率。最低 effort 設定でも競合の最高記録を上回るという。
追跡している全評価で Opus 4.8 を上回り、有機化学は10ポイント超の改善(分光データからの構造読み取りなど)。
4-2. 報道ベースの実数値
以下は the decoder(2026年7月24日)と tech-ish(同日)が、Anthropic のグラフから読み取って報じた数値で、両者で一致した項目のみを掲載する。公式ページの本文に数字として書かれているわけではない点に注意してほしい(🟡=報道ベース)。
| ベンチマーク | Opus 5 | Fable 5 | GPT-5.6 Sol | Opus 4.8 |
|---|---|---|---|---|
| Frontier-Bench v0.1 エージェント型ターミナル作業 |
43.3% | 33.7% | 34.4% | 約21%🟡 |
| ARC-AGI-3 未知の問題解決 |
30.2% | — | 7.8% | 1.5% |
| GDPval-AA v2(Elo) 実務的な知識労働 |
1,861 | 1,747 | 1,736 | 1,593 |
| OSWorld 2.0 PC操作エージェント |
70.6% | 66.1% | — | — |
| DeepSWE v1.1 エージェント型コーディング |
68.8% | 69.7% | 72.7% | — |
読み取れる傾向ははっきりしている。「長く自律して動く仕事」ほど差が大きい——ターミナル作業、PC操作、業務自動化、未知の問題解決。逆に1回のパッチを当てる型のコーディング(DeepSWE)では GPT-5.6 Sol に負けている。GPT-5.6 Sol との比較記事で整理した構図が、そのまま一段上のレイヤーで再現された形だ。
5. 勝てていない領域も正直に
リリース記事は「勝った項目」だけ並べがちなので、ここは意識して逆側を書く。Anthropic 自身が公式発表で認めている弱点と、報道が指摘した数値を並べる。
脆弱性の発見では Mythos 5 との差を詰めたが、エクスプロイト作成では大きく劣ると公式が明言。防御用途の専用モデルは Mythos 系のまま。
ライフサイエンス全般は改善したが、長時間の自律的な生物研究タスクでは Mythos 5 に及ばないと公式が記載。
DeepSWE v1.1 で 68.8% と GPT-5.6 Sol(72.7%)に劣後。Humanity's Last Exam も 56.3% 対 Fable 5 の 56.5% とほぼ横並び(報道ベース)。
the decoder は、Frontier-Bench と Coding Agent Index でmax effort のスコアがそれより低い設定を下回ったと指摘。コストを積んでも伸びない領域がある。
実務的な含意:「とりあえず max effort」はお金だけ増えて成績が落ちる可能性がある。公式ドキュメントも high または xhigh を出発点に、自分の評価セットで medium まで振ってみることを勧めている。effort は固定値ではなくチューニング対象と考えるべきだ。
6. 仕様変更2つ(思考ON・effort制限)
API を直接叩いている場合、ここだけは読み飛ばさないでほしい。Anthropic 公式ドキュメントが「behavior changes」として挙げている2点は、コード無変更だと事故になりうる。
変更① 思考(thinking)が既定でON
Opus 4.8 では thinking を指定しなければ思考なしで動いた。Opus 5 では指定しなければ思考ONで動く(thinking: {"type": "adaptive"} を書いたのと同じ挙動)。
# Opus 4.8 では「思考なし」で動いていた同じコードが…… client.messages.create( model="claude-opus-5", max_tokens=1024, # ← 思考ぶんも含めた上限になる messages=[...], ) # Opus 5 では「思考あり」で動く → 回答が途中で切れる恐れ
max_tokens は思考トークンと回答テキストの合計に対する上限だ。回答の長さぴったりに max_tokens を絞っていた処理は、思考に食われて回答が途中で切れる。移行時は「思考を明示的にOFFにする」か「max_tokens に余裕を持たせる」かの判断が必要になる。
変更② 思考をOFFにできるのは effort が high 以下のときだけ
そして、その「OFFにする」にも制限がついた。thinking: {"type": "disabled"} と effort xhigh / max の組み合わせは 400 エラーになる。しかもこの判定はリクエストごとなので、途中で effort を上げる実装は「最初は通っていたのに突然落ちる」形で表面化する。
思考OFF + effort low/medium/high
思考OFF + effort xhigh/max
思考はONのまま、effort を下げてコストを制御する
さらに公式は、思考OFFで運用したときの副作用まで明記している。曰く、Opus 5 は思考を切るとツール呼び出しを本文テキストとして書いてしまうことがあり(=ツールが実行されないまま処理が「成功」する)、内部XMLタグが表に出ることもある。エージェントを組んでいるなら、思考はONのままにして effort を下げるのが安全だ。
7. effort 5段階の選び方
Opus 5 は low / medium / high / xhigh / max の5段階すべてに対応し、API と Claude Code での既定は high。Claude Code 側の設定の話はeffort 設定の解説記事にまとめてある。
| effort | 向く用途 | メモ |
|---|---|---|
| low / medium | 定型処理、分類、下請けサブエージェント、レイテンシ重視 | 公式が「Opus 5 は低 effort でも品質が高い」と強調する箇所。まずここを試す価値がある |
| high(既定) | 知性が要る一般的な作業 | 迷ったらここ。品質とコストのバランス点 |
| xhigh | コーディング・エージェント用途の推奨開始点 | max_tokens を大きめに(6.4万トークン程度から) |
| max | 正しさがコストより重要な難問 | 最深の推論だが、常に最良とは限らない(第5章参照) |
8. その他の新機能
従来はツール一覧を会話中に変えるとプロンプトキャッシュが丸ごと無効化された。Opus 5 ではキャッシュを保ったままツールを追加・削除できる(ベータヘッダ mid-conversation-tool-changes-2026-07-01)。長時間エージェントのコストに効く。
キャッシュできる最小プロンプト長が 1,024 → 512 トークンに。Opus 4.8 では短すぎてキャッシュされなかったプロンプトが、コード変更なしでキャッシュ対象になる。
安全性フィルタで拒否されたとき、代替モデルを自分で列挙する代わりにAnthropic 推奨の振り分けを自動適用できる(ベータヘッダ server-side-fallback-2026-07-01)。
出力速度およそ2.5倍・単価2倍のリサーチプレビュー。Claude API 限定で、Bedrock・Google Cloud・Microsoft Foundry では利用不可。
9. 「性格」の変化とプロンプト調整
ベンチマークより実務で先に気づくのは、たぶんこちらだ。公式ドキュメントは「コードを一切変えなくても違いに気づく」振る舞いの変化を4つ挙げている。
| 変化 | 対処 |
|---|---|
| 回答も成果物も長くなる ユーザー向けの返答、書き出すMarkdownファイルなど |
簡潔さの指示を明示的に入れる。effort を下げても文章量は縮まないので、プロンプトで指定する |
| 作業中の実況が増える | 「◯回ごとに進捗を要約せよ」といった旧世代向けの足場は削除。うるさければ逆に「ツール呼び出しの合間は原則沈黙」と指示 |
| サブエージェントに任せたがる Opus 4.8 は逆に消極的だった |
4.8 向けに書いた「もっと委譲せよ」は撤去。並列数の上限を明示してコスト暴走を防ぐ |
| 言われなくても自己検証する | 「最後に検証ステップを入れよ」「サブエージェントで検証させよ」は過剰検証の原因になるので削除(公式が明記) |
移行のコツは「足し算」ではなく「引き算」。旧モデルの弱点を補うために書き足したプロンプト(検証を促す、委譲を促す、進捗報告を強制する)が、Opus 5 ではそのまま副作用になる。まず消して、素の挙動を見てから足すこと。
10. 誰が今すぐ移行すべきか
- 長時間動くコーディングエージェントを運用している
- PC操作・業務自動化のエージェントを作っている
- Fable 5 を使っていてコストが重い(半額で近い性能)
- Opus 4.8 をそのまま使っている(同額で明確に上)
- 思考OFF・低
max_tokensで安く回している定型処理 - 出力の長さや文体に依存した後段処理がある
- プロンプトに検証・委譲の指示を大量に書き込んでいる
- 1回のパッチ生成が中心の用途(差が小さい/劣後する場合も)
- Bedrock などで fast mode を前提にしている
- セキュリティ攻撃検証・長時間の生物研究(Mythos 系が上)
移行手順(API利用者向け)
- モデルIDを
claude-opus-4-8→claude-opus-5に変更する - 思考OFF(
thinking: disabled)を使っている箇所を洗い出し、effort が xhigh/max なら 400 エラーになるので効率を下げるか思考をONに戻す thinkingを指定していない箇所のmax_tokensを見直す(思考ぶんの余裕を足す)- プロンプトから検証を促す指示・委譲を促す指示・進捗報告の強制を削除する
- 簡潔さの指示を追加し、
usageの実測でコストを再ベースライン化する - effort を
medium/high/xhighで振って、自分の評価セットで最適点を決める
まとめ
Claude Opus 5 は、「値段そのままで一段上」という、利用者にとっては素直に嬉しいタイプのリリースだ。とくに長時間自律で働かせるエージェント用途で差が大きく、Anthropic 自身も1タスクあたりのコストを前面に出して「フロンティア級の性能を Fable 5 の半額で」と位置づけている。
一方で、API の挙動には無視できない変更が2つある(思考が既定ON、思考OFFは effort high 以下のみ)。そしてプロンプトは足すのではなく削るのが移行の要点だ。旧世代の弱点を補うために書いた指示が、そのまま冗長化・過剰検証の原因になる。
最後に、ベンチマークの数字はあくまで「その課題で測った値」である点も忘れないでほしい。DeepSWE では GPT-5.6 Sol に負け、max effort が最良でない領域もある。自分のタスクで測り直すこと——それが結局いちばん確実だ。
FAQ
Q. Opus 5 は Opus 4.8 より高いですか?
A. トークン単価は同額(入力 $5 / 出力 $25 per MTok)です。ただし思考が既定でONになったぶん出力トークンが増えることがあり、請求額としては上がる可能性があります。移行後に usage を実測してください。
Q. Fable 5 と Opus 5、どちらを使うべき?
A. コスト効率なら Opus 5(単価は半分で、エージェント系ベンチでは上回る項目も多い)。純粋に最高難度の推論・長時間の研究タスクでは引き続き Fable 5 が上位です。使い分けの考え方はFable 5 と Opus の使い分け記事の枠組みがそのまま使えます。
Q. 無料プランでも使えますか?
A. Opus 5 は Max プランの既定モデル、Pro プランで選べる最上位という位置づけです。プラン構成は変わることがあるため、最新の提供範囲は Anthropic の料金ページで確認してください。
Q. 移行して 400 エラーが出ました。
A. まず thinking: {"type": "disabled"} と effort xhigh/max を同時に指定していないか確認してください。この組み合わせは Opus 5 で拒否されます。effort を high 以下に下げるか、thinking の指定を外す(=既定のONに戻す)ことで解消します。
Q. 回答が長すぎるのですが、effort を下げれば短くなりますか?
A. なりません。effort は主に思考の深さを制御するもので、ユーザー向け出力の長さは確実には縮みません。プロンプトで簡潔さを明示的に指示するのが正しい対処です。
※ 本記事の数値は、Anthropic 公式発表「Introducing Claude Opus 5」、公式ドキュメント「What's new in Claude Opus 5」・「Models overview」、および the decoder・tech-ish の報道(いずれも2026年7月24日)に基づく。🟡 を付した数値は公式本文に明記がなく報道側がグラフから読み取ったもので、確度が一段落ちる。仕様・価格は変更されることがあるため、最終的な確認は公式ドキュメントで行ってほしい。