2026年9月26日更新:題と冒頭の図にあった「未最適化コストの20〜30%まで圧縮」「キャッシュで−60〜90%」「月額 $30K → $6〜9K」「8割の作業は安いモデルで十分」などの数字は、出典を示せないため外しました。代わりに、Anthropic と OpenAI の公式料金ページの単価・倍率から計算できる例を式つきで載せています。あわせて、キャッシュの採算ライン(5分は1回、1時間は2回の読み取りで得)と、出力の単価(入力の5倍)の誤りを直し、バッチ処理の章を足しました。どこをどう直したかは記事の末尾にまとめています。

定額の ChatGPT Plus(月 $20)から、トークン単位で課金される Claude Code の API 利用や自作の AI アプリに移ると、使い方しだいで請求の桁が変わる。従量課金には上限がないからだ。

ただし、効き目の大きい手段は3つに絞れる。プロンプトキャッシュ・モデル選択・出力予算の3つのレバーだ。どれも公式の料金表に載っている倍率で効き目が決まるので、自分の使い方に当てはめて計算できる。本記事では Anthropic と OpenAI の公式資料から、その倍率と計算のしかたを整理する。

3つのレバー

効き目は公式の単価から計算できる

— 2026年9月26日時点の Anthropic・OpenAI の公式料金表から

レバー① キャッシュ
0.1倍
キャッシュから読んだ入力は基本単価の0.1倍(Claude Opus 5.5 は0.05倍)。書き込みは5分なら1.25倍、1時間なら2倍(Anthropic 公式)。
レバー② モデル選択
4分の1
Opus 5.5 から Haiku 4.5 へ替えると、入力 $4→$1、出力 $20→$5(100万トークンあたり、Anthropic 公式)。Sonnet 5 なら半分。
レバー③ 出力予算
5倍
出力の単価は入力の5倍(現行の Claude 各モデルと GPT-6 の3モデル)。削った出力1トークンは、入力5トークン分に当たる。

計算例:Opus 5.5 に同じ10万トークンの前置きを5分以内の間隔で10回送ると、入力の費用は キャッシュなし $4.00 → 5分キャッシュ $0.68(書き込み1回 $0.50+読み取り9回 $0.18)。
急がない処理はバッチ API で入力・出力とも半額になり、キャッシュの倍率とも重なる。
出典: Claude Platform Docs「Pricing」・OpenAI API Pricing(2026年9月26日に確認。計算は本記事)

1. なぜ AI 料金は気づくと膨らんでいるのか

AI ツールには、個人プラン(定額)と API 課金(従量)の2系統がある。膨張するのは主に後者だ。

  • 個人プラン: ChatGPT Plus $20/月、Claude Pro $20/月(年払いなら月 $17)、Max $100〜/月。固定費なので使い倒しても上限がある(ただし使用量の上限あり)
  • API 課金: トークン単位の従量。API キーで使う Claude Code や、自社開発の AI アプリはこちら。使い方しだいで月額が大きく変わる

従量課金が膨らむのは、(1) 出力トークンの単価が入力の5倍、(2) コンテキストが長くなるほど毎回それを丸ごと送り直す、(3) サブエージェントが背後で何度も呼ばれる、(4) ループに入ると止まらない——これらが組み合わさるからだ。仕組みを知れば、どれにも手が打てる。

2. コストの内訳——入力・出力・キャッシュ・バッチ

Claude Opus(2026年9月時点では Opus 5.5。最上位の Fable より下で、Anthropic が入口として勧める層)の API 価格を例に、何にいくらかかるのか分解する。

項目単価(100万トークンあたり)説明
入力トークン$4あなたが送る文字。プロンプト+会話履歴+ファイル等
出力トークン$20AI が返す文字。入力の5倍
キャッシュ書き込み(5分)$5(入力の1.25倍)前置きをキャッシュに保存する分。5分以内に読まれるたびに追加料金なしで延長される
キャッシュ書き込み(1時間)$8(入力の2倍)間隔が5分を超えても残る。そのぶん書き込みが高い
キャッシュ読み取り$0.20(入力の0.05倍)多くのモデルは0.1倍、Opus 5.5 は0.05倍。これが節約の主役
バッチ処理入力 $2・出力 $10(半額)急がないリクエストをまとめて非同期で処理。キャッシュの倍率とも重なる
ツール呼び出し入力に含まれるtool 定義もコンテキストの一部。ツールを渡すと、専用のシステムプロンプト(Opus 5.5 で286トークン)も足される

つまり 「キャッシュに乗った前置きは、入力の10分の1以下の値段」で読める。書き込みの倍率(5分1.25倍・1時間2倍)と、出力が入力の5倍という関係は現行の Claude の全モデルで同じで、読み取りの倍率だけがモデルで違う(Fable 5.1 は0.025倍)。なお Claude Opus 4.7 以降は新しいトークナイザーを使い、同じ文章でも約30%多いトークンになると公式は書いている。世代をまたいで単価を比べるときは、この差も効く。出典: Claude Platform Docs「Pricing」(2026年9月26日に確認)。

3. プラン選びの節約効果

「使い方の予測」がついた時点で、まず適切なプランに切り替える。

使い方推奨プラン月額目安注意
趣味・学習・週数回Claude Free / ChatGPT Free$0使用量の上限あり、業務利用×
個人で毎日数時間Claude Pro / ChatGPT Plus$20個人プラン、業務情報×
ヘビー個人ユースClaude Max$100〜使用量が Pro の5倍か20倍、Claude Code を長時間使う人向け
チーム業務Claude Team / ChatGPT BusinessClaude Team の標準席は $20(年払い)〜$25/人業務情報OK、データ学習されない
大規模組織Enterprise営業見積SSO・監査ログ・SLA
AI 組み込み開発API 直接(Anthropic / OpenAI)従量キャッシュ・バッチを使え

出典: Claude の料金ページ・OpenAI ヘルプ「What is ChatGPT Plus?」(2026年9月26日に確認)。

Claude Code を毎日長時間使い、Pro の上限にたびたび当たるなら Max プランを検討する。定額なので、API キーで使うときのように請求が青天井にはならない。Cursor は個人向けの Pro が月 $20 からで、上位に Pro+・Ultra がある。

4. プロンプトキャッシュ——いちばん効くレバー

API を直接使う場合、同じ前置きを繰り返し送るならプロンプトキャッシュを使わない理由はほぼない。キャッシュから読んだ分は、基本の入力単価のごく一部で課金される。

仕組み

同じ system prompt や同じドキュメントを複数のリクエストで使い回すとき、最初の1回はキャッシュに書き込む(5分なら入力の1.25倍)。2回目以降は キャッシュ読み取り = 入力の0.1倍(Opus 5.5 は0.05倍、Fable 5.1 は0.025倍)で済む。ただし前置きが短すぎるとキャッシュされない。最小は Opus 5.5 で512トークン、Sonnet 5 で1,024トークン、Haiku 4.5 で4,096トークンだ(Claude Platform Docs「Prompt caching」)。

採算ライン——5分は1回、1時間は2回の読み取りで得

入力単価を1として、同じ前置きを送る費用を比べる(Anthropic の公式倍率から計算)。

  • 5分キャッシュ: 書き込み1.25+読み取り1回0.1=1.35。キャッシュなしで2回送ると2なので、1回読めば元が取れる
  • 1時間キャッシュ: 書き込み2+読み取り2回0.2=2.2。キャッシュなしで3回送ると3なので、2回読めば元が取れる(1回だけだと2.1で、なしの2をわずかに上回る)

公式の料金ページも「5分は1回、1時間は2回の読み取りで元が取れる」と書いている。Opus 5.5 は読み取りが0.05倍なので、同じ回数でも差はさらに開く。

計算例——10万トークンの前置きを10回送る

モデルキャッシュなし5分キャッシュ差
Claude Opus 5.5(入力 $4・書き込み $5・読み取り $0.20)0.1 × $4 × 10回 = $4.000.1 × $5 + 0.1 × $0.20 × 9回 = $0.68約83%減
Claude Sonnet 5(入力 $2・書き込み $2.50・読み取り $0.20)0.1 × $2 × 10回 = $2.000.1 × $2.50 + 0.1 × $0.20 × 9回 = $0.43約79%減

前置き(system prompt・資料など)の入力部分だけの計算で、10万トークン=0.1(100万トークン単位)。10回とも5分以内の間隔で送り、1回目で書き込み、残り9回はキャッシュから読む前提。単価は Claude Platform Docs「Pricing」(2026年9月26日に確認)。出力と、毎回変わる質問の部分は含まない。

OpenAI の GPT-6 系も仕組みは近い。キャッシュ済みの入力は0.1倍、書き込みは1.25倍で、公式ガイドは「1回書いて1回読むと1.35倍、書かずに2回処理すると2倍」と同じ計算を示している。有効期限は最後に使ってから30分で、対応モデルでは既定で有効だ(OpenAI「Prompt caching」)。

有効期限の既定は5分

Anthropic の API のプロンプトキャッシュの有効期限(TTL)は、既定で 5分だ。読まれるたびに追加料金なしで延長されるが、5分以上間が空くと失効し、次のリクエストで書き込み直し(入力の1.25倍)になる。1時間の有効期限も選べるが、書き込みは入力の2倍になる(出典: Claude Platform Docs「Prompt caching」)。

Claude Code も同じ仕組みの上で動く。Claude のサブスクリプションの範囲内で使うときは本体の会話に1時間を使うが、API キーで使う場合や、プランの上限を超えて使用量クレジットに移った場合は5分になる。v2.1.242 以降は設定の promptCacheTtl で 5m か 1h を自分で選べる(出典: Claude Code Docs「Prompt caching」、2026年9月26日に確認)。休憩をはさみながら使うなら、どちらで動いているかで書き込み直しの回数が変わる。

5分と1時間の選び方

公式ドキュメントの目安はこうだ。

  • 5分より短い間隔で繰り返し使う前置き: 5分キャッシュのままでよい。読まれるたびに無料で延長されるので、高い1時間の書き込みは要らない
  • 5分〜1時間の間隔が空く前置き(ユーザーの返事待ち、5分を超える処理の後に続く呼び出しなど): 1時間キャッシュが向く
  • 両方を混ぜるとき: 1時間のキャッシュを5分のキャッシュより前に置く(変わらない system prompt と tool 定義を先頭に置くのと同じ順番)

効いているかは、応答の usage にある cache_read_input_tokens(読み取り)と cache_creation_input_tokens(書き込み)で確かめる。読み取りがいつまでも0なら、前置きが毎回どこかで変わっているか、最小トークン数に届いていない。

5. コンテキスト管理——/compact と分割の使い分け

Claude Code / Cursor を使っていると、長い会話の途中で 毎ターン大量の過去の会話を送り直している状態になる。膨れるのは出力ではなく 入力(=過去の会話)だ。

対策1: /compact を能動的に使う

Claude Code には /compact コマンドがある。ここまでの会話を 要約してコンテキストを空ける(Claude Code Docs「Commands」)。要約に残してほしいことを指示として渡すこともできる。作業の区切りで使うのがよい。

対策2: タスクごとにセッションを分ける

「機能A実装」「バグ修正B」「ドキュメント生成C」を 1つの長い会話でやらず、新規セッションに分ける。各タスクの完了で session を閉じる。長期記憶が必要なら memory file に書き出す。

対策3: 不要な情報を Hooks で削る

Claude Agent SDK / Claude Code には Hooks があり、ツール出力をAIに渡す前に加工できる。例: npm install の長いログを、Hookで「成功/失敗」だけに圧縮する。長いログほど、毎ターンの入力が軽くなる。

6. モデル選択——タスク別ルーティング

「常に Opus」は富豪戦略。分類や抽出のような定型の作業は Sonnet や Haiku で足りることが多い。単価はモデルの層(上位・中位・軽量)で決まり、2026年9月26日時点の公式価格(100万トークンあたり)は次のとおり。版が替わっても「上位ほど高く、軽量は上位の数分の1」という関係は変わってこなかった。

モデル入力出力得意分野
Claude Opus 5.5(上位)$4$20複雑な設計・推論・長時間自律タスク
Claude Sonnet 5(中位)$2$10日常コーディング・分析・要約
Claude Haiku 4.5(軽量)$1$5分類・抽出・短い変換・リアルタイム応答
GPT-6 Sol(OpenAI のバランス型)$2$10複雑なコーディング・エージェント的な作業
GPT-6 Luna(OpenAI の低コスト型)$0.10$0.50的を絞った大量の軽作業

出典: Claude Platform Docs「Pricing」・OpenAI API Pricing(2026年9月26日に確認。OpenAI は短いコンテキストの料金)。Anthropic にはさらに上の Fable 5.1($10/$50)、OpenAI には旗艦の GPT-6 Astra($10/$50)がある。各社の現行モデルは現行モデルとカットオフの一覧で確かめられる。

上位の Opus から軽量の Haiku に替えると、単価は4分の1になる(2026年9月時点)。たとえば 1日に入力200万・出力20万トークンを使う分類の仕事なら、公式の単価から次のように計算できる。

  • Opus 5.5: 2 × $4 + 0.2 × $20 = $12
  • Sonnet 5: 2 × $2 + 0.2 × $10 = $6
  • Haiku 4.5: 2 × $1 + 0.2 × $5 = $3
  • Haiku 4.5 をバッチで: $3 × 0.5 = $1.50(8章)

品質が足りるかどうかは作業しだいなので、安いモデルに替える前に同じ入力で結果を比べる(FAQ の Q4)。判断の目安:

  • Opus を使う: 複雑なリファクタ、複数ファイル横断の設計、深い推論、未知ドメインの調査
  • Sonnet を使う: 日常のコード書き、分析、要約、レビュー、テスト追加
  • Haiku を使う: 分類、抽出、フォーマット変換、リアルタイム提案、コミットメッセージ生成

7. アウトプット予算の管理

出力トークンの単価は 入力の5倍だ(Claude の現行モデルも、GPT-6 の Astra・Sol・Luna も同じ)。たとえば Opus 5.5 で入力2,000・出力1,000トークンの応答は、入力 $0.008+出力 $0.020=$0.028。出力を500トークンに絞ると $0.018になり、約36%減る(公式の単価から計算)。

3つの方法

  • max_tokens を用途に合わせて絞る: Anthropic の Messages API では max_tokens は必須のパラメータで、ここに置いた数が出力の上限になる(API リファレンス「Messages」)。大きな値を置いたままにせず、max_tokens: 1000 など用途に見合う値にする
  • 「短く答えて」「箇条書き5つで」をプロンプトに: AI は指示に従う。冗長な前置き・サマリ・〆の挨拶を抑制
  • structured output(JSON モード): 自然文より JSON のほうが短い。アプリ内で消費するならこれ

「長文の素晴らしい回答」が要らない場面(分類、抽出、判断)では、ばっさり切ったほうが結果的にコスト効率が高い。

8. バッチ処理——急がない仕事は半額

すぐに答えが要らない仕事(夜間の一括分類、大量の要約、評価の実行など)は、バッチ API に回すと入力も出力も半額になる。Anthropic の Message Batches API は1回に最大10万リクエストまで受け付け、多くは1時間以内に終わるが、最大24時間かかることがある(Claude Platform Docs「Batch processing」)。OpenAI の Batch API も50%引きで、完了の期限は24時間だ(OpenAI「Batch API」)。

公式の料金ページによれば、キャッシュの倍率はバッチの割引と重なる。たとえば Haiku 4.5 のキャッシュ読み取りをバッチで行うと、$1 × 0.1 × 0.5 = 100万トークンあたり $0.05 だ。

9. マルチエージェントの罠——15倍トークン

2026年の流行、マルチエージェント構成(オーケストレータ + 並列サブエージェント)は強力だが、Anthropic は自社の Research 機能のデータとして、エージェントは通常のチャットの約4倍、マルチエージェント構成はチャットの約15倍のトークンを使うと公開している(Anthropic「How we built our multi-agent research system」、2025年6月)。15倍の比較相手はシングルエージェントではなくチャットだ。

節約の判断基準

  • 明確で順次的なタスク(1ファイル修正、要約、コードレビュー)→ シングルで十分
  • 並列性で実時間が大きく短縮できる → マルチが正当化される
  • 「とりあえずマルチ」は経済的に間違い。シングルから始めて、ボトルネックが見えた箇所だけ分割

詳細は マルチエージェントとは? を参照。

10. モニタリングと請求アラート

従量課金で「気づいたら高額」を防ぐには、定常モニタリング + アラートが欠かせない。

API ユーザー

  • Claude Console / OpenAI Dashboard で日次のトークン消費を確認
  • 使用上限(usage limit)を設定: 月額 $200 を超えたら止める、など。設定なしは危険
  • 請求アラート: $50 超えたらメール通知、$100 超えたら Slack、など段階的に

Claude Code ユーザー

  • /usage コマンドで現在のセッションの費用・プランの使用量を確認(/cost はいまは /usage の別名)
  • 毎日終わりに /usage を見る習慣をつける

組織管理者

  • 個人別の使用量レポート(Anthropic Team / Enterprise の管理画面)
  • 異常値検知(普段より大幅に多く使っている人を抽出)
  • 四半期ごとに「もったいない使い方」を全社共有

11. ありがちな浪費パターン7つ

パターン何が悪いか対策
毎ターン全ファイルを再添付キャッシュが効かず入力が膨れる変わらないドキュメントは前置きに置いてキャッシュ
「ChatGPT/Claude」と複数チャットで同じ質問同じ入力を別契約で2倍払う1つに絞る
長い会話を /compact なしで継続毎ターン履歴を丸ごと送る作業の区切りで /compact
Opus で簡単な分類・抽出Haiku の4倍払って同じ結果タスクで使い分け
「もっと丁寧に」「もう少し長く」を繰り返す出力トークン累積最初に欲しい分量を明示
不要なツールを多数定義tool 定義もコンテキストに乗る使うものだけ定義
マルチエージェントを安易に使うチャット比 約15倍のトークン(エージェント単体は約4倍)明確な必要性があるときだけ

まとめ

  • AI コスト最適化の 3レバー: プロンプトキャッシュ・モデル選択・出力予算。どれも公式の倍率で効き目が決まり、倍率は掛け合わさる
  • キャッシュ読み取り = 入力の0.1倍(Opus 5.5 は0.05倍)。5分キャッシュは1回、1時間キャッシュは2回の読み取りで元が取れる。10万トークンの前置きを Opus 5.5 に10回送ると $4.00 → $0.68
  • モデル選択: Opus 5.5 → Haiku 4.5 で単価は4分の1、Sonnet 5 なら半分(2026年9月時点)
  • 出力予算: 出力の単価は入力の5倍。max_tokens 明示と「短く」指示
  • バッチ処理: 急がない仕事は入力・出力とも半額。キャッシュの割引とも重なる
  • コンテキスト管理: 作業の区切りで /compact、タスクごとに分割、Hooks で出力圧縮
  • マルチエージェントの罠: チャット比 約15倍のトークン。明確な必要性があるときだけ
  • モニタリング: 使用上限・請求アラート・/usage 確認を習慣化

FAQ

Q1. Claude Code を毎日使うが Pro $20 と Max、どっちが得?

Pro の上限にたびたび当たるなら Maxを検討する。Anthropic のヘルプも、Pro で上限に頻繁に当たり、大きなリポジトリを扱う容量が要るなら Max 5x への切り替えを検討するよう案内している(Claude ヘルプ「Using Claude Code with your Pro or Max plan」)。上限に当たらないなら Pro のままでよい。

Q2. プロンプトキャッシュを使うのに特別な設定は必要?

Anthropic の API では cache_control を指定する必要がある。リクエストの最上位に1つ置く自動キャッシュと、ブロックごとに置く明示のブレークポイントの2通りがある。OpenAI は対応モデルで既定で有効だ。Claude Code は内部で自動的に使っている。詳細は Anthropic 公式ドキュメントを参照。

Q3. ChatGPT と Claude、コスト効率はどっちがいい?

用途による。単価だけを比べると、中位の Claude Sonnet 5 と GPT-6 Sol はどちらも入力 $2・出力 $10 で並ぶ。短い質問応答・大量の定型処理では OpenAI の低コスト型(2026年9月時点では GPT-6 Luna、入力 $0.10)が Haiku 4.5(入力 $1)の10分の1だ。同じ前置きを繰り返す長い仕事では、キャッシュの読み取りが効くので Opus 5.5(0.05倍)も候補になる。「両方契約して使い分け」も実用的。

Q4. 「Haiku で十分」をどう判断する?

3段階で実験する。(1) まず Opus で動かす。(2) 同じプロンプトを Sonnet に投げて品質を比較。(3) Sonnet が遜色なければ Haiku でも試す。定型の作業ほど差が出にくい。判断・推論が深く要る場合だけ Opus に戻す。

Q5. 個人ユーザーでも API 直接使うべき?

使い方による。対話しながらのコーディングが中心なら、請求が定額に収まる Max プランが楽。自分のアプリに AI を組み込む / バッチ処理 / 自動化なら API 直接が必要になる。両方の人も多い。

Q6. 請求アラートはいくらに設定すべき?

決まった正解はないが、たとえば普段の月額の1.5倍を最初のアラート、3倍で止める、という段階の付け方がある。普段 $30/月なら $50 でアラート、$100 で停止。最初のうちは1日単位の小さな額でアラートして使い方の感覚を掴み、それから緩める。

Q7. 「会社の AI 予算が膨らみすぎ」と言われた。最初に何をすべき?

3つを順にやる。(1) ユーザー別の使用量を見て、どこに消費が偏っているか確認 (2) 使用量の多い人の使い方を聞き取り → 浪費パターンを特定 (3) 全社向けに「キャッシュ・モデル選択・出力予算」の社内ガイドを配り、月次で改善状況をレポート。

旧版からの訂正

2026年9月26日に、次の記述を直しました。

旧版の記述いま
3つのレバーで未最適化コストの20〜30%まで圧縮できる(題・冒頭・画像)出典を示せないため外した。効き目は公式の単価・倍率から計算する例に置き換えた
キャッシュで−60〜90%、モデル選択で−50〜80%、出力予算で−30〜60%、月額 $30K → $6〜9K同上。代わりに「10万トークンの前置きを10回送ると $4.00 → $0.68」などの計算例を載せた
8割の作業は安いモデルで十分出典がないため外した
5分キャッシュは2回読めば元が取れる1回読めば元が取れる(書き込み1.25+読み取り0.1=1.35 < 2)
1時間キャッシュは5回読めば元が取れる2回読めば元が取れる(2+0.2=2.2 < 3)
出力トークンは入力の5〜6倍高い5倍(現行の Claude 各モデルと GPT-6 の3モデル)
キャッシュのヒット率が60%未満なら改善の余地、本番では80%以上を狙う出典がないため外した。usage の読み取り・書き込みのトークン数で確かめる方法に置き換えた
/compact で20万トークン → 5,000トークンに圧縮できる出典がないため数字を外した