Jevとは?文章を生成しない判断特化AIの用途・料金・限界
Jevは、文章を生成する代わりに選択肢・評価値・Yes/Noの確率を返すTypeSafeのAIモデルです。Choice・Score・Noulの使い分け、confidenceの読み方、問い合わせを分類するAPIの形を解説します。型が崩れないことは判断の正しさの保証ではありません。公式が公開する計算・日付・誘導文などの弱点、料金と二重の入力制限、日本語で使う前の評価方法まで整理します。API実行による性能レビューではありません。
AIを使ったアプリ開発・コード生成・デバッグ・テスト自動化の実践テクニック。初心者から中級者まで役立つガイド。
97 件の記事
並び替えで記事を探せます
Jevは、文章を生成する代わりに選択肢・評価値・Yes/Noの確率を返すTypeSafeのAIモデルです。Choice・Score・Noulの使い分け、confidenceの読み方、問い合わせを分類するAPIの形を解説します。型が崩れないことは判断の正しさの保証ではありません。公式が公開する計算・日付・誘導文などの弱点、料金と二重の入力制限、日本語で使う前の評価方法まで整理します。API実行による性能レビューではありません。
計画を立てるところだけ賢いモデルに任せ、実装は速くて安いモデルに回したい。Claude Code の opusplan は、それを自動でやるモデルの指定です。プランモードの間は Opus、それ以外は Sonnet で動き、/model opusplan か settings.json の model で使えます。ただし /model の一覧には出てこず、プランモードに入るたび・出るたびにモデルが切り替わるので、そのたびに会話全体をキャッシュなしで読み直します。この記事では、2026年9月15日時点の公式ドキュメント、変更履歴、GitHub の issue をもとに、設定のしかた(版の固定や 1M 文脈を含む)、プランモードから承認して実装に移る流れ、v2.0.0 で選択画面から外された経緯と Anthropic の担当者の説明、切り替えで生じるキャッシュの費用の試算とその抑え方、advisor ツールやサブエージェントとの違い、向いている使い方と向いていない使い方をまとめます。
Claude Code の本体は Opus 5 のまま、翻訳や大量の確認のような仕事だけを Sonnet や Haiku のサブエージェントに任せられるのか。結論はできます。サブエージェントのモデルは、呼び出すときの指定、定義ファイルの model、環境変数 CLAUDE_CODE_SUBAGENT_MODEL、本体のモデルの順に決まり、工数(effort)もサブエージェントごとに指定できます。この記事では、2026年9月15日時点の公式ドキュメントから、順番の版ごとの違い、全部を1つのモデルに固定する CLAUDE_CODE_SUBAGENT_MODEL_FORCE、接続先で変わるエイリアスの行き先、組み込みの Explore が v2.1.198 から本体のモデルを引き継ぐようになった点を整理します。そのうえで、実際に別のモデルで起動して会話ログで確かめた結果を載せます。指定どおりのモデルで動いたこと、起動するだけで数万トークンを読み込み、サブスクリプションでもサブエージェントのキャッシュは5分で切れること、そして同じ翻訳を Opus 5・Sonnet 5・Haiku 4.5 に2回ずつ任せたときの時間・料金・訳の出来の違いです。最後に、料金と使用量への効き方と、どの仕事を下げるかの判断材料をまとめます。
複数のセッションを並行して走らせていると、どれが週の上限を食っているのかが気になります。ところが Claude Code の /usage が出すのは、今のセッションの数字と、プラン全体の消費をスキル・サブエージェント・プラグイン・MCPサーバー別に分けた割合までで、「どのセッションが何割使ったか」は、デスクトップアプリの使用量リングにも claude.ai の設定画面にも出ません(2026年9月時点)。答えは手元に残っている会話ログ(~/.claude/projects の JSONL)にありますが、そのまま足すと数え間違えます。1回の応答が中身のかたまりごとに複数行へ書かれ、サブエージェントの記録は別のファイルにあるからです。筆者の環境で実測すると、素朴な合計は正しい値の約2倍になり、しかも誤差の倍率がセッションごとに違うため順位まで入れ替わりました。この記事では、公式の画面で見られるもの・見られないものの整理、ログの正しい数え方と約50行の集計スクリプト、1つのセッションが3割を占めていた実測結果、数字の読み方の限界、そして継続的に見たい場合の OpenTelemetry の設定までをまとめます。
「スキルを入れすぎるとコンテキストを圧迫する」——半分は正しく、半分は間違いです。Claude Code の公式ドキュメントによれば、スキル一覧が使うのはモデルの文脈窓の1%という決まった予算で、いくらスキルを増やしてもそこで頭打ちになります。膨らまないかわりに起きるのは「呼ばれなくなる」こと——予算からあふれると、Claude Code は呼び出し回数の少ないスキルから説明文を落とし、名前だけを残します。説明を失ったスキルは依頼と結び付かなくなりますが、エラーは出ず、遅くもなりません。この記事では、3つの計測手段(/context・/usage・/skill-doctor)の役割の違い、キャッシュミスが「5%かつ2,000トークン」で定義されること、キャッシュの寿命が契約形態で1時間から5分へ変わること、MCPのツール定義が既定で遅延読み込みになった今もCLIのほうが軽い理由、CLAUDE.mdを200行以下に保つ根拠、そして測ったあとに何から削るかを、すべて公式ドキュメントで確認できた範囲だけで整理します。
Claudeを使っていて手が止まり、出た文言をそのまま検索しても何も出てこない——そういう文字列がある。The model returned no content because the response was blocked by content filtering/The response was blocked by the provider's content filter/Streaming response ended before any complete data was received/Could not locate the Claude CLI on PATH/Connection to Claude's response was lost. Claude may still be working の5つがその例だ。共通しているのは「Claudeを使っていて出たのに、Claudeの資料を探しても見つからない(ように見える)」点で、理由は単純——いま画面に出ている文言を書いたのが、思っているプログラムとは限らないからである。本記事は個別の原因を一から解説するのではなく、その文言を書いたのは誰かを特定し、正しい記事へ振り分けるための入口として書いた。まず文言を書きうる層を4つに分ける(モデル提供元のバックエンド/Claude Code本体/起動元のIDE拡張やラッパー/第三者クライアント)。そのうえで実際に照合すると、5つのうち2つはClaude Code公式のエラーリファレンスに項目として存在していた。Streaming response ended… の公式の定義は「ヘッダは返ったがボディにClaude APIのメッセージが無い」であり、途中で切れた話ではない。Could not locate the Claude CLI on PATH は公式が「Wrapper and IDE errors=起動元のプログラムが印字するもの」として独立の章に置いている。一方でcontent filter系の2つは第三者側の語彙で、しかもOpenCodeのIssue #35736は、Vertexの404・ソケット断・本物の拒否という3つの別々の失敗がすべて同一の「blocked by content filter」として表示されると報告している。文言が正しいのは3つのうち1つだけだ。GitHubの公式ドキュメントもClaude利用時に入出力がGitHub Copilotのコンテンツフィルタを通ると明記しており、Claudeを使っていても止めたのがAnthropicのフィルタとは限らない。残る1つは公式にもRemote Controlのドキュメントにも文字列が無く、出どころを特定できなかったので名前を挙げず、自分で突き止める4手を置いた。確定・未確定はラベルで分けてある。
Claude Codeで応答の途中に「API Error: Connection lost mid-response. The response above may be incomplete.」と出て止まる——この文言をそのまま検索しても情報が少ないのは、これが比較的新しい名前だからだ。公式エラーリファレンスは「v2.1.227より前は Connection lost mid-response は Connection closed mid-response と表示されていた」と明記しており、同時に Response stalled mid-stream も The response stopped arriving へ、Connection closed while thinking, before producing a response も Connection lost before a response was produced へ付け替えられている。つまり中身は前からある事象で、単語だけが替わった。本記事はこの改名を起点に、公式ドキュメントと公開Issueだけを根拠として整理する。まず「途中で切れた」4つのメッセージ(Server error/Connection lost/computer went to sleep/The response stopped arriving)の公式定義と、途中まで流れた出力が意図的に保持される理由——送り直すと同じツール呼び出しを二重に実行しうるため——そして復帰手順が continue と返すことである点。次に、なぜ自動で再試行されないのかを公式の Automatic retries の分岐で説明する(何も完了していない段階の切断は最大10回のバックオフで再送、思考後・出力前なら最大2回で Connection lost before a response was produced、ブロック完了後は再送せず注記を出す)。さらに切断が起きうる3つの層(手元の端末と回線/プロキシ・ゲートウェイなどの経路/サーバ側と接続の再利用)、mTLS証明書ローテーション時の再読み込み(v2.1.232以降)、9手の切り分けチェックリスト、4つのストリーム監視タイマーの既定値(first-byte 180秒/event 300秒/byte 180秒/body idle 5分)と CLAUDE_CODE_MAX_RETRIES・CLAUDE_CODE_RETRY_WATCHDOG・API_TIMEOUT_MS などの環境変数、似たメッセージ8種との見分け方の対応表、そして生のHTTPSは健全なのにCLIだけECONNRESETで落ちる実報告(#86473/#85979)を扱う。最後に、症状と復帰手順は公式に文書化されている一方で原因の公式説明はまだ無いこと、CHANGELOGに改名の記載が見当たらないことまで、確度を分けて示す。
Claude Fable 5.1 の移行は、モデルIDを差し替えて終わりではない。公式が「3つは破壊的変更」と明記しており、しかもそのうち2つはエラーが出る場所と原因が離れている。①強制ツール呼び出しが400になる——tool_choice の any と tool が invalid_request_error を返す。思考が常時ONのモデルで強制すると思考が飛ばされ、引数の質が落ちるためだ。②思考ブロックがモデルに紐づく——前世代からFable 5.1へ移る会話は推論を保てるが、逆向きは失われる。しかも既定では読めないブロックがモデルに届く前に破棄され、input_tokens に数えられず課金にも出ない。ルーターやフォールバックでモデルを切り替える作りでは、動いているように見えて推論だけが抜け落ちる。気づくには thinking-binding-controls-2026-08-01 ベータヘッダが要る。③過去のターンを編集すると、それ以降の思考ブロックが無効になる。system プロンプトや tools の作り直し、リマインダーを差し込んで消す書き方が該当する。この検査は2026年8月31日以降に作成されたアカウントで強制されるため、新しい検証環境では落ちるのに本番では落ちない、という食い違いが起きうる。位置づけの誤解も避けたい——Fable 5.1 はフラグシップの交代ではなく、公式は「ほとんどの用途はOpus 5から」と明記している。値上げはなく、変わったのはキャッシュ読み取りだけで、基本入力の0.1倍から0.025倍へ下がった。効果は同じ前置きを何度読み直すかで決まり、公式は典型的な負荷で約25%減、エージェント色の強い作業で最大約45%減としている。さらにコードを変えなくても挙動が7つ変わる(並列ツール呼び出しが減る、進捗の発話が減る、low effortで記憶から答えがち、散文が密になる、整形が減る、要約で引用を明示しない、小さな修正でも全文を書き直す)。追加機能5つ(うちキャッシュ値下げは第5章で独立して扱う)と移行手順5点まで、すべてAnthropic公式ドキュメントに基づいて整理する。
自分のPCで動かすモデルにコードを書かせる——それ自体は前からできたが、できたのは「書きかけの行の続きを埋める」補完までだった。リポジトリを読んで複数ファイルを直しテストを走らせるエージェント型は、ローカルには重すぎた。そこが2025年末から2026年にかけて動いた。Qwenの公式モデルカードには「Qwen CodeやCLINEといったほとんどのプラットフォームをサポートし、専用に設計されたfunction call形式を備える」とエディタ拡張が名指しで書かれ、Mistralも2025年12月9日にエージェント型コーディング専用のDevstral 2を発表、小さいDevstral Small 2(24B)をApache 2.0で公開した。本記事は一次情報だけで「いまどこまでできて、どこで詰まるか」を整理する。最大の関門はOllamaの既定コンテキスト長で、これは固定値ではなくVRAM量で決まる——24GiB未満なら4k、24〜48GiBで32k、48GiB以上で256k。一般的なゲーミングPCは4kに落ち、エージェントはシステムプロンプトとファイル内容とツール往復で軽く超えるため、会話の頭から静かに切り落とされる。エラーは出ないので「モデルが馬鹿」に見えるが、原因は入り口で文脈が捨てられていることだ。Ollama公式はコーディングツール用途に「少なくとも64000トークン」を明記し、伸ばした後はollama psでGPUに載っているか確認せよと案内している。モデル選定は公式発表のみで比較する——Qwen3.6-35B-A3B(活性3B・262,144コンテキスト・Apache 2.0・SWE-bench Verified 73.4)とDevstral Small 2(24B・256K・Apache 2.0・68.0%)。ContinueとClineの設計差(役割ごとに別モデルを割り当てる補完型と、自律エージェント)、そして「クラウドの何%」という比較がもはや成立しない理由——AnthropicのOpus 5発表にはSWE-bench Verifiedの数値が無く、フロンティア側はこの指標から離れつつある——まで扱う。
Remote Control は、自分のマシンで動いている Claude Code のセッションに、スマホやブラウザから接続してそのまま操作を続ける機能だ。クラウドへ処理を移すのではなく、実行場所は手元のまま「操作する場所だけ」を移す——だからローカルのファイル、MCPサーバ、ツール、プロジェクト設定がそのまま生き、スマホで @ と打てば手元のプロジェクトのパスが補完される。本記事では、まず「外から動かす手段」が4つあること、そのうちRemote Control・Dispatch・Channelsの3つは手元のPCで動き、Claude Code on the webだけがクラウドで動くという地図を示す。リポジトリがGitHub以外なら結果をpushして戻せないため、構成そのものが選択肢を削る点にも触れる。起動方法は3つ——会話中に /remote-control で今の履歴ごと持ち出す、claude --remote-control で最初から有効にする、claude remote-control でサーバーとして常駐させる(スペースキーでQRコード、--spawn worktree でセッションごとにgit worktreeを分離、既定の同時数は32)。スマホ側では権限プロンプトと質問に答えられる一方、/plugin と /resume はローカル専用で、/model や /effort は引数を渡す形になる。UIから選ぶかコマンドを送るかで永続性が変わる点は事故のもとだ。仕組みは「登録してポーリングし、サーバが中継する」だけで、外向きHTTPSのみ・受信ポートは一切開かない——SSHを外に晒すのと比べて攻撃面が構造的に小さく、ルータ設定も固定IPも要らない。そのうえでセキュリティの本質は、QRコードが認証ではなく近道でしかないこと、アクセス権は「URLを知っているか」ではなく「誰のアカウントか」で決まること、つまり門は1枚でありその1枚がclaude.aiアカウントであることだ。だからパスキーの設定が最優先になる。接続中はトランスクリプトがAnthropicのサーバに保存され、保持期間はモデル改善への利用設定で5年と30日に分かれる。繋がらないときの原因切り分け、ネットワーク断でサーバーモードと対話セッションの挙動が違うこと、スマホ紛失時にまずプロセスを止めるべき理由、そしてDispatchとの使い分け(事前準備が要るか要らないか)まで、すべてAnthropic公式ドキュメントに基づいて解説する。
Claudeの「思考(thinking)」はこの1年で世代交代した。かつての拡張思考(extended thinking)は thinking: {"type": "enabled", "budget_tokens": N} で思考トークン量を人間が毎回指定する方式だったが、適切な予算はタスクごとに違い事前に当てられず、予算変更はプロンプトキャッシュも無効化する。現行の適応的思考(adaptive thinking)は type: "adaptive" の一行だけで、考えるかどうか・どれだけ深く考えるかをリクエストの難しさからモデル自身が判断する。移行はOpus 4.6 / Sonnet 4.6でbudget_tokensが非推奨になり、Opus 4.7以降では400エラーで拒否という段階を踏んだ。本記事ではモデル別の扱いを1枚の早見表に整理する——Fable 5は思考常時ON(OFF不可)、Opus 5 / Sonnet 5は既定ON(Opus 5のOFFはeffort high以下のみ)、Opus 4.8 / 4.7は明示で有効化、旧世代(Sonnet 4.5 / Haiku 4.5等)は今もbudget_tokensが唯一の方式。深さの調整はoutput_config: {"effort": ...}の5段階(既定high)に移り、effort変更はキャッシュを無効化する。見え方はdisplayで制御し、新世代の既定は"omitted"(空の思考ブロック)——見えなくても思考トークンは全額課金され、実測はusage.output_tokens_details.thinking_tokensで行う。生の思考過程はどの設定でも返らない。思考OFFにはOpus 5でツール呼び出しがテキスト化される・内部タグが漏れるという公式記載の副作用があり、切るよりeffortを下げるのが安全。interleaved thinking(ツール呼び出しの合間の思考)はadaptiveなら自動で、旧ベータヘッダは不要。速度が欲しいときはfast mode(約2.5倍速・単価2倍・Opus 5/4.8のみ・Claude Codeは/fastで切り替え)という選択肢もある。すべてAnthropic公式ドキュメント(Thinking / Extended thinking / Fast mode)に基づいて解説する。
作業中に Claude Desktop が突然固まり、開いていた Claude Code のセッションが全部まとめて止まる。強制終了して再起動すると、今度はアプリ自体が起動しなくなっていることがある——このときログの最後の行に残っているのは、たいてい「GPU process gone: { type: 'GPU', reason: 'crashed', exitCode: 101457950 }」という一文だ。この記事は、その exitCode 101457950(=0x060C201E)が何を意味するのかを整理する。落ちているのは Claude Code(CLI)ではなく、それを載せているデスクトップアプリ(Electron)の GPU プロセスである。判定は main.log の末尾を見るだけでよく、再起動の直前の行が GPU process gone なら本件で、Crashpad にダンプが増えていなければ CLI 側のネイティブクラッシュではない。なぜ無関係なセッションまで巻き添えになるのかという疑問には、構造で答えられる。Electron/Chromium の GPU プロセスはアプリケーションにつき1個しか存在せず、全ウィンドウ・全タブ・全セッションがこれを共有している。したがって in-app ブラウザで開いたページ1枚が GPU を殺すと、そのページと縁もゆかりもないセッションが同時に止まる。これは構造上の性質なので、ユーザー側の設定で分離することはできない。引き金は公開issueで最も多いのが in-app ブラウザで、#80444 は WebGL/WebGPU の機能検出から15〜36秒後に4回とも同じ 0x060C201E で死ぬ様子を、#82967 はブラウザツールのプレビュー用スクリーンショット取得(capturePreviewScreenshotIfChanged)を引き金として記録している。ただしブラウザだけが引き金ではなく、#68049 は ARM64 環境で起動時に同じコードで落ちると報告している。復旧は強制終了と再起動が基本だが、GPUクラッシュの後に Windows が MSIX パッケージを「変更されている」(appxState=2)と判定して起動を拒否することがあり、その場合は常駐プロセスを終わらせてから[修復]を実行する。[修復]が常に失敗し、完全な削除と再インストールでしか戻らなかったという報告(#82967)もある。データは保存済みのものが残る一方、実行中だった作業は戻らず、並列で走らせていたサブエージェントの結果ごと失った報告(#81698)がある。打てる手は引き金を引きにくくすることだけで、--disable-gpu は MSIX 版では「アクセスが拒否されました」で弾かれ、アプリの更新でも直るとは限らない。Anthropic はこの症状について公式の原因説明も修正告知も出していない。