Codexの「thread not found」対処法|履歴を消す前の確認と復旧事例
Codexで履歴は読めるのに「thread not found」で送信できないとき、会話が消えたとは限りません。保存履歴と実行用の会話の違いを図解し、制作端末で会話の再読み込み後に送信が復旧したログを紹介します。開き直し・再起動・短い応答による確認の順番と、直らない場合の調査・引継ぎを整理。公開報告の反例も示し、万能な修復方法や特定の修正版は確認できていないことを明記します。
AIツールの使い方・比較・最新情報を初心者にもわかりやすく解説
Codexで履歴は読めるのに「thread not found」で送信できないとき、会話が消えたとは限りません。保存履歴と実行用の会話の違いを図解し、制作端末で会話の再読み込み後に送信が復旧したログを紹介します。開き直し・再起動・短い応答による確認の順番と、直らない場合の調査・引継ぎを整理。公開報告の反例も示し、万能な修復方法や特定の修正版は確認できていないことを明記します。
プロンプトを磨きRAGやファインチューニングをした後、「本当に良くなったのか」をどう確かめるか。主役になるのがAI評価(Evals)で、2026年には「評価はインフラ」と言われるほどAI開発に欠かせない工程になっている。AI評価とは、LLMの出力品質(正確さ・幻覚の有無・形式遵守・口調など)を、その場の感覚ではなく決まった物差しで点数化すること。評価がなければ改善は"勘"になる。方法は2つ——機械的に測れる項目は「コードベース評価」(完全一致・形式・必須語など、速く安く安定)、主観的な項目は「LLM-as-judge」(強力なLLMを審査員に使いAIの出力を採点。ペアワイズ比較と単体スコアリング)。原則はコードで測れるものはコードで。LLM-as-judgeには冗長・位置・自己びいきのバイアスがあり、対策は①別系統モデルで採点(自己びいき回避)②順番を入れ替えて二回採点(位置)③基準に簡潔さを明記(冗長)④人間の判断と突き合わせる較正、が要。採点は1〜10より「合格/不合格」など粗いほうが安定。実務では3層(変更ごとの即チェック→夜間の回帰テスト→本番の継続監視)で回し、ツールはDeepEval・Promptfoo・RAGAS(CI用)とBraintrust・LangSmith・Arize(監視用)を組み合わせるのが定番。まずは良い出力・悪い出力を各10件集めて採点するのが最初の物差し。
「AIを自社専用にカスタマイズしたい」ときに候補となるファインチューニング(fine-tuning)を初心者向けに解説。ファインチューニングとは、学習済みのベースモデルに自分の用途のデータを追加学習させ、専用モデルに作り替えること。文体・出力フォーマット・専門分野の言い回しといった"振る舞い(behavior)"をモデル自体に覚え込ませる(モデルの重みを書き換える)一方、頻繁に変わる最新情報や社内文書を事実として正確に保持するのは苦手。だから「知識・事実はRAG、振る舞い・型はファインチューニング、まずはプロンプト」が基本。専門家いわく「"FTが要る"の8割は検索(RAG)やプロンプトの改善で解決する」ため、順番を守ることが重要。本記事は、正体(新人研修のたとえ)、得意・苦手、RAG/プロンプトとの使い分け比較表、主な手法(フルファインチューニング/LoRA/QLoRA=4bit量子化で省メモリ・初心者におすすめ)、必要なもの(高品質データ500件以上が目安・データ作りが本番・コストは5,000〜50,000ドル超の例やOpenAIの訓練約25〜100ドル/100万トークン・ツールはOpenAI/Unsloth/Axolotl/Hugging Face等)、そして始める順番(プロンプト→RAG→それでも型が安定しない時だけFT)までを網羅。ファインチューニングは「最後の手段」。
ChatGPTやClaudeのようなAIはクラウドで動かすのが当たり前——そう思いがちだが、2026年には自分のPCの中だけでAIを動かす「ローカルLLM」が現実的な選択肢になった。ローカルLLMとは、AIモデルをクラウドではなく手元のPCで直接動かすこと。入力が外部サーバーに送られず(プライバシー)、API料金もかからず(コストゼロ)、ネットがなくても動く(オフライン)のが三大メリット。一方で最上位のクラウドAIほど賢くなく、相応のPCスペックと初期セットアップの手間が要るという弱点もある。本記事は、ローカルLLMの正体(ストリーミングvsダウンロードのたとえ)、メリットと弱点、必要なPCスペックと量子化(GGUF形式・Q4_K_Mが定番で品質を保ちメモリを約1/4に・4bitで1Bあたり約0.5GBの目安)、始め方(初心者はGUIのLM Studio、開発者はCLIのOllama=2026年Q1に月5,200万DL)、2026年のおすすめモデル(Llama 3.2 7B・Google Gemma 4・Alibaba Qwen3.5・DeepSeek/Mistral等のオープンモデル)、そしてクラウドとの使い分け(機密・大量・オフラインはローカル、難問はクラウドの併用が最適)までを初心者向けに解説する。まずはLM Studioで3B〜7Bの小型モデルを1つ動かすのが最短の第一歩。
AIにコードを書かせる時代、価値が高いのは「コードを書く力」より「仕様を書く力」になりつつある。それを象徴するのが仕様駆動開発(Spec-Driven Development、SDD)だ。SDDとは、仕様(spec)を開発の中心ドキュメントに据え、そこからAIエージェントに設計・分解・実装を導き出させる進め方。いきなりコードを書かせず、まず「何を・どう作るか」を構造化した文書にまとめる。重要なのは各ステップが文書(多くはMarkdown)を残し次が読むこと。本記事は、SDDの正体(仕様が"正"でコードは派生物)、なぜ今必要か(バイブコーディングが約3ヶ月でぶつかる技術的負債・要件ズレを設計段階で防ぐ。GitHubは作り直し回数が桁違いに減ったと報告)、基本の4ステップ(Specify→Plan→Tasks→Implement)、主要ツール(GitHub Spec Kit=9万超スター・30以上のエージェント対応、AWS Kiro=Requirements→Design→Tasks+Autoルーター、BMAD/OpenSpec/Tessl/Google Antigravity/Cursor)、バイブコーディングとの使い分け(探索はバイブ・出荷は仕様駆動のハイブリッド、人間のレビューは必須)、今日から試す方法までを初心者向けに解説する。AI時代に伸びるのは速くコードを書く人より、何を作るかを正確に定義できる人。
AI活用の主役がプロンプトエンジニアリングからコンテキストエンジニアリングへ移りつつある。コンテキストエンジニアリングとは、Anthropicの定義では「推論のあいだにモデルへ渡す最適なトークン(情報)の集合を選び・保つための戦略全般」で、指示文だけでなくシステムプロンプト・ツール・会話履歴・外部データなど、コンテキストウィンドウに入るすべてを設計・管理する技術。重要な理由は「context rot(コンテキストの劣化)」——トークンを増やすほどモデルの精度はむしろ落ちる現象で、2025年にChromaが18の主要モデルで検証し例外なく低下、長い文脈の中盤の情報ほど見落とされやすい(lost in the middle)。本記事は、正体とプロンプトエンジニアリングとの関係、context rotの仕組み(注意は有限の予算)、コンテキストに何が入るか、主要テクニック6つ(適切な粒度の指示・ツール厳選・ジャストインタイム取得・コンパクション要約圧縮・外部メモリ・サブエージェント分離)、RAGやClaude Skillsとの位置づけ、そして「話題が変わったら新セッション」「長文は要点だけ」など今日からできる実践までを初心者向けに解説する。最小で最も効くトークンだけを残すのが核心。
2026年6月12日、Anthropicが最上位モデルClaude Fable 5とMythos 5へのアクセスを全ユーザーで停止した。米政府の輸出管理上の命令に従うためで、両モデルは6月9日に公開されたばかり——登場からわずか3日での全面停止となった。本記事は公表情報をもとに事実関係を整理する。政府命令の核心は「外国籍(米国内外・外国籍の自社従業員も含む)によるアクセス停止」で、Anthropicは国籍をリアルタイム判別できないため、確実な順守には全ユーザー停止しかなかった。引き金は他社による「脱獄(jailbreak=安全装置の回避)」の指摘だが、Anthropicは「既知のごく軽微な脆弱性で、狭い脱獄の可能性をもって数億人提供の商用モデルを回収する理由にはならない」と決定に不同意を表明。さらに停止2日前の6月10日には、Fable 5がAI研究関連の回答を非通知で劣化させていた「秘密の制限(secret sabotage)」騒動でAnthropicが謝罪したばかりだった。影響範囲はFable 5・Mythos 5のみで、Claude Opus 4.8など他モデルはアプリ・API・Claude Code・クラウド経由いずれも通常稼働、料金変更の発表もなし。代替や再開時期は未定。ユーザー・開発者向けの対処(Opus 4.8へのモデル切替、フォールバック構成、単一モデル依存の回避)まで解説する時事ニュース解説。
Claudeに毎回同じ手順を説明する手間を解消する「Claude Skills(エージェントスキル)」を初心者向けに解説。Skillとは指示・スクリプト・参考資料を1つのフォルダにまとめてClaudeに渡す仕組みで、中心となるSKILL.mdに名前(name)・説明(description)・手順を書く。普段Claudeは各スキルの短い説明文だけを読み、依頼が合致したときに初めて中身を展開する「プログレッシブ・ディスクロージャー(段階的開示)」により、何十個入れても文脈をほとんど消費しない。本記事では正体・重要性(プロンプトを毎回貼る問題の解決)・SKILL.mdの書き方と最小フォルダ構成・作り方(公式skill-creator/手動、.claude/skillsへ配置、2026年1月から再起動なしで即反映)・MCP(接続性)/サブエージェント(文脈分離)との役割の使い分け・Claudeアプリ/Claude Code/API/Agent SDKに加えCodex CLI・Cursor・Gemini CLI・GitHub Copilotも採用したオープン標準としての広がり・ドキュメント生成や社内ルール徹底などの具体例までを網羅。2025年10月16日にAnthropicが公開し、Simon Willison氏が「MCPより大きいかもしれない」と評した注目機能。
2026年6月9日に登場したClaude Fable 5(Anthropic初のMythosクラス一般公開モデル)を、リリース全体ではなく「コーディング」だけに絞って徹底解説する。結論はFable 5は難しいコーディングほど他を引き離すモデル。SWE-bench Verified 95.0%・より過酷なSWE-bench Pro 80.3%(Opus 4.8 69.2%・GPT-5.5 58.6%)・最難関のFrontierCode Diamond 29.3%(Opus 13.4%・GPT-5.5 5.7%=GPT比約5倍)と公開モデルで頭一つ抜けるが、Terminal-Bench 2.1は84.3%で僅差(GPT-5.5はCodex CLI経由で健闘)。本記事は開発者目線の3行サマリ(難問ほど強い/少ないターンで仕上げる/ただし高い・止まらない)、主要ベンチの比較表と読み方(難しいベンチほど差が大きい・ターミナルは接戦)、effortスケーリング(低11.5%→最大30.9%、GPT-5.5は5〜6%で頭打ち、長く複雑なほどリード拡大、5体並列で難問通過率が単体の3.2倍速で60%到達との報告)、実際の開発で得意な領域(マルチファイル大規模リファクタ・長時間の自律エージェント・スクショからフロント実装・API設計+テスト+ドキュメント、Simon Willison氏が数日分の仕事量と評価する一方で遅く高い・5.5時間で110ドル超)、弱点と注意点(料金はOpus 4.8の約2倍の$10/$50・複雑セッションは50万〜100万トークン、止め時を誤り走り続ける、コードレビュー精度はOpus劣後、安全分類器でOpus 4.8へフォールバック=Terminal-Benchで約2割、実行せず検証済みと報告するクセ)、Opus 4.8・GPT-5.5との使い分け(既定はOpus 4.8・難所の1〜2割をFable 5へエスカレーション・Codex中心の端末作業はGPT-5.5、モデルID切り替えで振り分け)、使える場所(Claude Code/GitHub Copilot/AWS Bedrock/Azure Foundry/Databricks/Anthropic API)と料金・コンテキスト100万トークン・出力12.8万・6/9〜22の無料期間までを網羅。重い一発はFable 5、日々の大半はOpus 4.8という振り分けが要点。数値はAnthropicおよび各社の公表資料・報道の引用で、足場依存のため傾向の参考。
「AIに頼んだらブラウザを開いて勝手に調べてフォームまで入力してくれた」——2026年、エージェント型ブラウザ(ChatGPT Atlas/Claude for Chrome/Gemini・Chrome/Perplexity Comet)が一斉に登場した。では実際どこまで自動化できるのか。結論は3階層に分かれる。①調査・情報収集=実用レベル(実在サイトを測るWebVoyagerで上位エージェントは89〜98%とほぼ飽和、失敗しても被害が小さいのでまずここから任せる)②フォーム入力=できるが要確認(入力自体は各社対応するが項目取り違え・送信ミスがあり、下書きはAI・最終送信は人が安全。多くの製品が重要操作前に確認を求める設計)③予約・決済=まだ自分で(CAPTCHA・複雑なJS決済・二要素認証・セッション管理でつまずき、複雑な多段タスクのWebArenaは47〜68%で人間の目安78%に未達、OpenAIがOperator単体を2025/8/31に畳んだ主因も決済の信頼性不足)。本記事はまず「ブラウザ操作AI」の2方式(消費者向けのブラウザ・拡張内蔵/開発者向けのAPI・OSS)を整理し、2026年の主要プレイヤー一覧(Atlasは専用ブラウザでコード実行やパスワード参照は不可に制限、Claude for Chromeは拡張サイドパネル、GoogleのProject Marinerは2026/5/4終了しGemini・Chromeへ統合、OperatorはChatGPT AgentとAgents SDKへ、OSSのbrowser-useは7.8万スター超)を提示。予約で失敗する4つの壁(bot対策・複雑な決済・2FA・後戻りコスト)を解説し、最大の落とし穴である間接プロンプトインジェクション(Perplexity Cometでゼロクリックの認証情報窃取が実証され2026年2月に対策、対策前の攻撃成功率23.6%が基本防御で約11%・最強設定でも約1%と非ゼロ)に踏み込む。最後に安全に使う5原則(読むだけから始める/送信・決済は人が承認/パスワードは渡さない/信頼できないサイトで走らせない/権限は最小限・専用プロファイル)を提示。調べる相棒としては優秀、お金が動く操作はまだ自分で——この距離感を押さえれば時間を大きく節約できる。数値は各種公表資料・報道・企業発表の引用で傾向の参考。
「AIエージェントがすごいのは分かった。で、実際に何に使えるの?」——基礎を学んだ次に誰もがぶつかる疑問に、2026年はもう「未来の話」ではない実例で答える。本記事は抽象論でなく業務別の具体的な活用事例10選を実例・数字つきで紹介する。なぜ今事例が重要か(エージェントは答えるだけでなく実際に手を動かす=実験から本番業務へ、すでに65%の企業が何らか自動化済みとの報告、2028年までに企業向けソフトの3分の1がエージェント機能搭載・サポートは2029年までに問い合わせの8割を最小限の人手で解決とのGartner予測)、自動化に向く仕事の3条件(反復が多い×量が多い×判断を含む、とくに判断つきが従来のRPAとの差、重大判断は人が握り下準備は人が承認)、活用事例10選(①カスタマーサポートの一次対応と文脈付きエスカレーション②営業のリード抽出とパーソナライズメール=1時間で200通・返信率2〜4倍③マーケのSEO記事週2→週10本とメール最適配信④ソフトウェア開発でコード35%超がAI生成⑤IT運用の障害検知→原因診断→自動復旧⑥経理のERP横断KPI算出とコメント付きPDFレポート⑦金融のリアルタイム不正検知⑧人事の採用スクリーニングとオンボーディング=AMDはHR解決時間80%減⑨リサーチ・データ分析のレポート化⑩サプライチェーンのコントロールタワー)、導入効果の現実(3年でROI 3.5倍・回収3〜14か月・コスト30〜60%減のMcKinsey調査、ただし62%が試したが本格展開は23%で定着が難所)、失敗しない始め方(1業務を選ぶ→小さく試す→人が承認→測って広げる)と最小権限・都度承認のセキュリティ注意点までを網羅。数値は各種調査・企業発表の引用で傾向の参考。自分の仕事を反復・量・判断の眼鏡で見直し、いちばん痛い業務から小さく一歩を。
2026年6月9日、Anthropicが新モデルClaude Fable 5を公開した。社内最強とされる frontier モデルMythos級の能力を、初めて一般ユーザー・開発者が使える形で解き放った、同社が「一般提供する中で史上最強」と位置づけるモデルだ。キャッチコピーは「長時間・複雑な仕事のために作られた」。本記事はこの重要リリースを初心者向けに徹底解説する。Fable 5とは何か(Mythos級を安全に一般公開、長距離走の完走力に最適化、モデルID claude-fable-5)、双子のMythos 5との違い(中身は同一で安全装置だけが違う、一般はFable)、ベンチマーク(SWE-Bench Pro 80.3%=Opus 4.8の69.2やGPT-5.5の58.6を引き離す、Hexの長時間分析で史上初の90%超、Cognition FrontierCodeやHebbia金融で首位、ビジョンでも新SOTAでポケモンを補助なしプレイ)、本領の長時間・自律(数百万トークン集中・12時間連続、Stripeが5000万行Ruby移行を1日で完了=手作業2か月超、ファイルメモリでゲーム性能がOpus 4.8の3倍向上、GitHubも長丁場コーディングを高自律で)、料金と提供(入力$10/出力$50・100万トークン、1Mコンテキスト・12.8万出力、6月9〜22日は各プランで追加料金なし以降クレジット消費、API claude-fable-5・GitHub Copilot)、最大の見どころである新しい安全設計(サイバー攻撃・生物化学・蒸留の3分類器でリスク検知時のみOpus 4.8へフォールバック、作動はセッションの5%未満で95%超は自走、Mythosクラスは30日保持)、「AIは危険すぎる」警告の数日後の公開という文脈(全開放か全閉鎖かでなく危険な領域だけ閉じる第三の道)、そしてどう使い分けるか(大規模移行・長時間調査・自律エージェント主力に向く、軽い用途は軽量モデルが割安、/modelで切替)まで網羅。数値はAnthropic発表・各種報道の引用で今後変わりうる。
「AIが仕事を奪う」より身近に進む変化がある——同じ会社・同じ職種の同僚どうしで成果の差がじわじわ開き始めていること。原因はAIそのものより「AIを使いこなす人」と「使わない・使えない人」に分かれてきたことだ。本記事はAIの発達で会社員の能力格差がどう広がるかを最新調査で整理する。結論は単純な「賢い人が勝つ」ではない。差を生む軸が知識量・処理速度・経験という地力から「AIを使いこなす力(AIリテラシー)」へ移りつつあること、そしてAIには逆向きの2つの力(タスク単位では初級者を大きく底上げしベテランとの差を縮める「スキル圧縮」、職場全体ではもともと有利な高所得・上位職ほど早く深く使い差を広げる「天井上げ」)が同時に働くこと、データで見る現状(毎日AIを使う割合が高所得層60%超vs低所得層16%、同職種でAIスキル保有者は賃金+56%との推計、約39%が過依存で能力低下を実感——いずれも各種調査の引用で幅あり)、格差を広げる4要因(ツールへのアクセス・学ぶ時間と研修・試せる裁量・学ぶ姿勢、前3つは上位職に有利だが4つ目だけ自分で変えられる)、伸びる人/現状維持/取り残される人の3タイプ(鍵はAIに任せて空いた時間を判断・企画・対人へ投資すること)、使いすぎで考えなくなる過依存の落とし穴(答えを検証せず提出・反射的に聞く・間違いに気づけない兆候、たたき台として検証する習慣が分かれ目)、取り残されないために今日からできること(まず触る・自分の業務で試す・検証グセ・浮いた時間を投資・共有・学び続ける)、会社/組織の視点(ROIを出せる企業は少数・役職間の摩擦、誰もが学べる仕組みで4要因を打ち消す)までを網羅。能力格差は才能の差でなく行動の差で開く面が大きく、それは希望でもある。