コンテンツにスキップ
トピック

AIエージェントとは?自動化・RAG・ワークフローを解説

AIエージェント、RAG、自動化ワークフローの仕組みと活用法をわかりやすく解説。ビジネス活用から技術解説まで。

50 件の記事

並び替えで記事を探せます

AIエージェント・自動化 の記事一覧

Jevとは?文章を生成しない判断特化AIの用途・料金・限界

Jevとは?文章を生成しない判断特化AIの用途・料金・限界

Jevは、文章を生成する代わりに選択肢・評価値・Yes/Noの確率を返すTypeSafeのAIモデルです。Choice・Score・Noulの使い分け、confidenceの読み方、問い合わせを分類するAPIの形を解説します。型が崩れないことは判断の正しさの保証ではありません。公式が公開する計算・日付・誘導文などの弱点、料金と二重の入力制限、日本語で使う前の評価方法まで整理します。API実行による性能レビューではありません。

Claude Codeのプロジェクト機能とは——Claudeがスレッドを配る仕組みと、使える条件・GitHub必須の制約・トークン消費

Claude Codeのプロジェクト機能とは——Claudeがスレッドを配る仕組みと、使える条件・GitHub必須の制約・トークン消費

Claude Codeの「プロジェクト」が作り直されました。これまでのプロジェクトは会話と資料をまとめておくフォルダでしたが、新しいプロジェクトは1本の会話です。あなたが用件を書くと、Claudeがそれをスレッドに切り分け、スレッドはクラウドで並列に走り、終わるとプルリクエストを置いて報告してきます。パソコンを閉じても止まりません。ただし飛びつく前に確かめることが3つあります。使えるアカウントがまだ限られていること(Pro・Max限定の公開ベータで、既存プロジェクトを持たないアカウントから配布)、github.comとClaude GitHub Appが事実上の必須条件であること、そしてトークンの減り方が単発のセッションとは比べものにならないことです。この記事では、配布条件の見分け方、スレッドが最初から持っている前提(リポジトリが複数になると権限ルールとフックが効かなくなる落とし穴を含む)、既定がOpusのhighであることを含むトークン消費の内訳、そしてサブエージェント・agent view・エージェントチーム・動的ワークフローを含む5つの並列手段の使い分けまでを、公式ドキュメントと公式ブログから整理します。

GPT-6 Astraのlowは本当に安いのか——GPT-5.6 Solのhighとトークン消費・料金・速度を実測で比較

GPT-6 Astraのlowは本当に安いのか——GPT-5.6 Solのhighとトークン消費・料金・速度を実測で比較

新しいモデルは賢いが高い——そう考えるのがふつうです。ところが GPT-6 Astra と GPT-5.6 Sol の比較では、単価だけ見ても答えが出ません。Astra は同じ仕事をより少ないトークンで終わらせるからです。第三者機関 Artificial Analysis の実測では、Astra を最も弱い low で動かすと、Sol を high で動かしたときと1タスクあたりの費用がほぼ同じ($0.82 対 $0.81)で、点数は上(46 対 42)、出力トークンは3分の1、返事が始まるまでの待ち時間は4分の1でした。この記事では、2026年9月18日時点の実測値をもとに、強度別の費用とトークンと速度、なぜ単価2.5倍でも総額が並ぶのかの内訳、Sol の販促価格が終わったときの試算、コーディングのエージェント作業では値段の差が縮まること、そして自分の仕事で測るための手順をまとめます。

GPT-6 Astra リリース完全解説——価格・使えるプラン・移行の変更点・Claude比較

GPT-6 Astra リリース完全解説——価格・使えるプラン・移行の変更点・Claude比較

OpenAIが2026年9月3日にGPT-6 Astraを公開しました。APIはゲート無しの一般提供で、モデルIDは gpt-6-astra、コンテキストは1,050,000トークン、価格は入力$10/出力$50、知識カットオフは2026年4月30日です。ただし「公開された」と「自分のプランで使える」は別で、ChatGPT Plusでは通常のチャットに出てこず、まずChatGPT WorkとCodexが入口になります。本記事では、プラン別の提供状況、単価が2倍でも1タスクあたりでは逆転しうる価格の見方、OpenAIが挙げたベンチマークの内訳、Preparedness Frameworkで初めて「Critical」に達したサイバー能力とその線引き、移行で壊れる4点(temperature系の削除、Responses API、noneの廃止、キャッシュ設定の改名)、Claude Opus 5・Fable 5.1・Gemini 3.8 Flashとの比較までを、一次情報で確認できた範囲だけ整理します。出回っている「Astra 74.1%対Opus 5 96%」型の比較表を載せていない理由も書きました。

Claudeのディスパッチ(Dispatch)——スマホから自分のPCが動く仕組みと、その安全性

Claudeのディスパッチ(Dispatch)——スマホから自分のPCが動く仕組みと、その安全性

ディスパッチ(Dispatch)は、スマホから指示を出すとその作業をあなたのPC上でClaudeが実行する機能だ(ベータ・Pro/Max)。クラウドで動くのではなく実機が動く点が、この機能の価値と危険の両方を生んでいる。公式ヘルプは「Dispatchを使えば、スマホからClaudeにメッセージを送り、デスクトップのコンピューター上で作業させられる」と説明し、Cowork ですでに設定済みのコネクタ・プラグイン・ファイルアクセスをそのまま使うとしている。動作にはPCが起きていてデスクトップアプリが開いていることが必要で、コンピュータ操作の対応はmacOSとWindowsのみ、Linuxにはない。仕組みは3段の優先順位で、コネクタが使えるならコネクタ、無ければブラウザ操作、最後の手段として画面の直接操作となる。安全性の評価はここから先だ。止まる場所は設計されている——コンピュータ操作は既定でオフ(設定→一般で有効化)、新しいアプリへのアクセスはアプリごとに毎回許可を求める、ファイルの完全削除には明示的な許可が要る、投資・取引プラットフォームと暗号資産のアプリは既定で対象外。一方で止まらない場所がある。許可済みアプリの中での個々の操作には確認が入らず、公式は「Claudeは画面を直接クリック・入力・遷移し、他のCoworkツールにかかる権限チェックを経ない」と明記している。さらに「コンピュータ操作にはClaudeと画面に映っているものとの間にサンドボックスが存在しない」「あるアプリで取った操作が別のアプリに影響しうる」ともある。最大のリスクはプロンプトインジェクションで、Anthropic自身が「操作された指示、予期しないコマンド、あるいはブラウザで開かれたフィッシングリンクが、取り消しが困難あるいは不可能な操作へと連鎖しうる」と書いている。対策としてモデル内部の活性を自動スキャンするとされるが、利用者側の線引きを不要にするものではない。公式は名指しで「機微なアプリ(銀行、医療、行政など)にコンピュータ操作の権限を与えないこと」とし、金融口座・法務文書・医療情報・個人データの取り扱いを避けるよう求めている。スマホ側のリスクも扱う——紛失時に漏れるのはスマホ内のデータではなく「PCに指示を出せる立場」と「続いている会話の中身」であり、被害の大きさはPC側で何を許しているかに比例する。ディスパッチの公式ヘルプには端末の解除や紛失時の手順が記載されていないため、対処はアカウント側の機能(アクティブなセッションの個別終了、全端末の一括ログアウト)とPC側の遮断(アプリを閉じる・スリープ)で行うことになる。一括ログアウトはモバイルアプリからは実行できずWebブラウザが要る点も押さえておきたい。本記事はこれらを一次情報から整理し、ディスパッチとコンピュータ操作が別のスイッチであること、Claude Codeのagent view(公式が同じくdispatchと呼ぶ別機能)との区別、そして取り返しのつく仕事から始めるという実務的な線引きまで扱う。

Claude Codeのagent view——セッションを並列で走らせる仕組みと、隔離がどこから漏れるか

Claude Codeのagent view——セッションを並列で走らせる仕組みと、隔離がどこから漏れるか

Claude Code の agent view(claude agents で開く)は、独立したバックグラウンドセッションを次々と起こし、1つの画面で管理するための機能だ。公式ドキュメントはその操作を「ディスパッチ(dispatch)」と呼ぶ——デスクトップアプリのサイドバーにある同名の別機能「ディスパッチ(Dispatch)」とは別物なので注意してほしい。公式ドキュメントは agent view を「1つの画面から多数のClaude Codeセッションをディスパッチし、管理する」機能と説明している(リサーチプレビュー・v2.1.139以降)。この記事は仕組みと安全性に絞る。まず驚くのは、入力欄に打ったプロンプトがそれぞれ自分自身の新しいセッションを開始するという点だ。2つ目を打っても1つ目への追記にはならず、隣に並ぶ。追加の指示はピークパネル(Space)から送る。安全性の中核はworktreeによる隔離にある。バックグラウンドセッションはファイルを編集する前に .claude/worktrees/ 配下の隔離されたworktreeへ移り、並列セッションは同じチェックアウトを読めるが書き込みはそれぞれ自分のものへ行う。読みは共有・書きは分離という設計だ。メインチェックアウトへ届く操作は3つのチェックで遮断される——ファイル編集(Edit/Write/NotebookEdit)、コマンドの作業ディレクトリ、そしてgitの向き先の付け替え(git -C、--git-dir、GIT_DIR、GIT_WORK_TREE、gitの前のcd)。検証できないコマンドは通さない安全側の判断になっており、この保護はセッションが生やすあらゆるサブエージェントにも継承される。ただしこれはOSの壁ではなく、リポジトリの外のファイルとネットワークは対象外で、PowerShellには作業ディレクトリのチェックしか適用されない。権限モードはその場で選ぶのではなく、そのディレクトリの設定のdefaultMode(サブエージェント指定時はそのフロントマターのpermissionMode)が引き継がれるため、普段緩めにしている人ほど無人の緩い権限が並列で生まれる。そして隔離の外へ漏れるものが3つある。「今後は確認しない」の承認はメインチェックアウトの.claude/settings.local.jsonに保存され全worktreeに効きworktreeを消しても残ること、agent viewでセッションを削除するとClaudeが作ったworktreeごと消えるため未コミットの作業が失われること、.worktreeincludeが秘密情報をworktreeの数だけ複製すること。さらにクォータは並列数に比例して減り(10個なら約10倍の速さ)、セッションはローカルで動くためマシンのシャットダウンで止まる。サブエージェント・エージェントチーム・動的ワークフローとの使い分け、安全に回すための手順(ディスパッチ前・実行中・終了後)も公式仕様にもとづいて整理する。

ChatGPT Workとは?使い方とGPT-5.6の仕事エージェント解説

ChatGPT Workとは?使い方とGPT-5.6の仕事エージェント解説

ChatGPT Workは、OpenAIが2026年7月9日にGPT-5.6と同時発表した「仕事用のAIエージェント」。質問に答えるだけの通常チャットと違い、連携アプリやファイルから文脈を集めて、資料・表・スライド・Webアプリといった「完成した成果物」まで作るのが最大の特徴だ。頭脳は同日発表の新フラッグシップGPT-5.6 Sol(Codex基盤)で、複雑なプロジェクトを分解して数時間にわたり自律作業を続けられる(Thurrott)。統合デスクトップアプリの中では、Work(成果物)/Codex(技術・詳細表示)/通常チャット(対話)の3モードが同居し、WorkはCodexの技術詳細を隠した"ビジネス版"の位置づけ(9to5Mac)。使えるモデルはプラン依存で、無料/GoはTerra、Plus/Pro/Business/EnterpriseはSol/Terra/Lunaから選択(報道ベース)。強みはGoogle Drive/SharePoint/Slack等のコネクターやMCPで「あなたの文脈」を取り込める点で、企業向けは既定でデータを学習に使わない。本記事では、Axios・TechCrunch・9to5Mac・Thurrott・OpenAIの情報をもとに、ChatGPT Workが何か・通常ChatGPTやCodexとどう違うか・どのプランで使えるか・どのアプリと繋がるかを、確度ラベル付きで整理する。

GPT-5.6 Sol vs Gemini 徹底比較——ベンチマーク・マルチモーダル・価格・選び方

GPT-5.6 Sol vs Gemini 徹底比較——ベンチマーク・マルチモーダル・価格・選び方

OpenAIの最上位GPT-5.6 SolとGoogle Geminiを徹底比較する。対Claude戦とは様相が違い、Solはエージェント/端末コーディングで圧倒(Terminal-Bench 2.1で88.8% vs 68.5%、SWE-bench Proで64.6%(推定) vs 54.2%)、Geminiはネイティブマルチモーダル(音声・動画)と約半額の価格($2.50/$15 vs $5/$30)、MMLU 92.6%・ARC-AGI-2 77.1%・WebDev Arena首位で対抗——得意分野がほぼ重ならない。さらに重要な「時制の罠」として、Googleの真の対抗馬Gemini 3.5 Proは本記事時点で未発売(アーキ全面刷新で2026年7月中旬にGA予定)で、現時点の公正な比較対象は現行最上位のGemini 3.1 Pro(2026年2月)である点を明示する。本記事ではスペック早見表、コーディング/推論/マルチモーダルのベンチ、Geminiの本丸であるマルチモーダルの差、実コスト(Sol比ではGeminiが約2倍安いが、GPT側もTerraならGeminiを下回る)、強み弱みマップ、ユースケース別の選び方までを公式発表と独立ベンチに基づいて整理する。

GPT-5.6 vs GPT-5.5 徹底比較——3モデル化・Terra 4割単価・ベンチ・移行の判断

GPT-5.6 vs GPT-5.5 徹底比較——3モデル化・Terra 4割単価・ベンチ・移行の判断

2026年4月のGPT-5.5から2か月半後の7月9日に登場したGPT-5.6は、単なる性能向上ではなく「単一旗艦から Luna/Terra/Sol の3モデル体制への再編」が最大の変化だ。多くのGPT-5.5ユーザーに最も効くのは、中位Terraが「GPT-5.5相当の品質を大幅に安く」提供する点。リリース時点で半額、さらに2026年7月30日の値下げでGPT-5.5の4割の単価($2/$12)になった。性能を上げたい人には最上位Sol(同価格$5/$30でSWE-Bench Pro 58.6→64.6%推定に向上)、コストを下げたい人にはTerra、という選択肢が生まれた。本記事では、3モデル化の意味、スペック早見表、Terraの価格対性能、世代でのベンチ向上(同一指標のSWE-Bench Proは+6pt、ただしTerminalBenchは2.0→2.1でバージョン違い・汎用推論は多くが非公表)、5.6の新機能(Programmatic Tool Calling・max effort・ChatGPT Work・GPT-Live・GitHub Copilot対応)、実コスト(月100M入力/20M出力で$1,100→$440の概算)、そしてどのモデルに移行すべきか(Terraで請求を6割減→性能が要る処理だけSol)までを公式発表・独立分析ベースで整理する。

GPT-5.6 Sol vs Claude Fable 5 徹底比較——ベンチマーク・長時間自律・価格・選び方

GPT-5.6 Sol vs Claude Fable 5 徹底比較——ベンチマーク・長時間自律・価格・選び方

OpenAIの最上位GPT-5.6 Sol(7月9日)と、Anthropicが「一般提供する中で史上最強」と位置づけるClaude Fable 5(6月9日)を徹底比較する。Opus 4.8戦が同価格帯の直接対決だったのに対し、こちらは「半額の万能型Sol($5/$30)」対「2倍高いが最上位のFable 5($10/$50)」というコストと実力のトレードオフが主題だ。実プロダクション級コーディングのSWE-Bench ProではFable 5が80.3%とSolの64.6%(推定)を15pt以上引き離し、その差はOpus 4.8戦より拡大。さらにFable 5は数百万トークンに集中して最大12時間連続で自走し、Stripeが5000万行のRuby移行を1日で完了させた「完走力」が本領だ。一方Solは端末操作のTerminalBench 2.1(88.8% vs Fable 86.0%)・Agents' Last Exam(53.6 vs 40.5)・Coding Agent Index(80 vs 77.2)で首位、しかも半額+トークン効率+54%でコスパが強い。本記事ではスペック早見表、ベンチ詳細、OpenAIがSolのSWE-bench Proを非公表な「非公開ベンチ問題」、長時間自律、実コスト(タスク完了あたりで見る)、強み弱みマップ、ユースケース別の選び方までを公式・独立ベンチベースで整理する。

GPT-5.6 Sol vs Claude Opus 4.8 徹底比較——ベンチマーク・コーディング・価格・選び方

GPT-5.6 Sol vs Claude Opus 4.8 徹底比較——ベンチマーク・コーディング・価格・選び方

2026年のAIコーディング2強、Claude Opus 4.8(5月28日)とGPT-5.6の最上位Sol(7月9日)を徹底比較する。得意領域はほぼ反対で、SolはTerminalBench 2.1(88.8% vs Opus 78.9%)・Agents' Last Exam 53.6・Coding Agent Index 80と端末操作/エージェント総合力で首位。対するOpus 4.8はSWE-bench Pro(69.2% vs Sol 64.6%)・USAMO 2026(96.7%)・GraphWalks 1M(68.1%)と実プロダクション級コーディング/数学/長文脈で首位、さらに「過信10分の1・欠陥結果の無批判報告0%」の誠実性を打ち出す。加えてOpenAIはSolのSWE-bench Proや汎用推論ベンチ(GPQA/AIME/MMLU等)を多く非公表——実コーディングの本丸では開示済みのOpusが優位という構図だ。本記事ではスペック早見表、ベンチ詳細、非公開ベンチ問題、実コスト(単価$25 vs $30とトークン効率+54%の綱引き)、強み弱みマップ、ユースケース別の選び方、デュアル運用戦略までを公式・独立ベンチベースで整理する。

GPT-5.6 リリース完全解説——Luna/Terra/Sol・ベンチマーク・価格・Claude比較

GPT-5.6 リリース完全解説——Luna/Terra/Sol・ベンチマーク・価格・Claude比較

OpenAIが2026年7月9日にGPT-5.6を一般提供開始。従来の「無印+Pro」から Luna(高速・低コスト $0.20/$1.20)/ Terra(バランス $2/$12、GPT-5.5相当をSolの4割の単価で)/ Sol(フラッグシップ $5/$30)の3モデル体制に再編されました(価格は2026年7月30日の改定後)。SolはAgents' Last Exam 53.6・Coding Agent Index 80で首位、TerminalBench 2.1も88.8%でClaude Fable 5(86.0%)を上回りますが、実プロダクション級のSWE-Bench ProではClaude Fable 5が80.0%、Sol 64.6%とClaudeが大きく優位。本記事では3モデルの違い・価格・ベンチマーク・新機能(Programmatic Tool Calling、ChatGPT Work、全二重音声GPT-Live)・ChatGPTプラン別提供・Claude(Fable 5/Opus 4.8)との比較・用途別の選び方まで、公式発表と独立ベンチマークを基に解説します。