コンテンツにスキップ
トピック

AIエージェントとは?自動化・RAG・ワークフローを解説

AIエージェント、RAG、自動化ワークフローの仕組みと活用法をわかりやすく解説。ビジネス活用から技術解説まで。

46 件の記事

並び替えで記事を探せます

AIエージェント・自動化 の記事一覧

Claudeのディスパッチ(Dispatch)——スマホから自分のPCが動く仕組みと、その安全性

Claudeのディスパッチ(Dispatch)——スマホから自分のPCが動く仕組みと、その安全性

ディスパッチ(Dispatch)は、スマホから指示を出すとその作業をあなたのPC上でClaudeが実行する機能だ(ベータ・Pro/Max)。クラウドで動くのではなく実機が動く点が、この機能の価値と危険の両方を生んでいる。公式ヘルプは「Dispatchを使えば、スマホからClaudeにメッセージを送り、デスクトップのコンピューター上で作業させられる」と説明し、Cowork ですでに設定済みのコネクタ・プラグイン・ファイルアクセスをそのまま使うとしている。動作にはPCが起きていてデスクトップアプリが開いていることが必要で、コンピュータ操作の対応はmacOSとWindowsのみ、Linuxにはない。仕組みは3段の優先順位で、コネクタが使えるならコネクタ、無ければブラウザ操作、最後の手段として画面の直接操作となる。安全性の評価はここから先だ。止まる場所は設計されている——コンピュータ操作は既定でオフ(設定→一般で有効化)、新しいアプリへのアクセスはアプリごとに毎回許可を求める、ファイルの完全削除には明示的な許可が要る、投資・取引プラットフォームと暗号資産のアプリは既定で対象外。一方で止まらない場所がある。許可済みアプリの中での個々の操作には確認が入らず、公式は「Claudeは画面を直接クリック・入力・遷移し、他のCoworkツールにかかる権限チェックを経ない」と明記している。さらに「コンピュータ操作にはClaudeと画面に映っているものとの間にサンドボックスが存在しない」「あるアプリで取った操作が別のアプリに影響しうる」ともある。最大のリスクはプロンプトインジェクションで、Anthropic自身が「操作された指示、予期しないコマンド、あるいはブラウザで開かれたフィッシングリンクが、取り消しが困難あるいは不可能な操作へと連鎖しうる」と書いている。対策としてモデル内部の活性を自動スキャンするとされるが、利用者側の線引きを不要にするものではない。公式は名指しで「機微なアプリ(銀行、医療、行政など)にコンピュータ操作の権限を与えないこと」とし、金融口座・法務文書・医療情報・個人データの取り扱いを避けるよう求めている。スマホ側のリスクも扱う——紛失時に漏れるのはスマホ内のデータではなく「PCに指示を出せる立場」と「続いている会話の中身」であり、被害の大きさはPC側で何を許しているかに比例する。ディスパッチの公式ヘルプには端末の解除や紛失時の手順が記載されていないため、対処はアカウント側の機能(アクティブなセッションの個別終了、全端末の一括ログアウト)とPC側の遮断(アプリを閉じる・スリープ)で行うことになる。一括ログアウトはモバイルアプリからは実行できずWebブラウザが要る点も押さえておきたい。本記事はこれらを一次情報から整理し、ディスパッチとコンピュータ操作が別のスイッチであること、Claude Codeのagent view(公式が同じくdispatchと呼ぶ別機能)との区別、そして取り返しのつく仕事から始めるという実務的な線引きまで扱う。

Claude Codeのagent view——セッションを並列で走らせる仕組みと、隔離がどこから漏れるか

Claude Codeのagent view——セッションを並列で走らせる仕組みと、隔離がどこから漏れるか

Claude Code の agent view(claude agents で開く)は、独立したバックグラウンドセッションを次々と起こし、1つの画面で管理するための機能だ。公式ドキュメントはその操作を「ディスパッチ(dispatch)」と呼ぶ——デスクトップアプリのサイドバーにある同名の別機能「ディスパッチ(Dispatch)」とは別物なので注意してほしい。公式ドキュメントは agent view を「1つの画面から多数のClaude Codeセッションをディスパッチし、管理する」機能と説明している(リサーチプレビュー・v2.1.139以降)。この記事は仕組みと安全性に絞る。まず驚くのは、入力欄に打ったプロンプトがそれぞれ自分自身の新しいセッションを開始するという点だ。2つ目を打っても1つ目への追記にはならず、隣に並ぶ。追加の指示はピークパネル(Space)から送る。安全性の中核はworktreeによる隔離にある。バックグラウンドセッションはファイルを編集する前に .claude/worktrees/ 配下の隔離されたworktreeへ移り、並列セッションは同じチェックアウトを読めるが書き込みはそれぞれ自分のものへ行う。読みは共有・書きは分離という設計だ。メインチェックアウトへ届く操作は3つのチェックで遮断される——ファイル編集(Edit/Write/NotebookEdit)、コマンドの作業ディレクトリ、そしてgitの向き先の付け替え(git -C、--git-dir、GIT_DIR、GIT_WORK_TREE、gitの前のcd)。検証できないコマンドは通さない安全側の判断になっており、この保護はセッションが生やすあらゆるサブエージェントにも継承される。ただしこれはOSの壁ではなく、リポジトリの外のファイルとネットワークは対象外で、PowerShellには作業ディレクトリのチェックしか適用されない。権限モードはその場で選ぶのではなく、そのディレクトリの設定のdefaultMode(サブエージェント指定時はそのフロントマターのpermissionMode)が引き継がれるため、普段緩めにしている人ほど無人の緩い権限が並列で生まれる。そして隔離の外へ漏れるものが3つある。「今後は確認しない」の承認はメインチェックアウトの.claude/settings.local.jsonに保存され全worktreeに効きworktreeを消しても残ること、agent viewでセッションを削除するとClaudeが作ったworktreeごと消えるため未コミットの作業が失われること、.worktreeincludeが秘密情報をworktreeの数だけ複製すること。さらにクォータは並列数に比例して減り(10個なら約10倍の速さ)、セッションはローカルで動くためマシンのシャットダウンで止まる。サブエージェント・エージェントチーム・動的ワークフローとの使い分け、安全に回すための手順(ディスパッチ前・実行中・終了後)も公式仕様にもとづいて整理する。

ChatGPT Workとは?使い方とGPT-5.6の仕事エージェント解説

ChatGPT Workとは?使い方とGPT-5.6の仕事エージェント解説

ChatGPT Workは、OpenAIが2026年7月9日にGPT-5.6と同時発表した「仕事用のAIエージェント」。質問に答えるだけの通常チャットと違い、連携アプリやファイルから文脈を集めて、資料・表・スライド・Webアプリといった「完成した成果物」まで作るのが最大の特徴だ。頭脳は同日発表の新フラッグシップGPT-5.6 Sol(Codex基盤)で、複雑なプロジェクトを分解して数時間にわたり自律作業を続けられる(Thurrott)。統合デスクトップアプリの中では、Work(成果物)/Codex(技術・詳細表示)/通常チャット(対話)の3モードが同居し、WorkはCodexの技術詳細を隠した"ビジネス版"の位置づけ(9to5Mac)。使えるモデルはプラン依存で、無料/GoはTerra、Plus/Pro/Business/EnterpriseはSol/Terra/Lunaから選択(報道ベース)。強みはGoogle Drive/SharePoint/Slack等のコネクターやMCPで「あなたの文脈」を取り込める点で、企業向けは既定でデータを学習に使わない。本記事では、Axios・TechCrunch・9to5Mac・Thurrott・OpenAIの情報をもとに、ChatGPT Workが何か・通常ChatGPTやCodexとどう違うか・どのプランで使えるか・どのアプリと繋がるかを、確度ラベル付きで整理する。

GPT-5.6 Sol vs Gemini 徹底比較——ベンチマーク・マルチモーダル・価格・選び方

GPT-5.6 Sol vs Gemini 徹底比較——ベンチマーク・マルチモーダル・価格・選び方

OpenAIの最上位GPT-5.6 SolとGoogle Geminiを徹底比較する。対Claude戦とは様相が違い、Solはエージェント/端末コーディングで圧倒(Terminal-Bench 2.1で88.8% vs 68.5%、SWE-bench Proで64.6%(推定) vs 54.2%)、Geminiはネイティブマルチモーダル(音声・動画)と約半額の価格($2.50/$15 vs $5/$30)、MMLU 92.6%・ARC-AGI-2 77.1%・WebDev Arena首位で対抗——得意分野がほぼ重ならない。さらに重要な「時制の罠」として、Googleの真の対抗馬Gemini 3.5 Proは本記事時点で未発売(アーキ全面刷新で2026年7月中旬にGA予定)で、現時点の公正な比較対象は現行最上位のGemini 3.1 Pro(2026年2月)である点を明示する。本記事ではスペック早見表、コーディング/推論/マルチモーダルのベンチ、Geminiの本丸であるマルチモーダルの差、実コスト(Sol比ではGeminiが約2倍安いが、GPT側もTerraならGeminiを下回る)、強み弱みマップ、ユースケース別の選び方までを公式発表と独立ベンチに基づいて整理する。

GPT-5.6 vs GPT-5.5 徹底比較——3モデル化・Terra 4割単価・ベンチ・移行の判断

GPT-5.6 vs GPT-5.5 徹底比較——3モデル化・Terra 4割単価・ベンチ・移行の判断

2026年4月のGPT-5.5から2か月半後の7月9日に登場したGPT-5.6は、単なる性能向上ではなく「単一旗艦から Luna/Terra/Sol の3モデル体制への再編」が最大の変化だ。多くのGPT-5.5ユーザーに最も効くのは、中位Terraが「GPT-5.5相当の品質を大幅に安く」提供する点。リリース時点で半額、さらに2026年7月30日の値下げでGPT-5.5の4割の単価($2/$12)になった。性能を上げたい人には最上位Sol(同価格$5/$30でSWE-Bench Pro 58.6→64.6%推定に向上)、コストを下げたい人にはTerra、という選択肢が生まれた。本記事では、3モデル化の意味、スペック早見表、Terraの価格対性能、世代でのベンチ向上(同一指標のSWE-Bench Proは+6pt、ただしTerminalBenchは2.0→2.1でバージョン違い・汎用推論は多くが非公表)、5.6の新機能(Programmatic Tool Calling・max effort・ChatGPT Work・GPT-Live・GitHub Copilot対応)、実コスト(月100M入力/20M出力で$1,100→$440の概算)、そしてどのモデルに移行すべきか(Terraで請求を6割減→性能が要る処理だけSol)までを公式発表・独立分析ベースで整理する。

GPT-5.6 Sol vs Claude Fable 5 徹底比較——ベンチマーク・長時間自律・価格・選び方

GPT-5.6 Sol vs Claude Fable 5 徹底比較——ベンチマーク・長時間自律・価格・選び方

OpenAIの最上位GPT-5.6 Sol(7月9日)と、Anthropicが「一般提供する中で史上最強」と位置づけるClaude Fable 5(6月9日)を徹底比較する。Opus 4.8戦が同価格帯の直接対決だったのに対し、こちらは「半額の万能型Sol($5/$30)」対「2倍高いが最上位のFable 5($10/$50)」というコストと実力のトレードオフが主題だ。実プロダクション級コーディングのSWE-Bench ProではFable 5が80.3%とSolの64.6%(推定)を15pt以上引き離し、その差はOpus 4.8戦より拡大。さらにFable 5は数百万トークンに集中して最大12時間連続で自走し、Stripeが5000万行のRuby移行を1日で完了させた「完走力」が本領だ。一方Solは端末操作のTerminalBench 2.1(88.8% vs Fable 86.0%)・Agents' Last Exam(53.6 vs 40.5)・Coding Agent Index(80 vs 77.2)で首位、しかも半額+トークン効率+54%でコスパが強い。本記事ではスペック早見表、ベンチ詳細、OpenAIがSolのSWE-bench Proを非公表な「非公開ベンチ問題」、長時間自律、実コスト(タスク完了あたりで見る)、強み弱みマップ、ユースケース別の選び方までを公式・独立ベンチベースで整理する。

GPT-5.6 Sol vs Claude Opus 4.8 徹底比較——ベンチマーク・コーディング・価格・選び方

GPT-5.6 Sol vs Claude Opus 4.8 徹底比較——ベンチマーク・コーディング・価格・選び方

2026年のAIコーディング2強、Claude Opus 4.8(5月28日)とGPT-5.6の最上位Sol(7月9日)を徹底比較する。得意領域はほぼ反対で、SolはTerminalBench 2.1(88.8% vs Opus 78.9%)・Agents' Last Exam 53.6・Coding Agent Index 80と端末操作/エージェント総合力で首位。対するOpus 4.8はSWE-bench Pro(69.2% vs Sol 64.6%)・USAMO 2026(96.7%)・GraphWalks 1M(68.1%)と実プロダクション級コーディング/数学/長文脈で首位、さらに「過信10分の1・欠陥結果の無批判報告0%」の誠実性を打ち出す。加えてOpenAIはSolのSWE-bench Proや汎用推論ベンチ(GPQA/AIME/MMLU等)を多く非公表——実コーディングの本丸では開示済みのOpusが優位という構図だ。本記事ではスペック早見表、ベンチ詳細、非公開ベンチ問題、実コスト(単価$25 vs $30とトークン効率+54%の綱引き)、強み弱みマップ、ユースケース別の選び方、デュアル運用戦略までを公式・独立ベンチベースで整理する。

GPT-5.6 リリース完全解説——Luna/Terra/Sol・ベンチマーク・価格・Claude比較

GPT-5.6 リリース完全解説——Luna/Terra/Sol・ベンチマーク・価格・Claude比較

OpenAIが2026年7月9日にGPT-5.6を一般提供開始。従来の「無印+Pro」から Luna(高速・低コスト $0.20/$1.20)/ Terra(バランス $2/$12、GPT-5.5相当をSolの4割の単価で)/ Sol(フラッグシップ $5/$30)の3モデル体制に再編されました(価格は2026年7月30日の改定後)。SolはAgents' Last Exam 53.6・Coding Agent Index 80で首位、TerminalBench 2.1も88.8%でClaude Fable 5(86.0%)を上回りますが、実プロダクション級のSWE-Bench ProではClaude Fable 5が80.0%、Sol 64.6%とClaudeが大きく優位。本記事では3モデルの違い・価格・ベンチマーク・新機能(Programmatic Tool Calling、ChatGPT Work、全二重音声GPT-Live)・ChatGPTプラン別提供・Claude(Fable 5/Opus 4.8)との比較・用途別の選び方まで、公式発表と独立ベンチマークを基に解説します。

LLMゲートウェイ/プロキシとは?複数プロバイダを1本のAPIでさばく仕組みと選び方【2026】

LLMゲートウェイ/プロキシとは?複数プロバイダを1本のAPIでさばく仕組みと選び方【2026】

OpenAIで実装し、次にClaudeやGeminiも試したくなった途端、プロバイダごとに違うSDK・形式・エラー処理の書き分けに時間が溶ける——そんな開発者向け。LLMゲートウェイ(AI Gateway/LLMプロキシ)は、アプリと各プロバイダの間に1枚かませる中継役で、1本のOpenAI互換APIで全モデルを叩けるようにし、フォールバック・コスト集計・仮想キー・キャッシュ・レート制限・観測といった横断的な面倒ごとを肩代わりする。本記事では、なぜ要るのか、ゲートウェイの正体、3つのタイプ(①セルフホスト型プロキシ=LiteLLM/②ホスト型=OpenRouter/③SDK型=Vercel AI SDK)の違い、LiteLLM・OpenRouter・Vercel AI SDKを軸にした選び方、接続先を差し替えるだけの最小構成コード、そして1ホップ分の遅延・ゲートウェイ自身の障害点・手数料(OpenRouterは購入額の5.5%)・機能の目減り・プライバシーという限界まで、実装目線で整理する。

AIエージェントの評価(Evals)とは?品質を測る5つの方法【2026】

AIエージェントの評価(Evals)とは?品質を測る5つの方法【2026】

AIエージェントを作ったあと必ずぶつかるのが「で、これはちゃんと動いているのか?」。プロンプトやモデルを変えた結果を感覚でなくデータで判断する仕組みがEvals(評価)だ。LLMは同じ入力でも確率的に出力が変わり、完全一致の単体テストが効きにくい。本記事はEvalsとは何か、品質を測る5つの方法(①正解データセット照合 ②ルールベース判定 ③LLM-as-judge=AIに採点させる ④回帰テスト=変更前後の比較 ⑤本番モニタリング)、エージェント特有の評価(タスク成功率・ツール呼び出しの正しさ・軌跡・コスト)、20件から小さく始める手順、よくある落とし穴、主要ツール(Anthropic Console/Evals・OpenAI Evals・LangSmith・Langfuse・Ragas)までを実務者向けに整理する。

AIエージェントとRPAの違いと使い分け|どっちを選ぶ?ハイブリッドが正解(2026)

AIエージェントとRPAの違いと使い分け|どっちを選ぶ?ハイブリッドが正解(2026)

業務自動化で必ず出るのが「AIエージェントとRPA、どっちを使う?」。結論は二者択一ではなく役割で使い分け、2026年の勝ちパターンは両者のハイブリッド。RPAは決まった手順を高速・正確にこなす決定的な「手」(変化に弱く画面変更で壊れる)、AIエージェントは状況を読んで判断する確率的な「頭」(曖昧さ・例外に強いが毎回同じ結果とは限らない)。本記事は動作原理の違い、比較表(再現性と変化耐性のトレードオフ)、使い分け(判断軸は「規則で書き切れるか」=書けるならRPA、書けない判断が要るならAIエージェント)、2026年の潮流(UiPath・Automation Anywhere・Blue PrismなどRPA大手のエージェント化=収束、対立でなく「判断をどこに置くか」=オーケストレーション優先)、そして実務の正解=ハイブリッド(頭=AIエージェントが判断・オーケストレーション、手=RPAが定型実行、決定性が要る所にエージェントを置かない、ガードレールと人間承認)まで整理。各社公式情報に基づき、FAQ付きで実務者向けに解説する。

AWSの管理をAIに任せる方法とメリット・デメリット|できること・危険・安全な任せ方(2026)

AWSの管理をAIに任せる方法とメリット・デメリット|できること・危険・安全な任せ方(2026)

AWSの運用・管理をAIに任せられるか。2026年は「かなり任せられる」段階に入った。AWS自身がAmazon Q DeveloperやAIエージェントがAWSを操作する公式基盤「Agent Toolkit for AWS」(2026年5月・40以上のagent skills+マネージドAWS MCP Server+プラグイン)を出し、IaC生成からリソース操作までAIが踏み込める。本記事は「任せる」を3段階(①コード/IaC生成支援②読み取り中心の運用・調査③実際にAWSを操作する自律エージェント)で整理し、主要ツール(Amazon Q Developer/Agent Toolkit/AWS MCP Server/Terraform MCP/Bedrock AgentCore)、メリット(IaCの速さ・一次調査自動化・コスト最適化提案・知識の民主化)、そして本題のデメリット(IAM権限の肥大化=permission sprawl、過剰権限がミス/プロンプトインジェクションの実行加速器になる、権限がタスクを越えて残る、コスト暴走。2025-26には本番DB削除の実例も)を、AWS公式・セキュリティ各社の情報をもとに解説。結論の「ひとひねり」は、論点は"できるか"ではなく"暴走・課金爆発なしにどう任せるか"であり、AWS自身がAgent ToolkitにIAMガードレール/CloudTrail監査/サンドボックスを組み込んだのが答えの形という点。最小権限IAM+破壊的操作の人間承認+可観測性+JIT短命資格情報+サンドボックスの5原則とFAQ付き。