跳到内容
主题

AI代理与自动化:RAG、工作流与实战指南

理解AI代理、RAG和自动化工作流。从概念到实际应用和实施指南。

50 篇文章

排序文章以找到您需要的内容

AI代理与自动化 分类下的文章

Jev是什么?TypeSafe决策AI的用途、价格与局限

Jev是什么?TypeSafe决策AI的用途、价格与局限

Jev是TypeSafe推出的AI模型,不生成长篇文本,而是返回选项、评分和“是/否”的概率。本文介绍Choice、Score与Noul的区别、confidence的含义,以及分派客服请求的API结构。类型保证并不保证判断正确。我们梳理官方列出的计算、日期和诱导输入等弱点,解释价格与两个输入限制,并说明使用日语前应如何评估。内容依据官方资料整理,并非API性能实测。

Claude Code Projects 是什么——Claude 如何分派线程、谁能用、GitHub 的硬性要求与 token 开销

Claude Code Projects 是什么——Claude 如何分派线程、谁能用、GitHub 的硬性要求与 token 开销

Claude Code 的 Projects 被重建了。此前的项目是一个装着对话和参考资料的文件夹,新的 Projects 则是一整条对话:你写下需求,Claude 把它拆成一个个线程,线程在云端并行运行,每个完成后开一个 pull request 并回报结果,合上笔记本也不会让它们停下来。不过动手之前有三件事值得先确认:能用的账号仍然有限(Pro 和 Max 的公开测试,优先发放给还没有现存项目的账号)、github.com 与 Claude GitHub App 在实际操作中是硬性要求,以及它消耗用量上限的速度和单个会话完全不是一个量级。本文依据官方文档与官方博客,说明怎么判断放量有没有轮到你、一个线程启动时带着什么(包括项目里一旦有多个仓库、权限规则和钩子就会失效这个陷阱)、token 开销从哪里来(默认是 Opus 的 high effort),以及在 Subagents、agent view、Agent Teams、动态工作流和 Projects 这五种并行方式之间该怎么选。

GPT-6 Astra 的 low 真的更便宜吗——与 GPT-5.6 Sol 的 high 实测比较token消耗、费用和速度

GPT-6 Astra 的 low 真的更便宜吗——与 GPT-5.6 Sol 的 high 实测比较token消耗、费用和速度

新模型更聪明但也更贵——一般都会这么想。可是在 GPT-6 Astra 和 GPT-5.6 Sol 的比较里,只看单价是得不出答案的,因为 Astra 用更少的token就能把同样的活干完。第三方机构 Artificial Analysis 的实测显示,把 Astra 开到最弱的 low,每个任务的费用和把 Sol 开到 high 时几乎相同($0.82 对 $0.81),分数还更高(46 对 42),输出token只有三分之一,回复开始之前的等待时间只有四分之一。本文以2026年9月18日时点的实测值为依据,整理按推理强度划分的费用、token和速度,为什么单价2.5倍而总额仍会打平的明细,Sol 的促销价结束之后的试算,在编程智能体作业上价格差距会缩小这一点,以及拿自己的工作去测量的步骤。

GPT-6 Astra 发布完全解读——价格、可用套餐、迁移变更点、与Claude的比较

GPT-6 Astra 发布完全解读——价格、可用套餐、迁移变更点、与Claude的比较

OpenAI 在2026年9月3日公开了 GPT-6 Astra。API 无门槛正式开放,模型ID 是 gpt-6-astra,上下文为1,050,000 token,价格是输入$10/输出$50(每100万token),知识截止为2026年4月30日。不过“已经发布”和“自己的套餐能用”是两回事,在 ChatGPT Plus 的常规聊天界面里它不会出现,入口先是 ChatGPT Work 和 Codex。本文整理各套餐的开放情况、单价翻倍但按每个任务算可能反过来的价格看法、OpenAI 实际举出的基准测试名单、在 Preparedness Framework 中首次达到“Critical”的网络安全能力以及围绕它划的那条线、迁移时会坏的4点(去掉采样类参数、改用 Responses API、废除 none 这一档推理强度、缓存设置改名),以及与 Claude Opus 5、Fable 5.1、Gemini 3.8 Flash 的比较,全部只写能用一手信息确认的范围。文中也写清楚了,为什么不刊登流传中的“Astra 74.1% 对 Opus 5 96%”那类比较表。

Claude 的 Dispatch——手机怎样驱动你自己的电脑,这又有多安全

Claude 的 Dispatch——手机怎样驱动你自己的电脑,这又有多安全

Dispatch 是这样一个功能:你从手机发出指令,Claude 在你自己的电脑上把这件事做完(测试版,Pro 与 Max)。它不在云端运行,动起来的是你的真实机器,而这一个事实同时决定了它的价值和它的危险。官方帮助写道,你可以从手机给 Claude 发消息、让它在你的桌面电脑上干活,用的是你已经在 Cowork 里配置好的那些连接器、插件和文件访问权限,整件事被 Anthropic 定位成一段从任意一端都能接上的连续对话。运行它要求电脑处于唤醒状态且桌面应用是打开的;电脑操作只支持 macOS 与 Windows,Linux 上没有电脑操作。机制上它沿着三级优先顺序往下走:有连接器就用连接器,没有就驱动浏览器,直接操作屏幕是最后手段,过程中还会截屏以看懂显示的内容。真正的评估从这里开始。会停下来的地方是设计出来的:电脑操作默认关闭,需要在设置的通用一栏里启用;每遇到一个新应用都会请求许可;永久删除文件需要显式许可;投资与交易平台以及加密货币类应用默认就在禁区之内。但也有不会停下来的地方。已批准应用内部的每一次具体操作都不会跟你确认,官方的措辞是 Claude 直接在你的屏幕上点击、输入和跳转,不经过约束其他 Cowork 工具的那套权限检查。文档还补充说,Claude 与你屏幕上的东西之间不存在沙箱,并且在一个应用里做出的操作可能影响到别的应用。最大的风险是提示注入,Anthropic 自己的说法是:网页内容是提示注入攻击的主要途径;一条被操纵的指令、一条意料之外的命令,或者在你浏览器里打开的一个钓鱼链接,都可能连锁引发难以撤销、甚至无法撤销的操作。Anthropic 表示它会扫描模型的激活值来识别这类行为,但那只是把概率压低,并不能替你省掉自己划一条线,指引里仍然要求凡是碰到敏感文件、账户或站点的任务都切到手动审批。Anthropic 把边界写得很明确:不要把电脑操作的权限授予银行、医疗、政务这类敏感应用,并避免用它处理金融账户、法律文件、医疗信息和个人数据。文章还讨论了手机这一侧。手机丢了,漏出去的不是存在手机里的数据,而是能给你的电脑下命令的资格,以及那段还在继续的对话的内容——而 Dispatch 的官方帮助并没有说明如何解除设备配对或设备丢失后怎么办,所以应对手段来自账户那一侧:在设置的账户一栏的活动会话里终止那一个会话;在 claude.ai 上一次性登出所有会话(这个功能在手机应用里不可用,因此需要网页浏览器);或者干脆掐掉电脑那一侧,关掉桌面应用或让机器睡眠,这其实是最快的,因为 Dispatch 需要电脑唤醒且应用打开。最后文章把 Dispatch 与电脑操作区分成两个各自独立的开关,把两者都和 Claude Code 的 agent view(官方文档同样称其操作为 dispatch)区分开来,并划出一条实用的界线:从你能收得回来的工作开始。

Claude Code 的 agent view——会话如何并行运行,隔离又在哪里漏了

Claude Code 的 agent view——会话如何并行运行,隔离又在哪里漏了

Claude Code 的 agent view 用 claude agents 打开,是一个让你在后台一个接一个启动彼此独立的会话、并在同一块屏幕上管理它们的功能。官方文档把你在那里执行的操作叫作 dispatch,而桌面应用里恰好还有一个同名的独立功能,所以第一件事就是把两者分清楚。文档把 agent view 描述成让你从一块屏幕上调度并管理多个 Claude Code 会话的功能,它属于研究预览,需要 v2.1.139 及以上版本。本文只谈机制与安全模型。第一个意外之处是:你在输入框里打的每一个提示词,都会启动它自己的一个新会话——再打一条,得到的是旁边多出来的第二个会话,而不是给第一个补的一句话。要追加指令,得走用 Space 打开的预览面板,它显示的是最近的输出或者会话正在等的那个问题,而不是完整记录。安全模型的核心是用 worktree 做隔离。在编辑任何文件之前,后台会话会先搬进 .claude/worktrees/ 下一个隔离的 git worktree,于是并行的会话读的是同一份检出,但各自写进自己的那一份——读是共享的,写是分开的。任何会触及主检出的动作都被三道检查切断:通过 Edit、Write、NotebookEdit 进行的文件编辑;工作目录会解析到主检出、或者无法核实其确实待在外面的命令;以及试图用 git -C、--git-dir、GIT_DIR、GIT_WORK_TREE 或在 git 之前先 cd 来把 git 指向别处的做法。判断刻意偏向安全一侧,核实不了的就不放行,而且同样的保护会被会话派生的每一个子智能体继承。不过它并不是操作系统层面的墙:仓库之外的文件和网络都不在范围内,PowerShell 命令也只享有工作目录那一道检查。权限同样不是在调度时当场选的,而是继承自那个目录的 defaultMode,或者继承自被调度的子智能体 frontmatter 里的 permissionMode——这意味着你平时的配置越松,一次就会造出越多无人看管、权限宽松的会话。随后有三样东西会漏出隔离之外。选了“是,以后别再问我”,这条规则会被存进主检出的 .claude/settings.local.json,于是它在主检出和其他每一个 worktree 里都生效,并且在它诞生的那个 worktree 被删掉之后依然留着。在 agent view 里删除会话,会把 Claude 创建的 worktree 一并删掉,未提交的成果随之消失——而 Ctrl+X 第一下是停止,第二下就是删除。还有 .worktreeinclude,它会把 .env 这类被 gitignore 的文件复制进每一个新 worktree,让你的凭据按调度出去的会话数成倍增加。除此之外,配额是随并行度成比例消耗的(十个智能体大约快十倍),会话跑在本地,能挺过睡眠但机器关机就停。文章最后把 agent view 放回官方给出的四种并行做法里,与子智能体、智能体团队和动态工作流并列,并给出调度之前、进行中和结束之后的一套具体流程。

ChatGPT Work 是什么与用法?GPT-5.6 工作智能体详解

ChatGPT Work 是什么与用法?GPT-5.6 工作智能体详解

ChatGPT Work 是 OpenAI 在 2026 年 7 月 9 日随 GPT-5.6 一同发布的“工作用 AI 智能体”。与只会回答的普通聊天不同,它从你已连接的应用和文件中收集上下文,做出文档、表格、幻灯片乃至 Web 应用这类完整成品。它的大脑是新旗舰 GPT-5.6 Sol(基于 Codex),能把一个复杂项目拆解成步骤并连续工作数小时(Thurrott)。在统一的桌面应用内,三种模式同居——Work(成品)、Codex(技术,展示细节)和普通对话(交谈)——其中 Work 被定位为隐藏了 Codex 技术细节的“业务版”(9to5Mac)。模型取决于套餐:Free/Go 默认用 Terra,而 Plus/Pro/Business/Enterprise 从 Sol/Terra/Luna 中选(基于报道)。它的强项在于通过 Google Drive、SharePoint、Slack 等连接器加上 MCP 把“你的上下文”拉进来——对企业而言,数据默认不用于训练。本文综合 Axios、TechCrunch、9to5Mac、Thurrott 和 OpenAI,梳理 ChatGPT Work 是什么、与普通 ChatGPT 及 Codex 有何不同、哪些套餐能用、能连接哪些应用——并对尚未官方确认的内容标注可信度。

GPT-5.6 Sol vs Gemini 3.1 Pro 全面对比:智能体编码 vs 原生多模态

GPT-5.6 Sol vs Gemini 3.1 Pro 全面对比:智能体编码 vs 原生多模态

OpenAI 旗舰 GPT-5.6“Sol”与 Google Gemini 的对决,是一场强项几乎不重叠的比拼:Sol 在终端·智能体编码上压倒性领先,Gemini 则以原生多模态(语音·视频)、约半价的价格以及 MMLU/ARC-AGI-2/WebDev Arena 抗衡。需要注意时态陷阱——Google 真正的对手 Gemini 3.5 Pro 在本文时点尚未发布(预计7月中旬 GA),因此公正的比较对象是现行旗舰 Gemini 3.1 Pro。本文依据官方发布与独立基准,梳理两者的实力、价格、多模态以及按场景的选择方式。

GPT-5.6 vs GPT-5.5 深度对比——三款模型体系与四成单价的 Terra 该如何迁移

GPT-5.6 vs GPT-5.5 深度对比——三款模型体系与四成单价的 Terra 该如何迁移

GPT-5.5 发布仅两个半月后,OpenAI 便推出了 GPT-5.6,最大的变化并非单纯提速,而是从单一旗舰重组为 Luna / Terra / Sol 三款模型体系。其中中位的 Terra 以远低于 GPT-5.5 的价格提供同级质量:发布时为半价,2026年7月30日降价后更降至 GPT-5.5 的四成单价($2/$12),成为多数现有工作负载的实质后继;最高端的 Sol 则在同价 $5/$30 下把 SWE-Bench Pro 从 58.6% 提升到约 64.6%(估算)。本文基于官方发布与独立分析,梳理规格差异、基准提升、新增功能与实际成本,并给出“先降到 Terra 把账单降六成、只把需要性能的处理升到 Sol”的两段式迁移建议。

GPT-5.6 Sol vs Claude Fable 5 深度对比——基准测试·长时间自主·价格·选择方法

GPT-5.6 Sol vs Claude Fable 5 深度对比——基准测试·长时间自主·价格·选择方法

深度对比 OpenAI 最高端 GPT-5.6 Sol(7月9日)与 Anthropic 定位为“面向公众发布的史上最强”的 Claude Fable 5(6月9日)。与 Opus 4.8 那种同价位段的正面对决不同,这一次的主题是“半价全能型 Sol($5/$30)”对“贵一倍但为顶级的 Fable 5($10/$50)”这一成本与实力的权衡。在生产级实战编码的 SWE-Bench Pro 上,Fable 5 以80.3%把 Sol 的64.6%(估算)甩开15pt以上,差距比对阵 Opus 4.8 时更大。此外 Fable 5 能专注于数百万 token 连续自主运行最长12小时,Stripe 在一天内完成5000万行 Ruby 迁移的“完赛能力”是其看家本领。另一方面,Sol 在终端操作的 TerminalBench 2.1(88.8% vs Fable 86.0%)、Agents' Last Exam(53.6 vs 40.5)、Coding Agent Index(80 vs 77.2)上居首位,且凭半价+token 效率+54%在性价比上更强。本文将从规格速览表、基准详情、OpenAI 未公布 Sol 的 SWE-bench Pro 的“未公开基准问题”、长时间自主、实际成本(以每完成一项任务来看)、强项弱项地图,到按使用场景的选择方法,基于官方与独立基准逐一梳理。

GPT-5.6 Sol vs Claude Opus 4.8:基准测试、编程、价格与选择的深度对比

GPT-5.6 Sol vs Claude Opus 4.8:基准测试、编程、价格与选择的深度对比

对 2026 年两大 AI 编程巨头的深度对比:Claude Opus 4.8(5 月 28 日)与 GPT-5.6 的最高端 Sol(7 月 9 日)。两者擅长领域几乎相反:Sol 在终端操作与智能体综合能力上领先(TerminalBench 2.1 88.8% vs Opus 78.9%、Agents' Last Exam 53.6、Coding Agent Index 80),而 Opus 4.8 在生产级编程、数学与长上下文上领先(SWE-bench Pro 69.2% vs Sol 64.6%、USAMO 2026 96.7%、GraphWalks 1M 68.1%),并突出诚实性(过度自信降至十分之一、无批判报告缺陷结果 0%)。此外 OpenAI 大量未公布 Sol 的基准(SWE-bench Pro、GPQA、AIME、MMLU),因此在编程的核心阵地上,已披露的 Opus 更占优势。本文涵盖规格速览表、基准详细、未公开基准问题、实际成本($25 vs $30 单价与 +54% token 效率)、优势/劣势地图、按场景选择,以及双供应商策略。

GPT-5.6 发布完全解读——Luna/Terra/Sol 三款模型、基准测试、价格与对比 Claude

GPT-5.6 发布完全解读——Luna/Terra/Sol 三款模型、基准测试、价格与对比 Claude

OpenAI 于 2026年7月9日正式向公众开放 GPT-5.6,以三模型阵容取代旧的“基础版+Pro”结构:Luna(高速·低成本,$0.20/$1.20)、Terra(均衡,$2/$12,以 Sol 四成的单价达到 GPT-5.5 水准)、Sol(旗舰,$5/$30)(价格为 2026年7月30日修订后)。Sol 在 Agents' Last Exam(53.6)和 Coding Agent Index(80)上位居首位,TerminalBench 2.1 的 88.8% 也略微超过 Claude Fable 5(86.0%)——然而在生产级实战的 SWE-Bench Pro 上,Claude Fable 5 以 80.0% 对 Sol 的 64.6% 明显领先。本文基于 OpenAI 官方公告与独立基准测试,讲解三款模型的区别、价格、基准测试、新功能(Programmatic Tool Calling、ChatGPT Work、全双工语音模型 GPT-Live)、按 ChatGPT 套餐的提供情况、与 Claude(Fable 5 / Opus 4.8)的对比,以及如何按用途选择。