跳到内容
主题

AI代理与自动化:RAG、工作流与实战指南

理解AI代理、RAG和自动化工作流。从概念到实际应用和实施指南。

50 篇文章

排序文章以找到您需要的内容

AI代理与自动化 分类下的文章

什么是规格驱动开发(SDD)?四个步骤、主要工具,以及它与 vibe coding 的区别

什么是规格驱动开发(SDD)?四个步骤、主要工具,以及它与 vibe coding 的区别

在 AI 代写代码的时代,更具价值的技能正从“写代码”转向“写规格”,而象征这一趋势的实践正是规格驱动开发(SDD)。SDD 把规格当作项目的中心文档与“正本”,由 AI 智能体据此推导设计、拆解与实现,而非一上来就写代码;其关键在于每一步都留下一份文档(多为 Markdown)供下一步读取。本篇初学者指南讲解:SDD 是什么(规格为正本,代码是派生物);为何现在需要它(它在设计阶段就防止 vibe coding 那道由技术债与需求漂移构成的“三个月之墙”——GitHub 报告称“从零重做”的次数减少了大约一个数量级);基本的四个步骤(Specify → Plan → Tasks → Implement);主要工具(拥有 9 万以上星标、支持 30 多种智能体的 GitHub Spec Kit,走 Requirements → Design → Tasks 流程并配备 Auto 路由器的 AWS Kiro,以及 BMAD、OpenSpec、Tessl、Google Antigravity 与 Cursor);如何与 vibe coding 搭配取舍(混合方式:探索用 vibe,交付用规格驱动,且人工审查必不可少);以及如何从今天开始尝试。在 AI 时代,脱颖而出的不是写代码最快的人,而是能精确定义要做什么的人。

什么是上下文工程?提示词之后的下一项技能,以及如何战胜“context rot”

什么是上下文工程?提示词之后的下一项技能,以及如何战胜“context rot”

用好 AI 的技术重心,正在从提示词工程转向上下文工程。借用 Anthropic 的定义,上下文工程是“在推理过程中,对交给模型的最优 tokens(信息)集合进行筛选与维护的一整套策略”——它涵盖的不只是提示词,而是上下文窗口里的一切:系统提示词、工具、对话历史以及外部数据。它之所以重要,是因为存在“context rot(上下文腐化)”:你加入的 tokens 越多,准确率反而越下降。Chroma 在 2025 年测试了 18 个主流模型(GPT、Claude、Gemini 等),结果无一例外都随输入变长而退化,长上下文中间位置的信息尤其容易被忽略(lost in the middle)。这篇面向初学者的指南讲解了什么是上下文工程、它与提示词工程的关系、context rot 为何发生(注意力是一笔有限的预算)、上下文里到底装了什么、六大核心技巧(合适高度的指令、精选工具、即时检索、压缩/摘要压缩、外部记忆笔记,以及子智能体隔离)、它与 RAG 和 Claude Skills 的关系,还有今天就能用上的习惯,例如话题变了就开新会话、只粘贴要点。核心理念是:只保留最精简、信号最强的 tokens。

什么是 Claude Skills(Agent Skills)?工作原理、制作方法,以及它与 MCP 有何不同

什么是 Claude Skills(Agent Skills)?工作原理、制作方法,以及它与 MCP 有何不同

一篇面向初学者的 Claude Skills(Agent Skills)入门指南——这套机制让你彻底告别反复向 Claude 解释同样步骤的麻烦。技能把指令、脚本和参考资料打包进一个文件夹,核心是一份记录着 name、description 和操作步骤的 SKILL.md 文件。大多数时候 Claude 只读取每个技能的简短说明,只有当你的请求与之匹配时才展开正文——这种设计被称为渐进式披露,即便装了几十个技能也能让上下文保持轻量。本文涵盖:Skills 是什么、为何重要(不必再粘贴提示词)、如何编写 SKILL.md 与最小文件夹结构、如何动手制作(用官方 skill-creator 或手动搭建,放进 .claude/skills,2026 年 1 月起改动可即时生效)、Skills 与 MCP(连通性)和子智能体(上下文隔离)的区别,以及这套开放标准如何在 Claude 应用、Claude Code、API 和 Agent SDK 之外,被 Codex CLI、Cursor、Gemini CLI 和 GitHub Copilot 采纳,还有文档生成、落实内部规范等具体用途。该功能由 Anthropic 于 2025 年 10 月 16 日发布,被 Simon Willison 称为“也许比 MCP 更重要”。

AI 操作浏览器到底能自动化到哪一步?填表单、预订与调研的现实

AI 操作浏览器到底能自动化到哪一步?填表单、预订与调研的现实

“我让 AI 帮忙,它就打开浏览器自己查资料,连表单都帮我填好了。”在 2026 年,这已不再是演示桥段:ChatGPT Atlas、Claude for Chrome、Gemini/Chrome、Perplexity Comet 等智能体型浏览器集中涌现。那么它们到底能自动化到什么程度?现实清晰地分成三个层级。(1)调研=已实用:在测试真实网站的 WebVoyager 上头部智能体达到 89-98%,近乎饱和,且出错代价小,应从这里开始放手交托。(2)填表单=能做但要核对:输入本身各家都支持,但可能填错字段或按错提交,因此“AI 起草、人来发送”才安全,Atlas 等许多产品会在重要操作前请求确认。(3)预订/支付=仍需自己来:智能体会栽在 CAPTCHA、复杂 JavaScript 结账、双因素认证与会话管理上,在 WebArena 上即便最好也只有约 47-68%,低于人类约 78% 的基准;OpenAI 关停单体 Operator 正是因为结账不够可靠。文章先梳理两种方式(面向消费者的浏览器/扩展,对面向开发者的 API/OSS),再盘点 2026 年的玩家(Atlas 设计上不可运行代码或读密码;Claude for Chrome 为扩展侧边栏;Google 的 Project Mariner 于 2026/5/4 并入 Gemini/Chrome;Operator 转入 ChatGPT Agent 与 Agents SDK;开源 browser-use 已超 78k 星标),解释让预订失败的四道墙,并深入剖析最大陷阱——间接提示词注入(Comet 曾被证实存在零点击窃取凭据的漏洞并于 2026 年 2 月修复,攻击成功率从防御前 23.6% 降到基础防御约 11%、最强防御约 1%,但仍非零),最后给出五条安全原则。它是出色的调研搭档,但涉及金钱的操作还是自己来。文中数值引自公开资料与公告,仅作趋势参考。

AI智能体10大应用案例——真实业务自动化实例、效果与起步方法

AI智能体10大应用案例——真实业务自动化实例、效果与起步方法

“AI智能体确实很厉害,但我究竟能拿它来做什么?”这是每个人了解基础后立刻碰到的问题。进入2026年,答案不再是未来的事:在客户支持、销售、财务、开发、人力资源等各职能中,智能体已开始真正接手日常工作,一项调查报告显示65%的企业已将某些工作流程自动化。本文跳过抽象论述,给出按职能划分的10个具体应用案例,配真实例子与数据。内容涵盖为何应用案例如今重要(智能体不只回答更会行动,从实验走向生产;Gartner预测到2028年三分之一企业软件将内置智能体功能、到2029年80%支持咨询将在极少人工下解决)、如何识别可自动化的工作(高度重复×大批量×需要判断,判断正是与旧式RPA的区别;重大决策保留给人类,以智能体准备、人类审批为原则)、10个案例(客户支持、销售获客与个性化邮件、市场营销SEO与邮件、软件开发超35%代码由AI生成、IT运维故障检测诊断自动恢复、财务跨ERP计算KPI与带批注PDF报表、实时金融欺诈检测、AMD人力资源解决时间下降80%、调研与数据分析成报告、供应链控制塔),以及投资回报的真实情况(3年3.5x、3–14个月回本、30–60%成本削减,但仅23%规模化,落地是难点)和如何安全起步(选定一项任务、小规模试做、人类审批、衡量并扩展)配最小权限与逐次审批的安全做法。数据引用自调查与企业公告,仅作趋势参考。透过重复、批量、判断重新审视你的工作,从最棘手的任务迈出小小一步。

AI 如何改变软件开发生命周期 (SDLC)——6 个阶段的现状与角色转型

AI 如何改变软件开发生命周期 (SDLC)——6 个阶段的现状与角色转型

系统开发的 6 个阶段——需求、设计、实现、测试、部署、运维——在过去 20 多年里几乎没有变化。在 2025–2026 年,这个流程已被从根本上重写。Gartner 预测,到 2028 年 90% 的企业开发者将使用 AI 编码助手;Cursor 每月节省 18 小时(ROI 36 倍);Claude Code 在 10–180 分钟内完成复杂多文件重构,成功率 89%。本文涵盖 SDLC 时间分配的反转(实现 40 → 10%、需求 10 → 25%、设计 15 → 30%)、各阶段现状与主要工具(Claude Code、Cursor、Copilot、v0、Bolt)、Lightrun 2026 的质量问题(43% 的 AI 生成变更需生产环境调试)、Waterfall → Agile → AI-Native 的世代更替、7 种角色转型(PM、设计师、初级 PG、资深 PG、QA、SRE、tech lead),以及 AI 主导 SDLC 的 3 大陷阱(质量脆弱、初级培养崩塌、隐性知识流失)与对策——全部基于 2026 年 5 月的事实。“只有编码能力的工程师”是 2027 年起最大的职业地雷。

什么是 Forward Deployed Engineer(FDE)?OpenAI、Anthropic 和 Google 争抢的岗位

什么是 Forward Deployed Engineer(FDE)?OpenAI、Anthropic 和 Google 争抢的岗位

在 2025 年,有一个岗位的招聘发布数量出现了惊人的同比增长 1,165%:那就是 FDE——Forward Deployed Engineer(前线部署工程师)。为什么一个 Palantir 历经约 20 年体系化的、默默无闻的岗位,会在 2026 年突然成为“最热门的头衔”?FDE 是“把自己公司的产品带进客户现场,并亲自端到端负责观察、设计、实现、运营与产品反馈的工程师”。生成式 AI 带有一段“演示能用、但在现场不灵”的最后一公里,而 FDE 正是用人手来打通它的岗位。本文将结合 2026 年 5 月的最新数据,介绍其定义、为何这一岗位在 2026 年爆发(OpenAI、Anthropic 和 Google 的招聘热潮)、5 阶段工作循环、薪酬与职业(Palantir 平均 23.8 万美元,staff 级别超过 63 万美元)、与 SE / IT 咨询顾问 / Applied AI Engineer 的区别、谁适合谁不适合,以及如何从零经验走上这条路。

从 Claude Code / Cursor 自动部署到 Vercel——Vercel Agent Skills 时代的三种工作流

从 Claude Code / Cursor 自动部署到 Vercel——Vercel Agent Skills 时代的三种工作流

“Claude Code 改完了文件——现在切到终端,git push,再切到浏览器,打开 Vercel 控制台……”在 2025 年这就是常态。到了 2026 年 5 月,Vercel 正式推出了 Agent Skills(基于 MCP)和 Claude Code 插件,Cursor 也只需要一份 .cursor/mcp.json 就能接入。“改代码 → 构建 → 部署 → 看 preview URL → 改 env → 回滚”全部在 AI Agent 内完成,“切到浏览器”这道税没有了。2026 年的现实是把三种方案混搭使用:(1) 极简(git push → 60–90 秒自动部署)对单人开发够用;(2) MCP-Direct(Vercel Agent Skills)让 Cursor / Claude Code 直接调用 vercel deploy,最适合每天在多个环境之间切换的开发者;(3) GitHub Actions + Claude Code Action 让团队实现“在 PR 里 @claude → AI 自动修复 + 重新部署 preview”,非常适合 review 文化重的团队。最大的雷区:env 泄漏与“AI 自动部署 → 成本爆炸”。防御措施是 spending limit + 限制 preview 部署 + 前置 Cloudflare 代理。本文涵盖三种实现、preview 策略(A/B 对比、永久 staging、客户验收)、四个坑(env 泄漏、成本爆炸、PR 冲突、漏回滚)以及 FAQ——全部基于 2026 年 5 月的可运行代码。

Vercel AI SDK 完全指南——OpenAI / Anthropic / Gemini 统一 API

Vercel AI SDK 完全指南——OpenAI / Anthropic / Gemini 统一 API

我用 OpenAI API 上线了,但也想试试 Claude 和 Gemini——结果你花两小时把同一套逻辑在三个不同的 SDK 之间重写,手动转换请求和响应格式。Vercel AI SDK(2026 年起简称 AI SDK)把这件事压缩成“一次 import、一个函数、所有 provider”:TypeScript 开源库,月下载量超 2000 万;AI SDK 6 自带 Agents、MCP、tool approval 和 DevTools,截至 2026 年 5 月已是统一 LLM 接口的事实标准。2026 年从 Web 应用或 Node.js 项目调 LLM,AI SDK 就是默认正解:轻松切换、1/3 实现量、类型安全、React 集成全都拿到。真正的价值在于摆脱厂商锁定——OpenAI 涨价就三行切到 Anthropic,Gemini 出新模型在同一处试一下,全部在同一份代码里。本文涵盖 AI SDK 是什么、三个实战理由(自由切换、1/3 代码、Zod 类型安全)、5 分钟跑起来(generateText → streamText)、用 generateObject 拿到类型安全 JSON、AI SDK 6 的 tool calling 与 Agents(tools + stopWhen、ToolLoopAgent、MCP 集成)、用 useChat 10 行集成 React、Provider 切换(OpenAI/Anthropic/Google/Mistral/xAI/兼容接口)一行搞定,以及生产环境必踩的三个坑:provider 特性差异、流中断仍计费、Zod 类型推断爆炸。

生成式 AI 能搞定基础设施与环境搭建吗?——初学者的“该委托到哪里”指南

生成式 AI 能搞定基础设施与环境搭建吗?——初学者的“该委托到哪里”指南

环境搭建是每个编程初学者都会卡住的地方。2026 年,生成式 AI(Claude Code、Codex、Cursor)在例行基础设施工作上已经真正可用——本地环境搭建、Dockerfile 生成、Terraform 草稿、CI/CD 流水线。HashiCorp 在 2026 年发布了官方 Terraform MCP Server,Anthropic 推出了 Agent Skills,让基础设施领域的专业知识可以按需加载。但“全权委托”是另一个问题:一个开放给 0.0.0.0/0 的安全组、一把被提交到 GitHub 的 SSH 密钥、月底 3,000 美元的 AWS 账单——这些都是 2026 年的真实事故。本文划分出五个可以安全委托的领域、三个“先核验再信任”的风险区、四个必须由人负责的领域、一套适合初学者的四步安全工作流,以及最新的 2026 年工具(Claude Code、MCP、Agent Skills)——聚焦能力评估,而非职业影响。

什么是 Cursor——AI 编辑器的用法与和 VS Code 的差异

什么是 Cursor——AI 编辑器的用法与和 VS Code 的差异

2026 年 2 月,Cursor 的开发公司 Anysphere 突破 20 亿美元 ARR,仅用三年就画出与 OpenAI、Anthropic 同级别的 SaaS 收入曲线。本文讲解 Cursor 如何通过把 AI 直接嵌入渲染层(100 毫秒以内的 Tab 补全、27.2 万 token 代码库索引、6 大核心功能:Tab / Inline Edit / Composer / Agent / Background Agents / Bugbot)与 VS Code 拉开差距,列出与 VS Code 的 5 大具体差异,并与四大对手(Windsurf / Zed / Claude Code / GitHub Copilot)逐项对比,介绍 Hobby 免费 / Pro 20 美元 / Business 40 美元的价格结构,并给出“谁应该真正切换”的决策指南——全部基于 2026 年 5 月的事实。

MCP server 能变现吗——12,000 个 server 中只有 5% 在赚钱的真相与实操手册

MCP server 能变现吗——12,000 个 server 中只有 5% 在赚钱的真相与实操手册

2025 年夏天,一位个人开发者发布的 MCP server“21st.dev”零营销预算 6 周做到了 $10K MRR。同期另一位在 Apify Store 上线 MCP server 的开发者月入 $2,000——比此前别处 $500 的天花板翻了 4 倍。那么 MCP 究竟能不能变现?答案是“能,但 95% 会失败”。截至 2026 年 3 月公开的 12,000 多个 MCP server 中,成功变现的不到 5%,剩下的 95% 都躺在“有用但免费”的坟场里。本文用行业研究和真实数字摆出来:赢家与输家的分水岭、4 种收入模型(订阅分级 / 按用量计费 / API key 模型 / 免费增值 + 付费档)、主流市场平台的真实情况(MCPize 85% 分成 / Apify / Glama / Smithery 创作者付费 / 自建站 + Stripe)、95% 失败的 6 种模式,以及个人开发者现在该用的 6 步实操手册。开门见山:做 MCP,怎么卖比怎么造重要得多。