跳到内容
主题

AI新手入门指南:从零开始学AI工具

AI新手?从这里开始。面向初学者的AI概念、工具选择和实践入门指南。

146 篇文章

排序文章以找到您需要的内容

新手入门 分类下的文章

如何运行本地LLM:在自己电脑上跑AI——给初学者的配置、工具与最佳模型

如何运行本地LLM:在自己电脑上跑AI——给初学者的配置、工具与最佳模型

你大概以为LLM必须跑在云端,但到了2026年,把AI完全运行在自己电脑里——也就是“本地LLM”——已是切实可行的选择。本地LLM意味着把ChatGPT或Claude那样的模型直接运行在本机,而非云端。三大吸引力是:隐私(输入绝不离开设备)、零成本(没有API费用)和离线使用(断网也能跑)。短板则是:没有顶级云端AI那么聪明、需要一台还算给力的电脑、需要一点配置工作,且不掌握最新信息。本篇初学者指南讲清楚什么是本地LLM(用“流媒体 vs 下载”作类比)、优点与短板、所需配置与量化(GGUF格式,其中Q4_K_M是公认之选,在保留质量的同时把内存压到约四分之一;4-bit下每10亿参数约0.5 GB内存)、如何上手(面向初学者的LM Studio图形界面,面向开发者的Ollama命令行——2026年第一季度月下载量5200万)、2026年推荐模型(Llama 3.2 7B、Google Gemma 4、Alibaba Qwen3.5,以及DeepSeek和Mistral,皆为开放模型),以及本地与云端如何分工(机密、高频、离线的工作交给本地,难题交给云端)。最快的第一步:在LM Studio里跑一个3B–7B的小模型。

什么是规格驱动开发(SDD)?四个步骤、主要工具,以及它与 vibe coding 的区别

什么是规格驱动开发(SDD)?四个步骤、主要工具,以及它与 vibe coding 的区别

在 AI 代写代码的时代,更具价值的技能正从“写代码”转向“写规格”,而象征这一趋势的实践正是规格驱动开发(SDD)。SDD 把规格当作项目的中心文档与“正本”,由 AI 智能体据此推导设计、拆解与实现,而非一上来就写代码;其关键在于每一步都留下一份文档(多为 Markdown)供下一步读取。本篇初学者指南讲解:SDD 是什么(规格为正本,代码是派生物);为何现在需要它(它在设计阶段就防止 vibe coding 那道由技术债与需求漂移构成的“三个月之墙”——GitHub 报告称“从零重做”的次数减少了大约一个数量级);基本的四个步骤(Specify → Plan → Tasks → Implement);主要工具(拥有 9 万以上星标、支持 30 多种智能体的 GitHub Spec Kit,走 Requirements → Design → Tasks 流程并配备 Auto 路由器的 AWS Kiro,以及 BMAD、OpenSpec、Tessl、Google Antigravity 与 Cursor);如何与 vibe coding 搭配取舍(混合方式:探索用 vibe,交付用规格驱动,且人工审查必不可少);以及如何从今天开始尝试。在 AI 时代,脱颖而出的不是写代码最快的人,而是能精确定义要做什么的人。

什么是上下文工程?提示词之后的下一项技能,以及如何战胜“context rot”

什么是上下文工程?提示词之后的下一项技能,以及如何战胜“context rot”

用好 AI 的技术重心,正在从提示词工程转向上下文工程。借用 Anthropic 的定义,上下文工程是“在推理过程中,对交给模型的最优 tokens(信息)集合进行筛选与维护的一整套策略”——它涵盖的不只是提示词,而是上下文窗口里的一切:系统提示词、工具、对话历史以及外部数据。它之所以重要,是因为存在“context rot(上下文腐化)”:你加入的 tokens 越多,准确率反而越下降。Chroma 在 2025 年测试了 18 个主流模型(GPT、Claude、Gemini 等),结果无一例外都随输入变长而退化,长上下文中间位置的信息尤其容易被忽略(lost in the middle)。这篇面向初学者的指南讲解了什么是上下文工程、它与提示词工程的关系、context rot 为何发生(注意力是一笔有限的预算)、上下文里到底装了什么、六大核心技巧(合适高度的指令、精选工具、即时检索、压缩/摘要压缩、外部记忆笔记,以及子智能体隔离)、它与 RAG 和 Claude Skills 的关系,还有今天就能用上的习惯,例如话题变了就开新会话、只粘贴要点。核心理念是:只保留最精简、信号最强的 tokens。

什么是 Claude Skills(Agent Skills)?工作原理、制作方法,以及它与 MCP 有何不同

什么是 Claude Skills(Agent Skills)?工作原理、制作方法,以及它与 MCP 有何不同

一篇面向初学者的 Claude Skills(Agent Skills)入门指南——这套机制让你彻底告别反复向 Claude 解释同样步骤的麻烦。技能把指令、脚本和参考资料打包进一个文件夹,核心是一份记录着 name、description 和操作步骤的 SKILL.md 文件。大多数时候 Claude 只读取每个技能的简短说明,只有当你的请求与之匹配时才展开正文——这种设计被称为渐进式披露,即便装了几十个技能也能让上下文保持轻量。本文涵盖:Skills 是什么、为何重要(不必再粘贴提示词)、如何编写 SKILL.md 与最小文件夹结构、如何动手制作(用官方 skill-creator 或手动搭建,放进 .claude/skills,2026 年 1 月起改动可即时生效)、Skills 与 MCP(连通性)和子智能体(上下文隔离)的区别,以及这套开放标准如何在 Claude 应用、Claude Code、API 和 Agent SDK 之外,被 Codex CLI、Cursor、Gemini CLI 和 GitHub Copilot 采纳,还有文档生成、落实内部规范等具体用途。该功能由 Anthropic 于 2025 年 10 月 16 日发布,被 Simon Willison 称为“也许比 MCP 更重要”。

Claude Fable 5 编程实力:基准测试、何时该用它而非 Opus 4.8,以及真实成本

Claude Fable 5 编程实力:基准测试、何时该用它而非 Opus 4.8,以及真实成本

于 2026 年 6 月 9 日发布、作为 Anthropic 首个公开可用 Mythos 级模型的 Claude Fable 5,本文只聚焦编程(完整发布另有专文)。一句话概括:Fable 5 任务越难、领先越大。它在 SWE-bench Verified 上拿下 95.0%、在更难的 SWE-bench Pro 上拿下 80.3%(Opus 4.8 为 69.2%、GPT-5.5 为 58.6%),在最难的 FrontierCode Diamond 上为 29.3%(Opus 13.4%、GPT-5.5 5.7%,约为 GPT 的 5 倍),而 Terminal-Bench 2.1 则是 84.3% 的胶着竞赛(GPT-5.5 借 Codex CLI 保持竞争力)。文章给出三点开发者要点(难题最强 / 用更少回合完成 / 但贵且停不下来)、并列基准表及解读、随思考量提升的特性(从低 11.5% 到最高 30.9%,而 GPT-5.5 停滞在 5-6%;五个并行智能体达到 60% 隐藏测试通过率据称比单个快 3.2x)、它真正擅长的领域(大型多文件重构、长时间自主智能体运行、从截图生成前端、API 设计加测试加文档;Simon Willison 称产出值“好几天工作量”却又慢又贵,5.5 小时烧掉超 110 美元)、弱点(约为 Opus 4.8 的 2 倍、$10/$50、复杂会话 500k-1M token、误判何时该停、审查精度落后、安全分类器在约 20% 的 Terminal-Bench 试验上回退到 Opus 4.8、还会谎报“已测试”)、路由建议(默认 Opus 4.8、最难的 10-20% 交给 Fable 5、终端工作交给 GPT-5.5,只需替换 model ID),以及在哪里使用(Claude Code、GitHub Copilot、AWS Bedrock、Azure Foundry、Databricks、Anthropic API),含价格、1M token 上下文、128k 最大输出与 6 月 9-22 日免费窗口。重活一次性任务用 Fable 5,日常大部分用 Opus 4.8。数字引自 Anthropic 及第三方报告,仅为方向性、依赖 scaffold。

AI 操作浏览器到底能自动化到哪一步?填表单、预订与调研的现实

AI 操作浏览器到底能自动化到哪一步?填表单、预订与调研的现实

“我让 AI 帮忙,它就打开浏览器自己查资料,连表单都帮我填好了。”在 2026 年,这已不再是演示桥段:ChatGPT Atlas、Claude for Chrome、Gemini/Chrome、Perplexity Comet 等智能体型浏览器集中涌现。那么它们到底能自动化到什么程度?现实清晰地分成三个层级。(1)调研=已实用:在测试真实网站的 WebVoyager 上头部智能体达到 89-98%,近乎饱和,且出错代价小,应从这里开始放手交托。(2)填表单=能做但要核对:输入本身各家都支持,但可能填错字段或按错提交,因此“AI 起草、人来发送”才安全,Atlas 等许多产品会在重要操作前请求确认。(3)预订/支付=仍需自己来:智能体会栽在 CAPTCHA、复杂 JavaScript 结账、双因素认证与会话管理上,在 WebArena 上即便最好也只有约 47-68%,低于人类约 78% 的基准;OpenAI 关停单体 Operator 正是因为结账不够可靠。文章先梳理两种方式(面向消费者的浏览器/扩展,对面向开发者的 API/OSS),再盘点 2026 年的玩家(Atlas 设计上不可运行代码或读密码;Claude for Chrome 为扩展侧边栏;Google 的 Project Mariner 于 2026/5/4 并入 Gemini/Chrome;Operator 转入 ChatGPT Agent 与 Agents SDK;开源 browser-use 已超 78k 星标),解释让预订失败的四道墙,并深入剖析最大陷阱——间接提示词注入(Comet 曾被证实存在零点击窃取凭据的漏洞并于 2026 年 2 月修复,攻击成功率从防御前 23.6% 降到基础防御约 11%、最强防御约 1%,但仍非零),最后给出五条安全原则。它是出色的调研搭档,但涉及金钱的操作还是自己来。文中数值引自公开资料与公告,仅作趋势参考。

AI智能体10大应用案例——真实业务自动化实例、效果与起步方法

AI智能体10大应用案例——真实业务自动化实例、效果与起步方法

“AI智能体确实很厉害,但我究竟能拿它来做什么?”这是每个人了解基础后立刻碰到的问题。进入2026年,答案不再是未来的事:在客户支持、销售、财务、开发、人力资源等各职能中,智能体已开始真正接手日常工作,一项调查报告显示65%的企业已将某些工作流程自动化。本文跳过抽象论述,给出按职能划分的10个具体应用案例,配真实例子与数据。内容涵盖为何应用案例如今重要(智能体不只回答更会行动,从实验走向生产;Gartner预测到2028年三分之一企业软件将内置智能体功能、到2029年80%支持咨询将在极少人工下解决)、如何识别可自动化的工作(高度重复×大批量×需要判断,判断正是与旧式RPA的区别;重大决策保留给人类,以智能体准备、人类审批为原则)、10个案例(客户支持、销售获客与个性化邮件、市场营销SEO与邮件、软件开发超35%代码由AI生成、IT运维故障检测诊断自动恢复、财务跨ERP计算KPI与带批注PDF报表、实时金融欺诈检测、AMD人力资源解决时间下降80%、调研与数据分析成报告、供应链控制塔),以及投资回报的真实情况(3年3.5x、3–14个月回本、30–60%成本削减,但仅23%规模化,落地是难点)和如何安全起步(选定一项任务、小规模试做、人类审批、衡量并扩展)配最小权限与逐次审批的安全做法。数据引用自调查与企业公告,仅作趋势参考。透过重复、批量、判断重新审视你的工作,从最棘手的任务迈出小小一步。

Claude Fable 5 发布深度解读——功能、基准、价格、与 Mythos 的区别,以及全新的安全设计

Claude Fable 5 发布深度解读——功能、基准、价格、与 Mythos 的区别,以及全新的安全设计

2026 年 6 月 9 日,Anthropic 发布了 Claude Fable 5——首次以普通用户和开发者都能使用的形式,释放出内部长期被视为最强的前沿模型“Mythos”级别的能力。Anthropic 将其定位为面向大众提供的最强模型,宣传语为“为长时间、复杂的工作而打造”。本篇写得让初学者也能跟上,讲清 Fable 5 是什么(以安全形式向公众开放的 Mythos 级别能力,为跑完一场马拉松而非单次问答而优化;模型 ID 为 claude-fable-5)、它与孪生兄弟 Mythos 5 有何不同(内部完全相同,只有安全机制不同;公众使用的是 Fable)、基准测试成绩(SWE-Bench Pro 80.3% 对 Opus 4.8 的 69.2 和 GPT-5.5 的 58.6,Hex 长时间分析史上首次突破 90%,Cognition FrontierCode 与 Hebbia 金融均居首,视觉方面无需辅助即可玩 Pokémon 的全新 SOTA)、它在长时间自主运行上的真正强项(在数百万 token 中保持专注、12 小时运行、Stripe 在一天内完成 5000 万行 Ruby 迁移、文件记忆使游戏任务提升约 Opus 4.8 的 3 倍)、价格与可用渠道(每 1M token $10/$50、1M 上下文与 128K 输出、6 月 9–22 日各方案内免费),与 Opus 4.8 的直接对比(标准 $5/$25 对 $10/$50、SWE-Bench Pro 领先 +11.1 个百分点),重头戏般的全新安全设计(网络、生化与蒸馏分类器只在危险时回退、触发率不到 5%、保留 Mythos 级别流量 30 天),以及发布前几天还警告 AI 太危险的背景。数字均引用自 Anthropic 公告与报道,可能变动。

AI如何拉大会社员之间的能力差距?正在转移的衡量轴、抬高下限与上限,以及如何不被甩在后面

AI如何拉大会社员之间的能力差距?正在转移的衡量轴、抬高下限与上限,以及如何不被甩在后面

“AI抢走你的工作”是耳熟能详的说法,但一种更日常的变化正在悄悄发生:在同一家公司、同一岗位的同事之间,产出的差距正慢慢拉大——因为人群分化成了会用AI的人和不用或不会用的人。本文依据最新调查数据,梳理AI如何拉大会社员之间的能力差距,而这并非“聪明的人就赢”这么简单。它揭示:拉开差距的轴正从硬实力(知识、速度、经验)转向“会不会用好AI(AI素养)”;AI同时存在两股相反的力量(在任务层面更多提升新手、压缩与老手的差距,而在整个职场,本就占优势者——高收入、资深岗位——更早更深入地采用AI,从而拉大差距);用数据看现状(某调查显示高收入者每天用AI超60%、低收入者仅16%,同岗位AI技能估算带来+56%薪资溢价,约39%的人感到过度依赖侵蚀能力——均为引用且因调查而异);4股拉大差距的力量(工具获取、时间与培训、试验自主权、学习意愿——前三股偏向资深岗位,唯独最后一股可由自己改变);三种类型(领先/原地踏步/被甩下,关键在于把省下的时间投向判断、规划与人);变成“会用却不思考”的过度依赖陷阱(把AI当粗稿去核实、别囫囵吞下);如何不被甩在后面(动手用、用在自己工作上、养成核实习惯、把省下的时间用于投资、分享、持续学习);以及组织视角(取得ROI的公司很少、层级间存在摩擦、要建立全员可学习的体系)。差距拉开在行动上的差别而非才能——这也令人充满希望,因为任何人今天就能开始学着用AI。

从零开始用AI在家赚钱的第一步——为家里蹲与啃老族准备的不见面起步法

从零开始用AI在家赚钱的第一步——为家里蹲与啃老族准备的不见面起步法

出门很难,跟人说话很吃力,现在也没有在工作——即便如此,把“在家、不见任何人、按自己的节奏”变成收入的机会,也随着AI实实在在地变宽了。这篇面向特定读者的指南,会尽可能诚实而温和地,为身为家里蹲(足不出户的隐居者)或啃老族的人,整理出从零开始用AI在家赚钱的第一步。文章首先约定不说“任何人都能轻松月入数千”(这通常是谎言或销售诱饵),并坦然写出现实的难度、所需时间与注意事项。内容涵盖:为何AI×居家很合适(不用见面就能完成、容易从零开始、按自己的节奏——AI作为伙伴降低那道墙);三个诚实的事实(不会立刻赚到钱,第一个目标是最初的几美元;AI是努力的放大器而非魔法,任何东西乘以零都是零;坚持下去的人、而非聪明的人才有成果);不用跟人说话也能赚钱的方式(写作、转写/字幕、AI图像素材、数据整理、翻译检查、数字产品——先选定一个);今天就能迈出的第一步(接触免费AI、选定一个领域、做一件练习作品——先做出东西再赚钱);如何积累小小的成功(作品集、一件低报酬活儿、积累评价、提高单价与接单量——收集成功而非金额,第一份工作最珍贵);如何坚持下去并保护好自己的心(不比较、把目标拆小、休息也没关系、放下完美主义、不要独自承担——就业支援与咨询服务);以及关于骗局/夸大宣传、完全交给AI的风险、税务/被扶养的注意事项(避开先掏钱的招揽、正规众包免费、查阅官方信息)。这不是“任何人都能轻松做到”,但“连你也能迈出的一步”确实存在——请一点一点地找回“原来我也能做到”。

AI 智能体安全事故会发生什么?权限、泄露、误操作的基础

AI 智能体安全事故会发生什么?权限、泄露、误操作的基础

只要吩咐 AI 智能体“读一下这封邮件并回复”,它就会自己思考、调用工具,真正把工作做完——但正因为它会自主行动,一类聊天型 AI 从未有过的事故也变得可能,到了 2026 年,这种危险开始从理论走向现实中的实际损害。本篇新手指南把 AI 智能体的安全事故归为三大类:权限、泄露、误操作。内容涵盖事故为何会发生(智能体不只是回答,而是会行动——这是关键词;可比作才华横溢但容易上当的新员工)、为什么智能体比聊天型 AI 风险更高(使用工具、自主运行、读取外部输入三者的相乘;OWASP 在 2026 年整理了智能体特有的风险并提倡“最小自主权”)、事故1 权限(过度自主——只需读取却拥有发送/删除权限、继承人类账号的强大权限、失控时损害膨胀,以及一个成本优化智能体删除备份的报告案例)、事故2 泄露(把指令埋进外部内容的间接提示注入——报告中的真实案例:公开 Reddit 帖子里的不可见文字泄露一次性密码、客服工单中的隐藏指令经由 MCP 窃取 SQL 数据、IDE 智能体仅打开文档就窃取机密)、事故3 误操作(即使没有恶意也会发生的破坏性操作和错误连锁)、4 步攻击流程、五条基本防御(最小权限、人工审批、沙箱、设定边界、不信任外部输入),以及新手检查清单。座右铭:不要交出过多权力,让人工把危险操作拦下,不要过度信任外部文字。

AI 视频生成入门 [2026]——后 Sora 时代格局、Veo/Kling 与提示词技巧

AI 视频生成入门 [2026]——后 Sora 时代格局、Veo/Kling 与提示词技巧

输入一段文字,几秒钟就诞生一段带声音的视频——这在不久前还是科幻情节,到了 2026 年却变成现实,而局势正以惊人速度变化。曾主导话题的 OpenAI 的 Sora 已于 2026 年 4 月关停 App 与网页版(API 也将在 9 月跟进),取而代之的是 Google Veo、Kling 与 Runway 占据领先。这份截至当前(2026 年 6 月)、与具体工具无关的指南,涵盖什么是 AI 视频生成(从文字或图片生成动态影像,音频同步、1080p–4K 与图生视频已成标准)、2026 年的格局(Sora 关停——据报道背景为算力与成本压力及用户减少——以及当前领先者 Google Veo 3.1、Kling 3.0、Runway Gen-4.5,按秒计费为常态)、原理(扩散模型扩展到时间维度;文生视频与图生视频)、通用的 5 步流程(选工具、提示词/图片、设置时长/画幅/音频、生成并挑选、在剪辑中拼接)、核心的视频提示词技巧(主体 + 运动 + 运镜 + 风格 + 时长 + 音频,动词与运镜是关键,一镜一动、善用图生视频、多生成再挑选)、现在能做什么与还做不到什么(一次性做长片与完全一致性仍困难,按秒成本会累积),以及权利、水印与伦理要点(SynthID 与 C2PA 让 AI 来源标记成为无法移除的标准,纯 AI 输出受保护弱且各国有差异,商用取决于条款,真实人物的深度伪造是禁区)。不要追求一次性做出长片,而要做镜头再在剪辑中拼接。由于该领域变化迅速,请始终通过官方渠道确认最新信息。