跳到内容
主题

AI新手入门指南:从零开始学AI工具

AI新手?从这里开始。面向初学者的AI概念、工具选择和实践入门指南。

146 篇文章

排序文章以找到您需要的内容

新手入门 分类下的文章

AI 图像生成入门——原理、4 个步骤、图像提示词结构剖析与版权

AI 图像生成入门——原理、4 个步骤、图像提示词结构剖析与版权

“我不会画画,所以这跟我没关系”——这种对 AI 图像生成的成见恰恰说反了。只要用语言下达指令,几秒钟后你就能得到专业级的视觉作品。本篇跨工具指南讲解:什么是 AI 图像生成(用语言从零做出图像——考验的是表达沟通而非绘画的本领,可谓图像版的提示词工程);它的原理(扩散模型以你的提示词为线索,从随机噪点中雕刻出一幅画,每次都从零绘制,所以结果会抖动);在任何工具中都通用的 4 步工作流(选择工具、写提示词、生成并挑选、修整并完成——迭代是前提);核心的 6 部分图像提示词结构(主体、场景/背景、风格、光线/色彩、构图/视角、技术参数)外加负面提示词与画面比例——不过 GPT Image 和 Imagen 偏好平实的句子,而 Stable Diffusion 系列则吃词语罗列和负面提示词;7 个精通技巧(多跑几次、一点一点加、参考图、局部重绘、固定种子、放大、保存好用的提示词);AI 不擅长什么(手、文字、一致性、精细准确度)及其应对;以及工作中必备的版权、商用和伦理要点(依据美国版权局和 2025 年 Thaler 判例,纯 AI 产出的保护很弱,且各国有别;商用取决于各工具的条款;深度伪造和未经许可模仿画风是禁区;像 DALL-E 的 C2PA 来源元数据这样的标注正在普及)。该选哪个工具以及各工具的具体操作,链接到对比、Midjourney 和 Stable Diffusion 等文章。了解结构、多跑几次、把词语一点一点加上去——任何人都能逼近自己想要的那张图。

提示词工程实用大全——从 AI 拿到想要答案的 6 个要素与技巧

提示词工程实用大全——从 AI 拿到想要答案的 6 个要素与技巧

同样的 AI、同样的问题,有人说它没用,另一个人却惊叹它能干得几乎过头——造成这种差距的真正原因,往往不是 AI 的能力,而是提示词是怎么写的。本文把这项技能,即提示词工程,整理成一份实用大全,让初学者也能立刻上手。内容涵盖:什么是提示词工程(设计并改进你对 AI 的指令的技能,不是代码而是如何把话说好的功夫)、改变结果的三大原则(要具体、给出背景、指定输出,外加“要做 X”胜过“不要做 Y”)、核心的好提示词 6 个要素(角色、背景、指令、示例、格式、约束——COSTAR、RCOF 等主流框架共同列出的要素,并非每次都要全部用上)、7 个实用技巧(赋予角色、展示范例/few-shot、逐步推理、固定输出格式、用分隔符理清结构、别一次问太多、迭代——其中最强的是迭代)、一个 Before/After 示例、进阶技巧(思维链、自洽性、提示词链、ReAct——不过 o 系列和 Claude 扩展思考这类推理模型会在内部执行 CoT,因此说清目标更管用)、7 个常见误区,以及各模型小窍门与输入安全。文内附有指向应用开发提示词技巧和输入注意事项的内部链接。把含糊变具体,把一股脑变对话——任何人今天就能开始进步。

什么是技术奇点?面向初学者的入门指南——机制、预测,以及它与 AGI 的区别

什么是技术奇点?面向初学者的入门指南——机制、预测,以及它与 AGI 的区别

2025 年 6 月,OpenAI 的 Sam Altman 在博客上写道:“我们已越过事件视界,起飞已经开始”(《温和的奇点》)。然而另一些研究者却干脆把这一想法斥为永远不会到来的东西。这篇初学者指南讲清:奇点(技术奇点)是“AI 超越人类智能并开始自我改进,从而使进步快得爆炸、再也无法被预测或控制的临界点”(截至 2026 年仍是假设,尚未实现)。文章涵盖其核心——智能爆炸 = 递归式自我改进,聪明的 AI 打造出更聪明的 AI,改进者从人类变成 AI;它与 AGI 和 ASI 有何不同(AGI/ASI 是智能的“状态”,奇点是变得不可预测的“事件”;AGI → 自我改进 → 骤然跃升至 ASI = 奇点);这个词的历史(I. J. Good 1965 年的“智能爆炸”→ Vinge 1993 年让它流行 → Kurzweil 以“2045”使其主流化);预测的巨大分散(Kurzweil 说 2045、Altman 说“已经开始”、Vinge,以及 Gary Marcus 和已故 Paul Allen 的“复杂性刹车”等怀疑者);突然的硬起飞 vs 渐进的软起飞;希望(疾病与科学上的突破)与风险(失控、对齐问题);深刻的怀疑(复杂性刹车、物理极限、完全是另一回事);以及“机器人统治”“AGI 一到来就立刻发生”“已确定在 2045 年”等常见误解。既不过度恐惧,也不过度幻想——充分用好今天的 AI,同时冷静地观望接下来可能到来的东西。

AI对律师、会计师与税务顾问的影响:什么会变,什么不变

AI对律师、会计师与税务顾问的影响:什么会变,什么不变

2023年,一位律师因一份由ChatGPT撰写的书状引用的判例全是AI捏造而受到制裁——这起事件在全球散播了对法律与AI的警惕。然而短短几年内采用率便迅猛增长,据称超过90%的律师在日常工作中使用某种AI。作为继 #068(贸易公司)、#094(市场营销)、#097(咨询业)之后“按行业看AI影响”系列的最新一篇,本文概览专业领域:用数字看清现状(62%的律师称每周节省6–20%的时间;Harvey与Thomson Reuters的CoCounsel在2026年第一季度处理了超过1000万份法律文件;税务/会计/审计事务所的生成式AI使用从2024年的8%升至2025年的21%;一项Stanford研究显示会计等领域初级职位较2022年下降13%,会计师+5%、记账员-5%)、AI按职业改变的工作(律师=判例检索、合同审查、义务提取;会计师=记账、凭证核对、抽样、风险识别;税务顾问=数据录入、起草报税表、法规检索——AI做基础工作,人类做最终决定)、幻觉这一最大陷阱(编造不存在的判例/法规——导致制裁和信任丧失;Harvey宣称引用核实准确率99.7%并标记其余,CoCounsel以判例数据库为依据故只引用真实判例)、不变的本质价值(最终判断、职业怀疑精神、伦理、灰色税务判断,以及决定性的、无法交给AI的签字与法律责任)、新人危机(学徒式日常工作的自动化)与新角色(AI合规官、税务提示工程师),以及面向执业者、立志者和客户的按立场建议(对照一手资料核实引用和数字;确认机密信息的处理)。监管与责任因国家而异;在日本,会计软件中的AI功能也已普及。AI抛出的问题:你出售的是工作,还是判断与责任?

Claude Code 的 /loop 命令是什么?用法、轮询与调度功能对比

Claude Code 的 /loop 命令是什么?用法、轮询与调度功能对比

“构建完成了就告诉我。”“CI 变红了就修好它。”“每 5 分钟盯一下部署。”把这些需要一直盯着的杂活整个交给 AI,正是 2026 年加入 Claude Code 的 /loop 命令所实现的。本初学者指南先讲清 /loop 是一个作用于会话范围的调度器,按你设定的(或 AI 设定的)间隔反复运行一段提示词或斜杠命令,然后讲解四种用法(① /loop 5m X = 固定 cron 间隔 ② /loop X = 由 AI 判断间隔的自适应节奏 ③ /loop 15m = 内置维护提示词 ④ /loop = 自动维护)、如何书写间隔(数字 + 单位 s/m/h/d、最小 1 分钟、像 “every 2 hours” 这样的自然语言,还可以循环斜杠命令:/loop 20m /review-pr 1234)、自适应节奏的厉害之处(活跃时等得短、安静时等得长、介于 1 分钟到 1 小时之间,而且——与单纯 cron 不同——判断任务完成后会自动结束循环)、实用配方(监视 CI/部署、照看 PR、检查耗时构建、提醒、分支自动维护)、如何停止以及注意事项(用 Esc 停止、作用于会话范围所以新对话会清除、关闭终端会停止、固定间隔最长 7 天、每个会话最多 50 个任务、在回合之间带抖动触发、本地时区)、三种调度功能如何取舍(/loop 用于会话内监视、Desktop scheduled tasks 用于常驻的本地工作、Routines 用于无人值守的云端运维),以及 loop.md 自定义和通过 CLAUDE_CODE_DISABLE_CRON=1 禁用——全部基于官方文档(截至 2026 年)。/loop 改变的,是你能交给 AI 的工作的时间轴。

如何用 AI 从视频/音频生成字幕和转写稿

如何用 AI 从视频/音频生成字幕和转写稿

给一小时的视频手动配字幕,过去要耗掉整整一天——听、暂停、敲字、对齐时间码。到了 2026 年,这种地狱只需“把视频丢进去,等几分钟”就完成了。本文聚焦于为视频和音频内容配字幕/转写(会议纪要见 #086,图片 OCR 见 #091),逐一讲解:AI 自动化的四个阶段(提取音频 → 含说话人分离的转写 → 加时间码生成 SRT/VTT → 翻译与排版);字幕(SRT/VTT)与转写稿的区别及各自的用途;工具对比(免费又保密的 Whisper、整体编辑的 Descript、高准确率多语言的 Sonix 与 Happy Scribe、对个人友好的 Notta、移动端 CapCut、最省事的 YouTube 自动字幕——许多底层都用 Whisper 系识别);最可复用的 4 步流程(准备 → 转写 → 校对 → 导出/挂载 SRT/VTT);按场景推荐(YouTube、播客、讲座、采访、机密、多语言);以音质占八成的六个准确率技巧(音质、语言设置、专有名词清单、查找替换、说话人分离、行长);多语言康庄大道(打磨原语言 → AI 翻译 → 母语者审校);以及易踩的坑——过度信任准确率、对噪声与术语吃力、版权、机密上传、时间码漂移。干净音频上准确率为 90~96%(已公布、视条件而定),人力下降 80~90%。工作交给 AI;收尾——核对专有名词、从头看一遍——交给你。

AI 对咨询行业的冲击:什么会变、什么不变,以及如何生存

AI 对咨询行业的冲击:什么会变、什么不变,以及如何生存

咨询新人的成长仪式——通宵赶制 PPT、靠人工做没完没了的调研——正在崩裂。麦肯锡的“Lilli”能在几秒内扫描 10 万份以上文档并起草幻灯片;BCG 的“Deckster”一瞬间完成幻灯片美化;据一项分析,初级分析师约 80% 的调研与制作幻灯片工作都可能在几秒内被替代。作为继 #068(贸易公司)与 #094(营销)之后“分行业看 AI 影响”系列的下一篇,本文审视咨询业:用数字看现状(四大与战略咨询所自 2023 年以来向 AI 投入超 100 亿美元,PwC 三年投 10 亿美元,BCG 2025 年 144 亿美元营收约 25% = 约 36 亿美元来自 AI,HBS 一项针对 758 名 BCG 顾问的研究显示使用 AI 的人任务多 12.2%、快 25.1%、质量高 40% 以上)、AI 改变的五大领域(调研、PPT、分析、纪要,以及全新的 AI 战略服务——目前在大型公司是净就业创造者)、金字塔模型的崩塌(初级常规工作据某种说法约 80% 在几秒内被自动化;走向精干的“少数几人 + AI”团队,伴随人才管道的隐忧)、计费的剧变(生产率悖论——完成更快意味着在按小时计费下收费更少——以及 73% 客户更倾向按成果计费,推动转向按成果计费与固定价)、不变的本质性价值(界定问题、解读、判断、信任、执行——驾驭系统的顾问比系统本身更重要)、巨头如油轮 vs 精品所如快艇的两极分化(据估计小公司增长率最高可达 50%),以及面向有志者、从业者与客户企业的分角色建议。AI 抛出的问题是:你的价值是作业,还是判断?

什么是 AGI(通用人工智能)?一篇面向初学者的入门指南

什么是 AGI(通用人工智能)?一篇面向初学者的入门指南

2026 年 1 月的达沃斯论坛上,这一领域最顶尖的头脑围绕“AGI 近在眼前”与“其本质仍然遥远”激烈交锋——导火索正是 AGI(通用人工智能)。本文面向初学者,先从 AGI 是什么讲起——“一种像人类那样、能在任何领域自主学习并解决全新事物的万能型 AI”(不过截至 2026 年它仍是一个尚未实现的目标)——再梳理它与如今 ChatGPT 那类窄域 AI 的决定性区别(能否把知识“迁移”到不同领域;泛化与自主习得技能)、窄域 AI → AGI → ASI(超级智能)的三阶段拆解、专家时间线预测的巨大离散(Anthropic 的 Amodei 乐观地认为在几年内/2027 年前后,DeepMind 的 Hassabis 谨慎地认为到 2030 年约 50%,研究者调查中位数为 2047 年,Marcus 等怀疑派则认为遥远或不会到来——这种离散源于定义不同)、如今的 AI 还有多远(在 ARC-AGI 上低于人类基线,但凭借多模态与智能体正向门口逼近)、所期待的益处(加速疾病研究与科学)与风险(就业、滥用、对齐问题——被 Anthropic 与 UK AISI 定位为关键的决策节点),以及“ChatGPT 已经是 AGI 了”“AGI = 具有意识”等常见误解。既不过度恐惧,也不过度幻想,在冷静观望接下来会发生什么的同时,先把手中的窄域 AI 用透。

如何成为最前沿的 AI 工程师(AI 原生开发者):技能与路线图

如何成为最前沿的 AI 工程师(AI 原生开发者):技能与路线图

你会站在被 AI 抢走工作的一边,还是驾驭 AI、一个人干十个人活的一边?在 2026 年,这就是工程师面前的岔路口。本文把成为“AI 原生开发者”(用 LLM、智能体、RAG 构建应用——与研究模型本身是两回事)当作一套可叠加、靠技能而非博士学位的体系,分三层讲解:① 不会变的地基(Python 作为 AI 开发主力语言、Git、命令行、HTTP/REST/JSON——在 AI 写代码的时代你仍然需要基础);② AI 原生的 5 项核心技能(提示词/上下文设计、作为企业级智能体中坚的 RAG、构建智能体、作为工具连接事实标准的 MCP,以及评估设计——再加上成本优化、护栏、可观测性);③ 大多数人会漏掉的拉开差距的一手——评估设计与上下文工程(会写评估是“真正用 LLM 动手做过”的最强信号,一份 AGENTS.md/CLAUDE.md 加一个小型评估集,就是从“辅助”跃迁到“原生”的关键)。文中还给出一份 8〜12 个月的路线图(地基 → LLM API/提示词 → 不靠框架亲手做 RAG → 智能体 + MCP → 评估 + 部署 + 发布)、一套部署作品胜过文凭的作品集策略、若干陷阱(教程沼泽、囤工具、忽视基础),以及市场/需求的数字(以美国为基准,地区差异很大)。分界线,在于你是否把 AI 当成一个系统来用。

AI 如何影响营销与广告:什么会变,什么不会变

AI 如何影响营销与广告:什么会变,什么不会变

2024 年底,Coca-Cola 用生成式 AI 制作的圣诞广告被批“没有灵魂”,这象征了 AI 给营销带来的拉锯战:“效率与效果”对“信任与情感”。本文先用数字看清现状(约 87% 的营销人使用生成式 AI,相比 2024 年的 51% 跃升;超过 71% 的广告支出由算法驱动;仅 2025 年第四季度 Google 就用 Gemini 制作了约 7000 万个创意素材;营销 AI 工具支出在 18 个月内约翻三倍)。文章涵盖 AI 改变的五大领域(① 内容创作 ② 广告创意 ③ 定向与投放/程序化 ④ 个性化/DCO ⑤ 分析与衡量)与报告中的效果(DCO 带来约 32% 更高 CTR、约 56% 更低 CPC,AI 文案 3.2 倍 ROI,第一方/情境定向高达 2 倍 ROAS——全部为公开发布值、依条件而定);不会改变的核心(战略、品牌、信任、突破性创意留在人类手中——AI 是放大器,底数为零答案也为零);SEO/AEO/LLMO 的地壳变动(附内部链接);风险(AI 广告上 82% 高管对 45% 消费者的认知落差、看似可信的捏造、品牌安全、权利/监管、无人看管的失控运行);营销人的工作如何转变(任务被拿走,判断变得更重;从生产者到总编辑兼战略家);以及从今天起的五步实践计划。AI 最大的影响是把人类的时间从做事中解放出来,用于决策。

用 AI 制作演示幻灯片:工具、流程与提示词

用 AI 制作演示幻灯片:工具、流程与提示词

用 AI 做幻灯片,先根据演示场所和最终交付格式选择工具。本文把结构、讲稿、设计作为三个阶段,介绍 Gamma、PowerPoint 内置 Copilot、Google Slides 用 Gemini、Beautiful.ai、Canva、ChatGPT 插件和 Claude Slides 的适用方式。说明如何把 Claude 对话变成演示,以及它与面向文档的 Claude Docs 有何区别。涵盖从搭建结构到核实数字和出处、检查导出效果的五步流程,提供三组实用提示词和精简信息的技巧。无论在一个应用里完成,还是使用多个工具,都应分别检查内容和外观。

用 AI 从图片中提取文字(OCR):完整指南

用 AI 从图片中提取文字(OCR):完整指南

一张手写便条、一张纸质收据、截图里的英文、照片中的招牌——那些你一直靠手敲的重新录入工作,到了 2026 年,借助 AI 几乎已全无必要。本指南从 AI OCR 与传统 OCR 的区别(逐字识别 vs. 按含义理解整页)讲起,再按场景梳理三种选择(通用聊天 AI/Google Lens 等专用工具/Mistral OCR、PaddleOCR-VL 等 API 与开源)。文章对比 ChatGPT(GPT-5.5)、Gemini 3.1 Pro 和 Claude(Opus 4.8)的强项(手写 → GPT 系列、表格结构化 → Claude 系列、多页 → Gemini 长上下文、纯 OCR → 专用模型;没有绝对冠军),给出三条可直接套用的提示词(无损转写、表格转 Markdown、收据转 JSON,均带“不得捏造”规则)、各场景的最佳选择(手写、收据、PDF、复杂表格、竖排/古字、公式和代码)、六个准确率技巧(图像质量占八成),以及 AI OCR 唯一最大的弱点——看似合理地捏造读不出的内容(金额、日期、姓名务必与原件核对)——还有关于机密外发、版权和训练使用的隐私注意事项。你可以交给 AI 的,只有“读”;确认这件事,留给亲眼看过原件的人。