本讲座终于来到最后一章。这里我们将一口气纵览当下最前沿正在发生的一切。多模态化、推理模型、AI智能体、开源、机器人、AGI——半年就会天翻地覆的世界,其"当前坐标",让我们抛开专业术语来把握。文中的数字与专有名词,请当作截至2026年3月的快照来阅读。
5分钟俯瞰AI的"当下"
切身感受AI的进化速度
在撰写本章的2026年3月,AI业界的口头禅是"半年前的常识已经不管用了"。
用数字来看,就能真切体会到这种速度感。AI相关的投资额在2025年达到2,258亿美元(约34万亿日元),创历史新高[1]。77%的企业已经引入或正在测试AI,全球21%的人口每天都在使用AI工具。AI的市场规模在2025年估计约为2,440亿〜3,910亿美元。
约34万亿日元
这一年半里发生了什么,让我们按时间顺序回顾主要事件。
接下来,我们深入剖析其中尤为重要的四大趋势。
多模态AI ― 拥有"五感"的AI
多模态AI,是指能够统一处理文本、图像、语音、视频等多种形式的AI。早期的LLM是"只能读写文字的存在",而如今的AI能看照片、听声音、做视频。
2025年的突破
| 领域 | 服务名 | 能做什么 |
|---|---|---|
| 图像生成 | GPT-4o(原生图像生成) | 精准生成带文字的图像。2025年3月公开后需求之大,让Altman形容GPU"都熔化了" |
| 视频生成 | Google Veo 3 | 生成带音频的视频。发布后累计生成超过2.7亿条视频 |
| 长文理解 | Gemini 2.5 Pro | 一次处理100万token(超过一整本书的量)。在LMArena上首次登场即位列第一 |
| 语音对话 | GPT-4o Advanced Voice | 无需经由文本,实时进行自然的语音对话。也可用作口译般的用途 |
另一方面,OpenAI的视频生成AI"Sora"由于估计每天约100万美元的基础设施成本以及用户增长乏力,已宣布于2026年停止服务(网页与App在4月、API在9月终止)。这也凸显出一个现实:高质量的视频生成仍然需要巨额成本。
💡 实用提示:图像分析(照片→文本)各家几乎都提供免费额度。识别小票、把手写便签转成文本、从图表中提取数值等,不妨在日常中多试试。
推理模型的革命 ―"会思考"的AI登场
从2024年下半年起,AI世界诞生了一个新类别,那就是推理模型。
传统的AI是"一被提问就立刻回答"的风格。推理模型则不同。它会在回答之前留出"思考的时间"。就像人在解数学题时,不是上来就写答案,而是一边记草稿一边分步思考一样。
为什么重要
随着推理模型的登场,AI曾经不擅长的领域 ―― 数学、科学、复杂的编程 ―― 性能得到了显著提升。
在数学奥林匹克级别的题目(AIME 2025)上达到92.7%。配合Python工具使用时为99.5%。
仅以约600万美元的训练成本(相较GPT-4估计的1亿美元以上)实现高性能,2025年1月登顶美国iOS应用榜首。英伟达股价一度下跌18%[2]。
开发者可自由设定"思考预算"的独有功能。实现了在使用工具的同时持续思考的"交错思考(interleaved thinking)"。
⚡ 关注要点:推理时计算(inference-time compute)
"让模型花更多时间思考,就能给出更准确的答案"这一发现,为AI的进化增添了一条新轴线。除了传统的"增加训练数据""把模型做大"之外,人们发现增加推理时的计算量同样能提升性能。
AI智能体 ― 进入"交办"的时代
2025〜2026年最火热的关键词,就是AI智能体。
此前的AI是"一问就答"的顾问型伙伴。AI智能体则不同。你告诉它目标,它便会制定计划、使用工具、自主完成任务。这更接近把工作"交办"给秘书或助理的感觉。想更详细了解其原理,可参考《什么是AI智能体》;多个AI协同运作的机制,则可一并阅读《什么是多智能体》。
AI智能体的具体例子
| 智能体 | 能做什么 | 特点 |
|---|---|---|
| Claude Code | 一贯自主地完成代码的生成、执行与调试 | 作为编程AI,是达成ARR超10亿美元的三款产品之一 |
| Operator | 操作网页浏览器,代为完成预订、调查 | 设有人工检查点,但应对提示注入攻击仍是难题 |
| Manus AI | 在云端异步执行复杂任务 | 2025年问世。Meta曾以约20亿美元收购,但2026年中国当局叫停,解除交易的手续正在进行中 |
| Devin | 自主完成软件开发的AI工程师 | 月费500美元。官方成功率为13.86%,仍在发展阶段 |
🛠 想真正把会写代码的"搭档"用起来的话,姊妹讲座《AI编程实战》讲解了从Claude Code等工具的上手到熟练运用的全过程。想个人开发应用的人,也推荐《用AI做个人开发》。
MCP ― AI智能体的"通用语言"
作为智能体与外部工具联动的标准规范,由Anthropic开发的MCP(Model Context Protocol,模型上下文协议)正在迅速普及。它于2025年12月被捐赠给Linux基金会,SDK月下载量已达9,700万次。ChatGPT、Gemini、VS Code、AWS、Azure等主要平台纷纷采用。
据Gartner预测,到2026年底,40%的企业应用将嵌入AI智能体[1]。
⚠️ 智能体的难题:智能体很方便,但现阶段存在若干重要制约。比如复杂判断上的失误、安全风险(擅自发送信息等)、成本(自主地反复调用API)、问责的不透明等。不是"全权托付",而是"交办后确认",这是铁律。
开源AI的崛起
并非只有GPT-4、Claude这类商用AI才是全部。可免费使用、可自由改动的开源AI正以惊人的势头进化。
主要模型(截至2025年)
| 模型 | 开发方 | 特点 |
|---|---|---|
| Llama 4 Scout/Maverick | Meta | Scout:支持1,000万token的超长文,单张H100即可运行。Maverick:性能媲美GPT-4o |
| DeepSeek V3/R1 | DeepSeek(中国) | V3训练费约600万美元却达GPT-4o级。R1作为推理模型登顶美国榜首 |
| Qwen 3 | Alibaba | Apache 2.0许可。支持119种语言。下载量上反超Llama |
🖥 想在自己的电脑上跑跑看? 开源模型在本地环境中也能运行。上手方法可参考《本地LLM入门》,该选哪个模型可参考《本地LLM模型对比》。
为什么开源很重要
开源AI有五点意义。
可以验证模型的机制,评估其安全性。
可用自有数据构建专用模型。
在自有服务器上运行,API费用便可归零。
无需把数据发往外部即可使用AI。
防止少数大企业垄断AI。
2025年夏天还发生了一件象征性的事件:在开源模型的总下载量上,源自中国的模型(DeepSeek + Qwen)反超了源自美国的模型。AI开发的地缘政治平衡正在发生变化。
💡 面向普通用户的要点:开源AI主要面向企业和开发者,但其红利会间接惠及每一个人。竞争加剧会让商用AI降价、性能提升。事实上,DeepSeek R1问世之后,各家纷纷大幅下调了API费用。
未来的AI ― 2026年以后的展望
最后,我们从机器人、AGI、日本的AI战略这三个切入点,来看看未来几年AI将走向何方。
Tesla Optimus的量产价格目标为2〜3万美元。Figure 03已在宝马工厂实际运转。1X NEO以家用约2万美元于2026年发货。中国厂商有140多家、330余款型号正在研发。在日本AI基本计划中也是重点领域(作为劳动力短缺的解决方案)。
Anthropic认为在2027年初,Google DeepMind认为在3〜5年内,OpenAI称"已经知道该怎么造",怀疑派则认为"仍需根本性突破"。推理时投入算力这一新的扩展轴线也备受关注。
预算为5年1万亿日元。软银+OpenAI投资约410亿美元,NTT tsuzumi 2是国产LLM,数字厅"玄内"是政府AI基座。特点是重创新甚于监管的姿态。
AI × 机器人 ―"会动的AI"走向实用
把LLM的智能与机器人的身体结合起来的人形机器人,终于开始在现实场景中大显身手。
- Figure 03 ― 已实际部署到宝马工厂。投资额超10亿美元
- 1X NEO ― 全球首款家用人形机器人。以约2万美元(月费499美元)于2026年开始发货
- Tesla Optimus ― 量产价格目标2〜3万美元。计划2026年生产数万台规模
- 中国厂商 ― 140多家企业、330余款型号正在研发
在日本政府的AI基本计划中,"物理AI"(机器人×AI)也被定位为解决劳动力短缺的重点领域[3]。
通往AGI之路 ― 专家们的预测
关于AGI(通用人工智能 ― 拥有与人类同等或更高智能的AI)何时到来,业界看法不一。术语的含义可参考《什么是AGI(通用人工智能)》,关于AI超越人类的"技术奇点",则可参考《什么是技术奇点(Singularity)》的详细解说。
| 立场 | 预测 |
|---|---|
| Anthropic | "2027年初" ― 媲美诺贝尔奖级研究者的AI将于2026年底〜2027年初出现 |
| OpenAI | "已经知道该怎么造" ― 对具体时间避而不谈,但态度乐观 |
| Google DeepMind | "3〜5年内" ― 较之前的"10年"大幅提前 |
| 持怀疑态度的研究者 | "仍需根本性突破" ― 在现有路线的延长线上要10〜20年 |
即便有人说"AGI要来了",生活也不会立刻天翻地覆。但AI能做的事情,其范围几乎每个月都在扩大,这是事实。"AI大概还做不到吧"这种成见,半年后或许就过时了。
日本的AI战略
2025年12月,日本政府制定了首个AI基本计划,提出在5年内向AI与半导体投资1万亿日元(约70亿美元)的方针[3]。
- 软银 × OpenAI ― 软银向OpenAI出资约410亿美元。通过合资公司"SB OAI Japan"构建面向日本的AI基座
- NTT tsuzumi 2 ― 国产LLM。单张H100即可运行,日语性能位居世界前列
- 数字厅"玄内" ― 面向约18万名政府职员的AI基座。NTT、KDDI、PFN等7家公司采用
日本秉持"重创新甚于监管"的姿态,与欧盟严格的监管路径形成对照。
AI时代"当下"应该做的事
用免费的AI工具亲身体验。百闻不如一试。
AI是工具。与你的专业性和创造力结合,才能变成价值。
这是半年就会刷新常识的时代。保持好奇心是最大的技能。
- AI已经多模态化,不仅能处理文字,还能处理图像、语音、视频。
- 借助推理模型,"会思考"的AI成为现实;借助AI智能体,"可交办"的AI成为现实。
- 开源AI迅猛崛起,地缘政治平衡也在发生变化。
- 下一个主战场是机器人、AGI、各国战略。半年就会刷新常识。
- 重要的是上手熟悉、与强项相乘、享受变化这三点。
参考文献
- Gartner. "Worldwide AI Spending Will Total $1.5 Trillion in 2025." Gartner Newsroom, September 2025. / Fortune Business Insights. "Artificial Intelligence Market Report." 2025.
- "DeepSeek R1: Open-source reasoning model." DeepSeek API Docs, January 20, 2025. / Market impact reported by multiple financial outlets, January 27, 2025.
- "Japan adopts first AI basic plan with 1 trillion yen investment." Nikkei, December 2025. / "Japan AI Basic Plan." AI Strategy Headquarters, December 2025.
相关链接:
- Hugging Face Models ― 开源AI模型的中心
- LM Arena ― 可对比AI模型性能的排行榜
从AI的基础到最新动向,你已经系统地掌握了知识。AI日新月异。以本讲座所学的根基为出发点,一边亲手操作工具,一边持续追踪最新信息吧。想进一步把AI用作写代码的搭档,欢迎前往姊妹讲座《AI编程实战》;想个人打造服务的,请前往《用AI做个人开发》。