本讲座终于来到最后一章。这里我们将一口气纵览当下最前沿正在发生的一切。多模态化、推理模型、AI智能体、开源、机器人、AGI——半年就会天翻地覆的世界,其"当前坐标",让我们抛开专业术语来把握。文中的数字与专有名词,请当作截至2026年3月的快照来阅读。

本章要点

5分钟俯瞰AI的"当下"

迈向拥有五感的AI
不仅是文字,还能处理图像、语音、视频的"多模态AI"成为主流。
"会思考""可交办"
借助推理模型AI智能体,AI从只会回答的存在,变为能自主行动的存在。
未来的主战场
机器人、AGI、各国战略。享受这个半年就会刷新常识的时代。

切身感受AI的进化速度

在撰写本章的2026年3月,AI业界的口头禅是"半年前的常识已经不管用了"。

用数字来看,就能真切体会到这种速度感。AI相关的投资额在2025年达到2,258亿美元(约34万亿日元),创历史新高[1]。77%的企业已经引入或正在测试AI,全球21%的人口每天都在使用AI工具。AI的市场规模在2025年估计约为2,440亿〜3,910亿美元。

2,258亿美元
2025年AI相关投资(历史最高)
约34万亿日元
77%
已引入/正在测试AI的企业
21%
每天使用AI工具的世界人口占比

这一年半里发生了什么,让我们按时间顺序回顾主要事件。

AI进化时间线(2024〜2026)
📘 2024年
5月 ― GPT-4o发布。多模态的开端
8月 ― 欧盟《AI法案》通过。全球首部综合性AI监管法
9月 ― o1发布。推理模型的起点
12月 ― DeepSeek V3。以约600万美元完成训练,震动业界
📗 2025年
1月 ― DeepSeek R1。登顶美国iOS榜首,英伟达股价一度下跌18%
3月 ― Gemini 2.5 Pro/GPT-4o原生图像生成
4月 ― Llama 4/o3、o4-mini/Qwen 3
5月 ― Claude 4(Opus/Sonnet)/Veo 3
10月 ― NTT tsuzumi 2/1X NEO开始预订
12月 ― 日本AI基本计划(1万亿日元)/MCP标准化
📕 2026年
2月 ― Claude Opus 4.6。SWE-Bench 72.5%
3月 ― Sora停止服务/AI智能体市场78亿美元
🚀 2026年是AI智能体与人形机器人加速走向实用化的一年

接下来,我们深入剖析其中尤为重要的四大趋势。

多模态AI ― 拥有"五感"的AI

多模态AI,是指能够统一处理文本、图像、语音、视频等多种形式的AI。早期的LLM是"只能读写文字的存在",而如今的AI能看照片、听声音、做视频。

2025年的突破

领域 服务名 能做什么
图像生成 GPT-4o(原生图像生成) 精准生成带文字的图像。2025年3月公开后需求之大,让Altman形容GPU"都熔化了"
视频生成 Google Veo 3 生成带音频的视频。发布后累计生成超过2.7亿条视频
长文理解 Gemini 2.5 Pro 一次处理100万token(超过一整本书的量)。在LMArena上首次登场即位列第一
语音对话 GPT-4o Advanced Voice 无需经由文本,实时进行自然的语音对话。也可用作口译般的用途

另一方面,OpenAI的视频生成AI"Sora"由于估计每天约100万美元的基础设施成本以及用户增长乏力,已宣布于2026年停止服务(网页与App在4月、API在9月终止)。这也凸显出一个现实:高质量的视频生成仍然需要巨额成本。

💡 实用提示:图像分析(照片→文本)各家几乎都提供免费额度。识别小票、把手写便签转成文本、从图表中提取数值等,不妨在日常中多试试。

推理模型的革命 ―"会思考"的AI登场

从2024年下半年起,AI世界诞生了一个新类别,那就是推理模型

传统的AI是"一被提问就立刻回答"的风格。推理模型则不同。它会在回答之前留出"思考的时间"。就像人在解数学题时,不是上来就写答案,而是一边记草稿一边分步思考一样。

为什么重要

随着推理模型的登场,AI曾经不擅长的领域 ―― 数学、科学、复杂的编程 ―― 性能得到了显著提升。

OpenAI o4-mini

在数学奥林匹克级别的题目(AIME 2025)上达到92.7%。配合Python工具使用时为99.5%。

DeepSeek R1

仅以约600万美元的训练成本(相较GPT-4估计的1亿美元以上)实现高性能,2025年1月登顶美国iOS应用榜首。英伟达股价一度下跌18%[2]

Claude扩展思考

开发者可自由设定"思考预算"的独有功能。实现了在使用工具的同时持续思考的"交错思考(interleaved thinking)"。

⚡ 关注要点:推理时计算(inference-time compute)
"让模型花更多时间思考,就能给出更准确的答案"这一发现,为AI的进化增添了一条新轴线。除了传统的"增加训练数据""把模型做大"之外,人们发现增加推理时的计算量同样能提升性能。

AI智能体 ― 进入"交办"的时代

2025〜2026年最火热的关键词,就是AI智能体

此前的AI是"一问就答"的顾问型伙伴。AI智能体则不同。你告诉它目标,它便会制定计划、使用工具、自主完成任务。这更接近把工作"交办"给秘书或助理的感觉。想更详细了解其原理,可参考《什么是AI智能体》;多个AI协同运作的机制,则可一并阅读《什么是多智能体》

AI智能体的具体例子

智能体 能做什么 特点
Claude Code 一贯自主地完成代码的生成、执行与调试 作为编程AI,是达成ARR超10亿美元的三款产品之一
Operator 操作网页浏览器,代为完成预订、调查 设有人工检查点,但应对提示注入攻击仍是难题
Manus AI 在云端异步执行复杂任务 2025年问世。Meta曾以约20亿美元收购,但2026年中国当局叫停,解除交易的手续正在进行中
Devin 自主完成软件开发的AI工程师 月费500美元。官方成功率为13.86%,仍在发展阶段

🛠 想真正把会写代码的"搭档"用起来的话,姊妹讲座《AI编程实战》讲解了从Claude Code等工具的上手到熟练运用的全过程。想个人开发应用的人,也推荐《用AI做个人开发》

MCP ― AI智能体的"通用语言"

作为智能体与外部工具联动的标准规范,由Anthropic开发的MCP(Model Context Protocol,模型上下文协议)正在迅速普及。它于2025年12月被捐赠给Linux基金会,SDK月下载量已达9,700万次。ChatGPT、Gemini、VS Code、AWS、Azure等主要平台纷纷采用。

据Gartner预测,到2026年底,40%的企业应用将嵌入AI智能体[1]

⚠️ 智能体的难题:智能体很方便,但现阶段存在若干重要制约。比如复杂判断上的失误、安全风险(擅自发送信息等)、成本(自主地反复调用API)、问责的不透明等。不是"全权托付",而是"交办后确认",这是铁律。

开源AI的崛起

并非只有GPT-4、Claude这类商用AI才是全部。可免费使用、可自由改动的开源AI正以惊人的势头进化。

主要模型(截至2025年)

模型 开发方 特点
Llama 4 Scout/Maverick Meta Scout:支持1,000万token的超长文,单张H100即可运行。Maverick:性能媲美GPT-4o
DeepSeek V3/R1 DeepSeek(中国) V3训练费约600万美元却达GPT-4o级。R1作为推理模型登顶美国榜首
Qwen 3 Alibaba Apache 2.0许可。支持119种语言。下载量上反超Llama

🖥 想在自己的电脑上跑跑看? 开源模型在本地环境中也能运行。上手方法可参考《本地LLM入门》,该选哪个模型可参考《本地LLM模型对比》

为什么开源很重要

开源AI有五点意义。

① 透明性

可以验证模型的机制,评估其安全性。

② 定制

可用自有数据构建专用模型。

③ 成本

在自有服务器上运行,API费用便可归零。

④ 隐私

无需把数据发往外部即可使用AI。

⑤ 促进竞争

防止少数大企业垄断AI。

2025年夏天还发生了一件象征性的事件:在开源模型的总下载量上,源自中国的模型(DeepSeek + Qwen)反超了源自美国的模型。AI开发的地缘政治平衡正在发生变化。

💡 面向普通用户的要点:开源AI主要面向企业和开发者,但其红利会间接惠及每一个人。竞争加剧会让商用AI降价、性能提升。事实上,DeepSeek R1问世之后,各家纷纷大幅下调了API费用。

未来的AI ― 2026年以后的展望

最后,我们从机器人、AGI、日本的AI战略这三个切入点,来看看未来几年AI将走向何方。

🤖 AI × 机器人
迈向人形机器人的时代

Tesla Optimus的量产价格目标为2〜3万美元。Figure 03已在宝马工厂实际运转。1X NEO以家用约2万美元于2026年发货。中国厂商有140多家、330余款型号正在研发。在日本AI基本计划中也是重点领域(作为劳动力短缺的解决方案)。

🧠 通往AGI之路
各家对AGI的预测各执一词

Anthropic认为在2027年初,Google DeepMind认为在3〜5年内,OpenAI称"已经知道该怎么造",怀疑派则认为"仍需根本性突破"。推理时投入算力这一新的扩展轴线也备受关注。

🇯🇵 日本的AI战略
AI基本计划(2025年12月)

预算为5年1万亿日元。软银+OpenAI投资约410亿美元,NTT tsuzumi 2是国产LLM,数字厅"玄内"是政府AI基座。特点是重创新甚于监管的姿态。

AI × 机器人 ―"会动的AI"走向实用

把LLM的智能与机器人的身体结合起来的人形机器人,终于开始在现实场景中大显身手。

  • Figure 03 ― 已实际部署到宝马工厂。投资额超10亿美元
  • 1X NEO ― 全球首款家用人形机器人。以约2万美元(月费499美元)于2026年开始发货
  • Tesla Optimus ― 量产价格目标2〜3万美元。计划2026年生产数万台规模
  • 中国厂商 ― 140多家企业、330余款型号正在研发

在日本政府的AI基本计划中,"物理AI"(机器人×AI)也被定位为解决劳动力短缺的重点领域[3]

通往AGI之路 ― 专家们的预测

关于AGI(通用人工智能 ― 拥有与人类同等或更高智能的AI)何时到来,业界看法不一。术语的含义可参考《什么是AGI(通用人工智能)》,关于AI超越人类的"技术奇点",则可参考《什么是技术奇点(Singularity)》的详细解说。

立场 预测
Anthropic "2027年初" ― 媲美诺贝尔奖级研究者的AI将于2026年底〜2027年初出现
OpenAI "已经知道该怎么造" ― 对具体时间避而不谈,但态度乐观
Google DeepMind "3〜5年内" ― 较之前的"10年"大幅提前
持怀疑态度的研究者 "仍需根本性突破" ― 在现有路线的延长线上要10〜20年

即便有人说"AGI要来了",生活也不会立刻天翻地覆。但AI能做的事情,其范围几乎每个月都在扩大,这是事实。"AI大概还做不到吧"这种成见,半年后或许就过时了。

日本的AI战略

2025年12月,日本政府制定了首个AI基本计划,提出在5年内向AI与半导体投资1万亿日元(约70亿美元)的方针[3]

  • 软银 × OpenAI ― 软银向OpenAI出资约410亿美元。通过合资公司"SB OAI Japan"构建面向日本的AI基座
  • NTT tsuzumi 2 ― 国产LLM。单张H100即可运行,日语性能位居世界前列
  • 数字厅"玄内" ― 面向约18万名政府职员的AI基座。NTT、KDDI、PFN等7家公司采用

日本秉持"重创新甚于监管"的姿态,与欧盟严格的监管路径形成对照。

AI时代"当下"应该做的事

① 上手熟悉

用免费的AI工具亲身体验。百闻不如一试

② 与自己的强项相乘

AI是工具。与你的专业性和创造力结合,才能变成价值。

③ 享受变化

这是半年就会刷新常识的时代。保持好奇心是最大的技能。

本章小结
  • AI已经多模态化,不仅能处理文字,还能处理图像、语音、视频。
  • 借助推理模型,"会思考"的AI成为现实;借助AI智能体,"可交办"的AI成为现实。
  • 开源AI迅猛崛起,地缘政治平衡也在发生变化。
  • 下一个主战场是机器人、AGI、各国战略。半年就会刷新常识。
  • 重要的是上手熟悉、与强项相乘、享受变化这三点。

参考文献

  1. Gartner. "Worldwide AI Spending Will Total $1.5 Trillion in 2025." Gartner Newsroom, September 2025. / Fortune Business Insights. "Artificial Intelligence Market Report." 2025.
  2. "DeepSeek R1: Open-source reasoning model." DeepSeek API Docs, January 20, 2025. / Market impact reported by multiple financial outlets, January 27, 2025.
  3. "Japan adopts first AI basic plan with 1 trillion yen investment." Nikkei, December 2025. / "Japan AI Basic Plan." AI Strategy Headquarters, December 2025.

相关链接:

🎓 全六章的学习,辛苦了!

从AI的基础到最新动向,你已经系统地掌握了知识。AI日新月异。以本讲座所学的根基为出发点,一边亲手操作工具,一边持续追踪最新信息吧。想进一步把AI用作写代码的搭档,欢迎前往姊妹讲座《AI编程实战》;想个人打造服务的,请前往《用AI做个人开发》