跳到内容
AI工具

其他AI工具评测与对比指南

发现和对比新兴AI工具。评测、功能介绍和实用指南。

48 篇文章

排序文章以找到您需要的内容

其他AI 分类下的文章

Kimi K3 是什么?“第三名”说法背后的 2.8 万亿参数模型——价格、开放权重与市场冲击

Kimi K3 是什么?“第三名”说法背后的 2.8 万亿参数模型——价格、开放权重与市场冲击

2026 年 7 月 16 日,Moonshot AI 发布了总参数量 2.8 万亿的 Kimi K3。美国半导体股票遭到抛售,事态更升级到一位白宫官员点名指控该公司蒸馏了 Anthropic 的模型。由于数字乃至叫法都会因来源而异,本文对照基准发布方、财经媒体、Moonshot 自己的公告以及 Hugging Face 上的实际页面,逐一说明每个数字出自谁之手。性能方面,它在 Artificial Analysis Intelligence Index 上得 57 分、排名第三(截至 2026 年 7 月 17 日;不过同样是 57 分,也存在排第四和第七的统计)。在更贴近实务的 GDPval-AA v2 上,K3 为 1668,Fable 5 为 1760,Opus 4.8 为 1600——较上一代 K2.6 的 1190 跃升 478 分,真正撬动市场的正是这种差距的缩小,而非绝对名次。编程方面,它在 Arena.ai 的 Frontend Code Arena 上以 1679 分拿下第一(Fable 5 为 1631),但在 FrontierSWE 上以 81.2% 输给了 Fable 5 的 86.6%。价格的结论会随比较对象反转:输入 $3、输出 $15,比 Claude Opus 4.8($5/$25)或 GPT-5.6 Sol($5/$30)输入便宜约四成、输出便宜四到五成,实测单任务成本 $0.94 也低于 Opus 4.8 的 $1.80。但与中国同行相比它是最贵的一个,约为 GLM-5.2 的三倍、DeepSeek V4 Pro 的 23 倍,因此这并不是 DeepSeek 冲击那种低一个数量级的折扣。关于权重,媒体在“开源”(VentureBeat、SCMP)与路透社的“开放权重”之间分裂,准确的说法是后者。权重已按原定计划于 2026 年 7 月 27 日放出,可以从 Hugging Face 无申请直接下载(96 个 safetensors 分片)。同时公开的许可证是自定的“Kimi K3 License”,在 MIT 式授权之上附加两项条件:Model as a Service 业务营收超过 2,000 万美元需另行签约,月活跃用户过亿的产品需在界面上标出“Kimi K3”。授权随规模而变,因此并不符合 OSI 的开源定义——称呼上的分歧,如今由许可证条文本身给出了答案。市场方面,纳斯达克周五下跌 1.5%,台湾跌超 6%,日本跌 4%,半导体 ETF(SMH)较 6 月底高点下跌超过 20%,但 SOX 的周跌幅按媒体不同被报为 -9% 至 -12.5%,此后抄底资金入场收窄了跌幅。蒸馏指控被研究者以时间线否定——Fable 于 7 月 1 日公开,K3 于 7 月 15 日上线,中间只有 15 天——并且没有任何证据被公开。速度(测量值从每秒 33 到 62 个 token 不等,OpenRouter 警告容量紧张会导致 429 频发)、幻觉率从 39% 升至 51%,以及 Moonshot 自己承认的明显用户体验差距,本文都附上了确信度标签。

Claude Opus 5 发布:与 Opus 4.8、Fable 5 有何不同

Claude Opus 5 发布:与 Opus 4.8、Fable 5 有何不同

Anthropic 于 2026 年 7 月 24 日发布 Claude Opus 5,官方文档称其相对 Opus 4.8 是台阶式跃升而非渐进式小改,但价格纹丝不动:每百万 token 输入 $5 / 输出 $25,正好是旗舰 Fable 5($10 / $50)的一半。本文交叉核对官方公告、官方文档与多家媒体报道,梳理核心规格(claude-opus-5、100 万 token 上下文且默认值即上限、128K 最大输出、知识截止 2026 年 5 月)、含缓存费率与高速模式(约 2.5 倍速度、2 倍价格、仅限 Claude API)的价格结构,以及基准测试成绩:Anthropic 在正文中明确写出 Frontier-Bench 超过 Opus 4.8 的两倍、CursorBench 3.2 与 Fable 5 相差 0.5% 以内、ARC-AGI 3 是第二名的三倍、OSWorld 2.0 以约三分之一成本超过 Fable 5;媒体从图表读取的数值则包括 Frontier-Bench 43.3%、ARC-AGI-3 30.2%、GDPval-AA 1,861 与 OSWorld 70.6%。同时也不回避短板:DeepSWE v1.1 上 68.8% 落后于 GPT-5.6 Sol 的 72.7%,攻击性安全与长周期生物学研究仍由 Mythos 5 领先,而且存在 max effort 得分反而低于低档位的情况。随后详解两处 API 破坏性变更(思考默认开启,导致卡得过紧的 max_tokens 被截断;关闭思考仅在 effort 为 high 及以下时允许,xhigh 或 max 会返回 400),五档 effort 的选择方法,对话中途变更工具、512 token 缓存下限、default 回退模式等新功能,以及回答变长、汇报变多、更愿意分派子智能体、不用催就自我验证的性格变化——迁移的要诀是删提示词而不是加提示词——最后给出谁该立刻迁移的判断标准与六步迁移检查清单。

GPT-Live 是什么?ChatGPT 全双工语音(边听边说)完全解读

GPT-Live 是什么?ChatGPT 全双工语音(边听边说)完全解读

2026年7月8日,OpenAI 面向全球发布了刷新 ChatGPT 语音的新模型 GPT-Live。它以"边听边说"的全双工架构取代传统 Advanced Voice Mode,会附和、能接住打断、不打断你思考的沉默,响应延迟 <250ms。深度推理与检索在后台委派给 GPT-5.5(可选 Instant/Medium/High)。免费套餐用 GPT-Live-1 mini,Go/Plus/Pro 用 GPT-Live-1。本文讲解它是什么、与旧版有何不同、如何运作、分套餐提供,以及视频/屏幕共享与 API 等当前限制。

10个有趣的AI绘画玩法:免费把照片和涂鸦变成艺术(2026)

10个有趣的AI绘画玩法:免费把照片和涂鸦变成艺术(2026)

那些因为"不会画画"而放弃绘画的人,恰恰是最适合把AI绘画当成游乐场的人。把脑海里的画面用文字说出来,它就变成了艺术品;一张手机照片、一幅孩子的涂鸦,几秒钟就能变成一件作品。这不是工具对比,也不是严肃教程,而是一本供一人玩或全家同乐的玩法灵感集。从上手就能免费用的工具(ChatGPT、Google Gemini、Microsoft Copilot、Canva),到10个玩法(①涂鸦变艺术 ②照片换新风格 ③专属角色跨场景 ④把孩子的画变绘本一页 ⑤原创表情包 ⑥四格漫画 ⑦如果X是Y的混搭 ⑧自制涂色页 ⑨房间改造 ⑩绘画对决),再到让画面更好看的小技巧,以及开玩前要知道的三件事(别用他人的脸、确认版权和商用、标注是AI制作的)。

Ollama 完全入门指南:本地 LLM 一条命令搞定 [2026]

Ollama 完全入门指南:本地 LLM 一条命令搞定 [2026]

开始上手本地 LLM 时,最先该装的首选工具就是 Ollama——它就像「LLM 版的 Docker」,几乎替你包办了所有繁琐的环境配置,只需一条命令即可下载量化模型并开始对话。本文面向初学者,一气呵成地讲解从 Win/Mac/Linux 安装、run/pull/list 等核心命令、按显存选择模型、套上 Open WebUI 等聊天界面、运行在 localhost:11434 的本地 API(含只改端点即可复用现有代码的 OpenAI 兼容 API)、用 Modelfile 与环境变量自定义,到速度慢、内存不足、API 连不上等常见问题排查的完整流程,让你既能先跑起来,又能进一步嵌入到自己的应用并把它当作云端的后备方案。

2026年最佳本地LLM开源模型对比:Qwen·DeepSeek·Llama·Gemma怎么选 [2026]

2026年最佳本地LLM开源模型对比:Qwen·DeepSeek·Llama·Gemma怎么选 [2026]

本地LLM跑得起来后,下一个难题是「到底装哪个模型」。本文把2026年的主流开源模型按开发方、出身国、用途、大小和许可证全面梳理,帮你选出最适合自己电脑和目标的「第一个」。其中重点介绍Qwen(阿里巴巴)、DeepSeek、GLM(智谱)等既是国产、也是全球开源第一梯队的中文模型,以及Yi、InternLM、Baichuan、MiniMax、Kimi等值得关注的国产力量;同时澄清「本地运行输入不外流」这一关键前提,并给出按显存大小和用途的具体推荐与商用许可证注意事项。

本地 LLM 需要什么硬件?显存(VRAM)速查表与按预算推荐配置 [2026]

本地 LLM 需要什么硬件?显存(VRAM)速查表与按预算推荐配置 [2026]

想跑本地 LLM,最先担心的就是"我的电脑跑得动吗"。其实所需配置的 90% 都取决于 VRAM(GPU 显存)——只要把这一点搞定,就能立刻判断什么能跑、什么跑不了。本文按模型大小给出一张 VRAM 速查表和一个简单公式(大小 B × 约 0.6),讲清会随上下文长度增长的 KV 缓存陷阱,并对比 RTX 3060/4090/5090 与 Apple Mac 的实际速度。最后按预算分入门、标准、硬核三档给出推荐配置,让初次接触的人也能弄清自己该买哪一款。

本地 LLM vs 云端 LLM:区别与性能差距 [2026]

本地 LLM vs 云端 LLM:区别与性能差距 [2026]

在自己电脑上运行的本地 LLM,和 Claude、ChatGPT、Gemini 等云端服务型 LLM,同样都是「LLM」,但在性能、成本、隐私和投入精力上有着明显的不同。本文用一张对比表把两者一览无余,并诚实梳理常被误解的「性能差距」在 2026 年缩小到了什么程度。在此基础上,再针对你的具体用途引导你该选哪一个——对大多数人来说,混合使用才是答案。文章即使没有任何前置知识也能读懂。

LoRA 是什么?用一点点额外训练定制 AI

LoRA 是什么?用一点点额外训练定制 AI

把庞大的 AI 从头重新训练太贵,但你又想为自己稍作调整;LoRA(Low-Rank Adaptation)通过冻结原始模型、只训练一个极小的附加部件(适配器),把可训练参数削减约 90%,实现了这个愿望。LoRA 让微调大幅更便宜、更快,并在 Stable Diffusion 等图像生成中作为添加角色或画风的小文件极受欢迎。本文用补丁的比喻来讲解。LoRA 是参数高效微调(PEFT)的代表:把庞大的原始权重冻结,在每一层插入一个小的附加矩阵,只训练它(W = W0 + BA,其中 W0 被冻结,BA 是新增的那一小部分)。它建立在这样一个发现之上:调整 AI 并不需要大的改动,低秩就足够。优势:可训练参数减少约 90%(在 GPT-3 规模下据报道少 10,000x)、更省 GPU 内存(约少 3x)、训练更快更便宜、合并适配器后不增加推理延迟、更不易过拟合。它最大的优势是适配器可更换:保留一个通用底座,按用途即时更换小巧的(几 MB)LoRA 文件(客户支持、公司语气、某个特定角色)。很多人第一次接触 LoRA 是在图像生成中,Stable Diffusion 上学会了角色、画风或主体的 LoRA 被广泛共享(添加画风、学会角色、轻巧易分享)。QLoRA 结合量化,在 4-bit 底座之上训练 LoRA,比标准 LoRA 省约 4x 内存,能在消费级 GPU(有时是 CPU)上微调庞大模型,且精度损失极小。相比全量微调(训练所有权重),LoRA 在训练的权重、成本、产出和适用场景上都不同;对大多数工作,LoRA 就足够。底座保持原样,风味小幅调出。文中数值引自公开资料,仅供参考。

什么是量化?把 AI 模型缩小,在你自己的机器上运行

什么是量化?把 AI 模型缩小,在你自己的机器上运行

一个庞大的 70B 模型不再需要数据中心的 GPU 机架,而能在家里一台游戏 PC 上运行,这要归功于量化——它降低模型权重的数值精度,从而大幅缩小体积和内存。模型蒸馏是把知识转移到另一个更小的模型,而量化则是让同一个模型变轻。本文用照片压缩的比喻来讲解。量化把以 FP16/FP32 小数存储的权重替换成 INT8(8 位)或 INT4(4 位)整数,减少每个权重的字节数(FP32=4、INT8=1、INT4=0.5);就像把 RAW 照片压成 JPEG,你牺牲一点点精度换来大幅减重,令人惊讶的是放弃的东西竟然这么少。在内存上,4-bit 约为 FP16 的四分之一:70B 模型从 ~140GB 降到 ~35GB,8B 模型在 4-bit 下约 ~4.5-5GB,能塞进中端 8GB VRAM 的 GPU 用于本地运行(LLM 的民主化)。在精度上,INT8 几乎无损,INT4 在一般问答/常识类任务上退化不到 4%,但在数学、代码生成和高难度推理上损失更明显(表现为困惑度小幅上升),所以要按任务选位宽。主要方法:GPTQ(精确 4-bit 的先驱)、AWQ(保护最重要的约 ~1% 权重,往往精度高 1-2% 且更快)、GGUF(llama.cpp/Ollama 格式,Q2_K-Q8_0,CPU+GPU 混合,用于本地)和 QLoRA(4-bit 基础加 LoRA,在消费级 GPU 上微调)。它与蒸馏(转移到另一个小模型)和微调(增添任务知识)不同,三者通常组合使用(量化蒸馏后的模型;在量化基础上微调)。开始时,用 Ollama 一条命令跑一个 GGUF 模型,按 VRAM 选 Q4/Q8,代码或精确计算避开 INT4。多数主流模型已以量化形式发布,下载即用。保留聪明,只去掉重量。文中数字引用自公开资料,仅供方向参考。

什么是模型蒸馏?把大 AI 的知识转移到小 AI

什么是模型蒸馏?把大 AI 的知识转移到小 AI

庞大而高性能的 AI 聪明但又重又贵;模型蒸馏(知识蒸馏)通过把大教师模型的知识转移到小学生模型来解决这一问题,以十分之一的体积和速度保留教师 95% 以上的性能。本文用教师与学生的比喻讲解。关键在于软标签:普通训练只教"答案是猫"(硬标签),蒸馏则传递教师"90% 猫、8% 狗、2% 狐狸"这样的整个概率分布,其"犹豫程度"蕴含丰富信息;温度参数会软化概率以显现微妙关系(真实例子:GPT-4o mini 据说从 GPT-4o 蒸馏而来)。好处:又快又便宜、约 10 倍更紧凑且保留 95% 以上性能、可在边缘端运行、擅长用途专精。两种方式:白盒(完全访问权重和内部表示,转移更深,用于自家或 OSS 模型)与黑盒(只能看到输出/API 响应,把别家 API 当教师可能违反条款)。它与量化(压缩同一模型的权重精度)、微调(对现有模型针对任务追加训练)不同——蒸馏是把知识转移到另一个小模型,三者可组合。法律与 ToS 现实是 2026 年的重大议题:技术正当,但 OpenAI、Anthropic、Mistral、xAI 等都设有反蒸馏条款,禁止用输出打造竞争模型,因此用受限 API 蒸馏竞品可能违反条款。OpenAI 诉 DeepSeek 的纠纷(OpenAI 主张疑似 DeepSeek 相关账号绕过限制获取输出用于蒸馏,而 DeepSeek 条款据称允许蒸馏其输出)表明评估取决于适用谁的 API 条款,且 Claude Fable 5/Mythos 5 据报道会限制被判定为蒸馏的作业。要诀:用自家或已授权 OSS 模型当教师、用商用 API 前确认反蒸馏条款,并判断用途是否属于"开发竞争模型"。聪明靠大模型、运营靠小模型——但选谁当教师会改变技术与法律结果。数据引用自公开资料,仅供参考。

什么是微调(fine-tuning)?微调 vs RAG、LoRA/QLoRA 与何时该用——初学者指南

什么是微调(fine-tuning)?微调 vs RAG、LoRA/QLoRA 与何时该用——初学者指南

想把 AI 定制成自己公司专用时,微调(fine-tuning)是选项之一——但贸然上手,成本高、还容易出错。本初学者指南讲清微调:把一个已训练好的基础模型,用贴合你用途的数据再进一步训练,改造成专用模型,通过改写权重把「行为」(公司文风、输出格式、领域表达)刻进模型本身。微调擅长改变行为,却不擅长记住最新知识,所以原则是「事实和知识 → RAG,个性和模子 → 微调,提示词优先」。正如专家所说,「我们需要微调」里约有 80% 都能靠更好的检索(RAG)或提示词解决,所以顺序很重要。文章涵盖:什么是微调(新员工培训类比)、它擅长与不擅长什么、微调 vs RAG vs 提示词对比表、主要方法(全量微调、LoRA,以及对初学者足够轻量的 4-bit 量化 QLoRA)、你需要准备什么(500+ 条高质量样本作参考,构建数据才是真正的硬活;成本从 $5,000 到 $50,000 以上,OpenAI 微调约每百万训练 token $25–$100;OpenAI、Unsloth、Axolotl、Hugging Face 等工具),以及开始的顺序。微调是最后的手段。