跳到内容
AI工具

其他AI工具评测与对比指南

发现和对比新兴AI工具。评测、功能介绍和实用指南。

50 篇文章

排序文章以找到您需要的内容

其他AI 分类下的文章

AI 对 IT 自由职业者做了什么:5项研究揭示被选中的方式如何改变

AI 对 IT 自由职业者做了什么:5项研究揭示被选中的方式如何改变

“AI 会不会抢走我的工作”这个问题,已经不适合用来谈这件事了。UCLA Anderson 的 Siddiq 与 Zhang 追踪了 Upwork 上 49,610 人、226万份合同,时间跨度为2021年1月至2026年3月。他们发现的不是工作还在不在,而是被选中的方式变了:客户放在人力资本信号上的权重下降 7.8%,价格的权重上升 1.1%,合同数下降 7.0%。经过验证的资质、工作履历、作品集与客户评价,全都失去了预测谁能拿到合同的能力;而且越靠近当下跌得越狠,最近4个季度信号权重为 -10.1%、价格权重为 +1.8%。与此同时,供给侧却朝着相反的方向移动:Upwork 报告称,美国熟练知识工作者的自由职业比例一年内从 28% 升到 38%,并有 58% 的正式员工正在考虑转型。文章的核心是两个悖论。其一,经验在雇佣里是盾牌,在承接里不是——Stanford 发现22至25岁在 AI 暴露度高的职业中的就业低约 19%,而有经验者身上不存在同等差距;Organization Science 对自由职业者的研究却发现经验最丰富的群体跌幅最大。公司雇的是角色,客户买的是交付物。其二,工作没有消失,消失的是中间层:Management Science 报告最容易被自动化的岗位需求下降 21%,而留下来的项目更复杂、报酬更高。本文只使用同行评审论文与平台官方调研,并逐一追到发布方本体核对,标明 Upwork 是利益相关方,纠正了流传甚广的“2月新闻稿称时薪上涨 44%”这一说法(原文并未提及时薪溢价),并保留研究者自己的但书,包括 Stanford 写明这一下滑在时间点上有一部分由 AI 之外的因素驱动。三项预测均附确信度标签与证伪条件,最后讲对策的一章明确标注为推测。

用本地 LLM 写代码:Ollama + Cline / Continue 的配置,和那道会静静坏掉的上下文关口

用本地 LLM 写代码:Ollama + Cline / Continue 的配置,和那道会静静坏掉的上下文关口

让跑在自己电脑上的模型写代码,这件事几年前就能做,但当年能做的只是补全。而从 2025 年底到 2026 年,“读一遍仓库、改动多个文件、跑一遍测试”这种智能体式的用法终于落到了本地:Qwen 的官方模型卡直接点名 CLINE,Mistral 也把标榜智能体式编程的 Devstral Small 2(24B)以 Apache 2.0 开放了出来。本文只取开发方自己公布的数据,不从汇总文章里转手引用——因为查证时不止一次遇到把某个尺寸模型的分数安在另一个尺寸头上的例子。全文最重要的一章是上下文长度:Ollama 的默认值不是固定的,而是按显存决定的,不足 24GiB 是 4k、24〜48GiB 是 32k、48GiB 以上才是 256k。一般的游戏配置正好落在最上面那一行,于是系统提示词加文件内容加工具调用的一来一回轻松溢出,对话从最前面被悄悄削掉,表现为忘记指令、反复做同一个操作、丢失目的,而且全程不报错。官方对编程这类负荷高的用途明确推荐把上下文设到 64000 以上,但调大之后必须用 ollama ps 确认模型仍完整装在 GPU 上,否则会被挤到 CPU 而慢得像换了个东西。文中还厘清了 Continue 和 Cline 在设计上的根本差异(前者按 chat / edit / apply / rerank / autocomplete 分配不同模型、要求低;后者是一个模型从规划做到执行、要求高),按显存给出三档现实选择,摆出 Qwen3.6-35B-A3B(35B 总参数、激活 3B、SWE-bench Verified 73.4)和 Devstral Small 2(24B、68.0%)的官方数字,并指出“本地相当于云端百分之多少”这种比较已经站不住脚——前沿模型正在不再公布 SWE-bench Verified。最后是成本:不收 API 账单不等于免费,答案会随着“你是不是已经有那块 24GB 级别的 GPU”而彻底反转。

Kimi K3 是什么?“第三名”说法背后的 2.8 万亿参数模型——价格、开放权重与市场冲击

Kimi K3 是什么?“第三名”说法背后的 2.8 万亿参数模型——价格、开放权重与市场冲击

2026 年 7 月 16 日,Moonshot AI 发布了总参数量 2.8 万亿的 Kimi K3。美国半导体股票遭到抛售,事态更升级到一位白宫官员点名指控该公司蒸馏了 Anthropic 的模型。由于数字乃至叫法都会因来源而异,本文对照基准发布方、财经媒体、Moonshot 自己的公告以及 Hugging Face 上的实际页面,逐一说明每个数字出自谁之手。性能方面,它在 Artificial Analysis Intelligence Index 上得 57 分、排名第三(截至 2026 年 7 月 17 日;不过同样是 57 分,也存在排第四和第七的统计)。在更贴近实务的 GDPval-AA v2 上,K3 为 1668,Fable 5 为 1760,Opus 4.8 为 1600——较上一代 K2.6 的 1190 跃升 478 分,真正撬动市场的正是这种差距的缩小,而非绝对名次。编程方面,它在 Arena.ai 的 Frontend Code Arena 上以 1679 分拿下第一(Fable 5 为 1631),但在 FrontierSWE 上以 81.2% 输给了 Fable 5 的 86.6%。价格的结论会随比较对象反转:输入 $3、输出 $15,比 Claude Opus 4.8($5/$25)或 GPT-5.6 Sol($5/$30)输入便宜约四成、输出便宜四到五成,实测单任务成本 $0.94 也低于 Opus 4.8 的 $1.80。但与中国同行相比它是最贵的一个,约为 GLM-5.2 的三倍、DeepSeek V4 Pro 的 23 倍,因此这并不是 DeepSeek 冲击那种低一个数量级的折扣。关于权重,媒体在“开源”(VentureBeat、SCMP)与路透社的“开放权重”之间分裂,准确的说法是后者。权重已按原定计划于 2026 年 7 月 27 日放出,可以从 Hugging Face 无申请直接下载(96 个 safetensors 分片)。同时公开的许可证是自定的“Kimi K3 License”,在 MIT 式授权之上附加两项条件:Model as a Service 业务营收超过 2,000 万美元需另行签约,月活跃用户过亿的产品需在界面上标出“Kimi K3”。授权随规模而变,因此并不符合 OSI 的开源定义——称呼上的分歧,如今由许可证条文本身给出了答案。市场方面,纳斯达克周五下跌 1.5%,台湾跌超 6%,日本跌 4%,半导体 ETF(SMH)较 6 月底高点下跌超过 20%,但 SOX 的周跌幅按媒体不同被报为 -9% 至 -12.5%,此后抄底资金入场收窄了跌幅。蒸馏指控被研究者以时间线否定——Fable 于 7 月 1 日公开,K3 于 7 月 15 日上线,中间只有 15 天——并且没有任何证据被公开。速度(测量值从每秒 33 到 62 个 token 不等,OpenRouter 警告容量紧张会导致 429 频发)、幻觉率从 39% 升至 51%,以及 Moonshot 自己承认的明显用户体验差距,本文都附上了确信度标签。

Claude Opus 5 发布:与 Opus 4.8、Fable 5 有何不同

Claude Opus 5 发布:与 Opus 4.8、Fable 5 有何不同

Anthropic 于 2026 年 7 月 24 日发布 Claude Opus 5,官方文档称其相对 Opus 4.8 是台阶式跃升而非渐进式小改,但价格纹丝不动:每百万 token 输入 $5 / 输出 $25,正好是旗舰 Fable 5($10 / $50)的一半。本文交叉核对官方公告、官方文档与多家媒体报道,梳理核心规格(claude-opus-5、100 万 token 上下文且默认值即上限、128K 最大输出、知识截止 2026 年 5 月)、含缓存费率与高速模式(约 2.5 倍速度、2 倍价格、仅限 Claude API)的价格结构,以及基准测试成绩:Anthropic 在正文中明确写出 Frontier-Bench 超过 Opus 4.8 的两倍、CursorBench 3.2 与 Fable 5 相差 0.5% 以内、ARC-AGI 3 是第二名的三倍、OSWorld 2.0 以约三分之一成本超过 Fable 5;媒体从图表读取的数值则包括 Frontier-Bench 43.3%、ARC-AGI-3 30.2%、GDPval-AA 1,861 与 OSWorld 70.6%。同时也不回避短板:DeepSWE v1.1 上 68.8% 落后于 GPT-5.6 Sol 的 72.7%,攻击性安全与长周期生物学研究仍由 Mythos 5 领先,而且存在 max effort 得分反而低于低档位的情况。随后详解两处 API 破坏性变更(思考默认开启,导致卡得过紧的 max_tokens 被截断;关闭思考仅在 effort 为 high 及以下时允许,xhigh 或 max 会返回 400),五档 effort 的选择方法,对话中途变更工具、512 token 缓存下限、default 回退模式等新功能,以及回答变长、汇报变多、更愿意分派子智能体、不用催就自我验证的性格变化——迁移的要诀是删提示词而不是加提示词——最后给出谁该立刻迁移的判断标准与六步迁移检查清单。

GPT-Live 是什么?ChatGPT 全双工语音(边听边说)完全解读

GPT-Live 是什么?ChatGPT 全双工语音(边听边说)完全解读

2026年7月8日,OpenAI 面向全球发布了刷新 ChatGPT 语音的新模型 GPT-Live。它以“边听边说”的全双工架构取代传统 Advanced Voice Mode,会附和、能接住打断、不打断你思考的沉默,响应延迟 <250ms。深度推理与检索在后台委派给 GPT-5.5(可选 Instant/Medium/High)。免费套餐用 GPT-Live-1 mini,Go/Plus/Pro 用 GPT-Live-1。本文讲解它是什么、与旧版有何不同、如何运作、分套餐提供,以及视频/屏幕共享与 API 等当前限制。

10个有趣的AI绘画玩法:免费把照片和涂鸦变成艺术(2026)

10个有趣的AI绘画玩法:免费把照片和涂鸦变成艺术(2026)

那些因为“不会画画”而放弃绘画的人,恰恰是最适合把AI绘画当成游乐场的人。把脑海里的画面用文字说出来,它就变成了艺术品;一张手机照片、一幅孩子的涂鸦,几秒钟就能变成一件作品。这不是工具对比,也不是严肃教程,而是一本供一人玩或全家同乐的玩法灵感集。从上手就能免费用的工具(ChatGPT、Google Gemini、Microsoft Copilot、Canva),到10个玩法(①涂鸦变艺术 ②照片换新风格 ③专属角色跨场景 ④把孩子的画变绘本一页 ⑤原创表情包 ⑥四格漫画 ⑦如果X是Y的混搭 ⑧自制涂色页 ⑨房间改造 ⑩绘画对决),再到让画面更好看的小技巧,以及开玩前要知道的三件事(别用他人的脸、确认版权和商用、标注是AI制作的)。

Ollama 完全入门指南:本地 LLM 一条命令搞定 [2026]

Ollama 完全入门指南:本地 LLM 一条命令搞定 [2026]

开始上手本地 LLM 时,最先该装的首选工具就是 Ollama——它就像“LLM 版的 Docker”,几乎替你包办了所有繁琐的环境配置,只需一条命令即可下载量化模型并开始对话。本文面向初学者,一气呵成地讲解从 Win/Mac/Linux 安装、run/pull/list 等核心命令、按显存选择模型、套上 Open WebUI 等聊天界面、运行在 localhost:11434 的本地 API(含只改端点即可复用现有代码的 OpenAI 兼容 API)、用 Modelfile 与环境变量自定义,到速度慢、内存不足、API 连不上等常见问题排查的完整流程,让你既能先跑起来,又能进一步嵌入到自己的应用并把它当作云端的后备方案。

2026年最佳本地LLM开源模型对比:Qwen·DeepSeek·Llama·Gemma怎么选 [2026]

2026年最佳本地LLM开源模型对比:Qwen·DeepSeek·Llama·Gemma怎么选 [2026]

本地LLM跑得起来后,下一个难题是“到底装哪个模型”。本文把2026年的主流开源模型按开发方、出身国、用途、大小和许可证全面梳理,帮你选出最适合自己电脑和目标的“第一个”。其中重点介绍Qwen(阿里巴巴)、DeepSeek、GLM(智谱)等既是国产、也是全球开源第一梯队的中文模型,以及Yi、InternLM、Baichuan、MiniMax、Kimi等值得关注的国产力量;同时澄清“本地运行输入不外流”这一关键前提,并给出按显存大小和用途的具体推荐与商用许可证注意事项。

本地 LLM 需要什么硬件?显存(VRAM)速查表与按预算推荐配置 [2026]

本地 LLM 需要什么硬件?显存(VRAM)速查表与按预算推荐配置 [2026]

想跑本地 LLM,最先担心的就是“我的电脑跑得动吗”。其实所需配置的 90% 都取决于 VRAM(GPU 显存)——只要把这一点搞定,就能立刻判断什么能跑、什么跑不了。本文按模型大小给出一张 VRAM 速查表和一个简单公式(大小 B × 约 0.6),讲清会随上下文长度增长的 KV 缓存陷阱,并对比 RTX 3060/4090/5090 与 Apple Mac 的实际速度。最后按预算分入门、标准、硬核三档给出推荐配置,让初次接触的人也能弄清自己该买哪一款。

本地 LLM vs 云端 LLM:区别与性能差距 [2026]

本地 LLM vs 云端 LLM:区别与性能差距 [2026]

在自己电脑上运行的本地 LLM,和 Claude、ChatGPT、Gemini 等云端服务型 LLM,同样都是“LLM”,但在性能、成本、隐私和投入精力上有着明显的不同。本文用一张对比表把两者一览无余,并诚实梳理常被误解的“性能差距”在 2026 年缩小到了什么程度。在此基础上,再针对你的具体用途引导你该选哪一个——对大多数人来说,混合使用才是答案。文章即使没有任何前置知识也能读懂。

LoRA 是什么?用一点点额外训练定制 AI

LoRA 是什么?用一点点额外训练定制 AI

把庞大的 AI 从头重新训练太贵,但你又想为自己稍作调整;LoRA(Low-Rank Adaptation)通过冻结原始模型、只训练一个极小的附加部件(适配器),把可训练参数削减约 90%,实现了这个愿望。LoRA 让微调大幅更便宜、更快,并在 Stable Diffusion 等图像生成中作为添加角色或画风的小文件极受欢迎。本文用补丁的比喻来讲解。LoRA 是参数高效微调(PEFT)的代表:把庞大的原始权重冻结,在每一层插入一个小的附加矩阵,只训练它(W = W0 + BA,其中 W0 被冻结,BA 是新增的那一小部分)。它建立在这样一个发现之上:调整 AI 并不需要大的改动,低秩就足够。优势:可训练参数减少约 90%(在 GPT-3 规模下据报道少 10,000x)、更省 GPU 内存(约少 3x)、训练更快更便宜、合并适配器后不增加推理延迟、更不易过拟合。它最大的优势是适配器可更换:保留一个通用底座,按用途即时更换小巧的(几 MB)LoRA 文件(客户支持、公司语气、某个特定角色)。很多人第一次接触 LoRA 是在图像生成中,Stable Diffusion 上学会了角色、画风或主体的 LoRA 被广泛共享(添加画风、学会角色、轻巧易分享)。QLoRA 结合量化,在 4-bit 底座之上训练 LoRA,比标准 LoRA 省约 4x 内存,能在消费级 GPU(有时是 CPU)上微调庞大模型,且精度损失极小。相比全量微调(训练所有权重),LoRA 在训练的权重、成本、产出和适用场景上都不同;对大多数工作,LoRA 就足够。底座保持原样,风味小幅调出。文中数值引自公开资料,仅供参考。

什么是量化?把 AI 模型缩小,在你自己的机器上运行

什么是量化?把 AI 模型缩小,在你自己的机器上运行

一个庞大的 70B 模型不再需要数据中心的 GPU 机架,而能在家里一台游戏 PC 上运行,这要归功于量化——它降低模型权重的数值精度,从而大幅缩小体积和内存。模型蒸馏是把知识转移到另一个更小的模型,而量化则是让同一个模型变轻。本文用照片压缩的比喻来讲解。量化把以 FP16/FP32 小数存储的权重替换成 INT8(8 位)或 INT4(4 位)整数,减少每个权重的字节数(FP32=4、INT8=1、INT4=0.5);就像把 RAW 照片压成 JPEG,你牺牲一点点精度换来大幅减重,令人惊讶的是放弃的东西竟然这么少。在内存上,4-bit 约为 FP16 的四分之一:70B 模型从 ~140GB 降到 ~35GB,8B 模型在 4-bit 下约 ~4.5-5GB,能塞进中端 8GB VRAM 的 GPU 用于本地运行(LLM 的民主化)。在精度上,INT8 几乎无损,INT4 在一般问答/常识类任务上退化不到 4%,但在数学、代码生成和高难度推理上损失更明显(表现为困惑度小幅上升),所以要按任务选位宽。主要方法:GPTQ(精确 4-bit 的先驱)、AWQ(保护最重要的约 ~1% 权重,往往精度高 1-2% 且更快)、GGUF(llama.cpp/Ollama 格式,Q2_K-Q8_0,CPU+GPU 混合,用于本地)和 QLoRA(4-bit 基础加 LoRA,在消费级 GPU 上微调)。它与蒸馏(转移到另一个小模型)和微调(增添任务知识)不同,三者通常组合使用(量化蒸馏后的模型;在量化基础上微调)。开始时,用 Ollama 一条命令跑一个 GGUF 模型,按 VRAM 选 Q4/Q8,代码或精确计算避开 INT4。多数主流模型已以量化形式发布,下载即用。保留聪明,只去掉重量。文中数字引用自公开资料,仅供方向参考。