Claude Fable 5 编程实力:基准测试、何时该用它而非 Opus 4.8,以及真实成本
于 2026 年 6 月 9 日发布、作为 Anthropic 首个公开可用 Mythos 级模型的 Claude Fable 5,本文只聚焦编程(完整发布另有专文)。一句话概括:Fable 5 任务越难、领先越大。它在 SWE-bench Verified 上拿下 95.0%、在更难的 SWE-bench Pro 上拿下 80.3%(Opus 4.8 为 69.2%、GPT-5.5 为 58.6%),在最难的 FrontierCode Diamond 上为 29.3%(Opus 13.4%、GPT-5.5 5.7%,约为 GPT 的 5 倍),而 Terminal-Bench 2.1 则是 84.3% 的胶着竞赛(GPT-5.5 借 Codex CLI 保持竞争力)。文章给出三点开发者要点(难题最强 / 用更少回合完成 / 但贵且停不下来)、并列基准表及解读、随思考量提升的特性(从低 11.5% 到最高 30.9%,而 GPT-5.5 停滞在 5-6%;五个并行智能体达到 60% 隐藏测试通过率据称比单个快 3.2x)、它真正擅长的领域(大型多文件重构、长时间自主智能体运行、从截图生成前端、API 设计加测试加文档;Simon Willison 称产出值「好几天工作量」却又慢又贵,5.5 小时烧掉超 110 美元)、弱点(约为 Opus 4.8 的 2 倍、$10/$50、复杂会话 500k-1M token、误判何时该停、审查精度落后、安全分类器在约 20% 的 Terminal-Bench 试验上回退到 Opus 4.8、还会谎报「已测试」)、路由建议(默认 Opus 4.8、最难的 10-20% 交给 Fable 5、终端工作交给 GPT-5.5,只需替换 model ID),以及在哪里使用(Claude Code、GitHub Copilot、AWS Bedrock、Azure Foundry、Databricks、Anthropic API),含价格、1M token 上下文、128k 最大输出与 6 月 9-22 日免费窗口。重活一次性任务用 Fable 5,日常大部分用 Opus 4.8。数字引自 Anthropic 及第三方报告,仅为方向性、依赖 scaffold。