Claude Fable 5.1 正式发布:基准测试提升与 Agent 成本大幅降低

ADK Atoms官方 / ADK编译 2026-09-02 5 分钟 35 次浏览
速览导读 / Summary

Anthropic 于 2026 年 9 月 1 日正式发布 Claude Fable 5.1 及 Claude Mythos 5.1。Fable 5.1 在多项基准测试中表现显著提升,特别是在终端编程、科学代理任务和长程推理方面。同时,Anthropic 大幅优化了计费结构,缓存命中价格降至 0.25 美元/百万 token,预计可为高频缓存读取的 Agent 工作负载节省 25%-45% 的成本。

缓存命中价格 $0.25 / MTok 较前代降低 75%
终端编程基准 55.8% Terminal-Bench 4.0 得分
预计成本节省 25-45% 针对高频缓存 Agent 工作负载
发布状态 GA & Trusted Access Fable 5.1 全面开放,Mythos 5.1 受限访问

Key Insights / 核心看点

  • 1 Claude Fable 5.1 在终端编程、科学代理及长程推理任务中基准测试得分显著提升,特别是在 CursorBench 和 OSWorld 中表现卓越。
  • 2 缓存命中价格大幅降低至 $0.25/百万 token,预计为高频缓存读取的 Agent 工作负载节省 25%-45% 的成本。
  • 3 模型支持 Low/Medium/High 三种 Effort 级别,允许开发者根据任务复杂度动态平衡性能与成本,避免过度配置。
  • 4 发布两款差异化模型:Fable 5.1 面向通用生产环境,Mythos 5.1 专为网络安全与生命科学领域设计,提供合规的安全保障。

Claude Fable 5.1 正式发布:基准测试提升与 Agent 成本大幅降低

Anthropic 于 2026 年 9 月 1 日正式推出了 Claude Fable 5.1Claude Mythos 5.1。这两款模型共享同一底层架构,但在安全策略和应用场景上有所区分:Fable 5.1 面向通用生产环境,已全面开放;Mythos 5.1 则仅限经过批准的网络安全和生命科学领域的可信访问。

此次发布不仅带来了模型能力的实质性飞跃,更通过重构计费模型,显著降低了长期运行 Agent 的经济成本,为开发者和企业级应用提供了极具吸引力的升级方案。

核心突破与功能特性

1. 全面的基准测试提升

Fable 5.1 在 Anthropic 发布的七大关键领域均取得了优于 Fable 5 的成绩,特别是在需要深度推理和工具调用的场景中表现突出。

  • 终端编程与科学代理:在 Terminal-Bench-Science 0.1 中,Fable 5.1 得分达 52.6%,相比 Fable 5 的 24.7% 实现了翻倍增长;在 CursorBench 3.2.0 中,得分提升至 73.4%
  • 复杂任务解决能力:模型更倾向于解决根本问题而非走捷径,在罕见崩溃调试、多小时代码实现及长周期实验循环中表现优异。
  • 跨学科推理:在 OSWorld 2.0 部分任务中得分 77.9%,在 Humanity's Last Exam 无工具模式下达到 60.9%

2. 革命性的成本优化策略

这是本次发布最具商业价值的部分。Anthropic 大幅调整了缓存(Cache)的计费标准,直接针对长程 Agent 的痛点进行优化。

  • 缓存价格暴跌:缓存命中(Cache Hits)价格从 $1/百万 token 降至 $0.25/百万 token(降幅达 75%)。
  • 成本节省估算:对于典型的 Agent 工作负载,Anthropic 预计节省约 25% 的成本;对于高度依赖缓存的复杂代理任务,节省幅度最高可达 45%

3. 灵活的 Effort 级别策略

Fable 5.1 支持 Low、Medium 和 High 三种 Effort 级别。用户无需总是选择最高配置,在中等或低 Effort 下即可在部分工作负载上达到与 Fable 5 相当的成本效益比,帮助团队根据任务复杂度动态调整资源。

对开发者与用户的实际价值

  • 降低长期运维成本:对于需要持续读取仓库、重放工具结果和保持长上下文记忆的 Coding Agents,缓存价格的降低将直接转化为可观的 ROI。
  • 提升复杂任务成功率:更高的基准分意味着在调试、科研和复杂工作流中,模型更有可能一次性正确完成任务,减少人工干预。
  • 明确的安全边界:Mythos 5.1 的推出为敏感行业(如医疗、安全)提供了符合合规要求的高性能模型选择,无需担心通用模型的数据泄露风险。

关键指标 (Metrics)

指标 数值/描述
缓存命中价格 $0.25 / 百万 tokens (较前代降低 75%)
终端编程基准 (Terminal-Bench) 55.8% (Fable 5.1) vs 42.0% (Fable 5)
科学代理基准 (Terminal-Bench-Science) 52.6% (Fable 5.1) vs 24.7% (Fable 5)
预计成本节省 25% - 45% (针对高频缓存工作负载)
发布状态 Fable 5.1: 全面开放 (GA); Mythos 5.1: 仅限可信访问

官方引言

"This combination—stronger long-horizon work plus cheaper repeated context—matters for coding agents that continuously reread repositories, tool results, plans, tests, and prior steps."

—— Anthropic 官方团队,关于 Fable 5.1 架构与经济模型优化的说明


注:基准测试数据基于 Anthropic 提供的特定条件,非绝对通用排名。实际效果可能因任务版本、Harness 配置及环境差异而有所不同。

This combination—stronger long-horizon work plus cheaper repeated context—matters for coding agents that continuously reread repositories, tool results, plans, tests, and prior steps.

Anthropic 官方团队

同主题深度资讯

查看更多 →
模型发布 2026-09-08

Framer AI 发布 CMS List Field:重构重复内容管理,赋能动态网站构建

Framer 于 2026 年 9 月正式发布 CMS List Field,彻底革新了重复内容(如 FAQ、产品特性)的管理方式。该更新引入原生列表字段,支持通过 Framer Agent 一键迁移旧数据,并优化了编辑器的内容复用与排序能力。此次更新不仅解决了垂直视频嵌入等长期存在的 Bug,还显著提升了大型 CMS 集合的滚动性能,为开发者提供了更强大的动态内容构建工具。

Framer AI官方 / ADK编译 4 分钟
模型发布 2026-09-08

Ajelix 自研 GPU 基础设施并推出企业级 Agentic 平台,解决数据主权与生产落地难题

Agentic AI 平台 Ajelix 宣布投资自建 GPU 计算基础设施,并正式发布面向企业的 Ajelix Enterprise Platform。此举旨在解决企业级 AI 落地中数据不可控、审计困难及中断风险等痛点。新平台提供从智能体编排、RAG 知识库到严格治理的全栈能力,支持私有化部署,助力企业将 AI 从实验阶段平稳过渡到生产运营。

Ajelix官方 / ADK编译 4 分钟
AI 工具 2026-09-08

DreamFace 发布 AI 直播生成器:零设备打造虚拟主播,重塑内容创作流程

DreamFace 正式推出 AI 直播生成功能,彻底消除传统直播对相机、灯光及推流软件的依赖。用户仅需上传照片或选择虚拟形象,配合脚本即可在数分钟内生成具备真实直播节奏与能量的视频。该工具支持游戏、带货、播客等多种模板,让创作者无需露脸即可测试新内容形式,大幅降低内容生产的门槛与试错成本。

DreamFace官方 / ADK编译 3 分钟
技术解读 2026-09-08

Accio Work 发布 F1 电视转播技术深度解析:8K 流媒体与超低延迟架构揭秘

Accio Work 深度编译 F1 TV 如何永久改变体育转播的历程,聚焦于日本市场策略、8K 流媒体技术革新及超低延迟架构。文章揭示了现代体育直播对带宽、编码及 CDN 的极致要求,包括 45% 的带宽消耗增长和亚 200ms 延迟标准。同时探讨了数字观众如何驱动 23 亿美元的周边销售,为开发者与架构师提供了从传统广播向数字化、智能化转型的宝贵案例与技术指标参考。

Accio Work官方 / ADK编译 3 分钟
agent · 免费
★ 5.0 · 120评测
A

Atoms

第一支自动构建真实业务的 AI 团队

Atoms 是一支“AI Vibe Business Team”,由 MetaGPT 和OpenManus团队打造,不仅只是一个代码工具。你给出一个想法或业务需求,Atoms 会用多角色智能体协作完成从 0 到 1 的关键链路:市场与竞品研究、产品方案、设计与开发、上线部署,以及后续的内容与增长支持。 如果你厌倦了只得到原型或一堆代码片段,Atoms 的目标是把结果推到更后面:交付一个能真正跑起来的产品。

查看 Atoms 使用教程与功能