Skip to content
← 标签

#Agentic Work (1)

推理开发梯顶A

Claude Fable 5.1:换一把尺子才登顶的长时程 agentic 档

Anthropic 面向 demanding reasoning and long-horizon agentic work 的固定版本(claude-fable-5-1,退役不早于 2027-09-01):默认思考强度 high、$10/$50,是同门 Opus 5.5 的 2.5 倍,默认 high 即默认成本行为。地位靠换尺子才成立:Arena Agent 净改进第 1(13.71,confirmed_success 19.83、praise 31.83),第 2 是 GPT-6 Astra(11.54/17.70/32.79),Opus 5.5 未进前八;Terminal-Bench 4.0 第 2、57.88%(n=330),比榜首 Astra 的 58.18% 低 0.3 点,而 pass@5 0.7879 高于其 0.7121,单次略低、五次更稳;智能指数 max 档 53.35 排第 4。画像一致:复合智能非第一,把真实任务往前推进是第一。praise 单列说明该榜含人评成分,非客观基准。选型看负载难在推理还是长程。闭源只走 API。置信度 A(已确认);未在自有 harness 上跑长任务对照。

13.71Arena Agent 净改进已确认 · 2026-09
产品Anthropic官网
Claude Fable 5.1:换一把尺子才登顶的长时程 agentic 档