Skip to content
←返回能力前沿雷达

SOTA

LLM

基座模型这一层:权重本身,加上与之紧耦合的训练配方(预训练、后训练、RL/RLHF)、架构与长上下文、以及推理服务栈与每 token 成本

尺子智能:Artificial Analysis 智能指数、GPQA、MMLU-Pro、Arena Elo。容量:有效长上下文召回、模态。供给:tok/s、$/1M tokens、开放权重许可

SOTA 阶梯

6
推理开发梯顶A

Claude Opus 5.5:用 1M 上下文与自适应思考把 agentic 主力档压到 $4/$20

Anthropic 面向 long-running agentic coding and knowledge work 的固定版本(claude-opus-5-5,退役不早于 2027-09-22):上下文 1M、单次输出 128K、自适应思考默认 medium,$4/$20 每百万 tokens,梯顶三条里最便宜。Artificial Analysis 智能指数(2026-09-22,本站同步)前三行都是它的思考档(max 57.62、xhigh 55.99、high 53.58),默认 medium 51.24 排第 8,同门 Fable 5.1(53.35)与 Astra(52.67)夹在中间。两处打折:前三行带 with fallback、与 Astra 的 (max) 口径不同;Terminal-Bench 第 8 的 53.94% 属上一代 Opus 5。闭源只走 API;自适应思考是黑箱,成本按 p90 预算;1M 上下文不等于 1M 有效注意力。选型:多数负载用它,最高档拉满还不够才换 Fable 5.1(贵 2.5 倍、指数高 4.3 分)。置信度 A(已确认);未做能力复现。

57.62AA 智能指数已确认 · 2026-09
生产Anthropic官网
Claude Opus 5.5:用 1M 上下文与自适应思考把 agentic 主力档压到 $4/$20
推理开发梯顶C

Jev:TypeSafe 首个 System One Model,把决策做成类型安全并便宜两个数量级

TypeSafe 首个 System One Model:输出不是字符串而是 Noul/Choice/Score 三种提问原语下的类型安全结构化值,RLCD 训练校准决策概率。官方 13 问并行实验单次调用比拆 13 次便宜约 12.2 倍、快约 10.0 倍;四工作流平均准确率 67.8%、单例 0.0004 美元、0.4 秒,准确率与 opus 5 / sol 同档而成本离开近两个数量级;输入 0.042 美元/M tokens、输出免费。附 OpenJev 本机复现与八处毛边清单。

67.8%四工作流平均准确率(官方评测)厂商宣称 · 2026-09
产品TypeSafe官网Repo
Jev:TypeSafe 首个 System One Model,把决策做成类型安全并便宜两个数量级
推理开发梯顶A

MiMo-V2.6:把 Live RL 做成 30 步、75 万轨迹与美元的公开账本

小米开源 MiMo-V2.6 Pro/Flash:30 步 Live RL、约 75 万条轨迹、成本公开 850k/2.62M 美元,7k+ RL 环境同批开源;AA 智能指数 46 登顶开源阵营,DeepSWE v1.1 样本外 +17/+14 分;Vibe World、CUA、科研与内容创作四条演示线全开。自我改进从口号变成可核对账本:步数、轨迹数、美元都摊在桌面上,第三方可按同一口径复算性价比。

46AA 智能指数(开源榜首)已确认 · 2026-09
产品Xiaomi官网Repo
MiMo-V2.6:把 Live RL 做成 30 步、75 万轨迹与美元的公开账本
推理开发梯顶A

Claude Fable 5.1:换一把尺子才登顶的长时程 agentic 档

Anthropic 面向 demanding reasoning and long-horizon agentic work 的固定版本(claude-fable-5-1,退役不早于 2027-09-01):默认思考强度 high、$10/$50,是同门 Opus 5.5 的 2.5 倍,默认 high 即默认成本行为。地位靠换尺子才成立:Arena Agent 净改进第 1(13.71,confirmed_success 19.83、praise 31.83),第 2 是 GPT-6 Astra(11.54/17.70/32.79),Opus 5.5 未进前八;Terminal-Bench 4.0 第 2、57.88%(n=330),比榜首 Astra 的 58.18% 低 0.3 点,而 pass@5 0.7879 高于其 0.7121,单次略低、五次更稳;智能指数 max 档 53.35 排第 4。画像一致:复合智能非第一,把真实任务往前推进是第一。praise 单列说明该榜含人评成分,非客观基准。选型看负载难在推理还是长程。闭源只走 API。置信度 A(已确认);未在自有 harness 上跑长任务对照。

13.71Arena Agent 净改进已确认 · 2026-09
产品Anthropic官网
Claude Fable 5.1:换一把尺子才登顶的长时程 agentic 档
推理开发梯顶A

GPT-6 Astra:终端工程任务第一,复合智能第三梯队

OpenAI 旗舰档,官方定位 hardest end-to-end work(gpt-6-astra):上下文 1.05M、单次输出 128K、知识截止 2026-04-30,内置 Functions、Web search、File search 与 Computer use,不必外拼 agent 框架。reasoning effort 五档而单价固定 $10/$50,成本杠杆在 token 侧;同门 Sol $2/$10、Luna $0.1/$0.5,100 倍价差可留在一家厂商内分流。第三方水位(2026-09-22):Terminal-Bench 4.0 第 1、58.18%(n_trials=330、pass@5 0.7121);Arena Agent 第 2,净改进 11.54、confirmed_success 17.70 低于榜首 Fable 5.1,praise 32.79 全场最高;智能指数第 6、7(max 52.67)。边界:知识截止比本页早近五个月,版本号与 API 变更须走 Web search;Computer use 可靠性不在任何榜上;闭源只走 API。置信度 A(已确认);未做能力复现。

58.18%Terminal-Bench 准确率已确认 · 2026-09
产品OpenAI官网
GPT-6 Astra:终端工程任务第一,复合智能第三梯队
推理开发C

Laya:421M 非自回归 System 1 决策模型,33 毫秒一次前向传播

Convai Innovations 开源的非自回归 System 1 决策模型:421M 参数、ModernBERT 主干加 [MASK] 选项抽取,一次前向 33 毫秒给出带校准概率的决策,Apache-2.0;RLCD 严格适当评分规则训练校准概率;模型卡附对 Jev 的真实基准对比与诚实限制清单。定位边缘与高并发小决策(游戏 NPC、对话策略、请求路由),不是长推理或开放生成。

33 ms单次前向延迟(421M,官方)厂商宣称 · 2026-09
研究Convai Innovations官网Repo
Laya:421M 非自回归 System 1 决策模型,33 毫秒一次前向传播

证据流

9
2026-09-12Sam Altman:AI 分水岭是记忆不是算力Sam Altman 称约半年内,下一代 ChatGPT 就能一直看你的屏幕、听你的会议与通话,把工作切片自动攒成完整上下文;分水岭不再是算力,而是记忆。2026-07-248美元ESP32-S3芯片运行2900万参数大模型开发者将2900万参数大语言模型塞入8美元的ESP32-S3微控制器,完全离线运行且功耗极低。2025-08-27ReST-RL:用统一自训练与价值引导搜索强化大模型推理GRPO 是当前提升大模型推理能力的代表性强化学习方法,但它只在整条轨迹末端拿到一个稀疏奖励:一旦同组采样得到的奖励彼此接近,组内相对优势就退化成噪声,策略几乎学不到东西。ReST-RL 把策略优化与价值引导搜索重新接回同一条自训练流水线。第一阶段 ReST-GRPO 先按奖励标准差过滤掉信息量低的提示词,再从每个提示词的最高奖励轨迹中按离散指数分布抽取若干前缀,把它们当作在线 GRPO 的新起点——前缀只作为上下文,后缀一律重新采样并优化,而不是拿来模仿。第二阶段 VM-MCTS 在这个已静态化的策略下用 MCTS 自采价值目标,训练一个预测期望终端奖励的价值模型,推理时同一个模型既用于 UCT 搜索分配,也用于最终 Best-of-N 排序,搜索与验证共享同一套状态价值尺度。在 APPS、BigCodeBench、HumanEval 等代码基准上,Qwen3-8B 的平均分从 0.503 提升到 0.689;在匹配策略与价值模型的对照实验里,ReST-GRPO + VM-MCTS 在 APPS-500 上得到 0.642,而 GRPO + VM-MCTS 只有 0.538,说明第一阶段带来的轨迹分布改善确实穿过了价值学习环节存活下来。端到端算力核算上,ReST-GRPO 用 1752 GPU 小时对 GRPO 的 2080 小时,在 71 小时而非 207 小时达到 9% 的提升。仅用代码轨迹训练出的价值模型,在不做目标域微调的情况下迁移到 MATH、Omni-MATH 与 GPQA-Diamond 同样带来增益。

怎么用

2026-09-22MiMo-V2.6 精读:6 天 Live RL、AA 指数 46 与全面开源的自我改进实验小米开源 MiMo-V2.6 Pro/Flash:30 步 Live RL、约 75 万条轨迹、$850k/$2.62M 成本公开;AA 指数 46 登顶开源,DeepSWE v1.1 样本外 +17/+14 分;Vibe World、CUA、科研与内容创作全演示,7k+ RL 环境一并开源。2026-09-21Laya 开源解读:421M 非自回归 System 1 决策模型,33 毫秒一次前向传播Convai Innovations 开源非自回归决策模型 Laya:ModernBERT 主干加 [MASK] 选项抽取,RLCD 严格适当评分规则训练校准概率;附 README 诚实限制与对 Jev 的真实基准。2026-09-20亲手构建自己的 Jev(100% 本地):用 SGLang 复现固定答案打分决策引擎用 SGLang /v1/score 在本地复现 Jev 式固定答案打分:单 token 标签、受限 softmax、置信度分流路由,并与结构化输出、自回归生成实测对照:单决策 6 ms 对 1088 ms。2026-09-18Jev 与 System One Model:把前沿智能做成一次函数调用TypeSafe 首个 System One Model Jev 精读:三种提问原语、并行经济学、置信度分层路由、官方评测偏差与八处毛边,附 OpenJev 本机复现。2026-09-01在 NVIDIA Jetson 上微调、转换并部署语言模型:Unsloth + llama.cpp 实战教程Jetson AI Lab 官方教程:用 Unsloth + JetPack 7.2 直接在 Jetson 上以内存高效的 QLoRA 微调模型,导出 GGUF 并用 llama.cpp 本地运行。两个实战案例:Jetson Orin Nano 上的 Qwen3.5-4B 视觉语言模型(LaTeX OCR 微调),以及 Jetson AGX Thor 上的 NVIDIA Nemotron 3.5 Lightning 30B-A3B(44.8 秒完成 3 步训练、Q4_K_M 量化后跑出 66.1 tokens/秒)。全程无需云端。2025-08-29拆解 vLLM:高吞吐大模型推理系统的解剖学——从引擎循环、Paged Attention 到多节点分布式服务vLLM 核心贡献者的系统拆解:从离线单进程引擎讲起,逐层覆盖调度器、Paged Attention 的 KV cache 分块、continuous batching、prefix caching、投机解码、P/D 分离,再到多卡执行器、两节点四副本分布式服务栈,以及 TTFT/ITL/goodput 与 roofline 模型下延迟与吞吐的取舍。

现在就能用的资产

这个域还没有挂上可直接装用的 skill。

消费它的领域

边界与失败模式

这个域的边界记录还没写。它应当回答三件事:当前卡在哪、什么情况下会坏、成本与延迟的量级。在这一段补上之前,梯顶的指标只说明它在这把尺子上领先,不说明它在你的任务上能用。