数学科研梯顶C
Kimina-Prover:不挂搜索树,靠整证生成 RL 把 miniF2F 推到 92.2%
Moonshot AI 与 Numina 的 Lean 4 定理证明线,立场逆主流:训练与推理均无 prover 中间反馈,不用 MCTS、价值函数与过程奖励模型(arXiv:2504.11354),搜索内化成一次整证生成;Formal Reasoning Pattern 先写结构化自然语言草稿再落 Lean 代码,把稀疏二值奖励重述成语言问题。底座 Qwen2.5-72B、上下文 32K。两代分开读:Preview(2025-04)miniF2F-test 80.7%(pass@8192);72B(2025-07-10)加 TTRL 搜索与错误修复后 92.2%,是收录时最高公开读数,卡片取此数,同口径 pass@1 仅 63.9%。等预算 pass@1/32/1024 为 63.9/84.0/87.7,三档全领先 671B DeepSeek-Prover-V2(61.9/82.4/86.6)。打折:对照表由 Kimina 团队发布、DeepSeek 两行为其复跑;仓库未声明许可证;miniF2F 仅 244 题且已过 92%,区分度在衰减。该域无第三方榜,读数只读作方向。置信度 C(厂商宣称):未在固定 commit 复算。
92.2%miniF2F(TTRL 搜索后)厂商宣称 · 2025-07
Kimina-Prover:不挂搜索树,靠整证生成 RL 把 miniF2F 推到 92.2%