蚂蚁 Ring-Zero:把 Zero RL 扩到万亿参数,涌现出自我验证等推理行为
蚂蚁集团技术团队 7 月 14 日在 arXiv 挂出论文《Ring-Zero: Scaling Zero RL to a Trillion Parameters for Emergent Reasoning》(v2 于 7 月 16 日修订),首次将「无人工标注数据、仅靠可验证奖励」的 Zero RL 训练范式扩展到 1 万亿参数规模。此前受算力限制,Zero RL 研究大多停留在小模型,大规模训练动力学与涌现能力基本是空白。
论文给出的三个核心结论直接验证「scaling 的苦涩教训」:其一,扩到 1T 参数显著提升样本效率与性能天花板;其二,训练过程呈「先探索发现、后收敛锐化」的两阶段演进;其三,模型自发涌现出拟人化表达、结构化排版、自我验证、并行推理乃至「上下文焦虑」等高级认知行为——许多手工设计的启发式规则在大规模下变得多余。针对 naive scaling 常见的可读性差、token 冗余、推理深度不自适应等问题,团队给出了含裁剪重要性采样、训推比校正、混合精度控制的稳定高效训练管线。
基于 Ring-2.5-1T 训练的 Ring-2.5-1T-Zero 在七个数学基准上取得有竞争力的成绩。团队还提出一套超越「最终答案正确性」的 CoT 质量结构化评估框架,用于衡量推理链本身的优劣。论文 7 月 17 日登上 Hacker News 热榜前列(60+ 分),社区关注点集中在「万亿参数 + 纯 RL 无 SFT」路线对开源推理模型的示范意义。
需要说明的是,目前成绩为团队自报、尚待第三方独立复现验证;论文未披露 Ring-2.5-1T 基座是否开源权重。若路线坐实,意味着继 DeepSeek R1 之后,国产团队在「Zero RL 规模化」方向上又迈出标志性一步。