Ring-Zero: Scaling Zero RL to a Trillion Parameters for Emergent Reasoning
arXiv · HuggingFace · ▲91
摘要(原文)
Reinforcement learning with verifiable rewards without human-annotated data, often referred to as zero RL, has emerged as a powerful paradigm for eliciting chain-of-thought reasoning. However, due to computational constraints, existing studies are largely restricted to small models, leaving the training dynamics and emergent capabilities at a large scale unexplored. To meaningfully explore this frontier, we aim to elicit high-quality reasoning behaviors from the model. However, we find that naive scaling often suffers from poor readability, token redundancy, and a lack of adaptive reasoning depth. To address these challenges, we present a stable and efficient training pipeline, incorporating algorithmic and system optimizations such as clipped importance sampling, training-inference ratio correction, and mixed-precision control. Our experiments offer three key findings that validate the "bitter lesson" of scaling: (1) scaling to 1T parameters significantly enhances sample efficiency and performance ceilings; (2) the training process progresses sequentially through an initial discovery phase followed by a sharpening phase; and (3) the model spontaneously develops advanced cognitive behaviors, including anthropomorphism, structured formatting, self-verification, parallel reasoning, and context anxiety, rendering hand-crafted heuristics redundant. Evaluated on seven mathematical benchmarks, Ring-2.5-1T-Zero achieves competitive performance. Additionally, to assess CoT quality beyond final-answer correctness, we propose a structured evaluation framework across three dimensions: comprehensibility, reproducibility, and efficiency, where our model demonstrates clear advantages in producing structured and concise reasoning traces. By sharing our observed emergent phenomena, we hope to provide the community with deeper insights into scaling behaviors, particularly at the 1-trillion scale.
摘要(中译)
无需人类标注数据的可验证奖励强化学习(通常称为零样本强化学习(zero RL))已成为引发链式思维推理的有力范式。然而,由于计算限制,现有研究主要局限于小型模型,大规模模型的训练动态和新兴能力仍未被探索。为了有意义地探索这一前沿领域,我们旨在从模型中引发高质量的推理行为。然而,我们发现简单扩展通常会导致可读性差、标记冗余和自适应推理深度不足。为应对这些挑战,我们提出了一个稳定高效的训练流程,结合了算法和系统优化,如裁剪重要性采样(clipped importance sampling)、训练-推理比率校正(training-inference ratio correction)和混合精度控制(mixed-precision control)。我们的实验提供了三个关键发现,验证了扩展的“苦涩教训”:(1)扩展到1万亿参数显著提高了样本效率和性能上限;(2)训练过程依次通过初始发现阶段,然后是锐化阶段;(3)模型自发地发展出高级认知行为,包括拟人化、结构化格式化、自我验证、并行推理和上下文焦虑,使手工设计的启发式方法变得多余。在七个数学基准测试上进行评估,Ring-2.5-1T-Zero取得了具有竞争力的性能。此外,为了评估链式思维(CoT)质量超越最终答案的正确性,我们提出了一个结构化评估框架,涵盖三个维度:可理解性、可重复性和效率,我们的模型在生成结构化和简洁的推理轨迹方面表现出明显优势。通过分享我们观察到的新兴现象,我们希望为社区提供关于扩展行为的更深入见解,特别是在1万亿规模上。
背景剖析
背景剖析
1. 技术背景与需求
链式思维(Chain-of-Thought, CoT)推理是当前大语言模型(LLM)解决复杂任务的核心能力,尤其在数学推理、代码生成等需要多步逻辑的场景中至关重要。传统方法依赖人工标注的推理数据(如监督微调)来引导模型学习,但这种方法成本高昂且难以覆盖所有任务场景。零强化学习(Zero RL)应运而生,它通过直接从预训练模型出发,利用可验证的奖励信号(如答案正确性)进行自主优化,避免了人工数据的限制。其目标是让模型自发涌现出高效的推理策略,例如在数学问题中逐步推导步骤、自我验证答案的正确性。然而,现有研究受限于计算资源,大多停留在小模型(如百亿参数级别),无法探索大规模模型(如万亿参数)的潜力。
2. 先前方法的局限性
尽管零RL展示了潜力,但现有方法存在三大问题:
- 可读性差:生成的推理过程缺乏逻辑结构,人类难以理解和验证;
- 冗余与效率低下:标准算法(如GRPO)倾向于奖励更长的输出,导致推理步骤冗余、计算资源浪费;
- 缺乏动态深度:固定响应预算限制了模型对不同复杂度任务的适应性,无法灵活调整推理深度。
此外,小模型的研究无法揭示大规模下的训练动态,例如是否会出现新的认知行为(如自我组织或并行推理)。
3. 本文的解决方案
针对这些问题,本文提出了一种针对万亿参数模型的零RL训练框架(Ring-Zero)。核心思路是通过轻量级算法与系统优化实现稳定训练:
- 算法改进:采用裁剪重要性采样(clipped importance sampling)避免长度偏差,结合训练-推理比率校正(training-inference ratio correction)激励高质量推理;
- 系统优化:使用混合精度计算和上下文并行技术提升训练效率;
- 自适应深度:通过分层训练(tier-based adaptive training)动态调整推理深度,适应不同任务需求。
这些优化无需复杂的工程改造,仅通过简单修改即可稳定训练万亿模型,并激发其自主涌现高级推理行为(如结构化格式、自我验证)。
4. 与前人的关键差异
本文的独特之处在于:
- 规模突破:首次验证了万亿参数下零RL的有效性,发现大规模模型会自发涌现人类级别的推理策略(如“情境焦虑”机制);
- 质量评估:提出多维度的CoT评估框架(可理解性、可复现性、效率),超越了仅关注最终答案的传统评估方式;
- 极简设计:相比依赖人工设计的启发式方法,本文通过纯强化学习训练,让模型自主优化推理过程,证明“规模即能力”的“苦涩教训”。
综上,本文通过技术优化与规模探索,为理解零RL在大模型中的行为提供了新视角,并展示了无监督推理的潜力。

































