欢迎光临
我们一直在努力

AReaL:全异步强化学习框架与推理大模型训练加速引擎


AReaL是什么

AReaL(Ant Reasoning RL)是蚂蚁技术研究院与清华大学交叉信息研究院联合开发的开源强化学习训练框架,作为全球首个实现全异步训练的推理大模型优化系统,其核心突破在于通过算法-系统协同设计(co-design),解决了传统同步强化学习在GPU利用率、训练周期和扩展性方面的三大痛点。项目于2025年2月首次开源,经过三个版本迭代后,最新发布的AReaL-boba²(v0.3)在Qwen3-14B模型上实现训练速度提升2.77倍,同时保持模型性能不变甚至提升。

区别于传统同步RL框架(如VeRL),AReaL创新性地采用可中断生成机制解耦PPO目标函数,将数据生成与模型训练完全解耦。实验证明,该系统在1.5B-32B参数范围的模型上均实现线性加速:在数学推理任务中,7B模型仅需25.4小时完成训练(对比基线57.7小时),AIME2024分数达63.1分;在代码生成任务中,14B模型以21.9小时训练时间达到LiveCodeBench 58.1分,刷新开源社区记录。项目已全面开源代码、数据集及模型权重,为推理大模型(LRM)的普惠化发展提供了基础设施级支持。

功能特色

AReaL在强化学习训练领域实现三大技术突破:

1. 全异步训练架构

传统系统如DeepCoder采用同步模式,而AReaL通过可中断Rollout Worker实现革命性突破:

  • 动态权重加载:生成过程中可中断并切换模型版本,KV缓存实时重组,中断延迟<0.1ms

  • 解耦数据流:训练器与生成器通过共享内存池通信,吞吐量提升35-73%(1.5B-32B模型)

  • 资源优化:在512张GPU集群上实现线性扩展,利用率从58%提升至92%

2. 低成本高性能训练

通过数据蒸馏技术实现极致性价比:

  • 极简数据需求:仅用200条数据复现QwQ-32B的78.8 AIME分数(原模型需5万条),成本200美元

  • 快速收敛:7B模型2天内完成RL训练,AIME2025分数48.3分,超越o1-Preview

  • 混合精度支持:FP16+FP32混合训练使显存占用降低40%

3. 多任务泛化能力

基于统一框架支持跨领域优化

  • 数学推理:1.5B模型在AMC23任务准确率从57.5%提升至70.0%

  • 代码生成:14B模型LiveCodeBench得分69.1,Codeforce Rating达2044

  • 智能体训练:原生支持多轮Agentic RL,交互延迟<300ms

AReal.webp

技术细节

1. 核心架构设计

异步训练系统

  • 四组件架构:生成器/评估器/训练器/经验池通过gRPC通信

  • 动态批处理:自动打包不同长度序列,填充率从51%提升至89%

  • 容错机制:训练中断后可从任意检查点恢复,数据丢失率<0.1%

关键算法创新

  1. 解耦PPO目标函数

    • 传统PPO:

    • AReaL改进:引入策略版本差异补偿项

  2. 陈旧性控制

    • 设置最大陈旧度η=4,优先消耗η范围内的旧数据

    • 实验显示η=8时性能下降仅2.3%(传统方法下降37%)

  3. 部分序列生成

    • 将长序列拆分为chunk(默认256token)

    • 通过KV缓存重组实现跨chunk一致性

2. 训练优化策略

三阶段训练流程

  1. 基础预训练

    • 数据:106k条数学/代码样本(AReaL-boba-106k数据集)

    • 硬件:128张H800 GPU,24小时完成1.5B模型训练

  2. 强化学习微调

    • 算法:异步PPO+KL散度约束(β=0.2)

    • 超参:学习率5e-6,batch size 1024,GAE λ=0.95

  3. 多任务迁移

    • 方法:冻结底层Transformer,仅微调注意力头

    • 效果:数学→代码任务迁移性能损失<15%

3. 性能评估

基准测试对比(AReaL-boba² v0.3)

任务/模型 指标 同步RL基线 AReaL提升
数学/7B AIME2024分数 63.0 +0.1
  训练时间 57.7小时 -55.9%
代码/14B LiveCodeBench 56.7 +1.4
  GPU利用率 58% +34%
智能体/32B 交互延迟 420ms -120ms

消融实验发现

  • 异步收益:1.5B模型在16GPU上训练时间从41h→14.8h

  • 数据蒸馏:200条数据即可达到全量数据92%性能

  • 解耦PPO:η=4时训练稳定性提升3.7倍

应用场景

AReaL的技术特性在多个领域产生变革性影响:

1. 教育领域

  • 个性化辅导:7B模型可实时生成解题思路(某在线教育平台响应时间从3s→0.8s)

  • 自动评分:数学证明题评估准确率达89%(传统方法72%)

2. 工业研发

  • 代码补全:14B模型在内部代码库补全准确率提升至71%(GitHub Copilot 68%)

  • 设计优化:通过RL训练实现芯片布局面积减少12%

3. 科学研究

  • 定理证明:在Coq框架下自动证明成功率提升28%

  • 文献分析:32B模型可生成符合学术规范的文献综述(人工审核通过率82%)

相关链接

  • 论文地址:https://arxiv.org/pdf/2505.24298

  • 代码仓库:https://github.com/inclusionAI/AReaL

  • 模型数据:https://huggingface.co/collections/inclusionAI/areal-boba-2-683f0e819ccb7bb2e1b2f2d5

总结

AReaL作为全球首个全异步强化学习训练框架,通过可中断生成机制与解耦PPO算法,在Qwen3-14B模型上实现2.77倍训练加速与69.1的LiveCodeBench分数,其开箱即用的200美元低成本方案与全面开源的技术栈,已成功应用于教育辅导、工业编程、科研分析等领域,为推理大模型的普惠化发展树立了新的技术标杆。

赞(0) 打赏
未经允许不得转载:王子主页 » AReaL:全异步强化学习框架与推理大模型训练加速引擎

评论 抢沙发

觉得文章有用就打赏一下文章作者

非常感谢你的打赏,我们将继续提供更多优质内容,让我们一起创建更加美好的网络世界!

支付宝扫一扫

微信扫一扫

登录

找回密码

注册