Agentic RL Daily

VOL. 002

7 条研究信号

每日期刊 / 日期快照

单条 rollout 异步训练开始走向可部署,Agentic RL 的新瓶颈转向稳定性与观测

今天最值得关注的不是“异步”本身,而是它开始拿出可复现的稳定性方案:当单条 rollout、值模型训练、双侧 token clipping 与真实部署闭环连在一起,Agentic RL 才从吞吐优化迈向持续在线学习。

编辑部观察

本期三条判断

  1. 单条 rollout 正在替代 group-wise 采样,成为异步 agent 训练的新默认候选。
  2. 训练系统的核心价值不再只是提吞吐,而是控制 off-policy 漂移与结构化工具调用崩塌。
  3. 开源框架竞争已经上移到可观测性、异步 rollout、多模态与蒸馏协同的基础设施层。

本期全文

本期全部资讯

归档时间 · 2026.07.11 09:00 CST

01

论文方法 / 异步训练

SAO 把异步 Agentic RL 从吞吐优化推进到稳定训练

论文用单条 rollout 采样替代 group-wise 方案,并配合 value model 训练设计与双侧 token clipping,缓解异步场景下的 off-policy 与训练震荡问题;作者报告其方案已用于开放 GLM-5.2 的 agentic RL 训练管线。

异步训练在线学习训练稳定性
arXiv

03

安全稳定性 / 工具调用

多步工具使用 RL 会出现结构性崩塌,单靠 RL 不够稳

论文指出,多步工具调用训练会因特定控制 token 概率异常飙升而突然塌陷;交错加入监督信号能显著稳住训练,但会带来格式与内容 OOD 下的泛化折损,提醒工程团队不要把“更稳”误判成“已解决”。

工具调用训练稳定性监督信号
arXiv

05

开源开源 / 训练框架

ROLL v0.3.0 把 AgentRunner 2.0、OTel 与多模态 RLVR 一次性补齐

阿里巴巴在 v0.3.0 中加入 AgentRunner 2.0、OpenTelemetry 分布式追踪、Video/Audio RLVR、Router Replay 与 Multi-Teacher OPD,说明开源训练栈正在把“可观测 + 多轮 agent + 多模态”作为一体化能力交付。

系统基础设施可观测性多轮 Agent
GitHub

06

开源开源 / 训练框架

OpenRLHF v0.10.4 继续围绕训练内核和依赖栈做快迭代

最新 release 虽然不是范式级更新,但直接升级 vLLM 0.22.1、DeepSpeed 0.19.1,并修复 token-level loss 聚合与 scheduler 兼容性,反映出 Agentic RL 框架进入“稳定性和兼容性持续修补”的工程周期。

系统基础设施异步训练工程迭代
GitHub