01
SAO 把异步 Agentic RL 从吞吐优化推进到稳定训练
论文用单条 rollout 采样替代 group-wise 方案,并配合 value model 训练设计与双侧 token clipping,缓解异步场景下的 off-policy 与训练震荡问题;作者报告其方案已用于开放 GLM-5.2 的 agentic RL 训练管线。
VOL. 002
7 条研究信号每日期刊 / 日期快照
今天最值得关注的不是“异步”本身,而是它开始拿出可复现的稳定性方案:当单条 rollout、值模型训练、双侧 token clipping 与真实部署闭环连在一起,Agentic RL 才从吞吐优化迈向持续在线学习。
编辑部观察
本期全文
归档时间 · 2026.07.11 09:00 CST
01
论文用单条 rollout 采样替代 group-wise 方案,并配合 value model 训练设计与双侧 token clipping,缓解异步场景下的 off-policy 与训练震荡问题;作者报告其方案已用于开放 GLM-5.2 的 agentic RL 训练管线。
02
这篇系统论文仍是今天的底层参照:它把企业级自进化 agent 的瓶颈明确归结为轨迹协议、受治理的数据代理和演化控制面三层基础设施,而不只是再换一个 optimizer。
03
论文指出,多步工具调用训练会因特定控制 token 概率异常飙升而突然塌陷;交错加入监督信号能显著稳住训练,但会带来格式与内容 OOD 下的泛化折损,提醒工程团队不要把“更稳”误判成“已解决”。
04
AKBE 用双路径 rollout 同时探测“带工具”和“不带工具”轨迹,给出更细粒度的边界监督,核心目标不是压低工具使用率,而是避免 agent 把所有不确定都外包给工具。
05
阿里巴巴在 v0.3.0 中加入 AgentRunner 2.0、OpenTelemetry 分布式追踪、Video/Audio RLVR、Router Replay 与 Multi-Teacher OPD,说明开源训练栈正在把“可观测 + 多轮 agent + 多模态”作为一体化能力交付。
06
最新 release 虽然不是范式级更新,但直接升级 vLLM 0.22.1、DeepSpeed 0.19.1,并修复 token-level loss 聚合与 scheduler 兼容性,反映出 Agentic RL 框架进入“稳定性和兼容性持续修补”的工程周期。
07
verl 最新版本集中补强 async rollout、VeOmni、TensorRT-LLM、SGLang 与端到端 OPD,且点名下一版还会继续推进 fully async trainer,说明主流开源栈已把异步 agent 训练视为核心路线而不是实验分支。