Agentic RL Daily

VOL. 003

5 条研究信号

每日期刊 / 日期快照

今日未发现实质性新增,异步训练稳定性与工具边界仍是 Agentic RL 主线

今天核验了 arXiv、OpenReview 与官方 GitHub release 后,未发现足以改写主线的新论文、新版本或新部署。值得继续盯住的,仍是异步单条 rollout 的稳定性、工具使用训练的崩塌边界,以及开源训练栈对可观测性的补齐。

编辑部观察

本期三条判断

  1. 今天没有足够强的一手新增,继续把旧信号当成“延续观察”,而不是误写成今日突破。
  2. 异步训练的核心问题仍是稳定更新,而不是单纯把 rollout 跑得更快。
  3. 工具使用 RL 的边界问题还没有被真正解决,监督信号与奖励设计仍要联合看。

本期全文

本期全部资讯

归档时间 · 2026.07.12 09:00 CST

01

论文方法 / 异步训练

SAO 仍是今天最值得继续跟踪的异步 Agentic RL 主线

截至今天,SAO 仍是最近最实质性的新增信号:它用单条 rollout 采样、value model 训练设计与双侧 token clipping 来缓解异步训练的 off-policy 与震荡问题,并给出已接入开放 GLM-5.2 训练管线的部署线索。

异步训练在线学习训练稳定性
arXiv

03

安全稳定性 / 工具调用

多步工具使用 RL 的结构性崩塌问题今天依然没有过时

这条信号今天继续保留,不是因为它变新了,而是因为它仍是解释训练失败的最好证据之一:多步工具使用会因控制 token 概率异常而塌陷,监督信号能缓解,但并不等于问题已经彻底解决。

工具调用训练稳定性监督信号
arXiv

04

开源开源 / 训练框架

ROLL v0.3.0 仍代表可观测性与多模态训练栈的补齐方向

官方 release 还没有更新到更高版本,因此今天继续把 v0.3.0 作为延续观察样本。它把 AgentRunner 2.0、OTel 分布式追踪、多模态 RLVR 与 OPD 一起交付,说明开源栈的竞争点已经上移到完整基础设施。

系统基础设施可观测性多轮 Agent
GitHub