博客
分类
标签
归档
友链
关于
博客
分类
标签
归档
友链
关于
Volantis
项目
笔记
专栏
博客
社区
源码
异步rl:pause/resume
在标准 RL 训练循环中,生成(generation)和训练(training)顺序执行:策略模型先生成 rollout 样本,然后在这些样本上进行训练,往复循环。在生成阶段,训练侧处于空闲状态,反之亦然。 所谓 one-off pipelining 方法将生成阶段和训练阶段拆分为两个并行的协程,使模型能够一边生成新样本,一边对先前生成的数据进行训练,带来更高的 GPU 利用率和更大的训练吞...
2026-08-20
Infra
Infra
阅读全文