抱歉,您的浏览器无法访问本站
本页面需要浏览器支持(启用)JavaScript
了解详情 >

在标准 RL 训练循环中,生成(generation)和训练(training)顺序执行:策略模型先生成 rollout 样本,然后在这些样本上进行训练,往复循环。在生成阶段,训练侧处于空闲状态,反之亦然。 所谓 one-off pipelining 方法将生成阶段和训练阶段拆分为两个并行的协程,使模型能够一边生成新样本,一边对先前生成的数据进行训练,带来更高的 GPU 利用率和更大的训练吞...