-+ 0.00%
-+ 0.00%
-+ 0.00%

近日,星尘智能 基座模型团队发布能异步执行的在线强化学习框架 SmoothRL。解决的是大模型异步推理成为真实部署常态后,与之适配的online RL到底该从哪些动作里学。SmoothRL 首次将这类异步online RL放到真实高动态投掷任务中验证,进一步证明在线学习不仅能用于高精度修正,也能适配连续加速、精确释放、不能停顿的动态操作。

智通财经·09/04/2026 02:09:05
语音播报
近日,星尘智能 基座模型团队发布能异步执行的在线强化学习框架 SmoothRL。解决的是大模型异步推理成为真实部署常态后,与之适配的online RL到底该从哪些动作里学。SmoothRL 首次将这类异步online RL放到真实高动态投掷任务中验证,进一步证明在线学习不仅能用于高精度修正,也能适配连续加速、精确释放、不能停顿的动态操作。