Skip to yearly menu bar Skip to main content


Poster Thu, Oct 8, 2026 • 4:40 PM – 6:30 PM PDT Grand Ballroom #107

Stabilizing Off-Policy Training for Long-Horizon LLM Agents via Turn-Level Importance Sampling and Clipping-Triggered Normalization

Chenliang Li ⋅ Adel Elmahdy ⋅ Alex J Boyd ⋅ Zhongruo Wang ⋅ Siliang Zeng ⋅ Alfredo Garcia ⋅ Parminder Bhatia ⋅ Taha Kass-Hout ⋅ Cao Xiao ⋅ Mingyi Hong

Abstract

Log in and register to view live content