Skip to yearly menu bar Skip to main content


Oral Tue, Oct 6, 2026 • 3:30 PM – 3:45 PM PDT Grand Ballroom

A Unified View of Attention and Residual Sinks: Outlier-Driven Rescaling is Essential for Large Language Model Training

Zihan Qiu ⋅ Zeyu Huang ⋅ Kaiyue Wen ⋅ Peng Jin ⋅ Bo Zheng ⋅ Yuxin Zhou ⋅ Haofeng Huang ⋅ Zekun Wang ⋅ Xiao Li ⋅ Huaqing Zhang ⋅ Yang Xu ⋅ Haoran Lian ⋅ Siqi Zhang ⋅ Rui Men ⋅ jianwei zhang ⋅ Ivan Titov ⋅ Dayiheng Liu ⋅ Jingren Zhou ⋅ Junyang Lin

Abstract

Log in and register to view live content