Skip to yearly menu bar Skip to main content


COLM 2026 Accepted Papers

Learning Human-Perceived Fakeness in AI-Generated Videos via Multimodal LLMs
Xingyu Fu ⋅ Siyi Liu ⋅ Yinuo Xu ⋅ Pan Lu ⋅ Viola (Guangqiuse) Hu ⋅ Tianbo Yang ⋅ Taran Anantasagar ⋅ Christopher Shen ⋅ Yikai Mao ⋅ Yuanzhe Liu ⋅ Keyush Shah ⋅ Chung U Lee ⋅ Yejin Choi ⋅ James Zou ⋅ Dan Roth ⋅ Chris Callison-Burch
MathDuels: Evaluating LLMs as Problem Posers and Solvers
Oscar Xu ⋅ Shibo Jin ⋅ Shreya Arya ⋅ Mayur Naik
Demystifying OPD: Length Inflation and Stabilization Strategies for Large Language Models
Feng Luo ⋅ Yu-Neng Chuang ⋅ Guanchu Wang ⋅ Zicheng Xu ⋅ Xiaotian Han ⋅ Tianyi Zhang ⋅ Vladimir Braverman
Improving Latent Generalization Using Test-time Compute
Arslan Chaudhry ⋅ Sridhar Thiagarajan ⋅ Andrew K Lampinen
Why Gaussian Diffusion Models Fail on Discrete Data?
Alexander Shabalin ⋅ Simon Elistratov ⋅ Viacheslav Meshchaninov ⋅ Ildus Sadrtdinov ⋅ Dmitry Vetrov
SWE-chat: Coding Agent Interactions From Real Users in the Wild
Joachim Baumann ⋅ Vishakh Padmakumar ⋅ Kevin Li ⋅ John Yang ⋅ Diyi Yang ⋅ Sanmi Koyejo
Loop, Think, and Generalize: Implicit Reasoning in Recurrent-Depth Transformers
Harsh Kohli ⋅ Srinivasan Parthasarathy ⋅ Huan Sun ⋅ Yuekun Yao
CeRA: Extreme Parameter Efficiency in Low-Rank Adaptation via Non-linear Expansion
Hung-Hsuan Chen
Switching Linear Attention
Hyun Dong Lee ⋅ Xavier Gonzalez ⋅ Nicolas Zucchet ⋅ E. Kelly Buchanan ⋅ Emily Fox ⋅ Scott Linderman
From Rebound to Remedy: Understanding and Mitigating Reward Hacking via Representation Engineering
Rui Wu ⋅ Ruixiang Tang
Differentiable Faithfulness Alignment for Cross-Model Circuit Transfer
Shun Shao ⋅ Binxu Wang ⋅ Shay B Cohen ⋅ Anna Korhonen ⋅ Yonatan Belinkov
Recursive Agent Optimization
Apurva Gandhi ⋅ Satyaki Chakraborty ⋅ Xiangjun Wang ⋅ Aviral Kumar ⋅ Graham Neubig
MS-GLA: Multi-Scale Gated Linear Attention for Addressing Representational Bottlenecks via Multi-Temporal Resolution
Prasoon Dev ⋅ Anirudh Sankar ⋅ Vasudeva Varma
A Rubric-Supervised Critic from Sparse Real-World Outcomes
Xingyao Wang ⋅ Valerie Chen ⋅ Heng Ji ⋅ Graham Neubig
T-REX: Mixture-of-Rank-One-Experts with Semantic-aware Intuition for Multi-task Large Language Model Finetuning
Rongyu Zhang ⋅ Yijiang Liu ⋅ Huanrui Yang ⋅ Shenli Zheng ⋅ Li Du ⋅ Dan Wang ⋅ Yuan Du ⋅ Shanghang Zhang
LPDS: Evaluating LLM Robustness Through Logic-Preserving Difficulty Scaling
Philipp Mondorf ⋅ Samuel J Bell ⋅ Jesse Dodge ⋅ Dieuwke Hupkes
CT-$\Delta$Bench: A Benchmark for Longitudinal 3D Medical Imaging Difference Reporting with Vision-Language Models
Kegeng Tang ⋅ Jingbo Wang ⋅ Shaogang Ren ⋅ Zihao WANG
Structure Before Collapse: Transient Semantic Geometry in Next-Token Prediction
Yize Zhao ⋅ Isabel Papadimitriou ⋅ Christos Thrampoulidis
Penalizing Length: Uncovering Systematic Bias in Quality Estimation Metrics
Yilin Zhang ⋅ Wenda Xu ⋅ Zhongtao Liu ⋅ Tetsuji Nakagawa ⋅ Markus Freitag
Teaching LLMs to Self-Evolve: Cultivating Core Meta-Skills with Reinforcement Learning
Shujin Wu ⋅ Cheng Qian ⋅ Xiusi Chen ⋅ Heng Ji
English is Not All You Need: Systematically Exploring the Role of Multilinguality in LLM Post-Training
Mehak Dhaliwal ⋅ Shashwat Ranjan Chaurasia ⋅ Yao Qin ⋅ Dezhi Hong ⋅ Thomas Butler
HISA: Efficient Hierarchical Indexing for Fine-Grained Sparse Attention
Yufei Xu ⋅ Fanxu Meng ⋅ Fan Jiang ⋅ Yuxuan Wang ⋅ Ruijie Zhou ⋅ Jiexi Wu ⋅ Zhixin Pan ⋅ Zhaohui Wang ⋅ Xiaojuan Tang ⋅ Wenjie Pei ⋅ Tongxuan Liu ⋅ di yin ⋅ Xing Sun ⋅ Muhan Zhang
InterviewSim: A Scalable Framework for Interview-Grounded Personality Simulation
Yu Li ⋅ Pranav Narayanan Venkit ⋅ Yada Pruksachatkun ⋅ Chien-Sheng Wu
Multilingual Embedding Probes Fail to Generalize Across Learner Corpora
Laurits Lyngbaek ⋅ Ross D Kristensen-McLachlan
QED-Nano: Teaching a Tiny Model to Prove Hard Theorems
Yuxiao Qu ⋅ Amrith Setlur ⋅ Jasper Dekoninck ⋅ Edward E Beeching ⋅ Jia LI ⋅ Ian Wu ⋅ Lewis Tunstall ⋅ Aviral Kumar
DeepThinkVLA: Enhancing Reasoning Capability of Vision-Language-Action Models
Cheng Yin ⋅ Yankai Lin ⋅ Wang Xu ⋅ Sikyuen Tam ⋅ Xiangrui Zeng ⋅ Zhiyuan Liu ⋅ Zhouping Yin
Voice of Reason: Reinforcement Learning for Spoken Math
Timothée Weisselberger ⋅ Edouard Grave ⋅ Alexandre Défossez
CoSearch: Joint Training of Reasoning and Document Ranking via Reinforcement Learning for Agentic Search
Hansi Zeng ⋅ Liam Collins ⋅ Bhuvesh Kumar ⋅ Neil Shah ⋅ Hamed Zamani
Towards Comprehensive Mobile Application Testing for User-centric Feature Coverage via Simulating Real-World Users with Personas
Ha Min Son ⋅ Huan Ren ⋅ Huan Song ⋅ Zhe Zhao ⋅ Xin Liu
Preference Redirection via Attention Concentration: An Attack on Computer Use Agents
Dominik Seip ⋅ Matthias Hein
Optical Context Compression Reconsidered
Ivan Lee ⋅ Cheng Yang ⋅ Taylor Berg-Kirkpatrick
V-DEAL: Diagnosing Video Safety De-Calibration as an Understanding--Refusal Coupling Failure
Zhetong Zhang ⋅ Honghao Fu ⋅ Miao Xu ⋅ Yiwei Wang ⋅ Yujun Cai
Tiny Aya: Bridging Scale and Multilingual Depth
Alejandro R Salamanca ⋅ Diana Abagyan ⋅ Daniel D'souza ⋅ Ammar Khairi ⋅ David Mora ⋅ Saurabh Dash ⋅ Viraat Aryabumi ⋅ Sara Rajaee ⋅ Mehrnaz Mofakhami ⋅ Ananya Sahu ⋅ Thomas Euyang ⋅ Brittawnya Prince ⋅ Madeline Smith ⋅ Hangyu Lin ⋅ Acyr Locatelli ⋅ Sara Hooker ⋅ Tom Kocmi ⋅ Aidan Gomez ⋅ Ivan Zhang ⋅ Phil Blunsom ⋅ Nicholas Frosst ⋅ Joelle Pineau ⋅ Beyza Ermis ⋅ Ahmet Üstün ⋅ Julia Kreutzer ⋅ Marzieh Fadaee
Training Proactive and Personalized LLM Agents
Weiwei Sun ⋅ Xuhui Zhou ⋅ Weihua Du ⋅ Xingyao Wang ⋅ Sean Welleck ⋅ Graham Neubig ⋅ Maarten Sap ⋅ Yiming Yang
AgentWorld: Benchmarking Long-Horizon Collaboration of Multi-agent LLMs
Raphael Shu ⋅ Yusen Zhang ⋅ Jeffrey (Young Min) Cho ⋅ Jin Mo Yang ⋅ Yuan Yuan ⋅ Wenliang Zheng ⋅ Sharath Chandra Guntuku ⋅ Lyle Ungar ⋅ Zhou Yu ⋅ Rui Zhang
Useless but Safe? Benchmarking Utility Recovery with User Intent Clarification in Multi-Turn Conversations
Mingqian Zheng ⋅ Malia Morgan ⋅ Liwei Jiang ⋅ Carolyn Rose ⋅ Maarten Sap
JMedEthicBench: A Multi-Turn Adversarial Benchmark for Japanese Medical Ethics Alignment in LLMs
Junyu Liu ⋅ Zirui Li ⋅ Qian Niu ⋅ Zequn Zhang ⋅ Yue Xun ⋅ Wenlong Hou ⋅ Shujun Wang ⋅ Yusuke Iwasawa ⋅ Yutaka Matsuo ⋅ Kan Hatakeyama-Sato
The Format Tax: Measuring and Mitigating the Cost of Structured Output
Ivan Lee ⋅ Loris DAntoni ⋅ Taylor Berg-Kirkpatrick
What AI Benchmarks Actually Measure: Adapting Convergent and Discriminant Validity to Interrogate Fifty-Six AI Benchmarks
Meera Desai ⋅ Sang Truong ⋅ Hanna Wallach ⋅ Alex Chouldechova ⋅ A. Feder Cooper ⋅ Jean Garcia-Gathright ⋅ Daniel Ho ⋅ Abigail Z Jacobs ⋅ Sanmi Koyejo ⋅ Nicholas Pangakis ⋅ Angelina Wang
SideQuest: Model-Driven KV Cache Management for Long-Horizon Agentic Workloads
Sanjay Kariyappa ⋅ G. Edward Suh
HieraSuite: A Holistic Toolkit for Building Versatile System-User Instruction Hierarchy
Liwei Jiang ⋅ Erick Galinkin ⋅ Makesh Narsimhan Sreedhar ⋅ Chong Xiang ⋅ Yejin Choi ⋅ Traian Rebedea ⋅ Christopher Parisien
$\pi^2$: Structure-Originated Reasoning Data Improves Long-Context Reasoning Ability of Large Language Models
Quyet V. Do ⋅ Thinh Pham ⋅ Nguyen P Nguyen ⋅ Sha Li ⋅ Pratibha Zunjare ⋅ Tu Vu
Disentangling MLP Neuron Weights in Vocabulary Space
Asaf Avrahamy ⋅ Yoav Gur-Arieh ⋅ Mor Geva
CollabSkill: Evaluating Human-Agent Collaboration On Real-World Tasks
Yijia Shao ⋅ Zora Wang ⋅ Neel Ahuja ⋅ Yicheng Wang ⋅ Bowen Liu ⋅ Diyi Yang
Beware What You Autocomplete: Forensic Attribution of Backdoored Code Completions
Anjun Gao ⋅ Yueyang Quan ⋅ Zhuqing Liu ⋅ Minghong Fang
SWE-Replay: Efficient Test-Time Scaling for Software Engineering Agents
Yifeng Ding ⋅ LINGMING ZHANG
Valley3: Scaling Omni Foundation Models for E-commerce
Zeyu Chen ⋅ Guanghao Zhou ⋅ Qixiang Yin ⋅ Ziwang Zhao ⋅ Huanjin Yao ⋅ Pengjiu Xia ⋅ Min Yang ⋅ Cen Chen ⋅ Minghui Qiu
FitText: Evolving Agent Tool Ecologies via Memetic Retrieval
Kyle Zheng ⋅ Han Zhang ⋅ Renliang Sun ⋅ Chenchen Ye ⋅ Wei Wang
SimulRAG: Simulator-based RAG for Grounding LLMs in Long-form Scientific QA
Haozhou Xu ⋅ Dongxia Wu ⋅ Matteo Chinazzi ⋅ Ruijia Niu ⋅ Rose Yu ⋅ Yian Ma
STATe-of-Thoughts: Structured Action Templates for Tree-of-Thoughts
Zachary E Bamberger ⋅ Till Raphael Saenger ⋅ Gilad Morad ⋅ Ofra Amir ⋅ Brandon M Stewart ⋅ Amir Feder
Metacognitive Abilities of LLMs: A Reality Check
Shashwat Singh ⋅ Tal Linzen ⋅ Shauli Ravfogel
Beyond Logit Adjustment: A Residual Decomposition Framework for Long-Tailed Reranking
Zhanliang Wang ⋅ Hongzhuo Chen ⋅ Quan M Nguyen ⋅ Mian U Ahsan ⋅ Kai Wang
Causal Drawbridges: Characterizing Gradient Blocking of Syntactic Islands in Transformer LMs
Sasha Boguraev ⋅ Kyle Mahowald
Source-Modality Monitoring in Vision-Language Models
Etha Tianze Hua ⋅ Tian Yun ⋅ Ellie Pavlick
Beyond Heuristics: A New Paradigm for Large Language Models Structured Pruning
Mengting Ai ⋅ Tianxin Wei ⋅ Sirui Chen ⋅ Jingrui He
A Diagnostic Failure Taxonomy and Trajectory Critic for Data Agent Improvement
Suchen Liu ⋅ Yuanfeng SONG ⋅ Jun Gao ⋅ Xing Chen
When Does Personality Composition Matter for Multi-Agent LLM Teams?
Aryan Keluskar ⋅ Amrita (Amy) Bhattacharjee ⋅ Huan Liu
Boosting Process-Correct CoT Reasoning by Modeling Solvability of Multiple-Choice QA
Raphael Schumann ⋅ Stefan Riezler
FOCUS: Closed-Loop Attention Feedback for Efficient Vision-Language Understanding
Akul Santhosh ⋅ Aastha Jhunjhunwala
How well do Large Language Models express and recognize value-conditioned behavior?
Maryam Ghorbansabagh ⋅ Eugene Yu Ji ⋅ Amir-Hossein Karimi ⋅ Igor Grossmann
Efficient Safety Alignment of Language Models via Latent Personality Traits
Mohamed Amine Merzouk ⋅ Nolan Smyth ⋅ Damiano Fornasiere ⋅ Linh Le ⋅ David Williams-King ⋅ Adam Oberman
The Depth Ceiling: On the Limits of Large Language Models in Discovering Latent Planning
Yi Xu ⋅ Philipp Jettkant ⋅ Laura Ruis
OpenSeeker: Democratizing Frontier Search Agents by Fully Open-Sourcing Training Data
Yuwen Du ⋅ Rui Ye ⋅ Shuo Tang ⋅ Xinyu Zhu ⋅ Yijun Lu ⋅ Yuzhu Cai ⋅ Siheng Chen
LeanGeo: Formalizing Competitional Geometry problems in Lean
Chendong Song ⋅ Zihan Wang ⋅ Frederick Pu ⋅ Haiming Wang ⋅ Xiaohan Lin ⋅ Junqi Liu ⋅ Jia LI ⋅ Zhengying Liu
Agent Alpha: Unifying Generation, Exploration and Evaluation via Tree Search for Computer-Use Solution Discovery
Sizhe Tang ⋅ Rongqian chen ⋅ Tian Lan
Rubrics as an Attack Surface: Stealthy Preference Drift in LLM Judges
Ruomeng Ding ⋅ Yifei Pang ⋅ He Sun ⋅ Yizhong Wang ⋅ Steven Wu ⋅ Zhun Deng
PolicyBank: Evolving Policy Understanding for LLM Agents
Jihye Choi ⋅ Jinsung Yoon ⋅ Long T. Le ⋅ Somesh Jha ⋅ Tomas Pfister
MechMath: Sorrifier-Driven Formal Decomposition Workflow for Automated Theorem Proving
Ruichen Qiu ⋅ Yichuan Cao ⋅ Junqi Liu ⋅ Dakai Guo ⋅ Xiao-Shan Gao ⋅ Lihong Zhi ⋅ Ruyong Feng
GLAZE: A Gaze-Language Benchmark for Grounding Human Gaze on Web User Interfaces
Yiran Ma ⋅ Yi-Hao Peng ⋅ Jiayang Shi ⋅ Isha Swaminathan ⋅ Aritra Dutta ⋅ Andrew Begel
Uniform Information Density-Based Preference Optimization
Yongyuan Li ⋅ Yang Xu
The Embedder's Dilemma: LLMs Are Better, but at What Cost?
Adnan El Assadi ⋅ Niklas Muennighoff ⋅ Jinhyuk Lee
VeriSoftBench: Repository-Scale Formal Verification Benchmarks for Lean
Yutong Xin ⋅ Jocelyn Qiaochu Chen ⋅ Greg Durrett ⋅ Isil Dillig
What Language Models Know But Don't Say: Non-Generative Prior Extraction for Generalization
Sara Rezaeimanesh ⋅ Mohammad M Ghassemi ⋅ Kundan S Thind ⋅ Farzan Siddiqui
Data Repetition Beats Data Scaling in Long-CoT Supervised Fine-Tuning
Dawid J Kopiczko ⋅ Sagar Vaze ⋅ Tijmen Blankevoort ⋅ Yuki M Asano
How Transformers Learn to Plan via Multi-Token Prediction
Jianhao Huang ⋅ Zhanpeng Zhou ⋅ Renqiu Xia ⋅ Baharan Mirzasoleiman ⋅ Weijie Su ⋅ Wei Huang
Detecting and Suppressing Reward Hacking with Gradient Fingerprints
Songtao Wang ⋅ Quang Hieu Pham ⋅ Fangcong Yin ⋅ Xinpeng Wang ⋅ Jocelyn Qiaochu Chen ⋅ Greg Durrett ⋅ Xi Ye
Analysis of Optimality of Large Language Models on Planning Problems
Bernd Bohnet ⋅ Michael C Mozer ⋅ Kevin Swersky ⋅ Aaron T Parisi ⋅ William A Cunningham ⋅ Kathleen Kenealy ⋅ Noah Fiedel
Multimodal Latent Reasoning via Predictive Embeddings
Ashutosh Adhikari ⋅ Mirella Lapata
SAGE: Learning to reason using Softmax Advantage Group Estimation
Jefferson Hernandez ⋅ Jaywon Koo ⋅ Zilin Xiao ⋅ Chen Wei ⋅ Vicente Ordonez
Sci-VBench: Benchmarking Knowledge-Grounded Scientific Reasoning in Video Generation
Diandian Zhang ⋅ Tingyu Song ⋅ Lin Fu ⋅ Zheyuan Yang ⋅ Yilun Zhao
Neuro-symbolic PRM: Enhancing Scientific Reasoning via Structured Traces and Symbolic Verification
Yuxin Zi ⋅ Cong Xu ⋅ Suparna Bhattacharya ⋅ Martin Foltin ⋅ Amit Sheth
CONCORD: Label-Free Calibration of Verbalized LLM Confidence via Rollout Consistency
Maximilian Schall ⋅ Gerard de Melo ⋅ Padhraic Smyth
Constraint decay: The Fragility of LLM Agents in Backend Code Generation
Francesco Dente ⋅ Dario Satriani ⋅ Paolo Papotti
The Hidden Cost of Thinking: Energy Use and Environmental Impact of LMs Beyond Pretraining
Jacob Morrison ⋅ Noah Smith ⋅ Emma Strubell
Prescriptive Scaling Laws for Data Constrained Training
Justin Lovelace ⋅ Christian Belardi ⋅ Srivatsa Kundurthy ⋅ Shriya Sudhakar ⋅ Kilian Weinberger
Multi-Mask Diffusion Language Models for Few-Step Generation
Sijin Chen ⋅ Yinuo Ren ⋅ Heyang Zhao ⋅ Ziheng Cheng ⋅ Quanquan Gu ⋅ Lexing Ying
Activation Steering via Generative Causal Mediation
Aruna Sankaranarayanan ⋅ Amir Zur ⋅ Atticus Geiger ⋅ Dylan Hadfield-Menell
Dr. Zero: Self-Evolving Search Agents without Training Data
Zhenrui Yue ⋅ Kartikeya Upasani ⋅ Xianjun Yang ⋅ Suyu Ge ⋅ Shaoliang Nie ⋅ Yuning Mao ⋅ Zhe Liu ⋅ Dong Wang
ACEvo: Adversarial Co-Evolution of Problem Distributions and Solvers for Combinatorial Optimization
Ruibo Duan ⋅ Yuxin Liu ⋅ Haoran Ye ⋅ Xinyao Dong ⋅ zhiqiang xu ⋅ Chenglin Fan
MoltNet: Understanding Social Behavior of AI Agents in the Agent-Native MoltBook
Yi Feng ⋅ Chen Huang ⋅ Zhibo Man ⋅ Ryner Tan ⋅ Long P Hoang ⋅ Shaoyang Xu ⋅ Wenxuan Zhang
Uncovering the computational ingredients that support human-like conceptual representations in large language models
Zach Studdiford ⋅ Timothy T Rogers ⋅ Kushin Mukherjee ⋅ Siddharth Suresh
Blind Refusal: Language Models Refuse to Help Users Evade Unjust, Absurd, and Illegitimate Rules
Cameron Pattison ⋅ Lorenzo Manuali ⋅ Seth Lazar
Attribution Bias in Large Language Models
Eliza H Berman ⋅ Bella Chang ⋅ Daniel B Neill ⋅ Emily Black
CoreSemDB: Benchmarking Hybrid Semantic-Relational Query Processing over Text-Rich Databases
Yuchen Tian ⋅ Jianxiong Guo ⋅ Hao Zhang ⋅ Jing Ma ⋅ Congli Gao
RealUserSim: Bridging the Reality Gap in Agent Benchmarking via Grounded User Simulation
Ming Zhu ⋅ Juntao Tan ⋅ Rithesh Murthy ⋅ Jielin Qiu ⋅ Liangwei Yang ⋅ Wenting Zhao ⋅ Silvio Savarese ⋅ Shelby Heinecke ⋅ Huan Wang
Aligning Language Models from User Interactions
Thomas Kleine Buening ⋅ Jonas Hübotter ⋅ Barna Pásztor ⋅ Idan Shenfeld ⋅ Giorgia Ramponi ⋅ Andreas Krause
Activation Steering for Aligned Open-ended Generation without Sacrificing Coherence
Niklas Herbster ⋅ Martin Zborowski ⋅ Alberto Tosato ⋅ Gauthier Gidel ⋅ Tommaso Tosato
Alignment Whack-a-Mole : Finetuning Activates Verbatim Recall of Copyrighted Books in Large Language Models
Xinyue Liu ⋅ Niloofar Mireshghallah ⋅ Jane C Ginsburg ⋅ Tuhin Chakrabarty
Lost in Distraction: LLM Planning Agents Recognize but Fail to Utilize Relevant Information under Context Noise
Weijie LIANG ⋅ Yuanfeng SONG ⋅ Xing Chen ⋅ Caleb C Cao ⋅ Sirui Han ⋅ Yike Guo
ScienceMeter: Tracking Scientific Knowledge Updates in Language Models
Yike Wang ⋅ Shangbin Feng ⋅ Yulia Tsvetkov ⋅ Hanna Hajishirzi
FERA: Uncertainty-Aware Federated Reasoning for Large Language Models
Ruhan Wang ⋅ Chengkai Huang ⋅ Zhiyong Wang ⋅ Junda Wu ⋅ Rui Wang ⋅ Tong Yu ⋅ Julian McAuley ⋅ Lina Yao ⋅ Dongruo Zhou
CIDER: A Dataset of Contextual Disclosure Boundaries for Privacy Preference Alignment
Bingcan Guo ⋅ Eryue Xu ⋅ Jijie Zhou ⋅ Zhiping Zhang ⋅ Tianshi Li
Latent Structure of Affective Representations in Large Language Models
Benjamin Choi ⋅ Melanie Weber
No, there are no grammatical ``grandmother neurons'' in LLMs
Linyang He ⋅ Nima Mesgarani
Self-Correction Bench: Uncovering and Addressing the Self-Correction Blind Spot in Large Language Models
Ken Tsui
Stargazer: A Scalable Model-fitting Benchmark Environment for AI Agents under Astrophysical Constraints
Xinge Liu ⋅ Terry J Zhang ⋅ Bernhard Schölkopf ⋅ Zhijing Jin ⋅ Kristen Menou
Transformer See, Transformer Do: Copying as an Intermediate Step in Learning Analogical Reasoning
Philipp Tobias Hellwig ⋅ Willem Zuidema ⋅ Claire E Stevenson ⋅ Martha Lewis
YC-Bench: Benchmarking AI Agents for Long-Term Planning and Consistent Execution.
Muyu He ⋅ Adit Jain ⋅ Anand Kumar ⋅ Vincent Tu ⋅ Soumyadeep Bakshi ⋅ Sachin Patro ⋅ Nazneen Rajani
RankBALD: Ranking-Aligned Active Evaluation for Language Models
Bonaventure F. P. Dossou ⋅ Jackie Cheung
REFRAMED: Towards Realistic Audio Description Generation for Movies
Igor Sterner ⋅ Mirella Lapata ⋅ Alex Lascarides ⋅ Frank Keller
One Word at a Time: Incremental Completion Decomposition Breaks LLM Safety
Samee Arif ⋅ Naihao Deng ⋅ Zhijing Jin ⋅ Rada Mihalcea
Curriculum Learning as Transport: Understanding Curricula with Wasserstein Geodesics
Changho Shin ⋅ David Alvarez-Melis
Evaluating steering techniques using human similarity judgments
Zach Studdiford ⋅ Timothy T Rogers ⋅ Siddharth Suresh ⋅ Kushin Mukherjee
Sample, Align, Synthesize: Graph-Based Response Synthesis with ConGrs
Sayan Ghosh ⋅ Shahzaib S Warraich ⋅ Dhruv Tarsadiya ⋅ Gregory Yauney ⋅ Swabha Swayamdipta
Latent Gender Encoding in Textual Semantics of Physical Attributes
Yingjia Wan ⋅ Lin L Lin ⋅ Elisa Kreiss
Reasoning on a Spectrum: Aligning LLMs to System 1 and System 2 Thinking
Alireza Salkhordeh Ziabari ⋅ Nona Ghazizadeh ⋅ Zhivar Sourati ⋅ Farzan K Malekabadi ⋅ Payam Piray ⋅ Morteza Dehghani
Reasoning Fine-Tuning Induces Persistent Latent Policy States
Abir Harrasse ⋅ Michael Lan ⋅ Hunar Batra ⋅ Fateme Hashemi Chaleshtori ⋅ Chaithanya Bandi
CT Open: An Open-Access, Uncontaminated, Live Platform for the Open Challenge of Clinical Trial Outcome Prediction
Jianyou (Andre) Wang ⋅ Youze Zheng ⋅ Longtian Bao ⋅ Hanyuan Zhang ⋅ Qirui Zheng ⋅ Yuhan Chen ⋅ Yang Zhang ⋅ Matthew Feng ⋅ Maxim Khan ⋅ Aditya K Sehgal ⋅ Christopher Rosin ⋅ Ramamohan Paturi ⋅ Umber Dube ⋅ Leon Bergen
A Unified Model and Document Representation for On-Device Retrieval-Augmented Generation
Julian Killingback ⋅ Ofer Meshi ⋅ Henry Li ⋅ Hamed Zamani ⋅ Maryam Karimzadehgan
Incentive-Aware Multi-Fidelity Optimization for Generative Advertising in Large Language Models
Jiayuan Liu ⋅ Barry Wang ⋅ Jiarui Gan ⋅ Tonghan Wang ⋅ Leon Xie ⋅ Mingyu Guo ⋅ Vincent Conitzer
Overconfidence and Calibration in Medical VQA: Empirical Findings and Hallucination-Aware Mitigation
Ji Young Byun ⋅ Young-Jin Park ⋅ Jean-Philippe Corbeil ⋅ Asma Ben Abacha
When Contextual Inference Fails: Cancelability in Interactive Instruction Following
Natalia Bila ⋅ Kata Naszadi ⋅ Alexandra Mayn ⋅ Christof Monz
Effective Strategies for Asynchronous Software Engineering Agents
Jiayi Geng ⋅ Graham Neubig
How Can We Synthesize High-Quality Pretraining Data? A Systematic Study of Prompt Design, Generator Model, and Source Data
Joel Niklaus ⋅ Atsuki Yamaguchi ⋅ Michal Štefánik ⋅ Guilherme Penedo ⋅ Hynek Kydlíček ⋅ Elie Bakouch ⋅ Lewis Tunstall ⋅ Edward E Beeching ⋅ Thibaud Frere ⋅ Colin Raffel ⋅ Leandro von Werra ⋅ Thomas Wolf
Persona Non Grata: Single-Method Safety Evaluation Is Incomplete for Persona-Imbued LLMs
Wenkai Li ⋅ Fan Yang ⋅ Shaunak A Mehta ⋅ Koichi Onoue
QLPO: Quadrant-weighted sampling for Length-aware Policy Optimization
Siwei Chen ⋅ SiQi Chen ⋅ Xupeng Miao ⋅ Bin CUI
Beyond Distribution Sharpening: The Importance of Task Rewards
Sarthak Mittal ⋅ Leo Gagnon ⋅ Guillaume Lajoie
Identifying Introspection From the Inside
David Atkinson ⋅ Dillon Plunkett ⋅ David Bau
Neuro-Symbolic Synergy for World Modeling
Hongyu Zhao ⋅ Siyu Zhou ⋅ Haolin Yang ⋅ Zengyi Qin ⋅ Tianyi Zhou
Train Yourself as an LLM: Exploring Effects of AI Literacy on Persuasion via Role-playing LLM Training
Qihui Fan ⋅ Min Ge ⋅ Chenyan Jia ⋅ Weiyan Shi
Pixel-SAIL: Single Transformer For Pixel-Grounded Understanding
Tao Zhang ⋅ Xiangtai Li ⋅ Zilong Huang ⋅ Yanwei Li ⋅ Xueqing Deng ⋅ Weixian Lei ⋅ Shihao Chen ⋅ Shunping Ji ⋅ Jiashi Feng
Vocabulary embeddings organize linguistic structure early in language model training
Jacob S Prince ⋅ Isabel Papadimitriou
Reasoning over Non-Parametric Memory in Multilingual LLMs: A Cognitive-Based Analysis of Relational Knowledge
Zohreh A Liasi ⋅ Batoul Hammoud ⋅ Anas Madkoor ⋅ Ehsaneddin Asgari
Don’t Lose the Thread: Empowering Long-Horizon LLM Agents with Cognitive Resource Self-Allocation
Zheng Zhu ⋅ Xiaozhuan Liang ⋅ Xi Chen ⋅ Bei Yu ⋅ Jiaya Jia
Extracting memorized pieces of (copyrighted) books from open-weight language models
A. Feder Cooper ⋅ Mark Lemley ⋅ Allison Casasola ⋅ Ahmed M Ahmed ⋅ Aaron Gokaslan ⋅ Amy B Cyphert ⋅ Christopher De Sa ⋅ Daniel Ho ⋅ Percy Liang
Measuring AI "Slop" in Text
Chantal Shaib ⋅ Tuhin Chakrabarty ⋅ Diego Garcia-Olano ⋅ Byron Wallace
Learning to See What You Need: Gaze Attention for Multimodal Large Language Models
Junha Song ⋅ Byeongho Heo ⋅ Geonmo Gu ⋅ Jaegul Choo ⋅ Dongyoon Han ⋅ Sangdoo Yun
ConformalGuard: False-Positive-Controlled Action Gating for LM Classifiers
Bishnu Bista ⋅ Dhanraj Haibatrao Jadhav ⋅ Vibha Choudhary ⋅ Gaurav Saxena ⋅ Arun Pandiyan Perumal ⋅ Arjun Subedi ⋅ Jignesh Ammineni
PromptBridge: Cross-Model Prompt Transfer for Large Language Models
Yaxuan Wang ⋅ Quan Liu ⋅ Zhenting Wang ⋅ Zichao Li ⋅ Wei Wei ⋅ Yang Liu ⋅ Yujia Bao
MetaState: Persistent Working Memory Enhances Reasoning in Discrete Diffusion Language Models
Kejing Xia ⋅ Mingzhe Li ⋅ Lixuan Wei ⋅ Zhenbang Du ⋅ Xiangchi Yuan ⋅ Dachuan Shi ⋅ Qirui Jin ⋅ Wenke Lee
Language Models That Think, Chat Better
Adithya Bhaskar ⋅ Xi Ye ⋅ Danqi Chen
What Makes a Sale? Simulating End-to-End Seller-Buyer Retail Dynamics with LLM Agents
Jeonghwan Choi ⋅ Jibin Hwang ⋅ Gyeonghun Sun ⋅ Minjeong Ban ⋅ Taewon Yun ⋅ Hyeonjae Cheon ⋅ Hwanjun Song
Understanding the Effects of Safety Unalignment on Large Language Models
John Halloran
Pando: Do Interpretability Methods Work When Models Won't Explain Themselves?
Ziqian Zhong ⋅ Aashiq Muhamed ⋅ Mona Diab ⋅ Virginia Smith ⋅ Aditi Raghunathan
Who Checks the Citations? Benchmarking Legal Hallucination Detection
Patty Liu ⋅ Dominik Stammbach ⋅ Peter Henderson
LiveMathematicianBench: A Live Benchmark for Mathematician-Level Reasoning with Proof Sketches
Linyang He ⋅ Qiyao Yu ⋅ Hanze Dong ⋅ Baohao Liao ⋅ Xinxing Xu ⋅ Micah Goldblum ⋅ Jiang Bian ⋅ Nima Mesgarani
Private-RAG: Answering Multiple Queries with LLMs while Keeping Your Data Differentially Private
Ruihan Wu ⋅ Erchi Wang ⋅ Zhiyuan Zhang ⋅ Yu-Xiang Wang
RefusalGuard: Geometry-Preserving Fine-Tuning for Safety in LLMs
Sadia Asif ⋅ Mohammad Mohammadi Amiri
Budget-Aware Tool Use Enables Effective Agent Scaling
Tengxiao Liu ⋅ Zifeng Wang ⋅ Jin Miao ⋅ I-Hung Hsu ⋅ Jun Yan ⋅ Jiefeng Chen ⋅ Rujun Han ⋅ Fangyuan Xu ⋅ Yanfei Chen ⋅ Ke Jiang ⋅ Samira Daruki ⋅ Yi Liang ⋅ William Yang Wang ⋅ Tomas Pfister ⋅ Chen-Yu Lee
MolDesignBench: Evaluating LLM-based Agent for Scenario- grounded Molecular Design
Yongjun Jeong ⋅ Hanbum Ko ⋅ Ye R Kim ⋅ Chanhui Lee ⋅ Rodrigo Hormazabal ⋅ Jaewan Lee ⋅ Sehui Han ⋅ Sungbin Lim ⋅ Sungwoong Kim
Where Did It Go Wrong? Process-Level Evaluation of Web Agents with Semantic State Tracking
Jiwan Chung ⋅ JiHyuk Byun ⋅ Vibhav Vineet ⋅ Seon Joo Kim
Can LLM Agents Discover? Evaluating Creativity on ML Engineering Tasks
Shitanshu Bhushan ⋅ Yunxiang Zhang ⋅ Lu Wang
KAMR: Grounding Generation via Knowledge-Aligned Multi-hop Retrieval
Xiaochen Wang ⋅ Yuan Zhong ⋅ Haoyu Wang ⋅ Ting Wang ⋅ Fenglong Ma
The Garden of Forking Prompts: How Users Explore Narrative Space in Story Generation
Advait Deshmukh ⋅ Nora Benedict ⋅ Melanie Walsh ⋅ Maria Antoniak
Quality of Rejections Matters: Preference Data Construction for Faithful Summarization
Jihwan Oh ⋅ Taewon Yun ⋅ Minkyu Che ⋅ Sundong Kim ⋅ Hwanjun Song
Agent0: Unleashing Self-Evolving Agents from Zero Data via Tool-Integrated Reasoning
Peng Xia ⋅ Kaide Zeng ⋅ Jiaqi Liu ⋅ Can Qin ⋅ Fang Wu ⋅ Yiyang Zhou ⋅ Caiming Xiong ⋅ Huaxiu Yao
Extended to Reality: Prompt Injection in 3D Environments
Zhuoheng Li ⋅ Ying Chen
RIMS: Preference Optimization via Smoothed Multi-pair Aggregation for Small-Scale LLM Retrieval-Augmented Generation
Pei Tian ⋅ Zihan Dong ⋅ Tianci Liu ⋅ Linjun Zhang ⋅ Haoyu Wang
SIMMER: Benchmarking Latent Failures in LLM Executable Planning with a World Model
Xiaoxin Lu ⋅ Ranran Zhang ⋅ Rui Zhang
TRUST: A Crowdsourcing Framework for Auditing Large Language Model Reasoning
Yu-Chao Huang ⋅ Zhen Tan ⋅ Mohan Zhang ⋅ Pingzhi Li ⋅ Zhuo Zhang ⋅ Tianlong Chen
Logarithmic Scores, Power-Law Discoveries: Disentangling Measurement from Coverage in Agent-Based Evaluation
HyunJoon Jung ⋅ William Na
Beyond Black-Box Obfuscation: Mechanistic Analysis and Defense of White-Box Monitors
Maheep Chaudhary ⋅ Fazl Barez
Do LLMs Know What Is Private Internally? Probing and Steering Contextual Privacy Norms in Large Language Model Representations
Haoran Wang ⋅ Li Xiong ⋅ Kai Shu
The Art of Building Verifiers for Computer Use Agents
Corby Rosset ⋅ Pratyusha Sharma ⋅ Andrew Zhao ⋅ Miguel Gonzalez Fernandez ⋅ Ahmed H Awadallah
Self-Evolving Curriculum for LLM Reasoning
Xiaoyin Chen ⋅ Jiarui Lu ⋅ Minsu Kim ⋅ Dinghuai Zhang ⋅ Jian Tang ⋅ Alexandre Piché ⋅ Nicolas Gontier ⋅ Yoshua Bengio ⋅ Ehsan Kamalloo
Rethinking Reasoning with MDLMs: Early Exits, Post-hoc Reasoning, and Beyond
Zachary Horvitz ⋅ Raghav Singhal ⋅ Hao Zou ⋅ Carles Domingo-Enrich ⋅ Zhou Yu ⋅ Rajesh Ranganath ⋅ Kathleen McKeown
On Epistemic Diversity in Large Language Models
Elisabeth Kirsten ⋅ Nicole C Krämer ⋅ Muhammad Bilal Zafar
To Mix or To Merge: Toward Multi-Domain Reinforcement Learning for Large Language Models
Haoqing Wang ⋅ Xiang Long ⋅ Ziheng Li ⋅ Yilong Xu ⋅ Tingguang Li ⋅ Yehui Tang
KTPO: K-Step Test-Time Policy Optimization for Long- Horizon Discovery
Dacheng Li ⋅ Fangzhou Zhao ⋅ Shiyi Cao ⋅ Hao Zhang ⋅ Joseph E Gonzalez ⋅ Ion Stoica
SEER: Long-Context Reasoning via Selective Visual-Text Compression
Jiawei Xu ⋅ Zhilin Zhai ⋅ Jinrui Fang ⋅ Ruohan Xu ⋅ Mingfei Lu ⋅ Yi Zhang ⋅ Guanchu Wang ⋅ Tianlong Chen ⋅ Ying Ding
Whose Standpoint do LLMs Reflect? Towards Robustness in Latent Need Discovery
Julius Broomfield ⋅ Kartik Sharma
Asymmetric Idiosyncrasies in Multimodal Models
Muzi Tao ⋅ Chufan Shi ⋅ Huijuan Wang ⋅ Shengbang Tong ⋅ Xuezhe (Max) Ma
Headroom-Drift Replay: A Primitive for Principled Replay Control in GRPO
HYUN BIN PARK ⋅ Du-Seong Chang
MuonQ: Enhancing Low-Bit Muon Quantization via Directional Fidelity Optimization
Yupeng Su ⋅ Ruijie Zhang ⋅ Ziyue Liu ⋅ Yequan Zhao ⋅ Zheng Zhang
ComponentBench: Diagnosing Component-Level Failures in Computer-Use Agents
Tianchen Guan ⋅ Daisy X Lin ⋅ Royce Cheng-Yue ⋅ Xiangjun Wang ⋅ Shuyan Zhou
TemMed-Bench: Evaluating Temporal Medical Image Reasoning in Vision-Language Models
Junyi Zhang ⋅ Jia-Chen Gu ⋅ Wenbo Hu ⋅ Yu Zhou ⋅ Robinson Piramuthu ⋅ Nanyun (Violet) Peng
Judge a Book by its Cover: Investigating Multi-Modal LLMs for Multi-Page Handwritten Document Transcription
Benjamin Gutteridge ⋅ Matthew T Jackson ⋅ Toni Kukurin ⋅ Xiaowen Dong
TowerVision: Understanding and Improving Multilinguality in Vision-Language Models
Andre G Viveiros ⋅ Patrick Fernandes ⋅ Saul Santos ⋅ Sonal Sannigrahi ⋅ Emmanouil Zaranis ⋅ Nuno Guerreiro ⋅ Amin Farajian ⋅ Graham Neubig ⋅ Andre Martins
Heard but Not Heeded: Paralinguistic Information Encoding and Loss in Audio-Language Models
Bhuvan Koduru ⋅ Dareen Alharthi ⋅ Rita Singh ⋅ Bhiksha Raj
Compliments to the Complementizer: Indirect Routing of Syntactic Structure in a Transformer Language Model
Lasse van den Berg ⋅ Bob Frank
LLMs Can Get "Brain Rot": A Pilot Study on Twitter/X
Shuo Xing ⋅ Junyuan Hong ⋅ Yifan Wang ⋅ Runjin Chen ⋅ Zhenyu Zhang ⋅ Ananth Grama ⋅ Zhengzhong Tu ⋅ Zhangyang Wang
AnonModel Hybrid: From Theory to Practice and Back
William Merrill ⋅ Yanhong Li ⋅ Tyler Romero ⋅ Anej Svete ⋅ Caia Costello ⋅ Pradeep Dasigi ⋅ Dirk Groeneveld ⋅ David Heineman ⋅ Bailey Kuehl ⋅ Nathan Lambert ⋅ Chuan Li ⋅ Kyle Lo ⋅ Saumya Malik ⋅ David Matusz ⋅ Benjamin Minixhofer ⋅ Jacob Morrison ⋅ Luca Soldaini ⋅ Finbarr Timbers ⋅ Evan Walsh ⋅ Noah Smith ⋅ Hanna Hajishirzi ⋅ Ashish Sabharwal
AdaPlanBench: Evaluating Adaptive Planning in Large Language Model Agents under World and User Constraints
Jiayu Liu ⋅ Cheng Qian ⋅ Zhenhailong Wang ⋅ Bingxuan Li ⋅ Jiateng Liu ⋅ Qing Zong ⋅ Heng Wang ⋅ Jeonghwan Kim ⋅ Yumeng Wang ⋅ Bingxiang He ⋅ Xiusi Chen ⋅ Yi Fung ⋅ Heng Ji
Quasar: A Programming Language Specialized for LLM Code Actions
Stephen Mell ⋅ Botong Zhang ⋅ David Mell ⋅ Shuo Li ⋅ Ramya Ramalingam ⋅ Nathan Yu ⋅ Stephan Zdancewic ⋅ Osbert Bastani
Synthetic Data for any Differentiable Target
Tristan Thrush ⋅ Sung Min Park ⋅ Herman Brunborg ⋅ Luke Bailey ⋅ Marcel Rød ⋅ Neil Band ⋅ Christopher Potts ⋅ Tatsunori Hashimoto
LakeQuest: A Three-Domain Benchmark for Grounded Question Answering across Data Lakes
Michael Solodko ⋅ Steven Gong ⋅ Guangwei Yu ⋅ Satya Krishna Gorti ⋅ Jesse C Cresswell ⋅ Victor Zhong
Instruction-tuned LLMs for Full Argumentative Component Detection
Sofiane Elguendouze ⋅ Erwan Hain ⋅ Elena Cabrio ⋅ Serena Villata
VehicleMemBench: An Executable Benchmark for Multi-User Long-Term Memory in In-Vehicle Agents
Yuhao Chen ⋅ Yi Xu ⋅ Xinyun Ding ⋅ Xiang Fang ⋅ Shuochen Liu ⋅ Luxi Lin ⋅ Qingyu Zhang ⋅ Ya Li ⋅ Quan Liu ⋅ Tong Xu
Combee: Scaling Prompt Learning for Self-Improving Language Model Agents
Hanchen Li ⋅ Runyuan He ⋅ Qizheng Zhang ⋅ Changxiu Ji ⋅ Qiuyang Mang ⋅ Xiaokun Chen ⋅ Lakshya A Agrawal ⋅ Wei-Liang Liao ⋅ Eric Yang ⋅ Alvin Cheung ⋅ James Zou ⋅ Kunle Olukotun ⋅ Ion Stoica ⋅ Joseph E Gonzalez
CARV: A Diagnostic Benchmark for Compositional Analogical Reasoning in Multimodal LLMs
Yongkang Du ⋅ Xiaohan Zou ⋅ Minhao Cheng ⋅ Lu Lin
Quantization-Robust Unlearning through the Lens of Retain-Forget Loss Landscapes Interaction
Jialu Wang ⋅ Jianing Deng ⋅ Shuqing Luo ⋅ Yuanzhe Li ⋅ Dongwei Wang ⋅ Jingtong Hu ⋅ Huanrui Yang ⋅ Song Wang ⋅ Tianlong Chen
Not All Thinking Helps: Which Reasoning Behaviors Matter Most in Thinking Models?
Jean de Dieu Nyandwi ⋅ Leena Mathur ⋅ Yonatan Bisk ⋅ Graham Neubig
Unlocking Parallelism in Autoregressive Language Models via Speculative Decoding with Progressive Tree Drafting
Zipeng Gao ⋅ Zhi Zheng ⋅ Qingrong Xia ⋅ Junda Lin ⋅ Ziwei Zhao ⋅ Tong Xu ⋅ Zhefeng Wang ⋅ Enhong Chen
Why Your Prompt Compressor Is Deleting the Wrong Tokens: An Information-Theoretic Diagnosis
Jinheng Wu ⋅ Di Zhang
ArtifactLinker: Linking Scientific Artifacts for Automatic State-of-the-art Discovery
Haofei Yu ⋅ Jiaxuan You ⋅ Peter Clark ⋅ Bodhisattwa Prasad Majumder ⋅ Kyle Richardson
Building Multi-Task Agentic LLMs via Two-Phase Distillation
Huaijie Wang ⋅ Shusheng Xu ⋅ Yi Wu ⋅ Kaifeng Lyu
Let’s Scale Step by Step: Compute-Efficient Hyperparameter Transfer for Large-Scale Mixture-of-Experts
Nayeon Kim ⋅ Hojin Lee ⋅ Yunju Bak ⋅ Jaesun Park ⋅ Boseop Kim
Awakening the Sleeping Agent: Lean-Specific Agentic Data Reactivates General Tool Use in Goedel Prover
Jui-Hui Chung ⋅ Hongzhou Lin ⋅ Lai Jiang ⋅ Shange Tang ⋅ Chi Jin
MAPLE: Metadata Augmented Private Language Evolution
Eli Chien ⋅ Yuzheng Hu ⋅ Ryan McKenna ⋅ Shanshan Wu ⋅ Zheng Xu ⋅ Peter Kairouz
Understanding Calibration and Truncation Error Propagation in Training-Free Low-Rank Compression for LLMs
Mohanad Odema ⋅ Dayin Gou ⋅ Gabrielle De Micheli ⋅ Nilesh Malpeddi ⋅ Prathamesh Vaste ⋅ Jacob Song
Path-Constrained Mixture-of-Experts
Zijin Gu ⋅ Tatiana Likhomanenko ⋅ Vimal Thilak ⋅ Jason Ramapuram ⋅ Navdeep Jaitly
RationalRewards: Reasoning Reward Models as Dual-Space Optimizers for Visual Generation
Haozhe Wang ⋅ Cong Wei ⋅ Weiming Ren ⋅ Jiaming Liu ⋅ Fangzhen Lin ⋅ Wenhu Chen
Safety Cost of Steering Vectors Is Separable and Reducible
Yuxiao Li ⋅ Gjergji Kasneci
Misalignment Contagion: Can a Misaligned Minority Shift Aligned Agents in Multi-Agent LLM Deliberation?
Syed Ali Haider ⋅ Soroush Vosoughi
Do Language Models Consistently Encode the Current Year?
Suze van Adrichem ⋅ Aditi Bhaskar ⋅ Diyi Yang ⋅ Christopher Potts ⋅ Jing Huang
GraphWalker: Agentic Knowledge Graph Question Answering via Synthetic Trajectory Curriculum
SHUWEN XU ⋅ Yao Xu ⋅ Jiaxiang Liu ⋅ Chenhao Yuan ⋅ Wenshuo Peng ⋅ Jun Zhao ⋅ Kang Liu
AMAT: Automated Multi-Agent Topology Design via Reinforcement Learning
Shijie Zheng ⋅ Zhiqiang Pu ⋅ Hao Ma ⋅ Tianyi Hu ⋅ Xiaolin Ai ⋅ Yi Pan
GoodPoint: Learning Constructive Scientific Paper Feedback from Author Responses
Jimin Mun ⋅ Chani Jung ⋅ Xuhui Zhou ⋅ Hyunwoo Kim ⋅ Maarten Sap
Studying the Soupability of Documents in State Space Models
Yasaman Jafari ⋅ Zixian Wang ⋅ Leon Bergen ⋅ Taylor Berg-Kirkpatrick
SOTOPIA-TOM: Evaluating Information Management in Multi-Agent Interaction with Theory of Mind
Yashwanth YS ⋅ Ruichen Wang ⋅ Shihua Zeng ⋅ Xuhui Zhou ⋅ Koichi Onoue ⋅ Vasudha Varadarajan ⋅ Maarten Sap
AnchorBench: A Multi-Pathway Benchmark for the Anchoring Effect in LLMs
Yiderigun Borjigin ⋅ Alexander Hermann ⋅ Christian J Cyron ⋅ Roland Aydin
Defragmenting Language Models: An Interpretability-based Approach for Vocabulary Expansion
Maitrey Mehta ⋅ Nishant Subramani ⋅ Zhichao Xu ⋅ Ashim Gupta ⋅ Vivek Srikumar
Joint Optimization of Reasoning and Dual-Memory for Self-Learning Diagnostic Agent
Bingxuan Li ⋅ Simo Du ⋅ Yue Guo
Why Do Safety Guardrails Degrade Across Languages?
Max Zhang ⋅ Ameen Patel ⋅ Sang Truong ⋅ Sanmi Koyejo
PISmith: Reinforcement Learning-based Red Teaming for Prompt Injection Defenses
Chenlong Yin ⋅ Runpeng Geng ⋅ Yanting Wang ⋅ Jinyuan Jia
Hallucination Self-Play: Bootstrapping Reinforced Detector via Evolved Generator
Shiping Yang ⋅ Shining Liang ⋅ Weihao Liu ⋅ Wenbiao Ding ⋅ Linjun Shou ⋅ Lu Cheng ⋅ Angel X Chang
Do We Need Frontier Models to Verify Mathematical Proofs?
Guruprerana Shabadi ⋅ Aaditya Naik ⋅ Rajeev Alur ⋅ Mayur Naik
Are Large Vision-Language Models Ready to Guide Blind and Low-Vision Individuals?
Eunki Kim ⋅ Na Min An ⋅ Wan Ju Kang ⋅ Sangryul Kim ⋅ James Thorne ⋅ Hyunjung Shim
Path-Lock Expert: Separating Reasoning Mode in Hybrid Thinking via Architecture-Level Separation
Shouren Wang ⋅ wang yang ⋅ Chuang Ma ⋅ Debargha Ganguly ⋅ Vikash Singh ⋅ Chaoda Song ⋅ Xinpeng Li ⋅ Xianxuan Long ⋅ Vipin Chaudhary ⋅ Xiaotian Han
The Devil Is in the Interface: Evaluating How Tool Architecture Shapes Coding Agent Behavior
Xiangzhe (Alex) Xu ⋅ Hamidreza Saghir ⋅ Qianhui Wu ⋅ Marc-Alexandre Côté ⋅ Tong Wang ⋅ Kiran Lakkaraju ⋅ Kexin Pei ⋅ Xiangyu Zhang
LiteResearcher: A Scalable Agentic RL Training Framework for Deep Research Agent
Wanli Li ⋅ Bince Qu ⋅ Bo Pan ⋅ Jianyu Zhang ⋅ Zheng Liu ⋅ Pan Zhang ⋅ Wei Chen ⋅ Bo Zhang
TRAPSBench: Vision-Language Models Encode but Fail to Express Epistemic Restraint
Fnu pramono ⋅ John Cai ⋅ Sourabh Kulkarni
Attr-Kit: An Efficient Toolkit for No-Decode Source Attribution
Sai Sundaresan ⋅ Archit Gupta ⋅ Debabrata Mahapatra
Syntax Without Semantics: Teaching LLMs to Code in an Unseen Language
Vinayshekhar Bannihatti Kumar ⋅ Disha Makhija ⋅ Manoj Ghuhan Arivazhagan ⋅ Rashmi Gangadharaiah
Reach Into The Choir: Free-List Elicitation Uncovers Distinct Model Voices in LLM Ensembles
Ben Wigler ⋅ Maria Tsfasman
SkillFoundry: Building Self-Evolving Agent Skill Libraries from Heterogeneous Scientific Resources
Shuaike Shen ⋅ Wenduo Cheng ⋅ Mingqian Ma ⋅ Alistair Turcan ⋅ Martin J Zhang ⋅ Jian Ma
The Generalization Ridge: Information Flow in Natural Language Generation
Ruidi Chang ⋅ Chunyuan Deng ⋅ Hanjie Chen
Co-Director: Agentic Generative Video Storytelling
Yale Song ⋅ Yiwen Song ⋅ Nick Losier ⋅ Nathan Hodson ⋅ Ye Jin ⋅ Rhyard Zhu ⋅ Yan Xu ⋅ Daniel Vlasic ⋅ Carina Claassen ⋅ Jasmine Leon ⋅ Khanh G LeViet ⋅ Zack Chomyn ⋅ Joe Timmons ⋅ Brett Slatkin ⋅ Scott Penberthy ⋅ Tomas Pfister
Resa: Efficient Reasoning Models via SAEs
Shangshang Wang ⋅ Julian Asilis ⋅ Ömer Faruk Akgül ⋅ Enes B Bilgin ⋅ Ollie Liu ⋅ Deqing Fu ⋅ Willie Neiswanger
(How) Learning Rates Regulate Catastrophic Overtraining
Mark Rofin ⋅ Aditya Varre ⋅ Nicolas Flammarion
Accounting for Layerwise Abstraction-Refinement Dynamics Improves Multimodal Adaptation of Language Models
Santiago Cuervo ⋅ Adel Moumen ⋅ Yanis Labrak ⋅ Sameer Khurana ⋅ Antoine LAURENT ⋅ Mickael Rouvier ⋅ Phil Woodland ⋅ Ricard Marxer
Can Induced Emotion Bias LLM Behaviors in Sequential Decision Making?
Minh Khoi Ho ⋅ Zihao Zhu ⋅ Runchuan Zhu ⋅ Levina Li ⋅ Zhiwen Fan ⋅ Zhangyang Wang ⋅ Junyuan Hong
Characterizing Model-Native Skills
Feiyang Kang ⋅ Mahavir Dabas ⋅ Myeongseob Ko ⋅ Ruoxi Jia
INSIDE: LLM Student Simulators That Reason Behind Their Actions
Rose Niousha ⋅ Minwoo Kang ⋅ Narges Norouzi
LORA-CRAFT: Cross-layer Rank Adaptation via Frozen Tucker Decomposition of Pre-trained Attention Weights
Kasun Dewage ⋅ Marianna Pensky ⋅ Suranadi De Silva ⋅ Shankhadeep Mondal
Online Reasoning Calibration: Test-Time Training Enables Generalizable Conformal LLM Reasoning
Cai Zhou ⋅ Zekai Wang ⋅ Menghua Wu ⋅ Qianyu Zhu ⋅ Flora C Shi ⋅ Chenyu Wang ⋅ Ashia C Wilson ⋅ Tommi Jaakkola ⋅ Stephen Bates
Tool-Creating LLM Agents Gain Little from Keeping Their Tools
Marek Šuppa ⋅ Jaroslav Kopcan
Towards Query-Agnostic RAG Evaluation via Query Coverage and Claim Verifiability
Jeonghwan Choi ⋅ Taewon Yun ⋅ Minjeong Ban ⋅ Gyeonghun Sun ⋅ Jae-Gil Lee ⋅ Hwanjun Song
Escaping the Nash Trap: Structural Estimation and Alignment of Strategic Reasoning in Large Language Models
Jiannan Xu ⋅ Yongkang Duan ⋅ Jane Y Jiang ⋅ Jiding Zhang
MoLGE: Mixture of Language Group Experts for Efficient Scaling of Massively Multilingual Speech Recognition
Sangmin Lee ⋅ Woojin Chung ⋅ Woongjib Choi ⋅ Hong-Goo Kang
Beyond Perplexity: Character Distribution Signatures and the MDTA Benchmark for AI Text Detection
Priyadarshan Narayanasamy ⋅ Swastik Agrawal ⋅ Klint Faber ⋅ Fardina F Alam
Automatic Generation of High-Performance RL Environments
Seth Karten ⋅ Rahul Dev Appapogu ⋅ Chi Jin
Principled and Scalable Diversity-Aware Retrieval via Cardinality-Constrained Binary Quadratic Programming
Qiheng Lu ⋅ Nicholas D Sidiropoulos
Human vs Machine Translation Detection: A Cross-Model, Cross-Domain, and Low-Resource Analysis
Yabsera Yemanberhan ⋅ Prasenjit Mitra ⋅ Roald Eiselen
Auditing Moderation Robustness Under Realistic Settings
Bargav Jayaraman ⋅ Hamid Mozaffari ⋅ Virendra Marathe ⋅ Swetasudha Panda
Reasoning with Image Generation
Nishad Singhi ⋅ Hector Garcia Rodriguez ⋅ Aditya Arora ⋅ Marcus Rohrbach ⋅ Anna Rohrbach
The State and Fate of Multilingual, Contextual Evaluation in the NLP World
Manan Uppadhyay ⋅ Himanshu Beniwal ⋅ Prashant Kodali ⋅ Sunayana Sitaram
Peer-Predictive Self-Training for Language Model Reasoning
Shi Feng ⋅ Hanlin Zhang ⋅ Fan Nie ⋅ Sham Kakade ⋅ Yiling Chen
Benchmarking the Robustness of Agentic Systems to Adversarially-Induced Harmful Behaviors
Jonathan Nöther ⋅ Adish Singla ⋅ Goran Radanovic
MegaTrain: Full Precision Training of 100B+ Parameter Large Language Models on a Single GPU
Zhengqing Yuan ⋅ Hanchi Sun ⋅ Lichao Sun ⋅ Yanfang (Fanny) Ye
Beyond Trajectory Imitation: Strategy-Guided Policy Optimization for LLM Reasoning
Tianyuan Shi ⋅ Canbin Huang ⋅ Bei Li ⋅ Xin Chen ⋅ Xiaojun Quan ⋅ Jingang Wang ⋅ Qifan Wang
Encode Once, Decode Never: Reusing Audio LM Internals for Efficient Temporal Localization
Joseph An ⋅ Phillip Keung ⋅ Jiaqi Wang ⋅ Orevaoghene Ahia ⋅ Noah Smith
Discovering Hierarchical Latent Capabilities of Language Models from Observational Evaluation Data
Jikai Jin ⋅ Vasilis Syrgkanis ⋅ Sham Kakade ⋅ Hanlin Zhang
Large Language Models Align with the Human Brain during Creative Thinking
Mete Ismayilzada ⋅ Simone A Luchini ⋅ Abdulkadir Gokce ⋅ Badr AlKhamissi ⋅ Antoine Bosselut ⋅ Antonio Laverghetta Jr. ⋅ Lonneke v Plas ⋅ Roger Beaty
Intern-S1-MO: Long-horizon Reasoning Agent for Olympiad-Level Mathematical Problem Solving
Songyang Gao ⋅ Yuzhe Gu ⋅ Zijian Wu ⋅ Lingkai Kong ⋅ Wenwei Zhang ⋅ ZhongruiCai ⋅ Fan Zheng ⋅ Tianyou Ma ⋅ Junhao Shen ⋅ Haiteng Zhao ⋅ Duanyang Zhang ⋅ Huilun Zhang ⋅ Kuikun Liu ⋅ Chengqi Lyu ⋅ YanhuiDuan ⋅ Chiyu Chen ⋅ Ningsheng Ma ⋅ Jianfei Gao ⋅ Han Lyu ⋅ Dahua Lin ⋅ Kai Chen
Test-Time Scaling in Reasoning Models Is Not Effective for Knowledge-Intensive Tasks Yet
James Xu Zhao ⋅ Bryan Hooi ⋅ See-Kiong Ng
DARE: Diffusion Large Language Models Alignment and Reinforcement Executor
Jingyi Yang ⋅ Yuxian Jiang ⋅ Xuhao Hu ⋅ Shuang Cheng ⋅ Biqing Qi ⋅ Jing Shao
When Verification Fails: How Compositionally Infeasible Claims Escape Rejection
Muxin Liu ⋅ Delip Rao ⋅ Grace Kim ⋅ Chris Callison-Burch
A Comedy of Estimators: On KL Regularization in RL Training of LLMs
Vedant Shah ⋅ Johan Obando-Ceron ⋅ Vineet Jain ⋅ Brian R Bartoldson ⋅ Bhavya Kailkhura ⋅ Sarthak Mittal ⋅ Glen Berseth ⋅ Pablo S Castro ⋅ Yoshua Bengio ⋅ Esmeralda S Whitammer ⋅ Moksh Jain ⋅ Siddarth Venkatraman ⋅ Aaron Courville
Sememe: Causal Modeling to Effectively Prune Task-Aware Large Language Models
Charles Yu ⋅ Heng Ji
High Volatility and Action Bias Distinguish LLMs from Humans in Group Coordination
Sahaj Singh Maini ⋅ Robert L Goldstone ⋅ Zoran Tiganj
CresOWLve: Benchmarking Creative Problem-Solving Over Real-World Knowledge
Mete Ismayilzada ⋅ Renqing Cuomao ⋅ Daniil Yurshevich ⋅ Anna Sotnikova ⋅ Lonneke v Plas ⋅ Antoine Bosselut
SkillFlow: Scalable and Efficient Agent Skill Retrieval System
Fangzhou Li ⋅ Pagkratios Tagkopoulos ⋅ Ilias Tagkopoulos
CoVLA: Vision-Language Alignment with Fewer Vision Tokens
Junyong Park ⋅ Yong-Ju Lee ⋅ Daeyoung Kim
Expert-Choice Routing Enables Adaptive Computation in Diffusion Language Models
Shuibai Zhang ⋅ Xialie Zhuang ⋅ Chihan Cui ⋅ Zhihan Yang ⋅ Fred ⋅ Yanxin Zhang ⋅ Haoyue Bai ⋅ Zack Jia ⋅ Yang Zhou ⋅ Guanhua Chen ⋅ Ming Liu
Strong but Brittle: Simple Attacks Subvert Reasoning-based Safety Guardrails
Shuo Chen ⋅ Zhen Han ⋅ Haokun Chen ⋅ Bailan He ⋅ Shengyun Si ⋅ Jingpei Wu ⋅ Philip Torr ⋅ Volker Tresp ⋅ Jindong Gu
Agent Psychometrics: Task-Level Performance Prediction in Agentic Coding Benchmarks
Chris Ge ⋅ Daria Kryvosheieva ⋅ Daniel Fried ⋅ Uzay Girit ⋅ Kaivalya Hariharan
Token-Level Control or Just a Better Mean? Isolating the Gains of Adaptive Decoding
Qingyun Li ⋅ Ruoyun Li
Unifying Group-Relative and Self-Distillation Policy Optimization via Sample Routing
Gengsheng Li ⋅ Tianyu Yang ⋅ Junfeng Fang ⋅ Mingyang Song ⋅ Mao Zheng ⋅ Haiyun Guo ⋅ Dan Zhang ⋅ Jinqiao Wang ⋅ Tat-Seng Chua
CPInj: Uncovering Prompt Injection Risks in Textual Collabo- rative Prompt Optimization
Xinting Liao ⋅ Behnoosh Zamanlooy ⋅ Masoumeh Shafieinejad ⋅ D. B Emerson ⋅ Ruinan Jin ⋅ Deval Pandya ⋅ Xiaoxiao Li
A case study of evaluating AI agents on a neuroscience data-to-discovery pipeline
Kai Horstmann ⋅ Ethan Lin ⋅ Alice A Robie ⋅ Jennifer J. Sun ⋅ Kristin Branson
LLM REgression with a Latent Iterative State Head (RELISH)
Yiheng Su ⋅ Matt Lease
RankGuide: Tensor-Rank-Guided Routing and Steering for Efficient Reasoning
Jiayi Tian ⋅ Yupeng Su ⋅ Ryan Solgi ⋅ Souvik Kundu ⋅ Zheng Zhang
In-Situ Behavioral Evaluation for LLM Fairness, Not Standardized-Test Scores
Zeyu Tang ⋅ Sang Truong ⋅ Deonna Owens ⋅ Shreyas Sharma ⋅ Yibo Jacky Zhang ⋅ Brando Miranda ⋅ Sanmi Koyejo
ODILE: Orthogonal Disruption of Injected Tool-Call Embeddings for Agentic Prompt Injection Defense
Mehmet Özdinçer ⋅ Samuel Simko ⋅ Bernhard Schölkopf ⋅ Zhijing Jin
Fine-Tuning Was Not Broken but Diffuse: Precise Knowledge Editing via Projected Error Signals
Shahar Katz ⋅ Avi Caciularu ⋅ Lior Wolf
Deep Research Agents Bring Deeper Harm
Shuo Chen ⋅ Zonggen Li ⋅ Xingyu Jin ⋅ Zhen Han ⋅ Bailan He ⋅ Tong Liu ⋅ Haokun Chen ⋅ Georg Groh ⋅ Philip Torr ⋅ Volker Tresp ⋅ Jindong Gu
Faithful GRPO: Improving Visual Spatial Reasoning in Multimodal Language Models via Constrained Policy Optimization
Sai Srinivas Kancheti ⋅ Aditya S Kanade ⋅ Rohit Sinha ⋅ Vineeth N Balasubramanian ⋅ Tanuja Ganu
Odysseys: Benchmarking Web Agents on Realistic Long Horizon Tasks
Lawrence Keunho Jang ⋅ Jing Yu Koh ⋅ Daniel Fried ⋅ Ruslan Salakhutdinov
Delay, Plateau, or Collapse: Evaluating the Impact of Systematic Verification Error on RLVR
Kazuki Egashira ⋅ Mark Vero ⋅ Jasper Dekoninck ⋅ Florian E Dorner ⋅ Robin Staab ⋅ Martin Vechev
MURMUR: Cross-Lingual and Multimodal Retrieval-Augmented Reasoning for Open Question Answering in Tamil and Yoruba
Kiran Raja ⋅ Mobareji Abejide ⋅ Arya Ram ⋅ Utkarsh Sharma ⋅ Kevin Zhu
DepthSSD: Rethinking Residual Connections via State Space Models on the Depth Axis
Zhengqing Yuan ⋅ Xiaoyu Ma ⋅ Yunhong He ⋅ Zhengtao Yao ⋅ Lichao Sun ⋅ Yanfang (Fanny) Ye
Training Agents to Self-Report Misbehavior
Bruce W Lee ⋅ Chen Yueh-Han ⋅ Tomek Korbak
Decoupling Planning and Control for Instructable Agents
Zineng Tang ⋅ Kelsey R Allen ⋅ Sjoerd v Steenkiste ⋅ Ishita Dasgupta ⋅ Alane Suhr
Social World Models
Xuhui Zhou ⋅ Jiarui Liu ⋅ Akhila Yerukola ⋅ Hyunwoo Kim ⋅ Maarten Sap
Learning to Learn from Language Feedback with Social Meta-Learning
Jonathan Cook ⋅ Diego Antognini ⋅ Martin Klissarov ⋅ Claudiu C Musat ⋅ Edward Grefenstette
CREBench: Evaluating Large Language Models in Cryptographic Binary Reverse Engineering
Baicheng Chen ⋅ Yu Wang ⋅ Ziheng Zhou ⋅ Xiangru Liu ⋅ Juanru Li ⋅ Yilei Chen ⋅ Tianxing He
Reasoning about Intent for Ambiguous Requests
Irina Saparina ⋅ Mirella Lapata
Multilingual Agent-Based World Modeling for Social Science
Xuan Zhang ⋅ Wenxuan Zhang ⋅ Anxu Wang ⋅ See-Kiong Ng ⋅ Yang Deng
Measuring Task-Agnostic Training Data Influence Across Language Model Pretraining
Yuto Nishida ⋅ Hirokazu Kiyomaru ⋅ Yusuke Oda ⋅ Takashi Kodama ⋅ Chaoran Liu ⋅ Daisuke Kawahara ⋅ Yusuke Miyao ⋅ Max Müller-Eberstein ⋅ Masaru Isonuma
PreScam: A Benchmark for Predicting Scam Progression from Early Conversations
Weixiang Sun ⋅ Shang Ma ⋅ Yiyang Li ⋅ Tianyi Ma ⋅ Zehong Wang ⋅ Colby Nelson ⋅ Xusheng Xiao ⋅ Yanfang (Fanny) Ye
Distill to Detect: Exposing Stealth Biases in LLMs through Cartridge Distillation
Shayan Talaei ⋅ Abhinav Chinta ⋅ Fnu Devvrit ⋅ Amin Karbasi ⋅ Azalia Mirhoseini ⋅ Amin Saberi
LLMs Corrupt Your Documents When You Delegate
Philippe Laban ⋅ Tobias Schnabel ⋅ Jennifer Neville
Rubrics to Tokens: Bridging Response-level Rubrics and Token-level Rewards in Instruction Following Tasks
Tianze Xu ⋅ Yanzhao Zheng ⋅ Pengrui Lu ⋅ Lyumanshan Ye ⋅ Yong Wu ⋅ Zhentao Zhang ⋅ Yuanqiang Yu ⋅ Chao Ma ⋅ Jihuai Zhu ⋅ Pengfei Liu ⋅ Baohua Dong ⋅ Hangcheng Zhu ⋅ Ruohui Huang ⋅ Gang Yu
Generating Pretraining Tokens from Organic Data for Data-Bound Scaling
Zichun Yu ⋅ Chenyan Xiong
When to Call an Apple Red: Humans Follow Introspective Rules, VLMs Don’t
Jonathan Nemitz ⋅ Carsten Eickhoff ⋅ Jessy Li ⋅ Kyle Mahowald ⋅ Michal Golovanevsky ⋅ William Rudman
Uncertainty Drives Social Bias Changes in Quantized Large Language Models
Stanley Hua ⋅ Sanae Lotfi ⋅ Irene Y Chen
Making Grid Beam Search Less Greedy
Sean Papay ⋅ Roman Klinger
EgoMemory: A Comprehensive Memory Benchmark for Long-Horizon Egocentric Video Understanding
Ziyang Wang ⋅ Yue Zhang ⋅ Shoubin Yu ⋅ Ce Zhang ⋅ Zengqi Zhao ⋅ Jaehong Yoon ⋅ Hyunji Lee ⋅ Gedas Bertasius ⋅ Mohit Bansal
ResearcherBench: Evaluating Deep AI Research Systems on Open-ended AI Research Tasks
Tianze Xu ⋅ Pengrui Lu ⋅ Lyumanshan Ye ⋅ Xiangkun Hu ⋅ Pengfei Liu
Jagle: Building a Large-Scale Japanese Multimodal Post-Training Dataset for Vision–Language Models
Issa Sugiura ⋅ Keito Sasagawa ⋅ Keisuke Nakao ⋅ Koki Maeda ⋅ Ziqi Yin ⋅ Zhishen Yang ⋅ Shuhei Kurita ⋅ Yusuke Oda ⋅ Ryoko Tokuhisa ⋅ Daisuke Kawahara ⋅ Naoaki Okazaki
Semantic Richness or Geometric Reasoning? The Fragility of VLM's Visual Invariance
Jason Qiu ⋅ Zachary Meurer ⋅ Xavier Thomas ⋅ Deepti Ghadiyaram
Safe Inference-Time Alignment via Lagrangian Reward Augmentation
Yaswanth Chittepu ⋅ Ativ Joshi ⋅ Sohini Chintala ⋅ Scott Niekum
InjecMEM: Memory Injection Attack on LLM Agent Memory Systems
Hanling Tian ⋅ Gengyu Zhang ⋅ Zeyang Sha ⋅ Jingying Wang ⋅ Yuhang Liu ⋅ Zhehao Huang ⋅ Kun Yang ⋅ Xiaolin Huang
Benchmark Designers Should "Train on the Test Set" to Expose Exploitable Non-Visual Shortcuts
Ellis Brown ⋅ Jihan Yang ⋅ Shusheng Yang ⋅ Rob Fergus ⋅ Saining Xie
VisCodeBench: a new benchmark dataset for Text-to-Vis reflecting real-world practice
Hy Nguyen ⋅ Thomas J Elton ⋅ Ella Wilson ⋅ Cecile Paris ⋅ Andrew Reeson ⋅ Josiah Poon ⋅ Jonathan Kummerfeld
“I didn’t Make the Micro Decisions”: Measuring, Inducing, and Exposing Goal-Level AI Contributions in Collaboration
Eunsu Kim ⋅ Jessica R Mindel ⋅ Kyungjin Kim ⋅ Sherry Wu
ContextBudget: Budget-Aware Context Management for Long-Horizon Search Agents
Yong Wu ⋅ Yanzhao Zheng ⋅ Tianze Xu ⋅ Zhentao Zhang ⋅ Yuanqiang Yu ⋅ Jihuai Zhu ⋅ Chao Ma ⋅ Binbin Lin ⋅ Baohua Dong ⋅ Hangcheng Zhu ⋅ Ruohui Huang ⋅ Gang Yu
Unveiling the Mechanisms of Multi-Hop Reasoning in Transformers via Identity Bridge
Pengxiao Lin ⋅ Zheng-An Chen ⋅ Zhi-Qin J Xu
GRADE: Probing Knowledge Gaps in LLMs through Gradient Subspace Dynamics
Yujing Wang ⋅ Yuanbang Liang ⋅ Yu-Kun Lai ⋅ Hainan Zhang ⋅ Hanqi Yan
Parcae: Scaling Laws For Stable Looped Language Models
Hayden Prairie ⋅ Zachary Novack ⋅ Taylor Berg-Kirkpatrick ⋅ Daniel Y Fu
SkillRouter: Skill Routing for LLM Agents at Scale
Yanzhao Zheng ⋅ Zhentao Zhang ⋅ Chao Ma ⋅ Yuanqiang Yu ⋅ Jihuai Zhu ⋅ Yong Wu ⋅ Tianze Xu ⋅ Baohua Dong ⋅ Hangcheng Zhu ⋅ Ruohui Huang ⋅ Gang Yu
Think Right: Learning to Mitigate Under-Over Thinking via Adaptive, Attentive Compression
Joykirat Singh ⋅ Justin Chen ⋅ Archiki Prasad ⋅ Elias Stengel-Eskin ⋅ Akshay Nambi ⋅ Mohit Bansal
Message Passing Enables Efficient Reasoning
Xuecheng Liu ⋅ Daman Arora ⋅ Gokul Swamy ⋅ Andrea Zanette
FinTrace: Holistic Trajectory-Level Evaluation of LLM Tool Calling for Long-Horizon Financial Tasks
Yupeng Cao ⋅ Haohang Li ⋅ Weijin Liu ⋅ Wenbo Cao ⋅ Anke Xu ⋅ Lingfei Qian ⋅ Xueqing Peng ⋅ Minxue Tang ⋅ Zhiyuan Yao ⋅ Jimin Huang ⋅ K.P. Subbalakshmi ⋅ Zining Zhu ⋅ Jordan W Suchow ⋅ Yangyang Yu
Bridging Databases and Documents: Data-Algorithm Co-Design for Hybrid Question Answering
Ruofan Wu ⋅ Boyi Liu ⋅ Fan Shu ⋅ Yite Wang ⋅ Zhewei Yao ⋅ Yuxiong He ⋅ Feng Yan
Counterfactual Simulation Training for Chain-of-Thought Faithfulness
Peter Hase ⋅ Christopher Potts
Benchmarking of Automated Assessment of K-5 Student Narratives Using Large Language Models
Saman Enayati ⋅ Elmira Talebianaraki ⋅ Ziyu Yang ⋅ Slobodan Vucetic ⋅ Trina D Spencer
Thinking to Recall: How Reasoning Unlocks Parametric Knowledge in LLMs
Zorik Gekhman ⋅ Roee Aharoni ⋅ Eran Ofek ⋅ Mor Geva ⋅ Roi Reichart ⋅ Jonathan Herzig
iOSWorld: A Realistic iOS Environment for Benchmarking Phone Agents with Personalized User Identity and Memory
Lawrence Keunho Jang ⋅ Mareks Woodside ⋅ Geronimo Carom ⋅ Andrew K Jang ⋅ Jing Yu Koh ⋅ Ruslan Salakhutdinov
When Large Language Models Know the Table: A Framework for Assessing Data Contamination in Tabular Datasets
Matteo Silvestri ⋅ Fabiano Veglianti ⋅ Flavio Giorgi ⋅ Fabrizio Silvestri ⋅ Gabriele Tolomei
BugScope: Learn to Detect Bugs Like Human
Jinyao Guo ⋅ Chengpeng Wang ⋅ Dominic DeLuca ⋅ Jinjie Liu ⋅ Zhuo Zhang ⋅ Xiangyu Zhang
Beyond Semantic Similarity: Complementary Antecedent Reasoning for Memory Association
Zheling Tan ⋅ Jin Gao ⋅ Dequan Wang
Spillover-Aware Multi-Value Steering for Pluralistic LLM Alignment
Weici Pan ⋅ Xander Barron ⋅ Jiawei Zhou ⋅ Zhenhua Liu
BibTeX Citation Hallucinations in Scientific Publishing Agents: Evaluation and Mitigation
Delip Rao ⋅ Chris Callison-Burch
Steering Awareness: Detecting Activation Steering from Within
Joshua Fonseca Rivera ⋅ David D Africa
On the Impossibility of Retrain Equivalence in Machine Unlearning
Jiatong Yu ⋅ Sanjeev Arora ⋅ Yinghui He ⋅ Anirudh Goyal
Domain-Adapted Retrieval for In-Context Annotation of Pedagogical Dialogue Acts
Jinsook Lee ⋅ Kirk Vanacore ⋅ Zhuqian Zhou ⋅ Bakhtawar Ahtisham ⋅ Rene F Kizilcec
Scaling Test-Time Compute for Agentic Coding
Joongwon Kim ⋅ Wannan Yang ⋅ Kelvin Niu ⋅ Hongming Zhang ⋅ Yun Zhu ⋅ Eryk Helenowski ⋅ Ruan Silva ⋅ Zhengxing Chen ⋅ Srini Iyer ⋅ Manzil Zaheer ⋅ Daniel Fried ⋅ Hanna Hajishirzi ⋅ Sanjeev Arora ⋅ Ruslan Salakhutdinov ⋅ Gabriel Synnaeve ⋅ Anirudh Goyal
Growing Pains: Extensible and Efficient LLM Benchmarking Via Fixed Parameter Calibration
Eliya Habba ⋅ Itay Itzhak ⋅ Asaf Yehudai ⋅ Yotam Perlitz ⋅ Elron Bandel ⋅ Michal Shmueli-Scheuer ⋅ Leshem Choshen ⋅ Gabriel Stanovsky
Playing Along: Learning a Double-Agent Defender for Belief Steering via Theory of Mind
Hanqi Xiao ⋅ Vaidehi Patil ⋅ Zaid Khan ⋅ Hyunji Lee ⋅ Elias Stengel-Eskin ⋅ Mohit Bansal
Autorubric: Unifying Rubric-based LLM Evaluation
Delip Rao ⋅ Chris Callison-Burch
Lost in Backpropagation: The LM Head is a Gradient Bottleneck
Nathan Godey ⋅ Yoav Artzi
WebChoreArena: Evaluating Web Browsing Agents on Realistic Tedious Web Tasks
Atsuyuki Miyai ⋅ Zaiying Zhao ⋅ Kazuki Egashira ⋅ Atsuki Sato ⋅ Tatsumi Sunada ⋅ Shota Onohara ⋅ Hiromasa Yamanishi ⋅ Mashiro Toyooka ⋅ Kunato Nishina ⋅ Ryoma Maeda ⋅ Kiyoharu Aizawa ⋅ Toshihiko Yamasaki
Trie Automata for Constrained Decoding over Large Finite Sets
Xingzi Xu ⋅ Karim Bouyarmane
TRACES: Tagging Reasoning Steps for Adaptive Cost-Efficient Early-Stopping
Yannis Belkhiter ⋅ Seshu Tirupathi ⋅ Giulio Zizzo ⋅ John Kelleher
From Feelings to Metrics: Understanding and Formalizing How Users Vibe-Test LLMs
Itay Itzhak ⋅ Eliya Habba ⋅ Gabriel Stanovsky ⋅ Yonatan Belinkov
SEQUOR: A Multi-Turn Benchmark for Realistic Constraint Following
Beatriz Canaverde ⋅ Duarte Alves ⋅ José Pombal ⋅ Giuseppe Attanasio ⋅ Andre Martins
Attractor States Emerge in Multi-Turn LLM Conversations
Ting-Wen Ko ⋅ Jonas Geiping
Steering LLMs for Culturally Localized Generation
Simran Khanuja ⋅ Hongbin Liu ⋅ Shujian Zhang ⋅ John W Lambert ⋅ Mingqing Chen ⋅ Rajiv Mathews ⋅ Lun Wang
Reflective Context Learning: Studying the Optimization Primitives of Context Space
Nikita Vassilyev ⋅ William Berrios ⋅ RUOWANG ZHANG ⋅ Bo Han ⋅ Douwe Kiela ⋅ Shikib Mehri
Off-Policy Token-Level Labels Improve Out-of-Distribution Generalization for Summarization
Zitong Huang ⋅ Gustavo A de Carvalho ⋅ Deqing Fu ⋅ Robin Jia
RewardClaw: Learning Human Preferences for Image Editing with Only 100 Demonstrations
Yuxuan Zhang ⋅ Cong Wei ⋅ Penghui Du ⋅ Bo Li ⋅ Huaisong Zhang ⋅ Songcheng Cai ⋅ Yubo Wang ⋅ Dongfu Jiang ⋅ Yuyu Zhang ⋅ Changqian Yu ⋅ Ping Nie ⋅ Wenhu Chen ⋅ Kelsey R Allen
Wiener Filtering for VLM Hallucination Suppression
Ameen Ali ⋅ Tamim Zoabi ⋅ Lidor Brami ⋅ Lior Wolf
From Mechanism Discovery to Proposal Closure: Graph-Grounded Hierarchical Search for Scientific Ideation
Zijian Hu ⋅ Hanqi Li ⋅ Zijian Wang ⋅ Tiancheng Huang ⋅ Chenrun Wang ⋅ Ziyue Yang ⋅ Kai Yu ⋅ Lu Chen
When Audio-Language Models Fail to Leverage Multimodal Context for Dysarthric Speech Recognition
Pehuen Moure ⋅ Niclas Pokel ⋅ Bilal Bounajma ⋅ Yingqiang Gao ⋅ Roman Boehringer ⋅ Longbiao Cheng ⋅ Shih-Chii Liu
Actor-Curator: Co-adaptive Problem Curation via Policy-Improvement Bandits for Scalable RL Post-Training
Zhengyao Gu ⋅ Jonathan Li ⋅ Raul Astudillo ⋅ Ziyu Ye ⋅ Langzhou He ⋅ Henry P Zou ⋅ Pei Chen ⋅ Wei Cheng ⋅ Santiago Paternain ⋅ Philip S Yu ⋅ Yisong Yue
Marco-MoE: Open Multilingual Mixture-of-Expert Language Models with Efficient Upcycling
Fan Jiang ⋅ Yu Zhao ⋅ Chenyang Lyu ⋅ Tianqi Shi ⋅ Yichao Du ⋅ Feihu Jiang ⋅ Longyue Wang ⋅ Weihua Luo
It Takes One to Bias Them All: Breaking Bad with One-Shot GRPO
Naihao Deng ⋅ Yilun Zhu ⋅ Naichen Shi ⋅ Clayton Scott ⋅ Rada Mihalcea
Relative Scaling Laws for LLMs
William B Held ⋅ David L Hall ⋅ Percy Liang ⋅ Diyi Yang
Multilingual Prompt Localization for Agent-as-a-Judge: Language and Backbone Sensitivity in Requirement-Level Evaluation
Alhasan S Mahmood ⋅ Samir Abdaljalil ⋅ HASAN KURBAN
Wired for Overconfidence: A Mechanistic Perspective on Inflated Verbalized Confidence in LLMs
Tianyi Zhao ⋅ Yinhan He ⋅ Wendy Zheng ⋅ Yujie Zhang ⋅ Chen Chen
Diversifying Multiple Generative Agents by Aligning with Human Populations
Manh Hung Nguyen ⋅ Sebastian Tschiatschek ⋅ Adish Singla
CritICL: Inference-Time Weak-to-Strong Generalization from Small Language Model Failure Modes
Yufan Wu ⋅ Zhengyi Hu ⋅ Lang Wei ⋅ Ruichen Li ⋅ Qifan Yang ⋅ Yinghui He ⋅ Ting Zhu
AgentIR: Reasoning-Aware Retrieval for Deep Research Agents
Zijian Chen ⋅ Xueguang Ma ⋅ Shengyao Zhuang ⋅ Jimmy Lin ⋅ Akari Asai ⋅ Victor Zhong
The Story Shapes the Agent: Narrative Priors in LLM Behavior
Yixuan Wang ⋅ James Lester ⋅ Shashank Srivastava
BiomedSQL: Text-to-SQL for Scientific Reasoning on Biomedical Knowledge Bases
Mathew J Koretsky ⋅ Maya Willey ⋅ Owen Bianchi ⋅ Chelsea X Alvarado ⋅ Tanay Nayak ⋅ Nicole Kuznetsov ⋅ Sungwon Kim ⋅ Michael Nalls ⋅ Daniel Khashabi ⋅ Faraz Faghri
Uncertainty as a Planning Signal: Multi-Turn Decision Making for Goal-Oriented Conversation
Xinyi Ling ⋅ Ye Liu ⋅ Reza Averly ⋅ Xia Ning
Automatic or Controlled? Repetition Priming Reveals Divergent Processing in Base LLMs, Instruct LLMs, and Humans
Jinglei Ren ⋅ Yuyue Wang
Function Over Form: Distributional Orthogonalization in Mixture-of-Experts with Replica Expert Mechanism
Jinfan He ⋅ Yunzhuo Liu ⋅ Kai Zhang ⋅ Weidong Han ⋅ key ⋅ Rayying
Conversation as Measurement in Clinical Encounters: Observable Phase Structure, Partially Observable Patient State
Lily Chen ⋅ Ted Mau ⋅ Michael Gensheimer ⋅ Brian A Nuyen ⋅ Nancy Jiang ⋅ James Zou
Steering Instruction Hierarchies at Inference Time
Siqi Zeng ⋅ Sewoong Lee ⋅ Han Zhao ⋅ Julia Hockenmaier
Hidden in the Haystack: Smaller Needles are More Difficult for LLMs to Find
Owen Bianchi ⋅ Mathew J Koretsky ⋅ Tanay Nayak ⋅ Maya Willey ⋅ Chelsea X Alvarado ⋅ Adi Asija ⋅ Nicole Kuznetsov ⋅ Michael Nalls ⋅ Faraz Faghri ⋅ Daniel Khashabi
Diversity or Precision? A Deep Dive into Next Token Prediction
Haoyuan Wu ⋅ Hai Wang ⋅ jiajia wu ⋅ Jinxiang Ou ⋅ keyaowang ⋅ Weile Chen ⋅ Zihao Zheng ⋅ Bei Yu
Beyond expert users: modeling boundedly rational users in conversational recommendation
Irena Saracay ⋅ Ludwig Schmidt ⋅ Carlos Guestrin
DRBENCHER: Can Your Agent Identify the Entity, Retrieve Its Properties and Do the Math?
Young-Suk Lee ⋅ Ramón Fernandez Astudillo ⋅ Radu Florian
Why Vision Fails as a Universal Bridge: Rectifying Modality Asynchrony in Multilingual MLLMs
Yihang Du ⋅ Juhao Liang ⋅ Zhengzhao Lai ⋅ Siyu Li ⋅ Yan Hu
Overton Pluralistic Reinforcement Learning for Large Language Models
Yu Fu ⋅ Seongho Son ⋅ Ilija Bogunovic
Reasoning Models Know What’s Important, and Encode It in Their Activations
Yaniv Nikankin ⋅ Martin Tutek ⋅ Tomer Ashuach ⋅ Jonathan S Rosenfeld ⋅ Yonatan Belinkov
Emergent Unfaithfulness: How Alignment Training Causes Language Models to Silently Override Task Faithfulness
Pardis Sadat Zahraei ⋅ Janvijay Singh ⋅ Gokhan Tur ⋅ Dilek Hakkani-Tür
Preserving Long-Tailed Expert Information in Mixture-of-Experts Tuning
Haoze He ⋅ Xingyuan Ding ⋅ Xuan Jiang ⋅ Xinkai Zou ⋅ Alex Cheng ⋅ Yibo Zhao ⋅ Juncheng B Li ⋅ Heather Miller
ReflCtrl: Controlling LLM Reflection Efficiently via Representation Engineering
Ge Yan ⋅ Chung-En Sun ⋅ Linbo Liu ⋅ Tsui-Wei (Lily) Weng
Hyper-Connected Looped Transformers for Parameter-Efficient Language Modeling
Abbas Zeitoun ⋅ Lucas Torroba-Hennigen ⋅ Yoon Kim
A Blind Spot in Alignment: Quantifying Biosecurity Risks in Large Language Models
Shu Quan ⋅ Tianfang Hao ⋅ Sitong Fang ⋅ He GENG ⋅ Jiayi Zhou ⋅ Boyuan Chen ⋅ Kaile Wang ⋅ Donghai Hong ⋅ Juntao Dai ⋅ Yaodong Yang ⋅ Jiaming Ji
Beyond the Rosetta Stone: Unification Forces in Generalization Dynamics
Carter Blum ⋅ Katja Filippova ⋅ Ann Yuan ⋅ Asma Ghandeharioun ⋅ Julian Zimmert ⋅ Fred Zhang ⋅ Jessica Hoffmann ⋅ Tal Linzen ⋅ Martin Wattenberg ⋅ Lucas Dixon ⋅ Mor Geva
Multi-Granular Node Pruning for Causal Circuit Discovery
Muhammad U Haider ⋅ Hammad Rizwan ⋅ Hassan Sajjad ⋅ A.B. Siddique
SuperCoder: Assembly Program Superoptimization with Large Language Models
Anjiang Wei ⋅ Tarun Suresh ⋅ Huanmi Tan ⋅ Yinglun Xu ⋅ Gagandeep Singh ⋅ Ke Wang ⋅ Alex Aiken
Agent Bazaar: Enabling Economic Alignment in Multi-Agent Marketplaces
Seth Karten ⋅ Cameron Crow ⋅ Chi Jin
Red-Teaming Text-to-Image Models via In-Context Experience Replay and Semantic-Preserving Prompt Rewriting
Zhi-Yi Chin ⋅ Pin-Yu Chen ⋅ Wei-Chen Chiu ⋅ Mario Fritz
LACUNA: A Testbed for Evaluating Localization Precision for LLM Unlearning
Matteo Boglioni ⋅ Thibault Rousset ⋅ Siva Reddy ⋅ Marius Mosbach ⋅ Verna Dankers
PAM: Training Moderation Filters from Policy-Derived Supervision
Masoomali Fatehkia ⋅ Enes Altinisik ⋅ Mohamed Osman ⋅ Husrev Taha Sencar
SAKE: Structured Agentic Knowledge Extrapolation for Complex LLM Reasoning via Reinforcement Learning
Jiashu He ⋅ Jinxuan Fan ⋅ Bowen Jiang ⋅ Ignacio Hounie ⋅ Dan Roth ⋅ Alejandro Ribeiro
Text-Guided Layer Fusion Mitigates Hallucination in Multimodal LLMs
Chenchen Lin ⋅ Sanbao Su ⋅ Rachel Luo ⋅ Yuxiao Chen ⋅ Yan Wang ⋅ Marco Pavone ⋅ Fei Miao
Understanding Machine Unlearning Through the Lens of Mode Connectivity
Jiali Cheng ⋅ Hadi Amiri
TritonRL: Training LLMs to Think and Code Triton Without Cheating
Jiin Woo ⋅ Shaowei Zhu ⋅ Allen Nie ⋅ Zhen Jia ⋅ Yida Wang ⋅ Youngsuk Park
DeepScholar-Bench: A Live Benchmark for Automated Evaluation of Generative Research Synthesis
Liana Patel ⋅ Negar Arabzadeh ⋅ Harshit Gupta ⋅ Ankita Sundar ⋅ Alon Y Halevy ⋅ Ion Stoica ⋅ Matei Zaharia ⋅ Carlos Guestrin
OpenStamp: A Watermark for Open-Source Language Models
Miroojin Bakshi ⋅ Saksham Rastogi ⋅ Danish Pruthi
TRIMS: Trajectory-Ranked Instruction Masked Supervision for Diffusion Language Models
Lingjie Chen ⋅ Ruizhong Qiu ⋅ Yuyu Fan ⋅ Yanjun Zhao ⋅ Hanghang Tong
StoryScope: Investigating idiosyncrasies in AI fiction
Jenna Russell ⋅ Rishanth Rajendhran ⋅ Mohit Iyyer ⋅ John F Wieting
Meta-Reinforcement Learning with Self-Reflection for Agentic Search
Teng Xiao ⋅ Yige Yuan ⋅ Hamish Ivison ⋅ Huaisheng Zhu ⋅ Faeze Brahman ⋅ Nathan Lambert ⋅ Pradeep Dasigi ⋅ Noah Smith ⋅ Hanna Hajishirzi
Multi-objective Evolutionary Merging Enables Efficient Reasoning Models
Mario Iacobelli ⋅ Adrian Robert Minut ⋅ Tommaso Mencattini ⋅ Donato Crisostomi ⋅ Andrea Santilli ⋅ Iacopo Masi ⋅ Emanuele Rodolà
AERO: Autonomous Evolutionary Reasoning Optimization via Endogenous Dual-Loop Feedback
Zhitao Gao ⋅ Jie Ma ⋅ Xuhong Li ⋅ Pengyu Li ⋅ Ning Qu ⋅ Yaqiang Wu ⋅ Hui Liu ⋅ Jun Liu
ReFIne: A Framework for Trustworthy Large Reasoning Models with Reliability, Faithfulness, and Interpretability
Chung-En Sun ⋅ Ge Yan ⋅ Akshay R Kulkarni ⋅ Tsui-Wei (Lily) Weng
LLMs as Content Curators: A Large-Scale Audit of Recommendation Bias Across Providers and Platforms
Nicolò Pagan ⋅ Christopher Barrie ⋅ Christopher Bail ⋅ Petter Törnberg
Entropy Centroids as Intrinsic Rewards for Test-Time Scaling
Wenshuo Zhao ⋅ Qi Zhu ⋅ Xingshan Zeng ⋅ Fei Mi ⋅ Lifeng Shang ⋅ Yiren Feng
Cycle-Consistent Search: Gold-Free Reinforcement Learning for Search Agents
Sohyun An ⋅ Shuibenyang Yuan ⋅ Hayeon Lee ⋅ Cho-Jui Hsieh ⋅ Alexander Min
On the Role of Reasoning Patterns in the Generalization Discrepancy of Long Chain-of-Thought Supervised Fine-Tuning
Zhaoyi Li ⋅ Xiangyu Xi ⋅ Zhengyu Chen ⋅ Wei Wang ⋅ Gangwei Jiang ⋅ Ranran Shen ⋅ Linqi Song ⋅ Ying Wei ⋅ Defu Lian
WebReal: Benchmarking DeepSearch Agents on Real-world User Information Needs
Yifei Wang ⋅ Shangwen Lv ⋅ Zhiyuan Xiong ⋅ Haoyuan Zhang ⋅ Yue Zhang ⋅ Rex Wang ⋅ Runquan Xie ⋅ Linjing Li ⋅ Zhanhui Kang ⋅ Daniel D Zeng
SALA: Syntax-Aware Logit Adjustment for Open-Ended Text Generation
Ting-Ruen Wei ⋅ Hsin-Tai Wu ⋅ Yi Fang
Interaction Protocol Shapes Moral Judgment in Multi-Agent Debate
Pratik Sachdeva ⋅ Tom van Nuenen
Latent Context Compilation: Distilling Long Context into Compact Portable Memory
Zeju Li ⋅ Yizhou Zhou ⋅ Qiang Xu
Process-Oriented Evaluation of AI-Assisted Scientific Writing
Patrick Da Silva ⋅ Sanchaita Hazra ⋅ Doeun Lee ⋅ Sachin Kumar ⋅ Bodhisattwa Prasad Majumder
Arbitration Failure, Not Perceptual Blindness: How Vision-Language Models Resolve Visual-Linguistic Conflicts
Farhad Nooralahzadeh ⋅ Omid Rohanian ⋅ Yi Zhang ⋅ Jonathan Fürst ⋅ Kurt Stockinger
A Mirage of Coherence: How Metaphor Impacts Language Models' Discourse Coherence Assessment
Wanting Ning ⋅ Brian Choi ⋅ Eun Jin Paek ⋅ Hyeju Jang
Synthesizing Instruction-Tuning Datasets with Contrastive Decoding
Tatsuya Ichinose ⋅ Youmi Ma ⋅ Masanari Oi ⋅ Ryuto Koike ⋅ Naoaki Okazaki
Capacity-Dependent Effects of Data Selection for Mathematical Reasoning
Cuong Dang ⋅ Hoang Anh Just ⋅ Ruoxi Jia
Document-as-Image Representations Fall Short for Scientific Retrieval
Ghazal Khalighinejad ⋅ Raghuveer Thirukovalluru ⋅ Alexander H Oh ⋅ Bhuwan Dhingra
MT-PINGEVAL: Evaluating Multi-Turn Collaboration with Private Information Games
Jacob Eisenstein ⋅ Fantine Huot ⋅ Adam Fisch ⋅ Jonathan Berant ⋅ Mirella Lapata
A Prior-Aware Metric for Efficiently Distinguishing Memorization from Generalization in Large Language Models
Trishita Tiwari ⋅ Ari Trachtenberg ⋅ G. Edward Suh
Language Models Might Not Understand You: Evaluating Theory of Mind via Story Prompting
Nathaniel Getachew ⋅ Abulhair Saparov
Learning Steerable Clarification Policies with Collaborative Self-play
Jonathan Berant ⋅ Maximillian Chen ⋅ Adam Fisch ⋅ Reza Aghajani ⋅ Fantine Huot ⋅ Mirella Lapata ⋅ Jacob Eisenstein
When Fewer Layers Break More Chains: Layer Pruning Harms Test-Time Scaling in LLMs
Keyu Wang ⋅ Tian Lyu ⋅ Guinan Su ⋅ Lu Yin ⋅ Marco Canini ⋅ Jonas Geiping ⋅ Shiwei Liu
Start Classifying: Categorical Critics for LLM Reinforcement Learning
Zhijian Zhou ⋅ Long Li ⋅ Xuan Zhang ⋅ Zongkai Liu ⋅ Yulei Qin ⋅ Ke Li ⋅ Xing Sun ⋅ Xiaoyu Tan ⋅ Chao Qu ⋅ Yuan Qi
PolicyLong: Towards On-Policy Context Extension
Junlong Jia ⋅ Ziyang Chen ⋅ Xing Wu ⋅ Chaochen Gao ⋅ TingHao YU ⋅ feng zhang ⋅ Songlin Hu ⋅ Binghui Guo
Beyond Post-Hoc Temperature Scaling: Bilevel Optimization for LLM Calibration
Ruochen Jin ⋅ Zhanliang Wang ⋅ Zongyu Dai ⋅ Jiancong Xiao ⋅ Bojian Hou
Length Value Model: Scalable Value Pretraining for Token-Level Length Modeling
Zhen Zhang ⋅ Changyi Yang ⋅ Zijie Xia ⋅ Zhen Yang ⋅ Chengzhi Liu ⋅ Zhaotian Weng ⋅ Yepeng Liu ⋅ Haobo Chen ⋅ Jin Pan ⋅ Chenyang Zhao ⋅ Yuheng Bu ⋅ Alkesh Patel ⋅ Zhe Gan ⋅ Eric Wang
CreativityNeuro: Steering Language Model Weights to Improve Divergent Thinking
Samuel Schapiro ⋅ Core Francisco Park ⋅ Felix A Sosa ⋅ Lav Varshney
MMMG: A Comprehensive and Reliable Benchmark for Multitask Multimodal Generation
Jihan Yao ⋅ Yushi Hu ⋅ Wenyuan Wang ⋅ Bin Han ⋅ Guang Yang ⋅ Yujie Yi ⋅ Shangbin Feng ⋅ Bingbing Wen ⋅ Ranjay Krishna ⋅ Lucy Lu Wang ⋅ Yulia Tsvetkov ⋅ Noah Smith ⋅ Banghua Zhu
Rule vs. Consequence: Dissociable Internal Representations of Moral Reasoning in LLMs
Eugenie Shi
BERT-as-a-Judge: A Robust Alternative to Lexical Methods for Efficient Reference-Based LLM Evaluation
Hippolyte Gisserot-Boukhlef ⋅ Nicolas Boizard ⋅ Emmanuel Malherbe ⋅ CELINE HUDELOT ⋅ Pierre Colombo
SPEED: Specialized Position Experts for Efficient Speculative Decoding
Langlin Huang ⋅ Chengsong Huang ⋅ Jixuan Leng ⋅ Di Huang ⋅ Jiaxin Huang
MegaScience: Pushing the Frontiers of Open Post-Training Datasets for Science Reasoning
Run-Ze Fan ⋅ Zengzhi Wang ⋅ Pengfei Liu
Beyond Semantics: Rediscovering Spatial Awareness in Vision-Language Models
Jianing Qi ⋅ Jiawei Liu ⋅ Hao Tang ⋅ Zhigang Zhu
InfiniteScienceGym: An Unbounded, Procedurally-Generated Benchmark for Scientific Analysis
Oliver Bentham ⋅ Vivek Srikumar
From Terminology to Diagrams: Visual-Instruction Generation for Scientific Diagram Understanding
Raúl Ortega ⋅ José Manuel Gómez-Pérez
Subliminal Steering: Encoding and Detecting Hidden Signals
George Morgulis ⋅ John Hewitt
WildTableBench: Benchmarking Multimodal Foundation Models on Table Understanding In the Wild
Junzhe Huang ⋅ Xiaoxiao Sun ⋅ Yan Yang ⋅ Yuxuan Hou ⋅ Ruotian Zhang ⋅ Sirui Li ⋅ Hehe Fan ⋅ Serena Yeung-Levy ⋅ Xin Yu
The Illusion of Superposition? A Principled Analysis of Latent Thinking in Language Models
Michael Rizvi-Martel ⋅ Guillaume Rabusseau ⋅ Marius Mosbach
MERIT: Multilingual Moral Decision-Making with Theory-Grounded Rubrics
Ayoung Lee ⋅ Ryan Kwon ⋅ Yunxiang Zhang ⋅ Yuxuan Liu ⋅ Peter Railton ⋅ Lu Wang
The Cost of Language: Centroid Erasure Exposes and Exploits Modal Competition in Multimodal Language Models
Akshay Paruchuri ⋅ Ishan Chatterjee ⋅ Henry Fuchs ⋅ Ehsan Adeli ⋅ Piotr Didyk
Coding Agents Don’t Know When to Act
Thibaud Gloaguen ⋅ Niels Mündler-Sasahara ⋅ Mark Niklas Müller ⋅ Veselin Raychev ⋅ Martin Vechev
Evaluating the Retrieval Robustness of Large Language Models
Shuyang Cao ⋅ Karthik Radhakrishnan ⋅ David S Rosenberg ⋅ Steven Lu ⋅ Pengxiang Cheng ⋅ Lu Wang ⋅ Shiyue Zhang
Scaling Self-Play with Self-Guidance
Luke Bailey ⋅ Kaiyue Wen ⋅ Kefan Dong ⋅ Tatsunori Hashimoto ⋅ Tengyu Ma
Commitment To Cooperation With Self-Negotiated Contracts
Tim Wyse ⋅ Kaitlin Bustos ⋅ Yulia Volkova ⋅ Max Kleiman-Weiner
Back to Basics: Revisiting ASR in the Age of Voice Agents
Geeyang Tay ⋅ Wentao Ma ⋅ Jaewon Lee ⋅ Yuzhi Tang ⋅ Daniel Lee ⋅ Weisu Yin ⋅ Dongming Shen ⋅ Silin Meng ⋅ Yi Zhu ⋅ Mu Li ⋅ Alex Smola
Domain-Aware Scaling Laws Uncover Data Synergy
Kimia Hamidieh ⋅ Lester Mackey ⋅ David Alvarez-Melis
Cracks in the Foundation: Seemingly Minor Architectural Choices Impact Long Context Extension
Amanda Bertsch ⋅ Luca Soldaini ⋅ Matthew R Gormley ⋅ Graham Neubig ⋅ Hanna Hajishirzi ⋅ Kyle Lo ⋅ Dirk Groeneveld
Co-Evolving Structured Knowledge and Reasoning in Language Models
Ryan T Noonan ⋅ Linxi Zhao ⋅ Menghan Xu ⋅ Akanksha Sarkar ⋅ Mihir Mishra ⋅ Dongyoung Go ⋅ Kilian Weinberger ⋅ Yoav Artzi ⋅ Jennifer J. Sun
Back to Basics: Let Conversational Agents Remember with Just Retrieval and Generation
Yuqian Wu ⋅ Wei Chen ⋅ Zhengjun Huang ⋅ Junle Chen ⋅ Qingxiang Liu ⋅ Kai Wang ⋅ Xiaofang Zhou ⋅ Yuxuan Liang
A Unified View of Attention and Residual Sinks: Outlier-Driven Rescaling is Essential for Large Language Model Training
Zihan Qiu ⋅ Zeyu Huang ⋅ Kaiyue Wen ⋅ Peng Jin ⋅ Bo Zheng ⋅ Yuxin Zhou ⋅ Haofeng Huang ⋅ Zekun Wang ⋅ Xiao Li ⋅ Huaqing Zhang ⋅ Yang Xu ⋅ Haoran Lian ⋅ Siqi Zhang ⋅ Rui Men ⋅ jianwei zhang ⋅ Ivan Titov ⋅ Dayiheng Liu ⋅ Jingren Zhou ⋅ Junyang Lin
Rethinking Generalization in Reasoning SFT: A Conditional Analysis on Optimization, Data, and Model Capability
Qihan Ren ⋅ Wang Peng ⋅ Ruikun Cai ⋅ Shuai Shao ⋅ Dadi Guo ⋅ Yuejin Xie ⋅ Yafu Li ⋅ Quanshi Zhang ⋅ Xia Hu ⋅ Jing Shao ⋅ Dongrui Liu
Do Depth-Grown Models Overcome The Curse Of Depth? An In-Depth Analysis
Ferdinand Kapl ⋅ Emmanouil Angelis ⋅ Tobias Höppe ⋅ Kaitlin Maile ⋅ Johannes von Oswald ⋅ Nino Scherrer ⋅ Stefan Bauer
EvoSkillBank: Hierarchical Skill Self-Evolution and Skill-Bank Governance for Continual Agent Learning
Shuaiyu Zhou ⋅ Jiaying Zhang ⋅ Taoyuan Li ⋅ Lei Shi ⋅ Fengpeng Yue ⋅ Cao Liu ⋅ Ke Zeng
FIPO: Eliciting Deep Reasoning with Future-KL Influenced Policy Optimization
Chiyu Ma ⋅ Shuo Yang ⋅ Kexin Huang ⋅ Jinda Lu ⋅ Haoming Meng ⋅ Shangshang Wang ⋅ Bolin Ding ⋅ Soroush Vosoughi ⋅ Guoyin Wang ⋅ Jingren Zhou
Uncertainty-Aware Variational Reward Factorization via Probabilistic Preference Bases for LLM Personalization
Gyuseok Lee ⋅ Wonbin Kweon ⋅ Zhenrui Yue ⋅ SeongKu Kang ⋅ Jiawei Han ⋅ Dong Wang
ATBench: A Diverse and Realistic Trajectory Benchmark for Long-Horizon Agent Safety
Yu Li ⋅ Haoyu Luo ⋅ Yuejin Xie ⋅ Yuqian Fu ⋅ Zhonghao Yang ⋅ Shuai Shao ⋅ Qihan Ren ⋅ Wanying Qu ⋅ Yanwei Fu ⋅ Yujiu Yang ⋅ Jing Shao ⋅ Dongrui Liu
In-Context Exploration-Exploitation is Biased by Semantic Priors
David Austin ⋅ Kaheer Suleman ⋅ Jackie Cheung
Understanding Primacy Effects in Large Language Models with Sparse Autoencoders
Ikhyun Cho ⋅ Julia Hockenmaier
Spectral Principal Paths: A Spectral Perspective on Linear Representation Formation in LLMs
Bowei Tian ⋅ Xuntao Lyu ⋅ Meng Liu ⋅ Hongyi Wang ⋅ Ang Li
CrystalSTAR: Structured Action Orchestration with Trio-Reflection for Constrained Novel Crystal Discovery
Chenyi Tong ⋅ Jingru Gan ⋅ Yanqiao Zhu ⋅ Kaiqiao Han ⋅ Haixin Wang ⋅ Xiao Luo ⋅ Yizhou Sun ⋅ Wei Wang
Fork-think with Confidence
Zena Al-Khalili ⋅ Rafi Hakim ⋅ Dietrich Klakow ⋅ Ji-Ung Lee
Instruct-FD: Can Your Full-Duplex Speech System Follow Turn-Taking Instructions?
Yuzhi Tang ⋅ Wentao Ma ⋅ Xiling Zhao ⋅ Ahmad Salimi ⋅ Sepehr H Moridani ⋅ Dongming Shen ⋅ Jixuan Wang ⋅ Abdulrahman Abdulrazzag ⋅ Murdock Aubry ⋅ Yu-Hua Chen ⋅ Daniel Lee ⋅ Jaewon Lee ⋅ Jonah Mackey ⋅ Silin Meng ⋅ Nicholas Stranges ⋅ Chenxu Xiong ⋅ Hao Yu ⋅ Yi Zhu ⋅ Mu Li ⋅ Alex Smola
Towards Full Pipeline FP8 Reinforcement Learning for LLMs
Fanchao Chen ⋅ Ziheng Jiang ⋅ Ziyun Wei ⋅ Zheng Zhong ⋅ Du Li ⋅ Chi Zhang ⋅ Haibin L ⋅ Shivaram Venkataraman
When Prompts Interact: Assessing Prompt Arithmetic for Deconfounding under Distribution Shift
Zhecheng Sheng ⋅ Yongsen Tan ⋅ Xiruo Ding ⋅ Trevor Cohen ⋅ Serguei V Pakhomov
Is CLIP Cross-Eyed? Revealing and Mitigating Center Bias in the CLIP Family
Oscar Chew ⋅ Hsiao-Ying Huang ⋅ Kunal Jain ⋅ Tai-I Chen ⋅ Khoa D Doan ⋅ Kuan-Hao Huang
Se-DPO: Self-Evolving Token Credit for Direct Preference Optimization
Wenxiao Zhao ⋅ Shu Wang ⋅ Ying Nian Wu
MELD: Multilingual Ensemble via Logical Debate
Sehyeok Kang ⋅ Jaejun Ryu ⋅ Se-Young Yun
When Do LLMs Admit Their Mistakes? Understanding The Role Of Model Belief In Retraction
Yuqing Yang ⋅ Robin Jia
LangFIR: Discovering Sparse Language-Specific Features from Monolingual Data for Language Steering
Sing Hieng Wong ⋅ Hassan Sajjad ⋅ A.B. Siddique
Spend Less, Fit Better: Budget-Efficient Scaling Law Fitting via Active Experiment Selection
Sijie Li ⋅ Shanda Li ⋅ Haowei Lin ⋅ Weiwei Sun ⋅ Ameet Talwalkar ⋅ Yiming Yang
Revisiting On-Policy Distillation: Empirical Failure Modes and Simple Fixes
Yuqian Fu ⋅ Haohuan Huang ⋅ Kaiwen Jiang ⋅ Jiacai Liu ⋅ Zhuo Jiang ⋅ Yuanheng Zhu ⋅ Dongbin Zhao
Cost-Efficient Estimation of General Abilities Across Benchmarks
Michael Krumdick ⋅ Adam Wiemerslage ⋅ Seth Ebner ⋅ Charles Lovering ⋅ Chris Tanner
Goose: Anisotropic Speculation Trees for Training-Free Speculative Decoding
TAO JIN ⋅ Phuong Minh Nguyen ⋅ Naoya Inoue
Verb-ICL: Rethinking Selective Annotation for Few-shot Structured Prediction
Fan Bai ⋅ Hengshuo Miao ⋅ Sanjit S Batra ⋅ Hamid Reza Hassanzadeh ⋅ Ardavan Saeedi ⋅ Mark Dredze
Mask-Aware Policy Gradients for Diffusion Language Models
Haran Raajesh ⋅ Kulin Shah ⋅ Adam Klivans ⋅ Philipp Kraehenbuehl
StateBridge: Training-free Hidden-state Alignment for Latent Communication in LLM Multi-Agent Systems
Yanwen Peng ⋅ Delvin Ce Zhang ⋅ Xi Wang ⋅ Nikolaos Aletras
No Free Labels: Limitations of LLM-as-a-Judge Without Human Grounding
Michael Krumdick ⋅ Charles Lovering ⋅ Varshini Reddy ⋅ Seth Ebner ⋅ Chris Tanner
KT4EQG: Personalized Exercise Question Generation via Knowledge Tracing
Xinyi Gao ⋅ Qiucheng Wu ⋅ Lu Ding ⋅ Vera Liao ⋅ Kaizhi Qian ⋅ Ying Xu ⋅ Shiyu Chang ⋅ Yang Zhang
Do Humans and LLMs Diverge in Belief Revision? Evidence from a Bayesian Analysis
Stylianos Loukas Vasileiou ⋅ Antonio Rago ⋅ Maria Vanina Martinez ⋅ William Yeoh
Illusory Truth or Mere Exposure? Model-Dependent Repetition Effects in LLM-Based Social Media Simulations
Azza Bouleimen ⋅ Nicolò Pagan ⋅ Ancsa Hannak
PrefPO: Pairwise Preference Prompt Optimization
Rahul Singhal ⋅ Pradyumna Tambwekar ⋅ Karime Maamari
Component and Dimension Sparsity in Transformer Refusal Mechanisms
Vincent Siu ⋅ Glenn Grant-Richards ⋅ Vlad Pavlovich ⋅ Yizhou Sun ⋅ Dawn Song ⋅ Chenguang Wang
TokEval: A Tokenizer Analysis Suite
Clara Meister
$p1$: Better Prompt Optimization with Less Prompts
Zhaolin Gao ⋅ Sid Wang ⋅ Bo Liu ⋅ Thorsten Joachims ⋅ Kianté Brantley ⋅ Wen Sun
HPFA: Hypergraph-Based Paired Failure Attribution for LLM Reasoning
Runchuan Zhu ⋅ Hongbin Lai ⋅ Bowen Jiang ⋅ Junrui Zhang ⋅ Zhangheng LI ⋅ Ostap Kilbasovych Shevtsiv ⋅ Junyuan Hong
Pinocchio: Estimating the Uncertainty of Black-Box Language Models
Kevin D Hayes ⋅ Arka Pal ⋅ Haosong Zhang ⋅ Tom Goldstein ⋅ Micah Goldblum
ComDoc: A Comprehensive Benchmark for Document Retrieval-Augmented Generation
Jun Wang ⋅ Tiancheng Gu ⋅ Yifan Zhang ⋅ Hengyu Shen ⋅ Xiaoxing Hu ⋅ Weidong Cai ⋅ Ziyong Feng ⋅ Xiang An ⋅ Kaicheng Yang
RefCritic: Training Long Chain-of-Thought Critic Models with Refinement Feedback
Hao Xiang ⋅ Qiaoyu Tang ⋅ Le Yu ⋅ Bowen Yu ⋅ Hongyu Lin ⋅ Yaojie Lu ⋅ Ben He ⋅ Xianpei Han ⋅ Le Sun ⋅ Junyang Lin
Decoupled Alignment for Robust Plug-and-Play Adaptation
Haozheng Luo ⋅ Jiahao Yu ⋅ Wenxin Zhang ⋅ Jialong Li ⋅ Chenghao Qiu ⋅ Yimin Wang ⋅ Eric H Jiang ⋅ Jerry Y Hu ⋅ Yan Chen ⋅ Binghui Wang ⋅ Xinyu Xing ⋅ Han Liu
Reinforce-Ada: An Adaptive Sampling Framework under Non-linear RL Objectives
Wei Xiong ⋅ Chenlu Ye ⋅ Baohao Liao ⋅ Hanze Dong ⋅ Xinxing Xu ⋅ Christof Monz ⋅ Jiang Bian ⋅ Nan Jiang ⋅ Tong Zhang
Cognitive Chain-of-Thought (CoCoT): Structured Multimodal Reasoning about Social Situations
Eunkyu Park ⋅ Wesley H Deng ⋅ Gunhee Kim ⋅ Motahhare Eslami ⋅ Maarten Sap
Smarter by the Moment: Environment-Driven Dynamic Policies for Continual LLM Improvement
Ting-Wei Chang ⋅ Po-Chun Chen ⋅ Hen-Hsen Huang ⋅ Hsin-Hsi Chen
SonicSampler: Unified Tile-Aware Kernels for LLM Sampling and Speculative Verification
Pragaash Ponnusamy ⋅ Shivam Sahni ⋅ Jue WANG ⋅ Tri Dao
A Self-Pruning Transformer: Extreme KV-Cache Compression with Universal Attention
Davis Wertheimer ⋅ Haochen Shen ⋅ Ahan Gupta ⋅ Derrick Liu ⋅ Yu Chin Fabian Lim ⋅ Mudhakar Srivatsa ⋅ Raghu K Ganti ⋅ Minjia Zhang ⋅ Naigang Wang
LLMs Exhibit Significantly Lower Uncertainty in Creative Writing Than Professional Writers
Patrick Sui
Prism-$\Delta$: Differential Subspace Steering for Prompt Highlighting in Large Language Models
Yuyao Ge ⋅ Shenghua Liu ⋅ Yiwei Wang ⋅ Tianyu Liu ⋅ Baolong Bi ⋅ Lingrui Mei ⋅ Jiayu Yao ⋅ Jiafeng Guo ⋅ Xueqi Cheng
Oolong: Evaluating Long Context Reasoning and Aggregation Capabilities
Amanda Bertsch ⋅ Adithya Pratapa ⋅ Teruko Mitamura ⋅ Matthew R Gormley ⋅ Graham Neubig
Do LLMs Benefit From Their Own Words?
Jenny Y Huang ⋅ Leshem Choshen ⋅ Wei Sun ⋅ Omar Khattab ⋅ Ramón Fernandez Astudillo ⋅ Mehul Damani ⋅ Tamara Broderick ⋅ Jacob Andreas
Process Supervision of Confidence Margin for Calibrated LLM Reasoning
Liaoyaqi Wang ⋅ Chunsheng Zuo ⋅ William Jurayj ⋅ Benjamin Van Durme ⋅ Anqi Liu
Risk Profiling and Modulation for LLMs
Yikai Wang ⋅ Guanting Chen ⋅ Xiaocheng Li
CCBench: Assessing LLM Cultural Competence via Implicitly Signaled Norms using Health Queries
Vasudha Varadarajan ⋅ Akhila Yerukola ⋅ Mona Diab ⋅ Maarten Sap
When Pruning Meets Interpretability: Preserving Sparse Autoencoder Robustness in LLMs
Suchit Gupte ⋅ Xueru Zhang ⋅ Mohammad Mahdi Khalili
Cross-Model Disagreement as a Label-Free Correctness Signal
Matt Gorbett ⋅ Suman Jana
KoSimpleQA: A Korean Factuality Benchmark with an Analysis of Reasoning LLMs
Donghyeon Ko ⋅ Kyubyung Chae ⋅ Yeguk Jin ⋅ Byungwook Lee ⋅ Chansong Jo ⋅ Sookyo In ⋅ Jaehong Lee ⋅ Taesup Kim ⋅ Donghyun Kwak
CreativityBench: Evaluating Creative Reasoning via Affordance-Based Tool Repurposing
Cheng Qian ⋅ Hyeonjeong Ha ⋅ Jiayu Liu ⋅ Bingxiang He ⋅ Jeonghwan Kim ⋅ Jiateng Liu ⋅ Bingxuan Li ⋅ Aditi Tiwari ⋅ Dwip Dalal ⋅ Zhenhailong Wang ⋅ Xiusi Chen ⋅ Aleksey Panasyuk ⋅ Mahdi Namazifar ⋅ Yunzhu Li ⋅ Heng Ji
We Hebben Een Serieus Translatie: Modeling Intercomprehension as Probabilistic Inference
Thomas H Clark ⋅ Roger P Levy ⋅ Edward Gibson
Poison Once, Exploit Forever: Environment-Injected Memory Poisoning Attacks on Web Agents
Mingwen Dong ⋅ Wei Zou ⋅ Miguel R Calvo ⋅ Shuaichen Chang ⋅ Jiang Guo ⋅ Dongkyu Lee ⋅ Xing Niu ⋅ Xiaofei Ma ⋅ Yanjun Qi ⋅ Jiarong Jiang
Matching Accuracy, Different Geometry: Evolution Strategies vs GRPO in LLM post-training
William Hoy ⋅ Binxu Wang ⋅ Xu Pan
Credit Cards, Confusion, Computation, and Consequences: What Can We Uncover About Language Model Reasoning?
Arnav Hiray ⋅ Agam Shah ⋅ Caleb Lu ⋅ Meghaj Tarte ⋅ Harsit Mittal ⋅ Sudheer Chava
Variational Co-Evolution via Reinforcement Learning
Qiahao Zheng ⋅ Hancong Jin ⋅ Junbo Niu ⋅ Yinjie Wang ⋅ Wentao Zhang ⋅ Ruixun Zhang
From Papers to Panoramas: Building Hierarchies of Scientific Literature at Scale
Muhan Gao ⋅ Jash Shah ⋅ Weiqi Wang ⋅ Kuan-Hao Huang ⋅ Daniel Khashabi
Improving Language Agents through BREW: Bootstrapping expeRientially-learned Environmental knoWledge
Shashank Kirtania ⋅ Param Biyani ⋅ Priyanshu Gupta ⋅ Yasharth Bajpai ⋅ Roshni Iyer ⋅ Sumit Gulwani ⋅ Gustavo Soares
Model organisms are leaky: Perplexity differencing often reveals finetuning objectives
Mohammed Abu Baker ⋅ Luca Baroni ⋅ Dan Wilhelm
Back to the Future: A workbook time machine for spread- sheet creation benchmarks
Mansi Uniyal ⋅ Agamdeep Singh ⋅ Ananya Singha ⋅ Priyanshu Gupta ⋅ Mukul Singh ⋅ Gust Verbruggen ⋅ Vu Le ⋅ Sumit Gulwani
BidirLM: From Text to Omnimodal Bidirectional Encoders by Adapting and Composing Causal LLMs
Nicolas Boizard ⋅ Théo Deschamps-Berger ⋅ Hippolyte Gisserot-Boukhlef ⋅ CELINE HUDELOT ⋅ Pierre Colombo
Accelerating Speculative Decoding with Block Diffusion Draft Trees
Liran Ringel ⋅ Yaniv Romano
Break Me If You Can: Self-Jailbreaking of Aligned LLMs via Lexical Insertion Prompting
Devang Kulshreshtha ⋅ Hang Su ⋅ Haibo Jin ⋅ Chinmay Hegde ⋅ Haohan Wang
The Shrinking Lifespan of LLMs in Science
Ana Trišović
How Much Backtracking is Enough? Exploring the Interplay of SFT and RL in Enhancing LLM Reasoning
Hongyi Cai ⋅ Junlin Wang ⋅ Xiaoyin Chen ⋅ Bhuwan Dhingra
Shorthand for Thought: Compressing LLM Reasoning via Entropy-Guided Supertokens
Zhenyu Zhao ⋅ Sander Land ⋅ Daniel M Bikel ⋅ Waseem Alshikh
Behavioral Canaries: Auditing Private Retrieved Context Usage in RL Fine-Tuning
Chaoran Chen ⋅ Dayu Yuan ⋅ Peter Kairouz
PM-Bench: Evaluating Prospective Memory of LLM Agents
Genglin Liu ⋅ Saadia Gabriel
Goedel-Code-Prover: Hierarchical Proof Search for Open State-of-the-Art Code Verification
Zenan Li ⋅ Ziran Yang ⋅ Mike He ⋅ Haoyu Zhao ⋅ A. Zhao ⋅ Shange Tang ⋅ Kaiyu Yang ⋅ Aarti Gupta ⋅ Zhendong Su ⋅ Chi Jin
Breaking Memorization Barriers in LLM Code Fine-Tuning via Information Bottleneck for Improved Generalization
Changsheng Wang ⋅ Xin Chen ⋅ Sijia Liu ⋅ Ke Ding
SciTaRC: Benchmarking QA on Scientific Tabular Data that Requires Language Reasoning and Complex Computation
Hexuan Wang ⋅ Yaxuan Ren ⋅ Srikar Bommireddypalli ⋅ Shuxian Chen ⋅ Adarsh Prabhudesai ⋅ Rongkun Zhou ⋅ Elina Baral ⋅ Philipp Koehn
Toward Scalable Terminal Task Synthesis via Skill Graphs
Zhiyuan Fan ⋅ TingHao YU ⋅ Yuanjun Cai ⋅ JiangTaoGuan ⋅ Yun Yang ⋅ Dingxin Hu ⋅ Xing Wu ⋅ Zhuo Han ⋅ feng zhang ⋅ Lilin Wang
LLMs Encode Their Failures: Predicting Success from Pre-Generation Activations
William Gitta Lugoloobi ⋅ Thomas Foster ⋅ William Bankes ⋅ Chris Russell
Beyond the Model Backbone: Structural Fixes for Data Science Agents
Au K Chun ⋅ Amrutha Rao ⋅ Abhigyan Acherjee ⋅ Zaiqian Chen ⋅ Kazem Meidani ⋅ C. B Bruss ⋅ Micah Goldblum
CuSearch: Curriculum Rollout Sampling via Search Depth for Agentic RAG
Jianghan Shen ⋅ Siqi Luo ⋅ Xinyu Cheng ⋅ Jing Xiong ⋅ Yue Li ⋅ Jiyao Liu ⋅ Jiashi Lin ⋅ Yirong Chen ⋅ Junjun He
When Retrieval Fails to Equalize: Geo-bias and Factual Question Answering over Public Companies
Abhinav Havaldar ⋅ Enrico Santus
Train Separately, Merge Together: Parallel LM Development with Mixture-of-Experts
Jacob Morrison ⋅ Sanjay Adhikesaven ⋅ Akshita Bhagia ⋅ Matei Zaharia ⋅ Noah Smith ⋅ Sewon Min
AutoOR: Scalably Post-training LLMs to Autoformalize Operations Research Problems
Sumeet Motwani ⋅ Chuan Du ⋅ Aleksandar Petrov ⋅ Christopher E Davis ⋅ Philip Torr ⋅ Antonio R Papania-Davis ⋅ Weishi Yan
Round-trip Reinforcement Learning: Self-Consistent Training for Better Chemical LLMs
Lecheng Kong ⋅ Xiyuan Wang ⋅ Yixin Chen ⋅ Muhan Zhang
Are LLMs Robust Enough for Operations Research? An Adversarial Attack and Defense Study via AttackOR
Hanxi Zhu ⋅ Jingru Yu ⋅ Yan Teng ⋅ Jian Wang ⋅ Yi YU
RL-VLA$^3$: A Flexible and Asynchronous Reinforcement Learning Framework for VLA Training
Haoran Sun ⋅ Yongjian Guo ⋅ Zhong Guan ⋅ shuai di ⋅ Xiaodong Bai ⋅ Jing Long ⋅ Tianyun Zhao ⋅ LUOMINGXI ⋅ Hongke Zhao ⋅ Likang Wu ⋅ Xiaotie Deng ⋅ Xu Chu ⋅ Xi Xiao ⋅ Sheng Wen ⋅ Yicheng Gong ⋅ Xiong J Wu
COMPASS: Benchmarking Constrained Optimization in LLM Agents
Tian Qin ⋅ Haoping Bai ⋅ Ting-Yao Hu ⋅ Raviteja Vemulapalli ⋅ Hema Swetha Koppula ⋅ Zhiyang Xu ⋅ Bowen Jin ⋅ Mert Cemri ⋅ Jiarui Lu ⋅ Zirui Wang ⋅ Meng Cao
PreMoE: Proactive Inference for Efficient Mixture-of-Experts
Zehua Pei ⋅ Ying Zhang ⋅ Hui-Ling Zhen ⋅ Tao Yuan ⋅ Xianzhi Yu ⋅ Zhenhua Dong ⋅ Sinno Pan ⋅ Mingxuan Yuan ⋅ Bei Yu
Overconfident and Blind to Details: Fixing Prompt Insensitivity with Abductive Preference Learning
Yijin Ni ⋅ Simon Yu ⋅ Peng Qi
A Spectral Transport Mechanism Underlying the Training Dynamics of Large Language Models
Yizhou Zhang ⋅ Weichen Wu ⋅ Lun Du ⋅ Zhengjie Miao
GRRR: The Geometry of Reshaping, Rotation, and Routing in Decoder LLM Post Training
Jianing Qi ⋅ Hao Tang ⋅ Zhigang Zhu
BAS: A Decision-Theoretic Approach to Evaluating Large Language Model Confidence
Sean Wu ⋅ Fredrik K. Gustafsson ⋅ Edward Phillips ⋅ Boyan Gao ⋅ Anshul Thakur ⋅ David A Clifton
Reasoning Dynamics and the Limits of Monitoring Modality Reliance in Vision-Language Models
Danae Sanchez Villegas ⋅ Samuel Lewis-Lim ⋅ Nikolaos Aletras ⋅ Desmond Elliott
v1: Learning to Point Visual Tokens for Multimodal Mathematical Grounded Reasoning
Jiwan Chung ⋅ Junhyeok Kim ⋅ Siyeol Kim ⋅ Jaeyoung Lee ⋅ Min Soo Kim ⋅ Youngjae Yu
A11yn: Aligning LLMs for Web Accessibility-Aware UI Generation
Janghan Yoon ⋅ Jaegwan Cho ⋅ Junhyeok Kim ⋅ Jiwan Chung ⋅ Jaehyun Jeon ⋅ Seungwon Lim ⋅ Youngjae Yu
Self-Preference Bias in Rubric-Based Evaluation of Large Language Models
José Pombal ⋅ Ricardo Rei ⋅ Andre Martins
Vocabulary Dropout for Curriculum Diversity in LLM Co-Evolution
Jacob Dineen ⋅ Aswin RRV ⋅ Zhikun Xu ⋅ Ben Zhou
OPERA: Online Data Pruning for Efficient Retrieval Model Adaptation
Haoyang Fang ⋅ Shuai Zhang ⋅ Yifei Ma ⋅ Hengyi Wang ⋅ Cuixiong Hu ⋅ Katrin Kirchhoff ⋅ Bernie Wang ⋅ George Karypis
Procedural Knowledge at Scale Improves Reasoning
Di Wu ⋅ Devendra S Sachan ⋅ Scott Yih ⋅ Mingda Chen
FlowEvo: Self-Evolving Agents through the Co-Evolution of Workflows and Executable Skills
Zeyu Ren ⋅ Ling Yue ⋅ Ran Li ⋅ Yishu Wang ⋅ Shengxiang Xu ⋅ Hanmo Liu ⋅ Shaowu Pan ⋅ Shimin Di
Pareto-Optimal RTL Code Generation via Multi-Objective Reinforcement Learning with Large Language Models
Koki Takeshita ⋅ Uebayashi Kenji ⋅ Hikaru Tomonari ⋅ Masaya Tsunokake ⋅ Koichiro Yawata ⋅ Tatsuya Sasaki ⋅ Yusuke Ohtsubo ⋅ Kota Dohi ⋅ Yasuhiro Sogawa
How Conversational Pressure Alters Belief in Large Language Models: A Hidden State Boundary Perspective
Zihao Huang ⋅ Rui Mao ⋅ Pengjun Xie ⋅ Anupam Chattopadhyay ⋅ Erik Cambria
Routing Entropy: A Hidden Self-Verifier for Free in Mixture-of-Experts LLMs
Zhongyang Li ⋅ Ziyue Li ⋅ Tianyi Zhou
Chasing the Public Score: User Pressure and Evaluation Exploitation in Coding Agent Workflows
Hardy Chen ⋅ Nancy Lau ⋅ Haoqin Tu ⋅ Shuo Yan ⋅ Xiangyan Liu ⋅ Zijun Wang ⋅ Juncheng Wu ⋅ Michael Q Shieh ⋅ Alvaro A Cardenas ⋅ Cihang Xie ⋅ Yuyin Zhou
FutureWeaver: Planning Test-Time Compute for Multi-Agent Systems with Modular Collaboration
Dongwon Jung ⋅ Peng Shi ⋅ Muhao Chen ⋅ Yi Zhang
TSRouter: Dynamic Modality-Model Selection for Time Series Reasoning
Fangxu Yu ⋅ Tao Feng ⋅ Dehai Min ⋅ Lu Cheng ⋅ Ge Liu ⋅ Tianyi Zhou
Actions Speak Louder than Words: On the Cross-Lingual Invariance of Agentic Tool Use
Sourabrata Mukherjee ⋅ Kalika Bali ⋅ Sunayana Sitaram
OfficeQA Pro: An Enterprise Benchmark for End-to-End Grounded Reasoning
Krista Opsahl-On g ⋅ Arnav Singhvi ⋅ Jasmine Collins ⋅ Josh Joseph ⋅ Ivan Zhou ⋅ Xinyi Wang ⋅ Ashutosh Baheti ⋅ Owen Oertell ⋅ Sam Havens ⋅ Jacob Portes ⋅ Michael Bendersky ⋅ Erich Elsen ⋅ Matei Zaharia
Legibility is Not Interpretability: Evaluating Judged Importance versus Actual Importance in Chain-Of-Thought Reasoning Steps
Kevin Du ⋅ Alexander M Hoyle ⋅ Laura Ruis ⋅ Acyr Locatelli
What does RL improve for Visual Reasoning? A Frankenstein-Style Analysis
Xirui Li ⋅ Ming Li ⋅ Tianyi Zhou
Communication and Verification in LLM Agents towards Collaboration under Information Asymmetry
Run Peng ⋅ Ziqiao Ma ⋅ Amy Pang ⋅ Sikai Li ⋅ Zhang Xi-Jia ⋅ Yingzhuo Yu ⋅ Cristian-Paul BARA ⋅ Joyce Chai
UNMASK Discovering and Causally Verifying Spurious Shortcuts in Text Classifiers
Chidaksh Ravuru ⋅ Shashank Srivastava
Monocultural Biases: Correlated biases in large language models lead to unequal systemic exclusion rates in hiring
Matthew Bone ⋅ Fabian Stephany ⋅ R. Maria del Rio-Chanona
Grounding latent algorithm routing in transformer reasoning
Xiangbo Zhang ⋅ Xiaoxu Ma
Routesplain: Towards Faithful and Intervenable Routing for Software-related Tasks
Adam Štorek ⋅ Vikas Upadhyay ⋅ Marianne Menglin Liu ⋅ Daniel W Peterson ⋅ Anshul Mittal ⋅ Sujeeth Bharadwaj ⋅ Fahad Shah ⋅ Sujith Ravi ⋅ Dan Roth
FineInstructions: Scaling Synthetic Instructions to Pre-Training Scale
Ajay Patel ⋅ Colin Raffel ⋅ Chris Callison-Burch
Are Latent Reasoning Models Easily Interpretable?
Connor Dilgren ⋅ Sarah Wiegreffe
Mitigating Knowledge Conflicts of Retrieval-Augmented Generation through Dual-Stage Confidence Measurement in Semantic Space
Jia Zhang ⋅ Zhiheng Zhang ⋅ Zeao ji ⋅ Tengfei Ma ⋅ Daojian Zeng
Distractor Injection Attacks on Large Reasoning Models: Characterization and Defense
Zhehao Zhang ⋅ Weijie Xu ⋅ Shixian Cui ⋅ Chandan Reddy
Simulating Organized Group Behavior: New Framework, Benchmark, and Analysis
Xinkai Zou ⋅ Yiming Huang ⋅ Zhuohang Wu ⋅ Jian Sha ⋅ Nan Huang ⋅ Longfei Yun ⋅ Jingbo Shang ⋅ Letian Peng
TEMPURA: Temporal Event Masked Prediction and Understanding for Reasoning in Action
Jen-Hao Cheng ⋅ Yi-Hao Peng ⋅ Huapeng Zhou ⋅ Vivian Wang ⋅ Huayu Wang ⋅ Hsiang-Wei Huang ⋅ Wenhao Chai ⋅ Hou-I Liu ⋅ Kuang-Ming Chen ⋅ Cheng-Yen Yang ⋅ Yi-Ling Chen ⋅ Vibhav Vineet ⋅ Qin Cai ⋅ Jenq-Neng Hwang
FoR-SALE: Frame of Reference-guided Spatial Adjustment in LLM-based Diffusion Editing
Tanawan Premsri ⋅ Parisa Kordjamshidi
Only Ask What You Don’t Know: Grounded Delta Planning for Efficient Multi-step RAG
Wei-Chieh Chou ⋅ Xuanjun Chen ⋅ Jian-Ren Lin ⋅ Claire Lin ⋅ Hung-yi Lee ⋅ Jyh-Shing R. Jang
Disentangling the Expressivity of RoPE
Selim Jerad ⋅ Anej Svete ⋅ Jiaoda Li ⋅ Ryan Cotterell
Model Merging via Data-Free Covariance Estimation
Marawan Gamal ⋅ Derek Tam ⋅ Pascal J Notsawo ⋅ Colin Raffel ⋅ Guillaume Rabusseau
ExpertWeave: Efficiently Serving Expert-Specialized Fine-Tuned Adapters at Scale
Ge Shi ⋅ Hanieh Sadri ⋅ Qian Wang ⋅ Yu Zhang ⋅ Ying Xiong ⋅ Yong Zhang ⋅ Zhenan Fan
Many Ways to Be Fake: Benchmarking Fake News Detection Under Strategy-Driven AI Generation
Xinyu Wang ⋅ Sai Koneru ⋅ Wenbo Zhang ⋅ Wenliang Zheng ⋅ Saksham Ranjan ⋅ Sarah Rajtmajer
CLaRa: Bridging Retrieval and Generation with Continuous Latent Reasoning
Jie He ⋅ Richard He Bai ⋅ Sinead Williamson ⋅ Jeff Z Pan ⋅ Navdeep Jaitly ⋅ Yizhe Zhang
Shared Circuits for Shared Grammar: Tracing Subject-Verb Agreement Across Languages
Isabella Gidi ⋅ Antonio Almudévar ⋅ Core Francisco Park ⋅ Naomi Saphra ⋅ Ricard Marxer
MameLoshnLM: Yiddish Language Model and Evaluation Benchmark
Uri Katz ⋅ Omer Goldman ⋅ Tomasz Limisiewicz ⋅ Reut Tsarfaty ⋅ Noah Smith
Failure-Aware Penetration Testing via Typed Failure Tokens: From Calibrated Prediction to Structured Recovery
Lanxiao Huang ⋅ Darshan Nere ⋅ Tyler Cody ⋅ Peter A Beling ⋅ Ming Jin
FinHardBench: Can LLMs Generate Latency-Aware Hardware for Financial Computing?
Weimin Fu ⋅ Hejia Zhang ⋅ Minghao Shao ⋅ Zeng Wang ⋅ Johann Knechtel ⋅ Ozgur Sinanoglu ⋅ Muhammad Shafique ⋅ Ramesh Karri ⋅ Xiaolong Guo
LLM2Vec-Gen: Generative Embeddings from Large Language Models
Parishad BehnamGhader ⋅ Vaibhav Adlakha ⋅ Fabian D Schmidt ⋅ Nicolas Chapados ⋅ Marius Mosbach ⋅ Siva Reddy
GradAlign: Gradient-Aligned Data Selection for LLM Reinforcement Learning
Ningyuan Yang ⋅ Weihua Du ⋅ Weiwei Sun ⋅ Sean Welleck ⋅ Yiming Yang
EvoLen: Evolution-Guided Tokenization for DNA Language Model
Nan Huang ⋅ Xiaoxiao Zhou ⋅ Junxia Cui ⋅ Mario Tapia-Pacheco ⋅ Tiffany Amariuta ⋅ Yang E Li ⋅ Jingbo Shang
HyperThink: Text-to-Parameter Hypernetworks for Efficient Reasoning
Donggyun Kim ⋅ Jack Lu ⋅ Chanwoo Kim ⋅ Mengye Ren ⋅ Seunghoon Hong
Bottom-Up Interpretability of Pretraining Dynamics via Loss Curve Decomposition
Koshiro Aoki ⋅ Masaru Isonuma ⋅ Yusuke Oda ⋅ Hirokazu Kiyomaru ⋅ Takashi Kodama ⋅ Chaoran Liu ⋅ Yohei Oseki ⋅ Yusuke Miyao ⋅ Max Müller-Eberstein ⋅ Daisuke Kawahara
Barriers to Universal Reasoning with Transformers (and How to Overcome them)
Oliver Kraus ⋅ Yash Sarrof ⋅ Yuekun Yao ⋅ Alexander Koller ⋅ Michael Hahn
Expert Threshold Routing for Autoregressive Language Modeling with Dynamic Computation Allocation and Load Balancing
Hanchi Sun ⋅ Yixin Liu ⋅ Yonghui Wu ⋅ Lichao Sun
Why Do Reasoning Models Lose Coverage? The Role of Data and Forks in the Road
Hieu N. Nguyen ⋅ Parshin Shojaee ⋅ Nguyen M Phuc ⋅ Nan Zhang ⋅ Chandan Reddy ⋅ Khoa D Doan ⋅ Rui Zhang
What Makes Good Multilingual Reasoning? Disentangling Reasoning Traces with Measurable Features
Dayeon Ki ⋅ Kevin Duh ⋅ Marine Carpuat
Do LLMs Recognize Your Latent Preferences? A Benchmark for Latent Information Discovery in Personalized Interaction
Ioannis Tsaknakis ⋅ Bingqing Song ⋅ Shuyu Gan ⋅ Jiangweizhi Peng ⋅ Dongyeop Kang ⋅ Alfredo Garcia ⋅ Gaowen Liu ⋅ Charles Fleming ⋅ Mingyi Hong
Spoiler Alert: Narrative Forecasting as a Metric for Tension in LLM Storytelling
Patrick Sui ⋅ Yutong Zhu ⋅ Tianyi Cheng ⋅ Peter West ⋅ Richard J So ⋅ Hoyt Long ⋅ Ari Holtzman
Minimal, Local, Causal Explanations of Jailbreak Success in Large Language Models
Shubham Kumar ⋅ Narendra Ahuja
Learn from Zero: Policy Optimization under Vanishing Advantage
Chang Liu ⋅ Peng Xiao ⋅ Jiandong Su ⋅ Wayne Zhang
Seeing Isn’t Believing: Uncovering Blind Spots in Evaluator Vision-Language Models
Mohammed Safi Ur Rahman Khan ⋅ Sanjay Suryanarayanan ⋅ Tushar Anand ⋅ Mitesh M Khapra
MTA-Agent: An Open Recipe for Multimodal Deep Search Agents
XIANGYU PENG ⋅ Can Qin ⋅ An Yan ⋅ Xinyi Yang ⋅ Ran Xu ⋅ Zeyuan Chen ⋅ Chien-Sheng Wu
Semantic Structure of Feature Space in Large Language Models
Austin Kozlowski ⋅ Andrei Boutyline
VLMs Need Words: Vision Language Models Ignore Visual Detail In Favor of Semantic Anchors
Haz Shahgir ⋅ Xiaofu Chen ⋅ Yu Fu ⋅ Erfan Shayegani ⋅ Nael Abu-Ghazaleh ⋅ Yova Kementchedjhieva ⋅ Yue Dong
Weightless Fine-Tuning: Personalizing LLMs via Logit-Space Transport
Bohan Zhang ⋅ Anqi Ni ⋅ Yixin Wang ⋅ Paramveer Dhillon
In-Context Examples Suppress Scientific Knowledge Recall in LLMs
Chaemin Jang ⋅ Woojin Park ⋅ Hyeok Yun ⋅ Dongman Lee ⋅ Jihee Kim
AI Assistance Reduces Persistence and Hurts Independent Performance
Grace Liu ⋅ Brian Christian ⋅ Tsvetomira Dumbalska ⋅ Michiel A Bakker ⋅ Rachit Dubey
Ideological Bias in LLMs’ Economic Causal Reasoning
Donggyu Lee ⋅ Hyeok Yun ⋅ Jungwon Kim ⋅ Junsik Min ⋅ Sungwon Park ⋅ Sangyoon Park ⋅ Jihee Kim
RecaLLM: Addressing the Lost-in-Thought Phenomenon with Explicit In-Context Retrieval
Kyle Whitecross ⋅ Razieh Rahimi
FLY-EVAL++: Evidence-Based Evaluation for Safety-Constrained Modeling in Embodied Systems
Yalun Wu ⋅ Boyang Wang ⋅ Junfeng Fang ⋅ Jiawei Wang ⋅ Haotian Liu ⋅ Qijun Yang ⋅ Minghan Yang ⋅ Hongcheng Guo ⋅ Zhoujun Li
Free(): Learning to Forget in Malloc-Only Reasoning Models
Yilun Zheng ⋅ Dongyang Ma ⋅ Tian Liang ⋅ Jiahao Xu ⋅ Xinting Huang ⋅ Lihui Chen ⋅ Haitao Mi ⋅ Yan Wang
Liberating LLM Capabilities in Full-Duplex Speech Models
Luoyuan Zhang ⋅ Bokai Xu ⋅ Junbo Cui ⋅ Weiyue Sun ⋅ Yingjing Xu ⋅ Hanyu Liu ⋅ Yuan Yao
SFT-Induced Hallucinations as a Continual Learning Problem
Guy Kaplan ⋅ Zorik Gekhman ⋅ Zhen Zhu ⋅ Yuval Reif ⋅ Lotem Rozner ⋅ Swabha Swayamdipta ⋅ Derek Hoiem ⋅ Roy Schwartz
Apriel-Reasoner: RL Post-Training for General-Purpose and Efficient Reasoning
Rafael Pardinas ⋅ Ehsan Kamalloo ⋅ David Vazquez ⋅ Alexandre Drouin
Thought-Level Beam Search for Reasoning
Lijie Yang ⋅ Hongyin Luo ⋅ Jiawei Zhao ⋅ Tri Dao ⋅ Ravi Netravali
FLINT: Influence-Guided Active Learning Framework for LoRA via Curvature-Aware Data Selection and Fine-Tuning
Zixuan Li ⋅ Shenglan Guo ⋅ Zhigen Li ⋅ Yanmeng Wang ⋅ Ning Cheng ⋅ Shaojun Wang ⋅ Deyi Xiong
KARL: Mitigating Hallucinations in LLMs via Knowledge-Boundary-Aware Reinforcement Learning
Cheng Gao ⋅ Cheng Huang ⋅ Kangyang Luo ⋅ Ziqing Qiao ⋅ Shuzheng Si ⋅ Huimin Chen ⋅ Chaojun Xiao ⋅ Maosong Sun
PromptNCE: Pointwise Mutual Information Predictions Using Only LLMs and Contrastive Estimation Prompts
Juliette Woodrow ⋅ Christopher J Piech
Revision or Re-Solving? Decomposing Second-Pass Gains in Multi-LLM Pipelines
Jingjie Ning ⋅ Xueqi Li ⋅ Chengyu Yu
More Than Words: Compositional Tokenization for Efficient Language Models
Yuval Reif ⋅ Guy Kaplan ⋅ Roy Schwartz
How Well Do Agentic Skills Work in the Wild: Benchmarking LLM Skill Usage in Realistic Settings
Yujian Liu ⋅ Jiabao Ji ⋅ Li An ⋅ Tommi Jaakkola ⋅ Yang Zhang ⋅ Shiyu Chang
Catching rationalization in the act: detecting motivated reasoning before and after CoT via activation probing
Parsa Mirtaheri ⋅ Mikhail Belkin
Fragility Under Pressure: Evaluating the Iterative Stability of LLMs in Constrained Interactive Coding
Zhuoheng Han ⋅ Jin-Ge Yao ⋅ Zailong Tian ⋅ Xi Yang ⋅ Houfeng Wang
Should We be Pedantic About Reasoning Errors in Machine Translation? Auditing Reasoning in Machine Translation
Calvin Bao ⋅ Marine Carpuat
FlexRouter: Learning Complementary Model Sets for Flexible LLM Routing
Wang Wei ⋅ Hongzheng Yang ⋅ Tiankai Yang ⋅ Samyadeep Basu ⋅ Hongjie Chen ⋅ Yue Zhao ⋅ Franck Dernoncourt ⋅ Ryan Rossi ⋅ Hoda Eldardiry
RAQE: Reranker-Aligned Query Expansion via Label-Free Group-Relative Policy Optimization
Gyeonghun Sun ⋅ Jeonghwan Choi ⋅ Sundong Kim ⋅ Hwanjun Song
Guard Vector: Beyond English LLM Guardrails with Task-Vector Composition and Streaming-Aware Prefix SFT
Wonhyuk Lee ⋅ Youngchol Kim ⋅ Yunjin Park ⋅ Junhyung Moon ⋅ Dongyoung Jeong ⋅ Wanjin Park
CORAL: Towards Autonomous Multi-Agent Evolution for Open-Ended Discovery
Ao Qu ⋅ Han Zheng ⋅ Zijian Zhou ⋅ Yihao Yan ⋅ Yihong Tang ⋅ Shao Yong Ong ⋅ Fenglu Hong ⋅ Kaichen Zhou ⋅ Chonghe Jiang ⋅ Minwei Kong ⋅ Jiacheng Zhu ⋅ Sirui Li ⋅ Cathy Wu ⋅ Bryan Kian Hsiang Low ⋅ Jinhua Zhao ⋅ Paul Pu Liang
In-Context Learning as Implicit Policy Gradient
Masahiro Kaneko ⋅ Timothy Baldwin
PowerMuon: Muon with Fractional Spectral Powers
Yihe Dong ⋅ Will Sawin
QualAlign: Benchmarking Automated Qualitative Coding Against Human Schemas
Taggert Smith ⋅ Chuong Nguyen ⋅ Qisen Yang ⋅ Oishani Bandopadhyay ⋅ Yaru Su ⋅ Nadia Polikarpova ⋅ Xinyu Pi
Adversarial Reward Auditing for Active Detection and Mitigation of Reward Hacking
Mohammad Beigi ⋅ Ming Jin ⋅ Junshan Zhang ⋅ Qifan Wang ⋅ Lifu Huang
Self-Generated Text Recognition: Quality Heuristics, Cross-Task Transfer, and Downstream Bias in LLM Evaluation
Jesse St. Amand ⋅ Callum Canavan ⋅ Sohaib Imran ⋅ Joseph Hewson ⋅ Aaron Lutz ⋅ Shi Feng ⋅ Puria Radmard ⋅ Lennie Wells
MoRFI: Monotonic Sparse Autoencoder Feature Identification
Dimitris Dimakopoulos ⋅ Shay B Cohen ⋅ Ioannis Konstas
Towards Active Synthetic Data Generation for Finetuning Language Models
Samuel Kessler ⋅ Menglin Xia ⋅ Daniel Madrigal ⋅ Dongge Han ⋅ Helia Hashemi ⋅ Saravan Rajmohan ⋅ Victor Rühle ⋅ Jordan T Ash
Reinforcing privacy reasoning in LLMs via normative simulacra from fiction
Matt Franchi ⋅ Madiha Zahrah Choksi ⋅ Harold Triedman ⋅ Helen Nissenbaum
Polar probe linearly decodes semantic structures from LLMs
Pablo Diego-Simón ⋅ Pierre Orhan ⋅ Emmanuel Chemla ⋅ Yair Lakretz ⋅ Jean-Remi King
EvoSkill: Automated Skill Discovery for Agents
Salaheddin Alzubi ⋅ Noah Provenzano ⋅ Jaydon Bingham ⋅ Christian A Calvo ⋅ Weiyuan Chen ⋅ Tu Vu
Compared to What? Baselines and Metrics for Counterfactual Prompting
Zihao Yang ⋅ Mosh Levy ⋅ Yoav Goldberg ⋅ Byron Wallace
CivBench: Progress-Based Evaluation for LLMs' Strategic Decision-Making in Civilization V
John Chen ⋅ Sihan Cheng ⋅ Can Gurkan ⋅ Mingyi Lin
Super Weights in LLMs and the Failure of Selective Training
Shreyas Subramanian ⋅ Adewale Akinfaderin ⋅ Akarsha Sehwag
Learning Reusable Program Transformations via LLM-Guided Rule Synthesis
Avaljot Singh ⋅ Dushyant Bharadwaj ⋅ Stefanos Baziotis ⋅ Kaushik Varadharajan ⋅ Charith Mendis
Differences in Text Generated by Diffusion and Autoregressive Language Models
Zeyang Zhang ⋅ Chengwei Liang ⋅ Xingyan Chen ⋅ Meiqi Gu ⋅ Minrui Luo ⋅ Jingzhao Zhang ⋅ Tianxing He
AVMeme Exam: A Multimodal Multilingual Multicultural Benchmark for LLMs' Contextual and Cultural Knowledge and Thinking
Xilin Jiang ⋅ Qiaolin Wang ⋅ Junkai Wu ⋅ Xiaomin He ⋅ Zhongweiyang Xu ⋅ Yinghao Ma ⋅ Minshuo Piao ⋅ Kaiyi Yang ⋅ Xiuwen Zheng ⋅ Riki Shimizu ⋅ Yicong Chen ⋅ Arsalan Firoozi ⋅ Gavin Mischler ⋅ Sukru S Dindar ⋅ Richard Antonello ⋅ Linyang He ⋅ Tsun-An Hsieh ⋅ Xulin Fan ⋅ Yulun Wu ⋅ Yuesheng Ma ⋅ Chaitanya Amballa ⋅ Weixiong Chen ⋅ Jiarui Hai ⋅ Ruisi Li ⋅ Vishal Choudhari ⋅ Cong Han ⋅ Yinghao A Li ⋅ Adeen Flinker ⋅ Mounya Elhilali ⋅ Emmanouil Benetos ⋅ Mark Hasegawa-Johnson ⋅ Romit Roy Choudhury ⋅ Nima Mesgarani
MEMENTO: Teaching LLMs to Manage Their Context
Vasilis Kontonis ⋅ Yuchen Zeng ⋅ Shivam Garg ⋅ Lingjiao Chen ⋅ Hao Tang ⋅ Ziyan Wang ⋅ Ahmed H Awadallah ⋅ Eric Horvitz ⋅ John Langford ⋅ Dimitris Papailiopoulos
Knowing Before Answering: Decoding Language Models for Reliable RAG
Syed Mahbubul Huq ⋅ Christopher Child ⋅ Tillman Weyde ⋅ Pranava Madhyastha
The Percept-V Challenge: Can Multimodal LLMs Crack Simple Perception Problems?
Samrajnee Ghosh ⋅ Naman Agarwal ⋅ Ashish Goswami ⋅ Hemanshu Garg ⋅ Chinmay Mittal ⋅ Parag Singla ⋅ Mausam .
Agentic Aggregation for Parallel Scaling of Long-Horizon Agentic Tasks
Yoonsang Lee ⋅ Howard Yen ⋅ Xi Ye ⋅ Danqi Chen
Struct-Searcher: Agentic Structural Thinking Advances Multimodal Deep Information Seeking
Fan Zhang ⋅ Guibin Zhang ⋅ Shengju Qian ⋅ Haoxuan Li ⋅ Zheng Lian ⋅ Hao Wu ⋅ Yuan Gao ⋅ Xinyu Geng ⋅ Xin WANG ⋅ Pheng-Ann Heng
Data-Efficient Adaptation of LLMs via Attention Head Reweighting
Tuomas Oikarinen ⋅ Zixiao Chen ⋅ Charlotte Siska ⋅ Tsui-Wei (Lily) Weng ⋅ Chandan Singh ⋅ Jianfeng Gao
From Plausible to Grounded: Reinforcing Structured Consistency in Video MLLMs
Yihao Quan ⋅ Zeru Shi ⋅ Jinman Zhao ⋅ Ruixiang Tang
SkillLearnBench: Benchmarking Continual Learning Methods for Agent Skill Generation on Real-World Tasks
Shanshan Zhong ⋅ Yi Lu ⋅ Jingjie Ning ⋅ Yibing Wan ⋅ Lihan Feng ⋅ Yuyi Ao ⋅ Markus Dreyer ⋅ Leonardo F Ribeiro ⋅ Sean Ammirati ⋅ Chenyan Xiong
Data Canvas: A Provenance-Guided Harness for Agentic Data Engineering
Zixuan Yi ⋅ Yuanming Shao ⋅ Shaun Wallace ⋅ Zachary Ives ⋅ Ryan Marcus
ADAG: Automatically Describing Attribution Graphs
Aryaman Arora ⋅ Zhengxuan Wu ⋅ Jacob Steinhardt ⋅ Sarah Schwettmann
Learning to Refer from Estimated Listener Gaze
Téa Wright ⋅ Alane Suhr
MomentKV: Closing the Directional Gap in KV Cache Eviction for Long-Context Inference
Yu Li ⋅ Binxu Li ⋅ Tian Lan
Distributed Attacks in Persistent-State AI Control
Josh Hills ⋅ Ida Caspary ⋅ Asa Cooper Stickland
LM-mixup: Text Data Augmentation via Language Model based Mixup
Zhijie Deng ⋅ Zhouan Shen ⋅ Ling Li ⋅ Yao Zhou ⋅ Zhaowei Zhu ⋅ Yanji He ⋅ Wei Wang ⋅ Jiaheng Wei
Lost in the Tower of Babel: The Adverse Effects of Incidental Multilingualism in LLMs
Anjishnu Mukherjee ⋅ Chutong Meng ⋅ Antonios Anastasopoulos
Small Foundation Models of Human Cognition and Behaviour
Nick Oh ⋅ Fernand Gobet
SNEAK: Evaluating Strategic Communication and Information Leakage in Large Language Models
Adar Avsian ⋅ Larry Heck
PCA-guided Activation Scaling for Monotonic Bidirectional Control over LLM Sycophancy
Zheng CHEN ⋅ Zhaoxin Feng ⋅ Yip T Po ⋅ Jianfei Ma ⋅ Emmanuele Chersoni ⋅ Bo Li
TEMPER: Testing Emotional Perturbation in Quantitative Reasoning
Atahan Dokme ⋅ Benjamin Reichman ⋅ Larry Heck
MedConceal: A Benchmark for Clinical Hidden-Concern Reasoning Under Partial Observability
Yikun Han ⋅ Joey Chan ⋅ Jingyuan Chen ⋅ Mengting Ai ⋅ Simo Du ⋅ Yue Guo
Scalable High-Recall Constraint-Satisfaction-Based Information Retrieval for Clinical Trials Matching
Cyrus Zhou ⋅ Yufei Jin ⋅ Yilin Xu ⋅ Yu-Chiang Wang ⋅ Chieh-Ju Chao ⋅ Monica Lam
UrbanLLMind: Scalable LLM-Powered Urban Mobility Simulation with Open-Weight Models
Prabin Bhandari ⋅ Sandro M Reia ⋅ Dieter Pfoser ⋅ Antonios Anastasopoulos
Unable to Forget: Proactive Interference Reveals Working Memory Limits in LLMs Beyond Context Length
Chupei Wang ⋅ Jiaqiu Vince Sun
PaperOrchestra: A Multi-Agent Framework for Automated AI Research Paper Writing
Yiwen Song ⋅ Yale Song ⋅ Tomas Pfister ⋅ Jinsung Yoon
Procedure-Aware Reinforcement Learning for Tool-Augmented Large Language Models
Qinglong Zheng ⋅ Jiajun Fan ⋅ Chaoran Cheng ⋅ Ge Liu
$V_{0.5}$: Generalist Value Model as a Prior for Sparse RL Rollouts
Yi-Kai Zhang ⋅ Yueqing Sun ⋅ Hongyan Hao ⋅ Qi GU ⋅ Xunliang Cai ⋅ Long Chen ⋅ De-Chuan Zhan ⋅ Han-Jia Ye
Dual-Stream Decoding for Accelerated Large Language Models
Dmitry Abulkhanov ⋅ Daniil Strizhakov ⋅ Maxim Panov
Neural Architecture Discovery via Autonomous Evolution
Weixian Xu ⋅ Yixiu Liu ⋅ Yang Nan ⋅ Lyumanshan Ye ⋅ Xiangkun Hu ⋅ Zhen Qin ⋅ Pengfei Liu
AlphaEval: Evaluating Agents in Production
Pengrui Lu ⋅ Bingyu Xu ⋅ Wenjun Zhang ⋅ Shengjia Hua ⋅ Xuanjian Gao ⋅ Ranxiang Ge ⋅ Lyumanshan Ye ⋅ Linxuan Wu ⋅ Yiran Li ⋅ Junfei F Yu ⋅ Yibo Zhang ⋅ Ruixin Li ⋅ Manxiang Li ⋅ Xiao Han ⋅ Xiaocong Zhou ⋅ Guangyao Chi ⋅ Zisheng Chen ⋅ Kaishen Chen ⋅ Kun Wang ⋅ Qihua Xu ⋅ Fengyuemeng ⋅ Yuchen Ni ⋅ Jiajun Li ⋅ Jinxiu Liu ⋅ Danfeng Zhang ⋅ Jingru Zhao ⋅ Pengfei Liu
ContextLeak: Auditing Leakage in Private In-Context Learning Methods
Jacob Choi ⋅ Shuying Cao ⋅ Xingjian Dong ⋅ Amin Banayeeanzade ⋅ Wang Bill Zhu ⋅ Robin Jia ⋅ Sai Praneeth Karimireddy
CAP: A Scalable Benchmark for Evaluating Cross-Site Browser Agents with Complex Actions and Perception
Zejun Xu ⋅ Taiyi Chen ⋅ Jin Li ⋅ Yongtong Gu ⋅ QiCheng ⋅ Lvaixuan ⋅ Zhu shuai ⋅ ZhuPengfei ⋅ Kaichen Yang ⋅ Sun Boyu ⋅ YixianYang ⋅ Mulong Xie ⋅ XIN LIU ⋅ Dagang Li ⋅ Xiaoteng Ma ⋅ Hongru WANG
TraceSafe: A Systematic Assessment of LLM Guardrails on Multi-Step Tool-Calling Trajectories
Yen-Shan Chen ⋅ Sian-Yao Huang ⋅ Cheng-Lin Yang ⋅ Yun-Nung Chen
IndexCache: Accelerating Sparse Attention via Cross-Layer Index Reuse
Yushi Bai ⋅ Qian Dong ⋅ Ting Jiang ⋅ Xin Lv ⋅ Zhengxiao Du ⋅ Aohan Zeng ⋅ Jie Tang ⋅ Juanzi Li
Filtered Reasoning Score: Evaluating Reasoning Quality on a Model's Most-Confident Traces
Manas Pathak ⋅ Xingyao Chen ⋅ Shuozhe Li ⋅ Amy Zhang ⋅ Liu Leqi
EvoSkills: Self-Evolving Agent Skills via Co-Evolutionary Verification
Hanrong Zhang ⋅ Shicheng Fan ⋅ Henry P Zou ⋅ Yankai Chen ⋅ Zhenting Wang ⋅ Jiayu Zhou ⋅ Chengze Li ⋅ Wei-Chieh Huang ⋅ Yifei Yao ⋅ Kening Zheng ⋅ Xue Liu ⋅ Xiaoxiao Li ⋅ Philip S Yu
How Models Learn Shape How They Forget: Post-Training Models Robust to Subsequent Fine-Tuning
Lawrence Feng ⋅ Gaurav R Ghosal ⋅ Jacob M Springer ⋅ Ziqian Zhong ⋅ Aditi Raghunathan
DeliveryBench: Can Agents Earn Profit in Simulated Worlds?
Lingjun Mao ⋅ Jiawei Ren ⋅ Jixuan Chen ⋅ Ziqiao Ma ⋅ Kun Zhou ⋅ Lianhui Qin
Exploring Temporal Curriculum in On-Policy Distillation for Multi-turn Autonomous Agents
Jiaqi WANG ⋅ Wenhao Zhang ⋅ Weijie Shi ⋅ Yaliang Li ⋅ James Cheng
Learning as Reasoning Unfolds: Progressive Rollout Allocation for Efficient Reinforcement Learning
Heyang Jiang ⋅ Henry Liu ⋅ Baharan Mirzasoleiman
Introspective Diffusion Language Models
Yifan Yu ⋅ Yuqing Jian ⋅ Junxiong Wang ⋅ Zhongzhu Zhou ⋅ Donglin Zhuang ⋅ Xinyu Fang ⋅ Xiaoxia Wu ⋅ Qingyang Wu ⋅ Shuaiwen L Song ⋅ Tri Dao ⋅ Ben Athiwaratkun ⋅ James Zou ⋅ Fan Lai ⋅ Chenfeng Xu
TrailBlazer: History-Guided Reinforcement Learning for Black-Box LLM Jailbreaking
Sung-Hoon Yoon ⋅ Ruizhi Qian ⋅ Minda Zhao ⋅ Weiyue Li ⋅ Mengyu Wang
Where Does the Relative Clause Attach? Probing Prosodic and Semantic Sensitivity in Large Audio Language Models
Jingying Hu ⋅ Elsayed Issa
Emergent Negligence: How Profit Mandates Induce Alignment Failures in LLMs
Eric So
Do Evaluation Metrics Detect Errors in Classical Chinese to English Translations?
Osvaldo Quinjica ⋅ Eric Bennett ⋅ Xinchen Yang ⋅ Andrew Schonebaum ⋅ Marine Carpuat
The Optimizer Is the Agent: Reasoning-Driven Search across Prompts, Programs, and ML Workflows
Junbo Li ⋅ Boyi Liu ⋅ Canwen Xu ⋅ Yite Wang ⋅ Zhewei Yao ⋅ Zhangyang Wang ⋅ qiang liu ⋅ Yuxiong He
Fractured Chain-of-Thought Reasoning
Baohao Liao ⋅ Hanze Dong ⋅ Yuhui Xu ⋅ Doyen Sahoo ⋅ Christof Monz ⋅ Junnan Li ⋅ Caiming Xiong
Large language models reorganize neural geometry during in-context learning
Hua-Dong Xiong ⋅ Li Ji-An ⋅ Robert Wilson ⋅ Kwonjoon Lee ⋅ Xue-Xin Wei
FlexSQL: Flexible Exploration and Execution Make Better Text-to-SQL Agents
Quang Hieu Pham ⋅ Yang He ⋅ Ping Nie ⋅ Canwen Xu ⋅ Davood Rafiei ⋅ Yuepeng Wang ⋅ Xi Ye ⋅ Jocelyn Qiaochu Chen
Human-like Working Memory Interference in Large Language Models
Hua-Dong Xiong ⋅ Li Ji-An ⋅ Jiaqi Huang ⋅ Robert Wilson ⋅ Kwonjoon Lee ⋅ Xue-Xin Wei
TierMem: Balancing Compressed Memory and Raw Evidence for Long-Horizon Agent Memory
Qiming Zhu ⋅ Shunian Chen ⋅ Rui Yu ⋅ Zhehao Wu ⋅ Benyou Wang
MidTool: Mid-training Data Synthesis for Agentic Tool Use
Fengqing Jiang ⋅ Yite Wang ⋅ Boyi Liu ⋅ Zhaoyang Wang ⋅ Canwen Xu ⋅ Zhewei Yao ⋅ Radha Poovendran ⋅ Yuxiong He
Revisiting AI Safety Gridworlds: Evaluating Language Models on Classic Safety Challenges
Ömer Çağatan ⋅ Xuandong Zhao
SERUM: State Extraction and Refinement for User Modeling
Andy J Phu ⋅ Karin De Langis ⋅ James Mooney ⋅ Khanh Chi Le ⋅ Dongyeop Kang
Eliciting Intrinsic Hallucinations in LLMs via Semantically Equivalent Adversarial Attacks
Atri Vivek Sharma ⋅ Brian Formento ⋅ Alessio Lomuscio
Does Episodic Memory Help Close the Lexical Frequency Gap in Sensitivity to Syntactic Contrasts? A Test Using Retrieval-Augmented Language Models
Jing Liu ⋅ Najoung Kim
The Illusion of Stochasticity in LLMs
Xiangming Gu ⋅ Soham De ⋅ Michalis Titsias ⋅ Larisa Markeeva ⋅ Petar Veličković ⋅ Razvan Pascanu
Superficial Beliefs in LLM Decision-Making
Gabriel Freedman ⋅ Francesca Toni
Learning Reasoning World Models for Parallel Code
Gautam Singh ⋅ Arjun Guha ⋅ Bhavya Kailkhura ⋅ Harshitha Menon
Autonomy Reshapes How Personalization Affects Privacy Concerns and Trust in LLM Agents
Zhiping Zhang ⋅ Yi E Zhang ⋅ Freda Shi ⋅ Tianshi Li
Struc-EMB: The Potential of Structure-Aware Encoding in Language Embeddings
Shikun Liu ⋅ Haoyu P Wang ⋅ Mufei Li ⋅ Pan Li
MedAction: Towards Active Multi-turn Clinical Diagnostic LLMs
Hsin-Ling Hsu ⋅ Zizheng Wang ⋅ Donghua Zhang ⋅ Nai-Chia Chen ⋅ Jerry Wang ⋅ Jun-En Ding ⋅ Chia-Hsuan Hsu ⋅ Guoan Wang ⋅ Feng Liu ⋅ Fang M Hung ⋅ Chenwei Wu ⋅ Liyue Shen
ConsumerBench: Benchmarking Generative AI Applications on End-User Devices
Michael Gu ⋅ Rohan Kadekodi ⋅ Sahi Chitrapu ⋅ Aradhya Agrawal ⋅ Camille Sawa ⋅ Hoang D Nguyen ⋅ Keisuke Kamahori ⋅ Yiyu Liu ⋅ Baris Kasikci
Who Guards the Benchmarks? Automated Auditing of LLM Agent Benchmarks
Xinming Tu ⋅ Tianze Wang ⋅ Minta Lu ⋅ Kexin Huang ⋅ Yuanhao Qu ⋅ Sara Mostafavi
Semantic Differentiation for Tackling Challenges in Watermarking Low-Entropy Constrained Generation Outputs
Nghia T Le ⋅ Alan Ritter ⋅ Kartik Goyal
DataSTORM: Deep Research on Large-Scale Databases using Exploratory Data Analysis and Data Storytelling
Shicheng Liu ⋅ Yucheng Jiang ⋅ Sajid Farook ⋅ Camila Nicollier Sanchez ⋅ David F Pena ⋅ Monica Lam
MMEB-V3: Measuring the Performance Gaps of Omni-Modality Embedding Models
Haohang Huang ⋅ Xuan Lu ⋅ Mingyi Su ⋅ Xuan Zhang ⋅ Ziyan Jiang ⋅ Ping Nie ⋅ Kai Zou ⋅ Tomas Pfister ⋅ Wenhu Chen ⋅ Wei Zhang ⋅ Xiaoyu Shen ⋅ Rui Meng
Memorization Dynamics in Knowledge Distillation for Language Models
Jaydeep Borkar ⋅ Karan Chadha ⋅ Niloofar Mireshghallah ⋅ Yuchen Zhang ⋅ Irina-Elena Veliche ⋅ Archi Mitra ⋅ David A Smith ⋅ Zheng Xu ⋅ Diego Garcia-Olano
The Collaboration Gap: Exploration and Benchmarking of Open-World Agentic Cooperation
Tim R Davidson ⋅ Adam Fourney ⋅ Saleema Amershi ⋅ Robert West ⋅ Eric Horvitz ⋅ Ece Kamar
ASPIRE: Asynchronous Batched Self-Speculative Decoding for Long-Context LLM Inference
Amir Ziashahabi ⋅ Hossein Entezari Zarch ⋅ Lei Gao ⋅ Murali Annavaram ⋅ Salman Avestimehr
Verbalizing LLMs' assumptions to explain and control sycophancy
Myra Cheng ⋅ Isabel Sieh ⋅ Humishka Zope ⋅ Sunny Yu ⋅ Lujain Ibrahim ⋅ Aryaman Arora ⋅ Jared Moore ⋅ Desmond Ong ⋅ Dan Jurafsky ⋅ Diyi Yang
MetaSymbO: Multi-Agent Language-Guided Metamaterial Discovery via Symbolic Latent Evolution
Jianpeng Chen ⋅ Wangzhi Zhan ⋅ Dongqi Fu ⋅ Junkai Zhang ⋅ Zian Jia ⋅ Ling Li ⋅ Wei Wang ⋅ Dawei Zhou
Group-Evolving Agents: Open-Ended Self-Improvement via Experience Sharing
Zhaotian Weng ⋅ Antonis Antoniades ⋅ Deepak Nathani ⋅ Zhen Zhang ⋅ Sophia Pu ⋅ Eric Wang
Enhancing Vision Language Models' Robustness Under Adverse Imaging Conditions
Tianfu Wang ⋅ Mingyang Xie ⋅ Haoming Cai ⋅ Tianyi Xiong ⋅ Xiyao Wang ⋅ Dongdong Fu ⋅ Guan-Ming Su ⋅ Paola Cascante-Bonilla ⋅ Christopher Metzler
Phonological Perception of Sign Language Models
Kayo Yin ⋅ Jessica Carter ⋅ Annemarie Kocab ⋅ Alex X Lu
Understanding In-context Learning of Addition via Activation Subspaces
Xinyan Hu ⋅ Kayo Yin ⋅ Michael I Jordan ⋅ Jacob Steinhardt ⋅ Lijie Chen
GRIP: Algorithm-Agnostic Machine Unlearning for Mixture-of-Experts via Geometric Router Constraints
Andy Zhu ⋅ Rongzhe Wei ⋅ Yupu Gu ⋅ Pan Li
Evolving Programmatic Skill Networks
Haochen Shi ⋅ Xingdi Yuan ⋅ Bang Liu
The Hidden Puppet Master: Predicting Human Belief Change in Manipulative LLM Dialogues
Jocelyn J Shen ⋅ Amina Luvsanchultem ⋅ Jessica Kim ⋅ Kynnedy S Smith ⋅ Valdemar Danry ⋅ Kantwon Rogers ⋅ Hae Won Park ⋅ Maarten Sap ⋅ Cynthia Breazeal
Learning to Draw ASCII Improves Spatial Reasoning in Language Models
Shiyuan Huang ⋅ Li Liu ⋅ Jincheng He ⋅ Leilani H Gilpin
Stabilizing Off-Policy Training for Long-Horizon LLM Agent via Turn-Level Importance Sampling and Clipping-Triggered Normalization
Chenliang Li ⋅ Adel Elmahdy ⋅ Alex J Boyd ⋅ Zhongruo Wang ⋅ Siliang Zeng ⋅ Alfredo Garcia ⋅ Parminder Bhatia ⋅ Taha Kass-Hout ⋅ Cao Xiao ⋅ Mingyi Hong
Models Can Model, But Can’t Bind: Structured Grounding in Text-to-Optimization
Zhiqi Gao ⋅ Albert Ge ⋅ Alexander M Berenbeim ⋅ Nathaniel D. Bastian ⋅ Frederic Sala
SlimQwen: Exploring the Pruning and Distillation in Large MoE Model Pre-training
Shengkun Tang ⋅ Zekun Wang ⋅ Bo Zheng ⋅ Liangyu Wang ⋅ Rui Men ⋅ Siqi Zhang ⋅ Xiulong Yuan ⋅ Zihan Qiu ⋅ Zhiqiang Shen ⋅ Dayiheng Liu
NI Sampling++: Optimizing Token Order for Fast Discrete Diffusion Sampling with Reinforcement Learning
Enshu Liu ⋅ Theodore Z Zhao ⋅ Xuefei Ning ⋅ Zinan Lin ⋅ Yu Wang
Faster Superword Tokenization
Craig Schmidt ⋅ Yuval Pinter ⋅ Chris Tanner
Cooperative Profiles Predict Multi-Agent LLM Team Performance in AI for Science Workflows
Shivani Kumar ⋅ Adarsh Bharathwaj ⋅ David Jurgens
Measuring Five-Nines Reliability: Sample-Efficient LLM Evaluation in Saturated Benchmarks
Eungyeup Kim ⋅ Chenchen Gu ⋅ Vashisth Tiwari ⋅ J Kolter
WorldPM: Scaling Human Preference Modeling via Real-World Feedback
Binghai Wang ⋅ Runji Lin ⋅ Keming Lu ⋅ Le Yu ⋅ Zhenru Zhang ⋅ Fei Huang ⋅ Chujie Zheng ⋅ Kai Dang ⋅ Yang Fan ⋅ An Yang ⋅ Binyuan Hui ⋅ Dayiheng Liu ⋅ Tao Gui ⋅ Qi Zhang ⋅ Xuanjing Huang ⋅ Yu-Gang Jiang ⋅ Bowen Yu ⋅ Jingren Zhou ⋅ Junyang Lin
Test-Time Scaling Makes Overtraining Compute-Optimal
Nicholas Roberts ⋅ Sungjun Cho ⋅ Zhiqi Gao ⋅ Tzu-Heng Huang ⋅ Albert Wu ⋅ Gabriel Orlanski ⋅ Avi Trost ⋅ E. Kelly Buchanan ⋅ Aws Albarghouthi ⋅ Frederic Sala
Ads in AI Chatbots? An Analysis of How Large Language Models Navigate Conflicts of Interest
Addison J. Wu ⋅ Ryan Liu ⋅ Stella Li ⋅ Yulia Tsvetkov ⋅ Thomas Griffiths
Understanding and Mitigating Premature Confidence for Better LLM Reasoning
Jingchu Gai ⋅ Guanning Zeng ⋅ Christina Baek ⋅ Chen Wu ⋅ J Kolter ⋅ Andrej Risteski ⋅ Aditi Raghunathan
New Skills or Sharper Primitives? A Probabilistic Perspective on the Emergence of Reasoning in RLVR
Zhilin Wang ⋅ Yafu Li ⋅ Shunkai Zhang ⋅ Zhi Wang ⋅ Haoran Zhang ⋅ Xiaoye Qu ⋅ Yu Cheng
Who Broke the System? Failure Localization in LLM-Based Multi-Agent Systems
Yufei Xia ⋅ Anjun Gao ⋅ Yueyang Quan ⋅ Zhuqing Liu ⋅ Minghong Fang
Meta-Harness: End-to-End Optimization of Model Harnesses
Yoonho Lee ⋅ Roshen S Nair ⋅ Qizheng Zhang ⋅ Kangwook Lee ⋅ Omar Khattab ⋅ Chelsea Finn
TierCache: A Multi-Granularity Semantic Caching Framework for Structured Query Generation
Myeonghwa Lee ⋅ Hyunjun Yang ⋅ Min-Soo Kim
TIDES: A Longitudinal Bilingual Dataset for Modeling Multi-Party Social Dynamics
Heechan Lee ⋅ Jeonggyu Kang ⋅ Junho Myung ⋅ Jaywoong Jeong ⋅ Juho Kim ⋅ Joseph Seering
Cylon: Asynchronous Linear Attention
Alexander Waitz ⋅ William Hu ⋅ Benjamin F Spector ⋅ Atri Rudra ⋅ Christopher Re ⋅ Simran Arora
GLiGuard: Schema-Conditioned Classification for LLM Content Moderation
Urchade Zaratiana ⋅ Mary Newhauser ⋅ George Hurn-Maloney ⋅ Ash Lewis
DreamProver: Evolving Abstract and Transferable Lemmas with Wake-Sleep Agentic Theorem Prover
Youyuan Zhang ⋅ Jialiang Sun ⋅ Hangrui Bi ⋅ Chuqin Geng ⋅ Wenjie Ma ⋅ Zhaoyu Li ⋅ Xujie Si
Learning from Failures: Correction-Oriented Policy Optimization with Verifiable Rewards
Mengjie Ren ⋅ Jie Lou ⋅ Boxi Cao ⋅ Xueru Wen ⋅ Hongyu Lin ⋅ Xianpei Han ⋅ Le Sun ⋅ XingYu Li ⋅ Yaojie Lu
What Do Language Models Learn and When? The Implicit Curriculum Hypothesis
Emmy Liu ⋅ Kaiser Sun ⋅ Millicent Li ⋅ Isabelle Lee ⋅ Lindia Tjuatja ⋅ Jen-tse Huang ⋅ Graham Neubig
OpenVLThinkerV2: A Generalist Multimodal Reasoning Model for Multi-domain Visual Tasks
Wenbo Hu ⋅ Xin Chen ⋅ Yan Gao-Tian ⋅ Nanyun (Violet) Peng ⋅ Kai-Wei Chang
FronTalk: Benchmarking Front-End Development as Conversational Code Generation with Multi-Modal Feedback
Xueqing Wu ⋅ Zihan Xue ⋅ Da Yin ⋅ Shuyan Zhou ⋅ Kai-Wei Chang ⋅ Nanyun (Violet) Peng ⋅ Yeming Wen
Thinking Without Words: Efficient Latent Reasoning with Abstract Chain-of-Thought
Keshav Ramji ⋅ Tahira Naseem ⋅ Ramón Fernandez Astudillo
FPEdit: Robust LLM Fingerprinting through Localized Parameter Editing
Shida Wang ⋅ Chaohu Liu ⋅ Yubo Wang ⋅ Linli Xu
The Tool Illusion: Rethinking Tool Use in Web Agents
Renze Lou ⋅ Baolin Peng ⋅ Wenlin Yao ⋅ Qianhui Wu ⋅ Hao Cheng ⋅ Suman Nath ⋅ Wenpeng Yin ⋅ Jianfeng Gao
Can AI Truly Represent Your Voice in Deliberations? A Comprehensive Study of Large-Scale Opinion Aggregation with LLMs
Shenzhe Zhu ⋅ Shu Yang ⋅ Michiel A Bakker ⋅ Alex Pentland ⋅ Jiaxin Pei
Clarify or Answer: Reinforcement Learning for Agentic VQA with Context Under-specification
Zongwan Cao ⋅ Bingbing Wen ⋅ Lucy Lu Wang
ReLay: Personalized LLM-Generated Plain-Language Summaries for Better Understanding, but at What Cost?
Joey Chan ⋅ Yikun Han ⋅ Jingyuan Chen ⋅ Samuel Fang ⋅ Lauren D Gryboski ⋅ Alexandra Lee ⋅ Sheel Tanna ⋅ Qingqing Zhu ⋅ Zhiyong Lu ⋅ Lucy Lu Wang ⋅ Yue Guo
QVAC Genesis III: A Large-Scale, High-Quality Open Synthetic STEM Corpus for Efficient Language Model Pre-Training
Davide Vitabile ⋅ Nik T ⋅ Akshay Prasoon Nambiar ⋅ Kamal Kumar Gupta ⋅ Amril Nurman Nazir
Comparing Developer and LLM Biases in Code Evaluation
Ryan Shar ⋅ Aditya Mittal ⋅ Zichu Wu ⋅ Shyam Agarwal ⋅ Sherry Wu ⋅ Chris Donahue ⋅ Ameet Talwalkar ⋅ Wayne Chi ⋅ Valerie Chen
To See the Unseen: on the Generalization Ability of Transformers in Symbolic Reasoning
Nevena Lazic ⋅ Liam H Fowl ⋅ András György ⋅ Csaba Szepesvari
Where Does Social Reasoning Come From? Capability Provenance in Language Models
Glenn Matlin ⋅ Chandreyi Chakraborty ⋅ Saehee Eom ⋅ Mika Okamoto ⋅ Rayan Castilla ⋅ Louis Jaburi ⋅ Alvin Deng ⋅ Taywon Min ⋅ Lucia Quirke ⋅ Stella Biderman ⋅ Mark Riedl
Identity, Cooperation and Framing Effects within Groups of Real and Simulated Humans
Suhong Moon ⋅ Minwoo Kang ⋅ Joseph Suh ⋅ Mustafa Safdari ⋅ John Canny
Why Does Self-Distillation (Sometimes) Degrade the Reasoning Capability of LLMs?
Jeonghye Kim ⋅ Xufang Luo ⋅ Minbeom Kim ⋅ Sangmook Lee ⋅ Dohyung Kim ⋅ Jiwon Jeon ⋅ Dongsheng Li ⋅ Yuqing Yang
What do your logits know? (The answer may surprise you!)
Masha Fedzechkina ⋅ Eleonora Gualdoni ⋅ Rita Ramos ⋅ Sinead Williamson
From RLVR to RLSVR: Breaking the Verifiability Bottleneck Beyond Math and Code via Self-Verifiable Rewards
Qinsi Wang ⋅ Jing Shi ⋅ Huazheng Wang ⋅ Kun Wan ⋅ Yiran Wu ⋅ Bo Liu ⋅ Qingyun Wu ⋅ Hai H Li ⋅ Yiran Chen ⋅ Handong Zhao ⋅ Wentian Zhao
Ill-Defined Math: Benchmarking LLM Reasoning Beyond Well-Defined Problems
Huaibo Chen ⋅ Yixiao Lin ⋅ Zihan Zhao ⋅ Pengcheng Chen ⋅ Nuohao Liu ⋅ Yue Hu ⋅ Qian Xie ⋅ Qinbo Bai ⋅ Ning Yan ⋅ Masood S Mortazavi ⋅ KAMAL YOUCEF-TOUMI
Visual Aesthetic Benchmark: Can Frontier Models Judge Beauty?
Yichen Feng ⋅ Yuetai Li ⋅ Chunjiang Liu ⋅ Fengqing Jiang ⋅ Yue Huang ⋅ Yuanyuan Chen ⋅ Hang Hua ⋅ Zhengqing Yuan ⋅ Kaiyuan Zheng ⋅ Luyao Niu ⋅ Bhaskar Ramasubramanian ⋅ Basel Alomair ⋅ Xiangliang Zhang ⋅ Misha Sra ⋅ Zichen Chen ⋅ Radha Poovendran ⋅ Zhangchen Xu
It’s How You Ask: Gendered Linguistic Bias in LLMs
Katherine Van Koevering ⋅ Anjalie Field
SCOPE: A Generative Approach for LLM Prompt Compression
Tinghui Zhang ⋅ Yifan Wang ⋅ Daisy Z Wang
Bagpiper: Solving Open-Ended Audio Tasks via Rich Captions
Jinchuan Tian ⋅ Haoran Wang ⋅ Bo-Hao Su ⋅ Chien-yu Huang ⋅ Qingzheng Wang ⋅ Jiatong Shi ⋅ William Chen ⋅ Xun Gong ⋅ Siddhant Arora ⋅ Chin-Jou Li ⋅ Masao Someki ⋅ Takashi Maekaku ⋅ Yusuke Shinohara ⋅ Jin Sakuma ⋅ Keita Goto ⋅ Chao-Han Huck Yang ⋅ Shinji Watanabe
Inference Scaling of LLM Ensembling: Bridging Token Spaces with Token Translation
Tianxin Wei ⋅ Zhichen Zeng ⋅ Ruizhong Qiu ⋅ Zhining Liu ⋅ Xuying Ning ⋅ Xinrui He ⋅ Wenxuan Bao ⋅ Xiao Lin ⋅ Qi He ⋅ Xianfeng Tang ⋅ Hanghang Tong ⋅ Jingrui He
EvoSelect: Data-Efficient LLM Evolution for Targeted Task Adaptation
Ting-Wei Li ⋅ Sirui Chen ⋅ Jiaru Zou ⋅ Yingbing Huang ⋅ Tianxin Wei ⋅ Jingrui He ⋅ Hanghang Tong
Reinforcement Routing for Mixtures of LoRAs in Parameter-Efficient LLM Finetuning
Ruizhong Qiu ⋅ Hanqing Zeng ⋅ Yinglong Xia ⋅ Yiwen Meng ⋅ Ren Chen ⋅ Jiarui Feng ⋅ Dongqi Fu ⋅ Qifan Wang ⋅ Jiayi Liu ⋅ Jun Xiao ⋅ Xiangjun Fan ⋅ Benyu Zhang ⋅ Hong Li ⋅ Zhining Liu ⋅ Hyunsik Yoo ⋅ Zhichen Zeng ⋅ Tianxin Wei ⋅ Hanghang Tong
Mitigating LLM biases toward spurious social contexts using direct preference optimization
Hyunji (Alex) Nam ⋅ Dorottya Demszky
TRIDENT: Benchmarking LLM Safety in Finance, Medicine, and Law
Zheng Hui ⋅ Yijiang R Dong ⋅ Ehsan Shareghi ⋅ Nigel Collier
LLM Evaluators are Biased across Languages
Ej Zhou ⋅ Lucas Resck ⋅ Zheng Hui ⋅ Anna Korhonen
Explainable AI-Generated Image Detection RewardBench
Michael Yang ⋅ Shijian Deng ⋅ William T Doan ⋅ Kai Wang ⋅ Tianyu Yang ⋅ Harsh Singh ⋅ Yapeng Tian
Can Large Language Models Match Human Diversity in Educational Content Generation?
Mei Tan ⋅ Hyunji (Alex) Nam ⋅ Dorottya Demszky
MLPs are Hebbians: Constructing Efficient Fact-Storing MLPs for Transformers
Roberto Garcia ⋅ Jerry Liu ⋅ Ronald G Junkins ⋅ Owen M Dugan ⋅ Dylan Zinsley ⋅ Sabri Eyuboglu ⋅ Atri Rudra ⋅ Christopher Re
REVERE: Reflective Evolving Research Engineer for Scientific Workflows
Balaji Dinesh Gangireddi ⋅ Aniketh Garikaparthi ⋅ Manasi Patwardhan ⋅ Arman Cohan
Beyond Scalar Rewards: Rubric-Guided Self-Distillation
Siyi Gu ⋅ Jialin Chen ⋅ Sophia Zhou ⋅ Arman Cohan ⋅ Rex Ying
Quokka: Accelerating Program Verification with LLMs via Invariant Synthesis
Anjiang Wei ⋅ Tianran Sun ⋅ Tarun Suresh ⋅ Haoze Wu ⋅ Ke Wang ⋅ Alex Aiken
Reinforcement Learning with Metacognitive Feedback Elicits Faithful Uncertainty Expression in LLMs
Gabrielle Liu ⋅ Avi Caciularu ⋅ Gal Yona ⋅ Idan Szpektor ⋅ Arman Cohan
Prototype Language Models
Dan Ley ⋅ Giang Nguyen ⋅ Himabindu Lakkaraju ⋅ Julius Adebayo
EvoX: Meta-Evolution for Automated Discovery
Shu Liu ⋅ Shubham Agarwal ⋅ Monish Maheswaran ⋅ Mert Cemri ⋅ Qiuyang Mang ⋅ Zhifei Li ⋅ Ashwin Naren ⋅ Ethan Boneh ⋅ Audrey Cheng ⋅ Alexander Du ⋅ Melissa Pan ⋅ Kurt Keutzer ⋅ Alvin Cheung ⋅ Koushik Sen ⋅ Alex Dimakis ⋅ Matei Zaharia ⋅ Ion Stoica
Squeeze Evolve: A Unified Multi-Model Orchestration Framework for Verifier-Free Evolution
Monish Maheswaran ⋅ Leon Lakhani ⋅ Zhongzhu Zhou ⋅ Shijia Yang ⋅ Junxiong Wang ⋅ Coleman R Hooper ⋅ Yuezhou Hu ⋅ Rishabh Tiwari ⋅ Jue WANG ⋅ Harman Singh ⋅ Qingyang Wu ⋅ Ce Zhang ⋅ Kurt Keutzer ⋅ Tri Dao ⋅ Xiaoxia Wu ⋅ Ben Athiwaratkun ⋅ James Zou ⋅ Chenfeng Xu
LLM Router: Rethinking Routing with Prefill Activations
Tanay Varshney ⋅ Annie P Surla ⋅ Michelle Xu ⋅ Gomathy Venkata Krishnan ⋅ Maximilian Jeblick ⋅ David Austin ⋅ Neal Vaidya ⋅ Davide Onofrio
ClawsBench: High Fidelity Simulated Workspace Environments for Evaluating and Improving Productivity Agents
Xiangyi Li ⋅ Kyoung Whan Choe ⋅ Yimin Liu ⋅ Wenbo Chen ⋅ Bingran You ⋅ Zonglin Di ⋅ Shenghan Zheng ⋅ Xiaokun Chen ⋅ Chujun Tao ⋅ Weixiang Yan ⋅ Jiankai Sun ⋅ Yiyuan Li ⋅ Jiajun Bao ⋅ Yuanli Wang ⋅ Hanchung Lee
Algebraic Decomposition Theory for Transformer Length Generalization
Andy Yang ⋅ Blerta Veseli ⋅ Corentin Barloy ⋅ Michaël Cadilhac ⋅ Andreas Krebs ⋅ Charles Paperman ⋅ Howard Straubing ⋅ Michael Hahn
Geometry-Aware Steering Interpolates Model Beliefs
Daniel Wurgaft ⋅ Can Rager ⋅ Thomas Fel ⋅ Sheridan Feucht ⋅ Usha Bhalla ⋅ Tal Haklay ⋅ Matthew Kowal ⋅ Raphaël Sarfati ⋅ Eric Bigelow ⋅ Jack Merullo ⋅ Noah Goodman ⋅ Atticus Geiger ⋅ Ekdeep Singh Lubana
Do Sparse Autoencoders Capture Concept Manifolds?
Usha Bhalla ⋅ Thomas Fel ⋅ Can Rager ⋅ Sheridan Feucht ⋅ Tal Haklay ⋅ Daniel Wurgaft ⋅ Siddharth Boppana ⋅ Matthew Kowal ⋅ Jack Merullo ⋅ Atticus Geiger ⋅ Ekdeep Singh Lubana
Arithmetic in the Wild: Llama uses Standard Addition to Reason About Cyclic Concepts
Sheridan Feucht ⋅ Tal Haklay ⋅ Usha Bhalla ⋅ Daniel Wurgaft ⋅ Can Rager ⋅ Jack Merullo ⋅ Thomas McGrath ⋅ Raphaël Sarfati ⋅ Owen Lewis ⋅ Ekdeep Singh Lubana ⋅ Thomas Fel ⋅ Atticus Geiger
When Seeing Overrides Knowing: Visual Dominance and Deferral-Based Method for Personalized Safety in VLMs
Edward Sun ⋅ Yuchen Wu ⋅ Zixian Ma ⋅ Eric H Jiang ⋅ Yijia Xiao ⋅ Xiaoyuan Yi ⋅ Ranjay Krishna ⋅ Wei Wang ⋅ Jindong Wang ⋅ Aylin Caliskan
VERIFY A Benchmark of Visual Reasoning for Multimodal Reasoning Fidelity
Jing Bi ⋅ JunJia Guo ⋅ Guangyu Sun ⋅ Susan Liang ⋅ Luchuan Song ⋅ Yolo Y Tang ⋅ Jinxi He ⋅ Jiarui Wu ⋅ Ali Vosoughi ⋅ Chen Chen ⋅ Jason J Corso ⋅ Chenliang Xu
HeaPA: Difficulty-Aware Heap Sampling and On-Policy Query Augmentation for LLM Reinforcement Learning
Weiqi Wang ⋅ Xin Liu ⋅ Binxuan Huang ⋅ Hejie Cui ⋅ Rongzhi Zhang ⋅ Changlong Yu ⋅ Shuowei Jin ⋅ Jingfeng Yang ⋅ Qingyu Yin ⋅ Zhengyang Wang ⋅ Zheng Li ⋅ Yifan Gao ⋅ Priyanka Nigam ⋅ Bing Yin ⋅ Lihong Li ⋅ Yangqiu Song
SWE-Cascade: Benchmarking Agents on Large-Scale Multilingual Code Refactoring
Yuling Shi ⋅ Jinghan Xu ⋅ Kelin Fu ⋅ Wenhao Zeng ⋅ YINGWEI MA ⋅ Shilin He ⋅ Lei Zhang ⋅ Yue Liu ⋅ Zelin Zhao ⋅ Terry Yue Zhuo ⋅ Jialun Cao ⋅ Siyu Ye ⋅ Tianyu Liu ⋅ Kai Cai ⋅ Shing-Chi Cheung ⋅ Xiaodong Gu
NormViz: A Benchmark and Framework for Grounding Multimodal Reasoning in Global Cultures
Akhila Yerukola ⋅ Fabrice Harel-Canada ⋅ Simran Khanuja ⋅ Abhinav S Rao ⋅ Ashima Suvarna ⋅ Nanyun (Violet) Peng ⋅ Saadia Gabriel ⋅ Maarten Sap
Teaching Pretrained Language Models to Think Deeper with Retrofitted Recurrence
Sean McLeish ⋅ Ang Li ⋅ John Kirchenbauer ⋅ Dayal Singh Kalra ⋅ Brian R Bartoldson ⋅ Bhavya Kailkhura ⋅ Avi Schwarzschild ⋅ Jonas Geiping ⋅ Tom Goldstein ⋅ Micah Goldblum
Learning to Comply: Workflow-Grounded Environment Generation for Training Procedurally Compliant Agents
Seungwon Lim ⋅ Minu Kim ⋅ Seokhee Hong ⋅ Jinyoung Yeo ⋅ Se-Young Yun ⋅ Joonkee Kim
Qworld: Question-Specific Evaluation Criteria for LLMs
Yuchang Su ⋅ Shanghua Gao ⋅ Pengwei Sui ⋅ Curtis R Ginder ⋅ Marinka Zitnik
Convergent Evolution: How Different Language Models Learn Similar Number Representations
Deqing Fu ⋅ Tianyi Zhou ⋅ Mikhail Belkin ⋅ Vatsal Sharan ⋅ Robin Jia
ExpRL: Exploratory RL for LLM Mid-Training
Violet Xiang ⋅ Amrith Setlur ⋅ Chase Blagden ⋅ Nick Haber ⋅ Aviral Kumar
SocialVeil: Probing Social Intelligence of Language Agents under Communication Barriers
Keyang Xuan ⋅ Pengda Wang ⋅ Chongrui Ye ⋅ Haofei Yu ⋅ Tal August ⋅ Jiaxuan You
An Investigation of Translationese in the Generations of Multilingual Large Language Models
Maria Valentini ⋅ Téa Wright ⋅ Julisa Granados ⋅ Eliana Colunga ⋅ Katharina von der Wense
From SWE-ZERO to SWE-HERO: Execution-free to Execution-based Fine-tuning for Software Engineering Agents
Nikolai Ludwig ⋅ Wasi Ahmad ⋅ Somshubra Majumdar ⋅ Boris Ginsburg
Restoring Generalization in Fine-tuned Multimodal LLMs via Geometric Alignment
Lixuan He ⋅ Shikang Zheng ⋅ Guantao Chen
Learning Next Action Predictors from Human-Computer Interaction
Omar Shaikh ⋅ Valentin Teutschbein ⋅ Kanishk Gandhi ⋅ Yikun Chi ⋅ Nick Haber ⋅ Thomas N Robinson ⋅ Nilam Ram ⋅ Byron Reeves ⋅ Sherry Yang ⋅ Michael Bernstein ⋅ Diyi Yang
Mind the Sim2Real Gap in User Simulation for Agentic Tasks
Xuhui Zhou ⋅ Weiwei Sun ⋅ Qianou Ma ⋅ Yiqing Xie ⋅ Jiarui Liu ⋅ Weihua Du ⋅ Sean Welleck ⋅ Yiming Yang ⋅ Graham Neubig ⋅ Sherry Wu ⋅ Maarten Sap
How Independent are Large Language Models? A Statistical Framework for Auditing Behavioral Entanglement and Reweighting Verifier Ensembles
Chenchen Kuai ⋅ Jiwan Jiang ⋅ Zihao Zhu ⋅ Hao Wang ⋅ Keshu Wu ⋅ Zihao Li ⋅ Yunlong Zhang ⋅ Chenxi Liu ⋅ Zhengzhong Tu ⋅ Zhiwen Fan ⋅ Yang Zhou
Gradual Code-Switching as Inference-Time Cross-Lingual Representational Alignment for LLMs
Haneul Yoo ⋅ Jiho Jin ⋅ Kyunghyun Cho ⋅ Alice Oh
MetaLint: Easy-to-Hard Generalization for Code Linting
Atharva Naik ⋅ Lawanya Baghel ⋅ Dhatchinamoorthi Kunde Govindarajan ⋅ Darsh Agrawal ⋅ Yiqing Xie ⋅ Daniel Fried ⋅ Carolyn Rose
Learning to Interrupt in Language-based Multi-agent Communication
Danqing Wang ⋅ Da Yin ⋅ Ruta Desai ⋅ Lei Li ⋅ Asli Celikyilmaz ⋅ Ansong Ni
KronQ: LLM Quantization via Kronecker-Factored Hessian
Donghyun Lee ⋅ Yuhang Li ⋅ Ruokai Yin ⋅ Priyadarshini Panda
Correct Answers from Sound Reasoning: Verifiable Process Supervision for Language Models
Kyuyoung Kim ⋅ Kevin Wang ⋅ Yunfei Xie ⋅ Peiyang Xu ⋅ Peiyao Sheng ⋅ Chen Wei ⋅ Zhangyang Wang ⋅ Jinwoo Shin ⋅ Pramod Viswanath ⋅ Sewoong Oh
Building Common Ground: Dynamic Grounding Failures and Repair in LLM Negotiation Dyads
Yiheng Yao ⋅ Robert Hawkins
MoRE: Mixture of Reused Experts
Eric S. Qiu ⋅ Utku U ACIKALIN ⋅ Justin Lovelace ⋅ Christian Belardi ⋅ Arjun B Mulchandani ⋅ Carla P Gomes ⋅ Kilian Weinberger
Locally Confident, Globally Stuck: The Quality-Exploration Dilemma in Diffusion Language Models
Liancheng Fang ⋅ Aiwei Liu ⋅ Henry P Zou ⋅ Yankai Chen ⋅ Enze Ma ⋅ Leyi Pan ⋅ Chunyu Miao ⋅ Wei-Chieh Huang ⋅ Xue Liu ⋅ Philip S Yu
MaLA: A Corpus and Data Mix for Massive Language Adaptation of Large Language Models
Shaoxiong Ji ⋅ Zihao Li ⋅ Jaakko Paavola ⋅ Peiqin Lin ⋅ Pinzhen Chen ⋅ Dayyán O'Brien ⋅ Hengyu Luo ⋅ Hinrich Schuetze ⋅ Jörg Tiedemann ⋅ Barry Haddow
A Tale of Two Temperatures: Simple, Efficient, and Diverse Sampling from Diffusion Language Models
Theo X. Olausson ⋅ Metod Jazbec ⋅ Xi Wang ⋅ Armando Solar-Lezama ⋅ Christian A. Naesseth ⋅ Stephan Mandt ⋅ Eric Nalisnick
SMETA-ZSL: Semantic Meta-Alignment for Zero-Shot Threat Classification
Ivan Montoya-Sanchez ⋅ Anantaa Kotal ⋅ Aritran Piplai
Improving GUI Grounding with Explicit Position-to-Coordinate Mapping
Suyuchen Wang ⋅ TIANYU ZHANG ⋅ Ahmed Masry ⋅ Christopher Pal ⋅ Spandana Gella ⋅ Bang Liu ⋅ Perouz Taslakian
Refusal Falls off a Cliff: How Safety Alignment Fails in Reasoning?
Qingyu Yin ⋅ Chak Tou Leong ⋅ Wenxuan Huang ⋅ Jaehong Yoon ⋅ Linyi Yang ⋅ Xiting Wang ⋅ Wenjie Li ⋅ Jinjin Gu
Opusanimation: Code-based dynamic chart generation
Bozheng Li ⋅ Miao Yang ⋅ Zhenhan Chen ⋅ Jiawang Cao ⋅ Mushui Liu ⋅ Yi Lu ⋅ Yongliang Wu ⋅ Bin Zhang ⋅ Yangguang Ji ⋅ Licheng Tang ⋅ Jay Wu ⋅ Wenbo Zhu
CURV: Enhancing Chart Understanding Through Curriculum Visual Grounded Reasoning
Xuehang Guo ⋅ Pingyue Zhang ⋅ Ruiyi Zhang ⋅ Zhenhailong Wang ⋅ Hanrui Lyu ⋅ Heng Ji ⋅ Tong Sun ⋅ Qingyun Wang ⋅ Manling Li
OpenMobile: Building Open Mobile Agents with Task and Trajectory Synthesis
Kanzhi Cheng ⋅ Zehao Li ⋅ Zheng Ma ⋅ Nuo Chen ⋅ Jialin Cao ⋅ Qiushi Sun ⋅ Zichen Ding ⋅ Fangzhi Xu ⋅ Hang Yan ⋅ Jiajun Chen ⋅ Anh Tuan Luu ⋅ Jianbing Zhang ⋅ Lewei Lu ⋅ Dahua Lin
BigCodeArena: A Platform for Executable Code Generation Evaluation
Terry Yue Zhuo ⋅ Xiaolong Jin ⋅ Hange Liu ⋅ Juyong Jiang ⋅ Tianyang Liu ⋅ Chen GONG ⋅ Bhupesh Bishnoi ⋅ Vaisakhi Mishra ⋅ Marek Šuppa ⋅ Noah Ziems ⋅ Saiteja Utpala ⋅ Ming Xu ⋅ Guangyu Song ⋅ Kaixin Li ⋅ Yuhan Cao ⋅ Bo Liu ⋅ Zheng Liu ⋅ Sabina Abdurakhmanova ⋅ Wenhao Yu ⋅ Mengzhao Jia ⋅ Jihan Yao ⋅ Kenneth Hamilton ⋅ Kumar Shridhar ⋅ Minh Chien Vu ⋅ Dingmin Wang ⋅ Jiawei Liu ⋅ Zijian Wang ⋅ Qian Liu ⋅ Binyuan Hui ⋅ Meg Risdal ⋅ Ahsen Khaliq ⋅ Atin Sood ⋅ Zhenchang Xing ⋅ Wasi Ahmad ⋅ John C Grundy ⋅ David Lo ⋅ Banghua Zhu ⋅ Xiaoning Du ⋅ Torsten Scholak ⋅ Leandro von Werra
Synthetic Sandbox for Training ML Engineering Agents
Yuhang Zhou ⋅ Lizhu Zhang ⋅ Yifan Wu ⋅ Jiayi Liu ⋅ Xiangjun Fan ⋅ Zhuokai Zhao ⋅ Hong Yan
Creativity and Hallucinations Share Mechanisms in LLMs
Neta Glazer ⋅ Hadas Orgad ⋅ Lenny Aharon ⋅ Ethan Fetaya
CHASE: How Content Ecosystem Collapses When Ranking is the Only Target
Qianwen Gao ⋅ Zichang Su ⋅ Yiwen Hou ⋅ Leanid Palkhouski ⋅ Arlen Kumar
BrowseSafe: Understanding and Detecting Prompt Injection Within AI Browser Agents
Kaiyuan Zhang ⋅ Mark Tenenholtz ⋅ Kyle Polley ⋅ Jerry Ma ⋅ Denis Yarats ⋅ Ninghui Li
Curse of Coordination: Can Coding Agents Resolve Conflicts in Teamwork?
Arpandeep Khatua ⋅ Hao Zhu ⋅ Peter Tran ⋅ Arya Prabhudesai ⋅ Frederic Sadrieh ⋅ Johann K Lieberwirth ⋅ Xinkai Yu ⋅ Yicheng Fu ⋅ Michael J Ryan ⋅ Jiaxin Pei ⋅ Diyi Yang
Odysseus: Scaling VLMs to 100+ Turn Decision-Making in Games via Reinforcement Learning
Chengshuai Shi ⋅ Wenzhe Li ⋅ Xinran Liang ⋅ Yizhou Lu ⋅ Wenjia Yang ⋅ Ruirong Feng ⋅ Seth Karten ⋅ Ziran Yang ⋅ Zihan Ding ⋅ Gabriel H Sarch ⋅ Danqi Chen ⋅ Karthik Narasimhan ⋅ Chi Jin
From Individuals to Interactions: Benchmarking Gender Bias in Multimodal Large Language Models from the lens of Social Relationship
Yue Xu ⋅ Wenjie Wang
Forgetting to Forget: Attention Sink as A Gateway for Backdooring LLM Unlearning
Bingqi Shang ⋅ Yiwei Chen ⋅ Yihua Zhang ⋅ Bingquan Shen ⋅ Sijia Liu
ADMM-Q: An Improved Hessian-based Weight Quantizer for Post-Training Quantization of Large Language Models
Ryan Lucas ⋅ Mehdi Makni ⋅ Xiang Meng ⋅ Adam Deng ⋅ Rahul Mazumder
Can We Trust LLMs on Memristors? Diving into Reasoning Ability under Non-Ideality
Taiqiang Wu ⋅ Yuxin Cheng ⋅ Chenchen Ding ⋅ RUNMING YANG ⋅ Feng Xincheng ⋅ Wenyong Zhou ⋅ Zhengwu Liu ⋅ Ngai Wong
Who Built This Model? Tracing LLM Lineage via Spectral Fingerprints in Weight Space
Yiwei Chen ⋅ Bingqi Shang ⋅ Sijia Liu
HAI-Agent: Improving Long Horizon Software Engineering with Handoff Interventions
Junhao Wang ⋅ Evander Yang ⋅ Zenan Xu ⋅ Taiqiang Wu ⋅ Feiyuan Zhang ⋅ Michael R Lyu
Subspace Control: Turning Constrained Model Steering into Controllable Spectral Optimization
Yancheng Huang ⋅ Changsheng Wang ⋅ Chongyu Fan ⋅ Yicheng Lang ⋅ Bingqi Shang ⋅ Yang Zhang ⋅ Mingyi Hong ⋅ Qing Qu ⋅ Alvaro Velasquez ⋅ Sijia Liu
Data-efficient pre-training by scaling synthetic megadocs
Konwoo Kim ⋅ Suhas Kotha ⋅ Yejin Choi ⋅ Tatsunori Hashimoto ⋅ Nick Haber ⋅ Percy Liang
Towards Isolated Interventions via Almost Orthogonal Features in Language Models
Moritz Miller ⋅ Florent Draye ⋅ Bernhard Schölkopf
MonitorBench: A Comprehensive Benchmark for Chain-of-Thought Monitorability in Large Language Models
Han Wang ⋅ Yifan Sun ⋅ Brian Ko ⋅ Mann Talati ⋅ Jiawen Gong ⋅ Zimeng Li ⋅ Naicheng Yu ⋅ Xucheng Yu ⋅ Wei Shen ⋅ Vedant Jolly ⋅ Huan Zhang
PivotRL: High Accuracy Agentic Post-Training at Low Compute Cost
Junkeun Yi ⋅ Damon Mosk-Aoyama ⋅ Baihe Huang ⋅ Ritu Gala ⋅ Charles Wang ⋅ Sugam Devare ⋅ Khushi Bhardwaj ⋅ Abhibha Gupta ⋅ Oleksii Kuchaiev ⋅ Jiantao Jiao ⋅ Jian Zhang ⋅ Venkat Krishna Srinivasan
LogicIF: Towards Complex Logic Instruction Following
Mian Zhang ⋅ Shujian Liu ⋅ Sixun Dong ⋅ Ming Yin ⋅ Yebowen Hu ⋅ Sean Wang ⋅ Simin Ma ⋅ Song Wang ⋅ Sathish Reddy Indurthi ⋅ Haoyun Deng ⋅ Zhiyu Chen ⋅ Kaiqiang Song
From Geometry to Causality: How Instruction Exposure Wires Up Latent Rhetorical Directions in LLMs
Shengjie Xu
Gecko: An Efficient Neural Architecture Inherently Processing Sequences with Arbitrary Lengths
Xuezhe (Max) Ma ⋅ Shicheng Wen ⋅ Linghao Jin ⋅ Bilge Acun ⋅ Ruihang Lai ⋅ Bohan Hou ⋅ Will Lin ⋅ Hao Zhang ⋅ Songlin Yang ⋅ Ryan Lee ⋅ Mengxi Wu ⋅ Jonathan May ⋅ Luke Zettlemoyer ⋅ Carole-Jean Wu
Evaluating and Mitigating Misgendering in English-to-Hindi Machine Translation
Shreyas Gantayet ⋅ Tanay Sodha ⋅ Samyak Savi ⋅ Chavi Gupta ⋅ Dhruv Kumar
Decocted Experience Improves Test-Time Inference in LLM Agents
Maohao Shen ⋅ Kaiwen Zha ⋅ Zexue He ⋅ Zhang-Wei Hong ⋅ Siru Ouyang ⋅ Jongha J Ryu ⋅ Prasanna Sattigeri ⋅ Suhas Diggavi ⋅ Gregory W Wornell
DarwinLM: Evolutionary Structured Pruning of Large Language Models
Shengkun Tang ⋅ Oliver Sieberling ⋅ Eldar Kurtic ⋅ Zhiqiang Shen ⋅ Dan Alistarh
DR-LoRA: Dynamic Rank LoRA for Fine-Tuning Mixture-of-Experts Models
Guanzhi Deng ⋅ Bo Li ⋅ Ronghao Chen ⋅ Xiujin Liu ⋅ Huacan Wang ⋅ Zhuo Han ⋅ Lijie Wen ⋅ Linqi Song
Lost in the Maze: Overcoming Context Limitations in Long-Horizon Agentic Search
Howard Yen ⋅ Yoonsang Lee ⋅ Ashwin Paranjape ⋅ Mengzhou Xia ⋅ Thejas Venkatesh ⋅ Jack Hessel ⋅ Danqi Chen ⋅ Yuhao Zhang
CocoaBench: Evaluating unified digital agents in the wild
Shibo Hao ⋅ Zhining Zhang ⋅ Zhiqi Liang ⋅ Tianyang Liu ⋅ Yuheng Zha ⋅ Qiyue Gao ⋅ Jixuan Chen ⋅ Zilong Wang ⋅ Zhoujun Cheng ⋅ Haoxiang Zhang ⋅ Junli Wang ⋅ Hexi Jin ⋅ Boyuan Zheng ⋅ Kun Zhou ⋅ Yu Wang ⋅ Feng Yao ⋅ Licheng Liu ⋅ Yijiang Li ⋅ Zhifei Li ⋅ Zhengtao Han ⋅ Pracha Promthaw ⋅ Tommaso Cerruti ⋅ Xiaohan Fu ⋅ Ziqiao Ma ⋅ Jingbo Shang ⋅ Lianhui Qin ⋅ Julian McAuley ⋅ Eric Xing ⋅ Zhengzhong Liu ⋅ Rupesh K Srivastava ⋅ Zhiting Hu
No Single Best Model for Diversity: Learning a Router for Sample Diversity
Yuhan Liu ⋅ Fangyuan Xu ⋅ Vishakh Padmakumar ⋅ Daphne Ippolito ⋅ Eunsol Choi
Judge, Retrieve, or Abstain: Uncertainty-Guided LLM Judging with Provable Risk Guarantees
Sher Badshah ⋅ Ali Emami ⋅ Hassan Sajjad
The Finetuner’s Fallacy: When to Pretrain with Your Finetuning Data
Christina Baek ⋅ Ricardo P Monti ⋅ David J Schwab ⋅ Amro Abbas ⋅ Rishabh Adiga ⋅ Cody Blakeney ⋅ Maximilian Böther ⋅ Paul Burstein ⋅ Aldo G Carranza ⋅ Alvin Deng ⋅ Parth Doshi ⋅ Vineeth Dorna ⋅ Alex Fang ⋅ Tony Jiang ⋅ Siddharth Joshi ⋅ Brett W Larsen ⋅ Jason C Lee ⋅ Katherine L Mentzer ⋅ Luke Merrick ⋅ Haakon Mongstad ⋅ Fan Pan ⋅ Anshuman Suri ⋅ Darren Teh ⋅ Jason Telanoff ⋅ Jack Urbanek ⋅ Zhengping Wang ⋅ Josh Wills ⋅ Haoli Yin ⋅ Aditi Raghunathan ⋅ J Kolter ⋅ Bogdan Gaza ⋅ Ari S Morcos ⋅ Matthew L Leavitt ⋅ Pratyush Maini
Training-Free versus Training-Based Intent Classification in LLMs: Accuracy, Robustness, and Failure Modes
Nan Chen ⋅ Zhouhao Yang ⋅ Soufiane Hayou
Inference-Time Scaling of Diffusion Language Models via Trajectory Refinement
Meihua Dang ⋅ Jiaqi Han ⋅ Minkai Xu ⋅ Kai Xu ⋅ Akash Srivastava ⋅ Stefano Ermon
Shorter, but Still Trustworthy? An Empirical Study of Chain-of-Thought Compression
Lingjie Zeng ⋅ Xiaofan Chen ⋅ Yanbo Wang ⋅ Xiuying Chen
InfMem: Learning System-2 Memory Control for Long-Context Agent
Xinyu Wang ⋅ 明泽 李 ⋅ Peng Lu ⋅ Xiao-Wen Chang ⋅ Lifeng Shang ⋅ Jinpeng Li ⋅ Fei Mi ⋅ Prasanna Parthasarathi ⋅ Yufei Cui
Measuring Pragmatic Influence in LLM Instructions
Yilin Geng ⋅ Omri Abend ⋅ Eduard Hovy ⋅ Lea Frermann
RepliCan: Evaluating LLM Agents on Scientific Reproducibility in Computational Materials Science
Ziyang Huang ⋅ Yi Cao ⋅ Ali K Shargh ⋅ Jing Luo ⋅ Ruidong Mei ⋅ Mohd Zaki ⋅ Zhan Liu ⋅ Wyatt Bunstine ⋅ William Jurayj ⋅ Somdatta Goswami ⋅ Tyrel McQueen ⋅ Michael Shields ⋅ Jaafar El-Awady ⋅ Paulette Clancy ⋅ William Walden ⋅ Nicholas Andrews ⋅ Benjamin Van Durme ⋅ Daniel Khashabi
Agent Q-Mix: Selecting the Right Action for LLM Multi-Agent Systems through Reinforcement Learning
Eric H Jiang ⋅ Levina Li ⋅ Rui Sun ⋅ Xiao Liang ⋅ Yubei Li ⋅ Yuchen Wu ⋅ Haozheng Luo ⋅ Hengli Li ⋅ Zhi Zhang ⋅ Zhaolu Kang ⋅ Kai-Wei Chang ⋅ Ying Nian Wu
Multimodal Language Models Cannot Spot Spatial Inconsistencies
Om Khangaonkar ⋅ Hadi J Rad ⋅ Hamed Pirsiavash
When Correct Patches Become Vulnerable: Red Teaming LLM-Based Program Repair Agents
Simin Chen ⋅ Yixin He ⋅ Suman Jana ⋅ Baishakhi Ray
RetroAgent: Agentic Retrosynthesis Planning with Search Over Structured Memory
Yanqiao Zhu ⋅ Jingru Gan ⋅ Xiaoqi Sun ⋅ Fang Sun ⋅ Yidan Shi ⋅ Md Mofijul Islam ⋅ Chao Shang ⋅ Wenhao Gao ⋅ Connor W Coley ⋅ Yizhou Sun ⋅ Wei Wang
LLM knowledge is brittle: Truthfulness representations rely on superficial resemblance
Patrick Haller ⋅ Mark Ibrahim ⋅ Polina Kirichenko ⋅ Levent Sagun ⋅ Samuel J Bell
Lang-Prune: Unlocking Fair and Powerful Pruning for Multilingual Large Language Models
Juhao Liang ⋅ Shiqi Zhang ⋅ Min Zhang ⋅ Hao Yang ⋅ Benyou Wang
Estimating near-verbatim extraction risk in language models with decoding-constrained beam search
A. Feder Cooper ⋅ Mark Lemley ⋅ Christopher De Sa ⋅ Lea Duesterwald ⋅ Allison Casasola ⋅ Jamie Hayes ⋅ Katherine Lee ⋅ Daniel Ho ⋅ Percy Liang
Direct Multi-Token Decoding
Xuan Luo ⋅ Weizhi Wang ⋅ Xifeng Yan
Personalized RewardBench: Evaluating Reward Models with Human Aligned Personalization
Qiyao Ma ⋅ Dechen Gao ⋅ Rui Cai ⋅ BOQI ZHAO ⋅ Hanchu Zhou ⋅ Junshan Zhang ⋅ Zhe Zhao
Detecting Safety Violations Across Many Agent Traces
Adam Stein ⋅ Davis Brown ⋅ Hamed Hassani ⋅ Mayur Naik ⋅ Eric Wong
Covariance-Aware Transformers for Quadratic Programming and Decision Making
Kutay Tire ⋅ Yufan Zhang ⋅ Ege Onur Taga ⋅ Samet Oymak
Batch-wise Adaptive Pruning: Periodic Neuron Activation-Aware Weight Pruning for Language Reasoning Model
Yongmin Kim ⋅ Shota Takashiro ⋅ Yusuke Iwasawa ⋅ Takeshi Kojima ⋅ Yutaka Matsuo
Statistically-Lossless Quantization of Large Language Models
Michael A. Helcig ⋅ Eldar Kurtic ⋅ Dan Alistarh
When Safety Fails Before the Answer: Benchmarking Harmful Behavior Detection in Reasoning Chains
Ishita Kakkar ⋅ Enze Zhang ⋅ Rheeya Uppaal ⋅ Junjie Hu
OSCAR : Orchestrated Self-verification and Cross-path Refinement
Yash Shah ⋅ Abhijit Chakraborty ⋅ Naresh Kumar Devulapally ⋅ Vishnu S Lokhande ⋅ Vivek Gupta
SynthDocBench: Controlled Benchmark for Long-Context Visual Document Understanding
Abhigya Verma ⋅ Khyati Mahajan ⋅ Amit Kumar Saha ⋅ Shruthan Radhakrishna ⋅ Sagar Davasam ⋅ Vikas Yadav ⋅ Sai Rajeswar Mudumba