- Coupled Variational Reinforcement Learning for Language Model General Reasoning
Paper Code
Xueru Wen, Jie Lou, Yanjiang Liu, Hongyu Lin, Ben He, Xianpei Han, Le Sun, Yaojie Lu, Debing Zhang.
ICML 2026.
- Decoupling Reasoning and Confidence: Resurrecting Calibration in Reinforcement Learning from Verifiable Rewards
Paper
Zhengzhao Ma, Xueru Wen, Boxi Cao, Yaojie Lu, Hongyu Lin, Jinglin Yang, Min He, Xianpei Han, Le Sun.
ICML 2026.
- Learning from Failures: Correction-Oriented Policy Optimization with Verifiable Rewards
Paper
Mengjie Ren, Jie Lou, Boxi Cao, Xueru Wen, Hongyu Lin, Xianpei Han, Le Sun, Xing Yu, Yaojie Lu.
COLM 2026.
- Rethinking Reward Model Evaluation: Are We Barking up the Wrong Tree?
Paper
Xueru Wen, Jie Lou, Yaojie Lu, Hongyu Lin, Xing Yu, Xinyu Lu, Ben He, Xianpei Han, Debing Zhang, Le Sun.
ICLR 2025 Spotlight
- Cheems: A Practical Guidance for Building and Evaluating Chinese Reward Models from Scratch
Paper Code
Xueru Wen, Jie Lou, Zichao Li, Yaojie Lu, Xing Yu, Yuqiu Ji, Guohai Xu, Hongyu Lin, Ben He, Xianpei Han, Le Sun, Debing Zhang.
ACL 2025.
- On-Policy Self-Alignment with Fine-grained Knowledge Feedback for Hallucination Mitigation
Paper
Xueru Wen, Jie Lou, Xinyu Lu, Yuqiu Ji, Xinyan Guan, Yaojie Lu, Hongyu Lin, Ben He, Xianpei Han, Debing Zhang, Le Sun.
ACL 2025.
- Transferable Post-training via Inverse Value Learning
Paper
Xinyu Lu, Xueru Wen, Yaojie Lu, Bowen Yu, Hongyu Lin, Haiyang Yu, Le Sun, Xianpei Han, Yongbin Li.
NAACL 2025.
- AutoAlign: Get Your LLM Aligned with Minimal Annotations
Paper
Xinyu Lu, Dong Xu, Chunkang Zhang, Xinyan Guan, Junxiang Wang, Qingyu Zhang, Pengbo Wang, Yingzhi Mao, Hao Xiang, Xueru Wen, Zichao Li, Yaojie Lu, Hongyu Lin, Le Sun, Xianpei Han.
ACL 2025.
- Critic-CoT: Boosting the Reasoning Abilities of Large Language Model via Chain-of-Thought Critic
Paper
Xin Zheng, Jie Lou, Boxi Cao, Xueru Wen, Yuqiu Ji, Hongyu Lin, Yaojie Lu, Xianpei Han, Debing Zhang, Le Sun.
ACL 2025.
- The Devil Is in the Details: Tackling Unimodal Spurious Correlations for Generalizable Multimodal Reward Models
Paper Code
Zichao Li, Xueru Wen, Jie Lou, Yuqiu Ji, Yaojie Lu, Xianpei Han, Debing Zhang, Le Sun.
ICML 2025.
- Offline Pseudo Relevance Feedback for Efficient and Effective Single-Pass Dense Retrieval
Paper
Xueru Wen, Xiaoyang Chen, Xuanang Chen, Ben He, Le Sun.
SIGIR 2023.
- End-to-End Entity Detection with Proposer and Regressor
Paper
Xueru Wen, Changjiang Zhou, Haotian Tang, Luguang Liang, Hong Qi, Yu Jiang.
Neural Processing Letters 2023.
- Type-supervised Sequence Labeling Based on the Heterogeneous Star Graph for Named Entity Recognition
Paper
Xueru Wen, Changjiang Zhou, Haotian Tang, Luguang Liang, Yu Jiang, Hong Qi.
arXiv, 2022.