Junhao Ruan, Yuan Ge, Bei Li, Yongjing Yin, Yuchun Fan, Xin Chen, Jingang Wang, Chenglong Wang, Jingbo Zhu and Tong Xiao. ToFu: A White-Box, Token-Efficient Agent Harness for Researchers. arXiv preprint arXiv:2607.11423. 2026.
Zhengyu Chen, Yudong Wang, Teng Xiao, Ruochen Zhou, Xuesheng Yang, Wei Wang, Zhifang Sui and Jingang Wang. From Mathematical Reasoning to Code: Generalization of Process Reward Models in Test-Time Scaling. AAAI 2026.
Deyang Kong, Qi Guo, Xiangyu Xi, Wei Wang, Jingang Wang, Xunliang Cai, Shikun Zhang and Wei Ye. Rethinking the Sampling Criteria in Reinforcement Learning for LLM Reasoning: A Competence-Difficulty Alignment Perspective. AAAI 2026.
Siqi Wang, Zhengyu Chen, Teng Xiao, Zheqi Lv, Jinluan Yang, Xunliang Cai, Jingang Wang and Xiaomeng Li. Scaling and Transferability of Annealing Strategies in Large Language Model Training. AAAI 2026.
Tianyuan Shi, Canbin Huang, Bei Li, Xin Chen, Xiaojun Quan, Jingang Wang and Qifan Wang. Beyond Trajectory Imitation: Strategy-Guided Policy Optimization for LLM Reasoning. arXiv preprint arXiv:2606.24064. 2026.
Zihao Wei, Wenjie Shi, Liang Pang, Jingcheng Deng, Shicheng Xu, Shasha Guo, Zenghao Duan, Jiahao Liu, Jingang Wang, Huawei Shen and Xueqi Cheng. Dynamic Rollout Editing for Reducing Overthinking in RL-Trained Reasoning Models. arXiv preprint arXiv:2606.17890. 2026.
Juncheng Diao, Zhicong Lu, Peiguang Li, Yongwei Zhou, Changyuan Tian, Qingbin Li, Rongxiang Weng, Jingang Wang and Xunliang Cai. HIPIF: Hierarchical Planning and Information Folding for Long-Horizon LLM Agent Learning. arXiv preprint arXiv:2606.10507. 2026.
Canbin Huang, Tianyuan Shi, Xiaojun Quan, Jingang Wang, Jianfei Zhang and Qifan Wang. When Model Merging Breaks Routing: Training-Free Calibration for MoE. arXiv preprint arXiv:2606.03391. 2026.
Han Li, Xinyu Peng, Yaoming Wang, Zelin Peng, Xin Chen, Rongxiang Weng, Jingang Wang, Xunliang Cai, Wenrui Dai and Hongkai Xiong. OneCAT: Decoder-Only Auto-Regressive Model for Unified Understanding and Generation. CVPR 2026.
Deli Huang, Cunguang Wang, Hongyin Tang, Zhe Tang, Linsen Guo, Dongyu Ru, Ruoshi Yuan, Ziyue Zhu, Xiaoyu Li, Ziwen Wang, Chen Zhang, Anchun Gui, Jingang Wang and others. ATLAS: All-round Testing of Long-context Abilities across Scales. arXiv preprint arXiv:2605.28079. 2026.
Yuchun Fan, Bei Li, Peiguang Li, Yilin Wang, Yongyu Mu, Jian Yang, Xin Chen, Rongxiang Weng, Jingang Wang, Xunliang Cai, Jingbo Zhu and Tong Xiao. LANG: Reinforcement Learning for Multilingual Reasoning with Language-Adaptive Hint Guidance. ACL 2026.
Junhao Ruan, Abudukeyumu Abudula, Bei Li, Yongjing Yin, Xinyu Liu, Kechen Jiao, Xin Chen, Jingang Wang, Xunliang Cai, Tong Xiao and Jingbo Zhu. MTR-Suite: A Framework for Evaluating and Synthesizing Conversational Retrieval Benchmarks. ACL 2026.
Xuemiao Zhang, Can Ren, Chengying Tu, Rongxiang Weng, Hongfei Yan, Jingang Wang and Xunliang Cai. LinkQA: Synthesizing Diverse QA from Multiple Seeds Strongly Linked by Knowledge Points. ACL 2026.
Xuemiao Zhang, Chengying Tu, Can Ren, Rongxiang Weng, Hongfei Yan, Jingang Wang and Xunliang Cai. Large-Scale Diverse Synthesis for Mid-Training. Findings of ACL 2026.
Yang Bai, Kaiyuan Liu, Ziyuan Zhuang, Jiahong Zhou, Rongxiang Weng, Xin Chen, Jingang Wang and Xunliang Cai. Multi-Objective and Mixed-Reward Reinforcement Learning via Reward-Decorrelated Policy Optimization. arXiv preprint arXiv:2605.13641. 2026.
Xinyu Liu, Kechen Jiao, Chunyang Xiao, Runsong Zhao, Junhao Ruan, Bei Li, Jiahao Liu, Qifan Wang, Xin Chen, Jingang Wang, Chenglong Wang, Tong Xiao and Jingbo Zhu. Teacher-Guided Policy Optimization for On-Policy Reasoning Distillation under Large Policy Divergence. arXiv preprint arXiv:2605.13230. 2026.
Wanli Yang, Hongyu Zang, Junwei Zhang, Wenjie Shi, Du Su, Jingang Wang, Xueqi Cheng and Fei Sun. Beyond Reasoning: Reinforcement Learning Unlocks Parametric Knowledge in LLMs. arXiv preprint arXiv:2605.07153. 2026.
Jianing Wang, Jianfei Zhang, Qi Guo, Linsen Guo, Rumei Li, Chao Zhang, Chong Peng, Cunguang Wang, Dengchang Zhao, Jiarong Shi, Jingang Wang and others. LongCat-Flash-Prover: Advancing Native Formal Reasoning via Agentic Tool-Integrated Reinforcement Learning. arXiv preprint arXiv:2603.21065. 2026.
Qi Guo, Jianing Wang, Deyang Kong, Xiangyu Xi, Jianfei Zhang, Yi Lu, Jingang Wang, Wei Wang, Shikun Zhang and Wei Ye. OPE: Overcoming Information Saturation in Parallel Thinking via Outline-Guided Path Exploration. arXiv preprint arXiv:2602.08344. 2026.
Chao Wang, Bei Li, Jiaqi Zhang, Xinyu Liu, Yuchun Fan, Linkun Lyu, Xin Chen, Jingang Wang, Tong Xiao, Peng Pei and Xunliang Cai. SpanNorm: Reconciling Training Stability and Performance in Deep Transformers. arXiv preprint arXiv:2601.22580. 2026.
Junhao Ruan, Bei Li, Yongjing Yin, Pengcheng Huang, Xin Chen, Jingang Wang, Xunliang Cai, Tong Xiao and Jingbo Zhu. Causal Autoregressive Diffusion Language Model. arXiv preprint arXiv:2601.22031. 2026.
Shiyu Liu, Yongjing Yin, Jianhao Yan, Yunbo Tang, Qinggang Zhang, Bei Li, Xin Chen, Jingang Wang, Xunliang Cai and Jinsong Su. BAPO: Boundary-Aware Policy Optimization for Reliable Agentic Search. Findings of ACL 2026.
Zhihao Xu, Rumei Li, Jiahuan Li, Rongxiang Weng, Jingang Wang, Xunliang Cai and Xiting Wang. Unlocking Implicit Experience: Synthesizing Tool-Use Trajectories from Text. ACL 2026.
Hexiang Tan, Wanli Yang, Junwei Zhang, Xin Chen, Rui Tang, Du Su, Jingang Wang, Yuanzhuo Wang, Fei Sun and Xueqi Cheng. BaseCal: Unsupervised Confidence Calibration via Base Model Signals. ACL 2026.
Team, Meituan LongCat, Gui Anchun, Li Bei, Tao Bingyang, Zhou Bole, Chen Borun, Zhang Chao, Gao Chen, Zhang Chen, Han Chengcheng, Jingang Wang and others. LongCat-Flash-Thinking-2601 Technical Report. arXiv preprint arXiv:2601.16725. 2026.
Shihan Dou, Haoxiang Jia, Shenxi Wu, Huiyuan Zheng, Muling Wu, Yunbo Tao, Ming Zhang, Mingxu Chai, Jessica Fan, Zhiheng Xi, Jingang Wang and others. What is wrong with your code generated by large language models? An extensive study. Science China Information Sciences 69(1):112107. 2026.