正如各位所知,我长期维护着一份自己(想)阅读和引用的研究论文清单。
大约六个月前,我分享了我的2024年清单,许多读者觉得很有用。因此,我考虑再做一次。不过,这次我采纳了那个反复出现的反馈意见:“能否按主题而非日期来组织论文?”
此外,随着LLM研究持续快速发布,我决定将清单改为每半年更新一次。这样,清单既能保持可读性、时效性,也希望能为寻找优质暑期阅读材料的读者提供帮助。
请注意,这目前只是一份精选清单。在未来的文章中,我计划重新审视并讨论其中一些更有趣或更具影响力的论文,并以专题形式进行更深入的探讨。敬请期待!
今年,我的清单中推理模型的内容非常多。因此,我决定将其细分为三个类别:训练、推理时扩展,以及更通用的理解与评估。
本小节聚焦于专门用于提升LLM推理能力的训练策略。你可能已经注意到,近期的大部分进展都集中在(基于可验证奖励的)强化学习上,我在之前的一篇文章中对此进行了更详细的介绍。
-
1月8日,Towards System 2 Reasoning in LLMs: Learning How to Think With Meta Chain-of-Thought,https://arxiv.org/abs/2501.04682
-
1月13日,The Lessons of Developing Process Reward Models in Mathematical Reasoning,https://arxiv.org/abs/2501.07301
-
1月16日,Towards Large Reasoning Models: A Survey of Reinforced Reasoning with Large Language Models,https://arxiv.org/abs/2501.09686
-
1月20日,Reasoning Language Models: A Blueprint,https://arxiv.org/abs/2501.11223
-
1月22日,Kimi k1.5: Scaling Reinforcement Learning with LLMs,https://arxiv.org/abs//2501.12599
-
1月22日,DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning,https://arxiv.org/abs/2501.12948
-
2月3日,Competitive Programming with Large Reasoning Models,https://arxiv.org/abs/2502.06807
-
2月5日,Demystifying Long Chain-of-Thought Reasoning in LLMs,https://arxiv.org/abs/2502.03373
-
2月5日,LIMO: Less is More for Reasoning,https://arxiv.org/abs/2502.03387
-
2月5日,Teaching Language Models to Critique via Reinforcement Learning,https://arxiv.org/abs/2502.03492
-
2月6日,Training Language Models to Reason Efficiently,https://arxiv.org/abs/2502.04463
-
2月10日,Exploring the Limit of Outcome Reward for Learning Mathematical Reasoning,https://arxiv.org/abs/2502.06781
-
2月10日,On the Emergence of Thinking in LLMs I: Searching for the Right Intuition,https://arxiv.org/abs/2502.06773
-
2月11日,LLMs Can Easily Learn to Reason from Demonstrations Structure, not content, is what matters!,https://arxiv.org/abs/2502.07374
-
2月12日,Fino1: On the Transferability of Reasoning Enhanced LLMs to Finance,https://arxiv.org/abs/2502.08127
-
2月13日,Adapting Language-Specific LLMs to a Reasoning Model in One Day via Model Merging - An Open Recipe,https://arxiv.org/abs/2502.09056
-
2月20日,Logic-RL: Unleashing LLM Reasoning with Rule-Based Reinforcement Learning,https://arxiv.org/abs/2502.14768
-
2月25日,SWE-RL: Advancing LLM Reasoning via Reinforcement Learning on Open Software Evolution,https://arxiv.org/abs/2502.18449
-
3月4日,Learning from Failures in Multi-Attempt Reinforcement Learning,https://arxiv.org/abs/2503.04808
-
3月4日,The First Few Tokens Are All You Need: An Efficient and Effective Unsupervised Prefix Fine-Tuning Method for Reasoning Models,https://arxiv.org/abs/2503.02875
-
3月10日,R1-Searcher:通过强化学习激励大语言模型的搜索能力,https://arxiv.org/abs/2503.05592
-
3月10日,LMM-R1:通过两阶段基于规则的强化学习赋予3B多模态大模型强大推理能力,https://arxiv.org/abs/2503.07536
-
3月12日,Search-R1:训练大语言模型通过强化学习进行推理并利用搜索引擎,https://arxiv.org/abs/2503.09516
-
3月16日,迈向分层多步奖励模型以增强大语言模型的推理能力,https://arxiv.org/abs/2503.13551
-
3月20日,小型大语言模型中的推理强化学习:有效与无效的方法,https://arxiv.org/abs/2503.16219
-
3月25日,ReSearch:通过强化学习学习为大语言模型进行搜索推理,https://arxiv.org/abs/2503.19470
-
3月26日,理解类R1-Zero训练:一个批判性视角,https://arxiv.org/abs/2503.20783
-
3月30日,RARE:检索增强推理建模,https://arxiv.org/abs/2503.23513
-
3月31日,Open-Reasoner-Zero:一种在基础模型上扩展强化学习的开源方法,https://arxiv.org/abs/2503.24290
-
3月31日,JudgeLRM:大型推理模型作为评判者,https://arxiv.org/abs/2504.00050
-
4月7日,通过强化学习实现简洁推理,https://arxiv.org/abs/2504.05185
-
4月10日,VL-Rethinker:通过强化学习激励视觉语言模型的自我反思,https://arxiv.org/abs/2504.08837
-
4月11日,Genius:一种可泛化且完全无监督的自我训练框架,用于高级推理,https://arxiv.org/abs/2504.08672
-
4月13日,利用推理模型答案增强非推理模型能力,https://arxiv.org/abs/2504.09639
-
4月21日,在离策略指导下学习推理,https://arxiv.org/abs/2504.14945
-
4月22日,Tina:通过LoRA实现的微型推理模型,https://arxiv.org/abs/2504.15777
-
4月29日,基于单一训练示例的大语言模型推理强化学习,https://arxiv.org/abs/2504.20571
-
4月30日,Phi-4-Mini-Reasoning:探索小型推理语言模型在数学中的极限,https://arxiv.org/abs/2504.21233
-
5月2日,Llama-Nemotron:高效推理模型,https://arxiv.org/abs/2505.00949
-
5月5日,RM-R1:将奖励建模视为推理,https://arxiv.org/abs/2505.02387
-
5月6日,Absolute Zero:基于零数据的强化自对弈推理,https://arxiv.org/abs/2505.03335
-
5月12日,INTELLECT-2:通过全球去中心化强化学习训练的推理模型,https://arxiv.org/abs/2505.07291
-
5月12日,MiMo:释放语言模型的推理潜力——从预训练到后训练,https://arxiv.org/abs/2505.07608
-
5月14日,Qwen3技术报告,https://arxiv.org/abs/2505.09388
-
5月15日,超越“啊哈!”:迈向大型推理模型的系统性元能力对齐,https://arxiv.org/abs/2505.10554
-
5月19日,AdaptThink:推理模型可以学习何时思考,https://arxiv.org/abs/2505.13417
-
5月19日,Thinkless:大语言模型学习何时思考,https://arxiv.org/abs/2505.13379
-
5月20日,General-Reasoner:推动大语言模型在所有领域的推理能力,https://arxiv.org/abs/2505.14652
-
5月21日,通过思维混合学习逻辑推理,https://arxiv.org/abs/2505.15817
-
5月21日,RL Tango:共同强化生成器和验证器以进行语言推理,https://arxiv.org/abs/2505.15034
-
5月23日,QwenLong-L1:通过强化学习迈向长上下文大型推理模型,https://www.arxiv.org/abs/2505.17667
-
5月26日,Enigmata:利用合成可验证谜题扩展大语言模型的逻辑推理能力,https://arxiv.org/abs/2505.19914
-
5月26日,无需外部奖励学习推理,https://arxiv.org/abs/2505.19590
-
5月29日,达尔文·哥德尔机:自我改进智能体的开放式进化,https://arxiv.org/abs/2505.22954
-
5月30日,反思、重试、奖励:通过强化学习实现大语言模型的自我改进,https://arxiv.org/abs/2505.24726
-
5月30日,ProRL:延长强化学习扩展大语言模型的推理边界,https://arxiv.org/abs/2505.24864
-
6月2日,超越80/20法则:高熵少数令牌驱动大语言模型推理的有效强化学习,https://arxiv.org/abs/2506.01939
-
6月3日,奖励不寻常:将GRPO提升至分布锐化之上,https://www.arxiv.org/abs/2506.02355
-
6月9日,强化预训练,https://arxiv.org/abs/2506.08007
-
6月10日,RuleReasoner:通过领域感知动态采样实现强化规则推理,https://arxiv.org/abs/2506.08672
-
6月10日,测试时扩展的强化学习教师模型,https://www.arxiv.org/abs/2506.08388
-
6月12日,Magistral,https://arxiv.org/abs/2506.10910
-
6月12日,虚假奖励:重新思考RLVR中的训练信号,https://arxiv.org/abs/2506.10947
-
6月16日,AlphaEvolve:面向科学与算法发现的编码智能体,https://arxiv.org/abs/2506.13131
-
6月17日,基于可验证奖励的强化学习隐式激励基础大语言模型的正确推理,https://arxiv.org/abs/2506.14245
-
6月23日,反向传播编程:大语言模型在代码训练中习得可复用算法抽象,https://arxiv.org/abs/2506.18777
-
6月26日,连接大语言模型的离线与在线强化学习,https://arxiv.org/abs/2506.21495
本列表的这一部分涵盖了在测试时动态改进推理的方法,无需重新训练。这些论文通常侧重于在计算性能与模型性能之间进行权衡。