正如各位所知,我长期维护着一份自己(想)阅读和引用的研究论文清单。

大约六个月前,我分享了我的2024年清单,许多读者觉得很有用。因此,我考虑再做一次。不过,这次我采纳了那个反复出现的反馈意见:“能否按主题而非日期来组织论文?”

此外,随着LLM研究持续快速发布,我决定将清单改为每半年更新一次。这样,清单既能保持可读性、时效性,也希望能为寻找优质暑期阅读材料的读者提供帮助。

请注意,这目前只是一份精选清单。在未来的文章中,我计划重新审视并讨论其中一些更有趣或更具影响力的论文,并以专题形式进行更深入的探讨。敬请期待!

今年,我的清单中推理模型的内容非常多。因此,我决定将其细分为三个类别:训练、推理时扩展,以及更通用的理解与评估。

本小节聚焦于专门用于提升LLM推理能力的训练策略。你可能已经注意到,近期的大部分进展都集中在(基于可验证奖励的)强化学习上,我在之前的一篇文章中对此进行了更详细的介绍。

本列表的这一部分涵盖了在测试时动态改进推理的方法,无需重新训练。这些论文通常侧重于在计算性能与模型性能之间进行权衡。