2024年对AI研究来说是充满变数与激动人心的一年,尤其对于关注LLM(大语言模型)的人来说更是如此。
我原本为这期12月刊制定了宏大计划,打算发表一篇新文章,全面回顾2024年的研究亮点。我依然有这个打算,但由于意外事故导致严重受伤,目前我无法在电脑前工作,也无法完成初稿。但我希望在未来几周内康复,尽快恢复工作状态。
与此同时,我想分享我在2024年偶然发现的大量有趣论文(主要与LLM相关)的收藏书签列表。这只是一个列表,但或许能为那些想在假期寻找一些值得一读的佳作的人提供帮助。
如果你对更侧重代码的阅读和实践感兴趣,我的《从零开始构建大语言模型》一书已于上月在亚马逊上架。
此外,我还在GitHub仓库中添加了大量额外资料。
感谢大家的理解与支持,我希望能尽快完全康复,并在几周后带着《2024年研究亮点》文章回归!
-
1月1日,《Astraios:参数高效指令调优代码大语言模型》,https://arxiv.org/abs/2401.00788
-
1月2日,《大语言模型知识编辑综合研究》,https://arxiv.org/abs/2401.01286
-
1月2日,《LLM或许就是LongLM:无需调优即可自扩展LLM上下文窗口》,https://arxiv.org/abs/2401.01325
-
1月2日,《自我博弈微调将弱语言模型转化为强语言模型》,https://arxiv.org/abs/2401.01335
-
1月2日,《LLaMA超越英语:语言能力迁移的实证研究》,https://arxiv.org/abs/2401.01055
-
1月3日,《对齐算法的机制理解:以DPO与毒性为例的案例研究》,https://arxiv.org/abs/2401.01967
-
1月4日,《LLaMA Pro:通过块扩展实现渐进式LLaMA》,https://arxiv.org/abs/2401.02415
-
1月4日,《LLM增强LLM:通过组合扩展能力》,https://arxiv.org/abs/2401.02412
-
1月4日,《混合即一切:万亿参数LLM的更廉价、更优替代方案》,https://arxiv.org/abs/2401.02994
-
1月5日,《DeepSeek LLM:以长期主义扩展开源语言模型》,https://arxiv.org/abs/2401.02954
-
1月5日,《去噪视觉Transformer》,https://arxiv.org/abs/2401.02957
-
1月7日,《从4K飞跃至400K:利用激活信标扩展LLM上下文》,https://arxiv.org/abs/2401.03462
-
1月8日,《专家混合模型Mixtral》,https://arxiv.org/abs/2401.04088
-
1月8日,《MoE-Mamba:结合专家混合的高效选择性状态空间模型》,https://arxiv.org/abs/2401.04081
-
1月8日,《基于人类反馈的强化学习的极小极大方法》,https://arxiv.org/abs/2401.04056
-
1月9日,《RoSA:通过鲁棒自适应实现精确参数高效微调》,https://arxiv.org/abs/2401.04679
-
1月10日,《潜伏代理:训练能通过安全训练的欺骗性LLM》,https://arxiv.org/abs/2401.05566
-
1月11日,《Transformer是多状态RNN》,https://arxiv.org/abs/2401.06104
-
1月11日,《类别不平衡下AUROC与AUPRC的深入审视》,https://arxiv.org/abs/2401.06091
-
1月12日,《面向大语言模型标签高效监督微调的实验设计框架》,https://arxiv.org/abs/2401.06692
-
1月16日,《通过代理调优语言模型》,https://arxiv.org/abs/2401.08565
-
1月16日,《大规模自回归图像模型的可扩展预训练》,https://arxiv.org/abs/2401.08541
-
1月16日,《使用AlphaCodium进行代码生成:从提示工程到流程工程》,https://arxiv.org/abs/2401.08500
-
1月16日,RAG vs 微调:流程、权衡及农业案例研究,https://arxiv.org/abs/2401.08406
-
1月17日,ReFT:基于强化微调的推理,https://arxiv.org/abs/2401.08967
-
1月18日,DiffusionGPT:LLM驱动的文本到图像生成系统,https://arxiv.org/abs/2401.10061
-
1月18日,自我奖励语言模型,https://arxiv.org/abs/2401.10020
-
1月18日,VMamba:视觉状态空间模型,https://arxiv.org/abs/2401.10166
-
1月19日,大型语言模型的知识融合,https://arxiv.org/abs/2401.10491
-
1月22日,SpatialVLM:赋予视觉语言模型空间推理能力,https://arxiv.org/abs/2401.12168
-
1月22日,WARM:论权重平均奖励模型的优势,https://arxiv.org/abs/2401.12187
-
1月22日,用双筒望远镜识别LLM:机器生成文本的零样本检测,https://arxiv.org/abs/2401.12070
-
1月24日,MambaByte:无令牌选择性状态空间模型,https://arxiv.org/abs/2401.13660
-
1月24日,SpacTor-T5:使用跨度破坏和替换令牌检测预训练T5模型,https://arxiv.org/abs/2401.13160
-
1月25日,重新思考掩码自编码器中的补丁依赖性,https://arxiv.org/abs/2401.14391
-
1月25日,Pix2gestalt:通过合成整体进行非模态分割,https://arxiv.org/abs/2401.14398
-
1月25日,多模态路径:利用其他模态的无关数据改进Transformer,https://arxiv.org/abs/2401.14405
-
1月26日,EAGLE:推测性采样需要重新思考特征不确定性,https://arxiv.org/abs/2401.15077
-
1月29日,MoE-LLaVA:面向大型视觉语言模型的专家混合,https://arxiv.org/abs/2401.15947
-
1月29日,重述网络:一种计算和数据高效的语言建模方法,https://arxiv.org/abs/2401.16380
-
1月31日,KVQuant:通过KV缓存量化实现千万上下文长度的LLM推理,https://arxiv.org/abs/2401.18079
-
2月1日,面向LLM的高效探索,https://arxiv.org/abs/2402.00396
-
2月1日,OLMo:加速语言模型科学,https://arxiv.org/abs/2402.00838
-
2月1日,小巨人:较小的大型语言模型在真实世界的会议摘要任务中能否超常发挥?,https://arxiv.org/abs/2402.00841
-
2月1日,跟我重复:Transformer在复制任务上优于状态空间模型,https://arxiv.org/abs/2402.01032
-
2月2日,LiPO:通过排序学习实现列表级偏好优化,https://arxiv.org/abs/2402.01878
-
2月2日,FindingEmo:野外情感识别图像数据集,https://arxiv.org/abs/2402.01355
-
2月3日,更多智能体就是你所需的一切,https://arxiv.org/abs/2402.05120
-
2月5日,DeepSeekMath:推动开放语言模型中数学推理的极限,https://arxiv.org/abs/2402.03300
-
2月6日,MobileVLM V2:更快更强的视觉语言模型基线,https://arxiv.org/abs/2402.03766
-
2月6日,点积注意力可解模型中位置学习与语义学习之间的相变,https://arxiv.org/abs/2402.03902
-
2月6日,大型语言模型下游任务性能的缩放定律,https://arxiv.org/abs/2402.04177
-
2月6日,MOMENT:一系列开放时间序列基础模型,https://arxiv.org/abs/2402.03885
-
2月6日,视觉超对齐:视觉基础模型的弱到强泛化,https://arxiv.org/abs/2402.03749
-
2月6日,自我发现:大型语言模型自组合推理结构,https://arxiv.org/abs/2402.03620
-
2月7日,无需搜索的大师级国际象棋,https://arxiv.org/abs/2402.04494
-
2月7日,基于在线AI反馈的直接语言模型对齐,https://arxiv.org/abs/2402.04792
-
2月8日,专家混合中的缓冲区溢出,https://arxiv.org/abs/2402.05526
-
2月9日,神经网络可训练性的边界是分形的,https://arxiv.org/abs/2402.06184
-
2月11日,ODIN:解耦奖励减轻RLHF中的黑客攻击,https://arxiv.org/abs/2402.07319
-
2月12日,使用语言反馈模型进行策略改进,https://arxiv.org/abs/2402.07876
-
2月12日,细粒度专家混合的缩放定律,https://arxiv.org/abs/2402.07871
-
2月12日,Aya模型:一个经过指令微调的开源多语言语言模型,https://arxiv.org/abs/2402.07610
-
2月12日,Step-On-Feet微调:通过自举扩展LLM的自我对齐,https://arxiv.org/abs/2402.07610
-
2月12日,通过直接原则反馈抑制粉红大象,https://arxiv.org/abs/2402.07896
-
2月13日,基于RingAttention的百万长度视频与语言世界模型,https://arxiv.org/abs/2402.08268
-
2月13日,专家混合模型解锁深度强化学习的参数扩展,https://arxiv.org/abs/2402.08609
-
2月14日,DoRA:权重分解的低秩自适应,https://arxiv.org/abs/2402.09353
-
2月14日,Transformer能实现长度泛化,但不够稳健,https://arxiv.org/abs/2402.09371
-
2月15日,BASE TTS:基于10万小时数据构建十亿参数文本转语音模型的经验教训,https://arxiv.org/abs/2402.08093
-
2月15日,恢复生成模型的微调前权重,https://arxiv.org/abs/2402.10208
-
2月15日,生成式表征指令微调,https://arxiv.org/abs/2402.09906
-
2月16日,FinTral:GPT-4级别的多模态金融大语言模型家族,https://arxiv.org/abs/2402.10986
-
2月17日,OneBit:迈向极低比特大语言模型,https://arxiv.org/abs/2402.11295
-
2月18日,LongAgent:通过多智能体协作将语言模型扩展至128k上下文,https://arxiv.org/abs/2402.11550
-
2月19日,重新格式化对齐,https://arxiv.org/abs/2402.12219
-
2月19日,AnyGPT:基于离散序列建模的统一多模态大语言模型,https://arxiv.org/abs/2402.12226
-
2月19日,迈向跨分词器蒸馏:大语言模型的通用对数几率蒸馏损失,https://arxiv.org/abs/2402.12030
-
2月19日,LoRA+:大型模型的高效低秩自适应,https://arxiv.org/abs/2402.12354
-
2月20日,神经网络扩散,https://arxiv.org/abs/2402.13144
-
2月21日,YOLOv9:利用可编程梯度信息学习你想学的内容,https://arxiv.org/abs/2402.13616
-
2月21日,LongRoPE:将大语言模型上下文窗口扩展至超过200万token,https://arxiv.org/abs/2402.13753
-
2月21日,大语言模型用于数据标注:综述,https://arxiv.org/abs/2402.13446
-
2月22日,TinyLLaVA:小型大规模多模态模型框架,https://arxiv.org/abs/2402.14289
-
2月22日,回归基础:重新审视基于人类反馈的REINFORCE风格优化在大语言模型学习中的应用,https://arxiv.org/abs/2402.14740
-
2月23日,Genie:生成式交互环境,https://arxiv.org/abs/2402.15391
-
2月26日,CARTE:表格学习的预训练与迁移,https://arxiv.org/abs/2402.16785
-
2月27日,1比特大语言模型时代:所有大语言模型都在1.58比特,https://arxiv.org/abs/2402.17764
-
2月27日,Sora生成具有惊人几何一致性的视频,https://arxiv.org/abs/2402.17403
-
2月27日,当规模遇上大语言模型微调:数据、模型与微调方法的影响,https://arxiv.org/abs/2402.17193
-
2月29日,Griffin:融合门控线性递归与局部注意力以实现高效语言模型,https://arxiv.org/abs/2402.19427
-
3月1日,在视觉表示学习中学习并利用世界模型,https://arxiv.org/abs/2403.00504
-
3月3日,通过语法增强改进大语言模型代码生成,https://arxiv.org/abs/2403.01632
-
3月3日,Mamba模型的隐藏注意力机制,https://arxiv.org/abs/2403.01590
-
3月4日,无需训练的预训练模型合并,https://arxiv.org/abs/2403.01753
-
3月4日,Vision-RWKV:基于RWKV类架构的高效可扩展视觉感知,https://arxiv.org/abs/2403.02308
-
3月5日,WMDP基准:通过遗忘机制衡量并减少恶意使用,https://arxiv.org/abs/2403.03218
-
3月5日,进化Transformer:上下文中的进化优化,https://arxiv.org/abs/2403.02985
-
3月5日,通过丰富监督增强视觉-语言预训练,https://arxiv.org/abs/2403.03346
-
3月5日,扩展修正流Transformer用于高分辨率图像合成,https://arxiv.org/abs/2403.03206
-
3月5日,Design2Code:我们离自动化前端工程还有多远?,https://arxiv.org/abs/2403.03163
-
3月6日,ShortGPT:大语言模型中的层比你想象的更冗余,https://arxiv.org/abs/2403.03853
-
3月6日,回溯:检索查询的原因,https://arxiv.org/abs/2403.03956
-
3月6日,学习与多个语言模型协作解码,https://arxiv.org/abs/2403.03870
-
3月6日,SaulLM-7B:面向法律领域的开创性大语言模型,https://arxiv.org/abs/2403.03883
-
3月6日,《语言模型是谜题天才吗?算法谜题揭示多模态推理中的严峻挑战》,https://arxiv.org/abs/2403.03864
-
3月6日,《3D扩散策略》,https://arxiv.org/abs/2403.03954
-
3月6日,《MedMamba:用于医学图像分类的视觉Mamba》,https://arxiv.org/abs/2403.03849
-
3月6日,《GaLore:通过梯度低秩投影实现内存高效的LLM训练》,https://arxiv.org/abs/2403.03507
-
3月6日,《停止回归:通过分类训练价值函数以实现可扩展深度强化学习》,https://arxiv.org/abs/2403.03950
-
3月7日,《我们距离智能视觉演绎推理还有多远?》,https://arxiv.org/abs/2403.04732
-
3月7日,《常见的70亿参数语言模型已具备强大的数学能力》,https://arxiv.org/abs/2403.04706
-
3月8日,《Gemini 1.5:解锁跨越数百万Token上下文的多模态理解》,https://arxiv.org/abs/2403.05530
-
3月8日,《嵌入的余弦相似度真的关乎相似性吗?》,https://arxiv.org/abs/2403.05440
-
3月8日,《LLM4Decompile:使用大型语言模型反编译二进制代码》,https://arxiv.org/abs/2403.05286
-
3月9日,《语言模型中的算法进展》,https://arxiv.org/abs/2403.05812
-
3月11日,《窃取生产语言模型的一部分》,https://arxiv.org/abs/2403.06634
-
3月12日,《Chronos:学习时间序列的语言》,https://arxiv.org/abs/2403.07815
-
3月13日,《持续预训练大型语言模型的简单且可扩展策略》,https://arxiv.org/abs/2403.08763
-
3月13日,《语言模型在过度训练和下游任务上可靠地扩展》,https://arxiv.org/abs/2403.08540
-
3月14日,《BurstAttention:针对极长序列的高效分布式注意力框架》,https://arxiv.org/abs/2403.09347
-
3月14日,《LocalMamba:具有窗口化选择性扫描的视觉状态空间模型》,https://arxiv.org/abs/2403.09338
-
3月14日,《GiT:通过通用语言接口迈向通才视觉Transformer》,https://arxiv.org/abs/2403.09394
-
3月14日,《MM1:多模态LLM预训练的方法、分析与见解》,https://arxiv.org/abs/2403.09611
-
3月15日,《RAFT:使语言模型适应特定领域的RAG》,https://arxiv.org/abs/2403.10131
-
3月18日,《TnT-LLM:使用大型语言模型进行大规模文本挖掘》,https://arxiv.org/abs/2403.12173
-
3月18日,《解码压缩信任:审视压缩下高效LLM的可信度》,https://arxiv.org/abs/2403.15447
-
3月19日,《PERL:基于人类反馈的参数高效强化学习》,https://arxiv.org/abs/2403.10704
-
3月20日,《RewardBench:评估语言建模的奖励模型》,https://arxiv.org/abs/2403.13787
-
3月20日,《LlamaFactory:统一高效微调100+语言模型》,https://arxiv.org/abs/2403.13372
-
3月21日,《RakutenAI-7B:为日语扩展大型语言模型》,https://arxiv.org/abs/2403.15484
-
3月22日,《SiMBA:用于视觉和多变量时间序列的简化Mamba架构》,https://arxiv.org/abs/2403.15360
-
3月22日,《大型语言模型能否在上下文中进行探索?》,https://arxiv.org/abs/2403.15371
-
3月22日,《LLM2LLM:通过新颖的迭代数据增强提升LLM》,https://arxiv.org/abs/2403.15042
-
3月25日,《LLM智能体操作系统》,https://arxiv.org/abs/2403.16971
-
3月26日,《更深层的不合理无效性》,https://arxiv.org/abs/2403.17887
-
3月27日,《BioMedLM:基于生物医学文本训练的27亿参数语言模型》,https://arxiv.org/abs/2403.18421
-
3月27日,《ViTAR:支持任意分辨率的视觉Transformer》,https://arxiv.org/abs/2403.18361
-
3月27日,《大型语言模型中的长文本事实性》,https://arxiv.org/abs/2403.18802
-
3月27日,《Mini-Gemini:挖掘多模态视觉语言模型的潜力》,https://arxiv.org/abs/2403.18814
-
3月26日,《LISA:用于内存高效大型语言模型微调的逐层重要性采样》,https://arxiv.org/abs/2403.17919
-
3月26日,《混合架构的机制设计与扩展》,https://arxiv.org/abs/2403.17844
-
3月28日,《MagicLens:基于开放式指令的自监督图像检索》,https://arxiv.org/abs/2403.19651
-
3月28日,《Model Stock:我们只需要几个微调模型》,https://arxiv.org/abs/2403.19522
-
4月1日,《语言模型会为未来Token预先规划吗?》,https://arxiv.org/abs/2404.00859
-
4月1日,《并非越大越好:潜在扩散模型的缩放特性》,https://arxiv.org/abs/2404.01367
-
4月1日,《微妙界限:通过下游能力分析引导大语言模型预训练》,https://arxiv.org/abs/2404.01204
-
4月1日,《Diffusion-RWKV:为扩散模型扩展类RWKV架构》,https://arxiv.org/abs/2404.04478
-
4月2日,《深度混合:在基于Transformer的语言模型中动态分配计算资源》,https://arxiv.org/abs/2404.02258
-
4月2日,《长上下文大语言模型在长上下文学习中表现不佳》,https://arxiv.org/abs/2404.02060
-
4月2日,《小规模生成语言模型中的涌现能力》,https://arxiv.org/abs/2404.02204
-
4月2日,《通过简单自适应攻击突破安全对齐的大语言模型》,https://arxiv.org/abs/2404.02151
-
4月3日,《基于扩散的文本到图像生成的可扩展性研究》,https://arxiv.org/abs/2404.02883
-
4月3日,《BAdam:一种内存高效的大语言模型全参数训练方法》,https://arxiv.org/abs/2404.02827
-
4月3日,《交叉注意力使文本到图像扩散模型的推理变得繁琐》,https://arxiv.org/abs/2404.02747
-
4月4日,《直接纳什优化:教会语言模型根据通用偏好自我改进》,https://arxiv.org/abs/2404.02151
-
4月4日,《在神经压缩文本上训练大语言模型》,https://arxiv.org/abs/2404.03626
-
4月4日,《CantTalkAboutThis:使语言模型在对话中保持话题一致》,https://arxiv.org/abs/2404.03820
-
4月5日,《ReFT:语言模型的表征微调》,https://arxiv.org/abs/2404.03592
-
4月5日,《设计可验证:使语言模型引用预训练数据》,https://arxiv.org/abs/2404.03862
-
4月5日,《Sigma:用于多模态语义分割的孪生Mamba网络》,https://arxiv.org/abs/2404.04256
-
4月8日,《AutoCodeRover:自主程序改进》,https://arxiv.org/abs/2404.05427
-
4月8日,《Eagle and Finch:具有矩阵值状态和动态循环的RWKV》,https://arxiv.org/abs/2404.05892
-
4月8日,《CodecLM:使用定制合成数据对齐语言模型》,https://arxiv.org/abs/2404.05875
-
4月9日,《MiniCPM:通过可扩展训练策略揭示小语言模型的潜力》,https://arxiv.org/abs/2404.06395
-
4月9日,《大象永不遗忘:大语言模型对表格数据的记忆与学习》,https://arxiv.org/abs/2404.06209
-
4月9日,《LLM2Vec:大语言模型是隐藏的强大文本编码器》,https://arxiv.org/abs/2404.05961
-
4月10日,《将LLaMA解码器适配到视觉Transformer》,https://arxiv.org/abs/2404.06773
-
4月10日,《不遗漏任何上下文:使用无限注意力实现高效无限上下文Transformer》,https://arxiv.org/abs/2404.07143
-
4月11日,《LLoCO:离线学习长上下文》,https://arxiv.org/abs/2404.07979
-
4月11日,《JetMoE:以0.1万美元成本达到Llama2性能》,https://arxiv.org/abs/2404.07413
-
4月11日,《语言模型合成数据的最佳实践与经验教训》,https://arxiv.org/abs/2404.07503
-
4月11日,《Rho-1:并非所有Token都是你需要的》,https://arxiv.org/abs/2404.07965
-
4月12日,《用更少Token预训练小型基础语言模型》,https://arxiv.org/abs/2404.08634
-
4月12日,《用于RLHF的数据集重置策略优化》,https://arxiv.org/abs/2404.08495
-
4月13日,《大语言模型的上下文回忆依赖于提示》,https://arxiv.org/abs/2404.08865
-
4月15日,《状态空间模型:Transformer的新一代网络替代方案综述》,https://arxiv.org/abs/2404.09516
-
4月15日,《Chinchilla缩放:一次复制尝试》,https://arxiv.org/abs/2404.10102
-
4月15日,《为真正良好的对齐学习你的参考模型》,https://arxiv.org/abs/2404.09656
-
4月16日,《DPO是否优于PPO用于大语言模型对齐?一项全面研究》,https://arxiv.org/abs/2404.10719
-
4月16日,《缩放(缩小)CLIP:数据、架构和训练策略的全面分析》,https://arxiv.org/abs/2404.08197
-
4月16日,《RAG模型有多忠实?量化RAG与大语言模型内部先验之间的拉锯战》,https://arxiv.org/abs/2404.10198
-
4月17日,《大语言模型的检索增强文本生成综述》,https://arxiv.org/abs/2404.10981
-
4月18日,当LLM不适用时,使用FastFit:快速且有效的多类别文本分类,https://arxiv.org/abs/2404.12365
-
4月18日,通过想象、搜索与批判实现LLM的自我改进,https://arxiv.org/abs/2404.12253
-
4月18日,OpenBezoar:基于指令数据混合训练的小型、经济且开源模型,https://arxiv.org/abs/2404.12195
-
4月19日,指令层级:训练LLM优先处理特权指令,https://arxiv.org/abs/2404.13208
-
4月22日,低位量化LLaMA3模型表现如何?一项实证研究,https://arxiv.org/abs/2404.14047
-
4月22日,Phi-3技术报告:可在手机上本地运行的高性能语言模型,https://arxiv.org/abs/2404.14219
-
4月22日,OpenELM:配备开源训练与推理框架的高效语言模型家族,https://arxiv.org/abs/2404.14619
-
4月22日,大型语言模型自我演化综述,https://arxiv.org/abs/2404.14662
-
4月23日,多头混合专家模型,https://arxiv.org/abs/2404.15045
-
4月23日,NExT:教大型语言模型推理代码执行,https://arxiv.org/abs/2404.14662
-
4月23日,大型语言模型时代的图机器学习,https://arxiv.org/abs/2404.14928
-
4月24日,检索头机制解释长上下文事实性,https://arxiv.org/abs/2404.15574
-
4月25日,层跳过:实现早期退出推理与自推测解码,https://arxiv.org/abs/2404.16710
-
4月25日,让LLM充分利用上下文,https://arxiv.org/abs/2404.16811
-
4月28日,LoRA Land:310个媲美GPT-4的微调LLM技术报告,https://arxiv.org/abs/2405.00732
-
4月30日,通过多令牌预测实现更好更快的大型语言模型,https://arxiv.org/abs/2404.19737
-
4月30日,RAG与RAU:自然语言处理中检索增强语言模型综述,https://arxiv.org/abs/2404.19543
-
4月30日,基于Transformer的语言模型内部工作原理入门,https://arxiv.org/abs/2405.00208
-
4月30日,何时检索:教LLM有效利用信息检索,https://arxiv.org/abs/2404.19705
-
4月30日,KAN:Kolmogorov–Arnold网络,https://arxiv.org/abs/2404.19756
-
5月1日,更大的编辑批次大小总是更好吗?基于Llama-3的模型编辑实证研究,https://arxiv.org/abs/2405.00664
-
5月1日,用于语言模型对齐的自我博弈偏好优化,https://arxiv.org/abs/2405.00675
-
5月1日,大型语言模型在小学数学算术上表现的仔细审视,https://arxiv.org/abs/2405.00332
-
5月2日,Prometheus 2:专用于评估其他语言模型的开源语言模型,https://arxiv.org/abs/2405.01535
-
5月3日,构建视觉语言模型的关键因素是什么?,https://arxiv.org/abs/2405.02246
-
5月5日,Flash Attention稳定吗?,https://arxiv.org/abs/2405.02803
-
5月7日,vAttention:无需PagedAttention的LLM服务动态内存管理,https://arxiv.org/abs/2405.04437
-
5月7日,xLSTM:扩展长短期记忆网络,https://arxiv.org/abs/2405.04517
-
5月8日,仅缓存一次:用于语言模型的解码器-解码器架构,https://arxiv.org/abs/2405.05254
-
5月8日,DeepSeek-V2:强大、经济且高效的混合专家语言模型,https://arxiv.org/abs/2405.04434
-
5月8日,寻找Magikarp:自动检测大型语言模型中训练不足的令牌,https://arxiv.org/abs/2405.05417
-
5月9日,微调LLM新知识会助长幻觉吗?,https://arxiv.org/abs/2405.05904
-
5月10日,用于语言模型对齐与个性化的价值增强采样,https://arxiv.org/abs/2405.06639
-
5月12日,PHUDGE:Phi-3作为可扩展评判者,https://arxiv.org/abs/2405.08029
-
5月13日,RLHF工作流:从奖励建模到在线RLHF,https://arxiv.org/abs/2405.07863
-
5月15日,LoRA学得更少,忘得更少,https://arxiv.org/abs/2405.09673
-
5月15日,Xmodel-VLM:多模态视觉语言模型的简单基线,https://arxiv.org/abs/2405.09215
-
5月16日,Chameleon:混合模态早期融合基础模型,https://arxiv.org/abs/2405.09818
-
5月17日,《迈向模块化LLM:构建与复用LoRA库》,https://arxiv.org/abs/2405.11157
-
5月19日,《SLAB:采用简化线性注意力与渐进式重参数化批归一化的高效Transformer》,https://arxiv.org/abs/2405.11582
-
5月20日,《MoRA:面向参数高效微调的高秩更新》,https://arxiv.org/abs/2405.12130
-
5月22日,《注意力机制即RNN》,https://arxiv.org/abs/2405.13956
-
5月22日,《面向MLLM的密集连接器》,https://arxiv.org/abs/2405.13800
-
5月23日,《AlignGPT:具备自适应对齐能力的多模态大语言模型》,https://arxiv.org/abs/2405.14129
-
5月23日,《SimPO:基于无参考奖励的简单偏好优化》,https://arxiv.org/abs/2405.14734
-
5月23日,《基于指令损失的指令微调》,https://arxiv.org/abs/2405.14394
-
5月24日,《不走寻常路:非传统调度策略》,https://arxiv.org/abs/2405.15682
-
5月26日,《堆叠Transformer:高效LLM预训练中的模型增长深度剖析》,https://arxiv.org/abs/2405.15319
-
5月26日,《gzip预测数据依赖的缩放定律》,https://arxiv.org/abs/2405.16684
-
5月27日,《Trans-LoRA:迈向无数据可迁移的参数高效微调》,https://arxiv.org/abs/2405.17258
-
5月28日,《VeLoRA:基于秩1子令牌投影的显存高效训练》,https://arxiv.org/abs/2405.17991
-
5月28日,《LLaMA-NAS:面向大语言模型的高效神经架构搜索》,https://arxiv.org/abs/2405.18377
-
5月29日,《上下文位置编码:学习计数重要信息》,https://arxiv.org/abs/2405.18719
-
6月2日,《展示而非告知:通过演示反馈对齐语言模型》,https://arxiv.org/abs/2406.00888
-
6月3日,《Skywork-MoE:混合专家语言模型训练技术深度解析》,https://arxiv.org/abs/2406.06563
-
6月3日,《OLoRA:大语言模型的正交低秩自适应》,https://arxiv.org/abs/2406.01775
-
6月3日,《大语言模型中类别与层级概念的几何结构》,https://arxiv.org/abs/2406.01506
-
6月3日,《迈向可扩展的LLM自动对齐:综述》,https://arxiv.org/abs/2406.01252
-
6月4日,《可扩展的无矩阵乘法语言建模》,https://arxiv.org/abs/2406.02528
-
6月4日,《块级Transformer:面向快速推理的全局到局部语言建模》,https://arxiv.org/abs/2406.02657
-
6月6日,《思维缓冲区:基于思维增强的大语言模型推理》,https://arxiv.org/abs/2406.04271
-
6月6日,《提示报告:提示技术的系统性综述》,https://arxiv.org/abs/2406.06608
-
6月6日,《Transformer需要眼镜!语言任务中的信息过度压缩》,https://arxiv.org/abs/2406.04267
-
6月6日,《MMLU已终结?》,https://arxiv.org/abs/2406.04127
-
6月6日,《步骤感知偏好优化:在每一步对齐偏好与去噪性能》,https://arxiv.org/abs/2406.04314
-
6月7日,《利用C4提升大规模并行训练效率:一种通信驱动方法》,https://arxiv.org/abs/2406.04594
-
6月7日,《CRAG——综合RAG基准》,https://arxiv.org/abs/2406.04744
-
6月7日,《WildBench:基于真实用户挑战性任务的LLM基准测试》,https://arxiv.org/abs/2406.04770
-
6月7日,《混合智能体增强大语言模型能力》,https://arxiv.org/abs/2406.04692
-
6月7日,《BERT是生成式上下文学习器》,https://arxiv.org/abs/2406.04823
-
6月7日,《3D-GRAND:面向3D-LLM的百万级数据集,具备更优基础与更少幻觉》,https://arxiv.org/abs/2406.05132
-
6月8日,《创造力已离线:语言模型去偏的代价》,https://arxiv.org/abs/2406.05587
-
6月10日,《自回归模型超越扩散:Llama用于可扩展图像生成》,https://arxiv.org/abs/2406.06525
-
6月10日,《基于边际感知偏好优化的无参考扩散模型对齐》,https://arxiv.org/abs/2406.06424
-
6月10日,《Husky:面向多步推理的统一开源语言智能体》,https://arxiv.org/abs/2406.06469
-
6月10日,《Turbo Sparse:以最少激活参数实现LLM SOTA性能》,https://arxiv.org/abs/2406.05955
-
6月10日,《自调优:通过自教学指导LLM有效获取新知识》,https://arxiv.org/abs/2406.06326
-
6月11日,《一张图像等价于32个令牌:用于重建与生成》,https://arxiv.org/abs/2406.07550
-
6月11日,TextGrad:通过文本实现自动“微分”,https://arxiv.org/abs/2406.07496
-
6月11日,简单有效的掩码扩散语言模型,https://arxiv.org/abs/2406.07524
-
6月11日,永不掉拍:一种高效的大语言模型上下文窗口扩展方法,实现一致的“中间”增强,https://arxiv.org/abs/2406.07138
-
6月11日,Samba:用于高效无限上下文语言建模的简单混合状态空间模型,https://arxiv.org/abs/2406.07522
-
6月12日,Magpie:通过无提示引导对齐LLM从头合成对齐数据,https://arxiv.org/abs/2406.08464
-
6月12日,如果我们用LLaMA-3重新标注数十亿张网络图像会怎样?,https://arxiv.org/abs/2406.08478
-
6月12日,通过嵌入损坏提示实现大语言模型遗忘,https://arxiv.org/abs/2406.07933
-
6月12日,大语言模型必须学会知道自己不知道什么,https://arxiv.org/abs/2406.08391
-
6月12日,基于Mamba的语言模型实证研究,https://arxiv.org/abs/2406.07887
-
6月12日,发现偏好优化算法:与大语言模型共同探索,https://arxiv.org/abs/2406.08414
-
6月13日,Transformer与神经算法推理器相遇,https://arxiv.org/abs/2406.09308
-
6月13日,MLKV:用于内存高效Transformer解码的多层键值头,https://arxiv.org/abs/2406.09297
-
6月13日,一张图像的价值远超16x16个补丁:探索基于单个像素的Transformer,https://arxiv.org/abs/2406.09415
-
6月13日,FouRA:傅里叶低秩自适应,https://arxiv.org/abs/2406.08798
-
6月14日,利用DPO隐式奖励引导语言模型,https://arxiv.org/abs/2406.09760
-
6月14日,像金鱼一样,不要记忆!缓解生成式LLM中的记忆问题,https://arxiv.org/abs/2406.10209
-
6月14日,正则化隐藏状态使LLM奖励模型具备泛化能力,https://arxiv.org/abs/2406.10216
-
6月16日,THEANINE:通过时间线增强响应生成重新审视长期对话中的内存管理,https://arxiv.org/abs/2406.10996
-
6月17日,任务我一切,https://arxiv.org/abs/2406.11775
-
6月17日,大语言模型在预训练期间如何获取事实知识?,https://arxiv.org/abs/2406.11813
-
6月17日,mDPO:多模态大语言模型的条件偏好优化,https://arxiv.org/abs/2406.11839
-
6月17日,Nemotron-4 340B技术报告,https://arxiv.org/abs/2406.11704
-
6月17日,DataComp-LM:寻找下一代语言模型训练集,https://arxiv.org/abs/2406.11794
-
6月17日,分词化不足:分词化的诅咒,https://arxiv.org/abs/2406.11687
-
6月17日,DeepSeek-Coder-V2:突破代码智能中闭源模型的壁垒,https://arxiv.org/abs/2406.11931
-
6月17日,揭示无编码器的视觉-语言模型,https://arxiv.org/abs/2406.11832
-
6月17日,迭代长度正则化直接偏好优化:将7B语言模型提升至GPT-4水平的案例研究,https://arxiv.org/abs/2406.11817
-
6月17日,HARE:人类先验知识——小型语言模型效率的关键,https://arxiv.org/abs/2406.11410
-
6月17日,测量RLHF在代码补全中的记忆效应,https://arxiv.org/abs/2406.11715
-
6月17日,Self-MoE:通过自专业化专家构建组合式大语言模型,https://arxiv.org/abs/2406.12034
-
6月18日,从RAG到丰富参数:探究语言模型如何利用外部知识而非参数信息处理事实查询,https://arxiv.org/abs/2406.12824
-
6月18日,评判法官:评估LLM作为评判者的对齐性与脆弱性,https://arxiv.org/abs/2406.12624
-
6月19日,长上下文语言模型能否取代检索、RAG、SQL等?,https://arxiv.org/abs/2406.13121
-
6月20日,指令预训练:语言模型作为监督多任务学习器,https://arxiv.org/abs/2406.14491
-
6月20日,LLM能通过教学学习吗?一项初步研究,https://arxiv.org/abs/2406.14629
-
6月21日,信任与准确性的故事:RAG系统中的基础LLM与指令LLM,https://arxiv.org/abs/2406.14972
-
6月21日,LongRAG:利用长上下文LLM增强检索增强生成,https://arxiv.org/abs/2406.15319
-
6月21日,MoA:面向大型语言模型自动压缩的混合稀疏注意力机制,https://arxiv.org/abs/2406.14909
-
6月21日,通过缓解稳定性差距实现高效持续预训练,https://arxiv.org/abs/2406.14833
-
6月24日,更稀疏则更快,更少即是更多:面向长程Transformer的高效稀疏注意力,https://arxiv.org/abs/2406.16747
-
6月24日,WARP:论权重平均奖励策略的优势,https://arxiv.org/abs/2406.16768
-
6月24日,Adam-mini:用更少的学习率获得更多收益,https://arxiv.org/abs/2406.16793
-
6月25日,FineWeb数据集:从网络中精炼大规模优质文本数据,https://arxiv.org/abs/2406.17557
-
6月25日,LongIns:面向大语言模型的挑战性长上下文指令测试,https://arxiv.org/abs/2406.17588
-
6月25日,遵循指令中的长度约束,https://arxiv.org/abs/2406.17744
-
6月26日,深入探究大语言模型中的混合专家机制,https://arxiv.org/abs/2406.18219
-
6月26日,RouteLLM:利用偏好数据学习路由大语言模型,https://arxiv.org/abs/2406.18665
-
6月26日,Step-DPO:面向大语言模型长链推理的逐步偏好优化,https://arxiv.org/abs/2406.18629
-
6月27日,从LoRA权重中恢复数据集大小,https://arxiv.org/abs/2406.19395
-
6月27日,从人工针到真实草堆:通过微调合成数据提升大语言模型的检索能力,https://arxiv.org/abs/2406.19292
-
6月27日,改变答案顺序会降低MMLU准确率,https://arxiv.org/abs/2406.19470
-
6月28日,面向大语言模型的直接偏好知识蒸馏,https://arxiv.org/abs/2406.19774
-
6月28日,大语言模型评论家助力捕捉大语言模型漏洞,https://arxiv.org/abs/2407.00215
-
6月28日,利用十亿角色扩展合成数据创建,https://arxiv.org/abs/2406.20094
-
7月1日,大语言模型所见即所行:引导数据生成以针对不可微目标,https://arxiv.org/abs/2407.01490
-
7月1日,探索检索增强生成的最佳实践,https://arxiv.org/abs/2407.01219
-
7月1日,让专家各司其职:面向稀疏架构大语言模型的专家专用微调,https://arxiv.org/abs/2407.01906
-
7月1日,扩散强制:下一词元预测与全序列扩散的融合,https://arxiv.org/abs/2407.01392
-
7月1日,消除语言模型的位置偏差:一种机制性方法,https://arxiv.org/abs/2407.01100
-
7月2日,JMInference 1.0:通过动态稀疏注意力加速长上下文大语言模型的预填充阶段,https://arxiv.org/abs/2407.02490
-
7月2日,TokenPacker:面向多模态大语言模型的高效视觉投影器,https://arxiv.org/abs/2407.02392
-
7月2日,大语言模型中的推理:一种几何视角,https://arxiv.org/abs/2407.02678
-
7月2日,RankRAG:在大语言模型中统一上下文排序与检索增强生成,https://arxiv.org/abs/2407.02485
-
7月3日,AgentInstruct:迈向基于智能体流程的生成式教学,https://arxiv.org/abs/2407.03502
-
7月3日,HEMM:多模态基础模型的全面评估,https://arxiv.org/abs/2407.03418
-
7月4日,百万专家混合模型,https://arxiv.org/abs/2407.04153
-
7月5日,学会在测试时学习:具有表达性隐藏状态的循环神经网络,https://arxiv.org/abs/2407.04620
-
7月9日,视觉语言模型是盲目的,https://arxiv.org/abs/2407.06581
-
7月9日,语言模型中的自我识别,https://arxiv.org/abs/2407.06946
-
7月10日,面向CPU的大语言模型推理性能优化,https://arxiv.org/abs/2407.07304
-
7月11日,梯度提升强化学习,https://arxiv.org/abs/2407.08250
-
7月11日,FlashAttention-3:利用异步与低精度实现快速准确的注意力机制,https://arxiv.org/abs/2407.08608
-
7月12日,SpreadsheetLLM:面向大语言模型的电子表格编码,https://arxiv.org/abs/2407.09025
-
7月12日,直接偏好优化的新需求,https://arxiv.org/abs/2407.09072
-
7月12日,用于检索增强生成中高效答案生成的上下文嵌入,https://arxiv.org/abs/2407.09252
-
7月15日,Qwen2技术报告,https://arxiv.org/abs/2407.10671
-
7月15日,好、坏与贪婪:评估大语言模型不应忽视非确定性,https://arxiv.org/abs/2407.10457
-
7月15日,从GaLore到WeLore:低秩权重如何从低秩梯度中非均匀涌现,https://arxiv.org/abs/2407.11239
-
7月16日,GoldFinch:高性能RWKV/Transformer混合模型,具备线性预填充和极致KV缓存压缩,https://arxiv.org/abs/2407.12077
-
7月16日,将扩散Transformer扩展到160亿参数,https://arxiv.org/abs/2407.11633
-
7月16日,NeedleBench:LLM能否在百万上下文窗口中进行检索与推理?,https://arxiv.org/abs/2407.11963
-
7月17日,大型语言模型的补丁级训练,https://arxiv.org/abs/2407.12665
-
7月17日,LMMs-Eval:大型多模态模型评估的现实检验,https://arxiv.org/abs/2407.12772
-
7月17日,面向不同NLP任务的大型语言模型提示工程方法综述,https://arxiv.org/abs/2407.12994
-
7月17日,Spectra:三元、量化与FP16语言模型的综合研究,https://arxiv.org/abs/2407.12327
-
7月18日,注意力溢出:长上下文缺失项推荐中的语言模型输入模糊,https://arxiv.org/abs/2407.13481
-
7月18日,从弱到强的推理,https://arxiv.org/abs/2407.13647
-
7月18日,理解直接偏好优化中的参考策略,https://arxiv.org/abs/2407.13709
-
7月18日,词汇量缩放定律:更大模型需要更大词汇量,https://arxiv.org/abs/2407.13623
-
7月19日,BOND:通过最佳N项蒸馏对齐LLM,https://arxiv.org/abs/2407.14622
-
7月19日,通过剪枝与知识蒸馏实现紧凑语言模型,https://arxiv.org/abs/2407.14679
-
7月19日,LazyLLM:面向高效长上下文LLM推理的动态令牌剪枝,https://arxiv.org/abs/2407.14057
-
7月22日,迷你序列Transformer:优化长序列训练的中间内存,https://arxiv.org/abs/2407.15892
-
7月22日,DDK:为高效大型语言模型蒸馏领域知识,https://arxiv.org/abs/2407.16154
-
7月23日,生成约束缩放可缓解幻觉,https://arxiv.org/abs/2407.16908
-
7月23日,检索增强生成还是长上下文LLM?综合研究与混合方法,https://arxiv.org/abs/2407.16833
-
7月23日,纠偏:使用合成偏好进行安全对齐,https://arxiv.org/abs/2407.16637
-
7月26日,数据混合推断:BPE分词器揭示了训练数据的哪些信息?,https://arxiv.org/abs/2407.16607
-
7月28日,元奖励语言模型:以LLM为元评判者的自我改进对齐,https://arxiv.org/abs/2407.19594
-
7月29日,通过自我推理改进检索增强语言模型,https://arxiv.org/abs/2407.19813
-
7月29日,Apple Intelligence基础语言模型,https://arxiv.org/abs/2407.21075
-
7月30日,ThinK:通过查询驱动剪枝实现更薄的键缓存,https://arxiv.org/abs/2407.21018
-
7月31日,Llama 3模型群,https://arxiv.org/abs/2407.21783
-
7月31日,Gemma 2:在实用规模上改进开放语言模型,https://arxiv.org/abs/2408.00118
-
8月1日,SAM 2:图像与视频中的任意分割,https://arxiv.org/abs/2408.00714
-
8月2日,POA:一次预训练,适配所有规模模型,https://arxiv.org/abs/2408.01031
-
8月2日,RAGEval:场景特定RAG评估数据集生成框架,https://arxiv.org/abs/2408.01262
-
8月2日,Mamba综述,https://arxiv.org/abs/2408.01129
-
8月3日,MiniCPM-V:手机上的GPT-4V级多模态大语言模型,https://arxiv.org/abs/2408.01800
-
8月5日,RAG Foundry:增强LLM用于检索增强生成的框架,https://arxiv.org/abs/2408.02545
-
8月5日,自学评估器,https://arxiv.org/abs/2408.02666
-
8月5日,BioMamba:利用Mamba的预训练生物医学语言表示模型,https://arxiv.org/abs/2408.02600
-
8月5日,自学评估器,https://arxiv.org/abs/2408.02666
-
8月7日,EXAONE 3.0 7.8B指令微调语言模型,https://arxiv.org/abs/2408.03541
-
8月7日,1.5-Pints技术报告:数天而非数月预训练——你的语言模型依赖高质量数据,https://arxiv.org/abs/2408.03506
-
8月8日,对话式提示工程,https://arxiv.org/abs/2408.04560
-
8月8日,跨分词化与跨语言词汇迁移:面向低资源NLP的LLM语言适配,https://arxiv.org/abs/2408.04303
-
8月12日,《AI科学家:迈向全自动开放式科学发现》,https://arxiv.org/abs/2408.06292
-
8月15日,《Hermes 3技术报告》,https://arxiv.org/abs/2408.12570
-
8月19日,《利用实例级LoRA定制语言模型进行序列推荐》,https://arxiv.org/abs/2408.10159
-
8月20日,《增强大型语言模型的鲁棒性:通过提示减轻无关信息的影响》,https://arxiv.org/abs/2408.10615
-
8月20日,《编码还是不编码?探索编码在预训练中的影响》,https://arxiv.org/abs/2408.10914
-
8月21日,《LLM剪枝与蒸馏实践:Minitron方法》,https://arxiv.org/abs/2408.11796
-
8月22日,《Jamba-1.5:大规模混合Transformer-Mamba模型》,https://arxiv.org/abs/2408.12570
-
8月22日,《大型语言模型的可控文本生成:综述》,https://arxiv.org/abs/2408.12599
-
8月23日,《多层Transformer的梯度可在近似线性时间内计算》,https://arxiv.org/abs/2408.13233
-
8月26日,《持续多模态预训练实践指南》,https://arxiv.org/abs/2408.14471
-
8月26日,《构建并更好理解视觉语言模型:见解与未来方向》,https://arxiv.org/abs/2408.12637
-
8月26日,《CURLoRA:稳定的LLM持续微调与灾难性遗忘缓解》,https://arxiv.org/abs/2408.14572
-
8月27日,《Llama中的Mamba:蒸馏与加速混合模型》,https://arxiv.org/abs/2408.15237
-
8月28日,《ReMamba:为Mamba配备高效长序列建模能力》,https://arxiv.org/abs/2408.15496
-
8月29日,《更小、更弱,却更好:通过计算最优采样训练LLM推理器》,https://arxiv.org/abs/2408.16737
-
8月31日,《LongRecipe:大型语言模型高效长上下文泛化的配方》,https://arxiv.org/abs/2409.00509
-
9月3日,《OLMoE:开放混合专家语言模型》,https://arxiv.org/abs/2409.02060
-
2024年9月3日,《在长上下文语言模型时代为RAG辩护》,https://arxiv.org/abs/2409.01666
-
9月5日,《大型语言模型的注意力头:综述》,https://arxiv.org/abs/2409.03752
-
9月5日,《LongCite:使LLM在长上下文问答中生成细粒度引用》,https://arxiv.org/abs/2409.02897
-
9月5日,《你的代码LLM表现如何?用高质量数据赋能代码指令微调》,https://arxiv.org/abs/2409.03810
-
9月6日,《Sigmoid自注意力的理论、分析与最佳实践》,https://arxiv.org/abs/2409.04431
-
9月10日,《LLaMA-Omni:与大型语言模型的无缝语音交互》,https://arxiv.org/abs/2409.06666
-
9月10日,《小模型在LLM时代的作用:综述》,https://arxiv.org/abs/2409.06857
-
9月11日,《RLHF中的策略过滤以微调LLM用于代码生成》,https://arxiv.org/abs/2409.06957
-
9月16日,《RetrievalAttention:通过向量检索加速长上下文LLM推理》,https://arxiv.org/abs/2409.10516
-
9月18日,《Qwen2.5-Math技术报告:通过自我改进迈向数学专家模型》,https://arxiv.org/abs/2409.12122
-
9月18日,《Qwen2.5-Coder技术报告》,https://arxiv.org/abs/2409.12186
-
9月21日,《无需指令微调的指令遵循》,https://arxiv.org/abs/2409.14254
-
9月30日,《偏好对齐是否总是增强基于LLM翻译的最佳选择?一项实证分析》,https://arxiv.org/abs/2409.20059
-
9月30日,《完美融合:用混合评判器重新定义RLHF》,https://arxiv.org/abs/2409.20370(Meta关于如何为Llama 3进行RLHF的新论文)
-
10月1日,《加法即一切:面向节能语言模型》,https://arxiv.org/abs/2410.00907
-
10月2日,《量化大型语言模型的泛化复杂度》,https://arxiv.org/abs/2410.01769
-
10月2日,《当语言模型针对推理进行优化时,它是否仍会显示自回归的余烬?对OpenAI o1的分析》,https://arxiv.org/abs/2410.01792
-
10月2日,《我们需要的仅仅是RNN吗?》,https://arxiv.org/abs/2410.01201
-
10月3日,《选择性注意力改进Transformer》,https://arxiv.org/abs/2410.02703
-
10月3日,《LLM知道的比它们展示的更多:关于LLM幻觉的内在表示》,https://arxiv.org/abs/2410.02707
-
10月3日,LLaVA-Critic:学习评估多模态模型,https://arxiv.org/abs/2410.02712
-
10月7日,差分Transformer,https://arxiv.org/abs/2410.05258
-
10月7日,GSM-Symbolic:理解大型语言模型数学推理的局限性,https://arxiv.org/abs/2410.05229
-
10月8日,ARIA:一个开放的多模态原生混合专家模型,https://arxiv.org/abs/2410.05993
-
10月8日,O1复现之旅:战略进展报告——第一部分,https://arxiv.org/abs/2410.18982
-
10月8日,长上下文LLM遇上RAG:克服RAG中长输入的挑战,https://arxiv.org/abs/2410.05983
-
10月9日,从通才到专才:通过任务特定视觉指令微调适配视觉语言模型,https://arxiv.org/abs/2410.06456
-
10月10日,用于改善首令牌时间的KV预测,https://arxiv.org/abs/2410.08391
-
10月11日,百川全模态技术报告,https://arxiv.org/abs/2410.08565
-
10月13日,MMIE:面向大型视觉语言模型的大规模多模态交错理解基准,https://arxiv.org/abs/2410.10139
-
10月13日,LOKI:使用大型多模态模型的综合合成数据检测基准,https://arxiv.org/abs/2410.09732
-
10月15日,AFlow:自动化智能体工作流生成,https://arxiv.org/abs/2410.10762
-
10月15日,面向检索增强生成的通用指令遵循对齐,https://arxiv.org/abs/2410.09584
-
10月21日,大型语言模型的预训练蒸馏:设计空间探索,https://arxiv.org/abs/2410.16215
-
10月23日,MIA-DPO:面向大型视觉语言模型的多图像增强直接偏好优化,https://arxiv.org/abs/2410.17637
-
10月23日,面向文本到图像生成的可扩展排序偏好优化,https://arxiv.org/abs/2410.18013
-
10月23日,通过自回归模型适配扩展扩散语言模型,https://arxiv.org/abs/2410.17891
-
10月24日,混合偏好:学习为人类与AI反馈路由实例,https://arxiv.org/abs/2410.19133
-
10月25日,大型语言模型的计数能力与分词影响,https://arxiv.org/abs/2410.19730
-
10月25日,小型语言模型综述,https://arxiv.org/abs/2410.20011
-
10月26日,通过前缀共享加速直接偏好优化,https://arxiv.org/abs/2410.20305
-
10月27日,注意你的步骤(逐步):在思考使人类表现更差的任务上,思维链可能降低性能,https://arxiv.org/abs/2410.21333
-
10月28日,LongReward:利用AI反馈改进长上下文大型语言模型,https://arxiv.org/abs/2410.21252
-
10月28日,ShadowKV:面向高吞吐长上下文LLM推理的阴影KV缓存,https://arxiv.org/abs/2410.21465
-
10月29日,超越文本:利用多模态输入优化工业应用中的RAG,https://arxiv.org/abs/2410.21943
-
10月30日,CORAL:多轮对话检索增强生成基准,https://arxiv.org/abs/2410.23090
-
10月31日,当LLM为快速与慢速思考训练时,各层发生了什么:梯度视角,https://arxiv.org/abs/2410.23743
-
10月31日,GPT还是BERT:为何不两者兼得?,https://arxiv.org/abs/2410.24159
-
10月31日,语言模型可自我延长以生成长文本,https://arxiv.org/abs/2410.23933
-
11月1日,为评估添加误差棒:语言模型评估的统计方法,https://arxiv.org/abs/2411.00640
-
2024年11月1日,边适应边学习:通过智能工具使用适配为科学问题构建LLM基础,https://arxiv.org/abs/2411.00412
-
2024年11月1日,多专家提示提升大型语言模型的可靠性、安全性和有用性,https://arxiv.org/abs/2411.00492
-
11月3日,LLM的样本高效对齐,https://arxiv.org/abs/2411.01493
-
2024年11月4日,大型语言模型时代的小型语言模型综合综述:技术、增强、应用、与LLM的协作及可信度,https://arxiv.org/abs/2411.03350
-
11月4日,“给我BF16,否则毋宁死”?LLM量化中的精度-性能权衡,https://arxiv.org/abs/2411.02355
-
11月4日,大型语言模型用于单元测试生成的参数高效微调:一项实证研究,https://arxiv.org/abs/2411.02462
-
11月5日,HtmlRAG:在RAG系统中,HTML比纯文本更适合建模检索知识,https://arxiv.org/abs/2411.02959
-
11月6日,文本与图像双双泄露!多模态大语言模型数据污染的系统性分析,https://arxiv.org/abs/2411.03823
-
11月6日,语言模型是隐藏的推理者:通过自我奖励解锁潜在推理能力,https://arxiv.org/abs/2411.04282
-
11月6日,数字烹饪书:语言模型的数字理解及其改进方法,https://arxiv.org/abs/2411.03766
-
11月7日,混合Transformer:面向多模态基础模型的稀疏可扩展架构,https://arxiv.org/abs/2411.04996
-
11月7日,BitNet a4.8:面向1比特大语言模型的4比特激活,https://arxiv.org/abs/2411.04965
-
11月7日,精度的缩放定律,https://arxiv.org/abs/2411.04330
-
11月8日,节能蛋白质语言模型:利用LoRA小型语言模型实现可控蛋白质生成,https://arxiv.org/abs/2411.05966
-
11月8日,平衡流水线并行与词汇并行,https://arxiv.org/abs/2411.05288
-
11月11日,面向RAG的最优搜索与检索,https://arxiv.org/abs/2411.07396
-
11月12日,大语言模型可在长上下文推理中自我改进,https://arxiv.org/abs/2411.08147
-
11月12日,更强的模型并非指令微调的更强教师,https://arxiv.org/abs/2411.07133
-
11月12日,利用稀疏特征级约束的直接偏好优化,https://arxiv.org/abs/2411.07618
-
11月13日,在大词汇量语言模型中减少损失,https://arxiv.org/abs/2411.09009
-
11月15日,提示格式对LLM性能有影响吗?,https://arxiv.org/abs/2411.10541
-
11月17日,SymDPO:通过符号演示直接偏好优化提升大型多模态模型的上下文学习能力,https://arxiv.org/abs/2411.11909
-
11月17日,SageAttention2技术报告:面向即插即用推理加速的精确4比特注意力机制,https://arxiv.org/abs/2411.10958
-
11月18日,Bi-Mamba:迈向精确的1比特状态空间模型,https://arxiv.org/abs/2411.11843
-
11月19日,RedPajama:用于训练大语言模型的开放数据集,https://arxiv.org/abs/2411.12372
-
11月20日,Hymba:面向小型语言模型的混合头架构,https://arxiv.org/abs/2411.13676
-
11月20日,损失到损失预测:所有数据集的缩放定律,https://arxiv.org/abs/2411.12925
-
11月21日,当精度遇上位置:BFloat16在长上下文训练中破坏RoPE,https://arxiv.org/abs/2411.13476
-
11月21日,大型视觉编码器的多模态自回归预训练,https://arxiv.org/abs/2411.14402
-
11月21日,自然语言强化学习,https://arxiv.org/abs/2411.14251
-
11月22日,大型多模态模型能够解释大型多模态模型中的特征,https://arxiv.org/abs/2411.14982
-
11月22日,TÜLU 3:推动开放语言模型后训练的前沿,https://arxiv.org/abs/2411.15124
-
11月23日,MME-Survey:多模态大语言模型评估综述,https://arxiv.org/abs/2411.15296
-
11月24日,大语言模型在隐式推理中并非逐步思考,https://arxiv.org/abs/2411.15862
-
11月25日,O1复现之旅——第二部分:通过简单蒸馏超越O1-preview,是巨大进步还是惨痛教训?,https://arxiv.org/abs/2411.16489
-
11月26日,星型注意力:长序列上的高效LLM推理,https://arxiv.org/abs/2411.17116
-
11月27日,低比特量化偏爱未充分训练的LLM:面向100T训练令牌的量化LLM缩放定律,https://arxiv.org/abs/2411.17691
-
11月27日,重新思考MLLM中的令牌缩减:迈向无训练加速的统一范式,https://arxiv.org/abs/2411.17686
-
11月29日,逆向思维使大语言模型成为更强的推理者,https://arxiv.org/abs/2411.19865
-
11月29日,关键令牌至关重要:令牌级对比估计增强LLM的推理能力,https://arxiv.org/abs/2411.19943
-
12月2日,Switti:为文本到图像合成设计尺度级Transformer,https://arxiv.org/abs/2412.01819
-
12月2日,X-Prompt:面向自回归视觉语言基础模型中的通用上下文图像生成,https://arxiv.org/abs/2412.01824
-
12月2日,无需过程标签的自由过程奖励,https://arxiv.org/abs/2412.01981
-
12月3日,《通过分组球面量化扩展图像分词器》,https://arxiv.org/abs/2412.02632
-
12月3日,《RARE:面向大型语言模型的检索增强推理优化》,https://arxiv.org/abs/2412.02830
-
12月4日,《感知标记增强多模态语言模型的视觉推理》,https://arxiv.org/abs/2412.03548
-
12月4日,《评估语言模型作为合成数据生成器的能力》,https://arxiv.org/abs/2412.03679
-
12月4日,《最佳N选一越狱攻击》,https://arxiv.org/abs/2412.03556
-
12月4日,《PaliGemma 2:面向迁移的多功能视觉语言模型家族》,https://arxiv.org/abs/2412.03555
-
12月5日,《VisionZip:视觉语言模型中更长并非必要》,https://arxiv.org/abs/2412.04467
-
12月5日,《评估并基于人类偏好对齐代码大语言模型》,https://arxiv.org/abs/2412.05210
-
12月6日,《MAmmoTH-VL:通过大规模指令微调激发多模态推理》,https://arxiv.org/abs/2412.05237
-
12月6日,《通过模型、数据和测试时扩展提升开源多模态模型性能边界》,https://arxiv.org/abs/2412.05271
-
12月7日,《大语言模型作为评判者:基于LLM的评估方法综述》,https://arxiv.org/abs/2412.05579
-
12月8日,《RLHF能否扩展?从数据、模型和方法角度探究其影响》,https://arxiv.org/abs/2412.06000
-
12月9日,《解析强化学习智能体中的记忆复杂性:一种分类与评估方法》,https://arxiv.org/abs/2412.06531
-
12月9日,《在连续潜在空间中训练大型语言模型进行推理》,https://arxiv.org/abs/2412.06769
-
12月9日,《AutoReason:自动少样本推理分解》,https://arxiv.org/abs/2412.06975
-
12月11日,《大型概念模型:在句子表征空间中进行语言建模》,https://arxiv.org/abs/2412.08821
-
12月12日,《Phi-4技术报告》,https://arxiv.org/abs/2412.08905
-
12月13日,《字节级潜在Transformer:补丁扩展优于标记扩展》,https://arxiv.org/abs/2412.09871
-
12月13日,《SCBench:以KV缓存为中心的长上下文方法分析》,https://arxiv.org/abs/2412.10319
-
12月13日,《大语言模型智能体间合作的文化演化》,https://arxiv.org/abs/2412.10270
-
12月13日,《DeepSeek-VL2:用于高级多模态理解的混合专家视觉语言模型》,https://arxiv.org/abs/2412.10302
-
12月16日,《告别Adam:初始化时学习率缩放即足够》,https://arxiv.org/abs/2412.11768
-
12月16日,《大型语言模型中的精确长度控制》,https://arxiv.org/abs/2412.11937
-
12月16日,《大型语言模型(LLM)中的开源优势》,https://arxiv.org/abs/2412.12004
-
12月16日,《多模态大语言模型时代的数学推理综述:基准、方法与挑战》,https://arxiv.org/abs/2412.11936
-
12月17日,《你的大语言模型能稳定推理吗?》,https://arxiv.org/abs/2412.13147
-
12月18日,《大语言模型后训练配方:提升LLM推理能力》,https://arxiv.org/abs/2412.14135
-
12月18日,《Hansel:大型语言模型输出长度控制框架》,https://arxiv.org/abs/2412.14033
-
12月18日,《关注你的理论:心理理论比推理更深入》,https://arxiv.org/abs/2412.13631
-
12月18日,《大型语言模型中的对齐伪装》,https://arxiv.org/abs/2412.14093
-
12月18日,《SCOPE:长上下文生成中键值缓存压缩优化》,https://arxiv.org/abs/2412.13649
-
12月19日,《LongBench v2:迈向对现实长上下文多任务的更深理解与推理》,https://arxiv.org/abs/2412.15204
-
12月20日,《面向大语言模型多步推理的离线强化学习》,https://arxiv.org/abs/2412.16145
-
12月24日,《Mulberry:通过集体蒙特卡洛树搜索赋予多模态大语言模型类似O1的推理与反思能力》,https://arxiv.org/abs/2412.18319
-
12月31日,《Titans:在测试时学习记忆》,https://arxiv.org/abs/2501.00663
这本杂志是我个人的热情项目。如果您希望支持我,请考虑购买一本我的《从零开始构建大型语言模型》(我确信您会从中收获颇丰,因为这本书以其他地方找不到的详细程度解释了LLM的工作原理。)
如果您阅读了这本书,并且有几分钟空闲,我将非常感激您能留下简短评价。这对我们作者来说帮助很大!
另外,我最近也在Substack上启用了付费订阅选项,以直接支持这本杂志。