此前,我在《大型LLM架构对比》一文中比较了2025年最值得关注的开源权重架构。随后,我在《从GPT-2到gpt-oss:架构演进分析》中从概念层面深入探讨了各种架构组件。

既然好事成三,在介绍今年夏天一些值得关注的研究亮点之前,我想现在通过代码亲手实践这些架构。跟随本文,你将理解这些架构在底层是如何运作的,并掌握可用于自己实验或项目的构建模块。

为此,我选择了Qwen3(最初于5月发布,7月更新),因为它是目前最受欢迎和使用最广泛的开源权重模型系列之一。

在我看来,Qwen3模型如此受欢迎的原因如下:

  1. 采用对开发者友好且商业友好的开源协议(Apache许可证 v2.0),除原始开源许可条款外无任何附加条件(其他一些开源权重LLM会施加额外使用限制)

  2. 性能非常出色;例如,截至本文撰写时,开源权重235B-Instruct变体在LMArena排行榜上排名第8,与闭源的Claude Opus 4并列。排名更高的另外两个开源权重LLM分别是DeepSeek 3.1(体积大3倍)和Kimi K2(体积大4倍)。9月5日,Qwen3在其平台上发布了1万亿参数的“max”变体,在所有主要基准测试上均超越Kimi K2、DeepSeek 3.1和Claude Opus 4;不过该模型目前仍为闭源。

  3. 提供多种不同规模的模型,适用于不同的计算预算和使用场景,从0.6B密集模型到480B参数的混合专家模型。

由于本文包含纯PyTorch的从头实现代码,篇幅较长。虽然代码部分可能看起来有些冗长,但我希望它们能比单纯的概念图更好地解释各个构建模块!

提示1: 如果你在电子邮件收件箱中阅读本文,较窄的行宽可能导致代码片段换行混乱。为获得更好的阅读体验,建议在浏览器中打开

提示2: 你可以使用网站左侧的目录在各章节间更轻松地导航。

图1:本文讨论并用纯PyTorch(重新)实现的Qwen3密集模型和混合专家架构预览。