如果你这个周末想花几个小时深入探索大型语言模型(LLMs)并理解它们的工作原理,我准备了一个3小时的编程工作坊演示,内容涵盖LLM的实现、训练和使用。

下面是一个目录,帮助你了解这个视频涵盖的内容(视频本身有可点击的章节标记,你可以直接跳转到感兴趣的主题):

0:00 – 工作坊概述

2:17 – 第一部分:LLM简介

9:14 – 工作坊材料

10:48 – 第二部分:理解LLM输入数据

23:25 – 一个简单的分词器类

41:03 – 第三部分:编写LLM架构代码

45:01 – GPT-2和Llama 2

1:07:11 – 第四部分:预训练

1:29:37 – 第五部分1:加载预训练权重

1:45:12 – 第五部分2:通过LitGPT加载预训练权重

1:53:09 – 第六部分1:指令微调

2:08:21 – 第六部分2:通过LitGPT进行指令微调

02:26:45 – 第六部分3:基准评估

02:36:55 – 第六部分4:评估对话性能

02:42:40 – 结论

这与我通常的文本内容略有不同,但几个月前我上次这样做时,反响非常好,所以我觉得再做一次也不错!

祝观看愉快!

  1. 《从零构建LLM》书籍

  2. 《从零构建LLM》GitHub仓库

  3. 包含工作坊代码的GitHub仓库

  4. 本次工作坊的Lightning Studio

  5. LitGPT GitHub仓库

这本杂志是一个个人热情项目。对于那些希望支持我的人,请考虑购买一本我的《从零构建大型语言模型》书籍。(我相信你会从这本书中收获很多,因为它以其他地方找不到的详细程度解释了LLM的工作原理。)

如果你读了这本书,并且有几分钟空闲时间,我将非常感激你写一篇简短的评论。这对我们作者帮助很大!

另外,我最近也在Substack上启用了付费订阅选项,以便直接支持这本杂志。

关于此文章的讨论

准备好了解更多了吗?