如果你这个周末想花几个小时深入探索大型语言模型(LLMs)并理解它们的工作原理,我准备了一个3小时的编程工作坊演示,内容涵盖LLM的实现、训练和使用。
下面是一个目录,帮助你了解这个视频涵盖的内容(视频本身有可点击的章节标记,你可以直接跳转到感兴趣的主题):
0:00 – 工作坊概述
2:17 – 第一部分:LLM简介
9:14 – 工作坊材料
10:48 – 第二部分:理解LLM输入数据
23:25 – 一个简单的分词器类
41:03 – 第三部分:编写LLM架构代码
45:01 – GPT-2和Llama 2
1:07:11 – 第四部分:预训练
1:29:37 – 第五部分1:加载预训练权重
1:45:12 – 第五部分2:通过LitGPT加载预训练权重
1:53:09 – 第六部分1:指令微调
2:08:21 – 第六部分2:通过LitGPT进行指令微调
02:26:45 – 第六部分3:基准评估
02:36:55 – 第六部分4:评估对话性能
02:42:40 – 结论
这与我通常的文本内容略有不同,但几个月前我上次这样做时,反响非常好,所以我觉得再做一次也不错!
祝观看愉快!
这本杂志是一个个人热情项目。对于那些希望支持我的人,请考虑购买一本我的《从零构建大型语言模型》书籍。(我相信你会从这本书中收获很多,因为它以其他地方找不到的详细程度解释了LLM的工作原理。)
如果你读了这本书,并且有几分钟空闲时间,我将非常感激你写一篇简短的评论。这对我们作者帮助很大!
另外,我最近也在Substack上启用了付费订阅选项,以便直接支持这本杂志。