两年前,我在社交媒体上发布了一份机器学习和人工智能的“Hello World”示例列表。这里的“Hello World”指的是适合初学者的示例,用于展示某种方法。
我设置了一个两年一次的日历提醒,以便重新审视并补充这份列表。我一直在认真思考2025年的示例会是什么样子。所以,这里有一篇短文,包含了更新后的列表以及一些更详细的解释。
- 2013年:鸢尾花数据集上的随机森林分类器
- 2015年:泰坦尼克号数据集上的XGBoost
- 2017年:MNIST数据集上的多层感知机
- 2019年:CIFAR-10数据集上的AlexNet
- 2021年:IMDb电影评论数据集上的DistilBERT
- 2023年:在Alpaca 50k数据集上使用LoRA的Llama 2
- 2025年:在MATH-500数据集上使用RLVR的Qwen3
让我们逐一回顾。
2013年:鸢尾花数据集上的随机森林分类器
请注意,列表中的方法在时间上会滞后几年。例如,随机森林是在2001年提出的。但根据我当时的记忆,直到2012年它被添加到scikit-learn(当时主要的机器学习库)后,大约在2013年左右才变得非常流行和主流。
- 《Python机器学习》中的代码示例

2015年:泰坦尼克号数据集上的XGBoost
XGBoost于2014年首次发布,我记得它在2015年因Kaggle竞赛而变得非常流行(当时大家入门都是从热门的泰坦尼克号数据集竞赛开始的)。
- Kaggle上的代码示例

2017年:MNIST数据集上的多层感知机
多层感知机(MLP)已经存在了很长时间。在1986年反向传播论文发表后,它们在20世纪80年代和90年代变得有些实用,但并未非常流行。我记得21世纪初,随机森林、支持向量机和梯度提升(特别是XGBoost)仍然占据主导地位。与此同时,非神经网络方法在计算机视觉领域仍然很受欢迎。然而,随着2015年TensorFlow的初始发布以及2017年TensorFlow 1.0的推出,MLP和神经网络在那个时候真正开始蓬勃发展。
- 来自我深度学习笔记本集合的代码示例

2019年:CIFAR-10数据集上的AlexNet
AlexNet可能应该更早出现在这个列表中,因为它是在2012年通过论文《使用深度卷积神经网络的ImageNet分类》引入的。然而,直到2017年PyTorch和TensorFlow 1.0发布后,它才变得非常流行。当时大多数人仍在使用Caffe,但也开始转向使用TensorFlow进行计算机视觉。
不过,由于使用卷积神经网络进行有意义的计算需要GPU,而CUDA和cuDNN让这一过程更加便捷,我认为将其放在“2017年基于MNIST的多层感知机”示例之后是合理的。(此外,当时ImageNet对大多数人来说规模太大且成本过高,因此CIFAR-10和CIFAR-100是流行的入门数据集。)
- 代码示例来自我的深度学习笔记本合集

2021年:基于IMDb电影评论的DistilBERT
在IMDb电影评论情感分类数据集上使用DistilBERT,我们进入了语言模型开始加速发展的时代。当然,Transformer架构于2017年提出,BERT于2018年提出,DistilBERT于2019年提出,但普及仍需数年时间。
- 代码示例来自我的深度学习笔记本合集

2023年:基于Alpaca 50k数据集的Llama 2与LoRA
2023年是ChatGPT发布后的第二年,LLM迅速加速发展。由于训练或微调LLM的成本,仍存在较大障碍,但LoRA、Llama 1和2以及Alpaca数据集的结合,突然让LLM变得更容易获取,指令微调也迎来了巨大热潮。
- 代码示例由Radek Osmulski在GitHub上提供

2025年:基于MATH-500数据集的Qwen3与RLVR
今年是推理模型和基于可验证奖励的强化学习(RLVR)的一年,这一趋势始于2024年OpenAI o1首次发布带来的热潮,但在2025年1月DeepSeek R1发布后真正加速发展。
今年,Qwen3模型也变得非常流行,它们有从0.6B到235B的多种规模。然而,即使是在MATH-500数据集的训练部分上使用最小模型,用RLVR训练推理模型也并非易事(这实际上是我新书的主题)。
不过,存在专有的API服务可以向初学者展示RLVR是什么,因此这可能是一个很好的“Hello World”示例和AI入门介绍(在初学者想要深入了解细节之前)。
