第一个 AI 项目,从哪里开始?

如果还没有选方向,可以先做一个看得见结果的项目:让模型认出手写数字,或者在自己拍的照片里框出人和车。数据、代码和教程都有现成的,从这里动手,再顺着碰到的问题补知识。

先做一次,是为了看看实际过程里有什么吸引你:喜欢把它做成一个应用,喜欢比较几种方法的效果,还是想追问模型为什么会出错?带着自己的体验,再决定下一步学什么、找谁交流。

下面先放两个视觉入门项目:MNIST 适合走一遍训练和提交,YOLO 适合先看到模型在真实图片上的效果。选一个感兴趣的开始;已经想做 Agent 或机器人,也有后面的入口。

MNIST:在 Kaggle 做一次手写数字识别

打开 Kaggle Digit Recognizer。任务很直观:输入一张手写数字图片,判断它是 0 到 9 中的哪一个。这个项目可以把数据、训练、预测和提交串起来。

先看数据,再找一份能读懂的代码

先打开比赛的 Data 页面,看看训练数据、测试数据和提交示例。把一行像素还原成图片,对照它的标签;这样再读模型代码时,知道它究竟在处理什么。

再到 Code 页面,找一份步骤完整、能从头读到尾的入门 notebook。可以搜 MNIST、PyTorch、CNN,优先看有数据展示、训练过程和生成提交文件的版本,复制到自己的 notebook 里运行。

第一次读代码,先找到数据读取、模型、loss、参数更新和预测这几处。拿不准一段在做什么,可以让 AI 逐段解释,再打印真实数据的 shape 看看。

训练一个模型,完成第一次提交

从带标签的训练数据里留出一部分做验证,训练后看它在这部分图片上认对了多少。然后对比赛测试集生成预测,按照提交示例的格式保存文件,完成一次提交。

到这里,你可以对照着想:模型训练时看到了哪些图片,验证时用了哪些,提交的预测又来自哪里?把这三件事分清,后面做其他项目也会反复用到。

改一点,看看结果怎么变

保存第一次跑通的 notebook、验证结果和提交文件,再改一个设置,比如学习率、训练轮数或网络宽度。先猜一下会发生什么,跑完对比。

把模型认错的图片摆出来看:哪些数字容易混淆,哪些连你也要辨认一下?下一次改动先用自己的验证集比较,榜单留作补充。最后写几句话:改了什么,结果怎样,你怎么解释,还有哪里没弄懂。

遇到概念和代码看不懂时

3b1b 的神经网络讲解用手写数字解释输入、神经元和输出,适合边做边看。PyTorch Learn the Basics可以用来查数据加载、自动求导、优化和模型保存;其中的 Quickstart 用的是服饰分类数据 FashionMNIST,读懂训练流程后再对照自己的数字识别代码。

Python 语法读不下去,去基础页补函数、循环、列表和文件读取。张量维度对不上,先补 shape、索引和矩阵乘法。想了解 AI 的更大图景,可以看 Crash Course AI 中感兴趣的主题。

YOLO:让模型在自己的图片里框出物体

如果你更想马上看到一个有意思的效果,可以从目标检测开始。分类回答“这张图是什么”,检测还要回答“东西在哪里”:一张照片里可能同时有人、自行车和汽车,每个物体都有自己的框和类别。

先用现成模型做一次预测

从 Ultralytics Quickstart进入,先用预训练模型跑通示例,再换成自己拍的图片。想在浏览器里做,可以从官方的 Colab 教程进入。

观察框、类别和置信度:远处的小物体有没有漏掉,遮挡之后还认不认得出来,同一个物体会不会被框两次?拿几张不同场景的图片试试,比只看一张成功截图更容易发现问题。

再走一遍训练和验证

跟着 训练教程,先用 COCO8 小数据集走通数据加载、训练和验证。它只有 8 张图,适合看清流程;想比较模型效果,下一步换成有足够训练与验证样本的数据集。

打开一张图片和对应标注,看看类别、框的位置怎样记录,再看数据配置文件怎样指定路径和类别。训练结束后,用保存的权重重新预测,找到结果图片和训练记录。

做一个自己想展示的小 demo

可以用一段自己拍的视频,观察模型怎样检测行人或车辆;想识别某种特定物品,就继续找有相应标注的数据,或尝试自己标注。先弄清当前模型认识哪些类别,再决定是否需要重新训练。

选一个现象继续试:换分辨率后,小物体能不能更容易被发现?调低置信度阈值,多出来的框有多少是误检?把结果图和设置放在一起,你就有具体东西可以拿去请教学长。

接下来可以读视觉方向,了解分类、检测和分割;开始想认真比较几种方案时,去看实验页。

已经对 Agent 感兴趣

从 Hello Agents 的基础内容,或 Hugging Face Agents Course 开始,选一套跟。

第一个目标可以是让模型调用一个简单工具,并读懂整个过程:收到什么任务、为什么调用、工具返回什么、接下来怎么做、什么时候结束。需要在线模型的练习会涉及账号或 API 费用,选例子前看它的运行条件。

保存一次成功和一次失败的执行记录。如果同样的问题直接问模型也能答,就比较加上工具之后到底改变了什么。接下来读 ReAct,再去 Agent 方向页挑一个想继续追的问题。

已经对机器人感兴趣

先看 ACT / ALOHA 的项目视频和方法图。拿一个动作来想:机器人看到了什么,示范数据里记录了什么,模型输出的动作又是什么?

然后在 LeRobot 里看一份示范数据和项目结构,把图里的模块对应到文件与数据上。第一步可以停在读数据、理解动作表示;仿真与真实机器人训练放在下一步选。具体入口在具身方向。

做完之后,怎么继续

留住三个东西:可以重开的项目、能讲清的一次改动、下次想问的一个问题。它们会把你带向不同的地方:

  • 对输入和模型内部好奇,继续学基础与架构。
  • 对某种任务特别感兴趣,去方向页找代表论文。
  • 想认真复现一篇文章,把阅读、实验和交流串起来。
  • 做下来没那么喜欢,也可以换一个例子。你的这次体验已经提供了信息。

做过之后,继续往哪里学

想系统补基础,可以看李沐的课程怎么接;想换一套教材或讲解,查基础学习目录。