照片里是什么、东西在哪里、哪些像素属于同一个物体,以及怎样从图像认识三维场景,都是视觉研究中的问题。它也是一个很容易从结果产生兴趣的入口:你能直接看见模型认对和认错了什么。
计算机视觉研究怎样从图像和视频中提取有用的信息。相册按人物整理、路口统计车辆、医学影像中勾出病灶,都要把像素变成可用的判断。分类回答是什么,检测补上位置,分割细到每个像素;三维视觉还要恢复距离、形状和空间关系。
入门时先选一种输出,再看模型如何得到它。卷积网络用同一组小滤镜在不同位置提取局部特征,视觉 Transformer 则把图像切成小块,让这些块交换信息。结构之外,数据怎样标注、测试图与训练图差多少,也常常决定模型能不能用。
主要任务- 识别与检索:给图片分类,或从图库里找到相似内容。
- 定位与测量:找出物体的位置、轮廓,统计数量或估计尺寸。
- 场景理解:结合连续画面或多个视角,估计运动、深度与三维结构。
先把一种任务的输入、标注和评价指标讲明白,再比较网络。
图像怎样经过视觉网络- 01输入图像
- 02提取特征
- 03目标检测
- 04像素分割
- 05估计深度
发展路线与代表工作
- 2012
从手工特征到学习特征
AlexNet 让卷积网络在大规模图像分类中显示出优势。一起看数据、GPU 训练和模型结构,才能理解这次进展。
- 2016
网络加深,为什么反而难学
ResNet 用跨层相加的连接改善深层网络的优化。这里的问题是怎样把网络训好,学到的视觉特征也能服务其他任务。
- 2016
另一条任务线:同时识别与定位
YOLO 直接从整张图预测框和类别,把检测写成一个统一的预测问题。它与分类网络不是前后替代关系。
- 2021
把图像看成一串小块
ViT 将图像块送入 Transformer,并研究大规模预训练怎样影响效果。卷积与注意力由此成为可以按任务、数据和成本选择的设计。
关键概念
- 卷积 / CNN
- 让一个小滤镜在图像上移动,同一组参数检查不同位置。多层组合后,可以从局部纹理形成更复杂的特征。
- 特征 / representation
- 模型中间层产生的一组数字,用来保留对任务有用的信息。它可以交给分类器,也可以供检测、检索等任务使用。
- Patch 与 attention
- Patch 是切下来的图像块;attention 按输入内容决定各块之间交换多少信息。一个块不是天然对应一个物体。
- IoU 与 mAP
- IoU 衡量预测框与真实框的重叠程度;mAP 汇总各类别检测的精确率与召回率关系。比较 mAP 时要对齐重叠阈值和评价协议。
从分类、检测与分割开始
从 MNIST 手写数字识别或 YOLO 目标检测开始:前者做一次训练、预测和 Kaggle 提交,后者先在自己的图片上看到检测结果,再尝试训练。再看 CS231n 的视觉任务、训练与卷积网络相关内容。
分类回答是什么,检测还要给出位置,分割进一步决定每个像素属于什么。选择其中一个你感兴趣的任务,再去看相应数据和指标。
特征、感受野与泛化
读 ResNet 可以认识一个结构变化怎样通过实验论证。对卷积中的感受野好奇,可以读 Distill 的可视化讲解。
把一次预测打开看:模型容易把哪些情况弄错,遮住背景之后是否变化,换一个数据来源又怎样。这些现象会把你带到数据、表示与泛化。
视觉与语言、生成、动作的联系
想把图像和语言联系起来,接多模态;想生成图像,接生成模型;想让视觉服务动作,接具身智能。碰到运行速度与内存问题,就去系统页。
视觉课程与研究团队
课程与项目见视觉资料目录;想看视觉怎样和机器人任务联系,可以从SVL、RAIL 等团队的项目开始。
代表论文
先用 AlexNet 和 ResNet 读懂特征学习与训练,再按兴趣选 YOLO 或 ViT;每篇都对照输入、输出和实验看。
入门练习
卡在某一步?把过程带到 AMA 一起聊 ↗