一句话定义
计算机视觉六十余年走过了「Marr 计算理论 → 特征工程时代 → 深度学习革命 → 基础模型范式」四段主线,理解各阶段的问题意识与代表人物,才能判断新方法解决的是老问题的哪一块。
为什么重要
学科史是「判断坐标系」:看到一篇新论文,知道它站在哪个传统的延长线上,才能识别真创新与重新包装;面试与选型时,能讲清「为什么这个方法在那个年代出现」的人,往往也是能判断技术边界的人。
直观类比
视觉学科像一座屡次翻修的老房子:Marr 画了建筑图纸(理论框架),特征工程时代砌了砖墙(手工特征 + 几何),深度学习时代换了整面承重墙(端到端学习),基础模型时代则开始给整栋楼装中央大脑(通用表征 + 提示);每次翻修都没有推倒全部,几何与滤波这两根老梁至今还在承重。
前置知识
无(本站为全库提供时间轴参照,可在任意阶段阅读)。
核心概念
- Marr 三层次(1982):计算理论(算什么)、算法与表示(怎么算)、硬件实现(在哪算),为学科奠定「先问计算问题再谈实现」的方法论。
- 特征工程时代(约 1990–2012):SIFT(Lowe 2004)、HOG、词袋、SVM;「人设计特征、机器学分类器」。
- 深度学习革命(2012–2020):AlexNet(Krizhevsky,Hinton 组)引爆,ResNet(何恺明)、GAN、检测/分割全面刷新;「机器自己学特征」。
- 基础模型范式(2020 至今):ViT(Dosovitskiy)、CLIP 图文对齐、SAM 可提示分割、自监督 DINOv2;「大模型 + 提示 + 适配」。
- 代表人物:Marr(理论奠基)、Lowe(SIFT)、Zhang(标定)、LeCun/Hinton/Bengio(深度学习 2018 图灵奖)、何恺明(ResNet/Mask R-CNN)、Fei-Fei Li(ImageNet 数据范式)。
- 流派余脉:几何视觉(SfM/SLAM)与学习视觉并非取代关系,今天在 SLAM、NeRF 中合流。
原理与机制
推动范式迁移的三条暗线:数据规模(小样本几何实验 → ImageNet 百万级 → 网络亿级图文对)、算力形态(工作站 → GPU → 大规模集群)、监督来源(人工标注 → 弱监督/自监督)。Marr 时代的「恢复三维场景」目标被深度学习时代「直接预测语义」部分绕过,但三维几何在自动驾驶与机器人时代重新成为中心议题——问题的钟摆式回归是本学科的重要规律。另一规律:工程可用性决定范式存活,SIFT 的免专利版本、OpenCV 的普及、YOLO 的工程化,都是「好方法 × 可用工具」的乘积效应。
公式与模型
本节不适用:学科脉络主题的核心是时间线与因果链,不引入新的数学模型;各阶段代表性公式见对应知识点(kp-002 卷积、kp-010 投影、kp-016 交叉熵、kp-021 注意力)。
图示
实例与案例
选型视角:SLAM 团队 2025 年仍以 ORB 特征 + 几何优化为基线,因为「免训练、可解释、有误差界」;内容平台则以 CLIP 类模型做冷启动分类——两个时代的工具在工业界并行服役。读论文视角:看到「新的检测头」,先问它在 kp-017 的 PR 曲线语言里改进了哪一段;看到「新的预训练」,先问它在 kp-015 的骨干接口上如何迁移。招聘视角:候选人能把「从 SIFT 到 SAM」讲成因果链而非名词罗列,通常意味着真正理解了任务本质。
常见误区
- 深度学习「推翻」了几何:没有推翻——自动驾驶感知栈里标定、对极几何、BA 仍是地基;被取代的是「手工特征描述子」这一层。
- 把 ImageNet 当起点:统计模式识别、神经认知机(Fukushima 的 Neocognitron 1980)都是前史,AlexNet 的成功站在数据(ImageNet)、算力(GPU)、算法(卷积/ReLU)三者同时到位的节点上。
- 用最新论文否定经典:Canny、Harris、卡尔曼滤波仍在产线上跑;工程选型的依据是场景约束,不是论文年份。
- 认为范式是单线更替:几何与学习、判别与生成、专用与基础模型,当前都是并存互补关系。
与其他知识点的关系
本站为全库提供时间轴:kp-007/008 属特征工程时代,kp-015/016 属深度学习革命,kp-021 属基础模型范式;kp-030/031 的伦理议题贯穿后两个时代。
自测题
- Marr 三层次框架是什么?它留下了什么方法论遗产?
答案要点:计算理论/算法与表示/硬件实现;遗产是「先明确计算问题与约束,再谈算法与实现」,这一提问方式至今适用于评估任何新方法。
- 深度学习革命引爆的三个同时到位的条件是什么?
答案要点:大规模标注数据(ImageNet)、GPU 并行算力、可训练的深度卷积架构与训练技巧(ReLU、Dropout)。
- 几何视觉在学习时代被淘汰了吗?
答案要点:没有;被淘汰的是手工描述子环节,标定、对极几何、BA 仍是三维感知的地基,并在 SLAM/NeRF 中与学习合流。
延伸阅读
- Marr《Vision》(1982)
- Szeliski《Computer Vision: Algorithms and Applications》第 1 章导论