目标检测与图像分割
目标检测中,两阶段检测器(如 Faster R-CNN)和单阶段检测器(如 YOLO、SSD)的核心区别是什么?¶

核心思想与流程
两阶段检测器:
将检测任务分解为两个顺序阶段——
-
区域提议 (Region Proposal):生成可能包含物体的候选区域,通常由区域提议网络(RPN)或选择性搜索(Selective Search)完成。
-
区域分类与精修 (Classification & Refinement):对每个候选区域进行特征提取,判断其类别,并对边界框进行精细回归。 代表:Faster R-CNN、Mask R-CNN、Cascade R-CNN。
单阶段检测器:
直接在特征图的每个空间位置上,一次性预测物体的类别和边界框偏移,无需独立的提议阶段。
代表:YOLO系列、SSD、RetinaNet、FCOS。
核心区别:
优缺点深度分析:
-
两阶段优势:ROI级别的特征对齐和二次分类回归能够更精确地定位,尤其对重叠目标和高IoU阈值下的评估有利。区域提议阶段的采样策略(如RPN的正负样本1:1)有效缓解了正负样本极端不平衡。
-
两阶段劣势:ROI处理(ROI Pooling/Align)需要额外计算,导致推理速度慢,难以达到实时。训练过程中两阶段联合优化也相对复杂。
-
单阶段优势:结构简单,端到端优化,推理速度快,适合实时应用。
-
单阶段劣势:早期版本(如YOLOv1、SSD)由于没有精细的区域提议,直接回归边界框导致定位精度较差。极端的正负样本不平衡使得训练困难,容易产生大量假阳性。后来Focal Loss等解决了该问题,使得单阶段检测器精度追平甚至超越两阶段方法。
现状:随着Anchor-Free和Transformer检测器(如DETR)的兴起,阶段划分逐渐模糊。但经典的两阶段和单阶段设计思想仍是检测领域的重要基础。
Faster R-CNN 中的 RPN(Region Proposal Network)是如何工作的?锚点(Anchor)机制是什么?¶
RPN的工作原理:
RPN是一个全卷积网络,它共享基础卷积特征图,并在此特征图上滑动一个小网络,同时预测物体性得分和边界框偏移。具体流程:
-
输入:骨干网络输出的特征图(如VGG16的conv5_3,尺寸为 H×W×C)。
-
滑动窗口:在特征图的每个空间位置,使用一个3×3卷积提取特征,输出一个低维向量(如256-d)。
-
双路预测:
- 分类分支:通过1×1卷积输出 2k 个得分,表示k个锚点各自是物体/背景的概率。
-
回归分支:通过1×1卷积输出 4k 个坐标偏移,每个锚点对应4个偏移量 (dx, dy, dw, dh)。
-
锚点生成:在每个滑动窗口中心,生成 k 个不同尺度和长宽比的参考框,称为锚点(Anchor)。
-
训练目标:RPN使用二分类损失(物体 vs 背景)和平滑L1回归损失进行端到端训练。
锚点(Anchor)机制:
-
锚点是预先定义的一系列矩形框,分布于特征图的每个位置,作为检测的基准。
-
典型设置:3种尺度(128², 256², 512²)和3种长宽比(1:1, 1:2, 2:1),组合出 k=9 个锚点。
-
锚点的设计使得网络只需预测相对偏移(偏移回归),而不是绝对坐标,这降低了学习难度。
-
正负样本分配:与任意真实框的IoU大于0.7的锚点为正样本;小于0.3的为负样本;其余忽略。这保证了RPN能学习到物体位置。
-
训练时,RPN会采样正负样本(通常各128个)以平衡训练。
RPN的损失函数:

总结:RPN替代了传统的选择性搜索,实现了端到端的区域提议,极大提升了检测速度和精度,是两阶段检测器的核心组件。
什么是 ROI Pooling 和 ROI Align?ROI Align 为什么更精确?¶
两者都是将任意尺寸的感兴趣区域(ROI)特征转换为固定尺寸特征图(如7×7)的操作,以便后续全连接层处理。
ROI Pooling:
-
根据ROI在原图中的坐标和特征图步长,将其映射到特征图上的区域。
-
将该区域划分成固定数量的网格(如7×7)。
-
每个网格内进行最大池化。
-
问题:在映射和划分网格时,坐标被量化取整,引入了两次量化误差:一次是将浮点ROI坐标取整到特征图网格,另一次是将网格边界取整。这种不对齐(misalignment)导致位置信息的丢失,对像素级的分割任务尤其不利。
ROI Align:
-
同样将ROI映射到特征图,但保持浮点坐标,不做量化。
-
将ROI区域均匀划分为7×7个单元格,每个单元格内固定采样4个点(如均匀分布),然后使用双线性插值计算每个采样点的特征值。
-
最后对每个单元格内的采样点进行最大池化(或平均池化)。
-
整个过程没有量化取整,保留了精确的空间对应关系。
为什么ROI Align更精确:
-
消除了量化误差,实现了像素级别的对齐,对于需要精细边界的分割任务(如Mask R-CNN)至关重要。
-
它保证了输入特征图与输出固定尺寸特征之间的空间不变性,使得后续的分类和回归更加准确。
-
实验表明,使用ROI Align替代ROI Pooling,在检测和分割上均有明显提升(Mask R-CNN中提升约1-2个点AP)。
公式表达:
对于每个单元格 (i,j),采样点坐标为:

(采样在单元格中心),然后利用双线性插值获得值。
ROI Align已成为实例分割和多任务检测(如Cascade R-CNN)的标准组件。
YOLO 系列如何实现“只看一次”的检测?从 YOLOv1 到 YOLOv8 有哪些关键演进?¶
YOLO的基本思想:将检测视为回归问题,直接从图像像素预测边界框和类别。单个卷积网络同时预测多个边界框及其类别概率,真正实现端到端、单次前向传播的检测,无需区域提议。
YOLOv1 (2016):
-
将输入图像划分为 S×S 网格(7×7)。每个网格预测 B 个边界框(B=2)及其置信度,以及 C 类条件概率。
-
边界框预测相对于网格中心的偏移,宽高相对于整张图。
-
损失函数结合坐标误差、置信度误差和分类误差。
-
缺点:每个网格只能预测一个类别,对密集小目标和群体目标检测差,定位精度低。
YOLOv2/YOLO9000 (2017):
-
引入Batch Normalization,提高收敛和正则化。
-
使用锚点(先验框),通过K-means聚类得到更好的先验尺寸,改为预测相对锚点的偏移。
-
多尺度训练、细粒度特征(跳过连接)、高分辨率分类器。
-
提出联合训练目标检测和分类数据集的方法。
YOLOv3 (2018):
-
使用Darknet-53骨干网络,融合残差连接。
-
多尺度特征图预测:在三个不同尺度的特征图上独立预测,类似FPN,显著提升小目标检测。
-
用逻辑回归替代softmax做类别预测,支持多标签(如“人”和“男人”)。
YOLOv4 (2020):
- 集成了大量Bag of Freebies和Bag of Specials:Mish激活函数、CSPDarknet53骨干、PANet特征融合、CIoU损失、CmBN、自对抗训练、马赛克数据增强等。速度和精度的极致平衡。
YOLOv5 (2020,Glenn Jocher):
- 工程化优化,PyTorch实现,提供多种尺寸(n/s/m/l/x)。引入自适应锚框计算、自动混合精度训练等。
YOLOv6/YOLOv7/YOLOv8 系列继续优化:
-
YOLOv7 (2022):E-ELAN高效聚合网络、模型缩放、辅助头训练等,性能卓越。
-
YOLOv8 (2023):由Ultralytics发布,anchor-free设计,解耦头(分类和回归分支分离),正负样本分配策略TaskAlignedAssigner等,提供全面的SOTA性能和易用性。
关键演进总结:
从v1的网格回归到v2的锚点,到v3的多尺度,到v4/v5的工程化极值,再到v7/v8的架构革新(如anchor-free),YOLO系列不断提升精度、速度和易用性,成为工业界最主流的检测框架之一。
SSD 如何利用多尺度特征图进行检测?它如何处理不同尺度的目标?¶
SSD (Single Shot MultiBox Detector) 的核心创新是在多个不同分辨率的特征图上同时进行检测,以处理不同尺度的目标。
多尺度特征图:
-
SSD使用VGG16作为骨干,并添加额外的卷积层,产生6个尺寸递减的特征图(如38×38, 19×19, 10×10, 5×5, 3×3, 1×1)。
-
高分辨率浅层特征图(如38×38)感受野小,适合检测小目标;低分辨率深层特征图(如1×1)感受野大,适合检测大目标。
-
每个特征图的每个空间位置,预测固定数量的边界框(default boxes),这些框具有不同的尺度和长宽比。
Default Boxes(先验框):
-
对于每个特征图位置,根据预定义的尺度和长宽比生成多个 default boxes。尺度随特征图层数线性增加,从最小的 sminsmin 到最大的 smaxsmax。
-
每个 default box 负责预测类别得分和4个坐标偏移。
-
这种设计使得不同层天然负责不同尺寸的目标,无需额外的特征金字塔(后来FPN对其进行了改进)。
如何处理不同尺度目标:
-
小目标由浅层大特征图检测,因为其空间分辨率高,保留了更多细节;大目标由深层小特征图检测,因为其语义信息强、感受野大。
-
训练时,通过匹配策略将真实框分配到与其IoU最大的 default box,通常是多个层的多个框,使得每个目标都有足够多的正样本。
优缺点:
-
优点:单阶段,速度快;多尺度预测提高了多尺度目标的覆盖。
-
缺点:小目标检测仍较差,因为浅层特征语义不足;需要手工设计 default box 尺度和长宽比,对参数敏感。后来FPN的加入(如DSSD)显著提升了SSD的性能。
SSD是多尺度检测的早期实践者,启发了后续FPN等方法在单阶段检测中的应用。
Anchor-Free 检测方法(如 CenterNet、FCOS)相比 Anchor-Based 方法有什么优势?¶
Anchor-Free方法不依赖预先定义的锚点框,而是通过其他方式(如关键点、中心点、像素点)来定位目标。
常见Anchor-Free方法分类:
-
基于关键点:如 CornerNet(检测左上和右下角点)、CenterNet(检测物体中心点,回归宽高)。
-
基于密集预测:如 FCOS(Fully Convolutional One-Stage),在每个特征图像素上直接预测物体类别、边界框距离(到左、上、右、下的距离),并引入中心度(centerness)抑制低质量框。
优势:
-
消除锚点超参数:不再需要手工设计锚点的数量、尺度、长宽比,避免了繁琐的超参数调整。
-
减少计算和内存:因为无需在每个位置生成大量锚点,减少了分类和回归头的计算量,训练和推理更快。
-
简化后处理:锚点方法通常需要NMS处理大量重叠框。Anchor-Free方法生成的框数量较少,正负样本定义更简单(如FCOS每个位置只预测一个框),NMS压力更小。
-
更灵活的尺度处理:FCOS通过FPN多尺度逐像素预测,直接在不同层限制回归范围,天然解决多尺度问题。CenterNet通过中心点热图和尺寸回归,精度高。
-
训练更稳定:正负样本分配更直接(如FCOS的正样本为落在真实框内的所有点,并引入多级FPN限制),避免了锚点方法中正负样本采样的复杂性和不平衡。
-
对不规则物体友好:FCOS直接回归四条边的距离,不依赖矩形锚点,可能更适合非刚性物体。
性能对比:FCOS等anchor-free检测器在COCO上达到了与anchor-based方法(如RetinaNet)相媲美甚至更优的精度,且速度更快,展示了anchor-free的巨大潜力。
目标检测中的 NMS(非极大值抑制)是如何工作的?Soft-NMS 的改进在哪?¶
NMS (Non-Maximum Suppression) 用于消除同一目标上的重复检测框,保留最佳的一个。
传统NMS流程:
-
对于每个类别,按置信度得分从高到低排序所有预测框。
-
选中得分最高的框 M,将其从列表移除并加入输出集。
-
计算剩余框与 M 的 IoU。若 IoU 大于阈值(如0.5),则认为它们与 M 检测的是同一物体,将其得分置零(即抑制)。
-
重复步骤2-3,直到列表为空。
缺点:
-
硬阈值:当阈值设置不当,可能误删正确检测到的相邻物体(如密集人群),造成漏检。
-
对得分高的框直接保留,得分低的相邻框直接删除,无法利用得分信息进行软决策。
Soft-NMS (Bodla et al., 2017):
-
核心思想:不是直接删除与 M 高重叠的框,而是衰减其得分,衰减程度随 IoU 增大而增大。
-
两种衰减函数:
- 线性衰减:si=si(1−IoU(M,bi))si=si(1−IoU(M,bi)),当IoU超过阈值时。
-
高斯衰减:si=sie−IoU(M,bi)2σsi=sie−σIoU(M,bi)2,更平滑。
-
这样,与 M 高度重叠但可能属于另一个邻近物体的框,其得分降低但不会被完全清除,在后续迭代中仍有机会作为正确检测被选出(如果其得分仍高于阈值)。
-
不需要重新训练模型,即插即用,在密集场景下显著提升召回率。
-
改进效果:在COCO等数据集上提升约1% AP,尤其是对重叠物体。
后续发展:如 Adaptive NMS、Learnable NMS、CenterNet 的 max pooling 替代 NMS 等,继续优化后处理。
如何评估目标检测器?mAP 的计算、IoU 阈值设定。¶
目标检测的核心评价指标是mAP (mean Average Precision)。它综合了分类准确率和定位精度。
关键概念:
-
IoU (Intersection over Union):预测框与真实框的交集面积除以并集面积。用于判断检测是否正确。通常设置IoU阈值(如0.5, 0.75,或0.5:0.95范围),IoU ≥ 阈值视为真正例(TP),否则为假正例(FP)。未检测到的真实框为假负例(FN)。
-
Precision-Recall 曲线:按置信度降序排列所有预测框,每增加一个预测框,计算当前累积的精确率和召回率,绘制曲线。
-
Average Precision (AP):PR曲线下的面积,或通过11点插值(VOC)或积分方式(COCO计算101点插值)得到。AP衡量单个类别的检测性能。
-
mAP:所有类别的AP的平均值。COCO使用多个IoU阈值(0.5到0.95,步长0.05)计算mAP,记为 mAP@[.50:.95],更严格地评估定位精度。
COCO评价指标详解:

计算步骤:
-
收集所有测试图像的预测框(置信度、类别、坐标)和真实框。
-
对每个类别,将所有预测框按置信度排序,并逐一匹配真实框(选择IoU最高且超过阈值的,且该真实框之前未被匹配)。
-
计算累积TP、FP,得到PR曲线。
-
计算PR曲线下面积得到该类AP。
-
对所有类别AP取平均得到mAP。
其他指标:FPS(推理速度)、模型大小等用于实际部署。
小目标检测的难点是什么?FPN 如何帮助解决?¶
小目标检测难点:
-
分辨率低:小目标在图像中占据像素少,经过多次下采样后,在深层特征图上可能只剩1-2个点甚至消失,特征信息极度匮乏。
-
特征表达能力弱:浅层大尺度特征图虽然保留细节,但语义信息不足,难以区分物体和背景噪声。
-
上下文缺失:小目标本身信息有限,更依赖周围上下文来辅助判断。
-
样本不平衡:训练集中小目标占比少,锚点匹配困难,正样本少,模型偏向大目标。
-
定位精度要求高:对小框的微小偏移会导致IoU下降巨大,对检测器回归能力要求高。
FPN (Feature Pyramid Network) 如何解决:
FPN构建了一个特征金字塔,将深层高语义特征上采样并与浅层高分辨率特征横向连接,融合生成具有强语义且高分辨率的特征图。
-
多尺度特征融合:深层特征通过上采样与对应浅层特征相加,使浅层特征获得更丰富的语义信息,从而能够更准确地检测小目标。
-
分层预测:在金字塔的每一层独立进行预测(类似SSD但融合了高语义),使得小目标在较大的特征图(如P2)上检测,大目标在较小特征图(如P5)检测,自然分配多尺度目标。
-
缓解感受野矛盾:融合后,浅层特征既保持细节又有充足语义,小目标定位更准,也减少了背景误检。
-
实验证明,FPN大幅提升了小目标AP(如COCO上小目标AP可提升数个百分点)。
FPN已成为现代检测器不可或缺的组件。
语义分割和实例分割的区别是什么?¶
-
语义分割 (Semantic Segmentation):为图像中的每个像素分配一个语义类别标签(如“天空”、“道路”、“车”),但不区分同一类别的不同个体。输出是一张单通道的类别图,每个像素值对应类别索引。例如,所有车辆被标记为同一个“car”类别,看不出是几辆车。
-
实例分割 (Instance Segmentation):不仅区分语义类别,还要区分同一类别中的不同实例。输出通常为每个实例生成一个掩码,并附带类别标签。例如,图像中有三辆车,实例分割会输出三个不同的掩码,分别标识为“car 1”、“car 2”、“car 3”。
关键区别:
联系:实例分割有时可视为“检测+语义分割”的组合,先检测物体再对每个物体进行前景分割。全景分割则进一步统一两者。
FCN(全卷积网络)如何实现端到端的语义分割?¶
FCN (Fully Convolutional Network) 是语义分割的开山之作,实现了端到端的像素级分类。
核心思想:
-
全卷积化:将分类网络(如VGG)最后的全连接层替换为1×1卷积层,使得网络可以接受任意尺寸输入,并输出空间尺寸对应的特征图。
-
上采样 (Deconvolution/Transposed Convolution 或双线性插值):由于骨干网络的下采样使得最终特征图分辨率远小于输入,FCN使用上采样操作将特征图恢复到输入尺寸,得到逐像素预测。
-
跳跃连接 (Skip Connections):为了融合精细空间信息,FCN将深层特征图上采样后与浅层特征图相加,逐步恢复细节。论文提出了FCN-32s(只从最后层上采样32倍)、FCN-16s(融合pool4)、FCN-8s(融合pool3和pool4),其中FCN-8s分割效果最好,边缘更精细。
工作流程:
-
输入图像经过卷积骨干网络,得到不同阶段的特征图(如1/8, 1/16, 1/32)。
-
对1/32的特征图进行预测并2倍上采样,与1/16的特征图(经过1×1卷积预测)相加,再2倍上采样与1/8的融合,最后8倍上采样至原图尺寸,输出类别概率图。
-
使用逐像素交叉熵损失端到端训练。
意义:FCN证明了全卷积网络可以高效进行密集预测,奠定了语义分割的基础。后续方法改进多集中在扩大感受野、多尺度上下文和更好的上采样策略。
U-Net 的编码器-解码器结构和跳跃连接为何在医学影像分割中有效?¶
U-Net 是医学影像分割中最经典的架构,其对称U型结构和跳跃连接高度适配医学数据的特点。
架构:
-
编码器 (Contracting Path):类似标准卷积网络,逐步下采样提取高维语义特征,同时降低空间分辨率。
-
解码器 (Expansive Path):通过上采样逐步恢复空间分辨率,并与编码器中对应层的特征图进行跳跃连接(拼接后卷积),融合浅层的细粒度位置信息和深层的语义信息。
-
最终输出与原图同尺寸的分割图。
为何有效:
-
医学数据特点:医学图像(如CT、MRI)通常结构固定但边界模糊,目标区域小且类别不平衡。需要同时利用全局上下文(定位器官)和局部细节(精准边界)。
-
跳跃连接:将编码器的高分辨率特征直接传递到解码器,为分割提供精准的位置信息,使得上采样后的预测能够恢复清晰的边界,这对病灶勾画至关重要。
-
对称结构:平衡的深度能够充分提取多尺度特征,且参数量适中,不易在小数据集上过拟合。
-
数据增强与弹性形变:U-Net常配合强大的数据增强(如随机弹性形变),模拟生物组织变形,提高泛化能力。
-
适应小样本:结构设计紧凑,即使只有少量标注数据也能有效训练。
U-Net的成功启发了无数变体(3D U-Net、V-Net、Attention U-Net等),至今仍是医学分割的主流基线。
DeepLab 系列如何利用空洞卷积和空间金字塔池化(ASPP)获取多尺度上下文?¶
DeepLab系列(v1, v2, v3, v3+)逐步改进,重点解决语义分割中的多尺度上下文聚合问题。
空洞卷积 (Atrous/Dilated Convolution):
-
在卷积核元素间插入零(空洞),在不增加参数和不损失分辨率的情况下指数级扩大感受野。
-
空洞率 (dilation rate) r 控制采样步幅。r=1为标准卷积;r=2时,3×3卷积的感受野相当于5×5。
-
DeepLab v1/v2 使用空洞卷积保持特征图分辨率,避免下采样导致的位置信息丢失。
ASPP (Atrous Spatial Pyramid Pooling):
-
由DeepLab v2提出,并行采用不同空洞率的空洞卷积对同一特征图进行采样,以捕获不同尺度的上下文。
-
典型配置:多个3×3卷积,空洞率分别为6, 12, 18, 24(或类似组合),加上一个1×1卷积分支,和一个全局平均池化分支(v3加入)。
-
所有分支输出拼接后通过1×1卷积融合,使每个像素的表示包含多尺度信息。
DeepLab v3:
-
改进了ASPP,加入了图像级特征(全局平均池化),提供全局上下文。
-
串行和并行空洞卷积模块组合。
DeepLab v3+:
- 添加了一个简单但有效的解码器模块,将ASPP输出的高层特征图上采样并与骨干网络的浅层特征融合,恢复目标边界细节,显著提升分割精度,尤其沿边界。
整体工作流程:
-
骨干网络(如ResNet)提取特征,利用空洞卷积保持8x下采样的高分辨率特征图。
-
该特征图送入ASPP模块捕获多尺度上下文。
-
输出通过1×1卷积得到类别得分图。
-
在v3+中,此得分图上采样并与低层特征融合后再上采样到原图大小。
效果:ASPP让模型能够有效处理不同大小的物体,空洞卷积保持了位置精度,DeepLab系列长期占据语义分割的最优性能。
Mask R-CNN 是如何在 Faster R-CNN 上添加分割分支的?损失函数设计。¶
Mask R-CNN 是在Faster R-CNN基础上的扩展,增加了一个分割掩码预测分支,实现了实例分割。
架构修改:
-
骨干网络:与Faster R-CNN共享卷积特征。
-
RPN:生成区域提议,不变。
-
ROI Align:替代ROI Pooling,解决量化不对齐问题,对掩码任务至关重要。
-
三分支头:对于每个ROI,并行应用:
- 分类分支:预测类别概率。
- 回归分支:预测边界框偏移。
- 掩码分支:一个小型全卷积网络,在ROI特征上预测每个类别的二值掩码(尺寸如28×28)。该分支输出一个 K 通道的特征图(K为类别数),每个通道对应一个类别的掩码。
掩码分支细节:
-
输入为ROI Align后的特征(如14×14×256)。
-
经过几个3×3卷积和ReLU,再接一个转置卷积上采样到28×28,最后用1×1卷积输出 K 个类别掩码(sigmoid激活)。
-
训练时,只使用真实类别对应的那个掩码通道计算损失,其他通道忽略。
损失函数:
多任务损失:

解耦掩码预测的优势:类别预测错误时,掩码分支仍能输出该ROI的精细掩码,但最终掩码由分类分支选择的类别通道决定。这种解耦提升了掩码质量和训练稳定性。
Mask R-CNN 以较小的额外计算代价实现了高精度实例分割,成为该领域的标杆。
目标检测中的正负样本不平衡问题是如何解决的?Focal Loss、OHEM。¶
正负样本不平衡:在单阶段检测器中,大部分锚点或位置属于背景(负样本),只有少数包含物体(正样本)。大量易分类的负样本主导了损失梯度,导致模型难以从有意义的正样本中学习,训练效率低下,假阳性高。
主要解决方法:
Focal Loss (RetinaNet):
-
改进标准交叉熵损失,通过调整因子降低易分类样本的权重,聚焦困难样本。
-
公式:

OHEM (Online Hard Example Mining):
-
用于两阶段检测器。在前向传播后,按损失排序所有ROI,只选择损失最大的那些(如top 70%的困难样本)进行反向传播,忽略易样本。
-
这样减少了简单负样本的梯度,使训练更有效。
-
缺点:对噪声敏感,可能采样到异常值。
其他方法:
-
重采样:随机过采样正样本或降采样负样本。
-
GHM (Gradient Harmonizing Mechanism):根据梯度密度协调不同样本的权重。
-
IOU-balanced sampling 等。
Focal Loss 最为经典,成功使单阶段检测器在精度上超越两阶段,是解决不平衡问题的里程碑。
在自动驾驶感知中,目标检测和分割面临哪些特殊挑战?¶
-
实时性与资源限制:车载芯片算力有限,模型必须在极低延迟(毫秒级)下运行,需轻量级架构(如YOLO、MobileNet)和硬件加速。
-
小目标与远距离检测:行人、交通标志在图像中可能只有几十像素,需要高分辨率输入和强特征提取。
-
复杂动态环境:光照骤变、雨雪雾天气、夜间红外、运动模糊、遮挡严重,要求模型鲁棒。需要数据增强(模拟天气)、多传感器融合(相机+LiDAR+Radar)。
-
安全性与可靠性:漏检和误检可能致命,需极低的假阴性(召回率高),同时控制假阳性。常需不确定性估计,融合多模态互补。
-
多类别与细粒度:需区分车辆类型、交通灯颜色和状态、可行驶区域等,类别定义复杂。
-
多任务联合:通常需同时做2D/3D检测、跟踪、分割、深度估计等,模型需支持多任务输出。
-
时序一致性:视频流中检测结果应稳定,避免闪烁,需跟踪器或时序模型(如3D卷积、Transformer)。
-
长尾分布与Corner Cases:罕见场景(如事故、施工路障)数据稀少,需要数据合成、自监督学习提升泛化。
-
标注成本:点云和密集分割标注极其昂贵,自监督预训练和弱监督方法变得重要。
-
传感器标定与同步:多传感器时空对齐误差会严重影响融合效果。
解决策略:常采用多传感器融合、时序模型、坚固的backbone、针对性的数据增强和有效的压缩技术。
什么是全景分割?它如何结合语义分割和实例分割?¶
全景分割 (Panoptic Segmentation) 由Kirillov等人提出,旨在统一语义分割和实例分割,为图像中每一个像素分配一个语义标签和一个实例ID。
-
语义分割:将“stuff”类(无固定形状的背景区域,如天空、道路、草地)标注为类别,不区分个体。
-
实例分割:将“thing”类(可数物体,如人、车、动物)标注出每个实例,赋予不同ID。
-
全景分割:同时处理stuff和things,预测每个像素属于哪个语义类别,并且对于thing类,还要区分是哪个实例。输出是一张全景图,每个像素值编码了语义和实例信息。
任务要求:
-
每个像素必须有唯一的语义标签和唯一的实例ID(stuff类实例ID忽略)。
-
同一个thing实例的所有像素必须具有相同的语义和ID。
-
不同实例不能重叠。
评价指标:PQ (Panoptic Quality):

其中TP是预测段和真实段匹配且IoU>0.5的对,FP是未匹配的预测段,FN是未匹配的真实段。PQ乘性结合了分割质量(IoU)和检测质量(识别召回与精度)。PQ可以分解为 PQ=SQ×RQ,SQ为匹配段的平均IoU,RQ为识别质量(F1-score)。
代表性方法:Panoptic FPN、UPSNet、Mask2Former等。通常基于FPN,添加语义分割头和实例分割头,通过融合策略合并结果。全景分割统一了两个任务,为全面场景理解提供了基准。
近年来视觉基础模型(如 SAM)对分割任务带来了什么变革?¶
SAM (Segment Anything Model) 由Meta AI推出,是一个基于提示的分割基础模型,变革影响深远。
SAM的核心能力:
-
可提示分割:接受点、框、掩码或文本等提示,生成对应物体的分割掩码。单一模型处理多样提示,通用性强。
-
大规模数据与模型:在11M图像、1.1B掩码的海量数据集上训练(数据引擎),模型参数达数亿,具备极强的零样本泛化能力。
-
模糊感知输出:当提示指向模糊区域时(如一个物体的一部分),SAM可输出多个可能的有效掩码(如衣服的领口、整件衣服)。
变革影响:
-
分割任务的范式转变
-
从“训练特定任务模型”变为“使用通用模型+提示/微调”。SAM可以作为一个强大的初始模型,开发者无需从头收集标注数据,只需提供提示或少量标注微调即可完成新分割任务。
-
极大降低了分割应用的门槛,尤其在医学、遥感、农业等标注稀缺领域,可通过点提示快速获得初始掩码,再结合人工修正,效率提升。
-
数据标注革命
-
SAM的数据引擎本身就是通过模型辅助标注循环构建的:人工标注少量,训练模型,模型预标注,人工修正,迭代放大。这为大规模分割数据集构建提供了新范式。
-
可集成到标注工具中,作为交互式分割器,显著加速标注速度。
-
与大型语言模型整合
-
SAM可与其他视觉或语言模型组合,例如 Grounding DINO(开放词汇检测)+ SAM,实现文本引导的分割,走向通用视觉理解。
-
推动通用视觉架构
-
SAM的成功证明了“大数据+大模型”在视觉领域的可行性,促进了更多视觉基础模型(如DINOv2、SEEM)的出现,最终可能统一检测、分割、深度估计等任务。
局限性:SAM在细粒度结构、复杂场景遮挡、实时性方面仍有挑战,且训练成本高。但SAM开启的分割基础模型方向正重新定义视觉任务的解决方式,是计算机视觉领域的里程碑之一。