视觉任务谱系:从图像级预测到实例级理解

使用同一张图像对比图像分类、目标检测、语义分割和实例分割的预测粒度、输出结构与评价指标,并引导进入独立任务模块。

SAME IMAGE · OUTPUT · METRIC
TASK OUTPUT COMPARISON

同一图像下的四类任务输出

PRESET SAMPLE
01

图像分类

Classification

BoVW/CNN demo
类别概率分布 Top-5 Top-1: --
输出单位整张图像 输出结构p(y | image) ∈ R^C 指标Top-1 / Top-5 Accuracy
02

目标检测

Object Detection

Queued
检测结果 0 / 0 个目标
输出单位目标实例 输出结构N × [x1,y1,x2,y2,score,class] 指标IoU / AP / mAP
03

语义分割

Semantic Segmentation

Queued
类别图例 mIoU --
输出单位像素 输出结构H × W class map 指标Pixel Accuracy / mIoU
04

实例分割

Instance Segmentation

Queued
0 个实例 Mask AP --
输出单位独立目标实例 输出结构N × {bbox,class,score,mask,instance_id} 指标Mask IoU / Mask AP
OUTPUT STRUCTURE COMPARISON

任务输出结构对比

四任务在预测单位、输出格式、评价指标与代表方法上的差异

任务 预测单位 输出结构 典型指标 代表方法
图像级分类 整图 1 × C class probability Top-1 / Top-5 Accuracy BoVW, CNN, ResNet
目标检测 目标 N × [x1,y1,x2,y2,score,class] mAP / IoU YOLO, Faster R-CNN, DETR
语义分割 像素 H × W class map mIoU / Pixel Acc FCN, U-Net, DeepLab
实例分割 实例 N masks + bbox + class + id Mask AP Mask R-CNN, YOLACT, SOLO
TASK GRANULARITY

任务粒度递进

从图像级预测逐步走向实例级理解

  1. Image-levelClassification

    整张图像一个类别分布

    p(y | image) ∈ RC
  2. Object-levelDetection

    每个目标一个边界框

    N × [x1,y1,x2,y2,score,class]
  3. Pixel-levelSemantic Segmentation

    每个像素一个语义类别

    H × W class map
  4. Instance-levelInstance Segmentation

    每个实例一张 mask 和 ID

    N × {bbox,class,score,mask,instance_id}
DEEP DIVE MODULES

继续深入独立模块

四任务对比用于建立谱系;下方入口进入拆分后的独立实验模块。

08
语义分割

FCN、1×1 Conv、Upsampling、Skip Connection、mIoU、SegFormer

进入语义分割