STATION 08 · FRONTIER VISION

CV 前沿探索:从专用算法到统一视觉模型

理解计算机视觉从手工特征、CNN、检测分割,到视觉基础模型与统一视觉任务接口的发展方向。

指令提示语 (Instruction Prompt) segment depth normal edit
视觉核心 通用多任务模型
语义 深度 法线 编辑
解码结果 掩码 · 几何 · 编辑
  1. 手工特征SIFT / HOG
  2. CNN 表征可学习特征
  3. 检测与分割多任务检测头
  4. 视觉基础模型SAM / DINO
  5. 多模态视觉模型VLM / CLIP
  6. 统一视觉模型通用多任务
统一任务接口 · UNIFIED TASK INTERFACE

同一张图像,不同任务输出不同结果

输入图不变,只切换任务接口;输出以预设视觉层模拟,不调用真实模型。

指令提示语 (Instruction Prompt)Generate a visual task output.
生成图像结果 (RGB Output)任务输出
解码结构化结果 (Decode Result)结构化结果
输入图像 (INPUT IMAGE) 城市街道样例 (City sample)
生成图像结果 (RGB OUTPUT) 任务输出
预设输出 (PRESET OUTPUT)解码结果 (Decoded result)
前沿基础模型 / FOUNDATION MODELS

前沿模型卡片

CLIP / 对比图文对齐

图文对齐与开放词表理解

把图像和文本放进同一语义空间,使分类不再局限于固定标签。

代表任务
开放词表分类、检索
系统关系
CNN 表征进入语义对齐
进入 CLIP 页
DINO / 自监督蒸馏

自监督视觉表征

不用人工标签也能学习稳定视觉特征,支撑迁移和密集预测。

代表任务
特征提取、聚类、检测预训练
系统关系
延伸角点特征与 CNN 学习
SAM / 分割一切

提示式分割

用点、框或粗略区域作为提示,把分割变成可交互接口。

代表任务
交互分割、自动 mask
系统关系
连接检测框与分割 mask
VLM / 视觉语言模型

视觉语言模型

把图像理解、语言推理与任务指令组合到同一个对话式入口。

代表任务
视觉问答、指代表达
系统关系
从高层任务走向多模态推理
进入 VLM 页
VISION BANANA / 统一任务模型

把视觉任务输出统一为 RGB 图像式结果

以图像生成器作为通用视觉学习器,将分割、深度、法线、边缘等任务转为可解码可视化图。

代表任务
RGB 任务图、解码评测、图像编辑
系统关系
承接检测分割并进入统一接口
进入案例页
专用与通用模型 / SPECIALIST VS GENERALIST

专用模型 vs 统一模型

传统专用路线

输入图像 (Image)
分类器 (Classifier) 检测器 (Detector) 分割器 (Segmenter) 深度估计 (Depth Net)
专属任务输出 (Specific Output)

统一模型路线

分割 (seg) 框 (box) 深度 (depth) 边缘 (edge) 图像 + 提示词 (Image + Prompt) 通用双阶段视觉模型 (Generalist Vision Model) 统一输出 (Unified Output)
知识系统演进 / SYSTEM MAP

与本系统的关系

  1. 图像基础

    理解像素、颜色、灰度和图像表示。

  2. 卷积与滤波

    从局部窗口和卷积核理解特征提取。

  3. 边缘轮廓

    把结构边界作为视觉理解的低层线索。

  4. 角点特征

    学习稳定关键点、描述子和匹配关系。

  5. CNN 学习

    从手工特征转向端到端可学习表征。

  6. 分类与任务谱系

    理解高层任务输出结构和评价指标。

  7. 前沿探索

    把任务接口推向基础模型、多模态和统一输出。

技术探讨 / DISCUSSION

前沿模型并不替代基础算法

本板块不调用真实大模型,不声称复现论文结果,只做前沿思想和任务接口的可视化展示。

基础算法仍然重要

像素、卷积、边缘和特征仍是理解模型输出的语言。

统一接口不等于万能模型

统一入口降低使用门槛,但评测、鲁棒性和边界仍需谨慎。

生成式视觉带来新范式

任务输出可以被组织成图像生成问题,再被解码为结构结果。

当前页面是思想可视化

所有输出均为预设演示层,用于帮助建立概念连接。