World 04 · Module A
ViT / Transformer:把图像切成 Token
从卷积局部窗口到全局注意力表征,理解视觉 Transformer 的输入、计算和输出结构。
机制拆解 · 教学动画
预设样例 · 非真实推理
Patch Token / Self-Attention / CLS / 表征
交互演示
图像 → Patch → Token → Transformer
城市街道
224×224×3
Patch 网格