ViT / Transformer:把图像切成 Token

从卷积局部窗口到全局注意力表征,理解视觉 Transformer 的输入、计算和输出结构。

机制拆解 · 教学动画 预设样例 · 非真实推理 Patch Token / Self-Attention / CLS / 表征
交互演示

图像 → Patch → Token → Transformer

城市街道 224×224×3 Patch 网格