VLM:视觉语言模型如何理解图像

展示图像 token 与文本 prompt 如何融合,并逐步生成自然语言回答。

图像 Tokens / Prompt Tokens / Cross-Attention / Decoder / 证据
交互演示

图像 Tokens + Prompt Tokens → 回答

street Token 融合