WORLD 04 · 前沿模块
VLM:视觉语言模型如何理解图像
展示图像 token 与文本 prompt 如何融合,并逐步生成自然语言回答。
图像 Tokens / Prompt Tokens / Cross-Attention / Decoder / 证据
交互演示
图像 Tokens + Prompt Tokens → 回答
street
Token 融合