WORLD 04 · 前沿模块
多模态理解:图像、文本与语义的联合表示
展示图像、文本、OCR、语音与布局等多模态输入如何进入统一任务管线。
模态 / Encoder / Fusion / Retrieval / VQA / Grounding
交互演示
输入 → 编码器 → Fusion → 任务输出
图像/文本/OCR/音频/布局
Cross Attention
VQA