多模态理解:图像、文本与语义的联合表示

展示图像、文本、OCR、语音与布局等多模态输入如何进入统一任务管线。

模态 / Encoder / Fusion / Retrieval / VQA / Grounding
交互演示

输入 → 编码器 → Fusion → 任务输出

图像/文本/OCR/音频/布局 Cross Attention VQA