2026-06-15·1 分钟阅读 多模态大模型再进化:图文音视频统一理解成新战场 分享 微博 复制链接 分享 最新一批多模态模型在「跨模态对齐」上取得明显进步,能同时理解一段视频里的画面、语音与字幕,并据此回答复杂问题。 应用想象空间 从视频内容审核、会议纪要到无障碍辅助,统一的多模态理解正在打开一批此前难以自动化的场景。