多模态大模型再进化:图文音视频统一理解成新战场
·1 分钟阅读

多模态大模型再进化:图文音视频统一理解成新战场

分享

最新一批多模态模型在「跨模态对齐」上取得明显进步,能同时理解一段视频里的画面、语音与字幕,并据此回答复杂问题。

应用想象空间

从视频内容审核、会议纪要到无障碍辅助,统一的多模态理解正在打开一批此前难以自动化的场景。

相关资讯