券商观点|汽车行业深度报告:AI系列深度19期-多模态如何从模型拼接走向统一?
2026年8月7日,东吴证券发布了一篇汽车行业的研究报告,报告指出,AI系列深度19期-多模态如何从模型拼接走向统一?。
报告具体内容如下:
投资要点 多模态智能的本质,是把文本、图像、音频、视频等映射进统一表示,并在此基础上完成理解、推理、生成与交互。我们认为,多模态是AI2.0“架构、任务、模态三重收敛”在模态维度的集中兑现。 我们依据“模态对齐发生在流程的哪个阶段”,将多模态的发展过程划分三阶段:2021—2023年为外挂式/组合式阶段,CLIP、Flamingo、BLIP-2、LLaVA等通过视觉编码器、投影层、Q-Former或指令微调把图像接入语言模型;2023—2024年进入原生多模态阶段,Gemini代表多模态能力从接口层前移到预训练阶段;2024年至今进入全模态Omni阶段,GPT-4o将文本、视觉和音频输入输出纳入同一实时交互闭环。 沿三阶段看,主线是对齐位置不断前移、转换损耗逐级下降。外挂式阶段工程效率高,但图像先被视觉编码器压缩再送入语言模型,细节、空间关系和时序信息存在损耗;原生阶段让文本、图像、音频、视频从训练早期共同参与表示学习,提升复杂真实任务中的泛化能力,同时显著抬高数据、训练系统和跨模态对齐门槛;Omni阶段进一步将多模态从“统一预训练”推进到“实时统一交互”,补齐听、看、说的互动性。 我们认为,Omni并非多模态发展的终点,理解与生成统一、多模态深度推理有望成为下一阶段两条核心主线。其一,理解偏重高层语义,生成需保留空间结构与纹理细节,二者存在表征冲突,业界正沿纯自回归、扩散及二者融合等范式,探索共享编码或“编码解耦、主干统一”。其二,以o1为代表的深度推理已由语言扩展至图像、视频和具身场景,但当前仍以语言思维链为主;视觉工具增强、视觉—语言交错推理、多模态潜空间推理等方向正在加速发展,以视觉表示或多模态潜变量为原生载体的推理仍处于早期阶段。
我们认为,数字AI底座模型发展路径已逐渐清晰、价值在于确定性,但其难以实现物理世界的建模闭环;我们认为物理AI将成为物理世界的AI解决方案,从而在AI的当前发展阶段成为增量更大的方向,智能驾驶作为最先跑通闭环的代表场景,我们认为应重点关注。
风险提示:技术迭代不及预期的风险,大模型厂商ARR增速放缓的风险,云服务商资本开支不及预期的风险,智能驾驶及机器人商业化落地不及预期的风险。
更多机构研报请查看研报功能>>
声明:本文引用第三方机构发布报告信息源,并不保证数据的实时性、准确性和完整性,数据仅供参考,据此交易,风险自担。
所有文章未经授权禁止转载、摘编、复制或建立镜像,违规转载法律必究。
举报邮箱:1002263188@qq.com