券商观点|汽车行业深度报告:AI系列深度18期-生成智能如何引入Transformer?
2026年8月7日,东吴证券发布了一篇汽车行业的研究报告,报告指出,AI系列深度18期-生成智能如何引入Transformer?。
报告具体内容如下:
投资要点 生成式视觉的本质,是学习图像数据背后的分布规律,并在文本条件下生成新内容。本轮生成式视觉的核心范式迁移发生在GAN与Diffusion之间;扩散以更稳定的加噪—去噪学习确立生成主干,其潜空间建模与交叉注意力机制,也为Transformer的介入预留了接口。不同于语言领域中Transformer对RNN的快速替代,其在视觉生成任务中沿序列生成、条件编码、骨干替换与多模态扩展四个环节渐进渗透, 以代表论文为锚,我们将2013年以来生成式视觉的发展划分为五个阶段:VAE与GAN奠基(2013—2015年)、GAN主导高真实感生成(2016—2019年)、扩散复兴与理论统一(2020—2021年)、文生图爆发(2022年)、DiT与视频/多模态扩展(2023年至今)。
Transformer进入生成式视觉领域,经历了由局部模块引入到核心架构替换的渐进式演进。早期阶段,Transformer主要作为自回归生成器,将文本与图像表示统一为离散token序列,实现视觉内容的序列化建模:2021年DALL·E将文本token与图像token联合建模,证明图像可被token化、并以类似语言模型的方式生成。随后,随着CLIP等视觉语言模型的发展,Transformer进一步承担文本语义编码与条件信息注入功能,通过跨模态对齐提升对文本指令的理解能力;Imagen与StableDiffusion则推动大语言模型编码器与扩散模型相结合。
随着视觉数据token化与大规模训练范式的发展,Transformer开始进入生成模型的核心模块。2023年DiT以Transformer替代传统扩散模型中的U-Net骨干网络,在潜空间图像patch上建模,验证了视觉生成同样具备规模化扩展潜力;不过其改变的是网络骨干,而非扩散去噪范式本身。进一步来看,Transformer正逐步成为视频与多模态生成系统的统一建模框架,推动生成模型由单图创作向连续时空与多模态交互演进。整体而言,相比语言领域对RNN架构的全面替代,Transformer在视觉生成领域更多体现为渐进式渗透:从生成器、条件编码器到核心骨干网络逐步深化。
我们认为,数字AI底座模型发展路径已逐渐清晰、价值在于确定性,但其难以实现物理世界的建模闭环;我们认为物理AI将成为物理世界的AI解决方案,从而在AI的当前发展阶段成为增量更大的方向,智能驾驶作为最先跑通闭环的代表场景,我们认为应重点关注。
风险提示:技术迭代与产品化落地不及预期的风险;视频与多模态生成的时间一致性与可控性不及预期的风险;大模型厂商ARR增速放缓、云服务商资本开支不及预期的风险;智能驾驶及机器人商业化落地不及预期的风险。
更多机构研报请查看研报功能>>
声明:本文引用第三方机构发布报告信息源,并不保证数据的实时性、准确性和完整性,数据仅供参考,据此交易,风险自担。
所有文章未经授权禁止转载、摘编、复制或建立镜像,违规转载法律必究。
举报邮箱:1002263188@qq.com