汽车行业深度报告:AI系列深度15期:Transformer如何开启AI第二次爆发?
投资要点
AI第二次爆发的本质,是模型能力形成方式从“人工设计”转向“规模化学习”。AI1.0时代深度学习仍带有“一任务一模型”特征,CNN、RNN等架构分别服务于图像、文本等专用任务,能力主要停留在基础感知层面。本轮AI2.0以Transformer等通用底座为核心,叠加数据、算力与自监督训练,使模型学习统计结构与通用表征,能力来源由强任务先验和强归纳偏置,转向弱归纳偏置下的规模化学习与涌现。
Transformer成为AI2.0关键基础架构:自注意力机制解决循环网络串行计算和长程依赖瓶颈,更适合GPU并行算力与大规模训练;弱归纳偏置为跨模态迁移提供统一接口,使多类输入逐步进入同一底座体系。2017年以来,主干架构总体稳定,能力提升更多来自MoE、长上下文、多模态融合、后训练与推理机制,而非底层架构切换。
从技术演进看,大模型可概括为“模型能力奠基—人机对齐与行为优化
推理与外部系统赋能”三阶段,并由能力广度和使用效率两条支线贯穿。第一阶段通过预训练、规模扩张和Scaling Laws奠定参数内能力;第二阶段通过SFT、RLHF、DPO等对齐技术提升可用性;第三阶段依托思维链、RAG、工具调用、强化学习推理和任务路由,将能力增量迁移到运行时系统。
GPT系列提供了大语言模型落地产业端的典型路径:GPT-1至GPT-3验证decoder-only架构和规模化泛化能力,InstructGPT与ChatGPT补齐交互入口,GPT-4/GPT-4o推动模型走向多模态交互,o1/o3/o4-mini/GPT-5进一步整合推理时计算、工具使用、多模态任务和实时路由。关键技术通常先在研究与工程验证中形成,再通过产品化入口实现规模扩散。
Scaling Law回答“规模如何转化为能力”,也反映AI2.0资源优化边界的外扩。早期scaling围绕参数量、数据量与训练算力展开,随后纳入能力涌现、计算最优配比、高质量数据、对齐、部署和推理成本等约束。2024年以来,MoE稀疏激活、测试时计算、RL reasoning、扩散Transformer与视频生成等方向,使scaling扩展为训练、推理、数据、架构、对齐与多模态的全链条资源优化框架。
从产业形态看,AI第二次爆发的外在结果是数字AI任务边界初步收敛。Transformer已参与文本、代码、知识库、工具、多模态输入和数字工作流,推动架构、任务与模态三重收敛。产业价值重心也从“设计何种架构”,转向“谁能把规模、数据、对齐、推理与系统工程能力做到位”。但推理阶段增量目前更多体现在语言、数学、代码等可验证任务中,向视觉生成、复杂多模态交互与真实物理闭环迁移仍需验证。
我们认为,数字AI底座模型发展路径已逐渐清晰、价值在于确定性,但其难以实现物理世界的建模闭环;我们认为物理AI将成为物理世界的AI解决方案,从而在AI的当前发展阶段成为增量更大的方向,智能驾驶作为最先跑通闭环的代表场景,我们认为应重点关注。
风险提示:技术迭代不及预期的风险,大模型厂商ARR增速放缓的风险,云服务商资本开支不及预期的风险,智能驾驶及机器人商业化落地不及预期的风险。