东方财富网 > 研报大全 > 宏观研究报告正文
宏观研究报告正文

汽车行业点评报告:AI系列深度11期:大模型如何进行模仿与强化学习?

www.eastmoney.com 东吴证券 黄细里 查看PDF原文

K图

  投资要点

  智能体学习行动主要有两条路径:模仿学习,即从专家示范中学习状态到动作的映射;强化学习,即在环境交互中依据奖励信号优化策略。二者并非对立,模仿学习通常更快、更稳,强化学习在可构造奖励、仿真环境或可验证任务中更可能突破示范上限,工程实践往往采用先模仿形成初始策略、再强化优化的组合范式。

  强化学习解决的是没有逐步标准答案、只有事后奖励反馈的问题,核心难点包括功劳分配、探索与利用、奖励稀疏和样本效率。其思想源于行为主义心理学和贝尔曼MDP,经Sutton与Barto体系化,并在DQN、AlphaGo、RLHF、RLVR和推理模型中持续演进。近年来,强化学习从补充性优化工具转向后训练、偏好对齐和可验证推理的重要方法。

  模仿学习的本质,是把状态到动作的映射转化为监督学习。行为克隆优点是训练快、稳定性较高,自动驾驶早期ALVINN、机器人示教和VLA预训练都体现这一思路;局限在于分布漂移和示范者上限,模型一旦进入训练数据未覆盖状态,错误会逐步累积。逆强化学习、DAgger和GAIL等方法,均围绕缓解这一问题展开。

  在大模型训练中,强化学习主要用于后训练而非预训练。预训练通过自监督学习通用表征,监督微调本质上是对高质量人工示范的模仿,RLHF和RLVR再通过人类偏好或可验证奖励进行精修。AlphaGo先学棋谱再自我对弈,ChatGPT先SFT再RLHF,机器人VLA先示范预训练再仿真或真实环境强化,均体现该组合范式。

  落到智能驾驶和具身智能,纯模仿路线面临更强约束。物理世界试错代价高,示范数据多来自平均人类表现,长尾和危险场景天然稀缺;因此趋势是用模仿学习获取初始策略,再依靠仿真、世界模型和强化学习补足长尾。杨立昆“蛋糕论”强调自监督是理解世界的主体,强化学习样本效率较低;但在可验证推理、偏好对齐和策略优化环节,强化学习的重要性正在上升。

  我们认为,数字AI底座模型发展路径已逐渐清晰、价值在于确定性,但其难以实现物理世界的建模闭环;我们认为物理AI将成为物理世界的AI解决方案,从而在AI的当前发展阶段成为增量更大的方向,智能驾驶作为最先跑通闭环的代表场景,我们认为应重点关注。

  风险提示:技术迭代不及预期的风险,大模型厂商ARR增速放缓的风险,云服务商资本开支不及预期的风险,智能驾驶及机器人商业化落地不及预期的风险。

郑重声明:东方财富发布此内容旨在传播更多的信息,与本站立场无关,不代表东方财富观点。建议用户在阅读研报过程中,请认真仔细阅读研报里的风险提示、免责声明、重要声明等内容,用户据此操作风险自担。

数据来源:东方财富Choice数据

郑重声明:东方财富网发布此信息的目的在于传播更多信息,与本站立场无关。东方财富网不保证该信息(包括但不限于文字、视频、音频、数据及图表)全部或者部分内容的准确性、真实性、完整性、有效性、及时性、原创性等。相关信息并未经过本网站证实,不对您构成任何投资建议,据此操作,风险自担。

信息网络传播视听节目许可证:0908328号 经营证券期货业务许可证编号:913101046312860336 违法和不良信息举报:021-61278686 举报邮箱:jubao@eastmoney.com
沪ICP证:沪B2-20070217 网站备案号:沪ICP备05006054号-11 沪公网安备 31010402000120号 版权所有:东方财富网 意见与建议:4000300059/952500