特斯拉 FSD 的训练分为两个阶段:模仿学习 + 强化学习。
特斯拉 FSD 的训练分为两个阶段:模仿学习 + 强化学习。
先用海量人类驾驶数据训练模型,让它学会“像人一样开车”。但仅靠模仿,模型很难超越人类,因为训练数据的质量有上限。
这时候就需要强化学习登场。
强化学习的核心是:在模拟器里让模型疯狂试错。
模型会生成大量不同驾驶轨迹(刹车、转向、变道等),每条轨迹都会被打分。安全、流畅的轨迹得分高,不安全或犹豫的轨迹得分低。
经过数百万次迭代,模型会逐渐内化“更好的驾驶方式”,而不是单纯复制人类。
FSD 14 的模型参数量是 13 版本的 10 倍,还引入了专家混合(MoE)架构,让模型在车端也能高效运行。
强化学习阶段有效弥补了真实世界数据无法覆盖的极端场景,让 FSD 在复杂情况下比大多数人类驾驶员更稳定、更果断。
一人公司做 AI Agent 能融到 2.5 亿刀,FSD 用强化学习跑出超越人类的驾驶,这可能是 AI 时代的共同特征。