模型路线趋同之后,Physical AI的胜负手变了
物理AI新瓶颈已出现
本条来自 量子位(AI / 中文),聚焦 technology。 过去一年多, VLA、世界模型、基座模型、数据闭环 等等,几乎都是头部智驾和具身智能公司频频提及的热词。
物理AI新瓶颈已出现
- 不同技术路线各有侧重,最终穿透到技术底层,指向的问题却越来越趋同——
- 过去一年多, VLA、世界模型、基座模型、数据闭环 等等,几乎都是头部智驾和具身智能公司频频提及的热词
物理AI新瓶颈已出现
过去一年多, VLA、世界模型、基座模型、数据闭环 等等,几乎都是头部智驾和具身智能公司频频提及的热词。
越来越多AI公司开始尝试让模型进入真实世界,让机器具备理解环境、预测变化和执行行动的能力。
不同技术路线各有侧重,最终穿透到技术底层,指向的问题却越来越趋同——
那就是AI如何从真实世界获取数据,如何形成对环境的理解、把理解转化为行动,又如何根据行动结果继续学习。
而当路线逐渐收敛,真正的瓶颈也开始浮出水面。
智能驾驶兴起至今,研究对象曾历经多次变迁。简单梳理下来可分为三个阶段:
早期的驾驶系统,是一套 高度模块化 的软件系统。 感知 负责识别车辆、道路和行人, 预测 负责推测其他交通参与者的运动, 规划和控制 再决定车辆的具体行动。
每个模块解决一个相对明确的问题,也拥有相对独立的指标。
端到端模型 盛行后,行业开始减少人工规则和模块接口,让模型 直接从传感器输入生成轨迹或控制信号 。
直到 物理AI 热潮席卷,又把研究对象向前推进了一步。
在这一目标下,行业逐渐分化出了不同的主流技术表达,当前已大致收敛成 两条明线加一条暗线 。
两条明线中,其一是 VLA (视觉—语言—动作),把视觉信息、语义理解和行动生成放进同一个模型体系,让AI看到环境、理解场景,直接作出行动。 理想、小鹏 都押在这一路线上。
另一条明线以 世界模型 为核心,重点学习环境如何随时间和动作发生变化。
世界模型进入场景生成、闭环仿真、数据生产和模型评测等环节,既可以帮助模型学习物理世界的演化规律,也能为其他行动模型提供训练和验证环境。
华为WEWA、蔚来NWM 都是世界模型路线的代表。
而在VLA和世界模型之外,还有一条暗线是 物理AI基座 。
基座模型通过大规模物理世界数据预训练,学习环境变化、物体关系和世界运行规律,再通过少样本或后训练的方式适配不同任务。
基座模型严格来说,与VLA、世界模型并不并列,而是两条明线共同奔赴的方向。
两条明线的边界肉眼可见地趋于模糊,二者间的关系已从路线选择走向能力协同。
当前,行业已经拥有这条链路中的大部分技术组件,然而各环节之间却还存在几层 “断裂” 。
物理AI需要海量真实数据,但数据规模扩大并不会自动产生对世界的理解。模型需要从数据中学习空间关系、时间变化、行为规律和行动后果。
模型在真实环境中暴露出什么能力缺口,又会决定下一轮需要收集、筛选或生成什么数据。
因此, 数据与模型之间需要持续反馈 ,由模型发现问题,数据系统补充相应场景,训练系统重新学习,再通过评测和真实环境确认模型是否获得了新的能力。
第二层“断裂”发生在视觉与行动之间。 模型看见一个场景,甚至理解其中的关系,也不代表它能够形成稳定行动。
物理AI区别于传统AI最明显的一点,也正是视觉与行动之间的关系。
假设车辆识别出前方行人正在靠近路口,并判断对方可能横穿道路,接下来还有一系列问题需要解决,比如应该在什么位置开始减速,减速幅度多大,是否需要提前变道,周围车辆可能怎样响应,整个动作又能否在实时算力下平稳执行等等。
这一过程中,视觉和语义理解需要转化为连续、实时、可验证的动作。
VLA承担了连接认知与行动的任务,但这条连接仍然需要未来预测、策略训练、闭环评测和真实验证共同支撑。
世界模型和仿真系统可以低成本生成大量场景,用于训练、测试。
理论上,模型可以在虚拟环境中经历无限次测试,学习各种复杂情况,但真实世界的情况始终更加复杂。
交通参与者的行为往往具有不确定性,传感器会受到天气、光照和遮挡影响,大量长尾事件很难被仿真系统完整建模。另外,模型在虚拟环境中的提升,未必能够等比例转化为真实表现。
物理AI必须要建立起一条双向链路:真实世界中的问题进入仿真和训练,仿真中获得的能力再回到真实环境验证。
这些横亘在数据、认知、行动和真实世界之间的断裂层,横跨数据、算法、仿真、Infra、产品和工程团队,看似属于不同技术方向,实际上都指向同一个问题—— 物理AI需要一套能够持续学习和进化的系统 。
由此,技术问题开始越过技术部门边界,延伸到技术如何被组织,放进同一个闭环。
现下,物理AI公司的当务之急,就是如何弥合断裂层,把整条链路放进同一个研究闭环。
不过在建立闭环之前,还需要解决研发体系中的两层 「摩擦」 。
模型暴露出的不足,需要能够反馈给数据系统;真实环境中的问题,需要能够进入仿真和训练流程;训练后的能力,也需要重新回到现实场景接受检验。
真正的难点在于,这些环节并不是彼此独立存在的。任何一个环节连接不畅,投入再多的数据、算力和模型规模,也可能只带来局部指标的提升。
通常来说,一家公司的基础模型、VLA或世界模型、数据、仿真和AI Infra等内容会由不同团队负责。
每个团队拥有自己的专业目标和工作节奏,但矛盾就在于,完整闭环要求所有环节围绕同一个模型问题快速反馈。
本条目归入「Technology AI」垂直,涉及真实话题:technology。
· 市场:关注 technology 对相关品类与竞争格局的潜在影响。
· 消费者:受众行为与偏好变化值得追踪。
· 品牌:本动向对品牌资产建设的启示。
· 渠道:内容分发与触点组合(社媒 / 电商 / 线下)的协同值得复盘。
· 核心话题:technology。
· 可思考:如何把「technology」的洞察,转化为可衡量的内容与增长动作?
面试中可引用「模型路线趋同之后,Physical AI的胜负手变了」:围绕 technology,说明你对行业动向的判断与可落地动作。
本条目相关英文术语可在「商务英语」模块按话题检索,用于外企面试表达训练。
越来越多AI公司开始尝试让模型进入真实世界,让机器具备理解环境、预测变化和执行行动的能力。…