WORK / ArchiveKelly Personal Marketing Intelligence OS
阅读READ
每日简报Daily Brief市场情报Market Intelligence品牌案例库Brand Casebook公司研究Company Dossier
收听与学习LISTEN & LEARN
播客Podcasts商务英语Business English
创作CREATE
创意工作室Creative Studio视觉素材库Visual Library作品集Portfolio
职业CAREER
面试题库Interview Bank营销工具箱Marketing Toolkit
资料库LIBRARY
收藏集Collections观察名单Watchlists来源体系Sources
我的Profile设置Settings
⌘K
更新于 —KKelly
今日情报播客来源我的
WORK / ArchiveKelly Personal Marketing Intelligence OS
阅读READ
每日简报Daily Brief市场情报Market Intelligence品牌案例库Brand Casebook公司研究Company Dossier
收听与学习LISTEN & LEARN
播客Podcasts商务英语Business English
创作CREATE
创意工作室Creative Studio视觉素材库Visual Library作品集Portfolio
职业CAREER
面试题库Interview Bank营销工具箱Marketing Toolkit
资料库LIBRARY
收藏集Collections观察名单Watchlists来源体系Sources
我的Profile设置Settings
⌘K
更新于 —KKelly
WORK / ArchiveKelly Personal Marketing Intelligence OS
阅读READ
每日简报Daily Brief市场情报Market Intelligence品牌案例库Brand Casebook公司研究Company Dossier
收听与学习LISTEN & LEARN
播客Podcasts商务英语Business English
创作CREATE
创意工作室Creative Studio视觉素材库Visual Library作品集Portfolio
职业CAREER
面试题库Interview Bank营销工具箱Marketing Toolkit
资料库LIBRARY
收藏集Collections观察名单Watchlists来源体系Sources
我的Profile设置Settings
⌘K
更新于 —KKelly
Market Intelligence/InfoQ 中文

机器人大脑之争进入深水区:为什么物理世界需要从头设计模型

点击查看原文>

·2026.08.12·17 min 阅读
事件背景基于真实抓取数据整理

本条来自 InfoQ 中文(AI / 工程),聚焦 technology。 AI摘要 具身智能在WAIC首次成体系亮相,技术重心从演示转向真实场景落地,“机器人大脑”成为关键突破点。蚂蚁灵波发布全栈大脑2.0,含6款具身原生模型,其中LingBot-VA 2.0为行业首个具身原生世界动作模型。

Original Intelligence基于真实抓取数据整理

点击查看原文>

  • InfoQ:所以大家现在初步判断,端到端这个方向暂时还是比较难走通?
  • AI摘要 具身智能在WAIC首次成体系亮相,技术重心从演示转向真实场景落地,“机器人大脑”成为关键突破点

点击查看原文>

AI摘要 具身智能在WAIC首次成体系亮相,技术重心从演示转向真实场景落地,“机器人大脑”成为关键突破点。蚂蚁灵波发布全栈大脑2.0,含6款具身原生模型,其中LingBot-VA 2.0为行业首个具身原生世界动作模型。

强调“具身原生”需从数据、目标、架构三方面重构,而非迁移视频模型;全栈拆解感知、对齐、预测、行动能力以渐进验证;终局架构未定前,分模块验证再融合是务实路径。

适合机器人算法工程师、AI架构师、具身智能产品负责人阅读。

如果说今年 WAIC 最直观的变化是什么,具身智能的超强存在感无疑是其中之一。在 H3 馆内,超过 200 家具身企业的集中亮相,让这一领域第一次以成体系的方式出现,甚至被抬升至与智算并列的核心赛道之一。

与往年相比,一个重要的变化正在发生:“表演型机器人”不再是主角,搬运、巡检、分拣、整理等更贴近真实场景的能力展示显著增多。决定机器人从“可看”走向“可用”的关键变量,是那个不那么直观的部分:“机器人大脑”。

今年以来,围绕 VLA 与世界模型的技术路线讨论持续升温。此前,蚂蚁灵波首席科学家沈宇军提出过一个颇为直接的判断:将数字世界的视频模型通过微调迁移到机器人场景,本质上仍是一种路径依赖,更像阶段性的“捷径”,而非面向物理世界的终局解法。这一判断来自一位生成模型出身的研究者,也让“具身原生”这个概念有了更加具体的技术含义。

沈宇军的判断并不只是一句路线主张。本届 WAIC 前夕,蚂蚁灵波发布了全栈大脑 2.0,一次推出 6 款模型,覆盖从空间智能、灵巧操作到环境反馈的全链路,让机器人看得更清楚、想得更明白、干得更利索。其中,LingBot-VA 2.0 是行业首个具身原生世界动作模型。

按照沈宇军的解释,在终局架构尚未确定时,蚂蚁灵波选择先把感知、对齐、预测和行动等能力拆开验证,再寻找融合方式。“全栈”解决的是怎么拆问题,“原生”解决的是从哪里开始——数据、训练目标和模型架构,都要服务于机器人在物理世界中的感知与行动需求。

日前,蚂蚁灵波宣布启动融资,首轮拟募资 15 亿元,并计划于年底完成第二轮融资。消息一出,行业目光随之聚拢。蚂蚁灵波以“全栈大脑”践行“具身原生”的技术路线,也由此迎来更公开的行业检验。

下面是我们在 WAIC 现场与沈宇军展开的一场专访对话,试图追问几个更深层的问题:具身数据的标准为何迟迟没有收敛?VLA 和 VA 路线并行探索的终极目标是什么?“具身原生”为何要从头开始?

InfoQ:过去几年,大语言模型的发展依靠互联网几十年积累的数据红利,而物理世界的数据被您称为“新大陆”。那么要找到这片新大陆,当前最核心的难点是什么?目前行业有没有初步形成一些数据采集标准?

沈宇军: 在具身智能赛道,数据还没有形成具体的标准。每一家公司想要的数据形式,包括包含哪些模态以及每种模态需要达到什么样的精度,都没有共识。例如,有的公司认为只需要头部一个摄像头就够了,有的走五指夹爪的路线,还有的采用遥操作。头部摄像头代表的模态是视觉。但即便是头戴式设备也分很多种:有些只配置上方两个摄像头,提供视觉和深度信息就足够了;有些则还需要增加更多摄像头,目的是获取头部位姿信息,会运行局部 SLAM。

从头部的数据来看,我们到底仅需要视觉,还是也需要头部的位置信息?这是一个问题。关于手部,夹爪方案也面临同样的问题:到底只需要通过头部视觉看到手的骨骼就足够,还是还需要手本身的姿态信息,抑或进一步需要手部触觉?在模态尚不确定的情况下,很难谈得上形成标准化的数据采集方式并大规模落地应用。因此,数据采集目前仍处于行业共同探索哪种数据格式对机器人发展更优的阶段。

数据格式之所以还未形成共识,还有一个原因是技术路线本身也没有收敛。没有人确切知道大脑整个训练过程中到底需要哪些模态。第二,即使把模态确定下来,每种模态的数据到底需要达到什么样的精度或质量标准,也尚未确定。近期感受较深的是手部位姿这件事情,有的人要求毫米级精度,有的人要求厘米级精度,到底需要什么精度,目前大家也还在探索。可能大家普遍认为精度越高越好,但精度越高必然带来成本越高,成本越高就越难规模化。那么,如何在精度也就是数据质量和成本之间取得平衡?这是一个非常关键的问题。

整体而言,数据之所以难以收敛,原因在于数据迭代与模型迭代是高度耦合的。目前行业还存在一个断层:做数据或传感器的团队可能有自己的一套指标体系,但做模型的人对数据却有不同的关注维度。假设一个数据有十个维度可以优化,而模型可能只重点关注其中五个。理想情况下,如果数据要与模型健康共生发展,就应该重点优化那五个维度。但现在做模型的人也提不出哪五个维度是最重要的,因此做数据的人只能尽可能地把所有模态、所有指标都向前推进。但全面推动就会导致成本急剧上升。所以核心还是标准未定,因此很难做取舍,这是当前的一个现状。

InfoQ:目前机器人涉及的数据大概包括遥操数据、第一人称数据和仿真数据。蚂蚁灵波本身也在数据训练和采集方面有所布局,那么在这几类数据之间,您会如何做取舍?如何在数据质量和成本之间寻找平衡?

沈宇军: 我们当前主要采用的是真实数据,但真实数据不完全等同于真机数据。我们认为有两类真实数据更为关键。第一类是真机遥操作数据,因为无论模型优化到什么程度,这一类数据都很难绕过。机器人毕竟要在物理世界中执行任务,它的大脑必须熟悉自己的身体。熟悉身体最好的方式,就是直接获取从身体本身采集到的数据。这一类数据可能不需要体量非常大,但质量要求非常高。

另一类需要上量的是真实的无本体数据。例如通过第一人称设备采集的数据,或者现在很多人使用的夹爪采集的数据,未来可能还会有手套方案。这类数据同样比较珍贵,因为它代表了人类最真实的行为方式,也就是人如何去做一件事情。例如,在仿真中我们也会让机器人去执行任务,但机器人的动作方式与人的下意识反应有时并不相同。因此,这一类数据非常关键,而且它比真机遥操作数据更容易上量。

互联网数据可以作为打底的数据。但互联网数据在向物理世界迁移时,有些模态是无法补全的。不过互联网数据体量大,而且确实蕴含了一定的知识,这可能是我们在模型训练阶段会重点关注的数据类型。

InfoQ:行业最近也在大量讨论仿真数据。对于具身智能来说,仿真是否会成为解决数据问题的重要路径?对于希望做通用机器人的方向,仿真数据是否更有价值?

沈宇军: 我认为,如果解决的是一个具体场景的问题,比如自动驾驶领域,仿真用得比较多,因为这是一个场景相对明确、任务也比较清晰的领域。在这种情况下,为它专门开发一套仿真系统,包括物理引擎等,是划算的,目的就是把这一类场景做得非常扎实。从这个角度看,无论是将仿真数据引入训练,还是用仿真来做评测,都是非常合理的。

但灵波的定位是希望做通用机器人。对于通用机器人来说,如果希望它完成各种各样的事情,而为了每一类事情都去构建一套仿真环境,我认为就有些过于沉重了。短期内,还没有出现一个真正优秀的仿真引擎,能够支持完成所有任务。而且从成本角度来看,构建仿真并不一定比获取真实数据更划算。此外,在采集数据时,我们仍然关心人是怎么做一件事情的。比如打开一瓶水,人可以有很多种方式,但在仿真里很难模拟出人最真实的反应,也就是拿到一瓶水后下意识会做什么动作。所以从这个角度讲,从人出发或者说“以人为本”的数据,在模型训练尤其是预训练阶段可能更为关键。

InfoQ:大语言模型的发展证明了数据红利和 scaling law 释放了巨大潜能。但物理世界的数据更加碎片化。具身智能的数据飞轮什么时候可能出现?未来机器人是否有可能不需要针对每一个领域、每一个场景单独采集数据,就能够获得泛化能力?

沈宇军: 从整体来看,我对此还是比较乐观的。乐观的原因在于,前面提到数据标准不确定,是因为模型路线也不确定,这两者相互牵制,使得任何一方都难以向前迈进。但最近几个月,模型路线正在慢慢收敛。一旦模型先迈出一步,数据就会跟上;数据跟上之后,模型获得更多数据,可能会更加聚焦,路线也会进一步收敛;然后模型会提出新的数据需求,数据又会根据新的需求变得更加规模化。整体趋势是比较乐观的。

但我不敢轻易谈 scaling law。只能说,在现有数据规模化的过程中,我们能看到数据规模越大,模型智能确实有所提升。但是这种趋势未来能持续多久,是指数级上升,还是呈对数趋势下降,还不好判断。所以我更倾向于谈论趋势。目前还没有看到拐点出现,但模型开始出现收敛趋势,这对整个数据领域的发展是有好处的。

InfoQ:您认为现在具身大脑的模型路线正在收敛。但从行业观察来看,大家发布的大脑模型形态和名称反而越来越多。比如灵波这次发布全栈大脑 2.0,一次推出 6 款模型。这个过程是工程化落地阶段的妥协,还是机器人长期的大脑形态本身就应该拆分和解耦?如果解耦,全栈优势应该如何定义?

沈宇军: 很多朋友也问过我,为什么上一次 1 月初发布时是 4 个模型,这次变成了 6 个,会不会以后变得更多。灵波开发模型并不是一个批量化模式,并非一定要一次做很多。正好借这个机会澄清一下:灵波做的每一个模型,都是在解决一个具体的技术问题。这个技术问题并不一定意味着该模型最终会直接用于某一台机器人的控制。机器人大脑当前还是一块比较大的拼图,中间需要很多技术能力,而这些技术能力目前都不成熟,或者说在物理智能这个方向上还没有被验证。如果一开始就做一个统一的大模型,直接开发一整块拼图,失败之后可能连问题出在哪一部分都无法判断,那这块拼图几乎是无法拼起来的,因为中间变量太多。

InfoQ:所以大家现在初步判断,端到端这个方向暂时还是比较难走通?

沈宇军: 无论从数据规模还是当前技术发展阶段来看,真正意义上的机器人端到端控制距离实现还有一定距离,但它一定是最终目标。端到端更像是一块大的拼图,或者说一个最终的大模型,需要非常多的技术能力来支撑。我们这次发布的多个模型,每一个解决的都是其中一部分技术能力。当这些技术能力逐渐成熟,从最初一块拼图都没有,慢慢形成两块、三块,甚至七块、八块的时候,很多东西就会逐渐融合。但这里需要注意,技术能力的融合并不一定意味着模型本身一定要融合,而是模型背后某些能力在逐渐融合。我此前也喜欢打个比方,我们发布模型可能会经历一个“书越读越厚,然后再越读越薄”的过程。

短期来看,模型数量可能会越来越多,是因为我们不断触碰更多的技术难题。当某些技术难题在我们看来已经取得一定突破后,才会把模型发布出来。等到能力积累到一定程度,我们才会尝试把一些东西组合起来。技术能力验证通过之后,下一步才是解决如何融合的问题。所以从这个角度理解,全栈并不是简单意味着一个模型包含所有东西,而是意味着我们在不同技术方向上都有探索和积累,从表征学习到规模化训练,到训练效率,再到因果建模等训练范式,都取得了一定进展。未来当这些能力进一步成熟之后,我们也希望能够向行业解释这些能力应该如何组合。

InfoQ:大家现在把模型进行解耦和分层,可能工程实现上会更容易。但当这些细分模型最终需要协同工作,由同一个大脑进行指挥时,如何解决模型之间的衔接问题?另外,如果通过一个智能体或者框架去协调不同模型,会不会牺牲机器人的时效性和反应能力?

沈宇军: 我并不认为时效性是最大的问题,它们属于不同的维度。在我看来,一个端到端模型可能需要解决几个核心问题。第一个是输入端的问题,也就是能不能把各种模态的信息拉到同一个维度的隐空间或者特征空间里。这一点非常关键,有些类似于人如何把眼睛看到的信号、皮肤感受到的信号转换成神经信号。首先需要解决的是能不能从输入端把不同模态变成高质量的特征。

第二个是模型端的问题。很多人可能会说,那我们直接融合就好,但前提是每一个模态本身是否已经完成了很好的特征学习。如果一个模态,比如视觉,本身都没有很好地理解自己的特征,就很难期待它与其他模态融合后能得到好的结果。所以第一个关键点是单模态能力,第二个关键点是多模态融合能力。融合之后,还涉及效率能力以及对未来的预测和预判能力。从模型维度看,它本身需要具备这些能力。

第三个维度是输出,也就是机器人最终如何把动作执行得更加完整。这更多可能与数据相关,需要让模型学习得更好。因此,现在并不是简单讨论到底要不要分层,而是技术问题本身一定会被拆开来看:模态理解到底做得好不好,模态之间融合得好不好,模型范式能不能支持高效推理和预测,最终动作执行能力够不够强。

我们现在所做的多个模型,就是在解决这些问题中的一个或者几个。当这些问题逐渐被解决之后,我们就认为某一部分能力已经形成,然后把这块拼图放在那里。随着这些碎片越来越完整,未来才有机会呈现出大家所期待的端到端模型。

InfoQ:那我们再聊一聊这次灵波具体发布的模型。我个人比较感兴趣的是视频生成模型 LingBot-Video,它和我们常见的 Sora 类视频生成模型相比,主要面向物理世界,或者说真正指导机器人理解物理世界。那么它和内容生产领域的视频生成模型有什么区别?它对于物理世界规律到底理解到了哪一层?

沈宇军 :这个模型主要解决两个问题。第一个是推理效率。虽然现在很多闭源视频生成模型已经使用了 MoE 架构,但开源领域还没有类似 MoE 架构的模型可供使用。机器人推理时一定需要速度快,所以在 LingBot-Video 这个模型里,我们希望验证灵波有没有能力训练出一个 MoE 基座模型。第二个问题是物理合理性,LingBot-Video 生成的视频真实感比较好。在预训练过程中,我们加入了很多机器人相关的数据,无论是操作数据还是移动数据。我们希望在这个过程中,对物理规律的强化下很大功夫,让模型能够更合理地预判物理世界。

这样做的原因在于,数字世界内容生成模型更在乎创造性,希望看到人在天上飞、跑得比火车还快等场景。而我们更关注的是对物理规律的建模。所以在模型特性的发力点上,我们和数字世界的模型不太一样。例如,我们可能没有那么关注 ID 的保持,一个人切镜之后是否还是同一个人,但人一定要是人,物体一定要符合其自身的规律,比如东西一定会往下掉,不会飞起来。

在后训练的强化过程中,我们基于这些特性做了额外强化,相当于放弃了一些数字世界关心的能力,增加了一些数字世界不关心但物理世界非常需要的能力。这就是我们和一些数字世界模型最大的不同。两类模型很难简单比较好坏,因为需求是不一样的。

InfoQ:您刚才提到物理世界规律的理解,那么机器人未来是否也需要学习类似物理学中的第一性原理,通过底层规律推演结果,而不仅仅是通过数据进行预测?

❧
Industry Analysis规则派生 · 可核对

本条目归入「Technology AI」垂直,涉及真实话题:technology。

· 市场:关注 technology 对相关品类与竞争格局的潜在影响。

· 消费者:受众行为与偏好变化值得追踪。

· 品牌:本动向对品牌资产建设的启示。

· 渠道:内容分发与触点组合(社媒 / 电商 / 线下)的协同值得复盘。

Marketing Insight规则派生 · 可核对

· 核心话题:technology。

· 可思考:如何把「technology」的洞察,转化为可衡量的内容与增长动作?

Career Usage规则派生 · 可核对

面试中可引用「机器人大脑之争进入深水区:为什么物理世界需要从头设计模型」:围绕 technology,说明你对行业动向的判断与可落地动作。

本条目相关英文术语可在「商务英语」模块按话题检索,用于外企面试表达训练。

关联播客真实 RSS 单集
Pump and circumstance: is China the new OPEC?
The Intelligence · 2026.08.12
The Innovation Strategy Most Companies Miss
HBR IdeaCast · 2026.08.11
Spring, then fall: a weakened Muslim Brotherhood
The Intelligence · 2026.08.11
延伸信源A / B 级权威来源 · 供深挖
Marketing BrewACampaignAThe DrumAWARCAAdweekADigidayA
Business English提取正文真实商业词汇
ai
ai

AI摘要 具身智能在WAIC首次成体系亮相,技术重心从演示转向真实场景落地,“机器人大脑”成为关键突破点。蚂蚁灵波发布全栈大脑2.0,含6款具身原生模型,其中LingBot-VA 2.0为行业首个具身原生世界动作模型。…

系统商务英语 →
关联 English Brief
从亚百毫秒级启动到生产级部署,腾讯云为何重构 Agent 沙箱?
InfoQ 中文
Vercel 发布新语言 Zero:代码不是写给人看的,而是写给 AI 的
InfoQ 中文
来源
阅读原文 · InfoQ 中文 ↗
发布:2026.08.12
类型:AI / 工程
话题:technology
相关阅读
InfoQ 中文/2026.08.13
从亚百毫秒级启动到生产级部署,腾讯云为何重构 Agent 沙箱?
InfoQ 中文/2026.08.13
Vercel 发布新语言 Zero:代码不是写给人看的,而是写给 AI 的
InfoQ 中文/2026.08.13
别再所有人平分AI算力:顶级模型给资深工程师才省钱,新人刷题式成长已失效
InfoQ 中文/2026.08.12
群青智能联合创始人&CEO 吴哲明博士确认出席AICon深圳,将分享“从真实产线定义智能——工业具身智能的物理 AI 闭环”
InfoQ 中文/2026.08.12
DoorDash使用Envoy和Valkey构建了1.5M RPS的代理缓存,可用性达99.99999%
个人笔记
自动同步到云端