华为大模型双子星联手创业,要找物理世界的Scaling Law

程浅 发自 凹非寺

量子位 | 公众号 QbitAI

数亿元资金,投向了一场物理世界的基模实验。

Physical AI创业公司息壤开物宣布,公司已经连续完成数亿元种子轮及天使轮融资。

由敦鸿资产领投,华控基金、三花控股、银杏谷资本、泽然资本、本坚基金、天使基石、标朴投资等知名机构跟投,估值达5亿美金。

而站在息壤开物背后的,是华为大模型双子星:

创始人、CEO李寅,前华为云大模型CTO,华为大模型0-1阶段核心成员;

联合创始人张含望教授,前华为多模态首席科学家。

二人此番联手,瞄准了一个具身智能至今尚未解决的底层难题。

“大语言模型之后,面向物理世界的下一阶段,是否仍然需要一个基础模型?”

过去几年,LLM已经通过海量文本预训练,将问答、写作、编程收进了同一个模型。

相较之下,机器人仍重度依赖特定本体、场景和任务做数据采集和增训。

为此,息壤要做LPM(Large Physics Model)。

即先从海量视频、机器人轨迹和真实交互中预训练一个物理基础模型,再让它进入不同本体和任务。

这件事说起来容易,做起来却尤为地难。

除了看重李寅、张含望及团队本身,为什么资本愿意在模型尚未完成预训练时,便下注这个非共识答案?

LPM是什么?

在息壤的定义里,大语言模型(LLM)代表的是AI 1.0时代,主要学习那些已经被人类抽象为语言、代码和公式的知识。

Physical AI,也就是息壤所说的“AI 2.0”,有质的不同。

这一阶段里,AI会深痛地意识到一件早在上万年前就被野生古猿们发现了的事情:

原来这个世界是连续变化的、可以被行动改变的,而且每一次行动的背面,还存在其他无数种可能……

这种混沌且连续演化的复杂性,是仅仅在离散Token序列中进行概率预测的LLM所无法忍受的。

△

连续的运动只有被切分后才能成为模型可读取的序列

物理世界里,没有一套可直接使用的,已经被人类整理好的抽象表征。

所谓表征,是让“某种形式”代替某个对象,使一个系统能够对它进行识别、比较、推理或行动。

如同地图表征城市,鸽子表征和平,人通过观念、图像、概念认识世界。

有些表征很直白,但有些表征却没有唯一答案。

一个人眉头蹙起却嘴角上扬,这是无语、苦笑、讥讽,还是忍痛?不知道,物理世界只提供像素、声音、位置和受力变化。

△表征没有唯一答案

在这无限多的变化和变化的组合之中,或许只有一个信号值得把握。而模型只能从亿万次观察、行动与反馈中自己找到答案。

这就是LPM,Large Physics Model,“大物理模型”将要完成的任务。

相当于再造大小脑。

尽管难度较大,息壤认为这一步有必要完成。

其中原因,很大一部分源于团队在过往工业项目中所深刻意识到的VLA路线局限性。

尽管VLA已经证明,视觉和语言信息可以被进一步映射为机器人动作,但在实际部署中,大量模型仍然要针对特定本体和任务进行增训。

如果机器人要进一步进入家庭和公共服务场景,模型就需要具备通用能力,在进入新环境时保留已经学到的物理知识。

LPM希望提供的正是这样一个能力底座。

目前,息壤在LPM方向上的研究已有了一些乐观信号。

据披露,息壤模型在World Arena 2.0 Track 1中,Trajectory Accuracy单项排名第一,Physical Adherence单项排名第二。

其中,Trajectory Accuracy主要考察模型预测的物体运动轨迹是否准确,Physical Adherence则关注模型生成的未来状态是否符合基本物理规律——均与LPM希望解决的问题具有直接联系。

飞书文档 - 图片

△

息壤模型“RiXin”打榜成绩

另一个信号则来自Scaling effects。

这一观察与LPM的核心假设有关:如果物理智能同样存在Scaling路径,那么模型能力应当能够随着训练规模扩大而持续增长。

据息壤介绍,随着数据规模与训练规模增加,模型性能已经出现初步提升趋势,团队认为值得继续做下去。

华为多模态双子星在Physical AI汇合

要拉长这条技术曲线,找物理世界的Scaling Law,凭借好的想法和积极信号还并不足够。

毕竟万卡集群一开,一个月就要花费上亿元,能在这样的消耗下做持续推进的人并不多。

资金储备量是一方面,对团队组织和技术路线的判断是另一方面。

从息壤的团队构成来看,它要做基模,可能是认真的。

创始人李寅,清华大学毕业,前华为云盘古大模型CTO、行业大模型开发部部长。

她的经历横跨了基模训练与产业交付两个世界。

基模侧,她曾带400人团队,依托百万小时视频数据集,在万卡算力集群上耗时2个月训出了一个8B视频大模型。

产业侧,她负责国内多地具身智能创新中心的落地,还交付了包括智驾、矿山、金融、医疗、气象在内的30个行业的200多家客户,每年带来数亿营收。

△李寅

在大模型的训练最前沿和落地最末端,所需能力相差不小,但都很复杂。

一方面,在模型训练阶段,基础模型并不是一个单纯的算法问题。

随着训练规模扩大,数据管线、算力调度和集群稳定性都会成为工程约束,任何一个环节的差错都可能影响整个训练周期,带来高昂的算力空转消耗。

但模型一旦走进产业,评判标准马上就变了,工作是否稳定、成本能否控制、能力能否快速复制…...

这使得李寅既需要关注模型训练能力,也需要处理成本、稳定性和交付效率。

但也就是这两方面的历史经验,构成了她判断Physical AI路线的背景。

因为从过往的产业落地经验来看,机器人每进入一个新场景都需要重新采集数据并定制模型,具身智能很难实现规模化落地。

为此,息壤必须推进能力复用的问题,在基础模型层去建立可共享的物理能力。

相较于李寅的工程化与产业落地能力,即将出任息壤联合创始人和首席科学家的张含望则更多在理论侧深耕。

张含望教授,前华为多模态首席科学家,南洋理工大学计算与数据科学学院教授、人工智能校长讲席教授。

△张含望教授

他长期研究因果机器学习、多模态理解和模型泛化,累计发表论文228篇,被全球引用超4.2万、H-index达81,是“causality(因果性)”这个方向上的华人学者NO.1。

还曾入选IEEE评选的“全球AI领域十大最值得关注的学者”,获得过新加坡总统科技奖青年科学家奖。

他的研究经历与Physical AI所面对的问题存在直接关联。

因为在物理世界中,仅依靠大模型训练中的“统计相关性”并不足以支撑稳定行动。

一个物体在视频中发生移动,可能来自机器人动作,也可能来自重力、碰撞或外部干扰。

模型只有学会理解动作与结果之间的因果关系,才能做出更可靠的判断。

泛化问题同样如此。

如果模型只记住训练数据中的物体外观和机器人姿态,那么更换材质、光照或本体之后,原有能力就可能失效。

Physical AI需要更稳定的表征系统,使模型成功识别不同场景背后的共同结构。

而张含望过去在因果学习和去偏方面的研究,正能减少模型对表面相关性的依赖。

可以说,李寅与张含望二人不同的能力点,分别代表了华为大模型体系中工程产业侧与算法研究侧。

李寅更接近基础模型如何训练、组织和部署的问题;张含望更关注模型稳定认知和迁移能力的形成。

但到了Physical AI阶段,机器最终要进入真实世界时,这两条路径就要开始融合、必须融合了。

如此二人的搭档使息壤既不同于单纯研究算法的实验室,也不同于围绕机器人本体承接项目的交付公司。

理论研究、大规模训练和产业反馈在这里,从一开始就被放进了同一个完整体系内。

实际上,“大模型双子星”也只是这支团队的塔尖。

团队既有参与过上一轮LLM基础模型训练的成熟负责人,也有来自多模态、世界模型和3D交互方向的年轻研究者。

息壤内部一共设置了Model、Data和System Infra三条能力线。

Model团队负责统一生成模型与物理表征;Data团队建立多来源数据管线,并处理仿真与真实数据;System Infra团队则支撑大规模稳定训练和后续推理优化。

如此种种,共同构成了息壤进攻LPM预训练的组织基础。

息壤开物要如何造物理基模?

团队履历只能解释“why”的问题,决定基模能否从理念真正落地的,仍然是“how”。

如前所述,物理基模之难,绝不会在LLM之下。

对于物理世界的模型而言,连续演化的“长程任务”是一个久攻不下的战场。

以收拾桌面为例,机器人需要先识别物体,再判断抓取顺序,规划移动路径,并根据每次动作之后的环境变化不断调整策略。

如前所述,问题在于,每一步都可能存在非常多可能的候选动作。

假设机器人在每个时刻有(b)种选择,完成任务需要连续决策(H)步,可能的行动路径就会增长到b^H。

如果每一步有10种选择,连续决策20步,理论上的路径数量将会爆炸增长到一个无法想象的数量级。

现实中,仅仅是做早饭、洗一件衣服,实际的决策和选择空间就远不止如此了。

这就是长程决策中的“组合爆炸”。

息壤所选择的自回归架构,与对这一问题的理解有关。

按照张含望对这条技术路线的理解,宇宙本身就可以被看作一个持续展开的巨大自回归过程。

任一时刻的世界状态,都承接此前的演化,并与当下发生的行动共同生成下一时刻。

这背后的理论直觉可以追溯到马尔可夫过程与贝尔曼递归。

在马尔可夫框架中,如果当前状态已经包含决策所需的充分信息,那么此前漫长的历史便可以被压缩进“当下”。下一时刻的状态,主要由当前状态与当前动作决定。

△马尔可夫决策过程

贝尔曼递归则在此基础上进一步处理“未来”:一个长期任务的价值,可以被拆解为当前动作带来的即时收益,以及进入下一状态后仍能够获得的未来价值。

在这样的理论框架下,过去不必被逐帧保存,未来也不必被一次穷举,模型只需要在当前状态下选择动作,再根据新的状态继续推演。

△图片系AI生成

如同下棋。

棋手不会在落子前穷举世界上所有可能的棋局,而是判断当前局面,选择一步,再根据新的局面继续推演。

这也是息壤所强调的第一性原理,回到物理决策的最基本结构,状态、动作、下一状态,以及行动产生的价值。

△示意图

在更为具体的架构上,息壤的LPM以Unified AR Transformer作为骨干,让自回归模型将复杂过程拆解为连续的条件预测。

Diffusion则作为可选模块存在,当系统需要把未来状态渲染成连续视频时,Diffusion完成视觉生成。

换句话说,前者负责写剧本分镜,后者负责摄影与后期。

基于这套理论框架,息壤将LPM拆分为六个相互配合的底层能力底座:统一Token、统一模型架构、强化学习算法、数据体系、评测体系和工程基础设施。

△

LPM技术架构图

统一Token负责把视觉、动作、触觉和力觉等异构信息转换为模型能够共同处理的表征;

统一架构负责在同一套模型中组织状态理解、推理、行动与未来预测;

强化学习让模型从行动结果中更新策略;

数据体系为上述学习提供材料;

评测体系检验模型到底是学到了真物理规律,还是假表象关系;

最后,工程底座决定了这套方法能否在足够大的数据与算力规模上真正运行起来。

由此形成一个闭环:

不同来源的数据被转换为统一表征,模型生成动作并预测后果,动作进入仿真或真实环境接受检验,奖励与评测系统把结果转化为反馈,成功和失败的经验再重新进入训练。

△息壤开物数据平台demo

按照息壤的规划,第一阶段数据将来自互联网物理视频、Ego第一视角数据、UMI示教、仿真与合成数据,以及公开机器人轨迹和真机反馈。

过去丰富的商业化经验使其有机会进入真实产业场景拿到数据,快速跑出数据飞轮。

在产品规划上,息壤将模型能力划分为L0、L1与L2三个层次。

L0是通用物理基础模型,目标是形成跨任务、跨场景和跨本体的底层能力。

L1是领域模型,进入工业制造等具体领域后,模型还要学习行业中的对象、流程和约束。

L2则进入具体应用,将领域能力转化为可以部署的机器人任务。

其训练成果XIRRA v0.1计划于今年晚些时候亮相,届时,判断物理模型价值的标准或将更新。

而物理世界是否真的存在一个符合Scaling Law的基础模型,也可以拭目以待了。

话说回息壤开物。

“息壤”取自《山海经》。

“土自长息无限,故可以塞洪水也”,息壤可自行生长、不断增殖,最终成为承托浩大工程的神土。

这与千年后的物理智能自身形成了某种呼应。

所有采集数据以及在真实部署中的成功或失败的反馈,重新流入训练,成为模型继续生长的土壤,生生不息。

《周易》言,夫易,开物成务,冒天下之道,如斯而已者也。

揭示万物的道理、促成天下的事务,而由此统摄天地间的一切规律——如果说,物理世界真的存在自己的LPM,大抵如此。

期待息壤开物真的能让智能生于万物,也重新作用于万物吧。

一键三连「点赞」「转发」「小心心」

欢迎在评论区留下你的想法!

— 完 —

🌟 点亮星标 🌟

科技前沿进展每日见

本文来自大风号,仅代表大风号自媒体观点。