Full text · 原文
4,236 字
Jay 发自 凹非寺<br>
量子位 | 公众号 QbitAI<br>
Generalist AI的GEN-1热度,仍在发酵。<br>
自节前那场引爆全网的Demo之后,昨日,创始人Pete Florence与团队,正式释出了GEN-1的技术博客。<br>
与其说这是一篇技术分享,不如说这是一篇「教同行做事」的檄文。<br>
一点甲不叠,上来就毫不留情地否定了当前炙手可热的世界模型与VLA之争。<br>
直言所有关于技术路线的争论都是浪费时间。<br>
现在关于「世界模型」的讨论,其实是由各种想法在驱动,确实很令人兴奋。<br>
但问题是,你的目标是什么?<br>
在他们看来,具身智能的关注点,应该回归到「目标」本身。<br>
这正是Generalist选择「离经叛道」的根本原因。<br>
完全不依赖任何已有路线。不走微调VLM加动作头的捷径,也不宣称自己是世界模型。<br>
直接基于真机数据从零开训。<br>
GEN-1大约99%的参数,都是从零开始训练的。<br>
Generalist强调,这才是促成GEN-1实现飞跃的核心机密,也是他们真正想与行业分享的洞见。<br>
这是他们从第一性原理出发,得出的最终答案:<br>
想要实现物理AGI,最好的方式,或许就是「从零训练」这条看似不好走的路。<br>
如果用原力灵机的话说,这叫「具身原生」。<br>
△原力灵机CEO唐文斌在2026技术开放日现场<br>
是的,这条路线其实并非GEN-1首创。<br>
就在两个月前,这家来自中国的具身智能新星,就已经用同样的逻辑,举办了一场「具身原生」主题的技术开放日,交出了一份惊艳的答卷。<br>
原力灵机,具身原生大模型DM0,RoboChallenge真机评测全球第一。<br>
所以,具身原生,到底有什么魔力?<br>
GEN-1引爆具身GPT-3时刻<br>
GEN-1的发布,无疑是2026年春节后,具身智能行业的第一次「大地震」。<br>
创始人Pete Florence将其称为「GPT-3时刻」。<br>
在多个任务中,该模型的成功率超过99%,完成任务的速度比此前最先进的模型快了大概3倍,甚至涌现出Failure Recovery(故障恢复)的能力。<br>
用实际demo表现,验证了机器人领域的Scaling Law。<br>
而此次Generalist在技术博客中的「暴论」,又在行业中掀起了一波余震。<br>
只要数据和算力够,从零训,永远是赢家。<br>
这句话放在2024年说,大概率会被当成疯话。<br>
彼时VLA风潮席卷全球,拿一个预训练好的视觉语言模型,接上动作头微调一下,是兼顾效率和效果的公认最优解。<br>
到了2026年初,世界模型又成了新的流量密码。<br>
Generalist偏偏不站队。<br>
他们从来没把自己的模型叫VLA,但也不宣扬自己是世界模型。<br>
事实上,他们至今也没说自己是个什么技术路线,也不想去刻意贴标签。<br>
但有一点却是无比清楚:无论靠什么方式,即便是「离经叛道」,他们也要彻底实现物理AGI。<br>
GEN-1的博客引用了John Schulman的观点,犀利地划分了「想法驱动」与「目标驱动」两种研究范式。<br>
前者,是雇佣兵。追涨杀跌,哪个方法火就选哪个,只为眼前的战功。<br>
后者,是传教士。选定一个终极目标,然后埋头苦行,坚定不移地前行,扫清挡在路上的一切障碍。<br>
Generalist选了后者。<br>
基于这个第一性原理,Generalist做出了那个看似疯狂的决定——<br>
不基于任何现有的基础模型,直接拿原始数据,冷启动。<br>
在这方面,Generalist表现出了近乎偏执的「完美主义」。<br>
在他们看来,微调别人的模型,意味着从第一行代码开始,天花板就被别人锁死了。<br>
知识边界、认知能力、甚至底层的缺陷,都已注定,无法更改。<br>
Generalist想要赌的,是明天。<br>
而站在未来的时间节点回望,你会惊觉:<br>
无论是VLM、VLA,还是世界模型,本质上都只是标签,数据匮乏时期的「拐杖」。<br>
关键问题在于,当「身体」恢复健康、肌肉足够强壮后,我们还需要拐杖吗?<br>
供给端的版图永远在日新月异。<br>
这正是这场比赛最惊心动魄的地方。<br>
就像F1赛车,规则制定者会刻意限制车胎耐久标准,正是在这些Trade-off(权衡)的极限施压下,才催生出无数截然不同的夺冠策略。<br>
在LLM领域,虽然互联网数据不再是瓶颈,但算力成为了新的紧箍咒。<br>
这才造就了OpenAI、Anthropic、DeepMind各自基于不同哲学思考,走出了截然不同的进化路线,因为资源只够他们选一条去All in。<br>
因此,基于第一性原理做出的长期主义战略判断,才会更显得尤为珍贵。<br>
最难的不是应对变化,而是在风云诡谲的环境中,找到那个屹立不变的锚点。<br>
你不仅要计算当前的限制,更要预判这些限制将如何不可避免地发生崩塌。限制变化得越快,这种预判就越重要。<br>
而在Generalist看来,机器人数据不够,仅仅是暂时的限制。<br>
进入2026年,事实证明,这项限制条件,确实被改写了。<br>
Generalist已经积累了超过50万小时的物理交互数据。<br>
当原生数据足够丰富时,所有辅助手段终将被扫进历史的垃圾堆。<br>
在他们看来,只有具身原生,从零开训这个「从无到有」的概念,是为那个即将到来的新世界而生的。<br>
不过,GEN-1可能并非第一个具身原生模型。<br>
在中国,同样有家All in这个概念的明星具身公司,并且早在今年2月份便高调发布过。<br>
DM0,首个具身原生模型<br>
一起再来看看原力灵机的这份成绩单吧。<br>
DM0,RoboChallenge真机评测,双项全球第一。<br>
单任务成功率:62%<br>
多任务成功率:37.3%<br>
排在它身后的,是Pi0.5、Pi0等一众明星模型。<br>
而取得这一成绩的,仅仅是一个2.4B参数的模型。并且已全面开源。<br>
2.4B是什么概念?<br>
在大模型的军备竞赛中,这个参数量几乎可以被忽略不计。<br>
但结果却令人哗然。<br>
对于这个结果,原力灵机合伙人周而进在与「智能相对论」的对话中,淡定地表示:<br>
在机器人领域,无脑堆参数量这件事非常荒诞。<br>
周而进一针见血地指出,参数并非第一性原理。<br>
事实上,一旦找到了真正「原生」的路线,现有具身数据量根本无法支撑起一个大参数模型。<br>
那么,DM0所说的「原生」,到底「原生」在哪?<br>
可以分为三个层面——<br>
首先,是数据原生,这是拉开差距的关键。<br>
当前行业的普遍做法是:下载一个预训练好的VLM,然后外挂一些机器人操作数据进行微调。<br>
快是快,但问题同样致命:模型压根没见过关节电机长什么样。<br>
它只是看过一些互联网数据,背诵了关于机械动作的文字描述。仅此而已。<br>
这种「死记硬背」导致了大量无意义的训练,最终带来参数膨胀。<br>
这或许是一种参数层面的「幻觉」。<br>
如果模型只是针对单一机型记忆「拿起瓶子」时,每个关节该转多少度,那么一旦换一台硬件,它将束手无策。<br>
因此,DM0走了完全不同的路。<br>
它的训练数据融合了三类来源:<br>
多模态互联网数据:奠定语义理解和常识推理的基座能力。<br>
驾驶数据:赋予模型对物理世界的时空推理与动态感知。<br>
具身传感数据:涵盖视觉、触觉、力觉等多维度信息,让模型真正「触摸」到这个世界。<br>
模型的输入端,不再仅仅是图像和文字,更包含了机器人实操的具身轨迹数据。<br>
两类数据共同优化,迫使模型同时学会「看懂世界」和「动手操作」。<br>
这是一种极其聪明的做法,在让数据结构更立体的同时,也巧妙地实现了数据规模的Scaling。<br>
在具体采集策略上,原力灵机的「原生」第一性原理同样体现得淋漓尽致——<br>
正是因为完全目标导向,所以手段可以相当灵活。<br>
比如对仿真数据的态度。<br>
仿真数据量大管饱,但在精细操作场景中价值有限。例如「装水」任务,液体一晃,整个瓶子的质心就在变化,仿真环境难以准确建模。<br>
因此,原力灵机在室内导航、刚性物体抓取等方面利用仿真数据,但在精细操作层面,则坚决侧重真机。<br>
追求Scaling,但不迷信数据量,而是让每一份数据都发挥最大价值。<br>
这恰好与Generalist在GEN-1博客中的判断形成呼应:供给端是会变化的,你要为即将到来的世界而构建。<br>
其次是训练原生。<br>
DM0将「理解世界」、「操作世界」、「预测世界」三种能力统一训练。<br>
它不是先训练一个VLM,再接一个动作头(Action Head),而是从第一天起,就让这三种能力在同一个模型体内共同生长、相互塑造。<br>
模型的设计紧贴真实世界需求,评价标准是真机效果,奖励函数来自真实场景的实践反馈。<br>
第三是架构原生。<br>
DM0采用天然支持多模态的架构设计,将力觉、触觉等维度的信息直接融入模型核心,而非外挂式地拼接传感器模块。<br>
同时,它具备原生记忆能力,为长序列任务的执行提供坚实支撑。<br>
三个「原生」叠加在一起,指向一个反直觉结果:模型虽小,却异常泛化。<br>
对具身智能来说,泛化性是真正的试金石。<br>
原力灵机将其拆解为四个维度:<br>
对象泛化:同样是抓取,换个形状、材质、大小,照样能稳稳拿起。<br>
场景泛化:在A车间能干活,搬到B车间也绝不掉链子。<br>
任务泛化:不只局限于被教过的几个动作,更能自主排列组合,将简单动作串联成复杂的长程任务。<br>
机型泛化:即便换一台胳膊更长、关节更多的机器人,也能直接驱动其上手干活。<br>
四个维度,缺一不可。<br>
而DM0,从第一天就在为这四个维度做准备。<br>
原力灵机没有像行业里很多团队那样,先针对一种机型训一个专用模型,跑通demo再说。<br>
DM0在预训练阶段就同时混合了操作、导航、全身控制三类任务,覆盖了8种构型迥异的机器人硬件。<br>
相当「粗暴」。<br>
这相当于对模型说:你不是喜欢死记硬背吗?<br>
好,我把所有任务和所有本体混杂在一起扔给你——来,背!<br>
事实证明,这一策略成功锁死了模型想通过死记硬背走捷径的念头。<br>
「混乱」中,原力灵机倒逼模型不再执着于电机参数,转而去理解每次操作背后通用的逻辑和物理规律。<br>
智能,就这样从原生的物理交互中,自然而然地生长了出来。<br>
2.4B参数,RoboChallenge双项全球榜首。<br>
2026年,是具身原生元年<br>
GEN-1的博客里有句话,目标比方法更强大。<br>
过去两年,行业最高频的问题是:机器人什么时候能进厂干活?<br>
但或许,比这个问题更值得关注的是:<br>
机器人什么时候能找到进厂干活的正确方法?<br>
Generalist用GEN-1给出了答案。<br>
从零训练原生模型,摒弃一切拐杖的「借力」,可能才是通往终局的唯一路线。<br>
无独有偶,原力灵机的DM0,同样不约而同地在今年踏上了这条少有人走的路。<br>
2026年或许不是具身智能的元年。但GEN-1和DM0的出现,正在为2026年烙上一个新标签:<br>
具身原生元年。