恒美微站
首页
关于我们
建站服务
主题模板
案例展示
资讯中心
联系我们
世界模型大混战:55家公司,7个门派,谁在真做世界模型?
首页
资讯中心
/
世界模型大混战:55家公司,7个门派,谁在真做世界模型?
世界模型大混战:55家公司,7个门派,谁在真做世界模型?
发布时间:2026/9/14 22:39:36
从夯倒拉挨个锐评。具身智能行业又爆大瓜。梅卡曼德创始人邵天兰在朋友圈开炮包括北京、上海一些名气很大估值很高的上春晚的公司大量利用所谓数采中心和与地方政府、投资方、供应商的关联交易来制造虚假的、不可持续的收入他指出这种做法是不合法不道德而且不聪明。银河通用随后回应公司产品已在工业、零售、药房等多个领域实现规模化落地并完成长达 2 年的常态化运营验证。表面上看吵的是机器人公司的收入是不是真的真机数据是不是真的商业场景是不是真的。但往深了看背后还有一个更大的问题大家都说自己拥有的那个“真实世界”到底是不是真的巧的是你问100个投资人今年他们看的方向是什么投资人都会告诉你世界模型它被寄希望于让机器理解、预测和模拟真实世界。方向听起来很清楚边界却没那么清楚。当我们真正问一句到底什么才算世界模型100个投资人心中不一定有100个哈姆雷特但答案已经开始分叉。除了原本就在做具身大脑的那些人还有视频生成、3D生成、数据公司、仿真平台一些原本并不以“世界模型”为名的公司都开始被纳入这场新叙事。世界模型成为每一家相关或者不相关公司的标配出现在PPT的页眉、发布会的标题、融资故事里的镀金边框。更有意思的是一个连行业边界都没有统一的赛道却已经开始批量制造独角兽在我们梳理的55家公司中已经有12家进入独角兽行列其中九家来自具身智能领域。市场对这个词的热情也远比产品落地来得快。Google Trends数据显示“world model”全球搜索热度同比暴涨1200%2026年5月至7月快速冲高。Google trends 世界模型全球搜索热度「非标玩家UnDefined」近期梳理了国内59个世界模型将他们划成七大门派机器人派、智驾派、大厂派、视觉生成派、数据派、3D派、Native派。不同门派不同出身不同底牌也注定了不同的活法。接下来我们将从夯到拉锐评这些“世界模型”主要看三件事它到底有多像一个真正的世界模型有没有真正进入真实世界以及能不能从真实世界里持续获得反馈。当然我们并非专业机构所有评价都不够客观如有雷同纯属巧合。01 机器人派争夺理解世界的大脑——我给到顶级机器人派做世界模型是真拥挤也是真需求。目前公开世界模型的机器人和具身智能公司至少有18家商汤绝影开悟Kairos、大晓机器人Kairos 3.1、星海图Fast-WAM、智元机器人τ0-WM、GE-Sim 2.0、银河通用DyWA、LDA-1B、灵初智能Psi-W0、星源智ω-EVA、极佳视界GigaWorld-Policy、墨奇智能、章鱼动力、中科第五纪BridgeV2W、韦特嘉仓储机器人具身大脑Ulti-Brain、至简动力VLA LaST₀、智平方全域全身VLA GOVLA、飞捷科思、无界动力W‑WALA、自变量机器人WALL‑WM、破壳机器人Embodied World Model等。机器人派是世界模型赛道里资本密度最高的一派。2026年上半年国内仅具身智能赛道披露的融资额就超过460亿其中七成砸向了前20家银河通用、星海图、智平方、自变量的估值都已经突破200亿成立不到一年的无界动力连融四轮后估值也突破百亿至简动力则半年就跻身独角兽。资本赌的是谁能先垄断真机数据入口。传统机器人靠规则编程端到端模型泛化能力很差。遇到陌生物体就直接宕机换一个场景就要重新训练。这也是人类期待世界模型能够解决的——理解物理规律后在脑内推演后果选择最优动作。机器人派切入世界模型最大的抓手是他们派拥有真实应用场景和真机数据敲重点是能训练出能力的真数据不是和前述所谓数采中心虚构的数据。机器人在真实环境里的每一次抓空、碰撞、跌倒和人类接管都是世界模型最珍贵的训练数据。只要真机规模起来“模型训练—真实验证—产品迭代”的飞轮就有机会转起来。因此机器人派很有可能是最先把世界模型带入物理世界的一派。但问题也恰恰在这里真机是资产也是负债。没有足够多的真机闭环就是空谈可机器人一多硬件、部署和维护成本又可能先把公司拖死。还有一个更隐蔽的陷阱专用模型不等于通用世界模型。自己公司的机器人每天产生的数据确实能让模型越来越懂自己的机械臂、抓取方式和场景但这可能只是把一个“小世界”做得越来越熟。真正的考题是能不能换一台机器人、换一个任务、换一个陌生环境依然有效。所以机器人派最终比的是谁能把真机数据变成可迁移的物理世界知识从“只懂自己的机器人”走向“理解别人的机器人”这才是真的在造理解世界的大脑否则世界模型只是给自己的机器人找了一个更高级的仿真器。能把后者变成前者的可能只有一两家剩下的只是在借世界模型的名义给融资故事加戏。02 智驾派预测下一秒世界——我给人上人目前至少有7家车企和智驾公司公开了相关探索包括蔚来汽车NIO WorldModel、理想汽车重建世界模型、生成世界模型、小鹏汽车X-World、吉利汽车World Action Model、小米汽车Joint World Model、华为云盘古多模态大模型的世界模型、MomentaR7 强化学习世界模型等另外地平线与星河问途也公开表示自研智驾系统内含世界模型能力。名单不长但每家都自带量产车队和数据管道。今天的“智驾”本质仍是辅助驾驶。世界模型要补上的是感知、预测和规划的统一。车企最大的优势是拥有持续运行的现实世界采样器从采集真实道路数据、发现问题、筛选有效样本、重新训练再通过仿真和评测验证模型迭代效果最后把模型重新部署到车上实现数据闭环。智驾派数据采集条件高度标准化相对固定的传感器、车辆控制接口相对统一的路况相对重复的任务所以模型具有很强的规模复制性。和其他派不同在过去的十年中智驾派已经跑过一轮数据闭环建设所以他们可能成为最早跑通世界模型的垂直领域之一。但车企的问题也很现实造汽车和造基础模型是两套能力。有钱、有车、有数据不等于拥有万卡集群和预训练团队。因此部分车企的世界模型可能是贴牌或联合研发——名字属于车企底层能力却来自供应商。这也成了智驾派真正的暗战。华为、Momenta等供应商可以跨品牌、跨车型获取数据尤其能覆盖极端天气、复杂路口和危险决策等高价值场景更重要的是他们有机会把不同车队的数据、算法和评测体系连接起来。他们的野心是从“卖智驾方案”进一步变成“汽车智能时代的基础能力提供者”。同样供应商也有困扰能接触数据不等于拥有数据闭环。数据能不能持续用于训练最终还要看与车企的合作模式和合同条款。车企争的是自己的数据规模和闭环供应商争的是跨车队的数据规模和闭环最终谁能真正把数据变成模型能力谁才有资格定义下一代汽车的大脑。03 大厂派全都能做但世界不是靠堆出来的——我给顶级目前已公开相关产品或研究的大厂包括阿里巴巴Qwen-RobotWorld、Qwen-AgentWorld、Happy Oyster、蚂蚁灵波LingBot-World / LingBot-VA、腾讯混元HY-World 2.0、字节 SeedGR 系列、Seedance 2.0、快手可灵视频 3.0 Omni、华为云盘古世界模型以及正在探路的美团LongCat-Video。2026年世界模型开始被越来越多大厂视为下一代AI基础设施。他们可以容忍自己的大模型不是最强但绝不能容忍自己在新牌桌上缺位。大厂派最大的优势是什么都有。有视频的做视频有地图的做3D有机器人的做具身有Agent的做数字环境……阿里甚至同时押注机器人、Agent和虚拟世界三条路线。这种“全都要”的底气在战略模糊期是优势但标准一旦确立也可能变成负担。毕竟世界模型究竟应该是视频、3D、物理模拟器还是Agent的数字环境现在还没有答案。路线可以同时下注但数据闭环却不能同时成立。内容平台有海量视频却缺少动作反馈地图公司有空间数据却未必拥有持续的物理交互机器人公司有真实动作数据但规模又远小于互联网数据。数据很多不等于有世界模型最需要的数据。最后做出来的可能是一堆分别服务于视频、3D、机器人和Agent的“高级工具”。世界模型的终局也未必是模型最多的大厂赢而是谁能把模型、场景、数据和反馈串成闭环并从“全都下注”里跑出一条真正的数据飞轮。04 视觉生成派从生成画面走向模拟世界——今年年初我给npc现在我给人上人视觉生成派向上做世界模型本质上是在给已有能力重新定价。现有公开相关模型的公司包括Sand.aiMagi-1.1、智象未来原生全模态世界模型架构、魔芯科技KOKONI-World / MoWorld、生数科技Motus / MotuBrain、阿里 Happy Oyster以及广义统计下的快手可灵 3.0 Omni、字节Seedance 2.0。这一派手里握着最便宜的互联网海量视频——这本身就是物理世界在时间维度上的切片。Sand.ai 用自回归预测下一段视频魔芯科技从 3D 空间切入生数科技把 VLA、世界模型、视频生成整合进 Motus。从生成下一帧到预测下一状态技术栈本来就是连续的。资本也认这个逻辑。生数科技B轮融资近20亿元投后估值超20亿美元正在冲刺港股 IPO智象未来三个月连续完成三轮融资累计超过21亿元可灵AI独立融资近30 亿美元投前估值150 亿美元。资本买的已经不只是生成画面的生意还有从内容生成走向物理模拟的想象。能生成杯子落地的视频卖的是内容工具能预测杯子落地后碎片溅起的轨迹卖的是物理理解。从内容生成到物理模拟估值逻辑差了一个数量级。问题是重新定价的前提是能力真的值这个价。视觉生成派的核心优势是有数据、有模型、有工程最大的短板却是有画面没因果。现有研究也表明视觉生成模型距离真正的世界模型仍卡在空间推理、持久状态、长程一致性和因果理解等问题上。这是范式问题——从无意识模仿像素到有意识理解物理中间隔的是动作-反馈的闭环。所以这一派最终要跨过去的是从视觉上的连续性走向物理上的因果性从“生成世界”走向“模拟世界”。05 数据派从还原世界走向生成世界——我现在给顶级下半年我再改目前已经公开自研模型的公司包括大衍科技4D世界重建合成数据平台、卓印智能Simulaix、树为智能具身智能物理因果数据引擎、群核科技SpatialGen、五一视界 51WORLD51World Model和跨维智能DexWorldModel。首先在具身智能这个充满非共识的行业数据短缺成为当下为数不多的共识。所以卡着行业脖子的数据派天然有优势。只不过在数据问题解决之后他们还有价值吗2026年世界模型显然是比数据标注、仿真服务更性感的资本故事。于是各家争相推出自己的世界模型从按单收费走向按能力收费成为这类公司的共识。数据派最大的优势是起手就有场景资产。群核科技背后是数千万真实家居设计数据51World Model建立在城市级数字孪生之上树为智能则直接把物理因果锚定在真实刚体碰撞和摩擦系数上。所以他们的模型在空间一致性和物理可信度上更有竞争力而且他们的数据客户本身也是潜在模型客户。给机器人公司卖了两年训练数据现在推销具身世界模型销售链路都不用重建。但问题也来了既是数据供应商又是模型供应商客户究竟该买你的模型还是该防着你成为竞争对手归根到底数据派真正的底牌还是在场景资产和仿真引擎世界模型更像是在这些资产上套了一层神经化包装。因此他们也可能是最先被证伪的一批——披着模型外衣的仿真公司。真正的验金石是离开自己最熟悉的业务场景后模型还能不能对陌生环境稳定预测、推演结果。否则它依然只是工具。当然如果真有谁能把场景资产物理仿真预训练能力跑出闭环数据派反而可能诞生隐形冠军。毕竟有世界的人比只有参数的人离物理现实更近。问题是他们愿意为了成为大脑彻底放弃卖铲子的舒服日子吗更残酷的问题是有些公司的现金流根本不允许他们放弃。当世界模型的故事讲完他们或许会发现自己既不是大脑也回不到铲子商的位置了。06 3D派从重建世界到理解空间——数据派的另一个支门派这一派坚信3D才是正确的世界表征。目前公开相关模型的公司包括腾讯混元HY-World 2.0、阿里高德ABot‑Earth 0.5昆仑万维Matrix系列、元昊动力4D 世界模型基模、极佳视界GigaWorld‑1、VASTTripo 、影身智能S1、魔芯科技MoWorld 3D、知天下科技3DGS三维重建平台、群核科技SpatialGen、具身升维3D物体环境生成重建方向和其域创新LCC空间重建与编辑体系。3D派很擅长回答这一秒长什么样世界模型要回答的却是下一秒会怎样。于是就有了昆仑万维把Matrix-3D包进Matrix世界模型系列VAST在3D生成底座上推世界模型其域创新把LCC空间编辑体系升级成世界模型……但加了播放键的3D模型也不一定能预测物理后果重建再精确也许仍是高级扫描仪。不过至少他们开始拥有一个可测量、可编辑、可调用、可交互的空间腾讯混元HY-World 2.0 输出Mesh和3DGS美术可以导进Unity继续改阿里高德ABot-Earth 0.5重建城市时带有地理坐标影身智能的S1直接用原生3D数据训练机器人拿到的是空间坐标。对于机器人、自动驾驶而言这种把空间位置、深度和物体关系直接固定下来的3D表征尤其重要因为模型不能只知道“前面有辆车”还得知道车在哪里、自己在哪里以及两者怎么运动。更重要的是如果现实场景真的被重建成3D世界模型就可以在这个世界里继续生成物体和环境再加入角色、动作和物理规则那时3D就真的能成为世界模型的空间底座。但3D派的致命瓶颈也在这里普遍缺失动力学推演与因果交互能力。所以能造出世界的外壳不代表算得出世界的内核。碰撞、摩擦、动力学和长时序变化目前很多方案还在靠传统物理引擎补位而高精度3D生成和动态推演的算力成本也足以让创业公司肉疼。如果3D派不能顺利从“空间表示”走向“空间推演”最终也还只是更逼真的场景渲染工具而非理解世界的模型。07 Native派先验者的赌注——我先给个npc回头再改这一派从Day1起核心使命就是通用世界模型。目前公开的玩家包括流形空间WorldScape-Policy 、逆矩阵科技悟界·Physis、LiberAI、卜拉格科技和飞捷科思。Native 派是 2026 年资本最敢下注的一派。流形空间一年连融五轮、累计近15亿元逆矩阵科技成立四个月拿下超1.1亿美元LiberAI半年四轮、累计超10亿元卜拉格科技成立仅一个月、产品尚未公开估值就冲到20亿美元。哇塞哇塞可以说比那些从别的门派转型而来的老登们融资更猛令人羡慕资本猛猛下注的原因是对通用世界模型的未来想象以及模型跑通后对数据入口的反向收割能力。Native派相信物理规律可以被神经网络内化相信存在一个比专用模型更底层的统一框架至于这个框架是空间表征、物理引擎还是隐状态模型各家答案不同但赌注都押在“通用”两个字上。Native派最大的优势是没有历史包袱。他们可以按照自己理解的“世界”来设计模型、数据和交互方式。所以理论上他们是最有机会做出真正跨场景、跨任务的通用世界模型。但问题也最直接没有产业入口就没有现成的世界数据。逆矩阵提到要从预测下一个词转向预测下一个物理状态可物理规律是从一次次真实失败里磕出来的。世界模型最需要的就是持续的“观察—行动—结果”反馈。没有数据闭环所谓Native很容易只剩下一套漂亮的架构和更漂亮的融资故事。可数据和场景不是期货最终必须交割。GPT背后有互联网海量文本Native派拿什么去造一个“物理世界GPT”而且Native派几乎没有退路。机器人做砸了还能卖机器人数据做砸了还能卖数据视频做砸了还能卖视频Native派如果通用基座跑不通手里可能什么都没有。结尾最开始我以为这是一次蹭概念。写到这我觉得不是。互联网泡沫时名字带“.com”就能上市SaaS热潮时传统软件换个订阅制就能讲云故事元宇宙最热的时候VR展厅也能融到钱。历史总是押韵概念先起飞产品还在滑跑所有人先挤上牌桌再说。好像只是历史的重复。但又有一点不一样。过去几轮至少技术底座是确定的互联网是TCP/IPSaaS是云和订阅大模型有Transformer。世界模型却连定义都没有被共识视频生成说它是下一帧预测器3D说它是空间模拟器机器人说它是物理推演器Native派说它是通用基座。所以我们这次的排名的参考价值大概要在一年后揭晓答案的时候才能显现。原文链接世界模型大混战55家公司7个门派谁在真做世界模型-36氪我的专辑《人工智能生命体 新启点》CSDN平台https://blog.csdn.net/2501_91883294/article/details/147616608?sharetypeblogdetailshareId147616608sharereferAPPsharesource2501_91883294sharefromlink