史密斯夫妇
深度|四张榜单,四种真相:WAIC 之后,世界模型到底该看哪个排名?_我的网站

A | 7 月的上海,世博展览馆 H3 馆的过道比往年拥挤许多。 入口处停着宇树的载人变形机甲 GD01,观众排队坐进驾驶舱拍照。 (本文作者王梦汐为马上消费研究院首席研究员) 人工智能技术路线的演进,构建起资本市场相关投资的底层逻辑,行业发展也需警惕资金短期异动带来的影响。往里走,300 多台机器人真机散在 200 多家具身智能企业的展台之间,具身智能无疑是这届 WAIC 最具象的展品。

B | 而视频生成公司的展台就设在机器人公司隔壁,播放演示片的屏幕连成片:机械臂倒水,无人机穿林,虚拟角色转身。科技产业的发展,并非单一的技术更新,而是技术理想与资本现实相辅相成、协同发展的过程。

C | 不同公司的讲解员说着高度趋同的话:都在讲具身智能,都在讲世界模型。 图:WAIC 2026 现场,宇树科技展台(来源:新蓝网) 穿梭在展台之间的投资人,面对诸多公司同样问着高度趋同的一套问题,核心聚焦在模型到底什么水平。但得到的答案却分别指向不同的东西。

D | 有人打开手机展示 VBench 排名,有人调出 RoboTwin 2.0 的任务成功率曲线,有人谈仿真到真机的迁移数据。同一个词,在不同的展台上被不同的数字定义。 当具身智能与世界模型成为显学,榜单便不再只是技术社区的内部排名,而成了行业理解技术路线的入口,在某种程度上,更成了话语权本身。 人工智能从实验室走向市场、赋能千行百业,本质是技术理想与资本现实不断磨合、相互约束、协同发展的过程。技术理想锚定产业长期发展方向,资本力量决定技术落地推广效率,二者形成动态平衡,这也是硬核科技实现产业化发展的底层逻辑。

E | 一张拼图,三个榜单 2026 年以来,具身智能和世界模型几乎成了 AI 圈最热的两个词。 资本永远在投票,技术路线永远在重构 技术路线的迭代变化,深刻影响资本流向,新能源电池行业的发展历程,是具备参考价值的典型案例。 技术圈在讨论,视频模型到底能不能成为机器理解物理世界的路径。资本圈在讨论,下一代 AI 公司,能不能从“会说话的模型”走向“会理解、会预测、会行动的模型”。

F | 媒体圈的问题则更清晰、直白,当“世界模型公司”越来越多,到底该怎么看谁更强? 然而时至今日,世界模型依旧没有一个统一的定义和衡量标准。 落到具体的评测上,世界模型目前还不是一种单一分数就能概括的能力,它更像一张尚未完成的拼图:视频质量、指令理解、时序一致性、物理规律、机器人执行、动作预测,每一项能力背后都站着一张榜单和一群拥趸。 前几年,依托政策补贴支持,新能源电池行业前期资本供给充足,三元锂电池依靠优异性能,成为当时主流技术路线。随着行业补贴有序退坡,政策驱动效应逐步减弱,市场化机制开始主导行业发展。

G | 那么,具身智能和世界模型到底该看哪些榜单?把这张拼图拆开,有三块版图绕不开:一张回答"像不像",一张回答"懂不懂",一张回答"动不动得了"。

H | 看懂它们,比看懂任何一场发布会都更接近行业的真实进度。还有一块回答"准不准",它是整张拼图的底座,值得单独一章。

I | 行业技术路线顺势转向性价比更高、适配大众市场的磷酸铁锂,真实的市场需求倒逼上游产业链全面重构。 VBench:回答"像不像" VBench 是目前视频生成领域最常用的评测体系之一,由南洋理工大学 S-Lab、上海人工智能实验室 OpenGVLab 等机构推出。整条产业链的产能、研发资源与产业重心,逐步向高性价比的电池材料与技术路线转变。

J | 这一变化印证了一条适配多数科技行业的规律:政策扶持助力产业起步发展,市场力量决定技术应用与普及范围。

K | 短期资本流向会改变赛道的资源储备与迭代速度,长期来看,能够穿越周期的技术,往往贴合真实市场需求、具备稳定性价比与落地价值。它从主体一致性、背景一致性、运动流畅度、美学质量等 16 个维度评价生成视频。 它回答的问题很直接:模型生成的视频,像不像真实世界,是否符合用户输入。 美国学者尼古拉斯・尼葛洛庞帝曾提出,任何技术与科学成果都存在两面性。 科技发展存在天然矛盾:技术研发着眼长远,而资本运作侧重短期收益。

L | 二者目标取向的差异,容易造成行业资源内耗,延缓部分长期前沿技术的研发进度,这一现象也为人工智能产业发展带来借鉴意义。 理想引领方向,资本赋能发展 相较于新能源行业的政策驱动特征,AI产业的发展,同样展现了理想与资本的双螺旋共生逻辑。 一项前沿科技从概念走向实战,离不开四个核心角色:想法是启动器,技术是发动机,舆论是助推器,资本是平衡机。 在 VBench 1.0 认证榜中,头部模型集中在 84 分到 88 分之间,差距已经很小。 想法是一切创新的起点,也是资本入局的核心前置条件。

M | 没有对通用人工智能的终极想象,没有对大模型能力边界的持续探索,资本便缺乏清晰的布局方向,AI的规模化产业化落地也就无从谈起。

N | 于是 VBench 在 2025 年推出 2.0 版本,将评测范围扩展到人类保真、物理、可控性、常识等维度,开始关注那些决定真实感、却容易被忽略的问题。 人工智能企业OpenAI创始人萨姆・奥尔特曼在GPT-4发布之际表示,团队正在打造具备长远价值的产品。 根据其 HuggingFace 官方榜单的认证视图,主要名次如下: 图:VBench-2.0 榜单:Veo 3 以 66.72% 居首(来源:HuggingFace Vchitect/VBench_Leaderboard,2026 年 7 月截图) 但 VBench 仍主要评价视频结果。画面可以逼真,模型却未必理解画面背后的规律。 这种立足长远的技术追求与价值坚守,是前沿科技不断突破的根基,也是人工智能行业持续迭代发展的精神内核。 WorldModelBench:回答"懂不懂" 如果视频生成模型被称为“世界模型”,它就需要接受更严格的检验。但仅有创意与构想,无法支撑产业落地发展。正如发明家爱迪生所言:天才是百分之一的灵感,百分之九十九的汗水。 人工智能从初步构想走向商业化应用,历经大量研发测试、技术迭代与工程攻坚,这一过程离不开资本的持续支持,让前沿创新理念转化为可落地、可赋能实体经济的产业成果。 研发创新能力,是人工智能产业持续发展的核心动力。 比尔·盖茨曾提出:“创新是区分领导者与追随者的关键。

o | 2025 年,来自 UC Berkeley、UC San Diego、NVIDIA 和 MIT 的研究者推出 WorldModelBench,把模型放进物理和常识环境中测试。”对于科技行业而言,研发创新能力,正是AI赛道最核心的创新壁垒与进化底气。 如果说想法是虚无缥缈的创新灵感,那么硬核的技术研发、持续的迭代创新能力,就是将创意落地的唯一关键抓手。

p | 该评测覆盖机器人、驾驶、工业、人类活动等 7 大领域,包含 350 条提示词和 6.7 万条人工标注,从指令遵循、物理规律、常识三个维度打分。 如果说创新构想是发展的灵感来源,那么扎实的技术研发、常态化的迭代升级,就是推动创意落地的核心依托。其中物理遵循占总分一半。

q | 只有具备过硬的工程研发与技术攻关能力,才能将抽象的创新构想,打磨为标准化、可落地、可规模化应用的人工智能产品。原因很简单:世界模型最重要的能力之一,是预测物体在真实世界中会如何变化。 依靠不断地技术突破与产品迭代,人工智能产品才能获得市场与用户认可,完成从创意、技术到商业价值的完整闭环。 结果显示,即使表现最好的模型,也只有 61% 的视频正确完成指令;12% 的视频违反质量守恒,11% 出现物体互相穿透。

r | 模型能生成一个看起来合理的世界,但距离真正理解世界,还有明显距离。行业舆论能够打破大众认知壁垒,是加速产业普及的重要助力。 图:WorldModelBench 官网榜单(来源:worldmodelbench-team.github.io,2026 年 7 月截图) RoboTwin 2.0:回答"动不动得了" 世界模型终究要服务于行动,再往拼图下游走一格,机器人能否干活便成了一个很重要的维度。

s | 凯恩斯曾感慨:“介绍新观念倒不难,难的是摆脱那些旧观念的束缚。 RoboTwin 2.0 由上海交大 ScaleLab 与港大 MMLab 主导、上海人工智能实验室参与。它包含 50 个双臂协同操作任务,抓取交接、工具使用、可形变物体操作,跑在 SAPIEN 仿真器上,支持 Aloha-AgileX、ARX-X5、Piper、Franka、UR5 共 5 种双臂本体,配套一个 731 个实例、147 个类别的物体库,通过 Easy 和 Hard 两种环境,测试机器人能否从仿真走向更复杂的真实世界。” ChatGPT的现象级全网传播,本质是一场全球性的AI认知革命。 早期结果显示,在 Hard 设定下,多数方法成功率仍低于 20%。机器人能够完成特定任务,但距离稳定、泛化地完成任务还有很长距离。 图:RoboTwin 2.0 官方榜单(来源:robotwin-platform.github.io,2026 年 7 月截图) 三张榜单,三种能力,各自有发布机构和评分体系。它让大众与资本跳出模糊的未来畅想,直观触摸到人工智能的真实能力与应用边界。没有一张榜单能独自定义世界模型,放在一起,他们才勾勒出一条从生成、理解到行动的能力链。但这个链条还缺少一个最关键的环节。 这股舆论浪潮,成功推动资本视角从“AI是什么”的概念空谈,转向“AI能落地什么”的务实探索,催生了大量从0到1的原创产业投资,加速了整个赛道的成熟进程。 资本兼顾短期热度与长期价值 创新理念、核心技术与社会认知,共同构筑起人工智能的发展基础,而资本则贯穿产业发展全过程,起到调节发展节奏的作用。

t | 马克思在《资本论》中精准刻画了资本的特质:“资本害怕没有利润或利润太少,就像自然界害怕真空一样。” 资本并非单一属性,两类资本的分工与诉求截然不同:政府产业引导侧重产业早期布局与长线赋能,承担行业培育使命;市场商业资本则偏向短期助力与市场化套利,追逐确定性收益,整体资本投入从来不是公益扶持,而是兼顾产业培育与价值增值的博弈过程。 Physics-IQ:回答"准不准" 人类做很多动作时,会下意识在脑中预演结果。

u | 推一下杯子,它会滑多远,会不会翻倒;倾斜水壶,水会从哪里流出来;把两块磁铁靠近,它们会吸住还是弹开。 机器人也需要这种能力。它必须根据眼前的状态,预测几秒后会发生什么,再决定下一步动作。 资本天然偏好路线收敛、落地清晰、收益可预期的赛道,始终在行业风险与长期收益之间寻找平衡。

v | 这里需要厘清一个关键产业逻辑:技术路线从来不是一成不变的既定答案,而是双向博弈的结果。 一方面,技术路线是科技工作者的主动输出。依靠底层研发迭代、学术突破与工程创新,科研人员自主探索Transformer、Scaling Law、智能Agent等全新技术范式,为行业指明进化方向。 另一方面,技术路线极易受到资本干预,随时发生偏移与改写。

w | 视频世界模型经常在这里犯错。这类预测如果不准,后面的规划和执行都无从谈起。 测量这一底座能力的基准叫 Physics-IQ,由 Google DeepMind 与 INSAIT 联合推出,论文发表于 WACV 2026。

x | 正如前文新能源电池赛道的演变,政策与市场资本的潮汐变化,能够直接淘汰主流技术、重塑全新赛道,让产业资源快速向高性价比、高确定性的方向转变。 这一规律同样适用于AI行业:资本的短期偏好,能够放缓硬核基础研究的进度,加速应用层技术的落地,甚至让部分长期有价值的技术路线暂时边缘化。 从长期发展来看,资本会不断筛选优质发展方向,逐步向算力、算法、核心芯片等具备长期核心竞争力的硬核领域聚集。 2026 年 6 月,原团队联合 Anates Labs 发布修正版 Physics-IQ Verified,修正了 57.6% 的样本标注问题,改用逐样本加权计分。 它的设计与前述榜单都不同:研究者真实拍摄了 66 个物理实验,覆盖固体力学、流体、光学、热力学、磁学五大类,每个实验 3 个机位、实拍 2 次,共 396 段 8 秒视频。资本的动态调整,也持续平衡着人工智能产业的创新速度、应用节奏与技术根基。 马克思提出,社会知识与智力正大规模转化为直接生产力,深刻改变生产与生活方式。 人工智能是当下前沿智力成果的集中体现,已成为新时代重要的生产力,与资本形成相互依存、协同发展的格局。模型只看前 3 秒,预测后 5 秒会发生什么,再与真实拍到的后续画面比对。技术理想坚守长期发展方向,推动技术不断突破;资本力量筑牢产业发展根基,让创新理念转化为现实生产力。 资本的市场化属性推动人工智能加速商业化普及,行业发展过程中也出现过偏重应用落地、弱化基础研发的现象,这就需要行业坚守长期发展理念,实现均衡发展。4 项指标合成一个 0 到 100 的 Physics-IQ 分数,并用同一场景两次实拍之间的差异做归一化:真实世界自己重拍一次都不会完全相同,模型的预测就被拿来和这种自然波动比较。

y | 让理想领航,让资本落地 纵观国内众多成熟硬核科技领域,普遍呈现出技术理想与资本力量协同发展的特征,人工智能行业表现得尤为突出。 脱离资本支持,前沿技术难以落地应用;脱离技术基本面,单纯追逐市场热度的行为也难以持续。

z | 技术路线指引产业长期趋势,资本市场影响企业阶段性估值,证券市场也是观察这一发展逻辑的重要窗口。 对于二级市场参与者以及产业投资者而言,布局人工智能相关领域,需要紧跟技术迭代趋势,秉持理性判断。

| 市场价格的起伏变化,本质是市场各方结合技术成熟度、企业成长潜力开展的价值判断与动态修正。 Physics-IQ 考察的是更底层的问题,即这个模型是否真的理解物理。这也正是图灵奖得主 Yann LeCun 多年来反复主张的观点,“AI 需要建立关于世界的内部模型,而不是只会生成内容”。他担任 Meta 首席科学家期间, Meta FAIR 便把 Physics-IQ 当作核心评测基准。短期资金追逐热点、切换方向,会带来板块轮动与行情波动。放眼长远,能够穿越市场周期、保持稳健发展态势的人工智能企业,必然是紧跟技术主流、掌握核心技术、贴合产业实际需求的市场主体。 第一财经一财号独家首发,本文仅代表作者观点,不构成投资建议。 (本文来自第一财经)。 然而翻开 Physics-IQ 的官方榜单,排在第一的却并非 Meta 的模型,也不是英伟达投入重金的Cosmos,而是一个中国的视频生成模型。 2025 年 4 月 21 日,Sand.ai 的 Magi-1 以 56.0% 的得分上榜登顶。当时的榜首、Google 的 VideoPoet 只有 29.5%,Magi-1 几乎把这个数字翻了一倍。从那天算起,Magi-1 系在第一名的位置上坐了约 13 个月,中间只离开过三周。 这张表有三种读法。 看裸模型:前三名里有两个建立在 Magi-1 之上,Magi-1 的 56.0% 是 v2v 设定下的裸模型最高分,远高于 Sora 2 裸模型的 42.3%,Cosmos3-Super 裸模型的 59.7% 出自不同设定,两者不直接可比。 看增强系统:2026 年 5 月,英伟达最新发布的旗舰世界模型 Cosmos3-Super 加持 WMReward 后冲到 63.4%,短暂登顶约三周;6 月 17 日,基于 Magi-1 的增强系统以 64.5% 重回第一。 图:Physics-IQ 官方榜单:Magi-1 系居首,Sora 2 裸模型 42.3%(来源:physics-iq.github.io,2026 年 7 月截图) 再看修正后的新榜:2026 年 6 月发布的 Verified 版本上,Magi-1 24B 增强版 58.2 分排第一、裸模型 48.4 分排第二,Cosmos3-Super i2v 39.5 分,Sora 2 只有 26.5 分。 图:Physics-IQ Verified 修正榜(来源:physics-iq-verified.anates.ai,2026 年 7 月截图) 把两张榜单放在一起看,会出现一个反常识的画面。OpenAI 的 Sora 在 VBench 这类回答"像不像"的榜单上名次并不难看,到了 Physics-IQ 上,Sora 2 裸模型只有 42.3%,不足榜首 64.5% 的三分之二;Verified 新榜上只有 26.5 分,不及榜首 58.2 分的一半。 生成得逼真,和预测得准确,被证明是两回事。

| 把视频生成做成"预测下一个词" Magi-1 赢在哪里?论文给出的答案是架构选择。 当下主流的视频生成模型,Sora、Kling 等,走的都是扩散路线:一次性生成整段视频,所有帧同时去噪,彼此之间没有严格的时间先后。 而Magi-1 的做法更像语言模型预测下一个词:按时间顺序逐块生成,每块 24 帧,块内部用扩散去噪保证画质,块与块之间自回归衔接。通过 block-causal attention,后来的帧不会影响过去的帧,过去一旦被写下,就不再被影响。 图:Magi-1 逐块自回归生成与块因果注意力示意(来源:SandAI-org/MAGI-1,arXiv:2505.13211) 这个架构天然更接近世界模型该做的事:根据世界的此刻,推演下一秒。它还带来几个工程上的特征:支持流式生成,视频可以边生成边播放;理论上可以无限长地续写下去。

| 对世界模型而言,这意味着推演的时间跨度不受窗口限制,仿真可以一直进行,还可以逐块更换提示词,控制后续走向。 如果把关键词从“生成”换成“预测”,Magi-1 和 LeCun 主张的 JEPA 路线便有了一种理念上的深层呼应。

| LeCun 在 2022 年发表立场论文《A Path Towards Autonomous Machine Intelligence》,提出 JEPA 架构:不在像素空间预测世界,而在表征空间预测,主动忽略那些不可预测的细节。这条路线后来长成一个家族:I-JEPA、V-JEPA,再到 2025 年的 V-JEPA 2,用百万小时视频训练,其衍生版本可以做零样本的机器人规划。 图:Yann LeCun 在 2026 年 6 月巴黎 VivaTech 演讲(来源:La Ecuación Digital) 一个在像素世界里逐块自回归,一个在表征空间里做预测,虽技术方案完全不同,但都指向同一个判断,即能够预测物理世界变化是世界模型的必要条件。 尺子一旦出现,叙事便有了边界 在WAIC 的论坛上,"世界模型"被反复提起。7 月 19 日的一场人形机器人与具身智能论坛,主题之一正是"标准体系不统一"。开幕当天有观察文章写道:通用世界模型正在成为人形机器人的新竞争壁垒。 竞争的坐标系确实在平移。过去几年,视频模型的发布会比的是"像不像":分辨率、时长、美学分。Physics-IQ 这类榜单的出现,把问题换成了"物理世界变化预测的准不准"。它的价值不在于新添了一张榜单,而在于把世界模型从一个抽象概念,拉回到具象的物理世界:杯子会怎么倒,水会怎么流,光会怎么折。这些东西没法靠话术修饰。坐标系的变化不会写在任何一场发布会的邀请函上,但它会决定下一年资本流向哪里、人才流向哪里。 榜单会迭代,名次会更替。但标准一旦确立,理解行业的方式必然会被改写,模糊的叙事也就有了相对清晰的边界。 尺子一旦有了,量出什么,就是什么。
Current article:http://7i1.xiongpeiduanlouduoennongleng.cyou/pv2ms/7my6zjt.html
Published on:01:04:11








