Meta发布V-JEPA 2视频世界模型,AI物理理解能力实现突破

Meta发布V-JEPA 2视频世界模型,AI物理理解能力实现突破

Meta FAIR 在 7 月 30 日发布 V-JEPA 2 视频世界模型在 PhysBench 物理常识推理基准上比 GPT-6 提升 28% 比人类平均水平提升 7%。V-JEPA 2 是 Yann LeCun 团队继 JEPA V-JEPA 之后的第三代视频自监督学习模型目标是让 AI 真正理解物理世界而不仅仅是统计模式匹配。这一成果的发布标志着 Meta 在大模型研究之外继续坚持自己的基础研究路线。

技术路线上 V-JEPA 2 采用非生成式自监督学习。与 GPT 系列生成像素级预测的做法不同 V-JEPA 2 在潜在空间中预测视频的抽象表示 latent state 不直接生成像素。模型在 1.5 亿段公开视频 YouTube Instagram 上预训练每段视频 32 秒分辨率 224x224 使用 8 块 H100 GPU 训练 14 天。模型规模 1.2B 参数是 V-JEPA 1 400M 参数的 3 倍。训练过程不使用任何标注数据完全依靠自监督信号验证了大规模无监督学习的可行性。

在 PhysBench 基准涵盖流体动力学刚体力学热传导光学四大类共 800 道选择题上 V-JEPA 2 取得 76.3% 准确率 GPT-6 取得 59.7% Claude Opus 5.1 取得 62.1% 人类平均 71.2%。在物理预测任务上给定初始 5 帧预测未来 5 帧物体的运动 V-JEPA 2 的预测轨迹误差比生成式视频模型低 41% 这意味着 V-JEPA 2 真正理解了物理规律而不是记住训练数据中的视觉模式。这一结果让学术界重新审视 LeCun 提出的 JEOA Joint Embedding Predictive Architectures 框架的有效性。

Meta 同步发布了 V-JEPA 2 的三个应用方向第一个是机器人控制 V-JEPA 2 输出的 latent state 可以直接作为机器人强化学习的状态表示让机器人从少量演示中学会复杂操作第二个是自动驾驶仿真 V-JEPA 2 可以预测其他交通参与者的未来轨迹相比传统运动学模型降低 33% 碰撞率第三个是 AR/VR 内容生成 V-JEPA 2 与 Meta Ray-Ban Display 智能眼镜配合实时理解用户看到的物理场景并叠加信息层这三个方向都指向一个共同的结论物理理解能力是实现通用智能的关键要素。

对整个 AI 行业而言 V-JEPA 2 代表了一条不同于 GPT 路线的技术路径。Yann LeCun 长期批评生成式 LLM 无法真正理解物理世界 V-JEPA 系列是他的回应。学术界普遍认为自监督世界模型 JEPA 架构是通往 AGI 的更可行路线。但 V-JEPA 2 目前还不能像 GPT-6 那样直接对话或生成内容距离消费级产品还有 3-5 年的距离。Meta 内部已经在评估 V-JEPA 2 与 Llama 4 融合的可能性让 Llama 4 同时具备语言能力和物理世界理解能力如果这项融合成功可能会在 2027 年带来新的范式转移。

对机器人产业链的拉动效应已经开始显现。波士顿动力在 7 月 30 日宣布 Atlas 2.0 的控制系统集成 V-JEPA 2 作为感知层物体抓取成功率从 78% 提升到 91%。Figure AI 同步披露 Figure 02 机器人使用 V-JEPA 2 后复杂家庭任务的执行成功率提升 28%。Tesla Optimus 的内部测试数据显示 V-JEPA 2 集成后折叠衣物的成功率从 24% 提升到 47%。机器人行业进入物理 AI 新阶段世界模型成为连接感知与行动的关键桥梁。