2026 年 10 月 9 日——AI 创业公司 Odyssey 于 10 月 8 日发布基础世界模型 Odyssey-3,官方称其为迄今最强大的基础世界模型;其中 Odyssey-3 Pro 在 Physics-IQ Verified 视频到视频基准上取得 66.10% 的最高报告分数,刷新该基准纪录,研究预览版已在官网免费开放体验。

本文信息主要来自 Odyssey 官网两篇发布公告(9 月 15 日技术介绍与 10 月 8 日发布说明)、Physics-IQ Verified 排行榜,以及创始人在 X 平台的官宣帖(截至发稿浏览量已超过 53 万次)。

1. 基准成绩:物理准确性刷新最高分

Physics-IQ 是由 Anates Labs 与 Google DeepMind 联合推出的物理理解基准,覆盖流体力学、光学、固体力学、磁学与热力学等物理行为,要求模型续写真实物理实验视频,并将预测结果与真实走向对比评分。

据 10 月 8 日官方发布说明,Odyssey-3 Pro 在 Physics-IQ Verified 的视频到视频(V2V)赛道取得 66.10%,为该基准迄今最高报告分数;在图生视频(I2V)赛道得分为 54.7。标准版 Odyssey-3 的物理精度略低于 Pro 版,官方表示其改善了物理精度与生成成本之间的权衡,可在相同算力预算内生成更多模拟。

Physics-IQ Verified 排行榜(V2V 赛道,2026 年 10 月 7 日数据)主要条目如下:

模型(所属机构) 最好成绩(8 次采样择优) 单次采样成绩 单次采样每视频成本
Odyssey-3 Pro(Odyssey) 66.10% 63.37% 0.444 美元
Odyssey-3(Odyssey) 64.43% 61.56% 0.187 美元
FLUX 3 [large](BFL) 64.35% 61.11% 2.080 美元
Physical Registry + PRS(微软亚洲研究院) — 52.61% —
Cosmos3 Super(NVIDIA,开源) — 50.80% —
Cosmos3 Nano(NVIDIA) — 43.00% —

数据口径:成本按 Odyssey 官方假设的每 MI355X GPU 小时 1 美元估算;分辨率方面 Odyssey-3 为 832×480、Pro 版为 1280×720;Odyssey-3 Pro 最好成绩对应 16 FPS 生成速度。

在衡量控制跟随、视觉质量与世界记忆的 WorldMark 基准上,官方自评数据显示 Odyssey-3 在 4 个环境类别中的 3 个排名第一:第一人称风格化环境得分 79.0,第三人称风格化环境得分 76.3,均领先第二名 HY-World 1.5(分别为 76.9 与 75.1)。需要说明的是,该成绩为官方使用基准自带描述与 13 项指标均值自测的结果。

2. 一个模型,六类物理与虚拟系统

Odyssey-3 定位为通用物理智能的基础模型,官方称同一模型可为机器人、人形机器人、汽车、无人机提供控制策略,也可用于训练 AI 与游玩游戏:

graph LR A[Odyssey-3 基础世界模型] --> B[机械臂] A --> C[人形机器人] A --> D[自动驾驶] A --> E[无人机] A --> F[AI 智能体训练] A --> G[游戏智能体] style A fill:#e8f4f8,stroke:#1a6b8a style B fill:#d5f5e3,stroke:#27ae60 style C fill:#ffecd6,stroke:#b7950b style D fill:#d6eaf8,stroke:#2980b9 style E fill:#fadbd8,stroke:#c0392b style F fill:#ebdef0,stroke:#8e44ad style G fill:#fdebd0,stroke:#e67e22
应用系统 适配数据量 官方披露结果
机械臂 数十小时机器人演示 完成倒麦片、物品装盒等任务,出现演示中未见的恢复行为,如抓空后重新调整夹爪、拾取异常位置掉落的物体
人形机器人 数十小时遥操作数据(Flexion 合作) 光照变化下持续执行任务,环境变化下的泛化优于受测 VLA 基线
汽车 20 小时模拟驾驶数据,主干模型冻结 在印度真实道路闭环自动驾驶,全程模拟训练策略的安全员接管间隔里程约为真实数据训练策略的 77%
无人机 数十小时模拟飞行数据 室内模拟环境中稳定飞行并避开障碍
AI 智能体训练 配合 PROWL 框架 生成可供智能体探索与学习的交互环境
游戏智能体 约 2 小时 GTA V 游戏录像 在 GTA V 中长时段游玩;移动策略未经额外训练即在《荒野大镖客 2》生成骑马移动、在《热血无赖》生成摩托车驾驶

官方介绍称,适配新系统时预训练世界模型保持冻结,仅训练一个小型动作解码器或策略,将模型内部表征翻译为具体机器的控制指令,因此每个任务所需的交互经验数据远少于以往专用系统。

3. 技术架构与开放情况

Odyssey-3 是一个自回归扩散 Transformer:以多步视频扩散 Transformer 为基础,通过时间分辨的提示与控制引导世界演化,再经 teacher forcing 与因果掩码扩展为自回归模型,从既有观测出发、以动作输入为条件预测未来状态。官方还通过分布匹配与对抗蒸馏的后处理流程得到少步数的蒸馏版本,支持实时交互。

本次研究预览支持从提示词生成可交互环境,提供第一人称与第三人称导航及独立镜头运动,用户可在生成过程中移动或引入事件并观察模型响应。研究预览可免费体验,官方同时向开发机器人、人形机器人、自动驾驶与无人机的物理 AI 开发者开放合作渠道。

训练数据方面,官方披露其组合了三类来源:带事件标注的互联网视频、时间对齐键鼠输入的游戏录像,以及带描述与元数据的模拟刚体交互数据。

4. 公司背景

Odyssey 于 2023 年由 Oliver Cameron 与 Jeff Hawke 创立,官方介绍称创始团队有十年无人驾驶研发经验,团队成员来自 DeepMind、Waymo、Tesla、Meta、Apple 与 xAI。官网显示公司已完成 3.1 亿美元 B 轮融资,此前已发布 Starchild-1、Agora-2 世界模型与 PROWL-2 强化学习框架。

官方在 9 月 15 日的技术介绍中曾表示将于未来几周公开发布 Odyssey-3,本次发布兑现了这一时间表。官方同时称,当前前沿世界模型的规模仍比语言模型落后约两个数量级,这是该方向的主要提升空间。