如果说大模型学会了"理解文字",那世界模型要学的是"理解并生成一个可以互动的 3D 世界"。字节、京东等巨头正加速押注这一方向:字节张一鸣亲自监督开发实时空间视频生成模型,京东开源世界模型 JoyAI-Echo 并在 WBench Navigation 评测中以 81.6 分登顶,同时规划十万卡国产算力集群。一场关于"可交互 3D 世界"的竞速,已经开始。
什么是世界模型 / 空间视频
- 世界模型:让 AI 理解真实世界的物理规律、空间结构,能预测和生成"世界"的变化;
- 空间视频生成:生成连续的、可交互的 3D 场景视频(不只是静态画面);
- 可交互:你改变输入(动作、视角),世界模型能实时响应,像"走进一个虚拟世界"。
这是从"生成图片/文字"到"生成可玩的 3D 世界"的跨越。
巨头们的动作
- 字节:张一鸣亲自督战,基于 Seedance 开发实时空间视频生成模型,延迟约 0.05 秒、每秒 20 帧,可为直播、短剧、游戏创建互动虚拟世界,对标谷歌 Genie;
- 京东:开源实时可交互世界模型 JoyAI-Echo,WBench Navigation 81.6 分登顶,并规划十万卡国产算力集群、1000 万小时具身数据采集;
- 智象未来:发布具身世界模型 HiDream-O1-Embodied,登榜 RoboColiseum 扰动适应榜首。
巨头下场,说明"生成可交互 3D 世界"被视作大模型之后的下一座金矿。
为什么如此重要
- 从"看"到"玩":可交互世界模型能让 AI 用于游戏、直播、短剧、数字孪生、机器人训练等;
- 数据与算力飞轮:世界模型需要海量真实数据与超强算力,门槛极高;
- 下一代理工形态:直接把"自然语言"变成"可交互场景",是交互方式的革命。
挑战与看点
- 算力需求爆炸:实时视频生成对算力要求极高,巨头都在囤算力(京东十万卡集群);
- 数据获取:真实世界交互数据昂贵,数据采集是瓶颈;
- 真实性 vs 可控性:既要"像真实世界",又要"可控可编辑",是技术难点。
结语
当字节、京东们开始抢"可交互 3D 世界",AI 竞争的下一站已经从"文字"“图片"升级到"物理世界的生成与互动”。世界模型不只是做视频,它可能成为游戏、直播、机器人、数字孪生的共同底座。谁先造出"真实又能互动"的世界生成器,谁就握住了人工智能的下一张入场券。
本文基于公开报道整理,产品与评测数据以各公司官方为准。
评论