LingBot-World

LingBot-World

交互式世界模型

AI官网

应用介绍

过去一年的世界模型演示大多是这个套路:给一张图,模型吐一段十几秒的视频,看着惊艳,但你不能插手,跑一会儿画面就开始糊、场景开始漂。看的成分远大于玩的成分。

LingBot-World 2.0(论文里叫 LingBot-World-Infinity)把这件事往前推了一步:给它一张图,生成的是一个能实时操控的世界。WASD 移动、IJKL 转视角,空格跳,按 U 近战、O 远程、P 滑翔,还能按数字键触发法术。官方页面上那个 demo 就是这么玩的——赛博朋克街头一个巫师,右边列着「绿色死亡魔法」「红色火焰魔法」「悬浮汽车」几个事件让你按。

它在架构上有两个东西值得说。一是用因果预训练把交互时长做成无上限的,官方的说法是保持输出质量不衰减,也就是不会玩着玩着崩掉;再蒸馏出一个实时版本,足以驱动 720p 60fps 的视频流。二是引入了双 Agent:Pilot 负责规划和执行角色行为,Director 负责随着场景推进往里加新的环境元素——世界会自己往下长,不用你一直喂提示词。事件不只有动作,也包括「霓虹峡谷开始下雪」这种改天气改场景的。

代码、技术报告和 14B 的 causal-fast 权重都放出来了,HuggingFace 和魔搭都有;1.3B 和另外两个 14B 变体还在 TODO 里。基于 Wan2.2 做的。

软件功能



图生世界:输入一张图加一句场景描述,生成可进入的环境,官方示例走的是 i2v-A14B 任务,配合动作序列文件驱动。

实时可操控:蒸馏出的实时版本支撑 720p 60fps;键盘方案是 WASD 移动 + IJKL 转视角 + 空格跳跃。

动作种类多:比上一代新增了近战、弓箭、施法、射击等动作,动作交给 VLM 判定后落到画面里。

文字驱动事件:用文字触发环境变化,从「一群椋鸟从云层里飞出」这种局部出现的事件,到「霓虹峡谷开始下雪」这种整体天气变化。

双 Agent 演化:Pilot agent 规划并执行角色行为,Director agent 在场景推进时合成新的环境元素,让世界自己往前长。

不限交互时长:因果预训练范式让交互可以一直进行下去而画质不塌,这是相对上一代最核心的改动。

在线可试:国际版在 Reactor 的网页上试,国内在灵光 App 上试;官方完整能力的演示放在 WAIC 2026 现场。

自己跑的门槛:仓库给的推理示例是 480P、8 卡 torchrun,需要 torch ≥ 2.4 和 flash-attn。部署代码作者明确说不会开源,要自建服务得参考 SGLang 或 NVIDIA flashdreams 的方案。

许可要看清:CC BY-NC-SA 4.0——可以分享和改,但必须署名、必须同样协议开放,不能商用