应用介绍
机器人学操作任务,换个物体、换个场景就不会了,泛化能力一直是难题。DiT4DiT 是一个把视频生成模型和流匹配动作预测结合起来的视觉-动作模型,先想象画面怎么变化,再推出动作。
借助视频模型学到的物理常识,它在新物体和新场景上的操作泛化更好,已开源代码。
视频生成:预测未来画面。
流匹配动作:平滑的动作输出。
泛化操作:新物体新场景。
借助视频模型学到的物理常识,它在新物体和新场景上的操作泛化更好,已开源代码。
软件功能
视频生成:预测未来画面。
流匹配动作:平滑的动作输出。
泛化操作:新物体新场景。

