Qwen2.5-Omni

Qwen2.5-Omni

能看能听能说的端到端全模态模型

AI官网

应用介绍

想做一个能看视频、听声音、还能直接开口回答的 AI 助手,通常要拼接好几个模型,延迟高还容易出错。Qwen2.5-Omni 是阿里通义千问团队的端到端全模态模型,同时理解文字、音频、图像和视频,并实时生成语音。

它采用 Thinker-Talker 架构,支持流式语音对话,权重开源可本地部署。

软件功能



全模态理解:文字、音频、图像、视频。

实时语音:直接开口回答。

流式对话:低延迟。

开源权重:本地部署。

应用截图