应用介绍
想做一个能看视频、听声音、还能直接开口回答的 AI 助手,通常要拼接好几个模型,延迟高还容易出错。Qwen2.5-Omni 是阿里通义千问团队的端到端全模态模型,同时理解文字、音频、图像和视频,并实时生成语音。
它采用 Thinker-Talker 架构,支持流式语音对话,权重开源可本地部署。
全模态理解:文字、音频、图像、视频。
实时语音:直接开口回答。
流式对话:低延迟。
开源权重:本地部署。
它采用 Thinker-Talker 架构,支持流式语音对话,权重开源可本地部署。
软件功能
全模态理解:文字、音频、图像、视频。
实时语音:直接开口回答。
流式对话:低延迟。
开源权重:本地部署。

