应用介绍
#语音转文字 #语音识别 #说话人识别 #本地AI #开源项目 #Mac #macOS #MIT
VibeVoice-ASR 是微软开源的一款语音转文字 AI,可以直接处理最长约 60 分钟的音频,无需提前手动切分。它适合会议录音、访谈、课程、播客等长音频转写场景,并支持说话人识别和句级时间戳。
VibeVoice-ASR 可以在本地运行,音频无需上传到第三方云端,也不会产生按调用次数计算的 API 费用。对于重视隐私,或者需要批量整理录音内容的用户来说,使用起来更方便。
软件功能
- 长音频转写:单次可以处理最长约 60 分钟的音频,不需要先将录音切成多个片段。
- 说话人识别:能够区分录音中的不同说话人,适合多人会议、访谈和对话内容。
- 句级时间戳:为每句话生成对应时间信息,方便定位原始录音内容。
- 多语言识别:支持 50 多种语言,可用于不同语言的录音转写。
- 本地运行:录音可以直接在自己的电脑上处理,无需上传到云端。
- 零 API 费用:本地部署后无需按分钟或调用次数支付语音识别费用。
- 适合隐私场景:会议录音、内部访谈等内容可以留在本地处理。
- MIT 开源协议:允许个人和商业项目使用,也可以根据需求进行修改和集成。
- 支持 macOS:可在 MacBook 等 Mac 设备上部署和运行。