Whisper

Whisper

开源语音转文字

AI官网

应用介绍

< #语音识别 #语音转文字 #多语言 #字幕生成 #本地部署 #开源软件

Whisper 是 OpenAI 开源的通用语音识别模型,把音频转成文字这件事做得又准又省心,而且完全免费、可以跑在自己机器上。同类的在线转写服务大多按月订阅,Otter 这类工具一个月要二十美元左右,Whisper 装完就能一直用,音频也不必上传给别人。

它训练在大规模多样化的音频数据上,支持九十多种语言的识别,同时还是个多任务模型:除了转写,还能把非英语语音直接翻成英文、判断音频里说的是哪种语言。适合做会议记录、播客文稿、视频字幕,或者给自己的程序接一个不花钱的转写能力。

软件功能



多语言识别:支持九十多种语言的语音转文字,识别效果因语言而异,项目给出了各语言的词错率对照图供参考。

语音翻译:加上 `--task translate` 就能把非英语语音直接转成英文文本,多语言模型(small、medium、large)在这项任务上表现最好。

六档模型任选:从 39M 的 tiny 到 1550M 的 large,显存需求约 1GB 到 10GB,速度相差十倍,可以按机器条件在速度和精度之间取舍;另有 turbo 模型,是 large-v3 的优化版,快了约八倍而精度几乎不降。

英语专用版本:tiny、base、small、medium 四档都有 `.en` 英语专用模型,处理纯英文内容时比同尺寸的多语言模型更准。

命令行直接用:`whisper audio.mp3 --model turbo` 一句话完成转写,支持 flac、mp3、wav 等常见格式,可以指定语言,也能一次处理多个文件。

Python 接口:`whisper.load_model()` 加 `model.transcribe()` 两行就能嵌进自己的程序,方便接进批量处理或后续的文本流程。

安装简单:`pip install -U openai-whisper` 即可,另需系统里装好 ffmpeg,Python 3.8 到 3.11 都能跑。

本地运行不外传:模型在本地推理,音频不需要上传到任何服务器,涉及会议录音和访谈素材时这一点尤其重要。

开源项目:项目源码托管在 GitHub,采用 MIT 许可,方便开发者查看实现方式、参与开发,或者根据自己的需求进行二次定制。