AI-Video-Transcriber

AI-Video-Transcriber

AI视频转录器

Loading…

应用介绍

#视频转文字 #AI摘要 #字幕提取 #FasterWhisper #FastAPI #yt-dlp #FFmpeg #YouTube #TikTok #哔哩哔哩 #ApplePodcasts #SoundCloud #Docker #开源工具

AI-Video-Transcriber 是一款可以把视频、播客和本地音视频文件自动整理成文字稿与摘要的开源工具,目前 GitHub 上约有 3K Stars。它特别适合处理两小时播客、长视频、课程录像这类内容:直接丢一个链接进去,工具会自动完成字幕获取、语音转写、文本优化和摘要生成,不需要自己反复倍速听、手动记重点。

它的处理逻辑也比较聪明。遇到平台本身带字幕的视频,会优先提取原生字幕;如果没有字幕,就调用 Faster-Whisper 对音频进行语音识别。得到原始转录文本后,还会再交给大模型做清理和优化,把机器转录里常见的错别字、断句和表达问题进一步整理。

除此之外,它还能根据内容生成多语言摘要。如果原始内容语言和目标摘要语言不同,还可以顺手完成翻译,相当于一次把“听内容、整理文字、提炼重点、跨语言阅读”这几件事都做了。

软件功能



链接直接转文字:只需要提交视频或播客链接,就可以自动抓取内容并生成整理后的文字稿,减少手动下载和处理步骤。

优先使用平台原生字幕:如果视频本身已经提供字幕,会优先直接提取,通常比重新进行语音识别更快,也能减少额外计算消耗。

无字幕自动语音识别:当平台没有可用字幕时,会调用 Faster-Whisper 对音频进行转录,把视频或播客内容转换成文本。

AI 优化转录文本:不仅仅停留在“语音转文字”,还可以继续使用大模型整理转录结果,对错别字、断句和表达进行优化,让最终文字稿更适合直接阅读。

自动生成多语言摘要:可以对长视频、播客等内容自动提炼重点,输出更加紧凑的摘要,方便快速了解核心信息。

支持自动翻译:当原始文字稿和目标摘要使用不同语言时,可以同时完成翻译,不需要再单独复制到其他翻译工具处理。

支持多个内容平台:可处理 YouTube、TikTok、哔哩哔哩、Apple Podcasts、SoundCloud 等来源,同时还能覆盖其他 yt-dlp 支持的网站。

支持本地文件:除了在线链接,也可以直接上传本地音视频文件进行处理,默认单文件大小上限为 200 MB

完整的本地处理技术栈:后端基于 FastAPI,并结合 yt-dlp、FFmpeg 和 Faster-Whisper 完成媒体下载、音频处理以及语音识别。

支持 Docker 部署:既可以直接安装到本地运行,也可以通过 Docker 部署,比较适合个人长期使用或者搭建成自己的音视频摘要服务。

对于经常需要消化课程、访谈、播客和长视频的人来说,它更像是一个自动化内容消化流水线:把几个小时的影音内容,直接转换成可以搜索、阅读、保存和复习的文字资料。

应用截图