应用介绍
开完会录了一个多小时的音频,一周后想确认「当时到底是怎么定的」,只能拖着进度条一段段试听。丢给在线转录服务倒是省事,可整段对话——客户名字、报价、内部争论——就一起传到别人服务器上了。Speakr 是一套自己部署的转写与笔记应用,音频进去,出来的是带说话人标注、能全库检索、还能直接追问的结构化笔记,全程跑在自己的机器上。
它把一段录音当成一条流水线来处理:录进来或拖进来 → 转写并分辨谁在说话 → 自动出摘要和待办 → 存进可搜索的资料库。最有意思的是 Inquire 模式,直接问「关于调价我们最后定的是什么,有人反对吗」,它会跨整个录音库检索,答案里的时间戳是可点的,点一下就跳到那句话的播放位置——不用先想起来这事发生在哪次会议上。
多种录音来源:麦克风、系统声音、浏览器标签页音频都能录,也能混录两路;界面里直接列出 PulseAudio / PipeWire 的 monitor、BlackHole、VB-Cable、Voicemeeter、立体声混音这些虚拟设备,还按操作系统给了设置说明。现成的音频文件拖进去也行。
长时间录制不怕断:网页里录的音频边录边传到服务端,录几个小时没问题,中途刷新页面也不会丢。
转写引擎自己选:自托管 WhisperX(推荐,说话人相关的功能都靠它)、OpenAI、Mistral Voxtral、AssemblyAI、OpenASR、阿里 FunASR,或者任何自定义 ASR 服务,配置写好后程序会自动认出该用哪个连接器。
说话人分离与声纹档案:自动标出每句话是谁说的;用 WhisperX 后端时还能靠声纹把同一个人在不同录音里认出来,不用每次重新标注。
自定义词表:人名、术语、缩写这些容易听错的词可以提前喂给转写器,支持全局、按标签、按文件夹配置,也能在上传对话框里临时加,还能存成模板复用。
转写与播放同步:点转写稿的任意一行就跳到那个时间点,播放时当前句会跟着高亮,也可以切成聊天气泡样式看多人对话。
摘要和事件提取:转写完自动生成摘要,提示词能按录音、按标签、按文件夹分别定制;还能从稿子里挑出待办事项和值得进日历的安排。
Inquire 全库问答:对整个录音库做语义检索和自然语言提问,答案带可点的时间戳;开启实验中的 agentic 模式后它会自己反复检索、翻列表、读原文直到能回答,每一步都实时显示,引用也带编号链接。允许它读哪些内容(转写稿、摘要、私人笔记)由你决定。
无人值守导入:指定一个监听文件夹,丢进去的音频自动导入并处理,还能按用户 ID 或用户名分子目录。
整理与留存:文件夹加批量操作管理大库;智能标签自带 AI 提示词和 ASR 设置并且可以叠加;留存策略支持到期自动删除,重要录音可单独设为免清理。
多人协作:多用户 + OIDC 单点登录(Keycloak、Azure AD、Google、Auth0、Pocket ID);群组内的标签会自动把录音共享给所有成员;还有查看/编辑/再分享三级权限和管理员可控的公开链接。
自动化接口:带 Swagger UI 的 REST API v1,方便接 n8n、Zapier、Make;录音生命周期事件有 HMAC 签名的 webhook 通知;每个用户还能设 LLM token 和转写分钟数的用量上限。
装起来不麻烦:Docker Compose 一把起,默认端口 8899;另有 lite 镜像不带 PyTorch,体积从 4.4GB 降到 725MB 左右,只有 Inquire 的语义检索会退回普通文本搜索。也是可安装的 PWA,手机上能用系统分享直接推送音频,界面支持七种语言和明暗主题。
它把一段录音当成一条流水线来处理:录进来或拖进来 → 转写并分辨谁在说话 → 自动出摘要和待办 → 存进可搜索的资料库。最有意思的是 Inquire 模式,直接问「关于调价我们最后定的是什么,有人反对吗」,它会跨整个录音库检索,答案里的时间戳是可点的,点一下就跳到那句话的播放位置——不用先想起来这事发生在哪次会议上。
软件功能
多种录音来源:麦克风、系统声音、浏览器标签页音频都能录,也能混录两路;界面里直接列出 PulseAudio / PipeWire 的 monitor、BlackHole、VB-Cable、Voicemeeter、立体声混音这些虚拟设备,还按操作系统给了设置说明。现成的音频文件拖进去也行。
长时间录制不怕断:网页里录的音频边录边传到服务端,录几个小时没问题,中途刷新页面也不会丢。
转写引擎自己选:自托管 WhisperX(推荐,说话人相关的功能都靠它)、OpenAI、Mistral Voxtral、AssemblyAI、OpenASR、阿里 FunASR,或者任何自定义 ASR 服务,配置写好后程序会自动认出该用哪个连接器。
说话人分离与声纹档案:自动标出每句话是谁说的;用 WhisperX 后端时还能靠声纹把同一个人在不同录音里认出来,不用每次重新标注。
自定义词表:人名、术语、缩写这些容易听错的词可以提前喂给转写器,支持全局、按标签、按文件夹配置,也能在上传对话框里临时加,还能存成模板复用。
转写与播放同步:点转写稿的任意一行就跳到那个时间点,播放时当前句会跟着高亮,也可以切成聊天气泡样式看多人对话。
摘要和事件提取:转写完自动生成摘要,提示词能按录音、按标签、按文件夹分别定制;还能从稿子里挑出待办事项和值得进日历的安排。
Inquire 全库问答:对整个录音库做语义检索和自然语言提问,答案带可点的时间戳;开启实验中的 agentic 模式后它会自己反复检索、翻列表、读原文直到能回答,每一步都实时显示,引用也带编号链接。允许它读哪些内容(转写稿、摘要、私人笔记)由你决定。
无人值守导入:指定一个监听文件夹,丢进去的音频自动导入并处理,还能按用户 ID 或用户名分子目录。
整理与留存:文件夹加批量操作管理大库;智能标签自带 AI 提示词和 ASR 设置并且可以叠加;留存策略支持到期自动删除,重要录音可单独设为免清理。
多人协作:多用户 + OIDC 单点登录(Keycloak、Azure AD、Google、Auth0、Pocket ID);群组内的标签会自动把录音共享给所有成员;还有查看/编辑/再分享三级权限和管理员可控的公开链接。
自动化接口:带 Swagger UI 的 REST API v1,方便接 n8n、Zapier、Make;录音生命周期事件有 HMAC 签名的 webhook 通知;每个用户还能设 LLM token 和转写分钟数的用量上限。
装起来不麻烦:Docker Compose 一把起,默认端口 8899;另有 lite 镜像不带 PyTorch,体积从 4.4GB 降到 725MB 左右,只有 Inquire 的语义检索会退回普通文本搜索。也是可安装的 PWA,手机上能用系统分享直接推送音频,界面支持七种语言和明暗主题。


