Docspell

Docspell

AI文档管理归档

Loading…

应用介绍

#开源文档管理 #纸质文件归档 #OCR识别 #全文搜索 #文档管理

Docspell 是一套专门用来管理扫描件、合同、发票、保单、说明书等纸质文件数字化资料的开源文档归档系统,GitHub 上大约有 2.3K Stars。它解决的核心问题很直接:文件扫进电脑不等于真的归档,真正有用的是以后能靠内容、标签、日期、通信方这些信息快速把它找出来。

把文件导入 Docspell 之后,它可以自动进入处理流程。图片型文档会先做 OCR,把纸面文字转换成可搜索文本,再结合机器学习和自然语言处理,尝试识别通信方、标签、文档日期等信息。你只需要检查和确认一下,后面再找资料时直接全文搜索,比在一堆 scan_0043.pdf 里面翻文件省事得多。

软件功能


多来源文件导入:文档可以从扫描仪、邮箱以及其他来源汇入系统,比较适合把家里或者公司的历史纸质资料集中整理。

OCR 文字识别:遇到扫描 PDF 或图片文件时,可以通过 Tesseract、OCRmyPDF 等工具把图片里的文字转换成可搜索文本,让扫描件真正具备全文检索能力。

自动识别文档信息:系统会使用机器学习和自然语言处理,尝试推断文件对应的通信方、标签以及日期等信息,减少手工一份份整理的工作量。

完整归档体系:支持标签、通信方、预定义元数据和自定义元数据,不是简单给 PDF 换个文件名,而是可以建立比较完整的文档分类和检索体系。

全文搜索:经过 OCR 和信息整理后,可以直接按照文档正文内容进行搜索。像房屋保险、发票金额、合同公司名这类只记得部分信息的文件,也更容易重新找到。

邮件集成:Docspell 支持邮件相关工作流,可以把通过邮箱收到的附件继续纳入归档流程,适合处理电子账单、合同和各种通知文件。

移动端界面:默认界面是一套适配手机的单页 Web 应用,平时用手机查询家里的保单、说明书或者发票会比较方便。

安卓与命令行客户端:除了网页端之外,还提供安卓客户端和命令行客户端,可以根据自己的使用场景选择访问方式。

REST API:系统功能都通过 REST API 暴露出来,想接自动扫描、NAS、家庭服务器或者其他文档处理流程,也有比较大的二次开发空间。

技术栈:后端采用 Scala,使用 Cats、FS2、Doobie、Http4s 等函数式技术栈;前端使用 Elm 配合 Tailwind。文档处理部分依赖 Tesseract、unoconv 和 OCRmyPDF。

机器学习组件:机器学习和自然语言处理部分使用 Stanford CoreNLP。需要注意的是,Stanford CoreNLP 采用 GPL 协议,如果准备将 Docspell 集成到商业产品或者进行二次分发,建议提前确认相关开源许可要求。

应用截图