应用介绍
发票、合同里的字段要提取出来,传统 OCR 拿到的只是一堆字,云端服务又不能用于敏感文件。docext 是 Nanonets 开源的本地部署文档信息抽取与基准测试工具包,不依赖传统 OCR,直接用视觉语言模型理解文档。
它能把文档转成 Markdown、抽取表格和字段,并配套 3B 参数的 Nanonets-OCR-s 模型,能识别图片、签名、水印等语义元素。
本地部署:敏感文档不出内网。
字段抽取:从非结构化文档中提取信息。
表格与 Markdown:转换为结构化格式。
专用模型:Nanonets-OCR-s 3B 模型。
它能把文档转成 Markdown、抽取表格和字段,并配套 3B 参数的 Nanonets-OCR-s 模型,能识别图片、签名、水印等语义元素。
软件功能
本地部署:敏感文档不出内网。
字段抽取:从非结构化文档中提取信息。
表格与 Markdown:转换为结构化格式。
专用模型:Nanonets-OCR-s 3B 模型。

