应用介绍
#PDF阅读 #AI读书 #知识库 #逐页解析 #Markdown #JSON #长文档处理 #GitHub项目 #AI摘要
这是一款主打让 AI 逐页读完 PDF,并边读边构建知识库的开源脚本,目前在 GitHub 上已经获得约 2.3K Stars。它没有选择把几百页 PDF 一次性全部塞进模型,而是采用更稳妥的处理方式:一页一页读取、一页一页提炼知识,再把结果持续积累下来。
对于几百页甚至更长的书籍来说,这种思路很实用。因为直接把整本 PDF 交给 AI,很容易受到上下文窗口限制,最后只能得到一份偏泛化的总结,大量章节细节、案例、概念和前后关联都会被压缩掉。这个脚本则把长文档拆成连续的小任务,让 AI 真正按照页面顺序处理内容。
每处理一页,它都会提取对应的知识点,并不断写入一个 JSON 知识库。处理到一定页数后,还能自动生成阶段性摘要;整本书读取完成后,再根据累计下来的内容生成完整总结,并以 Markdown 文件保存。换句话说,它不是只追求“最后给我总结一下”,而是在阅读过程中把知识提取、知识积累和总结一起完成。
软件功能
逐页读取 PDF:不会尝试一次把整本书塞进上下文,而是按照页面顺序逐页交给 AI 处理,更适合几百页甚至更长的 PDF 文档。
逐页提取知识点:每读取一页,就让模型从当前页面中整理关键信息,将原本分散在书中的内容逐步结构化。
自动构建 JSON 知识库:提取出来的知识不会只存在于临时上下文,而是持续保存到 JSON 文件中,后续可以继续处理、检索或者进行二次开发。
阶段性摘要:可以每隔若干页自动整理一次阶段总结,避免读到后面时完全依赖模型记住前面几百页的内容。
生成完整总结:全部页面处理完成后,可以基于已经积累的知识库继续生成整本 PDF 的最终摘要,并以 Markdown 格式保存。
处理模型与总结模型可分开设置:逐页提取和最终摘要可以指定不同的 AI 模型,例如使用成本较低的模型负责大量页面处理,再让能力更强的模型完成最终总结。
支持断点继续:如果几百页 PDF 处理到一半意外中断,可以载入已经生成的知识库继续执行,不需要每次都从第一页重新开始。
支持限制处理页数:测试提示词、模型或者输出效果时,可以只处理前几页,确认结果满意后再正式跑完整本书,减少不必要的 Token 和时间消耗。
适合长篇资料:除了电子书,这种逐页处理思路同样适合论文合集、课程资料、研究报告、技术文档和其他大型 PDF,把一次性的“AI 阅读”变成持续积累的结构化知识库。