公司动态

PageIndex 使用教程:4 条命令,把长 PDF 变成 AI 能推理的目录树

📅 2026/9/1 10:33:15
PageIndex 使用教程:4 条命令,把长 PDF 变成 AI 能推理的目录树
PageIndex 使用教程4 条命令把长 PDF 变成 AI 能推理的目录树【免费下载链接】PageIndex PageIndex: Document Index for Vectorless, Reasoning-based RAG项目地址: https://gitcode.com/GitHub_Trending/pa/PageIndexPageIndex 是一款无向量、基于推理的 RAG检索增强生成文档索引工具适合需要频繁对财务报表、监管文件、技术手册这类超长文档提问的场景。它把 PDF 解析成带页码的层级目录树让大模型按章节逐层定位内容走的是**推理式检索tree search**而非向量相似度匹配。把 200 页 PDF 塞进向量库再提问答案总差那么一层——相似度不等于相关性这正是传统向量 RAG 的软肋。 原理速览目录树如何替代向量库传统做法靠分块加语义相似度捞段落在专业长文档里容易失效措辞不相似但真正相关的章节被漏掉字面相似却不相关的段落被召回。PageIndex 改成两步走先扫描文档的章节结构生成树状索引每个节点标注页码范围和摘要提问时LLM 沿着这棵树逐层缩小范围找到候选节点后只读取对应页码检索路径全程可见、可回溯。索引本体就是一个 JSON 文件仓库里有多份真实样例可以参考比如 examples/documents/results/four-lectures_structure.json{ title: Financial Stability, node_id: 0006, start_index: 21, end_index: 22, summary: The Federal Reserve ..., nodes: [ { title: Monitoring Financial Vulnerabilities, node_id: 0007 } ] }每个节点都有四位node_id和起止页码所谓检索就是让模型返回一组 node_id过程透明可解释。️ 上手流程4 条命令生成第一份树索引1️⃣克隆仓库git clone https://gitcode.com/GitHub_Trending/pa/PageIndex2️⃣一条命令装好依赖pip3 install --upgrade -r requirements.txt3️⃣密钥写在哪个文件——项目根目录新建.env写入OPENAI_API_KEY接入其他模型厂商时可用provider/model格式基于 LiteLLM 实现多模型支持OPENAI_API_KEYyour_openai_key_here4️⃣跑主脚本结果会存到./results/文件名_structure.jsonpython3 run_pageindex.py --pdf_path /path/to/your/document.pdf常用可选参数如下默认值定义在 pageindex/config.yaml参数说明默认值--model构树使用的 LLMgpt-4o-2024-11-20--toc-check-pages扫描目录结构的页数20--max-pages-per-node单个节点最大页数10--max-tokens-per-node单个节点最大 token 数20000--if-add-node-summary是否生成节点摘要yes 效果验证财务问答基准 98.7% 的准确率对财务类长文档官方 README 引用了基于 PageIndex 的 Mafin 2.5 系统的成绩FinanceBench 财务文档问答基准上 98.7% 的准确率大幅领先传统向量 RAG 方案。追求速度的 Flash 模式也有自己的基准数据9 份 9 页到 1,098 页的 PDF 全部跑通结构提取 节点摘要全流程其中 1,098 页的《Machine Learning: A Probabilistic Perspective》全程消耗约 158.7 万输入 token。耗时与页数的关系见下图 还能做什么Flash、Markdown 与智能体问答Flash 模式python3 run_pageindex.py --flash --pdf_path doc.pdf用版式启发式规则秒级构树结构提取本身不耗 LLM 调用摘要仍需模型再加--optimize可让 LLM 精修树结构降低检索成本细节见 pageindex/flash/README.md。Markdown 文档换用--md_path参数即可按#标题层级建树例如python3 run_pageindex.py --md_path doc.md由 PDF 转来的 Markdown 因层级易丢失官方不推荐直接走这个模式。接上智能体问答examples/agentic_vectorless_rag_demo.py 基于 OpenAI Agents SDK几行代码就让智能体自动调用文档浏览、结构查询、取页工具来回答问题cookbook/ 里还有最简无向量 RAG 和直接基于页面图像、免 OCR 的视觉版工作流两个 notebook。多文档检索examples/tutorials/doc-search/README.md 给出按元数据、语义、描述三种跨文档搜索策略树搜索的提示词模板在 examples/tutorials/tree-search/README.md。现在就把第一份文档丢进去看看生成的树和你手工写的目录差多少。【免费下载链接】PageIndex PageIndex: Document Index for Vectorless, Reasoning-based RAG项目地址: https://gitcode.com/GitHub_Trending/pa/PageIndex创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考