公司动态
5分钟装好 Docling:PDF、Word 一键转 Markdown 的完整上手指南
5分钟装好 DoclingPDF、Word 一键转 Markdown 的完整上手指南【免费下载链接】doclingGet your documents ready for gen AI项目地址: https://gitcode.com/GitHub_Trending/do/doclingDocling 是一款面向生成式 AI 的文档处理工具把 PDF、DOCX、HTML 等文档解析成统一的结构化表示再导出为 Markdown、JSON 等格式。这篇 Docling 安装与上手指南带你用最少步骤从「装好」走到「跑通第一次转换」。一条命令装好 Docling先确认一下 Python 是 3.10 及以上python --version看一眼即可。Docling 同时覆盖 macOS、Linux、Windows 以及 x86_64 / arm64。pip最常用pip install doclinguv解析更快uv add docling从源码装想改代码时git clone https://gitcode.com/GitHub_Trending/do/docling cd docling uv sync --all-extras --no-extra feat-ocr-nemotron装完后终端里就有了docling命令。下面先花 30 秒确认它真的能用。装完先验证30 秒确认能跑别急着写代码先用两条最短的命令确认环境没问题。最轻量的确认——看 CLI 是否就位docling --help能打印出用法说明就代表命令行工具已装好。想一步到位直接真跑一次docling https://arxiv.org/pdf/2206.01062当前目录生成了一个.md文件就大功告成了。第一次转换PDF 变 MarkdownDocling 的核心逻辑一句话就能说清把各种格式「吃进去」输出统一的 DoclingDocument再导出成你要的格式。在 Python 里只需几行from docling.document_converter import DocumentConverter source https://arxiv.org/pdf/2408.09869 # 本地路径或 URL 都行 doc DocumentConverter().convert(source).document print(doc.export_to_markdown()) # 输出 Markdown想换文档、换格式直接改source和导出方法即可支持 Markdown、JSON、HTML、纯文本等。转换结果长什么样认识 DoclingDocument不管输入是 PDF 还是 WordDocling 都会把它组织成一棵带层级的树标题、段落、图片、表格各就各位。你既可以导出成 Markdown / JSON / HTML也能直接拿着这棵树去做分块和检索。装不上按 3 步排查安装或首次运行时卡住99% 是这几种情况对号入座即可。1. Python 版本太低Docling 需要 Python 3.10 及以上。先python --version确认低于 3.10 就先升级 Python 再重装。2. Intel 版 Mac 报错新版 PyTorch 不再提供 Intel Mac 的预编译包装兼容版即可pip install docling[mac_intel]注意其依赖的 torch 2.2.2 要求 Python 3.12 或更低。3. 只有 CPU 的 Linux显式装 CPU 版 PyTorch避免拉下 GPU 依赖pip install docling --extra-index-url https://download.pytorch.org/whl/cpu按需加装只装你要的功能默认装好的 Docling 就能跑通常见转换。要扩展时用 extras 按「你想做什么」来选而不是盲目装一堆。想识别扫描版 PDF、图片里的文字OCRDocling 支持多个 OCR 引擎装你顺手的pip install docling[rapidocr] # 轻量、速度快 pip install docling[easyocr] # 默认多语言友好用 Tesseract 则需先装系统包并设置TESSDATA_PREFIX各平台命令见官方安装文档。想用视觉语言模型VLMpip install docling[vlm]想转语音 / 视频字幕ASRpip install docling[asr]完整的 extras 列表见 docs/getting_started/installation.md。接进你的 AI 项目Docling 的输出可以直接喂给 LangChain、LlamaIndex、Haystack 等框架也能通过 MCP 接入任意 Agent。转换 → 分块 → 向量化一条链路就能嵌进你的 RAG 流程。现成对接示例见 docs/integrations/。看懂它的转换流程一句话理解每种格式先交给对应的「后端」读取再走一条「管线」完成版面、阅读顺序、表格等解析最后统一成 DoclingDocument由你决定导出成什么。想调行为改PipelineOptions就行。完整管线源码docling/pipeline/各格式后端docling/backend/文档转换器docling/document_converter.pyOCR 引擎实现docling/models/stages/ocr/支持的全部格式docs/usage/supported_formats.md【免费下载链接】doclingGet your documents ready for gen AI项目地址: https://gitcode.com/GitHub_Trending/do/docling创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考