公司动态
Firecrawl完整实战教程:把任意网站变成AI就绪结构化数据的上手指南
Firecrawl完整实战教程把任意网站变成AI就绪结构化数据的上手指南【免费下载链接】firecrawlThe context API to search, scrape, and interact with the web at scale. 项目地址: https://gitcode.com/GitHub_Trending/fi/firecrawl你想把几十个产品页灌进 RAG 系统抓回来的 HTML 却全是脚本和导航栏大模型 token 全烧在噪音上。Firecrawl 就是解决这件事的网页数据提取 API把任意网页转成干净的 Markdown 或结构化 JSON还内置搜索、整站爬取和页面交互一行调用就能拿到 AI 就绪的数据。项目定位与核心价值一句话定位Firecrawl 是一个开源的 Web 上下文 API——搜索、抓取、交互网页并输出 LLM 直接可用的数据。它的仓库里同时包含 API 服务端、Playwright 抓取服务、队列组件和九种语言 SDK既可以对接官方云服务也可以整套自托管。和传统爬虫库相比它的差异点在于覆盖广官方基准覆盖约 96% 的网页含 JS 重度页面代理轮换、限流等脏活由服务端代劳速度快官方宣称百万级页面的 P95 延迟约 3.4 秒适配实时 Agent 场景输出即成品干净 Markdown、结构化 JSON、截图直接喂给 LLM省掉清洗环节Agent 原生一条命令接入 MCP 客户端或 CLI网页能力直接给 AI 代理用Firecrawl 开源版与云版功能覆盖对比开源版已包含 Scrape、Crawl、LLM Extract、代理轮换、页面 Actions 等核心能力快速上手拿到第一个抓取结果路径一用 API 跑通最快在 firecrawl.dev 注册拿到 API key然后装 SDKpip install firecrawl-pyfrom firecrawl import Firecrawl app Firecrawl(api_keyfc-YOUR_API_KEY) result app.scrape(firecrawl.dev) print(result.markdown)Node.js 侧对应npm install firecrawlapp.scrape(url)用法一致。运行后终端会输出一段干净的 Markdown没有script、没有导航栏这就是你要验证的效果。提示不装 SDK 也可以直接用 cURL 调POST /v2/scrape请求体传{url: ...}响应里同样带 Markdown。路径二Docker Compose 自托管适合想控制数据出口或做二次开发的场景git clone https://gitcode.com/GitHub_Trending/fi/firecrawl cd firecrawl docker compose up -dCompose 文件仓库根目录的 docker-compose.yaml会拉起 API、Playwright 服务、Redis、RabbitMQ 和 NuQ PostgreSQL 五个核心容器默认只有 API 对外暴露 3002 端口。启动后访问http://localhost:3002即可用同一套 SDK 指向本地地址。注意默认配置下 API 是无鉴权的USE_DB_AUTHENTICATIONfalse。如果要把 API 暴露到可信网络之外先补齐数据库 schema 和应用配置再开鉴权别指望只改一个变量就完成认证部署。场景实战四个真实用法场景一给 RAG 系统喂干净文档解决什么问题文档站、产品页直接抓 HTML 又脏又长向量入库后检索质量差。怎么做用 scrape 的 Markdown 格式逐页抓取或整站 crawl拿到formats: [markdown]的结果直接分块、向量化。效果每个页面得到一份标题层级完整、无导航噪音的 Markdowntoken 消耗明显下降检索命中率更高。Firecrawl 把任意网站转为 LLM 可读的标准化文本llms.txt 风格是 RAG 场景的基础场景二商品价格监控与降价提醒解决什么问题促销窗口短手动盯价格不现实。怎么做用 batch_scrape 定期拉取商品页按 Pydantic 结构提取价格和库存落库后对比历史值触发阈值就发 Discord 或邮件告警调度交给 GitHub Actions 之类的定时任务。仓库里的 examples/ 目录有一个完整可跑的价格监控教程Streamlit 界面 定时爬取 降价图表照着搭即可。效果得到一张按时间轴展示价格波动的监控面板每个商品一行当前价 历史折线降价自动推送到手机。示例教程中的价格监控面板左侧添加商品右侧展示 Firecrawl 持续抓取的电商价格历史折线场景三结构化新闻聚合解决什么问题想从新闻源固定提取标题、作者、票数等字段不想每次手写 CSS 选择器。怎么做用 Pydantic 模型定义想要的字段examples/hacker_news_scraper 就是这个例子把 schema 交给 Firecrawl 的 extract 能力它负责在页面里定位并填值结果直接json.dump到本地文件定时执行就是聚合器。效果输出是一份字段完整的 JSON 列表页面改版时不用改选择器逻辑只需保证 schema 描述准确。场景四给 AI Agent 装上手和眼解决什么问题对话式 Agent 回答实时性问题时只能靠训练知识答不了这个商品现在多少钱。怎么做一条命令把 Firecrawl 接入你的 Agent 或 MCP 客户端npx -y firecrawl-clilatest init --all --browser安装后重启 Agent它就能用搜索、抓取、交互等工具实时查网页MCP 客户端则把 firecrawl-mcp 配置进 mcpServers 即可。效果Agent 从只会说变成会查引用带来源的实时网页内容作答。关键功能深挖Search一次调用拿到搜索结果全文何时用需要先找再读的场景比如竞品调研、资料聚合。怎么启用results app.search(firecrawl pricing, limit5)得到什么不是只有链接列表而是每条结果的 URL、标题加整页 Markdown 全文省去二次抓取。Search 接口示例传入查询词响应中同时返回 URL、标题和 Markdown 全文Agent描述需求不写 URL何时用不知道数据在哪个页面、或需要跨站对比时。怎么启用只给一句 promptAgent 自己搜索、导航、取数也可以附带 urls 聚焦特定页面或传 schema 拿结构化结果。得到什么结果文本 来源 URL 列表。模型有两个档位按需选择模型成本适用spark-1-mini便宜约 60%大多数日常任务spark-1-pro默认标准跨站对比、复杂导航、关键数据Firecrawl 的抓取 Agent 能力输入 URL 和自然语言指令如登录后返回用量面板由 Agent 代劳页面操作Crawl / Map / Batch Scrape整站与批量何时用文档站全站入库、批量处理成百上千个 URL。怎么启用app.crawl(url, limit50)抓整站app.map(url)先只列出站点全部 URL可加searchpricing按相关性筛app.batch_scrape([...])异步批量抓。得到什么crawl 返回带 Markdown 和元信息的文档列表。注意走原始 HTTP API 时 crawl 只返回 job ID需要轮询GET /v2/crawl/{id}拿结果各语言 SDK 已自动处理轮询优先用 SDK。避坑与调优现象抓 JS 重度页面内容残缺。对策自托管默认捆绑 Playwright 并带基础 fetch 兜底确认 playwright-service 容器在跑必要时调大CRAWL_CONCURRENT_REQUESTS默认 10和浏览器池BROWSER_POOL_SIZE默认 5但先保证内存够。现象crawl 调用只返回一个 id。对策这是异步任务设计SDK 会自动轮询到完成手写轮询逻辑时按status completed判断并留意total/completed计数。现象自托管容器 OOM 或起不来。对策Compose 里 API 限制 4 核 / 8G 内存、Playwright 2 核 / 4G机器资源不够时按比例下调NUM_WORKERS_PER_QUEUE默认 8。Redis、RabbitMQ、NuQ PostgreSQL 默认都不设持久卷生产环境要自行补上备份方案。现象Agent 任务成本超预期。对策日常查询类任务切到spark-1-mini只有跨站对比、复杂导航、高准确要求的任务才用spark-1-pro。现象担心合规风险。对策Firecrawl 默认遵守 robots.txt 指令爬取前确认目标网站的使用条款控制频率别把抓取量打到对方服务不可用的程度。提示本地开发改 API 源码和自托管跑 Compose是两条不同的路径环境变量文件不要互相照搬开发环境以 CONTRIBUTING.md 的说明为准。收尾资源清单与下一步仓库 README各端点的完整参数与多语言 SDK 示例都写在其中examples/新闻聚合、价格监控、定时爬取等可运行的场景代码SELF_HOST.md自托管的决策表与生产化检查清单CONTRIBUTING.md本地开发环境搭建与测试跑法apps/目录Python、Node、Go、Java、Rust 等九套 SDK 源码遇到 SDK 行为问题可直接查实现下一步建议先用 API 路径跑通一次 scrape再挑一个你自己的真实页面文档站或商品页做一遍抓取 → 结构化 → 入库的闭环把整条数据流走通后Agent 和整站爬取的功能都是顺理成章的加分项。【免费下载链接】firecrawlThe context API to search, scrape, and interact with the web at scale. 项目地址: https://gitcode.com/GitHub_Trending/fi/firecrawl创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考