公司动态

Firecrawl 网页抓取实战:从单页到批量再到 AI 提取的 5 分钟上手指南

📅 2026/8/29 8:01:20
Firecrawl 网页抓取实战:从单页到批量再到 AI 提取的 5 分钟上手指南
Firecrawl 网页抓取实战从单页到批量再到 AI 提取的 5 分钟上手指南【免费下载链接】firecrawlThe context API to search, scrape, and interact with the web at scale. 项目地址: https://gitcode.com/GitHub_Trending/fi/firecrawl做 AI 应用绕不开网页数据。当你想把一个网站的内容喂给大模型时往往得自己处理一堆破事HTML 解析、JS 渲染出来的动态内容、广告和导航栏的噪音、还有随时把你 IP 拉黑的反爬策略。Firecrawl 就是解决这件事的抓取 API它把任意网页直接转成干净的 Markdown 或结构化 JSON让爬虫这块脏活从你的代码库里消失。一句话说清它解决什么把抓网页从工程问题变成一次函数调用你给 URL它还给 LLM 能直接读的内容。适合谁给 RAG 应用准备干净语料要竞品、行情等结构化数据AI Agent 需要实时上网查东西5分钟跑起来安装 Python SDK再配一个 API key注册后可在控制台拿到pip install firecrawl-py export FIRECRAWL_API_KEYfc-YOUR_API_KEY最短示例一行抓一个网页from firecrawl import Firecrawl app Firecrawl(api_keyfc-YOUR_API_KEY) print(app.scrape(https://example.com).markdown)跑完直接得到去掉导航和页脚的正文 Markdown复制进任何 LLM 提示词里就能用。能力进阶第一站单页抓取能做什么一个 URL 进干净内容出还能顺手出截图、HTML、JSON。怎么写doc app.scrape(https://example.com, formats[markdown, screenshot])跑出来是什么样一个对象里装着正文 Markdown 和整页截图页面里的 PDF、DOCX 这类文件也能解析成文本。第二站批量和整站能做什么一次任务抓一个网站的几百个页面不用自己写队列。怎么写docs app.crawl(https://docs.firecrawl.dev, limit50) for d in docs.data: print(d.metadata.source_url, d.markdown[:80])跑出来是什么样任务完成时拿到 50 篇 Markdown每篇带着来源 URL 和页面元数据。map接口可以先扫出站内全部链接再挑着抓batch_scrape则用于手头的 URL 列表。第三站AI 提取能做什么不再只是拿原文而是按你定义的字段直接要答案。怎么写from pydantic import BaseModel, Field from typing import List, Optional class Founder(BaseModel): name: str Field(description创始人姓名) role: Optional[str] Field(None, description职位) result app.agent(prompt找出 Firecrawl 的创始人, schemaFounder) print(result.data)跑出来是什么样一段自然语言需求进结构化 JSON 出它自己完成搜索、翻页和提取。搜索同理app.search(关键词, limit5)返回的不是链接列表而是每条结果的整页正文。一个完整场景走通真实需求每天自动归档 Hacker News 首页的热帖——标题、原文链接、作者、排名、票数、时间六样东西按行存进 JSON。实现流程分三步。第一步用 Pydantic 定义一条新闻的六个字段让模型知道你要什么第二步调scrape_url格式设为extract并把刚才的模型 schema 传进去返回的就是填满字段的对象列表第三步按时间戳写文件。参考实现就 60 来行在项目里直接打开看examples/hacker_news_scraper。运行效果脚本跑一次firecrawl_hacker_news_data_2026_08_28_07_30.json里就是当天榜单的结构化数据丢进 crontab 就是一份日报。同一套路换个模型字段就能变成竞品价格监控或招聘数据追踪。容易踩的坑抓大站超时或任务长时间没回crawl、batch_scrape是异步任务加limit控制页数SDK 会自动轮询别自己写死循环硬等。只想要正文却塞满了导航和广告加onlyMainContent选项CLI 里是--only-main-contenttoken 消耗能砍掉一大截。动态页面抓回来是空的说明内容靠 JS 渲染确认抓取时开启了浏览器渲染或者干脆让 agent 接口去处理它会自动点进需要的页面。同一接口频繁 429这是额度或限流触发降并发、把批量任务错峰跑别在循环里裸调。完整用法、各语言 SDK 和参数说明都在项目里README想自己部署一套可以看 SELF_HOST.md更多示例翻 examples 目录就对了。【免费下载链接】firecrawlThe context API to search, scrape, and interact with the web at scale. 项目地址: https://gitcode.com/GitHub_Trending/fi/firecrawl创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考