公司动态
Scrapy官方教程实战:手把手抓取书籍网站数据,10行代码写出你的第一个Spider
Scrapy官方教程实战手把手抓取书籍网站数据10行代码写出你的第一个Spider【免费下载链接】scrapyScrapy, a fast high-level web crawling scraping framework for Python.项目地址: https://gitcode.com/GitHub_Trending/sc/scrapy本文带你完成Scrapy 官方教程的实战核心流程用 Python 高性能爬虫框架 Scrapy 抓取书籍网站books.toscrape.com的图书数据。只需10 行代码就能写出你的第一个 Spider爬虫再用一条命令把数据导出为 JSON 文件。Scrapy 是专为 Python 打造的网页抓取框架自动处理链接跟踪、并发下载、数据去重等脏活累活让你专注于要抓什么数据。上图就是 Scrapy 的工作机制Spider 发出请求 → 引擎交给调度器排队 → 下载器访问网站取回页面 → 引擎再把响应交回 Spider 解析。整个过程你只写 Spider 和数据提取逻辑其余全部自动化。3分钟上手安装Scrapy并创建项目如果还没安装 Scrapy一条命令搞定需要 Python 3.10详见 docs/intro/install.rstpip install Scrapy然后在任意目录下创建项目scrapy startproject bookscraper项目结构中你会看到几个关键文件settings.py爬虫设置、spiders/存放爬虫的目录、pipelines.py数据管道。建议打开settings.py取消注释USER_AGENT礼貌地表明爬虫身份。10行代码写出抓取书籍网站的第一只SpiderScrapy 官方提供了 books.toscrape.com 这个任你抓的沙盒站点仓库中就有它的页面样例tests/sample_data/books/listing.html。把下面的 Spider 保存到bookscraper/spiders/books_spider.pyimport scrapy class BooksSpider(scrapy.Spider): name books start_urls [https://books.toscrape.com/] def parse(self, response): for book in response.css(article.product_pod): yield { title: book.css(h3 a::attr(title)).get(), price: book.css(p.price_color::text).get(), }就这么短。对照 docs/intro/tutorial.rst 中的官方教程核心就三件事nameSpider 的唯一标识运行时靠它找到爬虫start_urls起始 URLScrapy 会自动请求并调用parse方法处理响应yield {...}把每本书的数据以字典形式交出Scrapy 负责收集。用CSS选择器精准定位书名和价格上面的代码里response.css(...)是 Scrapy 最强的数据提取工具。它的选择器语法和浏览器开发者工具里的一模一样。快速找准选择器的小技巧按 F12 打开开发者工具右键点击目标元素选检查看它的class就能写出选择器。书籍站点每本书的结构是书名h3 a标签的title属性 →book.css(h3 a::attr(title))价格p.price_color的文本 →book.css(p.price_color::text)其中::text表示取元素内文本::attr(...)表示取属性值。如果选择器没匹配到内容.get()会返回None而不会报错爬虫依然健壮——这正是官方教程推荐的容错写法。想深入 CSS/XPath 选择器可以看 docs/topics/selectors.rst。一条命令运行爬虫并导出JSON数据在scrapy.cfg所在目录执行scrapy crawl books -O books.json运行结束后当前目录会多出一个books.json里面整齐地躺着抓到的每本书的title和price。-O是 Scrapy 内建的 Feed Export 功能见 docs/topics/feed-exports.rst无需写任何存储代码。想追加而不是覆盖改用-o并换成.jsonl格式即可。自动跟随分页从20本书抓到全部1000本上面的 Spider 只抓了首页。书籍站点每页底部都有Next分页按钮加 3 行代码就能让它自动翻页next_page response.css(li.next a::attr(href)).get() if next_page is not None: yield response.follow(next_page, callbackself.parse)response.follow会自动把相对路径/catalogue/page/2/拼成完整 URL并把parse注册为新页面的回调——于是抓数据 → 找下一页 → 再抓形成循环直到没有下一页为止。Scrapy 还会自动过滤已访问过的重复 URL不用担心重复爬取。这正是 Scrapy 相比手写requests循环的精髓翻页逻辑、并发控制、去重调度全部由框架的引擎和调度器承担机制细节见 docs/topics/architecture.rst你只声明往哪走。下一步学习Scrapy进阶能力清单跑通第一个 Spider 只是开始Scrapy 还有这些值得掌握的能力能力说明文档位置Spider 参数scrapy crawl books -a tagtravel给爬虫传参docs/topics/spiders.rst数据管道用 Item Pipeline 清洗、校验、入库docs/topics/item-pipeline.rst下载中间件代理、重试、限速、HTTP 缓存docs/topics/downloader-middleware.rst内置爬虫类CrawlSpider 用规则引擎快速构建通用爬虫scrapy/spiders/crawl.py最后提醒爬取真实网站前先阅读目标站点的robots.txt和服务条款控制抓取频率做一个有礼貌的爬虫 ️。【免费下载链接】scrapyScrapy, a fast high-level web crawling scraping framework for Python.项目地址: https://gitcode.com/GitHub_Trending/sc/scrapy创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考