公司动态
MediaCrawler实操:如何稳定采集7大平台数据
MediaCrawler实操如何稳定采集7大平台数据【免费下载链接】MediaCrawler小红书笔记 | 评论爬虫、抖音视频 | 评论爬虫、快手视频 | 评论爬虫、B 站视频 评论爬虫、微博帖子 评论爬虫、百度贴吧帖子 百度贴吧评论回复爬虫 | 知乎问答文章评论爬虫项目地址: https://gitcode.com/GitHub_Trending/me/MediaCrawlerMediaCrawler 是一个基于 Playwright 的开源多平台自媒体数据采集工具覆盖小红书、抖音、快手、B站、微博、贴吧、知乎七个平台的笔记、视频、帖子和评论抓取不需要你手写签名算法或逆加密接口。这篇教程按一次采集任务的完整生命周期从搭建环境讲到长期稳定跑通。谁适合用先说清楚它替谁省事再决定要不要动手。数据分析手工截图、整理 Excel 的活交给脚本。它的核心思路是拿真实浏览器跑采集、保存登录态省掉了爬虫里最头疼的 JS 逆向指手动破解接口签名算法MediaCrawler 用浏览器上下文直接拿到签名参数。内容运营盯竞品和热点时需要定期拉取某账号主页的笔记、评论对比互动数变化这正好对应它内置的 creator 爬取模式。开发同学想把新媒体数据接进自己的分析管道store/ 的目录组织就是一个现成参考模板新平台照着 media_platform/ 的结构补 client 和 store 即可。搭环境从克隆到第一条数据装好 uv 和 Node.js16抖音、知乎的签名逻辑要用执行git clone https://gitcode.com/GitHub_Trending/me/MediaCrawler cd MediaCrawler uv sync装 Chrome 144 以上版本地址栏进chrome://inspect/#remote-debugging勾选允许远程调试看到Server running at: 127.0.0.1:9222就代表就绪。走 CDP 模式时连的是本地 Chrome不需要装浏览器驱动。打开 config/base_config.py四个关键项决定一切PLATFORM选平台、LOGIN_TYPEqrcode/phone/cookie、CRAWLER_TYPEsearch 关键词、detail 指定帖子、creator 创作者主页、SAVE_DATA_OPTION落盘格式。代理默认关闭想开再说。起第一个任务uv run main.py --platform xhs --lt qrcode --type search按提示扫码登录后第一条数据就按选定格式落到 data/ 目录。不想碰命令行的话项目自带 WebUI 可视化界面浏览器里配参数、看实时日志跑起来是这个效果采集策略让它不被拦、能续跑代理池怎么配它做什么爬虫启动时先检查代理开关开的话就从服务商拉一批 IP 存进 Redis每次请求从池子里取一个可用的用完轮换避免同一个出口 IP 反复出现。代理IP池工作流程图MediaCrawler 启动时拉取IP存入Redis并轮换使用怎么调ENABLE_IP_PROXY设为 TrueIP_PROXY_PROVIDER_NAME选 kuaidaili、wandouhttp 或 static。只有一两个固定代理时选 static把地址填进STATIC_PROXY_URL实现都放在 proxy/ 目录。登录态复用走 CDP 模式它做什么CDP 是 Chrome 自带的调试通道开启后程序直接驱动你日常在用的那个 Chrome带着真实 Cookie、扩展和浏览历史平台很难把它和真人区分开。首次跑用 qrcode 扫码登录SAVE_LOGIN_STATE True会把登录状态缓存到本地下次直接复用不用重登。怎么调ENABLE_CDP_MODE True是默认值浏览器版本低于 144 或端口被占用时改CDP_DEBUG_PORT或指定CUSTOM_BROWSER_PATH。断点续爬和多账号轮换它做什么长任务中途断掉后接着跑不用从头抓。开源版可以调START_PAGE从指定页继续抓Pro 版提供完整的断点续爬和多账号轮换一个号被限制时换号接着跑——这是两个版本最实在的差异之一。数据落地存下来怎么用SAVE_DATA_OPTION支持 csv、json、jsonl、sqlite、excel、postgres、db 等格式选 db 走关系库天然带按主键去重适合反复跑的任务。存储代码按平台拆在 store/ 目录每个平台一个子包数据结构定义在 model/ 的对应文件里想加字段先看这两处。拿竞品账号周度追踪走一遍定目标每周五抓某竞品账号最新 10 条笔记加一级评论对比上周互动数据变化。配参数CRAWLER_TYPE creator指向该创作者主页CRAWLER_MAX_NOTES_COUNT 10评论抓取默认开着存储选 csv 方便进 Excel 或数据库。采集定时每周五跑一次uv run main.py产物按日期/作者归档。利用连续几期 csv 拼起来画点赞评论走势评论文本跑一遍词频就能回答竞品这周哪条内容起量了、用户在夸什么骂什么。 踩坑最常见的三个问题登录态失效现象跑起来不停弹登录页或扫完码还是未登录。 原因cookie 过期、平台风控重置或扫码时浏览器没真正完成登录。 解决清掉本地缓存的登录态目录重新扫码或切 CDP 模式复用浏览器里已登录的会话。代理不通现象大量请求超时或 403IP 刚拉下来就失效。 原因代理账号欠费、IP 过期或白名单里没加你的机器 IP。 解决先在代理服务商后台点测试确认 IP 可用检查白名单再用 static 模式手动指定一个 IP 验证链路别一上来就开大池子排查。平台改版后字段对不上现象程序不报错但某列开始出空值。 原因接口字段改名或结构变了解析规则没跟上。 解决对照原始响应 JSON 更新 media_platform 对应平台的 field 解析规则和 model/ 里的模型定义raw_response 相关的测试文件能帮你快速定位是哪一层丢的字段。长期跑请求频率默认抓取间隔 2 秒可以拉长到 3~5 秒MAX_CONCURRENCY_NUM保持 1别贪并发单次任务的笔记数和评论数都设上限大批量任务放到凌晨跑。数据质量每次跑完抽查几条记录确认字段齐全重复跑的任务优先用 db 格式利用去重评论、正文里的手机号之类敏感信息落库前脱敏。合规边界遵守目标平台使用条款和 robots 约定只碰公开数据不绕登录墙和付费内容频率控制在正常人刷内容的水平数据只用于学习和研究不商用——项目 License 本身就禁止商业用途对外提供服务前先把法律风险想清楚。平台越加越多、分析能力越来越 AI、跑在云端是这条工具链接下来几个版本的主线。【免费下载链接】MediaCrawler小红书笔记 | 评论爬虫、抖音视频 | 评论爬虫、快手视频 | 评论爬虫、B 站视频 评论爬虫、微博帖子 评论爬虫、百度贴吧帖子 百度贴吧评论回复爬虫 | 知乎问答文章评论爬虫项目地址: https://gitcode.com/GitHub_Trending/me/MediaCrawler创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考