公司动态

MediaCrawler媒体爬虫工具:十分钟跑通首次采集完整指南

📅 2026/8/30 9:59:02
MediaCrawler媒体爬虫工具:十分钟跑通首次采集完整指南
MediaCrawler媒体爬虫工具十分钟跑通首次采集完整指南【免费下载链接】MediaCrawler小红书笔记 | 评论爬虫、抖音视频 | 评论爬虫、快手视频 | 评论爬虫、B 站视频 评论爬虫、微博帖子 评论爬虫、百度贴吧帖子 百度贴吧评论回复爬虫 | 知乎问答文章评论爬虫项目地址: https://gitcode.com/GitHub_Trending/me/MediaCrawlerMediaCrawler是一款开源的多平台媒体爬虫工具可采集小红书笔记、抖音视频、快手、B站、微博、百度贴吧、知乎的公开内容与评论。它用真实浏览器保持登录态不用你碰JS逆向适合做内容分析、竞品监测和舆情跟踪的新手直接使用。是什么MediaCrawler 的适用场景采集范围覆盖 7 个平台的公开信息关键词搜索按指定关键词采集相关帖子指定帖子 ID采集特定帖子及其评论创作者主页采集某创作者的发布内容支持二级评论还能生成评论词云图技术原理是基于 Playwright 启动真实浏览器登录并缓存登录态再在浏览器上下文里取接口签名参数。好处是不用逆向复杂加密算法技术门槛低。适合内容运营、市场调研、数据分析新手。项目声明仅供学习研究使用请勿对平台大规模爬取避免触发风控。 三步安装从克隆代码到依赖就绪环境要求三样Python由 uv 工具自动管理版本先确认uv --version能正常输出版号Node.js 16 及以上抖音、知乎的签名脚本需要Chrome 浏览器144 及以上版本默认 CDP 模式复用你已有的浏览器登录降低风控概率克隆代码后依次执行git clone https://gitcode.com/GitHub_Trending/me/MediaCrawler cd MediaCrawler uv sync uv run main.py --platform xhs --lt qrcode --type searchuv sync会自动创建 Python 环境并装好依赖默认 CDP 模式无需另装浏览器驱动。第三条命令就是运行小红书关键词搜索装完依赖可以直接跑。首次运行小红书关键词搜索演示运行前把config/base_config.py里的KEYWORDS变量改成你要采集的关键词多个用英文逗号分隔默认是编程副业,编程兼职。上面那条运行命令的含义--platform xhs采集小红书可换成 dy、ks、bili、wb、tieba、zhihu--lt qrcode扫码方式登录--type search关键词搜索模式可换 detail指定帖子或 creator创作者主页首次运行会弹出浏览器中的小红书二维码用小红书 App 扫码登录。CDP 模式下 Chrome 还会弹确认对话框60 秒内点接受即可。登录态默认缓存下次运行不用重新扫码。关键配置config/base_config.py 里要改的变量真正影响结果的变量都在这个文件里带中文注释SAVE_DATA_OPTION数据存储格式默认 jsonl每行一个 JSON方便用 pandas 读取可换 csv、excel、sqlite 等CRAWLER_MAX_NOTES_COUNT采集帖子条数默认 15初次试跑保持默认ENABLE_GET_COMMENTS评论采集开关默认开启单帖一级评论条数由CRAWLER_MAX_COMMENTS_COUNT_SINGLENOTES控制默认 10 条CRAWLER_MAX_SLEEP_SEC请求间隔秒数默认 2 秒建议不低于 2 秒代理开关ENABLE_IP_PROXY默认 False。网络环境差时再开启需填供应商名称和账号信息。已购快代理独享代理的用户用户名和密码在订单页的基本信息里各平台的专属配置在config/目录的 xhs_config.py 等文件中按注释对照填写即可。效果验证如何检查采集到的数据采集结束后数据默认写入项目根目录data/目录按平台分子文件夹存放。检查分三步打开对应 jsonl 文件确认每行是一个完整 JSON 对象核对字段完整性帖子 ID、标题、正文、点赞数、时间戳、评论内容不应为空存储切换到 sqlite 或 MySQL 时自带去重重复采集不会产生重复记录想看评论词云把ENABLE_GET_WORDCLOUD设为 True中文字体用仓库自带的docs/STZHONGS.TTF。存储方式全量说明见官方文档 docs/data_storage_guide.md。常见坑与进阶方向新手高频三个问题小红书登录一直弹滑块原因是平台风控严格。处理用默认 CDP 模式连接自己的 Chrome复用真实 Cookie 和浏览历史别用无痕模式仍失败就关闭浏览器清掉项目下生成的浏览器数据缓存目录后重新登录。抖音或知乎报 ProgramError、缺少分号原因是缺 Node.js 环境。处理安装 16 及以上版本即可代码不用改。报 Cannot connect to existing browser on port 9222原因是 Chrome 没开远程调试。处理地址栏输入chrome://inspect/#remote-debugging勾选允许远程调试页面显示Server running at: 127.0.0.1:9222才算就绪。进阶方向不想敲命令行可以启动内置 WebUI一个终端启动api/main.py的 API 服务另一个终端在webui目录装依赖并启动前端开发服务器浏览器访问 localhost:5173就能可视化配置参数、实时看采集日志和数据预览代理、手机号登录、CDP 模式等进阶内容看 docs/ 目录下的专题文档。使用时保持小批量、控制频率数据和你自己的账号都会更稳。【免费下载链接】MediaCrawler小红书笔记 | 评论爬虫、抖音视频 | 评论爬虫、快手视频 | 评论爬虫、B 站视频 评论爬虫、微博帖子 评论爬虫、百度贴吧帖子 百度贴吧评论回复爬虫 | 知乎问答文章评论爬虫项目地址: https://gitcode.com/GitHub_Trending/me/MediaCrawler创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考