恒美微站 Logo 恒美微站
  • 首页
  • 关于我们
  • 建站服务
  • 主题模板
  • 案例展示
  • 资讯中心
  • 联系我们

MediaCrawler 多平台自媒体数据采集指南:从安装到第一次抓取

  • 首页
  • 资讯中心
  • /
  • MediaCrawler 多平台自媒体数据采集指南:从安装到第一次抓取

相关资讯

OOP为何存在:从过程式失控到封装多态的工程解药 2026/8/30 10:01:25
一次搜索跨六个音乐源:LX Music 桌面版免费上手指南 2026/8/30 9:56:24
AI Agent浏览器底座:Cloudflare Kitesurf如何解决智能体网页操作难题 2026/8/30 9:56:24

最新资讯

FF-Codex 控制台:解决 Codex CLI 路径与 DeepSeek-V4 接入难题
三个系统十分钟跑通 Goose 跨平台部署的完整攻略
Monty四种快照类型详解:FunctionSnapshot、NameLookupSnapshot、FutureSnapshot
能在断网机房画流程图的免费 Visio 替代:draw.io 桌面版实用指南
Claude Code Game Studios /code-review:带路径规则强制执行的AI代码审查
判题服务巡检,不能只看进程还活着

今日推荐

备战数据库管理工程师校招:索引、事务、备份恢复核心考点解析
数字电路时序基石:深入理解建立时间与保持时间
蓝桥杯国赛超声波测距机:从单片机原理到嵌入式系统实战

本周热门

备战数据库管理工程师校招:索引、事务、备份恢复核心考点解析
数字电路时序基石:深入理解建立时间与保持时间
蓝桥杯国赛超声波测距机:从单片机原理到嵌入式系统实战

本月精选

如何用DamaiHelper实现演唱会门票的智能自动化抢购:完整技术解决方案指南
第4篇:59 倍性能差距的索引瓶颈定位——一次教科书级的全表扫描调优
终极歌词批量下载神器:5分钟解决离线音乐库歌词同步难题

MediaCrawler 多平台自媒体数据采集指南:从安装到第一次抓取

发布时间:2026/8/30 10:01:25
MediaCrawler 多平台自媒体数据采集指南:从安装到第一次抓取 MediaCrawler 多平台自媒体数据采集指南从安装到第一次抓取【免费下载链接】MediaCrawler小红书笔记 | 评论爬虫、抖音视频 | 评论爬虫、快手视频 | 评论爬虫、B 站视频 评论爬虫、微博帖子 评论爬虫、百度贴吧帖子 百度贴吧评论回复爬虫 | 知乎问答文章评论爬虫项目地址: https://gitcode.com/GitHub_Trending/me/MediaCrawlerMediaCrawler 是一个基于 Playwright 的开源爬虫项目按登录态抓取小红书、抖音、快手、B 站、微博、贴吧、知乎的笔记/视频、帖子及其评论结果落到本地文件或数据库。 它能帮你做什么监控某个关键词下的最新内容 → 按关键词跨七个平台搜索产出笔记/视频元数据加评论区数据复盘单个帖子 → 填帖子 ID 列表定向抓取该帖及对应评论分析某个创作者 → 填创作者 ID抓取其主页发布列表需要评论层级 → 开启二级评论抓取拿到楼中楼结构登录成本敏感 → 登录态按平台缓存到浏览器目录之后运行免扫码整体架构可参考官方文档docs/ 安装依赖三步跑通前提Python 3.11、Node.js 16、已安装 uv。git clone https://gitcode.com/GitHub_Trending/me/MediaCrawler cd MediaCrawler uv pip install -r requirements.txt若不走默认的 CDP 模式连接本机 Chrome无需装驱动再执行uv run playwright install安装浏览器驱动。核心开关都在 config/base_config.py每个平台另有独立文件如 config/xhs_config.py。 第一次采集怎么配置以抓某关键词的小红书笔记为例PLATFORM xhsKEYWORDS填英文逗号分隔的关键词LOGIN_TYPE qrcode。登录态目录由USER_DATA_DIR决定扫码一次后SAVE_LOGIN_STATE会将其缓存。数量与节奏CRAWLER_MAX_NOTES_COUNT控制帖子条数CRAWLER_MAX_SLEEP_SEC控制间隔默认 2 秒代理默认关闭需要时在 proxy/ 配置ENABLE_IP_PROXY与代理提供方。ENABLE_GET_SUB_COMMENTS True才会抓二级评论。SAVE_DATA_OPTION决定落盘格式结果写入项目data/目录。执行uv run main.py --platform xhs --lt qrcode --type search浏览器弹出后扫码确认随后开始抓取数据文件落在data/xhs/note/与data/xhs/comment/。把--type换成detail即按 ID 列表抓帖creator抓创作者主页。 平台差异速览平台可采集内容注意事项xhs 小红书笔记正文/图片/视频、一二级评论风控最严建议 CDP 模式并配代理dy 抖音视频元数据、互动数、评论扫码后可能触发手机验证ks 快手视频信息、评论GraphQL 接口依赖签名勿频繁改请求bili B 站视频数据、弹幕、评论需 B 站登录态wb 微博帖子、评论关键词搜索对登录态敏感tieba 贴吧帖子、评论回复以接口为主无需浏览器zhihu 知乎问答、文章、评论风控严建议低速各平台客户端源码见 media_platform/字段定义在各平台field.py中。️ 数据怎么落盘文件jsonl/json保留原始结构csv/excel便于直接打开分析SAVE_DATA_PATH可改输出目录。数据库sqlite/mysql/postgres自动建表并支持去重适合需要反复查询的场景模型见 database/models.py。 高频问题自查现象可能原因处理动作扫码后登录失败无头模式无法过滑块HEADLESS False人工过验证抓不到数据登录态过期删除对应*_user_data_dir目录重新扫码频繁风控/封禁请求过快、IP 单一调大CRAWLER_MAX_SLEEP_SEC开启ENABLE_IP_PROXY启动报 no such table未初始化数据库uv run main.py --db sqlite或改回文件落盘找不到结果文件未开启对应存储检查SAVE_DATA_OPTION与SAVE_DATA_PATH只有帖子没有评论评论抓取被关确认ENABLE_GET_COMMENTS True⚖️ 适合谁、不适合谁适合不适合有本机 Chrome、能扫码登录纯无头服务器无浏览器环境低频采集公开内容做调研大规模高频采集协议限定非商业学习用途想读源码做二次开发想要开箱即用的托管服务仓库另有一个商业项目 MediaCrawlerPro提供断点续爬、多账号管理并移除 Playwright 依赖与本文开源版是两套代码此处不做展开。MediaCrawler 的价值在于用登录态换掉了 JS 逆向的成本把采集门槛降到改配置加跑命令。文档见 docs/配置见 config/各平台源码见 media_platform/。【免费下载链接】MediaCrawler小红书笔记 | 评论爬虫、抖音视频 | 评论爬虫、快手视频 | 评论爬虫、B 站视频 评论爬虫、微博帖子 评论爬虫、百度贴吧帖子 百度贴吧评论回复爬虫 | 知乎问答文章评论爬虫项目地址: https://gitcode.com/GitHub_Trending/me/MediaCrawler创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

关于恒美微站

恒美微站专注于为个体商户、工作室提供极简自助建站服务,让每个人都能轻松拥有专业网站。

快速链接

  • 关于我们
  • 建站服务
  • 主题模板
  • 案例展示
  • 资讯中心

服务项目

  • 可视化建站
  • 拖拽编辑
  • 主题定制
  • SEO 优化
  • 网站托管

联系方式

  • 📍 地址:北京市朝阳区建国路 88 号
  • 📞 电话:400-888-8888
  • ✉️ 邮箱:info@hmyw.cn
  • 🕐 时间:周一至周日 9:00-18:00

© 2024 恒美微站 hmyw.cn 版权所有 | 京 ICP 备 12345678 号