Skip to content

Repository files navigation

抖音用户数据爬取工具 (Douyin Spider)

这是一个基于 Python 和 DrissionPage 开发的抖音用户数据采集工具。它可以根据指定的关键词搜索抖音用户,自动采集其公开信息(昵称、粉丝数、IP属地、主页链接),并支持数据筛选与导出。

✨ 主要功能

  • 所见即所得:利用浏览器自动化技术,模拟人工浏览,稳定可靠。
  • GUI 图形界面:提供友好的操作界面,支持关键词管理、任务控制和日志查看。
  • 断点续传:自动检测 cache/ 目录下的历史记录,避免重复爬取,随时继续中断的任务。
  • 智能导出:支持将采集结果导出为 Excel 表格,并按粉丝数排序。
  • 数据筛选:导出时可根据 IP 属地筛选(仅国内 / 仅国外 / 全部)。

📂 项目结构

Spider/
├── src/                  # 源代码目录
│   ├── gui.py            # GUI 界面主程序
│   ├── main.py           # 爬虫核心逻辑
│   ├── change_data.py    # 数据导出与清洗逻辑
│   └── ...               # 其他辅助模块
├── cache/                # [自动生成] 存放爬取的原始 CSV 数据(请勿手动删除)
├── Output/               # [自动生成] 存放导出的 Excel 结果报表
├── 1.终端启动.bat         # [启动脚本] 仅运行爬虫核心(无界面)
├── 2.导出结果.bat         # [启动脚本] 仅运行数据导出工具
├── 3.GUI启动.bat          # [启动脚本] 启动全功能图形界面(推荐)
├── requirements.txt      # Python 依赖库清单
└── README.md             # 项目说明文档

🚀 快速开始

1. 环境准备

  • 操作系统:Windows (脚本针对 Windows 优化)
  • 浏览器:必须安装 Google Chrome 浏览器。
  • Python 环境:建议 Python 3.10+。

安装依赖:

pip install -r requirements.txt

提示:启动脚本会自动查找以下 Python 环境:

  1. Conda 环境名为 Spider 的环境。
  2. 项目根目录下 python/ 文件夹内的便携式 Python。
  3. 系统环境变量中的 python

2. 运行程序

方式一:GUI 图形界面(推荐)

双击运行 3.GUI启动.bat

  1. 添加关键词:在左侧输入框输入关键词(如“留学”、“通过”),点击添加。支持多词组合搜索。
  2. 设置数量:可选填最大爬取博主数量。
  3. 开始任务:点击“开始爬取”,程序将自动打开浏览器并采集数据。
  4. 导出数据:任务完成或停止后,选择过滤模式(仅国外/仅国内/全部),点击“导出 xlsx”生成 Excel 报表。

方式二:命令行模式

  • 仅爬取:双击 1.终端启动.bat,将读取代码中的默认配置进行爬取。
  • 仅导出:双击 2.导出结果.bat,运行导出工具处理已有的 CSV 数据。

⚠️ 注意事项

  1. 浏览器接管:程序基于 DrissionPage,运行时会接管 Chrome 浏览器。建议在运行前关闭无关的 Chrome 窗口,以免干扰。
  2. 数据安全
    • cache/ 目录保存了爬取的原始数据,用于断点续传,请勿随意清空,除非你想重新开始。
    • Output/ 目录保存最终生成的 Excel 报表。
  3. 隐私保护
    • 爬取结果包含您的搜索记录。
    • 项目已配置 .gitignore 忽略 cache/Output/ 目录,防止敏感数据上传到版本控制系统。

🛠️ 常见问题

Q: 浏览器提示连接失败?
A: 请确保您已安装 Google Chrome。如果浏览器崩溃,程序会尝试自动重启。

Q: 为什么搜不到数据?
A: 请检查关键词是否过于冷门,或者手动在浏览器确认搜索结果是否为空。

Q: 爬取速度太慢?
A: 为了模拟真实用户并防止被风控,程序内置了等待间隔。请耐心等待。

About

一个爬取相关关键词的抖音账号的爬虫

Resources

Stars

9 stars

Watchers

0 watching

Forks

Releases

Packages

Contributors

Languages