这是一个基于 Python 和 DrissionPage 开发的抖音用户数据采集工具。它可以根据指定的关键词搜索抖音用户,自动采集其公开信息(昵称、粉丝数、IP属地、主页链接),并支持数据筛选与导出。
- 所见即所得:利用浏览器自动化技术,模拟人工浏览,稳定可靠。
- GUI 图形界面:提供友好的操作界面,支持关键词管理、任务控制和日志查看。
- 断点续传:自动检测
cache/目录下的历史记录,避免重复爬取,随时继续中断的任务。 - 智能导出:支持将采集结果导出为 Excel 表格,并按粉丝数排序。
- 数据筛选:导出时可根据 IP 属地筛选(仅国内 / 仅国外 / 全部)。
Spider/
├── src/ # 源代码目录
│ ├── gui.py # GUI 界面主程序
│ ├── main.py # 爬虫核心逻辑
│ ├── change_data.py # 数据导出与清洗逻辑
│ └── ... # 其他辅助模块
├── cache/ # [自动生成] 存放爬取的原始 CSV 数据(请勿手动删除)
├── Output/ # [自动生成] 存放导出的 Excel 结果报表
├── 1.终端启动.bat # [启动脚本] 仅运行爬虫核心(无界面)
├── 2.导出结果.bat # [启动脚本] 仅运行数据导出工具
├── 3.GUI启动.bat # [启动脚本] 启动全功能图形界面(推荐)
├── requirements.txt # Python 依赖库清单
└── README.md # 项目说明文档
- 操作系统:Windows (脚本针对 Windows 优化)
- 浏览器:必须安装 Google Chrome 浏览器。
- Python 环境:建议 Python 3.10+。
安装依赖:
pip install -r requirements.txt提示:启动脚本会自动查找以下 Python 环境:
- Conda 环境名为
Spider的环境。- 项目根目录下
python/文件夹内的便携式 Python。- 系统环境变量中的
python。
双击运行 3.GUI启动.bat。
- 添加关键词:在左侧输入框输入关键词(如“留学”、“通过”),点击添加。支持多词组合搜索。
- 设置数量:可选填最大爬取博主数量。
- 开始任务:点击“开始爬取”,程序将自动打开浏览器并采集数据。
- 导出数据:任务完成或停止后,选择过滤模式(仅国外/仅国内/全部),点击“导出 xlsx”生成 Excel 报表。
- 仅爬取:双击
1.终端启动.bat,将读取代码中的默认配置进行爬取。 - 仅导出:双击
2.导出结果.bat,运行导出工具处理已有的 CSV 数据。
- 浏览器接管:程序基于
DrissionPage,运行时会接管 Chrome 浏览器。建议在运行前关闭无关的 Chrome 窗口,以免干扰。 - 数据安全:
cache/目录保存了爬取的原始数据,用于断点续传,请勿随意清空,除非你想重新开始。Output/目录保存最终生成的 Excel 报表。
- 隐私保护:
- 爬取结果包含您的搜索记录。
- 项目已配置
.gitignore忽略cache/和Output/目录,防止敏感数据上传到版本控制系统。
Q: 浏览器提示连接失败?
A: 请确保您已安装 Google Chrome。如果浏览器崩溃,程序会尝试自动重启。
Q: 为什么搜不到数据?
A: 请检查关键词是否过于冷门,或者手动在浏览器确认搜索结果是否为空。
Q: 爬取速度太慢?
A: 为了模拟真实用户并防止被风控,程序内置了等待间隔。请耐心等待。