【爬取目标】
目标网站:某招聘网站
在求职市场分析、岗位薪资调研、招聘趋势预测、人才需求洞察等场景中,招聘职位信息是重要的参考依据。手动整理职位数据(职位名称、薪资、工作地点、经验要求、学历要求、技能标签、公司名称、公司行业、公司性质、公司规模、发布时间等)费时费力且容易遗漏关键信息,因此本文将教你使用 Python 的 Selenium 自动化框架,批量爬取某招聘网站的 Python 实习生职位数据并自动保存到结构化的 Excel 文件,快速搭建专属的职位信息数据库!
获取字段如下:职位名称、薪资、工作地点、经验要求、学历要求、标签、额外提示、公司名称、公司行业、公司性质、公司规模、发布时间,共 12 个字段,如图所示:

【实现效果】
代码使用 Selenium 有头模式自动打开浏览器,通过三层反检测策略降低被反爬系统拦截的风险,显式等待确保职位列表完全加载,模拟用户滚动触发懒加载机制,通过分析 Element UI 分页器的 .btn-next 按钮实现自动翻页采集,精准提取每个职位的 12 个字段信息(其中经验要求、学历要求、发布时间从隐藏的 sensorsdata 埋点 JSON 属性中提取),最终以精美的 Excel 表格样式输出(蓝色表头、自动列宽、冻结首行),默认采集 10 页、累计约 200 条职位数据:

文章目录
- 一、技术栈和环境版本
- 二、爬虫实战分析
-
- 2.1 导入模块
- 2.2 分析网页,定位职位数据(详细抓包过程)
-
- 第一步:打开目标页面,观察页面整体结构
- 第二步:利用关键词搜索,定位职位列表容器
- 第三步:逐字段分析 DOM 结构,确定 CSS 选择器
- 第四步:分析翻页按钮的 DOM 结构
- 第五步:分析翻页机制(SPA 页面特性)
- 第六步:总结网页分析规律
- 2.3 打开页面并等待数据渲染
- 2.4 实现翻页功能,自动采集多页数据
- 2.5 解析数据,提取职位字段信息
- 2.6 存储数据到 Excel 并美化样式
- 2.7 主函数启动程序(含翻页循环)
- 三、完整爬虫代码
- 四、总结
- 五、专栏说明
一、技术栈和环境版本
Python版本:3.12.3
编辑器:PyCharm
python内置模块:
import time # 延时等待,确保动态内容渲染完成
import json # 解析 sensorsdata 属性中的 JSON 数据
第三方模块,自行安装:
pip install selenium==4.5.0 # 浏览器自动化框架,驱动Chrome完成页面加载与元素定位
pip install openpyxl==


