前言
前面三篇项目,我们先后完成静态榜单分页爬虫、图书列表采集、JSON 接口批量抓取。今天我们进入多级联动爬虫实战,核心模式就是「列表页提取详情链接 → 进入详情页抓取正文内容」,这也是网文、诗词、文档类网站最经典的爬虫结构。
很多新手写爬虫只能单页抓取,一旦遇到需要从列表跳转详情的场景就无从下手。本次我们抓取古典诗词站点数据,批量获取诗人名称、诗词标题、朝代、原文、注释、赏析内容。整套流程覆盖二级页面联动抓取,学会这套逻辑,后续绝大多数文章、小说类站点都可以套用相同思路。爬取的诗词文本可以用来构建诗词语料库、做文本分析、古诗文检索小程序素材。
先附上项目所需工具与依赖库官方地址,方便大家快速查阅安装: Python 官方下载地址:https://www.python.org/downloads/ requests 库官方地址:https://pypi.org/project/requ


