前言
很多喜欢看书、整理电子资料的朋友,经常会遇到一类网站:在线电子书阅读站点,页面完整展示书籍目录、章节标题以及对应正文内容。想要保存全书内容,只能一章一章手动复制粘贴,一本书几十上百章节,耗费大量时间,还容易遗漏章节、排版混乱。
本篇实战项目,我们搭建一套完整电子书爬虫,自动抓取书籍目录列表、遍历所有章节链接、提取章节正文内容,最终把全书内容规整保存到本地文本文件。整套代码经过调试,结构模块化,新手可以直接运行,同时预留修改入口,更换目标站点链接就能适配其他同类电子书网站。
先把实战所需全部依赖库官方文档链接汇总,方便大家随时查阅接口用法: Python 官方下载地址:https://www.python.org/downloads/ Requests 官方文档:https://requests.readthedocs.io/ BeautifulSoup4 官方文档:






