前言
在爬虫数据解析场景中,除 BeautifulSoup、lxml 等标签解析库外,正则表达式是处理非标准文本、混杂字符串、内嵌脚本内容、不规则页面的核心手段。HTML 源码、JS 变量、接口原始报文、富文本内容中,大量数据并不规整在标准标签内,标签解析工具难以精准提取,而正则凭借灵活的字符匹配规则,可从杂乱文本中快速定位目标内容。
正则适用于三大典型场景:HTML 内嵌 JS 变量提取、不规则标签文本截取、批量匹配固定格式字符串、清洗页面冗余内容。本文从正则基础语法、爬虫常用元字符、分组提取、贪婪 / 非贪婪匹配、多行匹配、实战案例、性能优化、避坑要点逐层讲解,结合爬虫真实业务代码,覆盖单条数据提取、列表数据批量抓取、复杂嵌套内容解析、数据清洗等全场景,同时对比标签解析与正则的选型策略,形成可直接复用的正则爬虫解决方案。
本文使用 Python 内置 re 模块,无需额外安装第三方库,全版本 Python 原生支持,官方文档参考:https://docs.python.org/3/library/re.html
一、正则核心基础与爬虫专用语法
1.1 re 模块核心常用方法
Python <





