前言
在全球互联网流量中,自动化爬虫、恶意机器人占比常年突破 40%,比价爬虫、数据爬取、账号批量注册、接口暴力爬取持续侵蚀企业数据与服务器资源。Akamai Bot Manager 作为全球商用反爬虫标杆产品,依托覆盖 130 + 国家、数千边缘节点的分布式 CDN 网络,在访问抵达源站前完成全链路爬虫识别,区别于传统 WAF 依靠单一 IP、UA 拦截的粗放策略,采用网络指纹 + 客户端硬件指纹 + 人机行为建模 + 动态挑战 + 全球威胁情报 + AI 打分六层联动识别体系,实现对简易 http 爬虫、无头浏览器爬虫、模拟真人设备爬虫、分布式代理爬虫的分层甄别,是当前风控反爬领域技术复杂度最高的产品之一。本文从底层技术逐层拆解其爬虫识别逻辑。
一、底层网络层识别:TLS/HTTP 协议指纹,拦截原生简易爬虫
爬虫最基础的破绽集中在 TCP、TLS 握手与 HTTP 请求协议细节,Akamai 在边缘节点第一时间抓取网络报文特征,依靠 JA3 指纹、协议异常特征完成首轮过滤。
二、客户端硬件指纹识别:Sensor-Data 体系,抓取浏览器底层环境破绽
网络层绕过之后,Akamai 通过页面嵌入加密 JS 脚本,在客户端浏览器静默采集数百项软硬件特征,封装为X-ACF-Sensor-Data加密字段回传服务端,是识别无头爬虫、伪装浏览器爬虫的核心手段,也是整个指纹体系的核心载体。 采集特征分为四大类:
整套指纹采集多达 500 + 维度特征,单一特征异常存疑,多项特征偏离基线即拉高爬虫风险分数。
三、行为轨迹 AI 建模:从人机交互差异,识破模拟真人爬虫
爬虫最大短板是无法复刻人类随机操作习惯,Akamai 依托海量自然人访问样本训练机器学习模型,从页面全生命周期行为数据构建行为基线,依靠行为熵值区分自动化访问。
1. 鼠标与光标行为检测
- 人类鼠标移动为不规则曲线、频繁停顿、小幅晃动;爬虫模拟移动多为直线匀速位移、坐标点位间隔完全均等,轨迹熵值极低;
- 点击操作:人类点击存在坐标偏移、点击间隔随机,爬虫精准点击目标坐标、点击时间严格固定,批量爬虫点击时序完全一致。
2. 页面浏览行为建模
监测页面访问顺序、页面停留时长、滚动速率、返回上一页频次:自然人会无规律滚动页面、中途跳出、跨栏目跳转;爬虫严格按照固定 URL 顺序访问,每个页面停留时间毫秒级固定,无无效跳转、无随机浏览行为。
3. 键盘输入特征
账号密码爬取、表单爬虫输入字符间隔均匀,无停顿、无删改字符;真人输入存在错删、停顿、打字间隔离散,系统通过输入时间分布熵值快速区分人机。
系统针对每个站点单独训练基线模型,区分普通用户、移动端用户、小众浏览器用户,避免正常访客误拦截。
四、动态加密 JS 挑战(Crypto Challenge):算力校验,拦截自动化解析爬虫
当指纹、行为两项数据出现异常,Akamai 下发动态加密算力挑战,即业界熟知的 JS 加密谜题,将验证成本转移至客户端,无完整浏览器内核的爬虫无法通过校验。
区别于固定验证码,Akamai 加密挑战无固定题库,算法实时迭代,规避爬虫打码平台批量破解。
五、全球威胁情报与 Bot 分类库:黑白名单精准区分善意 / 恶意爬虫
Akamai 运营数十年积累全球海量机器人样本库,分为已知可信 Bot、中性爬虫、恶意爬虫三类,实现精细化放行与拦截:
六、Bot Score 量化打分体系:多维度加权汇总,分级处置爬虫
以上所有检测维度数据最终汇总为0-100 分 Bot 风险评分,是 Akamai 最终判定爬虫的核心标准,平台自定义分数阈值实现分级管控Akamai:
分数采用动态加权:短时间高频访问权重最高,硬件指纹多项异常次之,行为异常为辅,单一项轻微异常不会直接判定爬虫,保障正常用户不会误拦截。
七、爬虫识别补充:区分合法爬虫与恶意爬虫的落地逻辑
Akamai 并非一刀切封禁所有自动化程序,依靠规则配置区分业务所需合作爬虫与黑产爬虫:企业可自定义域名白名单、指定合作爬虫 IP 段放行;对于价格采集、内容盗爬类恶意爬虫,依靠上述六层识别全链路拦截,兼顾业务可用性与数据安全。
总结
Akamai Bot Manager 的爬虫识别本质是多层特征交叉验证,从网络层到硬件层、行为层、挑战层层层递进:简易爬虫栽在网络指纹,普通无头爬虫栽在硬件 Sensor 指纹,精心模拟真人的高级爬虫栽在行为建模与动态加密挑战,分布式代理爬虫栽在全球威胁情报与指纹持久化追踪。整套体系依托边缘分布式架构就近完成检测,不会占用源站算力,也是其成为全球头部反爬产品的核心原因。随着爬虫技术迭代,Akamai 持续迭代 JS 加密算法与 AI 行为模型,形成攻防动态平衡。



