欢迎光临
我们一直在努力

强化学习HAM(分层抽象机)全解:底层原理到工程落地实施全流程

一、前置基础:HAM基础定位与溯源

1.1 基础定义

HAM 全称为 Hierarchies of Abstract Machines,分层抽象机,1998年由Parr、Russell提出,是分层强化学习(HRL)三大经典原生框架之一,与Option框架、MaxQ值分解框架并列,是基于有限状态机FSM构建的结构化分层强化学习算法。

核心本质:将智能体决策策略封装为多层可嵌套、可递归调用的抽象状态机,区分固定逻辑执行节点与智能学习决策节点,仅在指定节点通过强化学习优化决策,其余流程按预设程序自动执行,依托时间抽象解决普通马尔可夫决策过程长时序、稀疏奖励、高维状态空间痛点。

以外卖骑手配送任务为例,可将完成一单配送的全过程直观对应为一台 HAM 分层抽象机:最顶层的「根机器」是 “完成一单配送”,其 “接到订单→到店取餐→送餐上门→结束订单” 的整体流程骨架由人工预先设定,无需 AI 从零学习;根机器会依次调用「到店取餐」「送餐上门」两台子机器,调用时主流程暂停、子任务启动,子任务执行完毕后自动返回主流程继续,对应 HAM 的嵌套调用机制;每台子机器内部又区分两类环节,到店后点击 “确认取餐”、送达后点击 “确认送达” 等规则固定的操作对应 HAM 里的 Start、Action、Stop 节点,全程按预设逻辑自动运行,而去商家选哪条路线最快、去用户家走大路还是穿小巷等需要结合实时路况判断的最优选择,则对应 HAM 里唯一需要学习的 Choice 节点,由强化学习算法迭代优化;整个过程中 AI 无需摸索基础业务流程,只需专注优化决策节点的选择收益,学习维度被大幅压缩,直观体现了 HAM“用固定结构承载业务逻辑,用强化学习优化决策节点” 的核心原理。

1.2 核心定位区分

  • Option:基于子策略的时间抽象框架,无硬性层级嵌套、无程序化状态机约束;

  • MaxQ:基于值函数分层分解框架,拆分全局奖励与子任务局部奖励;

  • HAM:基于程序式状态机嵌套框架,具备函数调用、栈帧存储、局部变量能力,策略可解释性、结构化表达能力最强。

1.3 原生解决痛点(HAM设计底层动因)

标准单层级强化学习MDP核心缺陷:复杂多阶段任务、长时序决策、机器人序列化操作中,原始MDP步数爆炸、奖励稀疏、样本效率极低、无法复用子任务逻辑;HAM通过人工先验搭建任务层级,剥离固定业务逻辑与智能决策逻辑,从模型结构层面降低RL学习难度。


二、HAM核心底层原理

2.1 核心设计原理

HAM遵循任务结构化拆分+决策解耦+半马尔可夫过程映射三大核心原理:

  • 逻辑解耦原理:将任务流程拆分为「固定执行逻辑」+「智能决策逻辑」,机器启停、底层动作、子任务调用均为固定代码逻辑,仅Choice选择节点交由RL算法学习;

  • 时序抽象原理:单次智能决策覆盖多步环境交互动作,消除逐帧决策冗余,将原始细粒度MDP转化为粗粒度SMDP半马尔可夫决策过程;

  • 栈式嵌套调用原理:抽象机支持多层递归调用,依托运行时栈完成子机器压栈、执行、弹栈返回,贴合人类任务拆解思维;

  • 先验引导原理:依托业务先验搭建状态机骨架,替代端到端黑盒学习,大幅提升样本效率与模型收敛速度。

  • 2.2 HAM运行底层逻辑

    整体执行链路:根抽象机启动 → 状态机节点流转 → 普通节点自动执行 → 命中Choice决策节点暂停 → RL输出最优选择 → 状态机继续流转 → 子机器调用压栈 → 子任务完成弹栈 → 根机器Stop节点终止回合。

    核心约束:非Choice节点无梯度、无参数更新、无策略优化,全程确定性执行。

    2.3 HAM与SMDP映射原理

    HAM原生等价离散时间SMDP:原始环境状态sss + 机器运行栈状态zzz 构成HAM全局状态;Choice节点输出选择动作ccc为高层动作;两次决策节点间隔τ\\tauτ为时间跨度;间隔内累计奖励为SMDP即时奖励,完成MDP到SMDP的原生转化。


    三、HAM标准化架构与数学建模

    3.1 抽象机Machine五元组数学定义

    HAM中每一台独立分层抽象机,标准化五元组定义:N=⟨M,Σ,Λ,δ,μ⟩N = \\langle M, \\Sigma, \\Lambda, \\delta, \\mu \\rangleN=M,Σ,Λ,δ,μ

    • MMM:机器内部私有状态集合,包含5类原生节点;

    • Σ\\SigmaΣ:环境输入状态集合,对接原始环境观测;

    • Λ\\LambdaΛ:机器输出指令集合(原始动作、机器调用、决策选择);

    • δ\\deltaδ:确定性状态转移函数,非决策节点固定流转;

    • μ\\muμ:节点输出映射函数,定义各节点执行行为。

    3.2 五大核心节点(HAM架构核心)

    所有抽象机仅包含5类标准化节点,无自定义节点,保证架构统一性:

  • Start起始节点:单机器唯一入口节点,固定启动,无环境交互、无决策;

  • Action原始动作节点:执行环境原生物理动作,与环境交互、获取单步奖励,逻辑固定;

  • Call机器调用节点:调用下级子抽象机,触发运行栈压栈操作,实现分层嵌套;

  • Choice决策选择节点【唯一学习节点】:算法核心,多分支路径待选,由强化学习策略输出分支选择,可学习、可优化;

  • Stop终止节点:当前机器执行完毕,运行栈弹栈,返回上级调用机器。

  • 3.3 运行时栈结构

    HAM专属运行栈为任务调度核心,栈帧存储:当前机器标识+机器内部节点+局部任务参数;执行Call节点压栈、执行Stop节点弹栈、Choice节点锁定当前栈帧状态作为决策状态;内部栈跳转不改变环境状态,属于内部私有转移。


    四、HAM专属学习算法原理与算法流程

    4.1 基础算法:HAMQ 算法原理

    基于SMDP-Qlearning改造,仅针对Choice节点执行Q值更新,跳过中间自动执行步骤,核心更新公式:

    Q(s,z,c)←(1−α)Q(s,z,c)+α(R+γτmax⁡c′Q(s′,z′,c′))Q(s,z,c) \\leftarrow (1-\\alpha)Q(s,z,c) + \\alpha\\left(R + \\gamma^\\tau \\max_{c'} Q(s',z',c')\\right)Q(s,z,c)(1α)Q(s,z,c)+α(R+γτmaxcQ(s,z,c))

    参数释义:sss环境观测状态、zzz机器栈状态、ccc当前决策选择、α\\alphaα学习率、τ\\tauτ两次决策间隔步数、RRR间隔累计奖励、γ\\gammaγ折扣因子。

    算法特性:收敛稳定、适配表格型Q学习,长时序任务梯度损耗低,缺点是内部无效转移重复计算,算力开销大。

    HAMQ 算法执行流程

    HAMQ 以选择点为核心更新单位,围绕状态机自动流转与 SMDP 值迭代展开,完整执行流程如下:

  • 初始化阶段:初始化所有选择点的 Q 值(离散状态采用 Q 表格存储,高维状态采用值函数近似),设置学习率 α、折扣因子 γ、探索率 ε 等超参数,完成全部抽象机的状态机结构定义与运行时栈初始化。

  • 回合启动:重置环境得到初始状态 s,将根抽象机压入运行栈并定位至 Start 节点,初始化累计奖励计数器、步长计数器与上一决策点状态缓存。

  • 状态机流转与决策点采样:

    • 按确定性转移规则自动执行 Start、Action、Call、Stop 等非学习节点,每执行一次 Action 节点与环境交互一步,同步累计单步奖励与时间步长;

    • 当栈顶运行至 Choice 节点时,若为回合内首个决策点,仅记录当前决策点全局状态 (s, z),并采用 ε- 贪心策略选择分支动作 c 后继续流转;若为非首个决策点,先基于上一决策点的状态、动作、累计奖励、步长与当前决策点状态执行一次 Q 值更新,再记录当前决策点信息并继续执行。

  • 回合终止更新:当根机器运行至 Stop 节点、回合结束时,完成最后一组决策点的 Q 值更新。

  • 迭代收敛:重复执行回合训练,持续迭代更新 Q 值,直至值函数收敛或达到预设最大训练回合数。

  • 参考文献:Parr R, Russell S. Reinforcement learning with hierarchies of machines[C]//Advances in Neural Information Processing Systems. 1998: 1043-1049.

    4.2 优化算法:HAMQ-INT 加速算法(工业首选)

    针对HAMQ冗余计算优化,提出内部转移Internal Transition缓存机制:

  • 定义内部转移:两次Choice节点之间,环境状态不变、累计奖励为0、仅机器栈跳转的纯架构流转过程;

  • 构建缓存映射ρ(P,s,z,c)=z′\\rho(P, s, z, c)=z'ρ(P,s,z,c)=z,存储内部栈转移规则;

  • 算法短路:训练时直接调取缓存跳过内部流转计算,仅更新环境状态发生变化的终端决策节点;

  • 收益:训练算力降低60%以上,收敛速度大幅提升,是HAM工程落地标准算法。

    HAMQ-INT算法执行流程

    HAMQ-INT 在 HAMQ 的决策点更新逻辑基础上,新增内部转移识别与缓存短路机制,完整执行流程如下:

  • 初始化阶段:初始化所有选择点的 Q 值,设置学习率 α、折扣因子 γ、探索率 ε 等超参数,完成全部抽象机结构定义与运行时栈初始化;同时初始化内部转移缓存字典ρ\\rhoρ,用于存储环境状态不变时的栈状态跳转规则。

  • 回合启动:重置环境得到初始状态 s,将根抽象机压入运行栈并定位至 Start 节点,初始化累计奖励计数器、步长计数器与上一决策点状态缓存。

  • 状态机流转与缓存短路:

    • 非 Choice 节点按确定性转移规则自动执行,遇到 Call 节点完成子机器压栈、遇到 Stop 节点完成当前机器弹栈;

    • 到达 Choice 节点并选定分支动作 c 后,优先查询内部转移缓存\\(\\rho\\):若当前 (s, z, c) 存在匹配的缓存记录,直接跳转至缓存对应的下一栈状态 z’,跳过中间全部节点的逐次执行过程,实现计算短路;

    • 若无匹配缓存记录,则按状态机转移规则逐步执行至下一个 Choice 节点,过程中同步累计单步奖励与时间步长。

  • 转移判定与更新:

    • 若两次 Choice 节点之间环境状态 s 未发生变化、累计奖励为 0,判定为内部转移,将该跳转关系写入缓存字典\\(\\rho\\),不执行 Q 值更新;

    • 若环境状态发生变化,判定为终端决策点,基于上一决策点的状态、动作、累计奖励、步长与当前决策点状态,按 SMDP Q 学习公式执行一次 Q 值更新,同时记录当前决策点信息作为下一更新周期的起点。

  • 回合终止更新:当根机器运行至 Stop 节点、回合结束时,完成最后一组终端决策点的 Q 值更新,终止状态跳转不纳入缓存。

  • 迭代收敛:重复执行回合训练,持续迭代更新 Q 值与内部转移缓存,直至值函数收敛或达到预设最大训练回合数。

  • 参考文献:Parr R. Hierarchical Control and Learning for Markov Decision Processes[D]. University of California, Berkeley, 1998.


    五、工程实施核心注意事项(避坑要点)

    5.1 架构设计注意事项

  • 禁止多层Choice嵌套堆叠:超过3层嵌套会导致栈状态爆炸,Q值拟合难度陡增;

  • 子机器功能解耦:单个子机器仅承载单一子任务,禁止跨功能逻辑耦合;

  • 内部转移优先设计:任务固定循环流程全部划为内部转移,最大化算法加速效果。

  • 5.2 算法训练注意事项

  • 折扣因子γ需适配间隔步数τ,长时序任务适当降低γ,避免远期奖励梯度失效;

  • 高维环境禁止原生Q表:必须搭配DQN、PPO等深度强化学习拟合Q网络;

  • 缓存定时清理:长周期任务需迭代清空过期内部转移缓存,防止状态匹配错误。

  • 5.3 落地缺陷约束

  • HAM强依赖人工先验:状态机架构全部人工设计,无法自动挖掘子任务;

  • 泛化性受限:架构绑定专属任务,跨任务迁移能力弱于Option框架;

  • 连续动作场景适配差:原生HAM适配离散决策,连续动作需二次改造。


  • 八、HAM综合优劣与适用场景

    8.1 核心优势

    • 样本效率极高,远超单层RL、原生Option;

    • 策略可解释性拉满,状态机流程可可视化溯源;

    • 子机器模块可复用,同类任务快速迁移;

    • 稀疏奖励、长时序决策任务收敛效果优异。

    8.2 适用落地场景

    工业机器人序列化装配、室内分层导航、离散游戏多阶段AI、物流分拣调度、工控分层决策系统;固定业务流程+少量最优路径优化的结构化任务。

    九、全文总结

    HAM本质是程序状态机+分层SMDP强化学习的结合体,核心原理是用人工设计的嵌套抽象机剥离固定业务逻辑,仅保留少量Choice节点交由RL优化;实施核心在于任务层级拆分与内部转移优化,相比于其他分层RL框架,HAM更适配工业结构化、流程固定的决策任务,落地成本低、训练稳定,缺点为先验依赖性强、无自动分层能力。

    赞(0)
    未经允许不得转载:171主机测评 » 强化学习HAM(分层抽象机)全解:底层原理到工程落地实施全流程
    分享到: 更多 (0)

    评论 抢沙发

    • 昵称 (必填)
    • 邮箱 (必填)
    • 网址