DQN(Deep Q-Network,深度Q网络)是深度强化学习的奠基性算法,由DeepMind于2013年首次提出,2015年优化完善。其核心价值是解决了传统Q-Learning算法无法处理高维连续状态空间的痛点,将深度学习的特征拟合能力与强化学习的决策能力深度结合,适用于机器人控制、参数优化、金融决策等通用高维状态场景。
传统Q-Learning依赖Q表存储状态-动作价值,仅适用于离散、低维小规模场景;而DQN利用全连接神经网络拟合高维状态下的Q值函数,实现了从“表格查询”到“高维函数拟合”的跨越,可直接处理传感器数据、环境参数向量、控制状态等各类高维输入。本文将逐步骤拆解DQN完整执行流程,重点解析高维输入的网络设计、底层原理与核心优化逻辑。
一、DQN核心前置基础
在拆解算法步骤前,需明确DQN继承的强化学习基础理论,这是理解其原理的核心前提。
1.1 马尔可夫决策过程(MDP)
DQN的所有迭代过程均基于MDP框架,MDP由五元组(S,A,R,P,γ)(S, A, R, P, γ)(S,A,R,P,γ)构成:
-
SSS:状态空间,智能体当前所处环境的高维状态(DQN主流场景为非图像的高维特征向量,如传感器参数、系统状态变量、控制维度数据等)
-
AAA:动作空间,智能体可执行的离散动作(DQN仅支持离散动作)
-
RRR:奖励函数,智能体执行动作后获得的即时反馈
-
PPP:状态转移概率,当前状态执行动作后跳转至下一状态的概率
-
γγγ:折扣因子(0≤γγγ≤1),权衡即时奖励与未来长期奖励
1.2 Q值函数核心定义
Q值(动作价值)表示:智能体在状态s下执行动作a,后续遵循最优策略所能获得的累计折扣奖励期望,公式如下:
Qπ(s,a)=Eπ[∑k=0∞γkRt+k∣St=s,At=a]Q^\\pi(s,a) = \\mathbb{E}_\\pi[\\sum_{k=0}^\\infty \\gamma^k R_{t+k} | S_t=s, A_t=a]Qπ(s,a)=Eπ[∑k=0∞γkRt+k∣St=s,At=a]
最优Q值函数(Bellman最优方程)是DQN的拟合目标:
Q∗(s,a)=E[R(s,a)+γmaxa′Q∗(s′,a′)]Q^*(s,a) = \\mathbb{E}[R(s,a) + \\gamma \\max_{a'} Q^*(s',a')]Q∗(s,a)=E[R(s,a)+γmaxa′Q∗(s′,a′)]
核心原理:当前状态-动作的最优价值 = 即时奖励 + 下一状态所有动作中的最大折扣价值,这是DQN迭代更新的核心依据。
1.3 传统Q-Learning的缺陷(DQN的诞生动因)
1. 维度灾难:高维状态下Q表无法存储所有状态-动作组合;
2. 更新效率低:单步迭代仅更新单个Q表值,泛化能力极差;
3. 无法感知特征:原始状态无特征提取能力,依赖人工特征工程。
DQN通过全连接神经网络拟合高维状态Q值、经验回放、目标网络冻结三大核心创新,彻底解决上述高维场景痛点。
二、DQN算法完整步骤逐阶解析(含底层原理)
DQN 的算法流程如下图所示,算法首先进行初始化(包括核心参数和两个网络结构初始化),然后进入episode循环,读取初始环境状态,进入交互序列学习循环,首先基于QnetQ_{net}Qnet网络选择动作aaa,获取反馈rrr,下一个状态s’s’s’,终止标记donedonedone, 然后将五元组(s,a,r,s′,done)(s, a, r, s', done)(s,a,r,s′,done)存入回放池,接着从回放池批量取样,根据QTargetQ_{Target}QTarget网络,训练QnetQ_{net}Qnet网络, 检查是否有固定交互步数没有更新更新QTargetQ_{Target}QTarget网络,如果是则更新,否则进入下次交互学习;如交互次数大于阈值或者进入终止状态,则进入下一次episode学习,直到达到最大episode,算法输出QnetQ_{net}Qnet,结束;

DQN的完整训练流程可分为初始化阶段、环境交互采样阶段、经验回放采样阶段、网络更新阶段、迭代终止判断五大核心步骤,每一步均有针对性的原理设计,下文逐一拆解。
步骤1:算法全局初始化
1.1 初始化核心参数
初始化超参数:学习率ααα、折扣因子γγγ、探索率εεε(ε-greedy)、经验回放池容量NNN、批次大小batch_sizebatch\\_sizebatch_size、目标网络更新频率、最大迭代步数等。
1.2 初始化双网络结构(核心创新1)
DQN搭建两个结构完全相同、参数不同步更新的神经网络:
-
当前网络(训练网络)QnetQ_{net}Qnet:实时更新参数,负责预测当前状态sss的Q值,用于决策与梯度更新
-
目标网络 QTargetQ_{Target}QTarget:参数定期冻结更新,负责预测下一状态s′s's′的Q值,用于计算目标Q值
1.3 初始化经验回放池(核心创新2)
创建固定容量的缓存队列,用于存储环境交互样本:(s,a,r,s′,done)(s, a, r, s', done)(s,a,r,s′,done),分别对应当前状态、执行动作、即时奖励、下一状态、回合终止标记。
本步骤底层原理
双网络设计原理:传统单网络拟合Q值时,目标Q值与预测Q值来自同一网络,参数每一步更新都会导致目标值持续波动,训练过程极不稳定、难以收敛。DQN通过冻结目标网络参数,让目标Q值在一定步数内保持稳定,为梯度下降提供固定优化目标,彻底解决训练震荡问题。
经验回放池原理:强化学习原始交互样本存在时间序列相关性(连续样本高度相似),直接训练会导致神经网络过拟合、梯度失效。回放池存储历史样本,通过随机采样打破样本时序关联,同时实现样本重复利用,提升数据效率。
步骤2:环境交互,采集训练样本
智能体与环境持续交互,生成训练样本,流程如下:
2.1 获取当前环境状态sss
从环境中读取当前时刻的高维状态向量(如多维度传感器数据、系统控制参数、环境状态特征向量),并完成预处理(归一化、特征标准化、维度规整等),适配全连接神经网络的输入格式。
2.2 ε-greedy策略选择动作a
基于当前网络QnetQ_{net}Qnet输出的Q值,通过贪心策略选择动作:
-
以**εεε概率**随机选择动作(探索):尝试未知动作,挖掘潜在更优策略,避免局部最优
-
以1-εεε概率选择Q值最大的动作(利用):基于QnetQ_{net}Qnet输出的最优决策,执行已有最优策略
训练过程中εεε通常线性衰减:前期高εεε,充分探索环境;后期低εεε,专注利用最优策略。
2.3 执行动作,获取环境反馈
智能体执行动作aaa,环境返回即时奖励rrr、下一状态s′s's′、回合终止标记donedonedone(True表示回合结束,无后续状态)。
2.4 存储样本至经验回放池
将五元组(s,a,r,s′,done)(s, a, r, s', done)(s,a,r,s′,done)存入回放池,若回放池达到最大容量,则淘汰最早的样本,保证样本时效性。
本步骤底层原理
ε-greedy平衡原理:强化学习核心矛盾是「探索与利用」。纯贪心策略会固化现有策略,无法发现更优动作;纯随机探索效率极低。ε-greedy通过概率动态平衡二者,前期探索、后期收敛,是离线强化学习的最优探索策略。
样本存储原理:离线训练模式(Off-Policy)允许复用历史样本,无需实时交互训练,大幅降低环境交互成本,同时打乱样本时序,满足神经网络独立同分布的训练要求。
步骤3:经验回放随机采样批次样本
当经验回放池样本数量达到最小采样阈值(避免样本不足导致训练偏差),开始执行采样训练:从回放池中随机抽取batch_sizebatch\\_sizebatch_size个独立样本,构成训练批次。
本步骤底层原理
解决强化学习的时序相关性与非平稳分布问题。环境连续交互的样本存在强时间关联,直接批量训练会让网络学习到时序噪声,导致梯度更新震荡、模型不收敛。随机采样让每一批次样本相互独立,符合深度学习梯度下降的训练前提。
同时,重复利用历史样本,让少量环境交互数据产生多次训练迭代,极大提升数据利用率,这是DQN高效训练的核心关键。
步骤4:计算损失函数,反向更新当前网络
这是DQN的核心训练步骤,通过拟合Bellman方程,最小化预测Q值与目标Q值的误差,分步执行如下:
4.1 计算当前网络预测Q值
将批次样本的状态s输入当前网络QnetQ_{net}Qnet,输出该状态下所有动作的Q预测值,根据样本中实际执行的动作a,提取对应Q值,记为Qnet(s,a)Q_{net}(s,a)Qnet(s,a)。
4.2 计算目标网络的真实Q值(标签值)
基于Bellman最优方程,结合目标网络计算目标Q值QtargetQ_{target}Qtarget,分两种场景:
1. 若回合未终止(done=False):存在下一状态价值
Qtarget=r+γ⋅maxa′Qtarget(s′,a′)Q_{target} = r + \\gamma \\cdot \\max_{a'} Q_{target}(s',a')Qtarget=r+γ⋅maxa′Qtarget(s′,a′)
2. 若回合终止(done=True):无未来奖励,仅保留即时奖励
Qtarget=rQ_{target} = rQtarget=r
核心:目标Q值由冻结的目标网络计算,全程不参与梯度更新,保证训练目标稳定。
4.3 构建均方误差损失函数
DQN采用MSE损失函数,缩小预测Q值与目标Q值的差距,损失公式:
Loss=1N∑i=1N[Qtargeti−Qneti(si,ai)]2Loss = \\frac{1}{N}\\sum_{i=1}^N [Q_{target}^i – Q_{net}^i(s_i,a_i)]^2Loss=N1∑i=1N[Qtargeti−Qneti(si,ai)]2
其中NNN为批次样本数量
4.4 反向传播更新网络参数
通过梯度下降算法,反向传播损失误差,仅更新**当前网络QnetQ_{net}Qnet的权重参数,目标网络参数保持不变。
本步骤底层原理
拟合本质原理:DQN的训练过程本质是函数逼近,用神经网络参数化的Qnet(s,a)Q_{net}(s,a)Qnet(s,a)拟合理论最优Q*值。通过不断最小化Bellman方程的迭代误差,让网络输出的Q值无限逼近真实最优动作价值。
参数更新隔离原理:目标网络全程不更新,保证每一轮训练的标签值(QtargetQ_{target}Qtarget)是固定、可信的;而当前网络不断迭代优化,逐步逼近最优值,从根本上解决了传统Q-Learning单步更新、目标漂移的训练不稳定问题。
终止态截断原理:回合结束后无后续状态,未来奖励为0,因此直接舍弃折扣累积项,保证价值计算的准确性,避免无效价值拟合。
步骤5:定期更新目标网络参数
每间隔固定的训练步数(如100步),将当前网络QnetQ_{net}Qnet的全部参数赋值给目标网络QtargetQ_{target}Qtarget,完成参数同步,其余时间目标网络参数完全冻结。
步骤6:迭代循环与终止判断
重复「环境交互采样→经验回放采样→网络更新→目标网络同步」流程,直至达到最大训练回合数或环境收敛条件(如累计奖励稳定、无明显波动),训练结束后当前网络QnetQ_{net}Qnet即为最优Q值预测网络,可直接用于环境决策。
三、DQN三大核心创新原理总结
DQN的性能突破完全依赖三大核心设计,也是其区别于传统Q-Learning的关键,原理汇总如下:
3.1 神经网络函数拟合
替代Q表存储,采用多层全连接神经网络适配非图像高维状态输入,自动对高维特征向量进行降维、特征融合与价值映射,无需人工特征筛选与图像预处理,完美适配连续高维状态空间,从根本上解决传统Q-Learning的维度灾难问题。网络核心设计偏向结构化高维数据拟合,摒弃卷积层的图像特征提取逻辑,以全连接层实现高维状态与动作价值的精准映射。
3.2 经验回放机制
打破样本时序相关性,实现样本随机采样、重复利用,满足深度学习训练的独立同分布要求,提升训练稳定性与数据效率。
3.3 双网络冻结更新机制
分离预测网络与目标网络,固定训练目标,彻底解决单网络训练的目标漂移、梯度震荡问题,让深度强化学习可稳定收敛。
四、不同输入维度与数据结构下的DQN网络结构适配分析
前文所述DQN默认采用全连接神经网络适配通用高维向量状态,而在实际工程场景中,输入状态维度规模和原始数据结构类型直接决定DQN的网络骨架设计、层数配置与特征提取逻辑。DQN并非固定网络结构,需根据输入特性定制化搭建,否则会出现欠拟合、过拟合、特征提取失效、训练不收敛等问题。本节针对性分析:10维/100维/1000维不同状态维度的结构设计,以及向量、时序、图像、图数据四类主流环境数据的网络适配方案与底层原理。
4.1 不同状态维度下的全连接网络结构设计(结构化向量输入)
针对DQN最常用的非图像结构化向量输入,状态维度(特征数量)是决定全连接网络宽度、深度、正则化策略的核心因素,不同维度的适配方案、设计偏向、优缺点如下。
4.1.1 低维状态(10维左右:简易控制场景)
适用场景:简单机器人姿态控制、小车倒立摆、单设备参数调控等低复杂度环境,状态特征少、物理意义明确、噪声极低。
最优网络结构:浅层窄网络(2-3层全连接层)
输入层(10) → 隐藏层(32/64, ReLU) → 隐藏层(32/64, ReLU) → 输出层(动作数)
结构设计原理:10维特征信息量少、特征冗余度低,无需复杂特征融合。浅层小宽度网络参数量少,可避免过参数化过拟合,同时训练速度快、收敛稳定,匹配低维状态的简单决策逻辑。
核心注意点:禁止使用深层网络、大学习率、Dropout等冗余正则化手段,否则会出现欠拟合,无法拟合细微的状态-动作价值关联。
4.1.2 中维状态(100维左右:常规工业场景)
适用场景:多传感器融合设备、中小型系统参数优化、智能仓储调度等,特征数量适中、存在少量冗余特征、特征间存在弱关联。
最优网络结构:中层标准网络(3-4层全连接层,适中宽度)
输入层(100) → 隐藏层(128, ReLU) → 隐藏层(128, ReLU) → 隐藏层(64, ReLU) → 输出层(动作数)
结构设计原理:100维特征具备充足环境信息,同时存在部分无效冗余特征,需要多层网络完成特征筛选、关联融合、维度压缩。采用先宽后窄的网络结构,先充分映射高维特征关联,再逐步降维提纯有效特征,平衡拟合能力与泛化能力。
核心注意点:可适当添加少量权重衰减正则化,避免中等维度下的轻微过拟合,无需复杂特征预处理,网络可自主完成特征提纯。
4.1.3 高维状态(1000维左右:复杂系统场景)
适用场景:大规模物联网设备状态、复杂金融时序特征、多节点系统状态、高精度工业监测等,特征量大、冗余度高、特征耦合性强、存在大量噪声特征。
最优网络结构:深层阶梯降维网络(4-6层全连接层+正则化+特征约束)
输入层(1000) → 隐藏层(512, ReLU) → 隐藏层(256, ReLU) → 隐藏层(128, ReLU) → 隐藏层(64, ReLU) → 输出层(动作数)
结构设计原理:1000维超高维状态存在严重的特征冗余与信息混杂,浅层网络无法完成有效特征映射。通过阶梯式降维逐步过滤无效噪声、解耦耦合特征、提纯核心决策信息,深层网络具备更强的非线性拟合能力,可学习高维状态与动作价值的复杂映射关系。
核心配套设计:必须搭配正则化(L2权重衰减、Dropout)、输入归一化、梯度裁剪,杜绝高维输入带来的严重过拟合、梯度爆炸问题;同时降低学习率,保证高参数网络的训练稳定性。
4.1.4 三档维度结构核心差异总结
维度越低,网络越浅越窄,核心目标是防止过拟合、快速收敛;维度越高,网络越深且阶梯降维,核心目标是特征提纯、解耦冗余、增强非线性拟合。三者均采用全连接结构,适配结构化向量输入,仅通过深度、宽度、正则化的差异化设计适配不同维度规模。
4.2 不同环境数据结构下的DQN网络适配设计与原理分析
除结构化向量外,真实环境还存在时序数据、图像数据、图结构数据三类主流非结构化/半结构化数据,此类数据无法直接用普通全连接网络处理,必须针对性替换特征提取主干网络,保留DQN双网络、经验回放、Bellman迭代的核心机制,实现场景适配。以下逐一分析各数据结构的网络设计、适配原理与优劣。
4.2.1 结构化向量数据(基础经典场景)
数据特性:维度固定、特征独立有序、无空间/时间关联,如传感器数值、系统参数、状态向量。
适配网络:纯全连接神经网络(MLP)
结构逻辑:全连接层可实现任意维度向量的非线性映射,无需额外特征提取模块,结构简单、训练高效、推理速度快。
适用场景:广泛应用于各类低、中、高维结构化数值决策场景,是工业控制与系统优化的主流方案。具体包括:倒立摆平衡、小车轨迹控制等经典强化学习仿真任务;工业多参数调控、设备能耗优化、智能温控系统;电力负荷参数调度、服务器资源分配;简单金融参数套利、多维度指标决策等纯数值型状态的智能决策任务。
数据特性:维度固定、特征独立有序、无空间/时间关联,如传感器数值、系统参数、状态向量。
适配网络:纯全连接神经网络(MLP)
结构逻辑:全连接层可实现任意维度向量的非线性映射,无需额外特征提取模块,结构简单、训练高效、推理速度快。
适用范围:前文重点讲解的通用DQN场景,是工业控制、参数优化、决策调度的主流方案。
4.2.2 时序序列数据(连续时间环境场景)
数据特性:数据随时间连续变化,前后帧存在强时间依赖关系,单帧状态无完整决策意义,如设备运行时序、交通流量时序、金融价格时序。
适配网络:LSTM-DQN / GRU-DQN(循环网络+全连接组合结构)
结构设计:时序输入 → LSTM/GRU时序特征提取层 → 全连接映射层 → Q值输出
核心原理:普通全连接网络无法捕捉时间关联,会丢失历史状态信息。LSTM/GRU可记忆长期时序依赖、过滤时序噪声,提取时间维度的有效特征,再通过全连接层完成价值拟合,适配动态时序环境的决策需求。
优缺点:可精准适配时序动态环境,但训练速度慢、对序列长度敏感,需搭配序列截断、批量归一化使用。
适用场景:针对状态随时间动态演变、历史数据影响当前决策的时序类任务。具体包括:工业设备故障预判与时序维护决策、机床运行状态动态调控;城市交通流量时序调度、路口信号灯动态配时;股票、期货时序价格交易决策、风险动态控制;无人机、机器人连续时序姿态微调、动态轨迹跟踪;水环境、气象时序数据的动态调控决策。
数据特性:数据随时间连续变化,前后帧存在强时间依赖关系,单帧状态无完整决策意义,如设备运行时序、交通流量时序、金融价格时序。
适配网络:LSTM-DQN / GRU-DQN(循环网络+全连接组合结构)
结构设计:时序输入 → LSTM/GRU时序特征提取层 → 全连接映射层 → Q值输出
核心原理:普通全连接网络无法捕捉时间关联,会丢失历史状态信息。LSTM/GRU可记忆长期时序依赖、过滤时序噪声,提取时间维度的有效特征,再通过全连接层完成价值拟合,适配动态时序环境的决策需求。
优缺点:可精准适配时序动态环境,但训练速度慢、对序列长度敏感,需搭配序列截断、批量归一化使用。
4.2.3 图像视觉数据(空间像素场景)
数据特性:二维/三维像素矩阵,具备局部空间相关性、纹理特征、位置特征,数据维度极高、冗余度极大,如游戏画面、机器人视觉图像、监控画面。
适配网络:CNN-DQN(卷积网络+全连接组合结构,原始DeepMind DQN结构)
结构设计:图像输入 → 多层卷积+池化(提取空间纹理、局部特征) → 特征展平 → 全连接层 → Q值输出
核心原理:卷积核的局部感受野、权值共享特性,可高效提取图像空间特征,大幅压缩图像冗余数据、降低参数量,解决全连接网络处理图像时参数量爆炸、无法提取空间特征的问题。
优缺点:视觉特征提取能力极强,适配图像决策场景;但仅能捕捉空间特征,无时序记忆能力,动态视频类图像需结合时序网络。
适用场景:面向以图像、像素画面为状态输入的视觉决策任务。具体包括:经典Atari游戏画面通关、小游戏智能操控;无人车、机器人视觉避障、画面路径规划;工业视觉缺陷检测后的动态调控、流水线智能分拣;安防监控画面异常行为识别与联动决策;虚拟现实、仿真可视化环境中的智能交互决策。
数据特性:二维/三维像素矩阵,具备局部空间相关性、纹理特征、位置特征,数据维度极高、冗余度极大,如游戏画面、机器人视觉图像、监控画面。
适配网络:CNN-DQN(卷积网络+全连接组合结构,原始DeepMind DQN结构)
结构设计:图像输入 → 多层卷积+池化(提取空间纹理、局部特征) → 特征展平 → 全连接层 → Q值输出
核心原理:卷积核的局部感受野、权值共享特性,可高效提取图像空间特征,大幅压缩图像冗余数据、降低参数量,解决全连接网络处理图像时参数量爆炸、无法提取空间特征的问题。
优缺点:视觉特征提取能力极强,适配图像决策场景;但仅能捕捉空间特征,无时序记忆能力,动态视频类图像需结合时序网络。
4.2.4 图结构数据(拓扑关联场景)
数据特性:非欧几里得结构化数据,包含节点、边、拓扑关联关系,特征存在节点关联依赖性,如电网拓扑、交通路网、社交网络、多智能体关联系统。
适配网络:GCN-DQN / GAT-DQN(图卷积网络+全连接组合结构)
结构设计:图拓扑输入 → GCN/GAT图特征聚合层(聚合节点与邻域特征) → 特征池化 → 全连接层 → Q值输出
核心原理:向量、卷积网络均无法处理拓扑关联数据,图卷积网络可自适应聚合节点邻域信息、学习拓扑结构特征,挖掘系统内各单元的关联关系,适配网络化、拓扑化环境的决策任务。
优缺点:专属适配拓扑图数据,特征提取精度高;网络结构复杂、训练成本高,仅适用于网络化复杂系统场景。
适用场景:针对具备拓扑关联、节点互联特性的复杂网络化系统决策任务。具体包括:智能电网节点负荷调度、电力拓扑故障分配与优化;城市交通路网节点流量调控、路径全局优化;多智能体集群协同控制、机器人编队拓扑协作;通信网络节点带宽分配、链路优化;社交网络、用户关联系统的策略推荐与资源分配。
数据特性:非欧几里得结构化数据,包含节点、边、拓扑关联关系,特征存在节点关联依赖性,如电网拓扑、交通路网、社交网络、多智能体关联系统。
适配网络:GCN-DQN / GAT-DQN(图卷积网络+全连接组合结构)
结构设计:图拓扑输入 → GCN/GAT图特征聚合层(聚合节点与邻域特征) → 特征池化 → 全连接层 → Q值输出
核心原理:向量、卷积网络均无法处理拓扑关联数据,图卷积网络可自适应聚合节点邻域信息、学习拓扑结构特征,挖掘系统内各单元的关联关系,适配网络化、拓扑化环境的决策任务。
优缺点:专属适配拓扑图数据,特征提取精度高;网络结构复杂、训练成本高,仅适用于网络化复杂系统场景。
4.3 通用DQN网络结构适配核心准则
1. 数据结构决定主干网络:结构化向量用MLP、时序数据用RNN系列、图像用CNN、拓扑图用GNN,核心特征提取模块必须匹配数据固有特性。
2. 维度规模决定网络深度与宽度:低维浅而窄、中维标准适中、高维深且阶梯降维,配套正则化策略逐级加强。
3. DQN核心机制通用不变:无论网络主干如何替换,经验回放、双网络冻结、Bellman损失迭代三大核心机制完全保留,仅替换特征提取模块,这是DQN适配多场景的核心灵活性。
基于上述原理,可推导DQN的固有缺陷,这也是Double DQN、Dueling DQN、PER-DQN等改进算法的优化切入点:
Q值过估计问题:目标Q值计算始终取max最大值,会放大正向误差,导致预测Q值普遍高于真实值;
样本采样无差异:均匀随机采样,忽略高价值学习样本与无效样本的区别,训练效率偏低;
动作价值拆分缺失:无法区分「状态固有价值」与「动作优势价值」,对不同状态的价值评估不够精准;
网络适配局限性:原生DQN固定简单全连接/卷积结构,对超高维向量、时序、图拓扑等复杂数据的特征提取能力有限,泛化性不足;
仅支持离散动作:输出为离散动作Q值,无法适配连续动作控制场景。
五、全文核心逻辑梳理
DQN的核心逻辑闭环:以Bellman最优方程为理论依据,采用适配非图像高维状态的全连接网络结构,以双网络冻结机制保证训练稳定,以经验回放解决高维样本时序冗余问题,通过梯度下降迭代拟合最优Q值函数,实现通用高维结构化状态下的智能决策。所有算法步骤与网络设计均针对高维向量输入优化,精准解决传统算法处理复杂结构化状态的固有缺陷。
![打卡信奥刷题(3584)用C++实现信奥题 P11523 [THUPC 2025 初赛] 摊位分配-171主机测评](https://www.171host.com/wp-content/uploads/2026/09/20260922020544-6ab1e2783b78e-220x150.png)


