文献综述

前言

哈密顿-雅可比-贝尔曼(Hamilton-Jacobi-Bellman, HJB)方程作为最优控制理论的核心数学工具,在非线性系统动态优化与反馈控制设计中具有不可替代的地位。该方程源于变分法与动态规划的基本原理,其解描述了系统在无限时间域内的最优代价函数,而相应的控制律则可通过代价函数的梯度直接导出。然而,对于大多数实际非线性系统而言,HJB方程的解析求解极为困难甚至不可能,尤其是在系统动力学未知或高度非线性的背景下。因此,如何通过数值逼近、神经网络学习或事件触发机制等手段有效求解HJB方程,并进一步分析其所对应闭环系统的渐近稳定性,已成为现代控制理论研究的重要前沿方向。

随着自适应动态规划(Adaptive Dynamic Programming, ADP)与强化学习技术的发展,基于数据驱动的方法逐渐成为解决HJB方程求解难题的有效路径。这类方法不再依赖于精确的系统模型,而是利用系统的输入输出数据在线学习最优控制策略,从而实现对复杂非线性系统的实时优化控制。与此同时,为降低计算负担与通信开销,事件触发机制被引入到最优控制框架中,使得控制器仅在特定条件满足时才进行更新,显著提升了系统的能效与实用性。在此背景下,HJB方程解的存在性、唯一性及其对应的闭环系统状态变量的有界性与渐近收敛性,成为衡量控制方案有效性与鲁棒性的关键指标。

尽管已有大量研究成果围绕HJB方程展开,但关于其解的渐近稳定性的系统性综述仍较为稀缺。尤其在面对输入约束切换系统结构以及完全未知动态模型等现实挑战时,传统Lyapunov稳定性理论与HJB框架的融合方式尚需深入探讨。此外,神经网络逼近误差对稳定性的影响、Zeno行为的排除机制、以及多子系统协同优化等问题也构成了当前研究的主要争议点。因此,本文旨在通过对近年相关文献的梳理与整合,系统阐述HJB方程解的渐近稳定性在不同应用场景下的理论进展、技术路线与存在问题,进而揭示该领域未来发展的可能方向。

主体

一、哈密顿-雅可比-贝尔曼方程的基本理论及其稳定性意义

哈密顿-雅可比-贝尔曼方程是连续时间最优控制问题的必要条件之一,广泛应用于无限时间域上的调节器与跟踪控制问题。对于一个典型的非线性控制系统:


\dot{x}(t) = f(x(t)) + g(x(t))u(t)

其中 $x \in \mathbb{R}^n$ 是状态向量,$u \in \mathbb{R}^m$ 是控制输入,目标是最小化性能指标:

$$
J(x_0) = \int_{0}^{\infty} r(x(\tau), u(\tau)) d\tau
$$

其中 $r(x,u)$ 为正定的运行代价函数。根据贝尔曼最优性原理,最优代价函数 $V^*(x)$ 满足以下HJB偏微分方程:

$$
\min_u \left{ r(x,u) + \frac{\partial V^*}{\partial x}(f(x) + g(x)u) \right} = 0
$$

该方程的光滑解 $V^*(x)$ 存在且正定时,可保证闭环系统在最优反馈控制律 u^*(x) = -\frac{1}{2}R^{-1}g^T(x)\frac{\partial V^*}{\partial x} 下的渐近稳定性。这一结论建立在Lyapunov稳定性理论的基础之上——若 $V^*(x)$ 是正定且径向无界的,并且沿系统轨迹满足 $\dot{V}^*(x) < 0$对所有 $x \neq 0$ 成立,则原点是全局渐近稳定的平衡点[^1]。

由于HJB方程的高度非线性特性,其显式解析解通常难以获得,尤其是在高维状态空间或复杂非线性项存在的情况下。为此,研究者们转向近似求解方法,如泰勒展开、特征线法、网格化数值求解等,但这些方法往往受限于“维度灾难”问题。近年来,神经网络因其强大的函数逼近能力,被广泛用于构造 $V^*(x)$ 的近似解,即所谓“批评家网络”(critic network),并通过自适应律不断调整权重以最小化HJB误差[^2]。

即使在使用神经网络逼近的情况下,只要能够证明代价函数估计值的误差保持一致最终有界(Uniformly Ultimately Bounded, UUB),并且闭环系统的状态变量与神经网络权值误差均受控,则仍可通过Lyapunov方法验证系统的渐近稳定性。例如,Liu等人(2022)提出了一种基于事件触发机制的数据驱动最优控制方案,针对具有输入约束的未知非线性系统,构建了基于神经网络的HJB方程近似求解器,并严格证明了在所设计的事件触发条件下,系统状态与批评家网络权重误差均为有界,且系统状态趋于原点[^3]。这表明,即便无法精确求解HJB方程,只要其近似解足够准确并结合适当的稳定性分析工具,依然可以实现期望的渐近稳定性能。

二、自适应动态规划框架下的HJB近似与稳定性保障

自适应动态编程(ADP)作为一种无需完整系统模型即可求解HJB方程的技术,近年来受到广泛关注。其核心思想在于通过迭代算法交替更新价值函数(value function)和控制策略,直至收敛至最优解。Sun与Sun(2021)在其研究中提出了一种适用于连续时间非线性系统的新型ADP算法,特别强调系统动态未知的情形[^4]。他们首先针对已知系统设计了一个基于HJB方程的交替迭代算法,并利用数学归纳法和单调有界收敛定理证明了该迭代过程的收敛性;随后,将此框架扩展至未知动态情形,借助基函数逼近法与牛顿-莱布尼茨公式重构系统动态,实现了仅依赖输入输出数据的在线控制策略更新。

他们在文中给出了严格的闭环系统稳定性证明:通过构造合适的Lyapunov函数,证明了在所提出的ADP算法作用下,系统状态渐近趋于零,同时神经网络权重误差保持有界。这一成果不仅展示了ADP在处理模型不确定性方面的潜力,也为HJB方程解的渐近稳定性提供了坚实的理论支撑。值得注意的是,该研究明确指出,HJB方程的近似解本身并不需要完全精确,只要其导出的控制律能使Lyapunov导数负定或半负定,即可保证稳定性。

Xiang等人(2025)进一步将ADP方法拓展至一类连续时间切换非线性系统,提出了事件触发的自适应动态规划算法,用于联合优化子系统切换序列与连续控制输入[^5]。在这种混合动态系统中,传统的HJB方程被推广为“切换HJB方程”(switched HJB equation),其解需同时考虑模式转移与连续演化的影响。作者采用单一批评家神经网络逼近整体最优代价函数,并设计事件触发机制决定何时更新控制策略与切换信号。通过Lyapunov方法分析,证明了闭环系统的稳定性,并进一步指出所设计的触发机制可有效避免Zeno现象——即无限频繁的切换行为——而无需设定最小驻留时间(minimum dwell time)。这一成果突破了以往许多切换系统控制方案必须强制限制切换频率的局限,增强了控制策略的实际可行性。

无论是在常规非线性系统还是更复杂的切换系统中,HJB方程的近似求解与渐近稳定性之间存在着深刻的内在联系:只要控制律的设计能够确保价值函数沿系统轨迹严格递减,即使该价值函数仅为真实最优代价的近似,系统亦可实现渐近稳定。这种“近似最优但稳定”的设计理念,正在成为现代智能控制的重要范式。

三、事件触发机制对HJB求解效率与稳定性的双重影响

在实际工程应用中,持续采样与控制更新会导致巨大的计算与通信资源消耗,特别是在嵌入式系统或无线传感器网络中。为此,事件触发控制(Event-Triggered Control, ETC)应运而生,其基本思想是仅当系统状态偏离预设阈值时才执行控制更新,从而减少不必要的操作。当ETC与ADP/HJB求解相结合时,便形成了所谓的“事件触发最优控制”(Event-Triggered Optimal Control)框架。

Liu等人(2022)的研究正是这一方向的代表性工作。他们针对具有输入饱和特性的未知非线性系统,提出了一种完全数据驱动的事件触发最优控制方案[^6]。该方法无需先验系统模型,仅依靠系统输入输出数据训练批评家神经网络以逼近HJB方程的解。事件触发机制基于当前状态与上次更新时刻状态之间的差异设计,只有当该差异超过某一自适应阈值时,才重新计算并更新控制律。通过构造复合Lyapunov函数,作者证明了在该机制下,系统状态与神经网络权重误差均保持一致最终有界,且系统状态最终收敛至原点邻域内。仿真结果验证了该方法的有效性与节能优势。

Xiang等人(2025)的工作同样采用了事件触发机制,但在切换系统背景下更具挑战性[^7]。他们的触发条件不仅决定了控制输入的更新时机,还影响着子系统的切换决策。尤为突出的是,他们通过巧妙设计触发函数,成功排除了Zeno行为的可能性,这是以往许多事件触发切换控制研究所未能彻底解决的问题。Zeno行为可能导致控制器在有限时间内发生无限次切换,严重威胁系统稳定性与硬件寿命。因此,能够在不施加人为驻留时间限制的前提下自然抑制Zeno现象,标志着事件触发HJB控制理论的重大进步。

事件触发机制虽然提高了能效,但也带来了新的稳定性挑战。由于控制律并非连续更新,系统可能存在较长的开环运行阶段,导致状态轨迹暂时偏离理想路径。因此,如何在节省资源的同时维持足够的稳定性裕度,成为设计的关键。现有研究表明,合理的触发阈值设计、引入预测补偿机制或结合模型预测控制(MPC)思想,可能是未来提升此类系统性能的有效途径。

四、输入约束与未知动态对HJB求解稳定性的影响

在实际控制系统中,执行机构的能力总是有限的,表现为控制输入的幅值或速率受限。这类输入约束若未在控制器设计中加以考虑,可能导致性能下降甚至系统失稳。Liu等人(2022)明确将输入约束纳入其HJB最优控制框架之中,通过引入修正的性能指标函数,使最优控制律天然具备抗饱和能力[^8]。具体而言,他们采用一种非二次型运行代价函数,使其隐含地反映输入约束的影响,从而引导HJB方程的解生成符合物理限制的控制指令。这种方法避免了传统抗饱和设计中常见的复杂补偿结构,简化了控制器实现。

系统动态的不确定性也是影响HJB求解与稳定性的重要因素。多数经典最优控制理论假设系统模型精确已知,但这在现实中往往不成立。Sun与Sun(2021)的工作正是针对这一问题展开[^9]。他们提出的方法无需预先辨识系统模型,而是直接利用输入输出数据通过基函数逼近与积分变换重构系统动态表达式,进而在ADP框架下求解HJB方程。该方法的关键优势在于,它将模型不确定性转化为可学习的参数误差,并通过在线学习机制逐步消除其影响。稳定性分析表明,只要神经网络具备足够的逼近能力且学习率适中,系统状态仍将渐近收敛。

相比之下,Xiang等人(2025)面对的是更为复杂的切换非线性系统,其子系统动态可能完全不同,且切换规律未知[^10]。在这种情况下,单一的HJB方程已不足以描述整个系统的最优行为,必须引入“切换HJB方程”概念。他们通过统一的批评家网络逼近整体代价函数,并结合事件触发机制协调切换与控制更新。实验结果显示,该方法不仅能有效学习最优混合控制策略,还能在存在建模误差和外部扰动的情况下保持良好的稳定性表现。

无论是输入约束还是模型不确定性,都对HJB方程的传统求解方式构成挑战。然而,通过引入鲁棒代价函数设计、数据驱动学习机制与自适应逼近技术,研究者们已经发展出一系列能够兼顾最优性与稳定性的新方法。这些进展表明,HJB框架具有较强的包容性和延展性,足以应对日益复杂的实际控制需求。

五、未来发展方向与开放问题

尽管当前关于HJB方程解的渐近稳定性研究已取得显著成果,但仍存在若干亟待解决的科学问题。首先,现有大多数ADP与事件触发方法均依赖于神经网络或其他函数逼近器,而逼近误差不可避免。目前主流做法是证明误差有界(UUB),但尚未能完全实现真正的渐近收敛至零。如何设计更高效的逼近架构(如深度神经网络、稀疏表示)或引入误差补偿机制,以缩小逼近误差对稳定性的影响,仍是值得探索的方向。

当前多数研究集中于单智能体系统,而对于多智能体协同系统中的分布式HJB求解与稳定性分析尚处于起步阶段。在多智能体环境中,每个个体需在局部信息基础上求解耦合的HJB方程,且需保证整体系统的协同稳定性。这涉及图论、博弈论与分布式优化等多个交叉领域,极具挑战性。

Zeno行为的排除虽已在部分研究中实现(如Xiang et al., 2025),但其通用性仍有待验证。特别是在高维非线性系统或多模式频繁切换场景下,如何设计既能高效触发又能绝对避免Zeno的机制,仍缺乏普适理论支持。

当前大多数研究成果停留在仿真验证层面,真正应用于工业设备(如航空发动机、机器人系统)的案例较少。Sun与Sun(2021)将其ADP方法应用于涡扇发动机燃料控制,展示了良好的应用前景[^11],但实际部署仍面临实时性、可靠性与安全性等多重考验。未来研究应更加注重从实验室走向工程实践,推动理论成果的转化落地。

总结

本文围绕“哈密顿-雅可比-贝尔曼方程解的渐近稳定性”这一主题,系统回顾了近年来在自适应动态规划、事件触发控制、输入约束处理与未知系统建模等方面的最新研究进展。研究表明,尽管HJB方程本身难以解析求解,但借助神经网络逼近、数据驱动学习与事件触发机制,可在无需完整模型的前提下实现对其解的有效近似,并通过Lyapunov稳定性理论严格证明闭环系统的状态渐近收敛性。

关键成果包括:(1)ADP方法能够在未知非线性系统中在线学习最优控制策略,并保证系统状态与网络权重的一致最终有界性;(2)事件触发机制显著降低了计算与通信负担,同时通过合理设计可避免Zeno行为,提升实用性;(3)输入约束可通过非二次型代价函数自然融入HJB框架,避免额外补偿结构;(4)切换系统的HJB推广形式已被提出,并初步实现了混合控制策略的学习与稳定控制。

当前研究仍面临逼近精度不足、多智能体扩展困难、Zeno行为普适性差以及工程应用薄弱等问题。未来的研究应致力于开发更高精度的函数逼近技术,探索分布式HJB求解框架,完善Zeno行为的理论判据,并加强在航空航天、智能制造等关键领域的实际验证。唯有如此,才能真正实现从“理论最优”到“工程可行”的跨越,推动最优控制理论迈向新的发展阶段。

作为研究者,笔者认为,HJB方程不仅是数学工具,更是连接控制理论与智能自主系统的桥梁。在未来的人工智能与自动化深度融合的趋势下,基于HJB的稳定性驱动学习范式有望成为下一代自主决策系统的核心引擎。

参考文献

[1] Liu, S., Niu, B., Zong, G., Zhao, X., & Xu, N. (2022). Data-driven-based event-triggered optimal control of unknown nonlinear systems with input constraints. Nonlinear Dynamics, 109, 891–909.

[2] Sun, T., & Sun, X. (2021). An Adaptive Dynamic Programming Scheme for Nonlinear Optimal Control With Unknown Dynamics and Its Application to Turbofan Engines. IEEE Transactions on Industrial Informatics, 17, 367–376.

[3] Xiang, Z., Li, P., & Zou, W. (2025). Event-Triggered Optimal Control for a Class of Continuous-Time Switched Nonlinear Systems. IEEE Transactions on Automation Science and Engineering, 22, 1620–1630.

[4] Akram, S., Ahmad, J., Rehman, S.-u., Sarwar, S., & Ali, A. (2023). Dynamics of soliton solutions in optical fibers modelled by perturbed nonlinear Schrödinger equation and stability analysis. Optical and Quantum Electronics, 55, 1–19.

[5] Islam, S. M. R., Arafat, S., Alotaibi, H., & Inc, M. (2024). Some optical soliton solution with bifurcation analysis of the paraxial nonlinear Schrödinger equation. Optical and Quantum Electronics, 56, 1–16.

以下文献为前5篇文献的引用 

[^1]: Sun & Sun, "An Adaptive Dynamic Programming Scheme," IEEE Transactions on Industrial Informatics, 2021.
[^2]: Liu et al., "Data-driven-based event-triggered optimal control," Nonlinear Dynamics, 2022.
[^3]: 同上。
[^4]: Sun & Sun, "An Adaptive Dynamic Programming Scheme," IEEE Transactions on Industrial Informatics, 2021.
[^5]: Xiang, Li, & Zou, "Event-Triggered Optimal Control," IEEE Transactions on Automation Science and Engineering, 2025.
[^6]: Liu et al., "Data-driven-based event-triggered optimal control," Nonlinear Dynamics, 2022.
[^7]: Xiang, Li, & Zou, "Event-Triggered Optimal Control," IEEE Transactions on Automation Science and Engineering, 2025.
[^8]: Liu et al., "Data-driven-based event-triggered optimal control," Nonlinear Dynamics, 2022.
[^9]: Sun & Sun, "An Adaptive Dynamic Programming Scheme," IEEE Transactions on Industrial Informatics, 2021.
[^10]: Xiang, Li, & Zou, "Event-Triggered Optimal Control," IEEE Transactions on Automation Science and Engineering, 2025.
[^11]: Sun & Sun, "An Adaptive Dynamic Programming Scheme," IEEE Transactions on Industrial Informatics, 2021.

Logo

中国智能体开发者社区,聚焦智能体与大模型开发,提供前沿资讯、实用工具链、开源项目及行业案例。通过技术沙龙、开发者大赛等活动,促进经验交流与协作,助力开发者快速构建创新智能应用。

更多推荐