基于动态规划的最优反馈控制数值算法及其收敛性

来源 :中国科学院数学与系统科学研究院 | 被引量 : 0次 | 上传用户:radicafrank
下载到本地 , 更方便阅读
声明 : 本文档内容版权归属内容提供方 , 如果您对本文有版权争议 , 可与客服联系进行内容授权或下架
论文部分内容阅读
本论文考虑一般的有穷维非线性控制系统的有限时区最优反馈控制的数值求解及收敛性问题。   寻找最优反馈是控制理论梦寐寻以求的目标。但是除去一般线性系统的LQ或LQS问题及其少量个别例子外,对一般非线性系统,最优控制问题的最优反馈律的解析求解几乎是不可能的。所以数值求解是唯一可能的且有实践意义的途径。理论上讲,Pontryagin极大值原理和Bellman动态规划原理是求解最优控制问题的两种有效的方法。然而目前的数值求解最优反馈律主要是基于Pontryagin极大值原理的多重打靶法。但这个方法有两个主要的问题,一是要猜测初值,二是求出的控制律是开环的。   本论文采取完全不同的途径,即以由Bellman动态规划导出的Hamilton-Jacobi-Bellman(HJB)方程的粘性解的数值解为基础来构造最优反馈控制数值解.HJB方程的解的存在性和唯一性由1980年代发展的粘性解理论所保证。即最优控制问题的值函数是相应的HJB方程的粘性解。进一步,为应对“维数灾难”问题,还设计了计算最优反馈控制的快速数值算法。   在第二章的前四节,给出了最优控制理论的一些基本概念和预备知识。在后两节则介绍了HJB方程的粘性解理论和数值求解问题。   在第三章,对一般的有穷维非线性系统的有限时区最优控制问题对应的HJB方程的粘性解,分别设计了时间离散格式和时间-空间离散格式,并证明了它们的收敛性。然后设计了一个数值求解粘性解的具体算法,并通过数值仿真实验验证了算法的有效性。   在第四章,对于同样的有穷维非线性系统的有限时区最优控制问题,基于第三章粘性解的离散逼近格式,分别构造了时间离散和时间。空间离散情形下的最优反馈控制函数,并证明了它们的收敛性。然后设计了一个求解最优反馈控制的具体数值算法,并通过数值仿真实验验证了算法的有效性。   在第五章,为应对“维数灾难”问题,对一般的有穷维非线性系统的有限时区最优控制问题,设计了一种快速计算最优反馈控制的数值算法。该算法极大的减少了计算量,数值仿真实验验证了该算法的快速性和有效性。最后一章给出本文的总结,同时提出了一些有待解决的问题。
其他文献
本文的目的是给出一种求解Fredholm第二型边界积分方程的超收敛算法。   边界积分方程来源于偏微分方程边值问题,它的数值解法一直是大家关注的一个焦点。鉴于积分算子的非
不等式在分析学中有着重要的应用,因而得到大量的研究。本文主要研究了Hilbert积分不等式和两类解析函数类的Fekete—Szego不等式。在第二章中,通过引入多个参数和β函数,得到一
本文主要研究Accrual Swap以及Callable Accrual Swap的定价,对于Accrual Swap,我们采用了对冲风险法以及LMM两种方法,对冲风险法将Accrual Swap拆分成一系列Floorlet的组合,利用
最优停止问题是与实际应用联系非常紧密的一类问题,这类问题广泛出现于经济、金融、运筹、统计决策等很多领域。在经典线性期望框架下,对这类问题的研究已经有六十多年的历史,其
本文主要研究分布参数系统最优控制理论的应用,包括在椭圆型方程的Lyapunov不等式、椭圆型方程解的存在性和四阶抛物型方程能控性方面的应用。   第一部分通过最优控制方法
在本文中,主要研究了两个方面的问题。研究的第一个方面是关于扩散需求情形下的生产容量、销售、定价和生产等决策问题.基于经典的Bass模型,考虑了两种情形:第一种情形足在Bass
本文的主要结果如下:   首先,当空间维数n=2时,从多体Schrodinger方程出发,推导了Gross-Pitaevskii级联。具体地说,在势函数V(x)的伸缩参数β满足0n/2,通过迭代(Duhamel-型展开
本文分为两部分:第一章为第一部分,在回顾了一些同调代数的知识后,给出了一族光滑代数簇的Hodge谱序列在E1处退化的一个充分条件以及与此相关的两个推论。第二章和第三章为第二
流体动力学方程(组)作为刻画物质运动的宏观模型,是我们认识与理解自然现象的一类重要的非线性偏微分方程.它一直占据数学物理界的核心研究领域.如:Boussi-nesq方程能够描述大气
这是一篇关于离散群的综述,着重从遍历论的角度描述了它的一些性质,以及它与测地流的关系。   对于离散群Γ,单位球面S上的Lebesgue测度ω,以及它在商空间Ω/Γ上诱导的测度M,