Table of Contents
理解模式-自由优化控制
模型无极控制代表了控制工程的范式转变,特别是对于传统模型方法不足的高度动态系统而言。 在自主无人机、非结构环境中的机器人操纵器或灵活的制造电池等系统中,获得精确的植物动力学模型往往不切实际或不可能。 模型无极方法通过直接从交互数据或实时反馈中学习优化控制政策来解决这一问题,而不需要明确的系统模型。 这使它们对系统参数迅速变化、非线性占主导地位或系统识别成本过高的应用具有很高的吸引力。
模型自由控制的核心优势在于它有能力适应未知动态。 控制者不依靠预先计算过的模型,而是探索状态-动作空间,并使用观测来逐步提高性能。 这种数据驱动的方法与现代感知和计算能力非常一致,使得在以前被认为过于复杂的环境中能够实时优化传统控制理论。
模型自由控制的核心技术
几种不同的方法都属于无模型最佳控制的范围。 每一种方法都提供了独特的优势和权衡,技术的选择往往取决于系统的性质、可用的计算资源和性能要求。
加强学习
强化学习(RL)已经作为无模型控制的主要框架出现. RL中,代理者通过与环境反复互动学习最佳政策,获得对其行为的奖惩. 关键思想是随着时间的推移而最大限度地增加累积奖励,而不需要过渡模型. RL是典型的,如Q学习,深Q网络(DQN)等算法,以及PPO(Procial Policy Optimization)等政策梯度方法被成功应用于持续控制任务. 对于高度动态的系统,演员批评架构特别有效:行为者修改控制法,而评论者则估计值功能,引导演员向更优化的行为方向发展. RL是自然界的样本效率低下,但模拟培训和转移学习的进步正在减轻这一局限性.
适应性动态编程
适应动态编程(ADP)是一类方法,可以迭代地接近最佳值函数和控制政策. ADP技术通常使用神经网络或其他函数近似器来代表值函数和控制器. 迭代过程涉及政策评价(根据当前政策更新值函数)和政策改进(根据新的值函数更新政策). ADP可以在线或离线执行,并且已经在动力系统,航空航天,机器人中被使用. 一个显著的变体是热动态编程(HDP)方法,它使用单一的评测网络和演员网络来达到近乎最佳的性能,而无需明确的系统识别.
演化算法
进化算法(EAS)提供了一种基于人群的模型优化方法。基因算法、差异演化和共变矩阵适应演化策略(CMA-ES)等技术会逐步形成一套代代相传的候选控制政策。每代人都会对政策进行真实系统或模拟器的评价,并选择和变异最佳的操作者来创造下一代。 进化算法是直接执行的,不需要梯度,使其适合具有不连续动态或非流畅成本功能的系统。 虽然在高维度问题中通常比RL慢,但在成本环境崎岖或全球搜索保障重要的情况下,它们却表现优异。
执行挑战和缓解战略
在高度动态的系统中部署无模型控制,是一系列挑战,必须应对这些挑战以确保安全、稳定和高效的运作。 以下各小节详细介绍了最紧迫的问题以及研究人员和工程师为克服这些问题而使用的战略。
稳定和趋同问题
无模型算法通常缺乏形式稳定性的保证,特别是在学习阶段。 在动态系统中,不稳定的控制器可能造成灾难性的失败。 为了缓解这种情况,从业者使用强优化(比如在学习目标上增加强性约束 ) , 使用基于利亚普诺夫的方法强制稳定,或在部署在真系统之前进行域随机化模拟培训。 另一种方法是使用安全探索策略,将行动空间限制在已知的安全区域,随着知识的积累而逐渐扩展。
采样效率和勘探
高度动态的系统往往在快速的时间尺度上运行,限制了可供学习的相互作用。 模式性方法的样本性令人臭名昭著。 为了提高样本效率,可以采用基于模式的温暖启动(使用一个大致模型来产生初步政策 ) , 以及政策外学习(从不同政策产生的数据中学习 ) 。 探索还可以通过内在动机信号或学习一系列模型来量化不确定性,并驱动最需要的地方的探索。
实时计算限制
模型无算法的计算需求 — — 特别是使用深神经网络的算法 — — 可能很重。在嵌入式系统或高频控制循环中,推断必须在微秒内完成。 解决方案包括网络推算、定量化和硬件加速(例如使用GPU或FPGA ) 。 对于一些应用来说,光线基础函数网络或线性函数近似器等轻量级架构在满足实时最后期限的同时,足以实现良好的性能。离线计算(培训)与在线调整是另一种权衡:有些系统可以在模拟中预先调整政策,然后在最小在线调整中微调。
高级混合办法
为了结合模型和无模型方法的优点,研究人员开发了混合结构,例如,模型组件可以产生初步的控制动作或提供短期的预测视野,而无模型组件则学习纠正模型不准确或处理意外扰动. 另一种流行的混合方式是“无模型”使用从数据中学习到的学习模型(例如,模型政策优化),但控制器优化则进行无样本操作,这些方法往往比纯粹无模型方法更能产生更快的学习和更好的最终性能,特别是在系统动态部分为人所知的情况下.
模型自由优化控制软件的应用
无模式方法的多用途性导致在众多行业采用这些方法,以下是实际世界应用的扩展实例。
自动车辆和无人驾驶飞机
在不可预测的交通,变化的天气,或粗糙地形上运行的自主车辆,从模型无阻控制中大有裨益. RL算法被用于从相机输入中训练端到端的驾驶政策,使车辆能够处理在训练中未明确遇到的情况. 采用模型无阻控制的四方在动态环境中表现出敏捷性,如飞过森林或适应有效载荷变化而无需模型无阻调整. 研究人员还利用ADP通过学习高效加速和制动模式来优化电动车辆的能量消耗.
结构化环境中的机器人
机器人操纵器的任务是抓住未知物体,在可变条件下组装,或者在不均匀的地面上运动,实时使用无模型方法进行适应. 演化算法在腿机器人的进化步态模式上找到了成功,而RL则通过高维触感感来进行可解的操纵. 在工业环境中,无模型控制允许机器人保持精度,尽管工具磨损或部分几何变化.
能源和电力系统
在智能电网和微网格中,可再生发电和负载需求的动态性质使得无模型最佳控制具有吸引力. ADP等算法被应用来管理电池存储,优化电流,实时稳定频率. 风涡轮的波波控制以及建造HVAC系统也得益于适应性的无模型策略,这些策略可以提高能效,而不需要详细的热力或空气动力模型.
工艺控制和化学工程
化学过程往往表现出非线性、时间变化的行为,很难从第一原理中建模。 模型自由控制被用于批量反应堆温度控制、蒸馏柱优化和聚合物质量控制。 这些应用利用了模型自由方法的能力,从过程数据中学习,并适应催化剂的去功能或原料变化。
未来方向
模型无源最佳控制领域正在迅速发展。 充满希望的途径包括整合不确定性量化,做出强有力的决定,实现模型无源近似,将离线和在线学习结合起来,以进行终身适应,并为连续状态-行动空间的安全性和趋同性制定理论保障。 另一个前沿是多代理系统使用模型无源控制,在多代理系统中,多个控制器交互,必须学习协调行为,而无需沟通明确的模型。 随着计算力的不断增长和算法的不断提高,模型无源最佳控制很可能成为控制工程师工具箱中的标准工具。
进一步读取,参见维基百科关于无模式控制[的概述,一篇关于无人机控制强化学习的研究文章,以及对适应性动态编程技术的调查.