Table of Contents
モデルフリーの最適制御を理解する
モデリングフリーの最適な制御は、特に従来のモデルベースのアプローチが不足するダイナミックなシステムのために、制御工学のパラダイムシフトを表します。 自律的なドローン、構造のない環境でのロボット操作器、またはフレキシブルな製造セルなどのシステムでは、植物の動的の正確な数学モデルを取得することは、しばしば非現実的または不可能です。 モデリングフリーの方法は、相互作用データやリアルタイムのフィードバックから直接最適な制御ポリシーを学習することによって、このアドレスに対処します。 それらは、システムが魅力的でないと、それらを容易に変更するようなシステムを作ることが禁止されています。
モデルフリーコントロールのコア利点は、未知のダイナミックに適応する能力にあります。 事前に入力されたモデルに依存する代わりに、コントローラーは、状態のアクション空間を探索し、観察を使用してパフォーマンスを増大させます。 このデータ主導のアプローチは、現代のセンシングとコンピューティング機能とよく整列し、従来の制御理論のためにあまりにも複雑に考慮された設定でリアルタイムの最適化を可能にします。
モデリングフリー制御のコア技術
いくつかの異なる方法論は、モデルフリーの最適制御の傘下で落ちます。各々は、ユニークな強みとトレードオフを提供し、多くの場合、技術の選択は、システム、利用可能な計算リソース、および性能要件の性質に依存します。
強化学習
強化学習(RL)は、モデルフリー制御のための優勢なフレームワークとして登場しました。 RLでは、エージェントは、環境とやり取りし、報酬や罰則を受け、その行動を繰り返して最適なポリシーを学びます。 重要な考え方は、移行モデルを必要としない時間にわたる累積報酬を最大限に引き出すことです。 Q-ラーニング、ディープQ-Networks(DQN)、PPO(Proffic)などのアルゴリズムは、特に有効な行動を優先する機能として、より効果的に制御する機能が、より効率的な動作を最適化する機能として活用されています。
適応型動的プログラミング
適応型動的プログラミング(ADP)は、最適な値関数と制御ポリシーを正当化する手法のクラスです。ADP技術は、ニューラルネットワークやその他の関数の近似器を使用して、値関数とコントローラーを表現します。反復プロセスは、ポリシー評価(現在のポリシーに基づいて値関数を検証)とポリシーの改善(新しい値関数に基づいてポリシーを更新)を伴います。ADPはオンラインでまたはオフラインで実装することができ、パワーシステムで使用されており、ADPは、単一のネットワークとネットワークを介在する機能(ADP)、およびネットワークを介在する機能が、ネットワークを同一に使用していません。
進化するアルゴリズム
進化するアルゴリズム(EA)は、モデルフリーの最適化に人口ベースのアプローチを提供します。遺伝子アルゴリズム、差異的な進化、およびコワランス・マトリックス・アダプテーションの進化戦略(CMA-ES)などの技術は、世代を超えて候補のコントロールポリシーのセットを進化させました。各世代では、政策は、実際のシステムやシミュレータで評価され、次の世代を作成するために最良のパフォーマーが選ばれ、ミュートレーションされます。EAは、それらが、それらが、必要な機能や、または、必要な機能が、必要な機能が、必要な範囲で動作するかどうかを制限するものではありません。
実装課題と緩和戦略
ダイナミックなシステムでモデルフリー制御を組み込むことで、安全で安定した、効率的な運用を確保するために対処しなければならない課題を一式示しています。次のサブセクションでは、最もプレスの問題や、戦略研究者やエンジニアがそれらを克服するために使用する詳細な情報について説明します。
安定性と一貫性の問題
モデルフリーアルゴリズムは、特に学習フェーズ中に正式な安定性保証が欠如することが多いです。 動的システムでは、不安定なコントローラーは、壊滅的な障害を引き起こす可能性があります。 これを軽減するために、開業医は、堅牢な最適化(例えば、学習目的に堅牢性制約を加える)などの技術を使用して、Lyapunovベースの安定性を強化したり、実際のシステムにデプロイする前にドメインのランダム化とシミュレーションでトレーニングをしたりすることができます。 もう一つのアプローチは、安全な戦略を使用して、徐々に知識領域を拡張する安全な領域を、徐々に拡大する危険性を増加させるためのものです。
サンプル効率および調査
ダイナミックなシステムは、学習のために利用可能な相互作用の数を制限し、多くの場合、高速なタイムスケールで動作します。 モデルフリーの方法は、明らかにサンプル空腹です。 サンプルの効率を向上させるために、経験の再生(過去のトランジションをストリングし、それらを再利用)、モデルベースのウォームスターティング(近似モデルを使用して初期ポリシーを生成)、オフポリシー学習(異なるポリシーによって生成されたデータから学ぶ)が採用されます。 調査は、ほとんどの学習方法を使用して、または学習することができないモデルを使用して、または学習する動機を制限することができます。
リアルタイム計算制約
複雑なシステムや高周波制御ループでは、マイクロ秒内での推論が完了する必要があります。ソリューションには、ネットワークの実行、定量化、ハードウェアアクセラレーション(例えば、GPUやFPGAs)が含まれます。いくつかのアプリケーションでは、放射状基礎関数ネットワークやリニア関数の近似などの軽量アーキテクチャは、オンラインの事前調整を行うときに十分な機能を備えています。
高度なハイブリッドアプローチ
モデルベースのモデルとモデルフリーのメソッドの強みを組み合わせるために、研究者はハイブリッドアーキテクチャを開発しました。例えば、モデルベースのコンポーネントは、予備的な制御アクションを生成したり、短期予測のhorizonを提供することができます。モデルフリーのコンポーネントはモデルの不正確のために正しいか、予見しない障害を処理することを学習しています。別の一般的なハイブリッドは、モデルベースのポリシーを計画するための学習モデル(例えば、モデルベースのポリシー)の「モデルフリー」を使用するものですが、モデルが特に、モデルが学習されたモデルが、より高速なパフォーマンスを発揮するよりも、より効果的です。
機種自由最適制御の応用
モデルは、モデルフリーのアプローチの汎用性は、数多くの業界に採用されました。以下は、実際のアプリケーションの例を拡大しています。
自動車両とドローン
予測不可能なトラフィックで動作する自動車両、天候の変化、または荒地地形でのメリットは、モデルフリーコントロールから大幅に向上します。 RLアルゴリズムは、カメラ入力からエンドツーエンドの運転ポリシーを訓練するために使用され、車両は訓練中に明示的に遭遇しない状況を処理することを可能にします。 モデリングフリーコントロールを使用したQuadrotorsは、モデルの再較正なしで森林を飛行したり、ペイロードの変更を適応したりするなどの動的環境で敏捷性を実証しました。 研究者は、ADPを電気ブレーキングする車両を最適化するために使用しました。
構造化されていない環境でのロボティクス
ロボティックマニピュレーターは、未知のオブジェクト、可変的な条件のアセンブリ、または、不均一な地面使用モデルのない方法のロコモーションをリアルタイムで適応させるよう作業しました。進化するアルゴリズムは、レッジロボットの進化したガイトパターンで成功を収めていますが、RLは高次元タッチセンシングでデキステラスな操作を可能にします。産業用設定では、モデルフリー制御により、ロボットは、ツールの摩耗や形状の変化にもかかわらず、精度を維持することができます。
エネルギー・電力システム
スマートグリッドやマイクログリッドでは、再生可能エネルギーの生成と負荷の需要の動的性質は、モデルフリーの最適な制御を魅力的にします。 ADPのようなアルゴリズムは、バッテリーのストレージの管理、電力の流れの最適化、およびリアルタイムで周波数の安定化に応用されています。 風力タービンピッチ制御とHVACシステムの構築は、詳細な熱や空力モデルを必要としないエネルギー効率を向上させる、適応型モデルフリーの戦略から恩恵を受けることができます。
プロセス制御・化学工学
化学プロセスは、多くの場合、最初の原則からモデル化するのが難しい非線形、時間変動の動作を展示します。モデルフリー制御は、バッチリアクター温度制御、蒸留カラムの最適化、ポリマー品質管理に使用されます。これらのアプリケーションは、モデルフリーのメソッドの能力を活用して、プロセスデータから学習し、触媒の非アクティブ化やフィードストックの変動に適応します。
今後の方向性
モデルフリーの最適な制御の分野は急速に進化しています。 有望なアベニューは、モデルフリーの近似に堅牢な決定をするために、不確実性定量を統合し、オフラインと生涯適応のためのオンライン学習を組み合わせ、継続的な状態行動空間における安全と寛容性のための理論的な保証を開発することを含みます。 もう1つのフロンティアは、複数のコントローラーが相互作用し、調整された動作を学習し、より適切なモデルを継続する能力モデルを向上させるためのモデルフリー制御システムのモデルフリー制御の使用です。 より多くのツールは、より適切なモデルをアップグレードする能力を向上させるためのモデルを拡張します。
さらなる読み方については、モデルフリーコントロールのWikipediaの概観、]]を参照してください。ドローン制御のための強化学習に関する研究、および[]]])を適応動的プログラミング技術の調査。