Table of Contents
DSPパフォーマンスの限界を理解する
デジタル信号プロセッサ(DSP)は、オーディオの均等化と画像圧縮からレーダービームフォーミングまで、リアルタイム信号処理タスクを処理するように設計された、特殊なマイクロプロセッサです。 それらのパフォーマンスは、アーキテクチャの制約(例えば、マルチプライ補正ユニットの数、メモリ帯域幅、パイプライン深さ)、動作条件(クロック周波数、電圧、温度)、およびワークロード特性(データレート、アルゴリズム複雑さ、並列)の組み合わせによって拘束されます。 従来の分析モデルまたは最悪の推定は、Dnuerの動作が、多くの場合、動的データが異なる動作条件を把握する場合には、Dnuerは、動的に変化します。
DSPパフォーマンス境界を定義する主な要因
どの要因が制約性能がMLを適用する最初のステップであるのかを理解する。 主な制限は次のとおりです。
- [] の の の の の の の の の の の の の の の の の の の の の の の の の の の の の の の の の の の の の の の の の の の の の の の の の の の の の の の の の の の の の の の の の の の の の の の の の の の の の の の の の の の の の の の の の の の の の の の の の の の の の の の の の の の の の の の の の の の の の の の の の の の
- [メモリーレイテンシー:[]] キャッシュミスや外部メモリアクセスによるストール。これにより、データ・インテンシブカーネルのパフォーマンスが厳しく劣化します。
- []力と熱のヘッドルーム:[] DSPは、多くの場合、厳格な電力予算で動作します。 熱限界を超えると、力が回転またはシャットダウンします。
- ]指示レベルの並列:[)サイクルごとの複数の指示を実行する機能は、データ依存とハードウェアリソースによって制約されます。
これらの要因は複雑な方法で相互作用します。例えば、多くの並列マルチプライ-精度の指示を使用するワークロードは、算数単位を飽和させる前に、電力の壁に当たる可能性があります。MLモデルは、これらのクロスドメイン相互作用をクローズフォームの式よりもはるかに効果的にキャプチャすることができます。
予測のための機械学習を適用
マシン学習は、DSP のパフォーマンス予測には通常、2 つのカテゴリに分類されます。 監督された回帰(実行時間や消費電力などの連続値予測)と分類(ワークロードが閾値を超えるかどうかを予測)。 コアワークフローは、データ収集、機能工学、モデル選択、検証を含みます。
データ収集:トレーニングコーパスの構築
ML 予測の品質は、トレーニングデータに大きく依存します。 エンジニアは、実際の DSP ハードウェアまたはサイクル ‐ 正確なシミュレータからテレメトリーをキャプチャする必要があります。 必須メトリックは次のとおりです。
- サイクルカウント:]タスクまたはカーネルごとの全クロックサイクル。
- キャッシュが欠落:] L1、L2、および最後のレベルのキャッシュが欠落します。
- ブランチの誤り:[パイプラインのフラッシュペナルティへの影響。
- []パワー消費量:] 動的な、静的電力、多くの場合、オンチップパワーセンサーを介して。
- [温度:]] 熱ダイオードによって測定される接合温度。
- ワークロード記述子:[] アルゴリズムタイプ(FIR、FFT、行列の乗算)、データサイズ、および並列レベル。
データは、モデルが一般化されるように、さまざまな動作点(異なる周波数、電圧、周囲温度)をカバーする必要があります。[Cortex-M DSPライブラリベンチマーク[または[]])などのパブリックベンチマークは、初期データセットを提供することができます。
機能工学: 生のテレメトリーを予測者に変革する
生のテレメトリーは、直接使用されていません。 機能工学は、パフォーマンス制限と相関する差別的な属性を抽出します。 一般的な機能は次のとおりです。
- [ 統計的要約:[ メモリアクセスパターンの平均、分散、およびパーセンシー。
- 周波数ドメイン機能:[振動熱動作を識別するためのパワートレースのFFT。
- ] ワークロード構成:] 複数重精度の比率は、読み込み/ストアの指示に。
- [] 温度特性:[]] 最近の温度または電力(スライドウィンドウ)の歴史。
]オートエンコーダ[または]t-DistributedStochastic Neighbor Embedding(t-SNE)[を使用して自動機能抽出物が構造を事前保存しながら寸法を減らすために使用することができます。
モデル トレーニングと検証
DSP性能予測には、いくつかのMLアーキテクチャが適しています。
回帰モデル
[Linear回帰]は、ベースラインを提供しますが、非線形相互作用をキャプチャできません。 ]]Random Forestsは、決定の木を組み立て、混合されたデータ型を処理することで、より良い精度を提供します。 Gradientブースティングマシン]]](例:XGBoost、LightGBM)は、その高い能力を予測するために広く使用されています。
神経ネットワーク
大規模で高次元のデータセットでは、深いニューラルネットワーク(DNN)は複雑なマッピングを学ぶことができます。 複雑なレイヤーは、再発レイヤー(LSTM)が一時的な依存性をキャプチャしながら、タイム・ドメイン・テレメトリーを処理できます。 典型的なアーキテクチャは、ReLUの活性化とドロップアウト(0.2)を使用して、3つの隠しレイヤー(256、128、64ニューロン)を備えたフィードフォワードネットワークであるかもしれません。
検証戦略
正規化を評価するために[[k-fold 交差validation[(k=5または10)を使用します。 メトリックには、[]]の実行時間の予測と[]の実行時の絶対エラー(MAE)が含まれている。 バイナリ分類(安全対限界を超えた)の)。 早期の検証を監視し、早期に使用を中止することにより、過度を回避します。
DSP 性能を改善する ML を使用して
パッシブ予測を超えて、MLはアクティブ最適化を駆動することができます。 2つの主要なアベニューは、リアルタイム制御と設計-時間改善です。
リアルタイム最適化
DSPファームウェア(またはコンパニオンコプロセッサ)に直接軽量MLモデルを埋め込むことで、ランタイムアダプテーションが実現します。このモデルは、現在テレメトリーに基づいてヘッドルームを継続的に推定し、動作パラメータを調整します。
動的電圧および頻度スケーリング(DVFS)
ワークロード特性を与えられた電力消費を予測する回帰モデルは、最適な電圧周波数ペアを決定することができます。例えば、モデルがワークロードがより高い周波数で電力予算内で滞在することを予測した場合、DVFSコントローラは、パフォーマンスを向上させることができます。逆に、熱限界が近い場合は、それは潜在的にスケールダウンすることができます - レイテンシを傷つける熱回転。
ワークロードスケジューリングとマイグレーション
同種では、クラスタは、処理要素(例えば、DSPクラスターとGPU)が最も効率的に期限を満たしているかを予測することができます。スケジューラは、それに応じてタスクを移行します。このアプローチは、Googleの]で使用されます。テザー処理ユニット]]と、Qualcomm SnapdragonのようなモバイルSoCは、電力とパフォーマンスのバランスをとります。
メモリアクセスオーケストレーション
キャッシュミスパターンを予測するMLモデルは、プリセットの指示や、ステージを削減するためのメモリアクセスを再スケジュールすることができます。 []からの研究]IEEE Xploreは、キャッシュトレースで訓練されたニューラルネットワークが最大25%のミス率を減らすことができることを示しています。
ML-Driven Insightsによる設計改善
マシン学習は、建築の拡張を通知します。 ワークロードが特定の限界に定期的にアプローチする分析によって、デザイナーは根本原因をターゲットにすることができます。
熱経営の強化
MLモデルが特定の命令順序の下の力密度(W/mm2)のスパイクを明らかにした場合、デザイナーは局所的な熱センサーを加えるか、または床計画を熱を広げるために調節できます。[arXiv[]からのケーススタディは、指示レベルの熱ホットスポットを識別するために勾配ブーストを使用していました。マイクロアーキテクチャの修正を通してピーク温度の15%の減少につながります。
建築調査
初期設計段階では、MLモデルは、キャッシュサイズ、パイプラインの深さ、またはALUsの数値を変更する性能の影響を予測することができます。これにより、設計-スペース探索ループが短縮されます。例えば、アーキテクチャ[ACMトランザクション]]]では、90%の精度を達成したランダムな-最も近いモデルが、DSPマイクロアーキテクチャ構成の短縮、シミュレーションの週の節約を説明します。
適応的な編集
ML-guidedコンパイラは、予測されたパフォーマンスに基づいて最適化フラグ(ループアンロール、ベクター化)を選択することができます。 []MLGOフレームワーク(Googleの機械学習ガイド最適化)は、強化学習が埋め込まれたDSPのコードサイズとランタイムを減らすことができることを実証します。
チャレンジとベストプラクティス
DSP 性能の ML の展開は非trivial です。一般的な下落は以下を含みます。
- データ品質:]] ノイズセンサー読み取りや欠落ラベルはモデルを劣化させる可能性があります。 堅牢な統計フィルタリングを使用して、地上の真実が同期されていることを確認します。
- モデルレイテンシ: 複雑なニューラルネットワークは、リアルタイムの決定のためにあまりオーバーヘッドを導入するかもしれません。典型的なDSP上で<100 μsで実行される定量化されたモデルまたは蒸留モデル(例えば、TensorFlow Lite Micro)を使用してください。
- [] 連載中のワークロードへの一般化:[[] 合成ベンチマークで訓練されたモデルは、実際のデータに失敗する可能性があります。 トレーニングセットで、多様なワークロード(ボイス、ビデオ、レーダー)を含める。
- ]漂流:を受け入れる]]。ハードウェアの年齢やワークロードが進化するにつれて、根本的な分布が変化します。オンライン学習または定期的な再訓練を実施します。
体系的なフレームワークを採用: 制御された実験の下でデータを収集し、機能選択を実行します(例えば、相互情報を使用して)、そして継続的に実際のハードウェアテレメトリーに対するML予測を監視します。
今後の方向性
MLとDSPの最適化のコンバージェンスが加速されます。 新興トレンドには以下が含まれます。
- 強化学習(RL):[ 実験とエラーでDVFSポリシーを学ぶRLエージェント、明示的なモデルなしで時間をかけて改善します。
- 学習をフェデレーション:[]] ML トレーニングを分散し、プライバシーを保護しながら、多くの DSP デバイス(例えば、IoT ネットワーク)を横断する。
- [ 説明可能なAI(XAI):[ SHAPまたはLIMEを使用して、ドライブのパフォーマンス制限予測、人的デザイナーを割り当てる機能が解釈されます。
- [ ジョイント ML-DSP 共同設計:[[] パワー、スループット、信頼性を同時に最適化し、セルフアダプト処理プロセッサにつながります。
に公開されたNature Electronics は、ニューラルネットワークアクセラレータ自身がMLによって最適化され、激しいサイクルを生成することができることを示しています。
コンテンツ
マシンラーニングは理論的好奇心から、DSP性能限界を予測し改善するための実用的なツールに成熟しました。 運用データを活用することで、エンジニアはボトルネックを予測し、リアルタイムでシステムパラメータを調整し、ハードウェア設計の決定を通知することができます。 記述された技術は、データ収集と機能工学からリアルタイムのDVFSおよびアーキテクチャ探査まで、DSP開発ライフサイクルにMLを統合するためのロードマップを生成します。 エッジコンピューティングとAI主導のアプリケーションが、DSPを効率的に処理する役割をさらに高めます。 DMLは、DSPの集中的に動作する役割を増加させます。