Table of Contents
درک محدودیت های عملکرد DSP
پردازنده های سیگنال دیجیتال (DSPs) میکروپرسورهای تخصصی هستند که برای رسیدگی به وظایف پردازش سیگنال زمان واقعی طراحی شده اند – از برابر سازی صوتی و فشرده سازی تصویر تا اطلاع رسانی پرتو رادار، عملکرد آنها با ترکیبی از محدودیت های کار وابسته به معماری (به عنوان مثال، تعداد واحدهای اندازه گیری، پهنای باند حافظه، لوله کشی عمیق)، شرایط عملیاتی (ساعت، ولتاژ، و پیچیدگی های یادگیری مدرن، و یا رفتار گرافیکی، اغلب به طور مستقیم شامل می شود.
عوامل کلیدی که عملکرد DSP را تعریف می کنند
درک اینکه کدام فاکتورها عملکرد را محدود می کنند اولین گام در استفاده از ML است.
- حداکثر تعداد عملیات در ثانیه، محدود با نرخ ساعت و بهره وری خط لوله.
- تأخیر حافظه: Stalls ناشی از حافظه های حافظه از دست رفته یا خارج از حافظه، که می تواند به شدت عملکرد برای هسته های داده فشرده را کاهش دهد.
- ] قدرت و اتاق خواب حرارتی: DSPها اغلب تحت بودجه های قدرت سخت کار می کنند؛ بیش از نیروهای حرارتی یا خاموش شدن.
- موازین سطح دستورالعمل: [FLT 1] توانایی اجرای دستورالعمل های متعدد در هر چرخه توسط وابستگی داده ها و منابع سخت افزاری محدود است.
این عوامل به روش های پیچیده ای تعامل دارند، به عنوان مثال، یک کار که از بسیاری از دستورالعمل های موازی ضرب و شتم استفاده می کند ممکن است قبل از اینکه واحدهای محاسباتی را پر کنید، دیوار قدرت را به سمت خود ببرد. مدل های ML می توانند این تعاملات متقابل دامنه را به مراتب موثرتر از معادلات فرم بسته جذب کنند.
استفاده از یادگیری ماشین برای پیش بینی
روش های یادگیری ماشین به پیش بینی عملکرد DSP به طور معمول به دو دسته تقسیم می شود: رگرسیون تحت نظارت (پیش بینی ارزش مستمر مانند زمان اجرای یا مصرف برق) و طبقه بندی (پیش بینی اینکه آیا یک کار کاری از آستانه تجاوز می کند)
مجموعه داده ها: ساخت شرکت آموزشی
کیفیت پیش بینی ML به شدت به داده های آموزشی بستگی دارد. مهندسان باید تله عدم تقارن را از سخت افزار واقعی DSP یا شبیه ساز های چرخه ای ضبط کنند.
- محاسبه: مجموع چرخه های ساعت در هر کار یا هسته.
- [در این باره] [از دست می رود؛ [[۱] [۱] [۱]] [۱] [۱]]، L2، و حافظهٔ آخر از دست می رود.
- [در این باره]: [و] سوء استفاده از [مشرکان]: [[۱] [۱] [۱] [۱] [۱] [۱] [۱] [۱] بر روی خط لوله [بر روی] مجازات ها [برجبر] قرار گیرد.
- ] مصرف قدرت: ] قدرت پویا و استاتیک، اغلب از طریق سنسورهای قدرت تراشه.
- [[۱] [۱۰] [۱۰] [۱۰] [۱] [۱۰] [۱]] [[۱۰]]] [[۳]]] [[۳]]] [[۳]]] [[۳]]] [۱] [۱۰] [۳] [۱] [۳] [۳] [۱] [۳] [۳] [۳] [۲] [۳] [۳] [۳] [۳] [۳] [۵] [۳] [۵] [۳] [۳] [۵] [۳] [۳] [۵] [۵] [۳] [۳] [۳] [۳] [۵] [۳] [۳] [۳] [۳] [۳] [۳] [۳] [۳] [۳] [۳] [۳] [۳] [۳] [۳] [۳] [۳] [۳] [۳] [۳] [بر [۳] [۳] [بر [۳] [۳] [۳] [۳] [۳] [۳] [۳] [۲] [۳] [۳] [۳] [۵] [۳] [۳] [
- توصیف کنندگان: نوع الگوریتم (FIR، FFT، ماتریس ضرب)، اندازه داده ها و سطح ارز.
داده ها باید طیف گسترده ای از نقاط عملیاتی را پوشش دهند - فرکانس های مختلف، ولتاژها و دمای محیط - برای اطمینان از تعمیم مدل. معیارهای عمومی مانند Cortex-M] معیارهای کتابخانه یا EEC] CoreMark-Pro [F:3LT3 می تواند داده های اولیه را ارائه دهد.
مهندسی ویژگی: تبدیل تلهومتر خام به پیش بینی کنندگان
تلهومتری خام به ندرت به طور مستقیم استفاده می شود.ویژگی های مهندسی مواد مخدر که با محدودیت های عملکردی مرتبط است شامل:
- خلاصه های آماری: [FLT 1] به معنی، واریانس و درصد از الگوهای دسترسی به حافظه است.
- ویژگی های دامنه: FFT از ردیابی قدرت برای شناسایی رفتار حرارتی نوسانی.
- [[۱] [۱۰] [[۱۰]] [[۱۰]]] [[۱۰]]] [[۱۰]]] [[۳]]] [[۳]]] [[۳]]] [[۳]]] [۱] [۱] [۱۰]] [۱] [۱] [۱]] [۱] [۳] [۱] [۱] [۱] [۳] [۳] [۳] [۱] [۳] [۳] [۵] [۱] [۱] [۱] [۱] [۳] [۱] [۱] [۳] [۱] [۳] [۳] [۱] [۱] [۱]] [۳] [۳] [۳] [۳] [۳] [۳] [۱] [۳] [۳] [۳] [۱] [۳] [۳] [۳] [۳] [۳] [۳] [۳] [۳] [۳] [۱] [۱] [۱] [۳] [۳] [۳] [۳] [۳] [۳] [۳] [۳] [۳] [۳] [۳] [
- ویژگی های زمانی: تاریخ اخیر دما یا قدرت (پنجره)
استفاده از یا [[FLT1]]، [[FLT3]]، [[FLT3]]، [[SNE]]، ، [[رده:SNE]]، ، [[رده:SNED]] است.
آموزش مدل و اعتبار
چندین معماری ML برای پیش بینی عملکرد DSP مناسب هستند:
مدل های بازگشتی
[[۱] [۱۰] [[۱۰]] [[۱]]] [۱]] [۱]] [۱] [۱] [۱] [۱] [۱] [۱] [۱] [۱] [۱]] [۱] [۱] [۱] [۱۰] [۳] [۳] [۳] [۳] [۳] [۳] [۳] [۳] [براى [براى جمع آوری درختان تصمیم گیری و کنترل انواع داده های گوناگون، و استفاده از دستگاه های [۳] و استفاده از دستگاه های گوناگون، و استفاده از دستگاه های [۳]، و استفاده از انرژی های [۳] و استفاده می کنند.
شبکه های عصبی
برای مجموعه داده های بزرگ و بالا، شبکه های عصبی عمیق (DNNs) می توانند نقشه برداری های پیچیده را یاد بگیرند. لایه های کانولوتال می توانند تلهومتر زمان را پردازش کنند، در حالی که لایه های مکرر (LSTM) وابستگی های زمانی را جذب می کنند. یک معماری معمولی ممکن است یک شبکه پیش رو با سه لایه پنهان (۶،۸، ۶۴، نورون) با استفاده از فعال سازی ReLU و کاهش (out) برای منظم شدن منظم باشد.
استراتژی های معتبر
از [[رده:رده:]] استفاده کنید تا از [[FLT1]] استفاده کنید و به صورت عمومی سازی (FLT:2) استفاده کنید.
استفاده از ML برای بهبود عملکرد DSP
فراتر از پیش بینی منفعل، ML می تواند بهینه سازی فعال را انجام دهد. دو مسیر اصلی کنترل زمان واقعی و بهبود زمان طراحی هستند.
بهینه سازی زمان واقعی
با استفاده از یک مدل ML سبک به طور مستقیم به سیستم عامل DSP (یا یک coprocessor همراه) سازگاری زمان اجرا را امکان می دهد.این مدل به طور مداوم اتاق سر را بر اساس تلهومتر فعلی و تنظیم پارامترهای عملیاتی برآورد می کند.
ولتاژ پویا و مقیاس فرکانس (DVFS)
مدل رگرسیون پیش بینی مصرف انرژی با توجه به ویژگی های کاری می تواند جفت فرکانسی مطلوب را تصمیم بگیرد، به عنوان مثال، اگر مدل پیش بینی کند که یک کار در بودجه قدرت در فرکانس بالاتر باقی خواهد ماند، کنترل کننده DVFS می تواند عملکرد را افزایش دهد، در مقابل، اگر محدودیت های حرارتی نزدیک باشد، می تواند به طور پیشگیرانه کاهش یابد - اجتناب از تر شدن حرارتی که تأخیر را مختل می کند.
دانلود بازی Workload Scheduling and Migration
در SoC های ناهمگن، یک کلاس می تواند پیش بینی کند که کدام عنصر پردازش (به عنوان مثال، یک خوشه در مقابل یک GPU) با مهلت های کارآمد تر مطابقت خواهد داشت.برنامه نویس سپس به وظایف خود بر اساس آن مهاجرت می کند.این رویکرد در Google Tensor Processing Unit [F:1] و SoC تلفن همراه مانند Snapdragon برای تعادل و عملکرد استفاده می شود.
قابلیت دسترسی به Memory Access Orchestration
مدل های ML که الگوهای از دست دادن حافظه را پیش بینی می کنند می توانند دستورالعمل های پیش بینی شده یا دسترسی به حافظه را به کاهش غرفه ها منجر کنند.تحقیقات از IEEE Xplore نشان می دهد که شبکه های عصبی آموزش دیده در رد و نشات می توانند نرخ ها را تا 25 درصد کاهش دهند.
بهبود طراحی از طریق ML-Driven Insights
یادگیری ماشین همچنین پیشرفت های معماری را به اطلاع می رساند، با تجزیه و تحلیل اینکه چه کارهایی به طور معمول به یک محدودیت خاص نزدیک می شوند، طراحان می توانند علت ریشه را هدف قرار دهند.
بهبود مدیریت حرارتی
اگر مدل های ML نشان دهند که چگالی قدرت (W /mm2) تحت توالی های دستورالعمل خاصی بالا می رود، طراحان می توانند سنسورهای حرارتی محلی را اضافه کنند یا طبقه بندی را برای گسترش گرما تنظیم کنند. مطالعه موردی از [FLT 1] از گرادیان برای شناسایی نقاط حرارتی سطح دستورالعمل استفاده کرد، که منجر به کاهش 15٪ در دمای اوج از طریق تغییرات میکرواریک می شود.
معماری معماری اکتشاف
در مراحل اولیه طراحی، مدل های ML می توانند تاثیر عملکرد تغییر اندازه حافظه، عمق خط لوله یا تعداد ALUs را پیش بینی کنند.این کوتاه کردن حلقه اکتشاف فضایی طراحی است. معاملات ACM در معماری [FLT 1] یک مدل تصادفی برای نمونه که به دقت رتبه بندی 90٪ در پیکربندی میکروارکتاتور، شبیه سازی هفته ها صرفه جویی می کند.
سازگاری با Compilation
کامپایلرهای هدایت شده ML می توانند پرچم های بهینه سازی (بدون ثبت نام، برداراسیون) را بر اساس عملکرد پیش بینی شده انتخاب کنند. / {{FLT:1 چارچوب (یادگیری ماشینی گوگل) نشان می دهد که یادگیری تقویت می تواند اندازه کد را کاهش دهد و زمان را برای DSP های جاسازی شده اجرا کند.
چالش ها و بهترین تمرین ها
نصب ML DSP برای عملکرد غیر قابل تعویض است.مشکلات مشترک شامل:
- کیفیت داده ها: خواندن سنسور نوری یا برچسب های از دست رفته می تواند مدل های ضعیف را استفاده کند.
- تاخیر مدل: یک شبکه عصبی پیچیده ممکن است بیش از حد برای تصمیمات زمان واقعی معرفی کند.استفاده از مدل های اندازه گیری شده یا تقطیری (به عنوان مثال، TensorFlow Lite Micro) که در <100 μs در حالت های معمولی اجرا می شوند.
- ] تعمیم به کارهای ناشناخته: مدل های آموزش دیده در معیارهای مصنوعی ممکن است در داده های دنیای واقعی شکست بخورد، شامل کارهای مختلف (صدا، ویدئو، رادار) در مجموعه آموزش.
- حرکت اجباری: به عنوان سخت افزار سن و یا کار تکامل، تغییرات توزیع اساسی پیاده سازی یادگیری آنلاین و یا دوره آموزشی دوره ای.
اتخاذ یک چارچوب سیستماتیک: جمع آوری داده ها تحت آزمایش های کنترل شده، انجام انتخاب ویژگی (به عنوان مثال، استفاده از اطلاعات متقابل)، و به طور مداوم نظارت بر پیش بینی ML در برابر تله سخت افزار واقعی.
مسیر های آینده
همگرایی ML DSP و بهینه سازی سرعت دارد. روندهای نوظهور شامل:
- آموزش اجباری (RL): عوامل RLS که سیاست های DVFS را از طریق محاکمه و خطا یاد می گیرند، بهبود در طول زمان بدون مدل های صریح.
- یادگیری اجباری: آموزش ML در بسیاری از دستگاه های DSP (به عنوان مثال، در شبکه های IoT) در حالی که حفظ حریم خصوصی.
- AI قابل توضیح (XAI): با استفاده از SHAP یا LIME تفسیر که ویژگی های پیش بینی عملکرد را کاهش می دهد، کمک به طراحان انسانی.
- طراحی مشترک ML-DSP: آموزش مدل های ML که به طور همزمان قدرت، از طریقput و قابلیت اطمینان را بهینه سازی می کنند، منجر به پردازنده های خود-adapting می شود.
تحقیقات منتشر شده در طبیعت الکترونیک [FLT 1] نشان می دهد که شتاب دهنده های شبکه عصبی می توانند توسط ML بهینه سازی شوند و یک چرخه خوب ایجاد کنند.
نتیجه گیری
یادگیری ماشین از یک کنجکاوی نظری به یک ابزار عملی برای پیش بینی و بهبود محدودیت های عملکرد DSP بالغ شده است.با استفاده از داده های عملیاتی، مهندسان می توانند تنگناها را پیش بینی کنند، پارامترهای سیستم را در زمان واقعی تنظیم کنند و تصمیمات سخت افزاری را که شرح داده شده است، از جمع آوری داده ها و مهندسی ویژگی تا DVFS و اکتشاف معماری واقعی - ارائه یک نقشه راه حل برای ادغام ML به توسعه توسعه سیستم های محاسباتی مرکزی، به طور فزاینده ای کارآمد، به عنوان برنامه های پردازش سیگنال های کاربردی، به طور فزاینده ای کارآمد، به عنوان برنامه های کاربردی، برنامه های کاربردی، برنامه های کاربردی و تقاضا می دهد.