Table of Contents
ارزیابی عملکرد مدل های یادگیری عمیق برای درک اثربخشی و قابلیت اطمینان آنها ضروری است. روش های Quantitative معیارهای عینی را ارائه می دهند که به مقایسه مدل ها و بهینه سازی عملکرد آنها برای کارهای خاص کمک می کند.
معیارهای عملکرد مشترک
چندین معیار برای ارزیابی مدل های یادگیری عمیق، به ویژه در طبقه بندی و وظایف عقب مانده استفاده می شود.این معیارها نشان می دهد که یک مدل چگونه پیش بینی می کند یا متناسب با داده ها است.
ارزیابی متریک ها برای طبقه بندی
برای وظایف طبقه بندی، معیارهای مشترک شامل دقت، دقت، یادآوری و نمره F1 است که این معیارها جنبه های مختلف توانایی پیش بینی مدل را ارزیابی می کنند.
دقت دقیق
دقت نسبت پیش بینی های صحیح را از پیش بینی های کلی اندازه گیری می کند، این زمانی مفید است که کلاس ها متعادل هستند.
دقت و یادآوری
دقت نشان دهنده نسبت پیش بینی های مثبت واقعی در میان تمام پیش بینی های مثبت است، در حالی که یادآوری نسبت مثبت واقعی را به درستی شناسایی می کند.
F1 امتیاز
نمره F1 دقت و یادآوری را در یک متریک واحد ترکیب می کند و یک اندازه متعادل را به ویژه هنگامی که کلاس ها بی تعادل هستند، ارائه می دهد.
ارزیابی متریک برای بازگشت
مدل های بازگشتی با استفاده از معیارهایی که تفاوت بین مقادیر پیش بینی شده و واقعی را اندازه گیری می کنند، ارزیابی می شوند.معیارهای مشترک شامل خطای مطلق (MAE)، به معنی خطای مربع (MSE) و R-squared است.
خطای مطلق (MAE)
MAE میانگین تفاوت مطلق بین مقادیر پیش بینی شده و واقعی را محاسبه می کند که نشان دهنده خطای پیش بینی متوسط است.
خطای Squared Error (MSE)
MSE میانگین تفاوت مربعی را اندازه گیری می کند، خطاهای بزرگتر را به شدت از MAE محاسبه می کند.
R-squared
R-squared نشان دهنده نسبت تفاوت در داده های توضیح داده شده توسط مدل است، با ارزش های نزدیک به 1 نشان دهنده تناسب بهتر است.
تکنیک های اعتباربخشی صلیب
روش های عبور-validation، مانند k-fold cross-validation، کمک به ارزیابی توانایی کلی سازی مدل ها با پارتیشن بندی داده ها به آموزش و تست، چندین بار است.
این رویکرد بیش از حد کاهش می یابد و برآورد قابل اعتمادتری از عملکرد مدل در زیرمجموعه های مختلف داده ارائه می دهد.