ارزیابی عملکرد مدل های یادگیری ماشین برای تعیین اثربخشی آنها در برنامه های دنیای واقعی ضروری است.معیارها و محاسبات مناسب به درک اینکه چگونه یک مدل نتایج را پیش بینی می کند و در چه زمانی پیشرفت ها لازم است کمک می کند.

معیارهای عملکرد مشترک

چندین معیار برای ارزیابی عملکرد مدل، بسته به نوع مشکل مورد استفاده قرار می گیرد.برای وظایف طبقه بندی، دقت، یادآوری و نمره F1 معمولاً مورد استفاده قرار می گیرد.

معیار های محاسبه

متریک ها بر اساس پیش بینی های مدل و نتایج واقعی محاسبه می شوند.به عنوان مثال، دقت نسبت پیش بینی های صحیح به پیش بینی های کلی است. Precision نسبت مثبت واقعی در میان مثبت های پیش بینی شده را اندازه گیری می کند، در حالی که یادآوری نشان می دهد که نسبت مثبت واقعی شناسایی شده در میان تمام مثبت های واقعی است.

معیارهای بازگشت مانند MAE میانگین تفاوت مطلق بین مقادیر پیش بینی شده و واقعی را محاسبه می کنند، و بینش را در مورد خطاهای پیش بینی ارائه می دهند. R-squared نشان دهنده نسبت تفاوت های توضیح داده شده توسط مدل است.

نتایج تفسیر در عمل

معیارهای تفسیر شامل درک زمینه مشکل است. دقت بالا ممکن است گمراه کننده در مجموعه داده های عدم تعادل باشد، جایی که معیارهای دیگر مانند دقت و یادآوری بینش های بهتری را برای رگرسیون ارائه می دهند، مقادیر MAE پایین و MSE عملکرد بهتری را نشان می دهند، در حالی که مقادیر بالاتر R-square یک مدل دقیق تر را پیشنهاد می دهند.

ملاحظات اضافی

  • کیفیت داده ها و پیش پردازش
  • بیش از حد و کمتر
  • پیچیدگی مدل
  • تکنیک های معتبر