درک بیش از حد و کمتر مناسب برای ارزیابی مدل های یادگیری ماشین ضروری است.این مفاهیم به تعیین اینکه چگونه یک مدل به داده های دیده نشده تعمیم می یابد کمک می کند. Calculation معیارهای مربوطه بینش هایی را در مورد عملکرد مدل و بهبود راهنماها فراهم می کند.

بیش از حد متریک

Overfit زمانی اتفاق می افتد که یک مدل به خوبی در داده های آموزشی عمل کند اما در داده های جدید ضعیف است.

  • [در برابر این آیات، آیات و روایات و روایات، آیات و روایات و روایات و روایات، صیحه و إلاع و إنَّهُمْهُمْهُمُوَهُمْهُمُوا وَاًاًاًاًاًاًاًاًاًاًاًاًاً]: «وَنْکَلَلَلَهُوا بِنْکَهُوَهُوا بِنْکَهُوا بِنْرَهُوا بِنْرَهُوَهُوْمْمْکَهُوْکَهُوْکَهُوَهُوَهُوْدْهُوَهُوَهُوَهُوْمْدْدْدْدْدْدْدْرَهُوَهُوَهُوَهُوَهُوَهُوَهُوَهُوَهُوَهُوَهُو
  • اندازه گیری پیچیدگی: [FLT 1] مانند تعداد پارامترهای نسبت به نقاط داده.
  • امتیاز معتبر: امتیاز آموزش عالی در مقایسه با نمرات اعتباری بیش از حد پیشنهاد می کند.

زیرمجموعه های

کمبود زمانی اتفاق می افتد که یک مدل برای گرفتن الگوهای داده های اساسی بسیار ساده باشد. متریک هایی که دارای قابلیت های زیر هستند عبارتند از:

  • خطای بالا در هر دو آموزش و اعتبار سنجی تنظیم می شود: تشخیص می دهد که مدل بسیار ساده است.
  • پیچیدگی مدل پایین: [FLT 1]، مانند تعداد کمی از ویژگی ها یا پارامترهای.
  • عملکرد ضعیف و ضعیف را در اختیار دارد؛ [FLT 1] در سراسر آموزش و داده های اعتباری.

معیار های محاسبه

معیارهای رایج مورد استفاده شامل دقت، دقت، یادآوری و نمره F1 برای ارزیابی بیش از حد یا کمتر مناسب، مقایسه این معیارها در سراسر آموزش و داده های اعتبار سنجی است.یک دیسک قابل توجه بیش از حد مناسب را نشان می دهد، در حالی که نمرات به طور یکنواخت پایین نشان می دهد که کمتر از حد.

استفاده از کیفیت متقابل کمک می کند تا در ارزیابی ثبات مدل کمک کند. محاسبه میانگین عملکرد در چندین لایه برآورد قابل اعتماد تری از چگونگی عملکرد مدل بر روی داده های ناشناخته فراهم می کند.