Table of Contents
درک خطای کلی سازی مورد انتظار یک مدل یادگیری ماشینی برای ارزیابی عملکرد آن در داده های ناشناخته ضروری است.این اندازه گیری می کند که چگونه مدل نقاط داده جدید را پیش بینی می کند و به انتخاب بهترین پیکربندی مدل کمک می کند.
خطای عمومی سازی چیست؟
خطای تعمیم تفاوت بین خطا در داده های آموزشی و خطا در داده های جدید و ناشناخته است، این نشان می دهد که چگونه مدل فراتر از داده هایی که در آن آموزش داده شده است، تعمیم می یابد.
روش های Calculate انتظار خطای عمومی سازی را دارد
چندین روش وجود دارد تا خطای عمومی سازی مورد انتظار، از جمله متقابل-validation، Boottrapping و محدودیت های نظری را تخمین بزند.هر رویکرد دارای مزایا و محدودیت های آن بسته به مجموعه داده ها و پیچیدگی مدل است.
استفاده از Cross-Validation
انتقال صلیب شامل تقسیم داده ها به زیرمجموعه های متعدد، آموزش مدل در برخی از زیرمجموعه ها و تست بر روی دیگران است. خطای متوسط در تمام آزمایشات برآورد خطای کلی سازی مدل را فراهم می کند.
برآورد با Bounds نظری
محدودیت های نظری، مانند مواردی که از نظریه VC یا پیچیدگی راماخر حاصل می شود، تخمین هایی را بر اساس ظرفیت مدل و اندازه داده های آموزشی ارائه می دهند.این محدودیت ها می توانند انتظارات را هدایت کنند اما ممکن است محافظه کارانه باشند.
- صلیب-validation
- بوت استرپی
- محدودیت های نظری
- روش هول کردن