Table of Contents
خوشه سازی یک تکنیک رایج در یادگیری بدون نظارت است که برای گروه بندی نقاط داده مشابه استفاده می شود. ارزیابی کیفیت این خوشه ها برای اطمینان از بینش های معنی دار ضروری است. معیارهای خوشه بندی اقدامات کمی برای ارزیابی اینکه چگونه به خوبی الگوریتم انجام شده است.
معیارهای خوشه ای مشترک
چندین معیار برای ارزیابی نتایج خوشه ای استفاده می شود. محبوب ترین آنها عبارتند از:
- [[۱] [۱۰] [۱۰] [۱۰] [۱۰] [۱۰] [۱]] [۳]]: اندازه گیری کنید که چگونه یک جسم مشابه با خوشه های دیگر است.
- شاخص بوندین [FLT 1]: میانگین شباهت بین هر خوشه و مشابه ترین آن را ارزیابی کنید.
- [[ویرایش] [۱] [۱۰] [۱۰] [۱] [۱۰] [۱] [۱۰] [۱] [۱] [۱] [۱]]: [۱] نسبت بین پراکنده شدن ذرات به پراکندگی درون ذرات را بیان کنید.
محاسبه متریک ها
اکثر کتابخانه های خوشه ای توابعی برای محاسبه این معیارها ارائه می دهند، به عنوان مثال، در کتابخانه علمی تخیلی پایتون، می توانید از آن استفاده کنید:
[[ویرایش] [[[۱]] [۱۰] [۱۰] [۱۰]] [[۱۰]]] [[۱۰]]] [۱۰] [۱۰]] [۱۰]] [۱۰] [۳] و calinski harabasz-score [۳]
این توابع نیاز به نقاط داده و برچسب های خوشه ای اختصاص داده شده خود را به عنوان ورودی پردازش مناسب و عادی سازی داده ها بهبود قابلیت اطمینان از معیارها.
نتایج تفسیر
نمرات بالاتر silhouette نشان دهنده خوشه های به خوبی تعریف شده است، در حالی که نمرات پایین تر نشان می دهد همپوشانی یا گروه های ضعیف جدا شده است.برای شاخص دیویس-Bouldin، مقادیر پایین بهتر است، نشان دادن خوشه های متمایز است. شاخص Calinski-Harabasz امتیاز بالاتر، منعکس کننده ساختار خوشه ای بهتر است.