الگوریتم های خوشه ای به طور گسترده ای در تجزیه و تحلیل داده ها به نقاط داده مشابه گروه استفاده می شود.ارزیابی کیفیت این خوشه ها برای تعیین اثربخشی آنها ضروری است.شاخص رند تنظیم شده (ARI) یک متریک محبوب برای این منظور است، ارائه اندازه گیری شباهت بین برچسب های واقعی و نتایج خوشه ای.

آشنایی با شاخص Rand

ARI مقایسه خروجی خوشه ای با حقیقت زمین، تنظیم برای گروه بندی فرصت ها. محدوده ارزش آن از 1 تا 1، که 1 نشان دهنده توافق کامل، 0 نشان می دهد خوشه تصادفی و ارزش های منفی به معنای توافق کمتر از انتظار می رود با شانس.

محاسبه شاخص Rand تنظیم شده

اکثر زبان های برنامه نویسی کتابخانه هایی را برای محاسبه ARI ارائه می دهند، به عنوان مثال، در پایتون، کتابخانه علمیkit-learn یک تابع ساده را فراهم می کند:

[[ویرایش]

⁇ python

از sklearn.metrics import تنظیم rand score

برچسب ها: [0, 0, 1, 1, 2]

برچسب ها: [0, 0, 1, 1 0, 2]

امتیاز = تنظیم شده rand score ( برچسب ها واقعی، برچسب ها pred)

چاپ (Adjusted Rand Index: امتیاز)

⁇ ⁇

نکات اجرایی عملی

هنگام استفاده از ARI، اطمینان حاصل کنید که برچسب های واقعی برای مقایسه در دسترس هستند، همچنین مهم است که نمره را در متن تفسیر کنید، با توجه به مجموعه داده های خاص و روش خوشه بندی استفاده شده با استفاده از ARI در کنار معیارهای دیگر می تواند یک ارزیابی جامع تر ارائه دهد.

علاوه بر این، داده های پیش پردازش و انتخاب الگوریتم های خوشه ای مناسب می تواند بر نتایج ARI تأثیر بگذارد. آزمایش با پارامترهای مختلف به بهینه سازی عملکرد خوشه ای کمک می کند.