خوشه بندی K-means یک روش محبوب است که برای گروه داده ها بر اساس ویژگی های آنها استفاده می شود.این به شناسایی الگوها و ساختارهای در مجموعه داده های بزرگ کمک می کند.این مقاله یک راهنمای گام به گام برای استفاده از خوشه K-means به داده های دنیای واقعی، از جمله محاسبات و بهترین شیوه ها فراهم می کند.

آشنایی با خوشه های K-means

تقسیم بندی K-means داده ها را به خوشه های K تقسیم می کند با به حداقل رساندن تفاوت ها در هر خوشه. الگوریتم هر نقطه داده را به نزدیکترین درصدroid و به روز رسانی درصد آن را به طور غریزی تا همگرایی استفاده می شود.

مرحله به مرحله محاسبه

این مراحل را برای انجام خوشه بندی K-means دنبال کنید:

  • مرحله 1: تعداد خوشه ها (K) را انتخاب کنید.[۱۰] از روش های استفاده مانند روش آرنج برای تعیین یک K مناسب استفاده کنید.
  • مرحله 2: شروع به کار در صدوئیدها؛ به طور تصادفی نقاط داده K را به عنوان rsoids اولیه انتخاب کنید.
  • مرحله 3: اشاره به داده های نزدیک ترین درصد را به نزدیک ترین نقطه (FLT 1) فاصله بین هر نقطه و هر سانتی گرادیید را محاسبه کنید، سپس امتیازها را بر اساس آن اختصاص دهید.
  • مرحله 4: به روز رسانی ۱۰۰٪roids محاسبه معنی از همه نقاط در هر خوشه برای پیدا کردن rsoids جدید.
  • مرحله 5: مراحل 3 و 4 را تا همگرایی تکرار کنید.[۱۰] ادامه دهید تا تکالیف خوشه ای دیگر به طور قابل توجهی تغییر نکنند.

بهترین روش برای داده های دنیای واقعی

استفاده از K-means به داده های دنیای واقعی نیازمند توجه به کیفیت داده ها و انتخاب پارامتر است. مراحل پیش پردازش مانند عادی سازی اطمینان حاصل می کند که ویژگی ها به طور مساوی به محاسبات از راه دور کمک می کنند. انتخاب تعداد مناسب خوشه ها بسیار مهم است؛ تکنیک هایی مانند نمره silhouette می تواند در این تصمیم کمک کند.

علاوه بر این، در نظر بگیرید که چندین بار الگوریتم را با مراحل اولیه مختلف اجرا کنید تا از خوشه های تجسمی محلی جلوگیری شود.