Table of Contents
جمع آوری اطلاعات یک گام اساسی در ساخت درختان تصمیم است.این کمک می کند تا بهترین ویژگی را برای تقسیم داده ها در هر گره، بهبود دقت مدل، تعیین کند.این فرایند شامل اندازه گیری کاهش آنتروپی پس از مجموعه داده ها بر اساس یک ویژگی خاص تقسیم می شود.
درک Entropy
انتروفیلی اختلال یا ناتوانی در مجموعه داده ها را اندازه گیری می کند، با استفاده از احتمال هر کلاس در مجموعه داده ها محاسبه می شود. مجموعه داده با کلاس های مخلوط دارای آنتروپی بالاتر است، در حالی که مجموعه داده های خالص دارای آنتروپی پایین تر است.
فرمول آنتروپی:
[[ویرایش] [۱] [۱۰] [۱۰] [۱۰] [۱] [۱۰] [۱] [۱۰] [۳] [۳] [۱۰] [۱۰] [۳] [۳] [۳] [۱۰] [۳] [۱۰] [۱۰] [۱۰] [۳] [۳] [۳] [۳] [۳] [۳] [۳] [۳] [۳] [۳] [۳] [۳] [۳] [۳] [۳] [۳] [[[[۳] [۳] [۳] [۳] [۳] [۳] [۳] [۳] [۳] [۳] [۳] [۳] [۳] [۳] [۳] [۳] [۳] [۳] [۳] [۳] [۳] [۳] [۳] [۳] [۳] [۳] [۳] [۳] [۳] [[[[[[۳] [بر [بر [۳] [۳] [۳] [۳] [۳] [۳] [۳] [۳] [۳] [۳] [۳] [۳] [۳] [۳]
کسب اطلاعات محاسبه شده
به دست آوردن اطلاعات تفاوت بین آنتروپی از مجموعه داده های اصلی و آنتروپی متوسط وزن پس از یک تقسیم است.این اندازه گیری می کند که چقدر عدم اطمینان با تقسیم داده ها بر اساس یک ویژگی کاهش می یابد.
فرمول کسب اطلاعات:
کسب اطلاعات = Entropy (پدر و مادر) - ⁇ (وزن کودک) × Entropy (کودک)
مراحل محاسباتی عملی
برای محاسبه ی کسب اطلاعات در عمل، این مراحل را دنبال کنید:
- محاسبه آنتروپی کل مجموعه داده ها
- مجموعه داده ها را بر اساس ویژگی مورد ارزیابی قرار دهید.
- سپس آن را برای هر یک از زیرمجموعه های ایجاد شده توسط تقسیم بندی کنید.
- متوسط وزن این دسته ها را تکمیل کنید.
- این ارزش را از آنتروپی اصلی برای پیدا کردن سود اطلاعات ردیابی کنید.
مثال مثال مثال
فرض کنید یک مجموعه داده دارای آنتروپی اولیه 0.94 باشد، پس از تقسیم بر اساس یک ویژگی، میانگین آنتروپی از زیر مجموعه ها 0.5 است.به دست آوردن اطلاعات از این تقسیم 0.44 است که نشان دهنده کاهش قابل توجهی در عدم اطمینان است.