सूचना लाभ की गणना निर्णय पेड़ों के निर्माण में एक मूलभूत कदम है। यह प्रत्येक नोड पर डेटा को विभाजित करने के लिए सर्वोत्तम सुविधा निर्धारित करने में मदद करता है, मॉडल की सटीकता में सुधार करता है। इस प्रक्रिया में एक विशिष्ट विशेषता के आधार पर डेटासेट को विभाजित करने के बाद एन्ट्रापी में कमी को मापने में शामिल है।

एन्ट्रापी

एन्ट्रोपी एक डेटासेट में विकार या अशुद्धता को मापती है। यह डेटासेट के भीतर प्रत्येक वर्ग की संभावना का उपयोग करके गणना की जाती है। मिश्रित वर्गों के साथ एक डेटासेट में उच्च एन्ट्रोपी होता है, जबकि एक शुद्ध डेटासेट में कम एन्ट्रोपी होता है।

एन्ट्रापी के लिए सूत्र है:

]Eentropy = -Clpi]] log]2] p]i]]]]]]]]]]]]]]]]]]]]]]]]]]]]]]]]]]]]]]]]]]]]

सूचना लाभ की गणना

सूचना लाभ मूल डेटासेट के एन्ट्रॉपी और एक विभाजन के बाद भारित औसत एन्ट्रोपी के बीच का अंतर है। यह निर्धारित करता है कि किसी फीचर के आधार पर डेटा को विभाजित करके कितना अनिश्चितता कम हो जाती है।

सूचना लाभ के लिए सूत्र है:

सूचना लाभ = एनट्रोपी (माता-पिता) - Σ (बालों का वजन) × एनट्रोपी (child)

प्रैक्टिकल गणना चरण

इन चरणों का पालन करने के लिए, व्यवहार में सूचना प्राप्त करने के लिए:

  • संपूर्ण डेटासेट के एन्ट्रापी की गणना करें।
  • यह सुविधा के आधार पर डेटासेट को विभाजित करने का मूल्यांकन किया जा रहा है।
  • प्रत्येक उप-सेट के लिए विभाजित द्वारा बनाई गई एन्ट्रापी की गणना करें।
  • इन एन्ट्रापीज के भारित औसत को पूरा करें।
  • इस मूल्य को मूल एन्ट्रोपी से घटाकर सूचना लाभ प्राप्त करने के लिए।

उदाहरण

मान लीजिए कि डेटासेट में 0.94 का प्रारंभिक एन्ट्रोपी है। एक विशेषता के आधार पर विभाजन के बाद, सबसेट का भारित औसत एन्ट्रोपी 0.5 है। इस विभाजन से सूचना लाभ 0.44 है, जो अनिश्चितता में महत्वपूर्ण कमी का संकेत देता है।