Berechnung von Präzision, Rückruf und F1-Score für NIP-Klassifikationsaufgaben

Präzision, Rückruf und F1-Score sind wichtige Metriken, die zur Bewertung der Leistung von NLP-Klassifikationsmodellen verwendet werden und helfen zu verstehen, wie gut ein Modell verschiedene Klassen vorhersagt, insbesondere in unausgewogenen Datensätzen.

Präzision verstehen

Die Präzision misst den Anteil der wirklich positiven Vorhersagen unter allen positiven Vorhersagen des Modells und gibt an, wie viele der vorhergesagten positiven Fälle tatsächlich positiv sind.

Rückruf verstehen

Recall, auch bekannt als Sensitivität, misst den Anteil der tatsächlichen positiven Fälle, die vom Modell korrekt identifiziert werden, und spiegelt die Fähigkeit des Modells wider, positive Fälle zu erkennen.

Berechnung des F1-Score

Der F1-Score ist das harmonische Mittel von Präzision und Rückruf. Er bietet eine einzige Metrik, die beide ausgleicht, besonders nützlich, wenn die Klassenverteilung ungleichmäßig ist.

Beispielrechnung

Angenommen, ein Modell prognostiziert 80 positive Fälle, von denen 60 korrekt sind. Die tatsächlichen Gesamt-positiven Fälle sind 70. Die Berechnungen lauten wie folgt: