Table of Contents

Verlustfunktionen dienen als mathematische Grundlage, die Computer Vision Modelle zu genauen Vorhersagen führt. Sie quantifizieren die Diskrepanz zwischen dem, was ein Modell vorhersagt und der tatsächlichen Grundwahrheit, wodurch ein messbares Signal erzeugt wird, das Optimierungsalgorithmen verwenden, um die Modellleistung iterativ zu verbessern. Verlustfunktion bestimmt die Konvergenzgeschwindigkeit und Genauigkeit des DL-Modells und hat einen entscheidenden Einfluss auf die Qualität und die Modellleistung des Algorithmus. Zu verstehen, wie verschiedene Verlustfunktionen funktionieren und wann sie angewendet werden, ist für jeden, der mit Deep Learning in Computer Vision Anwendungen arbeitet, unerlässlich.

Was sind Verlustfunktionen in Computer Vision?

Im Bereich des maschinellen Lernens bezieht sich die Verlustfunktion (oder Kostenfunktion) auf die Differenz zwischen der Ground Truth-Ausgabe und der vom Modell vorhergesagten Ausgabe. Während des Trainings passen neuronale Netze ihre internen Parameter - Gewichte und Verzerrungen - an, um diese Differenz zu minimieren. Der Optimierungsprozess verwendet typischerweise eine Gradientenabsenkung oder deren Varianten, die den Gradienten der Verlustfunktion in Bezug auf jeden Parameter berechnen und sie in die Richtung aktualisieren, die den Verlust reduziert.

Sie werden verwendet, um den Unterschied zwischen vorhergesagten Outputs und Ground Truth Labels zu quantifizieren, und leiten den Optimierungsprozess, um Fehler zu minimieren. Die Wahl der Verlustfunktion beeinflusst direkt, wie das Modell Muster aus Daten lernt, die es priorisiert, und letztendlich, wie gut es bei unsichtbaren Beispielen funktioniert. Eine gut gewählte Verlustfunktion kann das Training beschleunigen, die Generalisierung verbessern und dem Modell helfen, sich auf die wichtigsten Aspekte der Aufgabe zu konzentrieren.

Während des Trainings ist es daher das Ziel, solche Modellparameter (Gewichte und Verzerrungen) zu finden, die den Verlust minimieren und die Rate der korrekten Vorhersagen maximieren. Das Erreichen von Nullverlusten während des Trainings garantiert jedoch keine hervorragende Leistung in der realen Welt. Während das Erreichen eines geringen Verlustes während des Trainings wünschenswert ist, garantiert der Verlust gleich 0 keine großartige Modellleistung in einer realen Welt. Man sollte Überanpassungen vermeiden - ein Problem, wenn das Modell perfekte Vorhersagen für das Trainingsset macht, aber keine neuen, unsichtbaren Daten verallgemeinert.

Die Evolution von Verlustfunktionen im Deep Learning

Der Fortschritt beim Deep Learning wurde durch Fortschritte sowohl bei Modellarchitekturen als auch bei Optimierungstechniken vorangetrieben. Frühe Deep Learning-Modelle, die hauptsächlich auf neuronalen Netzwerken basieren, stützten sich auf einfache Verlustfunktionen. Da Computer Vision-Aufgaben komplexer und vielfältiger wurden, entwickelten die Forscher spezielle Verlustfunktionen, die auf spezifische Herausforderungen zugeschnitten waren.

SVMs brachten Scharnierverlust, was die Marge zwischen Klassen für Klassifikationsaufgaben maximiert. Beim Deep Learning wurde der Verlust durch die Enttropie immer beliebter, indem die Mehrklassenklassifizierung effektiv gehandhabt wurde, indem die Unähnlichkeit zwischen vorhergesagten Wahrscheinlichkeiten und tatsächlichen Klassen gemessen wurde. Diese Entwicklung spiegelt das wachsende Verständnis des Feldes wider, wie verschiedene mathematische Formulierungen spezifische Lernherausforderungen angehen können, von Klassenungleichgewicht bis zur Grenzpräzision.

In letzter Zeit ist die Entwicklung von Verlustfunktionen für Deep-Learning-Methoden zu einem der schwierigsten Probleme geworden. Moderne Verlustfunktionen müssen sich mit immer komplexeren Szenarien befassen, einschließlich multimodaler Daten, schwerer Klassenungleichgewichte und Einschränkungen der realen Welt, die in früheren maschinellen Lernsystemen keine Überlegungen waren.

Grundlegende Verlustfunktionen für Computer Vision

Mean Squared Error (MSE) für Regressionsaufgaben

Der mittlere Quadratfehler ist eine der grundlegendsten Verlustfunktionen, die bei Regressionsaufgaben verwendet werden, bei denen sowohl Prädiktoren als auch Zielvariablen kontinuierlich sind. In den letzten zehn Jahren haben Forscher viele Verlustfunktionen für maschinelles Lernen entwickelt, wie z. B. mittlere Quadratfehler und mittlere absolute Fehler. MSE berechnet den Durchschnitt der quadrierten Differenzen zwischen vorhergesagten und tatsächlichen Werten, wodurch größere Fehler aufgrund der Quadrierung stärker bestraft werden.

Die mathematische Formulierung ist einfach: Summe der quadrierten Differenz zwischen jedem vorhergesagten und tatsächlichen Wert, dann durch die Anzahl der Beobachtungen dividieren. Diese Einfachheit macht MSE leicht zu verstehen und zu implementieren, was zu seiner weit verbreiteten Annahme in Regressionsproblemen beiträgt.

Obwohl sie allgemein und leicht verständlich ist, passt die MSE-Verlustfunktion aus folgenden Gründen nicht zu jedem Anwendungsfall: Sie ist empfindlich gegenüber Ausreißern: Datenpunkte, die sich stark von den anderen abheben, können die Regressionslinie stark beeinflussen, was zu einer Abnahme der Modellleistung führt.

Cross-Entropy-Verlust für die Klassifizierung

Cross-Entropy Loss ist eine weit verbreitete Alternative für die MSE, die häufig für Klassifizierungsaufgaben verwendet wird, bei denen die Ausgabe als Wahrscheinlichkeitswert zwischen 0 und 1 dargestellt werden kann.

Der Kreuzentropieverlust vergleicht die vorhergesagten Vs. wahren Wahrscheinlichkeitsverteilungen. Wenn das Tier im Bild beispielsweise eine Katze ist (Katze = 1, Hund = 0, Fisch = 0), und das Modell die Verteilung als Katze = 0,1, Hund = 0,5 und Fisch = 0,4 vorhersagt, wird der Kreuzentropieverlust ziemlich hoch sein. Dieser hohe Verlustwert signalisiert dem Optimierungsalgorithmus, dass die Vorhersagen des Modells bei weitem nicht korrekt sind, was zu signifikanten Parameteraktualisierungen führt.

Binäre Kreuzentropie ist ein Spezialfall von Kreuzentropie-Verlust verwendet werden kann, für jede binäre Klassifizierung Aufgabe und im Prinzip für binäre Segmentierung verwendet werden binäre Kreuzentropie ist besonders nützlich, wenn es um zwei-Klassen-Probleme, wie zum Beispiel die Bestimmung, ob ein Bild enthält ein bestimmtes Objekt oder nicht.

Hinge Loss für Support Vector Machines

Der Scharnierverlust ist in erster Linie mit Support Vector Machines (SVMs) verbunden und ist für die Klassifizierung mit maximaler Marge konzipiert. Im Gegensatz zu Cross-Enttropie, die Vorhersagen weiterhin bestraft, auch wenn sie korrekt, aber nicht sicher genug sind, bestraft der Scharnierverlust nur Vorhersagen, die auf die falsche Seite der Entscheidungsgrenze fallen oder zu nahe dran sind.

Diese Verlustfunktion ermutigt das Modell, nicht nur Beispiele korrekt zu klassifizieren, sondern auch einen Trennungsabstand zwischen Klassen beizubehalten. Die Marge-maximierende Eigenschaft macht den Scharnierverlust besonders effektiv für binäre Klassifizierungsprobleme, bei denen eine klare Trennung zwischen Klassen gewünscht ist.

Spezialisierte Verlustfunktionen für Computer Vision Aufgaben

Focal Loss für Object Detection

Wir stellen fest, dass das extreme Klassenungleichgewicht zwischen Vordergrund und Hintergrund, das beim Training dichter Detektoren auftritt, die zentrale Ursache ist. Wir schlagen vor, dieses Klassenungleichgewicht zu beheben, indem wir den Standard-Kreuzentropieverlust so umgestalten, dass er den Verlust, der gut klassifizierten Beispielen zugeordnet ist, verringert. Der Fokusverlust stellt einen signifikanten Fortschritt im Umgang mit Klassenungleichgewichten dar, insbesondere in Objekterkennungsszenarien.

Unser Roman Focal Loss konzentriert sich auf ein spärliches Set von harten Beispielen und verhindert, dass die große Anzahl von leichten Negativen den Detektor während des Trainings überwältigt. In der Objekterkennung enthält die überwiegende Mehrheit der Kandidaten keine Objekte (einfache Negative), während nur ein kleiner Bruchteil tatsächliche Objekte enthält. Standard-Kreuzentropieverlust behandelt alle Beispiele gleich, so dass die überwältigende Anzahl von leichten Negativen das Trainingssignal dominieren kann.

Um dies zu adressieren, schlagen wir den fokalen Verlust vor, der einen modulierenden Begriff auf den Kreuzentropieverlust anwendet, um das Lernen auf harte Beispiele zu konzentrieren und die zahlreichen leichten Negative zu reduzieren. Der modulierende Faktor reduziert den Beitrag einfacher Beispiele, so dass das Modell Rechenressourcen auf das Lernen aus schwierigen Fällen konzentrieren kann, die mehr Aufmerksamkeit erfordern.

Um Klassenungleichgewicht zu kompensieren, multipliziert die Funktion des Brennpunktverlusts die Funktion der Kreuzentropie mit einem Modulationsfaktor, der die Empfindlichkeit des Netzwerks gegenüber falsch klassifizierten Beobachtungen erhöht. Dieser Ansatz hat sich als sehr effektiv erwiesen, da RetinaNet, wenn es mit dem Brennpunktverlust trainiert wird, in der Lage ist, die Geschwindigkeit früherer einstufiger Detektoren anzupassen, während die Genauigkeit aller bestehenden zweistufigen Detektoren des Standes der Technik übertroffen wird.

Bei Negativen konzentriert sich die Erhöhung der γ jedoch stark auf harte Beispiele, wobei fast die gesamte Aufmerksamkeit von leichten Negativen abgelenkt wird. Der Fokussierungsparameter gamma (γ) steuert, wie stark die Verlustfunktion einfache Beispiele reduziert, wobei höhere Werte eine stärkere Konzentration auf harte Beispiele bieten.

Würfelkoeffizientverlust für Bildsegmentierung

Der Dice-Koeffizientenverlust, auch als F1-Verlust bekannt, ist speziell für Bildsegmentierungsaufgaben konzipiert, bei denen das Ziel darin besteht, eine binäre Maske vorherzusagen, die anzeigt, welche Pixel zu Objekten von Interesse gehören. Im Gegensatz zur pixelweisen Kreuzentropie optimiert Dice loss direkt die Überlappung zwischen vorhergesagten und Ground Truth-Segmentierungsmasken.

Diese Verlustfunktion ist besonders wertvoll in der medizinischen Bildgebung und anderen Segmentierungsanwendungen, bei denen das Klassenungleichgewicht schwerwiegend ist, beispielsweise wenn das Objekt von Interesse nur einen kleinen Teil des Bildes einnimmt.

Der Dice-Koeffizient misst die Ähnlichkeit zwischen zwei Sätzen und reicht von 0 (keine Überlappung) bis 1 (perfekte Überlappung). Durch die Minimierung von 1 minus dem Dice-Koeffizienten fördert die Verlustfunktion das Modell, die Überlappung zwischen Vorhersagen und Grundwahrheit zu maximieren. Diese Formulierung behandelt unausgewogene Datensätze natürlich besser als pixelweise Verluste, da sie sich auf die Region von Interesse und nicht auf den Hintergrund konzentriert.

IoU-Verlust für Bounding Box Regression

Der Crosssection over Union (IoU)-Verlust stellt eine grundlegende Herausforderung bei der Objekterkennung dar: die Optimierung von Bounding-Box-Vorhersagen. Herkömmliche L1- oder L2-Verluste behandeln Bounding-Box-Koordinaten unabhängig und erfassen nicht die geometrische Beziehung zwischen vorhergesagten und Ground Truth-Boxen. IoU-Verlust optimiert direkt die Überlappung zwischen Boxen, was genau das ist, was uns bei Erkennungsaufgaben wichtig ist.

IoU misst das Verhältnis des Schnittbereichs zum Vereinigungsbereich zweier Begrenzungsboxen. Ein höherer IoU zeigt eine bessere Ausrichtung zwischen vorhergesagten und Ground Truth Boxen an. Durch die Verwendung von IoU als Verlustfunktion lernt das Modell, Boxen vorherzusagen, die eine maximale Überlappung mit Ground Truth haben, was zu einer genaueren Lokalisierung führt.

Es wurden mehrere Varianten des IoU-Verlustes entwickelt, um spezifische Einschränkungen zu berücksichtigen. Generalisierte IoU (GIoU) behandelt Fälle, in denen sich Boxen überhaupt nicht überschneiden, was einen sinnvollen Gradienten auch bei IoU Null bietet. Entfernungs-IoU (DIoU) und vollständige IoU (CIoU) verfeinern den Verlust weiter, indem sie den Abstand zwischen Boxzentren und das Seitenverhältnis berücksichtigen, was zu einer schnelleren Konvergenz und einer besseren Leistung bei Objekterkennungsaufgaben führt.

Kontrastiver und Triplettverlust für metrisches Lernen

Kontrastive und Triplettverluste sind für metrische Lernaufgaben konzipiert, bei denen das Ziel darin besteht, Einbettungen zu lernen, bei denen ähnliche Beispiele eng beieinander liegen und unterschiedliche Beispiele weit voneinander entfernt im Einbettungsraum. Diese Verlustfunktionen sind von grundlegender Bedeutung für Gesichtserkennung, Bildabruf und Personenidentifikationsanwendungen.

Kontrastiver Verlust arbeitet mit Beispielpaaren, zieht ähnliche Paare näher, während unterschiedliche Paare auseinander geschoben werden. Es ermutigt das Modell, Darstellungen zu lernen, bei denen der Abstand zwischen Einbettungen die semantische Ähnlichkeit zwischen Eingaben widerspiegelt. Dieser Ansatz ist besonders effektiv, wenn Sie Paare markiert haben, die angeben, ob Beispiele ähnlich oder unterschiedlich sind.

Der Triplettverlust erweitert dieses Konzept um die Arbeit mit Triolen von Beispielen: einem Anker, einem positiven Beispiel (ähnlich dem Anker) und einem negativen Beispiel (anders als der Anker), der das Modell dazu anregt, das positive Beispiel um mindestens einen vorgegebenen Rand näher an den Anker zu legen als das negative Beispiel. Diese Formulierung liefert reichere Trainingssignale als der paarweise kontrastierende Verlust und führt oft zu besser gelernten Einbettungen.

Moderne Varianten wie N-Paar-Verlust und Center-Loss verbessern diese Grundlagen weiter, indem sie mehrere Negative gleichzeitig berücksichtigen oder indem sie Klassenzentren im Einbettungsraum explizit lernen.

Wahrnehmungsverlust für die Bilderzeugung

Der Wahrnehmungsverlust stellt einen Paradigmenwechsel in der Art und Weise dar, wie wir erzeugte Bilder auswerten. Anstatt Pixelwerte direkt zu vergleichen, vergleicht der Wahrnehmungsverlust hochrangige Merkmalsdarstellungen, die aus einem vortrainierten Netzwerk, typischerweise VGG oder ResNet, extrahiert wurden. Dieser Ansatz passt besser zur menschlichen Wahrnehmung, da Menschen die Bildqualität basierend auf semantischem Inhalt und Struktur beurteilen, anstatt exakte Pixelwerte.

Bei der Stilübertragung, Superauflösung und Bild-zu-Bild-Übersetzungsaufgaben hat sich der Wahrnehmungsverlust als weitaus effektiver erwiesen als pixelweise Verluste wie MSE. Während MSE verschwommene Ergebnisse liefern könnte, die den Fehler auf Pixelebene minimieren, fördert der Wahrnehmungsverlust die Erzeugung scharfer, visuell ansprechender Bilder, die wichtige semantische Merkmale bewahren.

Der Verlust wird berechnet, indem sowohl das erzeugte Bild als auch das Zielbild durch ein vortrainiertes Netzwerk geleitet und ihre Feature-Maps in einer oder mehreren Schichten verglichen werden. Frühe Schichten erfassen Merkmale auf niedriger Ebene wie Kanten und Texturen, während tiefere Schichten semantische Inhalte auf hoher Ebene erfassen. Durch die Kombination von Verlusten aus mehreren Schichten kann der Wahrnehmungsverlust sowohl feine Details als auch die Gesamtstruktur ausgleichen.

Wahrnehmungsverlust wird oft mit kontradiktorischem Verlust in generativen kontradiktorischen Netzwerken (GANs) kombiniert, um noch realistischere Ergebnisse zu erzielen. Die Wahrnehmungskomponente sorgt für semantische Konsistenz, während die kontradiktorische Komponente die erzeugten Bilder in Richtung der Mannigfaltigkeit der natürlichen Bilder drückt.

Task-Spezifische Anwendungen von Loss-Funktionen

Bildklassifizierung

Diskriminative Aufgaben, wie Bildklassifizierung, Objekterkennung und semantische Segmentierung, beruhen stark auf Verlustfunktionen, um die Diskrepanz zwischen vorhergesagten Etiketten und Grundwahrheit genau zu messen.

In Multi-Class-Klassifikationsszenarien kombiniert Softmax-Kreuzentropie die Softmax-Aktivierungsfunktion mit Cross-Entropie-Verlust. Die Softmax-Funktion wandelt Rohmodell-Ausgaben (Logis) in eine Wahrscheinlichkeitsverteilung über Klassen um, wodurch sichergestellt wird, dass Vorhersagen zu Eins summieren.

Bei Datensätzen mit Klassenungleichgewicht weist gewichtete Kreuzentropie unterschiedliche Gewichte verschiedenen Klassen zu, so dass das Modell unterrepräsentierten Klassen mehr Aufmerksamkeit schenken kann. Label Glättung ist eine weitere Technik, die die Zielverteilung leicht modifiziert, um zu selbstbewusste Vorhersagen zu verhindern und die Generalisierung zu verbessern.

Objekterkennung

Objekterkennung: Objekterkennung ist eine wesentliche Aufgabe in der Computervision. Sie enthält normalerweise zwei Hauptunteraufgaben, d.h. Objektklassifizierung und Objektregression. Moderne Objektdetektoren müssen gleichzeitig Klassifizierungsprobleme (welche Objekte sind vorhanden) und Lokalisierungsprobleme (wo Objekte sich befinden) lösen, was sorgfältig gestaltete Verlustfunktionen für jede Komponente erfordert.

Das entscheidende Problem für Forscher ist das extreme Ungleichgewicht zwischen positiven und negativen Beispielen. Außerdem werden viele einfache Beispiele den Gradienten dominieren, was ein weiteres unausgewogenes Problem aufwirft. Dieses doppelte Ungleichgewichtsproblem - zwischen positiven und negativen Beispielen und zwischen einfachen und harten Beispielen - macht die Objekterkennung besonders herausfordernd.

Moderne Objektdetektoren kombinieren typischerweise mehrere Verlustfunktionen: Brennwertverlust oder Kreuzentropie für die Klassifizierung, IoU-basierte Verluste für Bounding Box Regression und manchmal zusätzliche Verluste für Hilfsaufgaben wie Schlüsselpunkterkennung oder Instanzsegmentierung. Der Gesamtverlust ist eine gewichtete Summe dieser Komponenten, wobei die Gewichte sorgfältig auf die verschiedenen Ziele abgestimmt sind.

Semantische Segmentierung

Die semantische Segmentierung erfordert die Vorhersage eines Klassenlabels für jedes Pixel in einem Bild, was es zu einer der rechenintensivsten Computer Vision-Aufgaben macht. Die Wahl der Verlustfunktion hat erhebliche Auswirkungen auf die Trainingseffizienz und die endgültige Segmentierungsqualität.

Pixelweise Kreuzentropie ist der Basisansatz, der jedes Pixel als unabhängiges Klassifizierungsproblem behandelt, wobei dieser Ansatz jedoch unter einem starken Klassenungleichgewicht leidet, wenn Objekte von Interesse nur einen kleinen Teil des Bildes einnehmen.

Der Würfelverlust und seine Varianten werden immer beliebter für die Segmentierung, weil sie die Regionsüberlappung direkt optimieren, anstatt einzelne Pixel. Der Fokusverlust wird auch häufig verwendet, um das Ungleichgewicht zwischen einfachen Hintergrundpixeln und herausfordernden Randpixeln zu bewältigen. Viele moderne Segmentierungsnetzwerke kombinieren mehrere Verluste - zum Beispiel durch Kreuzentropie und Würfelverlust -, um die Stärken jedes Ansatzes zu nutzen.

Grenzbewußte Verluste zielen speziell auf die genaue Abgrenzung von Objektgrenzen ab, was oft der schwierigste Aspekt der Segmentierung ist. Diese Verluste richten höhere Gewichte auf Pixel in der Nähe von Grenzen oder verwenden Entfernungstransformationen, um räumliche Beziehungen zwischen Pixeln zu kodieren.

Gesichtserkennung

Gesichtserkennungssysteme müssen Einbettungen lernen, die identitätsspezifische Merkmale erfassen und gleichzeitig robust gegenüber Variationen in Pose, Beleuchtung, Ausdruck und Alterung sind. Dies erfordert spezielle Verlustfunktionen, die über eine einfache Klassifizierung hinausgehen.

Softmax-Verlust mit groß angelegter Klassifizierung behandelt jede Identität als eine separate Klasse, aber dieser Ansatz verallgemeinert sich nicht gut auf neue Identitäten, die während des Trainings nicht gesehen werden. Metrische Lernverluste wie Kontrastverlust und Triplettverlust adressieren dies, indem sie eine Entfernungsmetrik im Einbettungsraum lernen und die Erkennung neuer Identitäten durch Übereinstimmung zwischen dem nächsten und dem Nachbarn ermöglichen.

Der Center-Loss lernt explizit ein Zentrum für jede Identitätsklasse und bestraft den Abstand zwischen Merkmalen und den entsprechenden Klassenzentren. Dies fördert die Kompaktheit innerhalb der Klasse bei gleichzeitiger Aufrechterhaltung der Trennbarkeit zwischen den Klassen. Winkelrandbasierte Verluste wie ArcFace und CosFace verbessern die Diskriminierung weiter, indem sie eckige Ränder in den Einbettungsraum einführen, was zu robusteren Gesichtserkennungssystemen führt.

Bilderzeugung und Stilübertragung

Generative Aufgaben, einschließlich Text-zu-Bild-, Bild-zu-Bild- und Audio-zu-Bild-Generierung, verwenden Verlustfunktionen, um den Realismus und die Qualität der erzeugten Ausgaben zu bewerten, wobei häufig kontradiktorische oder Wahrnehmungsverluste verwendet werden, um den Trainingsprozess zu leiten. Generative Modelle stehen vor einzigartigen Herausforderungen, da es oft keine einzige "richtige" Ausgabe gibt - mehrere gültige Generationen können für eine bestimmte Eingabe existieren.

Der Verlust von Gegnern, der mit Generative Adversarial Networks (GANs) eingeführt wird, verwendet ein Diskriminatornetzwerk, um zwischen realen und erzeugten Bildern zu unterscheiden. Der Generator lernt, Bilder zu erzeugen, die den Diskriminator täuschen, was zu immer realistischeren Ergebnissen führt. Dieser kontradiktorische Trainingsprozess hat die Bilderzeugung revolutioniert und eine fotorealistische Synthese über zahlreiche Anwendungen hinweg ermöglicht.

Für die Stilübertragung wird typischerweise eine Kombination aus Content Loss und Style Loss verwendet. Content Loss, oft als Perzeptionsverlust implementiert, stellt sicher, dass das erzeugte Bild den semantischen Inhalt der Eingabe bewahrt. Style Loss erfasst den künstlerischen Stil durch den Vergleich von Gram-Matrizen von Feature Maps, die Textur- und Farbmuster unabhängig von der räumlichen Struktur codieren.

Moderne Diffusionsmodelle verwenden die denoising score matching losses, indem sie das Modell trainieren, um einen allmählichen Rauschprozess umzukehren. Dieser Ansatz hat bemerkenswerte Ergebnisse bei der Text-zu-Bild-Erzeugung erzielt, indem er verschiedene, qualitativ hochwertige Bilder aus Textbeschreibungen erzeugt.

Bedeutung der Auswahl der richtigen Verlustfunktion

Bei der Konstruktion einer vollständigen Netzwerkstruktur stellt die Auswahl oder Gestaltung einer geeigneten Verlustfunktion ebenfalls ein herausforderndes Problem dar. Bei Deep Learning-Aufgaben misst die Verlustfunktion üblicherweise die Genauigkeit, Ähnlichkeit oder Güte der Übereinstimmung zwischen dem vorhergesagten Wert und der Grundwahrheit. Eine sorgfältig vorbereitete Verlustfunktion kann die Trainingsleistung des neuronalen Netzes erheblich verbessern.

Die Auswahl der richtigen Verlustfunktion ist von entscheidender Bedeutung, da sie sich direkt auf die Konvergenz, Generalisierung und Gesamtleistung des Modells in verschiedenen Anwendungen auswirkt, von der Computervision bis hin zur Zeitreihenvorhersage. Eine unangemessene Verlustfunktion kann zu mehreren Problemen führen: langsame Konvergenz, schlechte Generalisierung auf neue Daten, Instabilität während des Trainings oder Nichterfassung der Nuancen der Aufgabe.

Verlustfunktionen im Deep Learning sind ein typisches, aber wichtiges Forschungsgebiet, das die Leistung eines tiefen neuronalen Netzes bestimmt. Das gleiche Framework von tiefen CNNs mit unterschiedlichen Verlustfunktionen kann unterschiedliche Trainingsergebnisse haben. Diese Beobachtung unterstreicht, dass architektonische Innovationen allein nicht ausreichen - die Verlustfunktion spielt eine ebenso entscheidende Rolle bei der Bestimmung der endgültigen Modellleistung.

Faktoren, die bei der Auswahl einer Verlustfunktion zu berücksichtigen sind

Aufgabentyp: Die grundlegende Natur Ihrer Aufgabe – Klassifizierung, Regression, Segmentierung oder Generation – schränkt die entsprechenden Verlustfunktionen ein. Klassifikationsaufgaben verwenden typischerweise Kreuzentropievarianten, Regression verwendet MSE oder MAE, Segmentierung profitiert von Würfel- oder Fokusverlust und Generation verwendet kontradiktorische oder Wahrnehmungsverluste.

Datenmerkmale: Klassenungleichgewicht, Ausreißer, Rauschpegel und Datensatzgröße beeinflussen alle die Auswahl der Verlustfunktion. Unausgewogene Datensätze profitieren von fokalem Verlust oder gewichteter Kreuzentropie, während Datensätze mit Ausreißern robuste Verluste wie Huber-Verlust gegenüber MSE bevorzugen könnten.

Modellarchitektur: Beim tiefen Lernen werden Neuronen der letzten Schicht jedoch normalerweise durch eine Sigmoid- oder Softmax-Funktion aktiviert.

Evaluationsmetriken: Idealerweise sollte Ihre Verlustfunktion darauf abgestimmt sein, wie Sie die Modellleistung bewerten. Wenn Sie sich für IoU bei der Objekterkennung interessieren, ist die Verwendung von IoU-basierten Verlusten sinnvoll. Wenn Sie für den F1-Score in der Segmentierung optimieren, ist der Würfelverlust (der mit F1 zusammenhängt) eine natürliche Wahl.

Computational Efficiency: Einige Verlustfunktionen sind rechentechnisch teurer als andere. Wahrnehmungsverlust erfordert Vorwärtsfahrten durch ein zusätzliches vortrainiertes Netzwerk, während gegnerischer Verlust ein Diskriminatortraining erfordert. Diese Rechenkosten müssen gegen potenzielle Leistungssteigerungen abgewogen werden.

Multi-Loss-Trainingsstrategien

Moderne Computer Vision Systeme kombinieren häufig mehrere Verlustfunktionen, um komplementäre Stärken zu nutzen und verschiedene Aspekte des Lernproblems anzugehen.

Bei der Objekterkennung kombiniert der Gesamtverlust typischerweise Klassifikationsverlust, Lokalisierungsverlust und manchmal zusätzliche Hilfsverluste. Jede Komponente adressiert einen anderen Aspekt der Aufgabe, und ihre relativen Gewichte müssen sorgfältig ausgeglichen werden. Zu viel Gewicht auf Klassifikation kann zu genauen Klassenvorhersagen führen, aber schlechte Lokalisierung, während eine zu starke Lokalisierung zu gut positionierten Boxen mit falschen Klassenbeschriftungen führen kann.

Für die Bilderzeugung schafft die Kombination von gegnerischem Verlust mit Wahrnehmungsverlust und pixelweisem Verlust ein multiobjektives Optimierungsproblem. Adversarialer Verlust fördert Realismus, Wahrnehmungsverlust bewahrt semantischen Inhalt und pixelweiser Verlust behält strukturelle Ähnlichkeit. Die Herausforderung besteht darin, das richtige Gleichgewicht zwischen diesen Zielen zu finden.

Dynamische Verlustgewichtungsstrategien passen die relative Bedeutung verschiedener Verlustkomponenten während des Trainings automatisch an. Diese Ansätze erkennen, dass unterschiedliche Ziele in verschiedenen Trainingsphasen mehr oder weniger wichtig sein können, so dass sich das Modell auf das konzentrieren kann, was an jedem Punkt des Lernprozesses am wichtigsten ist.

Fortgeschrittene Konzepte und jüngste Entwicklungen

Adaptive und gelernte Verlustfunktionen

In der jüngsten Forschung wurden Lernverlustfunktionen selbst untersucht, anstatt sie von Hand zu entwerfen. Meta-Learning-Ansätze trainieren eine Verlustfunktion in einer Verteilung von Aufgaben, so dass sie auf neue Aufgaben verallgemeinert werden kann.

Adaptive Verlustfunktionen passen ihr Verhalten automatisch an die Trainingsdynamik an. Zum Beispiel gleichen einige Verluste automatisch mehrere Ziele aus, indem sie Gradientengrößen überwachen, um sicherzustellen, dass kein einzelnes Ziel das Training dominiert. Andere passen ihren Fokus zwischen einfachen und harten Beispielen an, wenn das Training fortschreitet.

Diese erlernten und adaptiven Ansätze sind vielversprechend, führen aber auch zu zusätzlicher Komplexität und zusätzlichem Rechenaufwand. Sie sind am wertvollsten, wenn man mit neuen Aufgaben oder Domänen arbeitet, in denen etablierte Verlustfunktionen möglicherweise nicht optimal sind.

Robustheit und Unsicherheit

Dieses Papier stellte auch einige fortgeschrittene Herausforderungen und Grenzen der Verlustfunktion in Deep Learning.k Um die Stabilität eines Modells zu verbessern, haben Forscher die Robustheit der Verlustfunktionen die ganze Zeit verbessert. Robuste Verlustfunktionen sind so konzipiert, dass sie mit lauten Etiketten, Ausreißern und gegnerischen Beispielen ohne katastrophale Leistungsminderung umgehen können.

Symmetrische Verlustfunktionen behandeln positive und negative Fehler gleichermaßen, wodurch sie robuster gegen das Rauschen werden.

Verluste im Bewusstsein der Unsicherheit tragen zur Modellunsicherheit bei, anstatt alle Vorhersagen gleich zu behandeln, tragen diese Verluste zur Vertrauenswürdigkeit des Modells bei, so dass es sich auf Beispiele konzentrieren kann, bei denen es zuverlässige Vorhersagen treffen kann, während es bei unsicheren Fällen vorsichtig ist.

Verlustfunktionen für selbstüberwachtes Lernen

Selbstüberwachtes Lernen hat sich als ein mächtiges Paradigma für das Erlernen visueller Darstellungen ohne manuelle Etiketten herausgebildet. Dieser Ansatz erfordert spezialisierte Verlustfunktionen, die das Modell dazu ermutigen, nützliche Merkmale aus nicht markierten Daten zu lernen.

Kontrastive Verluste für selbstüberwachtes Lernen ziehen verschiedene erweiterte Ansichten desselben Bildes zusammen, während sie Ansichten von verschiedenen Bildern auseinanderdrängen. SimCLR, MoCo und ähnliche Frameworks verwenden Varianten kontrastiven Verlusts, um Darstellungen zu lernen, die für Datenerweiterungen invariant sind, aber zwischen verschiedenen Bildern unterscheiden.

Kontrastfreie Methoden wie BYOL und SimSiam vermeiden explizit negative Paare, indem sie Vorhersage- und Stopgradientenoperationen verwenden, um den Zusammenbruch zu trivialen Lösungen zu verhindern. Diese Ansätze haben beeindruckende Ergebnisse erzielt, die manchmal die überwachte Lernleistung bei nachgelagerten Aufgaben übertreffen oder übertreffen.

Maskierte Bildmodellierung, inspiriert durch maskierte Sprachmodellierung in NLP, nutzt Rekonstruktionsverluste, um maskierte Bildflecken vorherzusagen. Dieser Ansatz hat sich als effektiv für das Erlernen visueller Darstellungen erwiesen, insbesondere in Kombination mit Vision-Transformatoren.

Praktische Umsetzungsüberlegungen

Rahmenunterstützung und -umsetzung

Beliebte Frameworks wie PyTorch, TensorFlow/Keras und MATLAB bieten Kernfunktionen wie Rechengraphen, automatische Differenzierung und vorimplementierte Verluste (z. B. MSE, Cross-Etropie) neben Standardmetriken wie Genauigkeit oder Präzisions-Rückruf. Moderne Deep Learning-Frameworks machen die Implementierung von Verlustfunktionen einfach, wobei die häufigsten Verluste als eingebaute Funktionen verfügbar sind.

Für benutzerdefinierte Verlustfunktionen stellen diese Frameworks die Werkzeuge bereit, die benötigt werden, um sie effizient zu implementieren. Automatische Differenzierung übernimmt die Gradientenberechnung, so dass Sie sich auf die Definition des Vorwärtspasses des Verlustes konzentrieren können. GPU-Beschleunigung stellt sicher, dass auch komplexe Verlustfunktionen während des Trainings effizient berechnet werden können.

Bei der Implementierung von benutzerdefinierten Verlusten ist numerische Stabilität entscheidend. Operationen wie Logarithmen und Divisionen können unendliche oder undefinierte Werte erzeugen, wenn sie nicht sorgfältig gehandhabt werden. Die meisten Frameworks bieten numerisch stabile Implementierungen von gemeinsamen Operationen und die Einhaltung bewährter Verfahren hilft, Trainingsinstabilitäten zu vermeiden.

Hyperparameter-Abstimmung

Viele Verlustfunktionen beinhalten Hyperparameter, die das Training erheblich beeinflussen. Der Fokusverlust hat den Fokusparameter Gamma und den Balancingparameter Alpha. Der Tripletverlust hat einen Margin-Parameter. Multi-Loss-Setups erfordern Gewichte für jede Komponente. Diese Hyperparameter müssen auf eine optimale Leistung abgestimmt sein.

Gittersuche und Zufallssuche sind gängige Ansätze für die Hyperparameter-Abstimmung, obwohl sie rechnerisch teuer sein können. Bayessche Optimierung und andere fortschrittliche Techniken können gute Hyperparameter effizienter finden. Kreuzvalidierung hilft sicherzustellen, dass ausgewählte Hyperparameter auf unsichtbare Daten verallgemeinern.

Beginnend mit den in der Literatur angegebenen Werten bietet sich eine gute Ausgangsbasis, aber optimale Hyperparameter hängen oft von Ihrem spezifischen Datensatz und Ihrer Aufgabe ab. Die Überwachung von Trainingskurven und Validierungsleistung hilft zu erkennen, wann Hyperparameter angepasst werden müssen.

Debugging und Monitoring

Die Überwachung der Verlustwerte während des Trainings liefert entscheidende Erkenntnisse über den Lernprozess. Der Verlust sollte im Allgemeinen im Laufe der Zeit abnehmen, obwohl die Rate und das Muster der Abnahme je nach Aufgabe und Verlustfunktion variieren. Plötzliche Spitzen, Plateaus oder Divergenzen weisen auf mögliche Probleme hin.

Bei Multi-Loss-Setups hilft die Überwachung jeder Komponente, Ungleichgewichte zu erkennen. Wenn eine Verlustkomponente dominiert, kann das Modell andere Ziele vernachlässigen.

Visualisierung von Vorhersagen neben Verlustwerten liefert qualitative Erkenntnisse, die quantitative Metriken ergänzen. Für die Bildsegmentierung zeigt das Überlagern vorhergesagter Masken auf Eingabebildern, ob das Modell aussagekräftige Muster lernt oder Datensatzverzerrungen ausnutzt.

Herausforderungen und zukünftige Richtungen

Der Schwerpunkt liegt auf komplexen Szenarien, die multimodale Daten, Klassenungleichgewichte und reale Einschränkungen beinhalten. Schließlich identifizieren wir die wichtigsten zukünftigen Richtungen und befürworten Verlustfunktionen, die die Interpretierbarkeit, Skalierbarkeit und Generalisierung verbessern und zu effektiveren und belastbaren Deep-Learning-Modellen führen.

Handhabung von Extremklassenungleichgewichten

Wir fanden heraus, dass viele wesentliche Verlustfunktionen verwendet werden, um das Ungleichgewichtsproblem zu lösen. Die Idee des Brennwertverlusts kann dieses Problem effektiv lösen, und die jüngsten Rankingverluste können es besser lösen. Während Brennwertverlust und gewichtete Verluste helfen, bleibt extremes Ungleichgewicht eine Herausforderung, insbesondere in Bereichen wie der medizinischen Bildgebung, wo Anomalien selten sind.

Zukünftige Forschungsrichtungen umfassen die Entwicklung von Verlustfunktionen, die sich automatisch an den Grad des Ungleichgewichts anpassen, mehrere Strategien für den Umgang mit Ungleichgewicht kombinieren und die Datenerweiterung besser mit dem Verlustfunktionsdesign integrieren. Meta-Learning-Ansätze, die lernen, wie man mit Ungleichgewicht aus mehreren verwandten Aufgaben umgeht, sind ebenfalls vielversprechend.

Multi-Modal und Multi-Task Learning

Da Computer Vision Systeme zunehmend mehrere Modalitäten (Bilder, Text, Audio) verarbeiten und mehrere verwandte Aufgaben gleichzeitig lösen, müssen Verlustfunktionen weiterentwickelt werden, um diese Komplexitäten zu bewältigen.

Cross-modale Verluste, die die Ausrichtung zwischen verschiedenen Modalitäten fördern, haben sich für Vision-Sprachmodelle als wertvoll erwiesen. Aufgabenspezifische Verluste in Kombination mit gemeinsamen Repräsentationsverlusten ermöglichen ein effektives Multi-Task-Lernen.

Interpretierbarkeit und Erklärbarkeit

Die Entwicklung theoretischer Rahmenbedingungen, die vorhersagen, welche Verlustfunktionen basierend auf Aufgabenmerkmalen effektiv sein werden, würde den Fortschritt beschleunigen und die Trial-and-Error-Natur der Verlustfunktionsauswahl reduzieren.

Interpretierbare Verlustfunktionen, die Einblicke in das Modell lernen und warum bestimmte Beispiele schwierig sind, könnten den Praktikern helfen, Modelle zu debuggen und die Leistung zu verbessern. Die Verbindung des Verlustfunktionsdesigns mit der menschlichen Wahrnehmung und Kognitionswissenschaft kann zu Verlusten führen, die besser mit der Art und Weise übereinstimmen, wie Menschen die visuelle Qualität bewerten.

Automatisiertes Loss Function Design

Schließlich identifizieren wir offene Probleme und vielversprechende Richtungen, einschließlich der Automatisierung der Verlustfunktionssuche und der Entwicklung robuster, interpretierbarer Bewertungsmaßnahmen für immer komplexere Deep-Learning-Aufgaben. Die Automatisierung der Entdeckung optimaler Verlustfunktionen für neue Aufgaben könnte Deep Learning demokratisieren, indem das für gute Ergebnisse erforderliche Fachwissen reduziert wird.

Die Suche nach neuronaler Architektur hat das Modelldesign erfolgreich automatisiert; die Anwendung ähnlicher Techniken auf die Verlustfunktionssuche ist ein natürlicher nächster Schritt. Herausforderungen sind die Definition des Suchraums möglicher Verlustfunktionen, die effiziente Bewertung von Kandidaten und die Sicherstellung, dass entdeckte Verluste über die spezifischen Aufgaben hinaus verallgemeinern, die während der Suche verwendet werden.

Umfassende Liste der Verlustfunktionen für Computer Vision

Um eine praktische Referenz zu liefern, hier ist eine erweiterte Kategorisierung der Verlustfunktionen, die üblicherweise in Computer Vision verwendet werden:

Regressionsverluste

  • Mean Squared Error (MSE): Standardverlust für Regression, empfindlich auf Ausreißer
  • Mittelwert absoluter Fehler (MAE): Robuster für Ausreißer als MSE
  • Huber Loss: Kombiniert MSE und MAE, robust gegenüber Ausreißern, während die Glätte erhalten bleibt
  • Glatter L1-Verlust: Ähnlich wie Huber-Verlust, der üblicherweise bei der Objekterkennung verwendet wird
  • Log-Cosh-Verlust: Glatte Approximation von MAE mit besseren Gradienteneigenschaften

Einstufungsverluste

  • Cross-Entropy Loss: Standard für die Mehrklassenklassifizierung
  • Binäre Cross-Entropie: Für binäre Klassifikationsaufgaben
  • Focal Loss: Behebt das Klassenungleichgewicht, indem es sich auf harte Beispiele konzentriert
  • Gewichtete Kreuzentropie: weist unterschiedliche Gewichte verschiedenen Klassen zu
  • Label-Glättungsverlust: Verhindert überbewusste Vorhersagen
  • Hinge Loss: Maximum-Margin-Loss für SVMs

Segmentierungsverluste

  • Dice Loss: Optimiert Überlappungen zwischen vorhergesagten und Ground Truth Masken
  • Tversky Loss: Generalisierung des Würfelverlustes mit einstellbaren falsch positiven / negativen Strafen
  • Focal Tversky Loss: Kombiniert den Fokalverlust mit dem Tversky-Verlust
  • Grenzverlust: betont genaue Grenzziehung
  • Lovász-Softmax Verlust: Direkte Optimierung der IoU für die Segmentierung

Objekterkennungsverluste

  • IoU Loss: Direkt optimiert Bounding Box Überlappung
  • GIoU Loss: Generalisierte IoU, die nicht überlappende Boxen behandelt
  • DIoU Verlust: Entfernung IoU unter Berücksichtigung der Mittelpunktsentfernung
  • CIoU Loss: Complete IoU including side ratio
  • Focal Loss: Für die Klassifizierung in der Objekterkennung

Metric Learning Verluste

  • Kontrastiver Verlust: Lernt Einbettungen aus Beispielpaaren
  • Triplet Loss: Verwendet Anker-positiv-negative Drillinge
  • N-Paar-Verlust: Erweitert den Triplett-Verlust auf mehrere Negative
  • Center Loss: Lernt Klassenzentren im Einbettungsraum
  • ArcFace Loss: Winkelmarge-basierter Verlust für Gesichtserkennung
  • CosFace Loss: Cosine Margin-based Loss

Generative Verluste

  • Adversarial Loss: Wird in GANs verwendet, um reale von generierten Bildern zu unterscheiden
  • Perceptual Loss: Vergleicht High-Level-Features von vortrainierten Netzwerken
  • Style Loss: Erfasst künstlerischen Stil durch Gram-Matrizen
  • Gesamtvariationsverlust: fördert räumliche Glätte
  • Rekonstruktionsverlust: Pixelweiser Vergleich für Autoencoder
  • SSIM Verlust: Strukturelle Ähnlichkeitsindex für die Bildqualität

Best Practices für das Arbeiten mit Verlustfunktionen

Wir haben zwei Richtlinien für die Gestaltung oder Auswahl der Verlustfunktionen vorgeschlagen. Forscher können eine Verlustfunktion entsprechend dem Anwendungsszenario oder basierend auf ihren Eigenschaften verwenden. Hier sind praktische Empfehlungen für die effektive Nutzung von Verlustfunktionen in Computer Vision-Projekten:

  1. Beginnen Sie mit etablierten Baselines: Beginnen Sie mit Standard-Verlustfunktionen, von denen bekannt ist, dass sie für Ihren Aufgabentyp gut funktionieren, bevor Sie exotischere Optionen erkunden.
  2. Verstehen Sie Ihre Daten: Analysieren Sie Klassenverteilungen, die Ausreißerprävalenz und die Datenqualität, um die Auswahl der Verlustfunktion zu informieren.
  3. Richte den Verlust mit den Bewertungsmetriken aus: Wähle Verluste aus, die mit der Art und Weise korrelieren, wie du den Erfolg letztendlich messen wirst.
  4. Überwachen Sie mehrere Metriken: Verlassen Sie sich nicht nur auf Verlustwerte; verfolgen Sie aufgabenspezifische Metriken, die die reale Leistung widerspiegeln.
  5. Experiment systematisch: Wenn Sie verschiedene Verluste versuchen, ändern Sie eine Sache nach der anderen, um zu verstehen, was Leistungsänderungen antreibt.
  6. Betrachten Sie die Rechenkosten: Balancieren Sie potenzielle Leistungssteigerungen mit dem Trainingszeit- und Ressourcenbedarf.
  7. Validieren auf ausgehaltenen Daten: Stellen Sie sicher, dass Verbesserungen beim Trainingsverlust zu einer besseren Generalisierung führen.
  8. Dokumentiere deine Entscheidungen: Notiere, welche Verluste du versucht hast, ihre Hyperparameter und Ergebnisse, um institutionelles Wissen aufzubauen.

Ressourcen für weiteres Lernen

Für Praktiker, die ihr Verständnis der Verlustfunktionen in der Computervision vertiefen möchten, bieten mehrere Ressourcen wertvolle Informationen:

Die PyTorch-Dokumentation bietet eine umfassende Abdeckung der eingebauten Verlustfunktionen mit Implementierungsdetails und Anwendungsbeispielen.

Akademische Arbeiten, die neuartige Verlustfunktionen einführen, beinhalten typischerweise Ablationsstudien, die ihre Wirksamkeit belegen. Das Lesen dieser Arbeiten bietet Einblicke in die Motivation hinter verschiedenen Verlustdesigns und den Problemen, die sie lösen. Der arXiv Preprint-Server beherbergt viele aktuelle Artikel über Verlustfunktionen und ihre Anwendungen.

Online-Kurse zum Thema Deep Learning von Plattformen wie Coursera, fast.ai und Stanfords Cover Loss CS231n sind Teil ihres Lehrplans. Diese Kurse bieten strukturierte Lernpfade mit praktischen Übungen.

Open-Source-Implementierungen von State-of-the-Art-Modellen auf GitHub zeigen, wie Praktiker Verlustfunktionen in realen Anwendungen kombinieren und abstimmen.

Schlussfolgerung

Verlustfunktionen sind von grundlegender Bedeutung für das Training effektiver Computer Vision Modelle, die als Brücke zwischen Modellvorhersagen und gewünschten Ergebnissen dienen. Solche Verluste sind in der Regel für die Lösung der einzigartigen Probleme des Deep Learning konzipiert. Von grundlegenden Regressions- und Klassifizierungsverlusten bis hin zu anspruchsvollen aufgabenspezifischen Formulierungen entwickelt sich die Landschaft der Verlustfunktionen neben Fortschritten in Modellarchitekturen und Anwendungsdomänen weiter.

Das Verständnis der mathematischen Grundlagen, praktischen Überlegungen und geeigneten Anwendungen verschiedener Verlustfunktionen befähigt die Praktiker, fundierte Entscheidungen zu treffen, wenn sie Computer Vision-Systeme entwerfen und trainieren.Obwohl keine einzelne Verlustfunktion für alle Szenarien optimal funktioniert, bieten die in diesem Artikel diskutierten Prinzipien und Richtlinien einen Rahmen für die Auswahl und Anpassung von Verlusten an spezifische Bedürfnisse.

Da Computer Vision immer komplexere Herausforderungen anpackt – vom multimodalen Verständnis über Wenige-Schuss-Lernen bis hin zum robusten Einsatz in sicherheitskritischen Anwendungen – werden Verlustfunktionen weiterhin eine entscheidende Rolle bei der Gestaltung des Lernens von Modellen spielen. Die laufende Forschung zu adaptiven, gelernten und robusten Verlustfunktionen verspricht, Deep Learning für verschiedene Anwendungen zugänglicher und effektiver zu machen.

Durch sorgfältige Prüfung der Aufgabenanforderungen, Datenmerkmale und Bewertungsziele können Praktiker das reichhaltige Toolkit der verfügbaren Verlustfunktionen nutzen, um Computer Vision-Systeme zu bauen, die nicht nur hohe Genauigkeit erreichen, sondern auch gut verallgemeinern, Randfälle anmutig behandeln und sich an den realen Einsatzbeschränkungen ausrichten. Die Reise vom Verständnis grundlegender Verlustfunktionen bis zur Beherrschung ihrer Anwendung ist für jeden, der es ernst meint, den Stand der Technik im Computer Vision voranzutreiben, unerlässlich.