Einleitung

Computer Vision ist einer der transformativsten Zweige der künstlichen Intelligenz, der es Maschinen ermöglicht, Bilder und Videostreams automatisch zu interpretieren und Entscheidungen auf der Grundlage visueller Daten zu treffen. Für Unternehmen ermöglicht die Fähigkeit, Bilder und Videostreams automatisch zu analysieren, Effizienz in der Qualitätskontrolle, dem Bestandsmanagement, der Sicherheit und der Kundenerfahrung. Allerdings erfordert der Aufbau eines benutzerdefinierten Bilderkennungsmodells von Grund auf umfassendes Fachwissen im maschinellen Lernen, erhebliche Rechenressourcen und zeitaufwendiges Data Engineering. Azure Cognitive Services Custom Vision schließt diese Lücke und befähigt Entwickler und Domänenexperten, hochleistungsfähige Bildklassifikatoren und Objektdetektoren zu trainieren, bereitzustellen und zu iterieren, ohne komplexe Deep-Learning-Infrastruktur verwalten zu müssen. Es bietet einen schnellen Weg zur Produktion für eine Vielzahl visueller KI-Anwendungen.

Was ist Azure Cognitive Services Custom Vision?

Azure Custom Vision ist ein vollständig verwalteter, cloudbasierter Bilderkennungsdienst, der Teil der Azure AI-Plattform ist. Im Gegensatz zur universellen Computer Vision API, die sich durch die Identifizierung von gängigen Objekten, Prominenten, Landmarken und Text auszeichnet, ermöglicht Custom Vision Ihnen, ein Modell speziell für Ihre eindeutige Domain zu trainieren. Ob Sie einen seltenen Defekt auf einer Leiterplatte, einer bestimmten Pflanzenart oder einem bestimmten Produkt in einem Einzelhandelsregal identifizieren müssen, passt sich Custom Vision Ihren Daten an.

Der Dienst nutzt Transfer Learning, eine Technik, bei der ein vortrainiertes neuronales Netzwerk auf Ihren benutzerdefinierten Datensatz abgestimmt ist. Dies reduziert den Datenaufwand und die Trainingszeit im Vergleich zum Erstellen eines Modells von Grund auf. Mit Custom Vision können Sie entweder das intuitive No-Code-Portal für einfache Projekte verwenden oder die programmatische API für die volle Kontrolle über den Trainingslebenszyklus nutzen. Die Ausgabe ist ein skalierbarer REST-API-Endpunkt oder ein exportiertes Modell, das lokal auf Edge-Geräten ausgeführt werden kann. Es unterstützt zwei primäre Projekttypen: Bildklassifizierung (zuweisen eines oder mehrerer Labels zu einem ganzen Bild) und Objekterkennung (Ortung bestimmter Objekte in einem Bild und Zeichnen von Begrenzungsfeldern um sie herum).

Der Kern-Workflow von Custom Vision

Die Erstellung eines benutzerdefinierten Vision-Modells folgt einer strukturierten, iterativen Pipeline.

Datenerhebung und -kennzeichnung

Die Qualität und Quantität Ihrer Trainingsdaten bestimmen direkt die Leistung Ihres Modells. Für jede Etiketten- oder Objektklasse, die Sie erkennen möchten, sollten Sie mindestens 50 repräsentative Bilder anstreben. Komplexere oder variablere Objekte können Hunderte von Bildern erfordern. Zu den Best Practices gehören die Aufnahme von Bildern mit unterschiedlichen Hintergründen, unterschiedlichen Lichtverhältnissen, verschiedenen Winkeln und den typischen Maßstabsvariationen, denen Ihre Anwendung begegnen wird. Für die Objekterkennung muss jedes Bild durch Markierung des Bildes und Zeichnen von Begrenzungsfeldern um jede Instanz des Objekts gekennzeichnet werden. Custom Vision unterstützt JPEG-, PNG-, BMP- und WEBP-Formate. Die Kennzeichnung kann direkt im Custom Vision-Portal durchgeführt oder von Drittanbieter-Etikettierungstools mit den Formaten COCO oder Pascal VOC exportiert werden.

Modellschulung

Sobald Ihre Bilder hochgeladen und markiert sind, starten Sie das Training. Custom Vision bietet zwei Trainingsoptionen: Quick Training (das Standard-Hyperparameter verwendet und Züge schnell für das Prototyping ausführt) und Advanced Training (das es Ihnen ermöglicht, Rechenstunden für gründlichere Schulungen zuzuweisen, was oft zu einer höheren Genauigkeit führt). Während des Trainings können Sie auch eine Domain auswählen, die auf Ihren Anwendungsfall zugeschnitten ist. Die allgemeine Domäne ist ein robuster Ausgangspunkt, aber spezialisierte Domänen wie Food, Landmarks, Retail oder Compact Domains (optimiert für den mobilen und Edge-Export) können die Leistung für bestimmte Szenarien verbessern. Der Trainingsprozess teilt Ihre hochgeladenen Daten automatisch in Trainings- und Testsätze auf, wobei ein Teil zum Erstellen des Modells und der Rest zum Validieren verwendet wird.

Auswertung und Iteration

Nach dem Training bietet Custom Vision eine umfassende Leistungsübersicht. Die wichtigsten Metriken beinhalten Precision (wie viele der Vorhersagen Ihres Modells korrekt waren), Recall (wie viele der tatsächlichen Objekte korrekt gefunden wurden) und Mittelwert der Präzision (mAP) für Objekterkennungsprojekte. Der Dienst generiert auch eine Confusion Matrix, ein leistungsstarkes Tool, das visualisiert, welche Klassen füreinander verwechselt werden. Dies ist von unschätzbarem Wert, um Lücken in Ihren Trainingsdaten zu identifizieren. Wenn das Modell Ihre Genauigkeitsziele nicht erreicht, ist der Weg nach vorne klar: Sammeln Sie mehr Daten für die Klassen mit schlechter Leistung, korrigieren Sie Beschriftungsfehler und umschulen Sie diese iterative Schleife von Trainings-, Bewertungs- und Erweiterungsdaten ist der Kern des Custom Vision-Workflows.

Einsatz

Sobald Sie mit der Leistung des Modells zufrieden sind, können Sie es bereitstellen. Die einfachste Methode ist die Veröffentlichung des Modells in der Cloud, die einen sicheren HTTPS-Endpunkt generiert. Sie senden ein Bild an diesen Endpunkt und es gibt die Vorhersagen zurück. Für Anwendungen mit niedriger Latenz, Offline-Fähigkeit oder Datensouveränität ermöglicht Ihnen Custom Vision, Ihr Modell in verschiedenen Formaten zu exportieren: TensorFlow, , CoreML (für Apple-Geräte) und eine Dockerfile für benutzerdefinierte Container. Diese exportierten Modelle können in mobile Apps, Desktop-Software oder IoT-Edge-Geräte mit Azure IoT Edge integriert werden. Diese Flexibilität stellt sicher, dass Ihre KI überall dort laufen kann, wo sich Ihre Daten befinden.

Fortgeschrittene Fähigkeiten für Produktionssysteme

Neben dem grundlegenden Workflow enthält Custom Vision Funktionen, die für die Wartung und Skalierung von KI-Systemen in der Produktion unerlässlich sind.

Aktives Lernen

Eine der leistungsstärksten Funktionen ist Active Learning. Wenn Sie ein Modell für einen Produktionsendpunkt bereitstellen, kann Custom Vision automatisch Bilder sammeln, bei denen es unsicher ist. Sie können diese "harten Negative" oder mehrdeutigen Bilder regelmäßig direkt im Portal überprüfen, sie beschriften und sie verwenden, um ein robusteres Modell umzuschulen. Dies erzeugt eine Feedbackschleife, die die Leistung des Modells mit realen Daten kontinuierlich verbessert, ohne dass eine manuelle Kuration neuer Trainingssätze erforderlich ist.

Modellexport und Edge Computing

Die Ausführung von KI-Inferenz am Rand ist für Branchen wie die Fertigung und den Einzelhandel von entscheidender Bedeutung, in denen die Netzwerkverbindung nicht garantiert werden kann oder Latenz minimiert werden muss. Die Exportfähigkeiten von Custom Vision ermöglichen es Ihnen, Modelle lokal auf Geräten auszuführen. Zum Beispiel kann ein exportiertes TensorFlow- oder ONNX-Modell in eine mobile App integriert werden, um Anlagen ohne Internetverbindung zu identifizieren, oder ein Docker-Container kann auf einem Fabrikboden-Kamerasystem eingesetzt werden, um Defekte in Echtzeit zu erkennen. Die Compact-Domänen sind speziell dafür optimiert, handeln eine kleine Menge an Genauigkeit für eine deutlich kleinere Modellgröße und schnellere Inferenzgeschwindigkeit.

Real-World-Anwendungen in allen Branchen

Die Vielseitigkeit von Custom Vision macht es für ein breites Spektrum von geschäftlichen Herausforderungen anwendbar.

Einzelhandel und E-Commerce

Einzelhändler verwenden Custom Vision, um die Bestandsverwaltung zu automatisieren, die Planogramm-Compliance zu überprüfen und die visuelle Suche in mobilen Apps zu ermöglichen. Zum Beispiel kann ein Regalbild analysiert werden, um sicherzustellen, dass Produkte korrekt und am richtigen Ort gelagert werden. Im E-Commerce können benutzerdefinierte Modelle hochgeladene Produktbilder automatisch für die Katalogisierung oder moderate benutzergenerierte Inhalte markieren.

Herstellung und Qualitätssicherung

Die visuelle Inspektion ist einer der Anwendungsfälle mit den höchsten Auswirkungen für KI in der Fertigung. Custom Vision-Modelle können trainiert werden, um Oberflächenfehler, Risse, Verfärbungen und Fremdkörper an Montagelinien zu erkennen. Durch den Einsatz dieser Modelle auf Randgeräten, die mit Kameras verbunden sind, können Hersteller eine Qualitätskontrolle in Echtzeit durchführen, Abfall reduzieren und verhindern, dass fehlerhafte Produkte Kunden erreichen.

Healthcare und Life Sciences

Im Gesundheitswesen unterstützen benutzerdefinierte Vision-Modelle die medizinische Bildgebung, wie das Markieren potenzieller Frakturen bei Röntgenstrahlen oder die Analyse von Netzhautscans. Sie werden auch für operative Zwecke verwendet, wie die Überwachung der Einhaltung der Händehygiene oder die Sicherstellung, dass persönliche Schutzausrüstung (PSA) in klinischen Umgebungen korrekt getragen wird. Es ist wichtig zu beachten, dass Custom Vision nicht von der FDA für diagnostische Zwecke freigegeben wird, sondern als leistungsstarkes Hilfsmittel für die Workflow-Optimierung und Voruntersuchung dient.

Landwirtschaft und Umweltwissenschaften

Landwirte und Forscher setzen Custom Vision-Modelle ein, um die Gesundheit von Pflanzen zu überwachen, Schädlingsbefall zu erkennen und Vieh zu zählen. Drohnen, die mit Kameras ausgestattet sind, können Bilder von Feldern aufnehmen, die dann mit einem benutzerdefinierten Modell analysiert werden, um Bereiche zu identifizieren, die Bewässerung oder Pestizidanwendung erfordern. Umweltwissenschaftler verwenden ähnliche Techniken, um Wildtierpopulationen zu verfolgen oder invasive Pflanzenarten durch Kamerafallenbilder zu identifizieren.

Bewertung von Custom Vision: Stärken und Grenzen

Die Wahl des richtigen Tools für ein KI-Projekt erfordert eine ehrliche Bewertung seiner Fähigkeiten.

Stärken: Der Hauptvorteil von Custom Vision ist die Zugänglichkeit. Das No-Code-Portal ermöglicht Fachexperten, die die Daten am besten kennen, aktiv an der Modellerstellung teilzunehmen. Es integriert sich nahtlos in das breitere Azure-Ökosystem, einschließlich Logic Apps, Power Automate und Azure Functions, was die schnelle Erstellung von durchgängig automatisierten Workflows ermöglicht. Die integrierten Iterations- und Active-Learning-Funktionen bieten einen strukturierten Weg zur Produktion, der oft in rohen Machine-Learning-Frameworks fehlt. Schließlich ist die Exportfähigkeit für Edge-Geräte robust und gut dokumentiert, was es zu einer starken Wahl für IoT-Szenarien macht.

Grenzen: Obwohl leistungsstark, ist Custom Vision kein Wundermittel. Es arbeitet innerhalb eines bestimmten Sweet Spots. Für hochspezialisierte Aufgaben, die State-of-the-Art-Performance erfordern und bei denen Sie Zugriff auf große, benutzerdefinierte Datensätze (z. B. 100.000+ Bilder) und Deep-Learning-Know-how haben, wird ein benutzerdefiniertes Modell mit PyTorch oder TensorFlow wahrscheinlich die Standard-Custom Vision-Architekturen übertreffen. Darüber hinaus kann Datenschutz ein Problem darstellen; während Sie Modelle für Edge-Bereitstellung exportieren können, erfordert der primäre Trainingsworkflow das Hochladen Ihrer Daten in die Azure-Cloud. Schließlich ist die Modellinterpretierbarkeit im Vergleich zu einfacheren Machine-Learning-Modellen begrenzt. Um zu verstehen, warum das Modell eine bestimmte Klassifizierung vorgenommen hat, sind häufig externe Tools oder Proxy-Analysen erforderlich.

Custom Vision vs. Alternative Lösungen

Das Verständnis der Landschaft von Computer Vision Tools hilft dabei, die richtige architektonische Entscheidung zu treffen.

Azure Custom Vision vs. Azure Computer Vision API: Die Computer Vision API ist ein vortrainierter Dienst, der allgemeine Aufgaben wie das Lesen von Text (OCR), das Beschreiben von Bildern und das Identifizieren von gemeinsamen Objekten übernehmen kann. Er benötigt keine Trainingsdaten, kann aber nicht auf eindeutige Objekte spezialisiert werden. Custom Vision füllt diese Lücke, indem es Ihnen erlaubt, ein maßgeschneidertes Modell für Ihre spezifischen Daten zu erstellen. Sie können die beiden sogar zusammen verwenden, indem Sie die Computer Vision API zum allgemeinen Szenenverständnis und Custom Vision zur Nischenobjekterkennung verwenden.

Azure Custom Vision vs. Open-Source Frameworks (TensorFlow, PyTorch): Ein Modell von Grund auf neu zu erstellen, bietet maximale Flexibilität und potenzielle Leistung. Allerdings erfordert es ein qualifiziertes ML-Engineering-Team, eine bedeutende Infrastruktur für Schulungen (GPUs) und einen viel größeren Engineering-Aufwand für Bereitstellung und Management. Custom Vision abstrahiert diese Komplexität und reduziert die Zeit bis zur Wertermittlung drastisch. Für die meisten Geschäftsanwendungen, die keine absolute Spitzengenauigkeit bei einem neuartigen Problem erfordern, ist Custom Vision die pragmatischere Wahl.

Azure Custom Vision vs. Other Cloud AutoML (Google AutoML, AWS Rekognition Custom Labels): Das zentrale Wertversprechen ist bei Cloud-Anbietern ähnlich. Die Entscheidung fällt oft auf Ihr bestehendes Cloud-Ökosystem, spezifische Compliance-Anforderungen und Preismodelle an. Azure Custom Vision profitiert von einer engen Integration mit Diensten wie Azure IoT Edge, Logic Apps und dem ONNX-Laufzeit-Ökosystem. Für Unternehmen, die bereits in den Microsoft- und Azure-Stack investiert haben, bietet es den natürlichsten und kostengünstigsten Weg.

Best Practices für eine erfolgreiche Umsetzung

Um den Erfolg Ihres Custom Vision-Projekts zu maximieren, befolgen Sie diese bewährten Richtlinien.

  • Reparieren Sie Ihren Datensatz sorgfältig: Daten sind der wichtigste Faktor. Stellen Sie sicher, dass Ihre Trainingsbilder die gesamte Bandbreite der Variabilität widerspiegeln, die Ihr Modell in der Produktion erleben wird. Fügen Sie Bilder mit unterschiedlichen Hintergründen, Beleuchtungsbedingungen und Kamerawinkeln hinzu. Sammeln und fügen Sie aktiv negative Samples (Bilder, die Ihr Zielobjekt nicht enthalten) ein, um falsch positive Werte zu reduzieren.
  • Balance your classes: Ein Modell, das auf einem Datensatz trainiert wird, bei dem eine Klasse 500 Bilder hat und eine andere nur 50, wird stark auf die größere Klasse ausgerichtet sein. Ziel ist eine ungefähr gleiche Anzahl von Bildern pro Klasse. Wenn Sie nicht mehr Daten für die Minderheitsklasse sammeln können, sollten Sie während des Trainings die Datenerweiterung (die Custom Vision automatisch anwendet) verwenden.
  • Leverage Quick Test: Bevor Sie der Codierung einer Integration viel Zeit widmen, verwenden Sie die Schaltfläche "Quick Test" im Custom Vision-Portal. Damit können Sie ein einzelnes Bild hochladen und die Vorhersagen des Modells sofort sehen. Es ist der schnellste Weg, um zu validieren, ob das Modell Ihre Domain versteht.
  • Planen Sie die Iteration: Ihr erstes Modell wird mit ziemlicher Sicherheit nicht Ihr letztes sein. Erstellen Sie einen Workflow, mit dem Sie neue Daten sammeln, beschriften und das Modell nahtlos umschulen können. Verwenden Sie die Funktion Aktives Lernen, um Daten effizient zu identifizieren, die die Genauigkeit Ihres Modells am besten verbessern.
  • Betrachten Sie die Compact Domain für Edge: Wenn Sie vorhaben, Ihr Modell für mobile oder Edge-Geräte zu exportieren, verwenden Sie die Compact Domain von Anfang an. Um später Domains zu wechseln, müssen Sie Ihr Modell von Grund auf mit der ausgewählten Domain neu schulen.

Schlussfolgerung

Azure Cognitive Services Custom Vision demokratisiert den Zugang zu leistungsstarker visueller KI. Durch den Umgang mit der Komplexität von Modellschulungen und -bereitstellung können sich Unternehmen auf ihre Kernanwendungsfälle konzentrieren, von der Automatisierung visueller Inspektionen bis hin zur Verbesserung der Kundenerfahrung. Während es wichtig ist, die Grenzen zu verstehen und das richtige Tool für den Job auszuwählen, bleibt Custom Vision eine der effizientesten und zugänglichsten Möglichkeiten, die Leistungsfähigkeit der benutzerdefinierten Bilderkennung in die Produktion zu bringen. Für jedes Unternehmen, das umsetzbare Erkenntnisse aus visuellen Daten ableiten möchte, ist der Start eines Pilotprojekts mit Custom Vision eine risikoarme, hochkarätige Strategie.