Présentation

La vision informatique est l'une des branches les plus transformatrices de l'intelligence artificielle, permettant aux machines d'interpréter et de prendre des décisions basées sur des données visuelles. Pour les entreprises, la capacité d'analyser automatiquement les images et les flux vidéo permet de réaliser des gains d'efficacité dans le contrôle de la qualité, la gestion des stocks, la sécurité et l'expérience client. Cependant, la construction d'un modèle de reconnaissance d'image personnalisé à partir de zéro nécessite une expertise approfondie dans l'apprentissage automatique, des ressources informatiques importantes et une ingénierie des données longue.

Qu'est-ce que Azure Cognitive Services Custom Vision?

A la différence de l'API de vision informatique générale, qui permet d'identifier des objets communs, des célébrités, des repères et du texte, Custom Vision vous permet de former un modèle spécifique à votre domaine unique. Que vous ayez besoin d'identifier un défaut rare sur une carte de circuit, une espèce spécifique d'usine ou un produit particulier sur une tablette de vente au détail, Custom Vision s'adapte à vos données.

Le service permet de transférer l'apprentissage, une technique où un réseau neuronal pré-formé est adapté à votre jeu de données personnalisé. Cela réduit considérablement le temps de formation et de données requis par rapport à la construction d'un modèle à partir de zéro. Avec Custom Vision, vous pouvez soit utiliser le portail intuitif sans code pour des projets simples ou utiliser l'API programmatique pour contrôler pleinement le cycle de vie de la formation. La sortie est un paramètre de l'API REST évolutive ou un modèle exporté qui peut fonctionner localement sur des périphériques de bord. Il prend en charge deux types de projets principaux : Classification d'image (assignant une ou plusieurs étiquettes à une image entière) et Détection d'objets (déplacement d'objets spécifiques dans une image et dessinant des boîtes limitatrices autour d'eux).

Le flux de travail de base de la vision personnalisée

La conception d'un modèle de vision personnalisé suit un pipeline structuré et itératif. La compréhension de chaque étape est essentielle pour réaliser un modèle prêt à la production.

Collecte de données et étiquetage

Pour chaque catégorie d'étiquettes ou d'objets que vous souhaitez reconnaître, vous devriez viser un minimum de 50 images représentatives. Des objets plus complexes ou variables peuvent nécessiter des centaines d'images. Les meilleures pratiques comprennent la capture d'images avec des arrière-plans variés, des conditions d'éclairage variables, des angles différents et les variations d'échelle typiques que votre application rencontrera. Pour la détection d'objets, chaque image doit être étiquetée en étiquetant l'image et en dessinant des boîtes de délimitation autour de chaque instance de l'objet. Custom Vision prend en charge les formats JPEG, PNG, BMP et WEBP. L'étiquetage peut être effectué directement dans le portail Custom Vision ou exporté à partir d'outils d'étiquetage tiers utilisant les formats COCO ou Pascal COV.

Formation modèle

Une fois vos images téléchargées et étiquetées, vous commencez l'entraînement. Custom Vision offre deux options de formation : Entraînement rapide (qui utilise des hyperparamètres par défaut et des trains rapidement pour le prototypage) et Entraînement avancé (qui vous permet d'allouer des heures de calcul pour une formation plus approfondie, ce qui entraîne souvent une précision plus élevée). Pendant la formation, vous pouvez également sélectionner un Domain adapté à votre cas d'utilisation. Le domaine général est un point de départ solide, mais des domaines spécialisés comme les aliments, les repères, le commerce de détail ou les domaines compacts (optimisés pour l'exportation mobile et bord) peuvent améliorer les performances pour des scénarios spécifiques.

Évaluation et itération

Après la formation, Custom Vision fournit un résumé complet des performances. Les principales mesures comprennent Précision (combien de prédictions de votre modèle étaient correctes), Reappel (combien d'objets réels ont été trouvés correctement), et Précision moyenne (mAP)[] pour les projets de détection d'objets. Le service génère également une matrice de confusion[, un outil puissant qui permet de visualiser les classes qui se trompent les unes les autres. Ceci est inestimable pour identifier les lacunes dans vos données de formation.

Déploiement

Une fois que vous êtes satisfait des performances du modèle, vous pouvez le déployer. La méthode la plus simple est la publication du modèle dans le cloud, qui génère un paramètre HTTPS sécurisé. Vous envoyez une image à ce paramètre, et il renvoie les prédictions. Pour les applications nécessitant une faible latence, une capacité hors ligne, ou la souveraineté des données, Custom Vision vous permet d'exporter votre modèle dans plusieurs formats : TensorFlow, ONNX, CoreML[ (pour les appareils Apple), et Dockerfile[ pour les conteneurs personnalisés. Ces modèles exportés peuvent être intégrés dans des applications mobiles, des logiciels de bureau ou des périphériques IoT fonctionnant à Azure IoT Edge. Cette flexibilité garantit que votre AI peut fonctionner partout où vos données vivent.

Capacités avancées pour les systèmes de production

Au-delà du flux de travail de base, Custom Vision comprend des fonctionnalités essentielles pour maintenir et à l'échelle des systèmes de production d'IA.

Apprentissage actif

Une des caractéristiques les plus puissantes est Active Learning. Lorsque vous déployez un modèle sur un point de production, Custom Vision peut automatiquement collecter des images dont il est incertain. Vous pouvez régulièrement revoir ces "graves négatifs" ou des images ambiguës directement dans le portail, les inscrire et les utiliser pour recycler un modèle plus robuste. Cela crée une boucle de rétroaction qui améliore continuellement les performances du modèle sur les données du monde réel sans nécessiter la mise en place manuelle de nouveaux ensembles de formation.

Modèle Export et calcul des bords

L'inférence AI est essentielle pour les industries comme la fabrication et le commerce de détail, où la connectivité réseau ne peut être garantie ou latence doit être minimisée. Les capacités d'exportation de Custom Vision vous permettent d'exécuter des modèles localement sur des appareils. Par exemple, un modèle TensorFlow ou ONNX exporté peut être intégré dans une application mobile pour identifier des usines sans connexion Internet, ou un conteneur Docker peut être déployé sur un système de caméra au sol d'usine pour détecter des défauts en temps réel.

Applications du monde réel dans toutes les industries

La polyvalence de Custom Vision la rend applicable à un large éventail de défis commerciaux.

Commerce de détail et électronique

Les détaillants utilisent Custom Vision pour automatiser la gestion des stocks, vérifier la conformité des planogrammes et alimenter la recherche visuelle dans les applications mobiles. Par exemple, une image d'étagère de magasin peut être analysée pour s'assurer que les produits sont correctement stockés et au bon endroit.

Fabrication et assurance de la qualité

L'inspection visuelle est l'un des cas d'utilisation les plus touchés pour l'IA dans la fabrication. Les modèles de vision personnalisée peuvent être formés pour identifier les défauts de surface, les fissures, la décoloration et les objets étrangers sur les lignes de montage.

Santé et sciences de la vie

Dans le domaine des soins de santé, les modèles de vision personnalisés aident à trier l'imagerie médicale, comme les fractures potentielles de balisage dans les rayons X ou l'analyse des scans rétiniens. Ils sont également utilisés à des fins opérationnelles, comme la surveillance de la conformité à l'hygiène des mains ou la garantie que l'équipement de protection individuelle (EPI) est porté correctement dans les environnements cliniques.

Agriculture et sciences de l'environnement

Les drones équipés de caméras peuvent capturer des images de champs, qui sont ensuite analysées par un modèle personnalisé pour identifier les zones nécessitant une irrigation ou une application de pesticides. Les spécialistes de l'environnement utilisent des techniques similaires pour suivre les populations de la faune ou identifier les espèces végétales envahissantes au moyen d'images de pièges à caméra.

Évaluation de la vision personnalisée : forces et limites

Choisir le bon outil pour un projet d'IA exige une évaluation honnête de ses capacités.

Strengths: Le principal avantage de Custom Vision est son accessibilité. Le portail sans code permet aux experts en matière de données, qui connaissent le mieux les données, de participer activement à la création de modèles. Il s'intègre parfaitement à l'écosystème d'Azure, y compris les applications logiques, les fonctions Power Automate et Azure, permettant la création rapide de flux de travail automatisés de bout en bout. Les fonctionnalités d'itération et d'apprentissage actif intégrées offrent un chemin structuré vers la production qui est souvent manquant dans les cadres d'apprentissage machine bruts. Enfin, la capacité d'exportation des appareils de bord est robuste et bien documentée, ce qui en fait un choix fort pour les scénarios IoT.

Limitations: Bien que puissant, Custom Vision n'est pas une balle d'argent. Il fonctionne dans un endroit doux spécifique. Pour des tâches hautement spécialisées qui nécessitent des performances de pointe et où vous avez accès à de grands ensembles de données personnalisés (p. ex., 100 000 images+) et une expertise d'apprentissage profond, un modèle sur mesure utilisant PyTorch ou TensorFlow est susceptible de surperformer les architectures de Custom Vision par défaut. De plus, la confidentialité des données peut être une préoccupation; tandis que vous pouvez exporter des modèles pour le déploiement de bords, le flux de travail de formation primaire nécessite le téléchargement de vos données dans le cloud Azure. Enfin, la capacité d'interprétation des modèles est limitée par rapport aux modèles d'apprentissage automatique plus simples.

Vision personnalisée par rapport aux solutions alternatives

Comprendre le paysage des outils de vision assistée par ordinateur aide à prendre la bonne décision architecturale.

Azure Custom Vision vs. Azure Computer Vision API: L'API Computer Vision est un service pré-formé qui peut gérer des tâches générales comme la lecture de texte (OCR), la description d'images et l'identification d'objets communs. Il ne nécessite aucune donnée de formation mais ne peut pas être spécialisé pour des objets uniques. Custom Vision comble cette lacune en vous permettant de construire un modèle sur mesure pour vos données spécifiques. Vous pouvez même utiliser les deux ensemble, en utilisant l'API Computer Vision pour la compréhension de la scène générale et Custom Vision pour la détection d'objets niche.

[FLT:][FLT:][FLT:][FLT:][FLT:][FLT:][FLT:][FLT:][FLT:][FLT:][FLT:][FLT:][FLT:][FLT:][FLT:][FLT:][FLT:][FLT:][FLT:][FLT:][FLT:][FLT:][FLT:][FLT:][FLT:][FLT:][FLT:][FLT:][FLT:][FLT:][FLT:][FLT:][FLT:][FLT:][FLT:][FLT:][FLT:][FLT:][FLT:][F][F][FLT:][F]

Azure Custom Vision vs. Other Cloud AutoML (Google AutoML, AWS Rekognition Custom Labels):[ La proposition de valeur de base est similaire dans les fournisseurs de cloud. La décision revient souvent à votre écosystème cloud existant, des exigences de conformité spécifiques, et des modèles de prix. Azure Custom Vision bénéficie d'une intégration étroite avec des services tels que Azure IoT Edge, Logic Apps, et l'écosystème d'exécution ONNX. Pour les organisations déjà investies dans la pile Microsoft et Azure, il fournit le chemin le plus naturel et le plus rentable.

Pratiques exemplaires pour une mise en œuvre réussie

Pour maximiser le succès de votre projet Custom Vision, suivez ces lignes directrices éprouvées.

  • Curez soigneusement votre jeu de données: Les données sont le facteur le plus critique. Assurez-vous que vos images d'entraînement reflètent la gamme complète de variabilité que votre modèle rencontrera dans la production. Inclure des images avec différents milieux, conditions d'éclairage et angles de caméra.
  • Balance vos classes: Un modèle formé sur un ensemble de données où une classe a 500 images et une autre seulement 50 sera fortement biaisé vers la classe plus grande. Visez un nombre à peu près égal d'images par classe. Si vous ne pouvez pas recueillir plus de données pour la classe minoritaire, envisagez d'utiliser l'augmentation de données (qui s'applique automatiquement à Custom Vision) pendant l'entraînement.
  • Leverage Quick Test:[ Avant de consacrer beaucoup de temps au codage d'une intégration, utilisez le bouton «Test rapide» dans le portail de la vision personnalisée. Cela vous permet de télécharger une seule image et de voir les prédictions du modèle immédiatement. C'est la manière la plus rapide de valider si le modèle comprend votre domaine.
  • Plan pour l'itération:[ Votre premier modèle ne sera presque certainement pas votre dernier. Construisez un workflow qui vous permet de collecter de nouvelles données, de les étiquetter et de reformer le modèle de manière transparente. Utilisez la fonctionnalité Active Learning pour identifier efficacement les données qui amélioreront le plus la précision de votre modèle.
  • Considérez le domaine Compact pour Edge: Si vous prévoyez d'exporter votre modèle pour des appareils mobiles ou bords, utilisez le domaine Compact dès le début. Le changement de domaine nécessite ensuite de recycler votre modèle à partir de zéro avec le domaine choisi.

Conclusion

Azure Cognitive Services Custom Vision démocratise l'accès à une puissante AI visuelle. En gérant la complexité de la formation et du déploiement des modèles, elle permet aux entreprises de se concentrer sur leurs cas d'utilisation de base, de l'automatisation des inspections visuelles à l'amélioration de l'expérience client. Bien qu'il soit essentiel de comprendre ses limites et de choisir l'outil approprié pour le travail, Custom Vision demeure l'un des moyens les plus efficaces et accessibles pour apporter le pouvoir de la reconnaissance d'image personnalisée à la production.