Azure Cognitive Services Пользовательское видение для приложений распознавания изображений

Введение

Компьютерное зрение является одной из самых преобразующих отраслей искусственного интеллекта, позволяющей машинам интерпретировать и принимать решения на основе визуальных данных. Для бизнеса возможность автоматического анализа изображений и видеопотоков разблокирует эффективность в контроле качества, управлении запасами, безопасности и клиентском опыте. Однако создание пользовательской модели распознавания изображений с нуля требует глубоких знаний в области машинного обучения, значительных вычислительных ресурсов и трудоемкой обработки данных. Azure Cognitive Services Custom Vision устраняет этот разрыв, предоставляя разработчикам и экспертам домена возможность обучать, развертывать и повторять на высокопроизводительных классификаторах изображений и детекторах объектов без необходимости управления сложной инфраструктурой глубокого обучения. Он обеспечивает быстрый путь к производству для широкого спектра визуальных приложений ИИ.

Что такое Azure Cognitive Services Custom Vision?

Azure Custom Vision — это полностью управляемый облачный сервис распознавания изображений, являющийся частью платформы Azure AI. В отличие от универсального API Computer Vision, который отлично подходит для идентификации общих объектов, знаменитостей, ориентиров и текста, Custom Vision позволяет обучать модель специально для вашего уникального домена. Независимо от того, нужно ли идентифицировать редкий дефект на плате, конкретном виде растения или конкретном продукте на розничной полке, Custom Vision адаптируется к вашим данным.

Сервис использует обучение передаче, технику, при которой предварительно обученная нейронная сеть настраивается на ваш пользовательский набор данных. Это резко сокращает количество данных и время обучения, необходимое по сравнению с созданием модели с нуля. С помощью Custom Vision вы можете либо использовать интуитивно понятный портал без кода для простых проектов, либо использовать программный API для полного контроля над жизненным циклом обучения. Выходом является масштабируемая конечная точка REST API или экспортируемая модель, которая может работать локально на периферийных устройствах. Он поддерживает два основных типа проекта: Классификация изображений (назначение одной или нескольких меток на целое изображение) и Обнаружение объектов (локация конкретных объектов в изображении и рисование ограничивающих коробок вокруг них).

Основной рабочий процесс пользовательского видения

Создание модели индивидуального видения следует за структурированным итеративным конвейером. Понимание каждого этапа имеет решающее значение для достижения готовой к производству модели.

Сбор и маркировка данных

Качество и количество ваших обучающих данных напрямую диктуют производительность вашей модели. Для каждого класса ярлыков или объектов, которые вы хотите распознать, вы должны стремиться к минимуму 50 репрезентативным изображениям. Более сложные или переменные объекты могут потребовать сотни изображений. Лучшие практики включают захват изображений с различными фонами, различными условиями освещения, различными углами и типичными вариациями масштаба, с которыми столкнется ваше приложение. Для обнаружения объектов каждое изображение должно быть помечено пометкой изображения и рисованием ограничивающих коробок вокруг каждого экземпляра объекта. Пользовательское зрение поддерживает форматы JPEG, PNG, BMP и WEBP. Маркировка может выполняться непосредственно в портале пользовательского видения или экспортироваться из сторонних инструментов маркировки с использованием форматов COCO или Pascal VOC.

Модель обучения

После загрузки и пометки изображений вы начинаете обучение. Custom Vision предлагает два варианта обучения: Quick Training (который использует гиперпараметры по умолчанию и быстро тренируется для прототипирования) и Advanced Training (который позволяет вам выделять вычислительные часы для более тщательного обучения, часто приводя к более высокой точности.Домен , адаптированный к вашему случаю использования. Общий домен является надежной отправной точкой, но специализированные домены, такие как Food, Landmarks, Retail или Compact домены (оптимизированные для мобильного и краевого экспорта) могут улучшить производительность для конкретных сценариев. Процесс обучения автоматически разделяет загруженные данные на наборы обучения и тестирования, используя часть для создания модели и оставшуюся часть для проверки.

Оценка и итерация

После завершения обучения Custom Vision предоставляет всеобъемлющую сводку производительности. Ключевые показатели включают в себя Пренциальность (сколько предсказаний вашей модели были правильными), Перезвоните (сколько фактических объектов были правильно найдены) и Средняя средняя точность (mAP) Средний средний показатель точности (mAP)]Служба также генерирует Матрицу путаницы , мощный инструмент, который визуализирует, какие классы ошибочно принимаются друг за друга.Это бесценно для выявления пробелов в ваших тренировочных данных. Если модель не соответствует вашим целям точности, путь вперед ясен: собрать больше данных для классов с плохой производительностью, правильные ошибки маркировки и переобучение. Этот итеративный цикл обучения, оценки и увеличения данных является ядром рабочего процесса пользовательского видения.

Развертывание

После того, как вы удовлетворены производительностью модели, вы можете развернуть ее. Самый простой метод - публикация модели в облако, которое генерирует безопасную конечную точку HTTPS. Вы отправляете изображение на эту конечную точку и возвращаете прогнозы. Для приложений, требующих низкой задержки, автономной возможности или суверенитета данных, Custom Vision позволяет экспортировать вашу модель в нескольких форматах: TensorFlow , ONNX , CoreML (для устройств Apple) и Dockerfile для пользовательских контейнеров. Эти экспортируемые модели могут быть интегрированы в мобильные приложения, настольное программное обеспечение или периферийные устройства IoT, работающие на Azure IoT Edge. Эта гибкость гарантирует, что ваш ИИ может работать везде, где живут ваши данные.

Расширенные возможности производственных систем

Помимо основного рабочего процесса, Custom Vision включает в себя функции, которые необходимы для поддержания и масштабирования производственных систем ИИ.

Активное обучение

Одной из самых мощных функций является Active Learning. При развертывании модели на производственной конечной точке Custom Vision может автоматически собирать изображения, о которых неизвестно. Можно периодически просматривать эти «жесткие негативы» или неоднозначные изображения прямо на портале, маркировать их и использовать для переобучения более надежной модели. Это создает цикл обратной связи, который непрерывно улучшает производительность модели на реальных данных, не требуя ручного курирования новых наборов обучения.

Модель экспорта и Edge Computing

Запуск вывода ИИ на периферии имеет решающее значение для таких отраслей, как производство и розничная торговля, где невозможно гарантировать сетевое подключение или необходимо минимизировать задержку. Экспортные возможности Custom Vision позволяют запускать модели локально на устройствах. Например, экспортируемая модель TensorFlow или ONNX может быть интегрирована в мобильное приложение для идентификации заводов без подключения к Интернету, или контейнер Docker может быть развернут на системе камеры заводского пола для обнаружения дефектов в режиме реального времени. Компактные домены специально оптимизированы для этого, торгуя небольшим количеством точности для значительно меньшего размера модели и более быстрой скорости вывода.

Реальные приложения в разных отраслях

Универсальность Custom Vision делает его применимым к широкому спектру бизнес-задач.

Розничная торговля и электронная коммерция

Розничные торговцы используют Custom Vision для автоматизации управления запасами, проверки соответствия планограмме и визуального поиска мощности в мобильных приложениях. Например, изображение полки магазина можно анализировать, чтобы убедиться, что продукты хранятся правильно и в нужном месте. В электронной коммерции пользовательские модели могут автоматически помечать загруженные изображения продуктов для каталогизации или умеренного пользовательского контента.

Производство и обеспечение качества

Визуальный осмотр является одним из наиболее эффективных вариантов использования ИИ в производстве. Модели пользовательского зрения могут быть обучены для выявления дефектов поверхности, трещин, обесцвечивания и посторонних объектов на сборочных линиях. Развернув эти модели на периферийных устройствах, подключенных к камерам, производители могут выполнять контроль качества в режиме реального времени, уменьшая отходы и предотвращая попадание неисправных продуктов к клиентам.

Здравоохранение и наука о жизни

В здравоохранении пользовательские модели зрения помогают в медицинской сортировке изображений, например, помечают потенциальные переломы в рентгеновских лучах или анализируют сканирование сетчатки. Они также используются в оперативных целях, таких как мониторинг соблюдения гигиены рук или обеспечение правильной ношения средств индивидуальной защиты (СИЗ) в клинических условиях. Важно отметить, что Custom Vision не очищается FDA для диагностических целей, но служит мощным вспомогательным инструментом для оптимизации рабочего процесса и предварительного скрининга.

Сельское хозяйство и наука об окружающей среде

Фермеры и исследователи внедряют модели Custom Vision для мониторинга здоровья сельскохозяйственных культур, выявления заражений вредителями и подсчета скота. Дроны, оснащенные камерами, могут захватывать изображения полей, которые затем анализируются по заказной модели для выявления областей, требующих применения ирригации или пестицидов. Ученые-экологи используют аналогичные методы для отслеживания популяций диких животных или выявления инвазивных видов растений с помощью изображений с помощью камеры-ловушки.

Оценка пользовательского видения: сильные и ограниченные стороны

Выбор правильного инструмента для проекта ИИ требует честной оценки его возможностей.

Сильные стороны: Основным преимуществом Custom Vision является его доступность. Портал без кода позволяет экспертам по предметам, которые лучше всего знают данные, активно участвовать в создании моделей. Он легко интегрируется с более широкой экосистемой Azure, включая Logic Apps, Power Automate и Azure Functions, что позволяет быстро создавать сквозные автоматизированные рабочие процессы. Встроенные функции итерации и активного обучения обеспечивают структурированный путь к производству, который часто отсутствует в сырых средах машинного обучения. Наконец, экспортные возможности для периферийных устройств надежны и хорошо документированы, что делает его сильным выбором для сценариев IoT.

Ограничения: Хотя Custom Vision и является мощным, он работает в пределах конкретного сладкого пятна. Для узкоспециализированных задач, требующих современной производительности и где у вас есть доступ к большим пользовательским наборам данных (например, 100 000+ изображений) и опыту глубокого обучения, специально построенная модель с использованием архитектуры PyTorch или TensorFlow, вероятно, превзойдет стандартную архитектуру Custom Vision. Кроме того, конфиденциальность данных может быть проблемой; в то время как вы можете экспортировать модели для развертывания на периферии, основной рабочий процесс обучения требует загрузки ваших данных в облако Azure. Наконец, интерпретируемость модели ограничена по сравнению с более простыми моделями машинного обучения. Понимание * почему * модель, сделанная конкретной классификацией, часто требует внешних инструментов или анализа прокси.

Custom Vision vs. Альтернативные решения

Понимание ландшафта инструментов компьютерного зрения помогает в принятии правильного архитектурного решения.

Azure Custom Vision vs. Azure Computer Vision API: API Computer Vision — это предварительно обученный сервис, который может обрабатывать общие задачи, такие как чтение текста (OCR), описание изображений и идентификация общих объектов. Он не требует данных обучения, но не может быть специализированным для уникальных объектов. Custom Vision заполняет этот пробел, позволяя вам создавать индивидуальную модель для ваших конкретных данных. Вы даже можете использовать их вместе, используя API Computer Vision для общего понимания сцены и Custom Vision для обнаружения нишевых объектов.

Azure Custom Vision vs. Open-Source Frameworks (TensorFlow, PyTorch): Построение модели с нуля в фреймворке с открытым исходным кодом обеспечивает максимальную гибкость и потенциальную производительность. Однако для этого требуется квалифицированная команда инженеров ML, значительная инфраструктура для обучения (GPU) и гораздо более крупные инженерные усилия для развертывания и управления. Custom Vision абстрагирует эту сложность, резко сокращая время до ценности. Для большинства бизнес-приложений, которые не требуют абсолютной пиковой точности по новой проблеме, Custom Vision является более прагматичным выбором.

Azure Custom Vision vs. Other Cloud AutoML (Google AutoML, AWS Rekognition Custom Labels): Основное ценовое предложение аналогично для облачных провайдеров. Решение часто сводится к существующей облачной экосистеме, конкретным требованиям соответствия и моделям ценообразования. Azure Custom Vision выигрывает от тесной интеграции с такими сервисами, как Azure IoT Edge, Logic Apps и экосистема времени выполнения ONNX. Для организаций, уже инвестирующих в стек Microsoft и Azure, он обеспечивает наиболее естественный и экономически эффективный путь.

Лучшие практики для успешной реализации

Чтобы максимизировать успех вашего проекта Custom Vision, следуйте этим проверенным рекомендациям.

Заключение

Azure Cognitive Services Custom Vision демократизирует доступ к мощному визуальному ИИ. Обрабатывая сложности обучения и развертывания моделей, он позволяет предприятиям сосредоточиться на своих основных вариантах использования, от автоматизации визуальных проверок до повышения качества обслуживания клиентов. Хотя важно понимать его ограничения и выбирать правильный инструмент для работы, Custom Vision остается одним из самых эффективных и доступных способов привнести силу распознавания изображений на заказ в производство. Для любой организации, стремящейся получить действенные идеи из визуальных данных, запуск пилотного проекта с Custom Vision является стратегией с низким риском и высокой наградой.