Introducción

La visión informática es una de las ramas más transformadoras de la inteligencia artificial, permitiendo a las máquinas interpretar y tomar decisiones basadas en datos visuales. Para las empresas, la capacidad de analizar imágenes y secuencias de vídeo desbloquea eficiencias en control de calidad, gestión de inventarios, seguridad y experiencia de los clientes. Sin embargo, la construcción de un modelo personalizado de reconocimiento de imágenes desde cero requiere una amplia experiencia en el aprendizaje automático, recursos computacionales significativos y la ingeniería de datos de tiempo.

¿Qué es Azure Cognitive Services Custom Vision?

Azure Custom Vision es un servicio de reconocimiento de imagen totalmente gestionado y basado en la nube que forma parte de la plataforma Azure AI. A diferencia de la API de visión de ordenador de uso general, que se destaca en la identificación de objetos comunes, celebridades, hitos y texto, Custom Vision le permite formar un modelo específicamente para su dominio único. Ya sea que necesite identificar un defecto raro en una placa de circuito, una especie específica de planta, o un producto en particular para adaptar sus datos de venta al porta de venta al portatil.

El servicio aprovecha el aprendizaje de transferencia, una técnica en la que una red neuronal pre-entrenada está bien ajustada en su conjunto de datos personalizados. Esto reduce drásticamente la cantidad de datos y el tiempo de entrenamiento requerido en comparación con la construcción de un modelo desde cero. Con Custom Vision, puede utilizar el portal intuitivo de códigos para proyectos simples o aprovechar la API programática para controlar completamente el ciclo de vida de entrenamiento.

El flujo de trabajo básico de la visión personalizada

La construcción de un modelo de visión personalizada sigue un oleoducto estructurado e iterativo. Entender cada etapa es fundamental para lograr un modelo listo para la producción.

Recopilación de datos y etiquetado

La calidad y la cantidad de sus datos de entrenamiento directamente dictan el rendimiento de su modelo. Para cada etiqueta o clase de objeto que desee reconocer, debe apuntar a un mínimo de 50 imágenes representativas. Objetos más complejos o variables pueden requerir cientos de imágenes. Las mejores prácticas incluyen capturar imágenes con diversos fondos, condiciones de iluminación variables, ángulos diferentes y variaciones de la escala típica que encontrará su aplicación.

Modelo de capacitación

Una vez que sus imágenes se suben y etiquetan, inicia la formación. Custom Vision ofrece dos opciones de entrenamiento: Entrenamiento rápido (que utiliza hiperparametros y trenes predeterminados rápidamente para prototipar) y Formación avanzada (que permite asignar horas de computación para una formación más completa, a menudo resultando en mayor precisión).

Evaluación e Iteración

Después de completar el entrenamiento, Custom Vision proporciona un resumen de rendimiento completo. Las métricas clave incluyen Precisión (cuántas de las predicciones de su modelo fueron correctas), Recall (cuántas de los objetos reales fueron encontrados correctamente) y Mean Precisión media (mAP6][FLT6]

Despliegue

[LT] Los dispositivos de escritorio integrados de IFX [LT] pueden ser utilizados por el modelo, y se pueden utilizar para el uso de los dispositivos de ITTPS. Para aplicaciones que requieren una baja latencia, capacidad de conexión o soberanía de datos, Custom Vision permite exportar su modelo en varios formatos:

Capacidades avanzadas para sistemas de producción

Más allá del flujo de trabajo básico, Custom Vision incluye características que son esenciales para mantener y escalar sistemas de producción de IA.

Aprendizaje activo

Una de las características más poderosas es el aprendizaje activo. Cuando implementas un modelo a un punto final de producción, Custom Vision puede recopilar automáticamente imágenes que no está segura. Puedes revisar periódicamente estas imágenes "divas duras" o ambiguas directamente en el portal, etiquetarlas y utilizarlas para reentrenar un modelo más robusto. Esto crea un circuito de retroalimentación que mejora continuamente el rendimiento del modelo en datos reales sin requerir curación manual de nuevos conjuntos de entrenamiento.

Exportación de modelos y computación de bordes

La inferencia de IA en el borde es crítica para industrias como la fabricación y el comercio minorista, donde la conectividad de red no puede garantizarse o latencia debe minimizarse. Las capacidades de exportación de Custom Vision le permiten ejecutar modelos localmente en dispositivos. Por ejemplo, un modelo de TensorFlow o ONNX exportado puede integrarse en una aplicación móvil para identificar plantas sin conexión a Internet, o un contenedor Docker puede ser desplegado en un sistema de cámara de tiempo de tiempo real para detectar defectos.

Aplicaciones en el mundo real en todas las industrias

La versatilidad de la Visión Aduanera hace que sea aplicable a un amplio espectro de desafíos empresariales.

Comercio electrónico y de comercio electrónico

Los minoristas utilizan Custom Vision para automatizar la gestión de inventarios, verificar el cumplimiento de planogramas y la búsqueda visual de potencia en aplicaciones móviles. Por ejemplo, se puede analizar una imagen de estantería de la tienda para asegurar que los productos se almacenan correctamente y en la ubicación correcta. En el comercio electrónico, los modelos personalizados pueden etiquetar automáticamente las imágenes de productos subidas para catalogar o contenido generado por el usuario moderado.

Manufactura y garantía de calidad

La inspección visual es uno de los casos de uso más potentes para la IA en la fabricación. Los modelos de Visión Personalizada pueden ser entrenados para identificar defectos superficiales, grietas, decoloración y objetos extranjeros en las líneas de montaje. Al implementar estos modelos en dispositivos de borde conectados a cámaras, los fabricantes pueden realizar control de calidad en tiempo real, reduciendo los residuos y evitando que los productos defectuosos lleguen a los clientes.

Salud y Ciencias de la Vida

En la salud, los modelos de visión personalizada ayudan en la triage de imágenes médicas, como las posibles fracturas en rayos X o el análisis de los escaneos retinales. También se utilizan para fines operacionales, como el monitoreo del cumplimiento de la higiene de las manos o la garantía de que el equipo de protección personal (PPE) se usa correctamente en entornos clínicos. Es importante señalar que la Visión Personalizada no está limpiada para fines diagnósticos, sino que sirve como una poderosa herramienta de prepantalla para optimizar el flujo de trabajo.

Agricultura y Ciencias Ambientales

Los agricultores e investigadores están implementando modelos de Visión Personalizada para monitorear la salud de cultivos, detectar plagas y contar ganado. Los doctores equipados con cámaras pueden capturar imágenes de campos, que luego son analizados por un modelo personalizado para identificar áreas que requieren riego o aplicación de pesticidas. Los científicos ambientales utilizan técnicas similares para rastrear poblaciones de fauna o identificar especies de plantas invasivas a través de imágenes de trampa de cámara.

Evaluación de la Visión Personalizada: Fuerza y limitaciones

Elegir la herramienta adecuada para un proyecto AI requiere una evaluación honesta de sus capacidades.

Fortaleza: La principal ventaja de Custom Vision es su accesibilidad. El portal de códigos permite a expertos de materias, que conocen los datos mejor, participar activamente en la creación de modelos. Integra perfectamente con el ecosistema de Azure más amplio, incluyendo las aplicaciones Logic, Power Automate y Azure Functions, permitiendo la rápida creación de caminos de trabajo automatizados de punta a punta.

Limitations: Aunque es potente, Custom Vision no es una bala de plata. Funciona dentro de un punto dulce específico. Para tareas altamente especializadas que requieren un rendimiento de vanguardia y donde tiene acceso a conjuntos de datos grandes y personalizados (por ejemplo, 100.000 imágenes) y experiencia de aprendizaje profundo, un modelo personalizado usando PyTorch o TensorFlow es probable que se despliegue por defecto

Custom Vision vs. Alternative Solutions

Comprender el paisaje de herramientas de visión informática ayuda a tomar la decisión arquitectónica correcta.

Azure Custom Vision vs. Azure Computer Vision API: La API de Computer Vision es un servicio pre-entrenado que puede manejar tareas generales como leer texto (OCR), describir imágenes e identificar objetos comunes. No requiere datos de entrenamiento, pero no puede ser especializado para objetos únicos. Custom Vision llena esta brecha al permitirle construir un modelo a medida para su detección de objetos específicos.

Azure Custom Vision vs. Open-Source Frameworks (TensorFlow, PyTorch): Construir un modelo desde cero en un marco de código abierto ofrece máxima flexibilidad y rendimiento potencial. Sin embargo, requiere un equipo de ingeniería ML cualificado, infraestructura significativa para la formación (GPUs), y un esfuerzo de ingeniería mucho mayor para el despliegue y la gestión.

Azure Custom Vision vs. Other Cloud AutoML (Google AutoML, AWS Rekognition Custom Labels): La propuesta de valor básico es similar en los proveedores de la nube. La decisión a menudo se reduce a su ecosistema de la nube existente, requisitos de cumplimiento específicos y modelos de precios. Azure Custom Vision se beneficia de una integración estrecha con servicios como Azure IoTge, el sistema de gestión de aplicaciones lógicas

Buenas prácticas para una aplicación exitosa

Para maximizar el éxito de su proyecto Custom Vision, siga estas directrices probadas.

  • Cuarta cuidadosamente tu conjunto de datos: Los datos son el factor más crítico. Asegúrese de que tus imágenes de entrenamiento reflejen la gama completa de variabilidad que tu modelo encontrará en la producción. Incluya imágenes con diferentes orígenes, condiciones de iluminación y ángulos de cámara. Recopila y incluye muestras negativas (imagenes que no contienen tu objeto objetivo) para reducir falsos positivos.
  • Mejorar sus clases: Un modelo formado en un conjunto de datos donde una clase tiene 500 imágenes y otra tiene sólo 50 serán fuertemente sesgados hacia la clase más grande. Objetivo para un número aproximado de imágenes por clase. Si no puede recopilar más datos para la clase minoritaria, considere utilizar la ampliación de datos (que Custom Vision se aplica automáticamente) durante el entrenamiento.
  • Probación rápida de la palanca: Antes de dedicar tiempo significativo a la codificación de una integración, utilice el botón "prueba rápida" en el portal de Visión Personalizada. Esto le permite subir una imagen única y ver las predicciones del modelo inmediatamente. Es la manera más rápida de validar si el modelo comprende su dominio.
  • Plan para iteración: Su primer modelo casi sin duda no será su último. Construya un flujo de trabajo que le permita recopilar nuevos datos, etiquetarlos y reentrenarlos sin problemas. Utilice la función de aprendizaje activo para identificar de manera eficiente datos que mejoran la exactitud de su modelo.
  • Considera el Dominio Compacto para el borde: Si planeas exportar tu modelo para dispositivos móviles o de borde, utiliza el dominio Compacto desde el principio. Los dominios de conmutación más tarde requieren la reentrenamiento de tu modelo desde cero con el dominio elegido.

Conclusión

Azure Cognitive Services Custom Vision democratiza el acceso a potentes IA visual. Al manejar las complejidades de la formación y el despliegue de modelos, permite a las empresas centrarse en sus casos de uso básico, desde automatizar las inspecciones visuales hasta mejorar las experiencias de los clientes. Aunque es esencial entender sus limitaciones y elegir la herramienta adecuada para el trabajo, Custom Vision sigue siendo una de las maneras más eficientes y accesibles para llevar el poder de reconocimiento personalizado de imagen a la producción.