Artículo de investigación

Modelo de detección de objetos en tiempo real para la identificación de marcas de cigarrillos basado en una arquitectura mejorada de regresión de una sola etapa

DOI:

10.3791/69657

9 de enero de 2026

En este artículo

Resumen

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Para abordar desafíos como la oclusión y los cambios de iluminación en almacenes automatizados, este artículo introduce una Arquitectura de Regresión de Una Etapa mejorada para la detección de marcas de cajas de cigarrillos. Al integrar el muestreo adaptativo hacia abajo, un mecanismo de atención multiescala invertido y eficiente y una cabeza de detección dinámica, el modelo propuesto logra un inventario inteligente preciso y en tiempo real.

Resumen

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

El reconocimiento visual para el inventario automatizado de cigarrillos se enfrenta a importantes obstáculos, como cambios en la iluminación, dimensiones diversas de las cajas y oclusión parcial de características, que complican la verificación de marca y la detección de cajas extraviadas. Este artículo propone un modelo mejorado de detección en tiempo real para abordar problemas de reconocimiento de imágenes y mejorar la precisión. En primer lugar, se despliega un módulo adaptativo de muestreo hacia abajo para reemplazar el módulo de convolución de muestreo hacia abajo tanto en la red troncal como en la red de cuello de la serie YOLO como detector base o original, lo que mantiene efectivamente más detalles de características y logra la ligereza del modelo. En segundo lugar, se introduce un módulo de atención multiescala invertido y eficiente para capturar la información del contexto espacial de diferentes escalas y generar un mapa de atención espacial más preciso, lo que mejora la precisión de predicción del modelo base para características complejas y objetivos de oclusión. Finalmente, un módulo dinámico de cabeza de detección reemplaza al cabezal de detección original del modelo base y realiza la detección de objetos a escala múltiple en el mapa de características extraído de las redes de columna vertebral y cuello para lograr una posición precisa y división de categorías del objetivo predicho. Para evaluar el rendimiento del modelo mejorado en el campo, construimos un conjunto de datos visual de la marca de la caja de cigarrillos. El conjunto de datos se amplió utilizando técnicas de copia y pega específicas de la región y técnicas tradicionales de aumento, y el conjunto de datos obtenido incluye antecedentes complejos, oclusión y solapamiento, objetivos pequeños y otros factores. El experimento demuestra que el modelo mejorado presentado en este artículo cumple eficazmente con los requisitos para la detección en tiempo real en el campo. El modelo propuesto alcanza un mAP del 97,9%, con parámetros y FLOPs de 1.849.679 y 5,1 G, respectivamente. En comparación con el modelo base, el modelo propuesto mejora el mAP en un 0,9% mientras reduce los parámetros en un 28,78% y las operaciones en coma flotante en 1,4 G. Además, el modelo alcanza una velocidad de inferencia de 38,5 FPS, cumpliendo los requisitos para la detección industrial en tiempo real.

Introducción

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

La fabricación y logística modernas dependen en gran medida de los Sistemas Automatizados de Almacenamiento y Recuperación (AS/RS)1 para lograr almacenamiento de alta densidad, manipulación eficiente de materiales y gestión precisa del inventario. AS/RS se ha convertido en un medio crucial que puede ayudar a las empresas a mejorar la eficiencia de los almacenes y reducir costes, gracias a su alta eficiencia e inteligencia en sus características. Con una base de estanterías multicapa y diversos equipos de carga y descarga, el AS/RS es un sistema mecatrónico controlado por ordenador, que integra múltiples tecnologías, incluyendo mecánica, electrónica, informática, comunicaciones, redes, sensores y controlautomático 2,3. El AS/RS logra el almacenamiento y manipulación eficientes, precisos y seguros de las mercancías mediante la integración y optimización de estanterías, grúas apiladoras, líneas de transportadora, sistemas de control y otros equipos, lo que mejora considerablemente la eficiencia del almacenamiento. La integración de la visión por ordenador en AS/RS, un aspecto clave de la Industria 4.0, permite niveles sin precedentes de automatización e inteligencia al permitir que los sistemas vean y tomen decisiones basadas en datosvisuales 4.

Con la aplicación generalizada del AS/RS en las fábricas detabaco 5, se ha propuesto un nuevo requisito de inventario para las marcas de cajas de cigarrillos. Los métodos tradicionales de inventario manual sufren de ineficiencia, altas tasas de detección de falsas y riesgos para la seguridad, que no satisfacen las necesidades de AS/RS. Con el avance continuo de la tecnología de visión por ordenador, las soluciones de visión artificial se aplican cada vez más en los ámbitos de inspecciónindustrial 6,7,8. Dado que la información de la marca con patrones y texto únicos está impresa en cada caja de cigarrillos, la tecnología de reconocimiento de imágenes basada en visión artificial permite identificar la marca y almacenar cajas de cigarrillos.

Desde 2012, los algoritmos de detección de objetos basados en aprendizaje profundo han supuesto avances significativos en el reconocimientode imágenes 9, 10 y 11. Desde los primeros modelos de detección de objetos de dos etapas como R-CNN12 hasta los modelos contemporáneos de detección de objetos de una sola etapa dominados por modelos de la serie YOLO como detectores baseu originales 13, 14 y 15, estos enfoques han contribuido significativamente al desarrollo de algoritmos de detección de objetos. Las tareas inteligentes de inventario utilizan cada vez más modelos de detección de objetos para identificar y localizar múltiples objetivos con precisión en imágenes o vídeos. Li et al.16 propusieron un método inteligente de balanceo que integra sensores de pesaje y tecnología de reconocimiento de imágenes para mejorar la eficiencia y precisión del inventario. Wang et al.17 usaron la máscara R-CNN para segmentar el número de la estantería y la posición del título a partir de la imagen del lomo del libro. Sun et al.18 diseñaron un sistema integrado de reconocimiento visual, que utilizaba OpenCV para reconocer los códigos bidimensionales en materiales y estanterías en modo multimodo. Optimizaron el detector original (v5s) introduciendo el mecanismo de atención C3CBAM y la asignación de etiquetas SimOTA para mejorar las funciones de pérdida y lograr una detección precisa de múltiples materiales.

En el campo de la detección de objetos, aunque los modelos de dos etapas —representados por Faster R-CNN— poseen ventajas tradicionales en precisión de detección, sus complejos mecanismos de generación de propuestas de regiones resultan en velocidades de inferencia relativamente lentas. En consecuencia, les cuesta cumplir los estrictos requisitos de rendimiento en tiempo real en escenariosindustriales 19,20. En cambio, la arquitectura basada en regresión trata la detección de objetos como un único problema de regresión, prediciendo directamente las ubicaciones de los objetivos y las probabilidades de las categorías a partir de imágenes de entrada. Este diseño arquitectónico permite que los modelos superen significativamente a la mayoría de los modelos de dos etapas en términos de eficiencia de inferencia, aligeramiento y flexibilidad de despliegue, manteniendo la precisión competitiva. Así, esta arquitectura se ha convertido en la solución preferida para la detección industrialen tiempo real 21.

El ecosistema original del modelo sigue evolucionando rápidamente, con variantes recientes que abordan desafíos específicos. Por ejemplo, el detector original (v12)22 se centra en mejorar aún más la optimización del tiempo de entrenamiento y el refinamiento arquitectónico para lograr mejores compensaciones entre precisión y eficiencia. Mientras tanto, el detector original (Mundo)23 introduce capacidades de detección de vocabulario abierto, permitiendo la inferencia en tiempo real de una vasta gama de objetos más allá de las categorías del conjunto de entrenamiento mediante el modelado de lenguaje visual. Aunque estos avances llevan los límites de la detección de objetos de propósito general, este trabajo se centra en una aplicación industrial especializada donde la robustez ante desafíos específicos, como la oclusión parcial y la variación de iluminación, es fundamental, y el espacio de categorías es fijo y conocido a previo. Como la versión más popular de esta familia de modelos, el modelobase 24 hereda ventajas del detector original (v8)25,26; No solo reduce el número de parámetros del modelo, sino que también considera un equilibrio entre eficiencia de detección y precisión. En comparación con otros modelos de detección de objetos, destaca en tareas de reconocimiento visual.

El desafío de detectar cajas de cigarrillos pequeñas o parcialmente ocluidas es una manifestación de un problema más amplio en la visión por ordenador. La detección de objetos pequeños ha sido investigada activamente, con enfoques que van desde refinamientos de red de pirámides de características (FPN) 27 hasta mecanismos de atención conscientes del contexto, que inspiran la integración del procesamiento de características a múltiples escalas. Además, la búsqueda de la eficiencia operativa en un entorno industrial requiere un diseño de modelo ligero. Inspirados en los conceptos de arquitectura eficiente explorados enMobileNetV3 28 yGhostNet 29, estos conceptos utilizan convolución profunda y transformación lineal para reducir la complejidad computacional manteniendo la capacidad de presentación, por lo que elegimos algunos módulos ligeros para mejorar el modelo. Por lo tanto, para abordar el inventario de las marcas de cajas de cigarrillos y los factores que influyen en el inventario, como cambios en la iluminación, diferencias de tamaño de características entre distintas marcas y oclusión parcial entre las cajas de cigarrillos, proponemos en este artículo un modelo mejorado de detección de objetos con arquitectura de regresión de una sola etapa.

Las principales innovaciones del modelo propuesto son tres. Primero, se despliega el módulo Adaptive Downsampling (ADown)30para reemplazar el downsampling convolucional estándar tanto en la red troncal como en la red de mástil. Este diseño novedoso mitiga la pérdida de información durante la compresión de características, lo cual es fundamental para preservar logotipos y textos de marcas pequeñas. En segundo lugar, se introduce un mecanismo invertido de Atención Multiescala Eficiente (iEMA) para potenciar al modelo con percepción contextual dinámica y multiescala, mejorando significativamente su rendimiento en cajas de cigarrillos pequeñas y parcialmente ocluidas. En tercer lugar, la cabeza de detección original es reemplazada por el módulo DynamicHead31 , que unifica las atenciones conscientes de la escala, el espacio y la tarea, permitiendo una localización y clasificación más precisas entre objetivos de tamaños muy diferentes. Estas modificaciones arquitectónicas están diseñadas de forma cohesionada para abordar los puntos de dolor específicos de la identificación de marcas de cigarrillos en entornos industriales.

Acceso restringido. Inicie sesión o comience una prueba gratuita para ver este contenido.

Protocolo

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

El conjunto de datos utilizado en este artículo fue adquirido del campo AS/RS del Departamento de Logística de Longyan Tobacco Industry Co., Ltd. Este estudio no involucró participantes humanos ni animales. No se requería aprobación ética.

Adquisición y configuración de conjuntos de datos
Configuración de hardware: Montar una cámara industrial (por ejemplo, MV-CA013-A0GM) equipada con un objetivo de 8 mm de distancia focal (por ejemplo, MVL-HF0828M-6MPE) sobre la plataforma de carga de la grúa apiladora. Conecta la cámara a un PC de control mediante un cable GigE y un dispositivo de acceso inalámbrico (por ejemplo, BH-ANT5158S-14HV, BH-MS-AC1600HWH). Coloca una tira de luz LED (por ejemplo, MV-LLDS-1002-38-W) alrededor de la cámara para asegurar una iluminación uniforme.

Configuración de parámetros de la cámara: Configura la cámara usando el software del fabricante (por ejemplo, MVS). Ajusta la resolución de adquisición a 1280 x 1024 píxeles. Configura el modo de disparo en Disparador Hardware y sincronízalo con el sistema de posicionamiento de la grúa apiladora. Ajusta el tiempo de exposición a 100 ms y la ganancia a 5 dB para minimizar el desenfoque de movimiento y el ruido. La distancia de trabajo entre la cámara y las cajas de cigarrillos es de aproximadamente 550 mm.

Recogida de imágenes: Una cámara industrial con disparador captura una imagen automáticamente cada vez que se coloca una bandeja durante el almacenamiento y recogida de las cajas de cigarrillos. Recopilar un total de 4.835 imágenes en bruto; las imágenes típicas se muestran en la Figura 1.

Anotación de imágenes: Utiliza la herramienta de código abierto LabelImg. Para cada imagen, dibuja cuadros delimitados alrededor de cada característica visible de la marca de cigarrillos. Asigna el nombre de marca correcto (por ejemplo, Hongzhuang, Gutian) como etiqueta de clase para cada cuadro delimitador. Guarda las anotaciones en un formato estándar de detección de una sola etapa, con un archivo txt por imagen.

Control de calidad: Un segundo anotador revisa al azar el 20% de las imágenes anotadas. Cualquier discrepancia se discute y resuelve, asegurando la coherencia del etiquetado.

Estrategia de aumento de datos
Esta sección detalla tanto técnicas tradicionales como avanzadas de aumento aplicadas a los conjuntos de datos. Los datos iniciales y los datos aumentados se combinan en un nuevo conjunto de datos, que luego se divide en conjunto de entrenamiento, conjunto de validación y conjunto de pruebas para garantizar la equidad en la evaluación.

Aumento tradicional de datos32: Estas transformaciones se aplican en tiempo real por la tubería de entrenamiento (por ejemplo, usando las librerías de Albumentations o PyTorch Transforms) con una probabilidad definida para cada lote.

Transformaciones geométricas: Rotación: Gira aleatoriamente las imágenes con un ángulo entre -45° y +45°. Escalado: Escala aleatoriamente las imágenes por un factor entre 0,8 y 1,2. Volteo horizontal: Invertir imágenes aleatoriamente en horizontal con un 100% de probabilidad. Recorte aleatorio: Recorta aleatoriamente una sección entre el 80% y el 100% del área original de la imagen.

Transformaciones fotométricas: Brillo y contraste: Ajustar brillo y contraste mediante un factor elegido aleatoriamente de [0,6, 1,4]. Ruido gaussiano: Añade ruido gaussiano con una desviación estándar elegida aleatoriamente entre [0, 0,01 * 255] al 10% de las imágenes. Desenfoque gaussiano: Aplica un desenfoque gaussiano con un tamaño de núcleo de 3x3 al 10% de las imágenes.

Simulación de oclusión: Colocar aleatoriamente de 1 a 3 parches rectangulares de oclusión (cubriendo hasta un 5% del área de la imagen cada uno) en las imágenes. Los parches se llenan de ruido aleatorio o valores medios de píxeles de imagen.

Aumento avanzado de datos: copiar y pegar específico por región
Motivación e impacto: La motivación principal de este aumento dirigido fue abordar un problema crítico de datos: varias marcas de cigarrillos tuvieron muy pocos casos (tan solo una imagen). Una división estándar aleatoria de prueba de validación de trenes podría potencialmente asignar todas las instancias de una marca rara a un solo conjunto (por ejemplo, todas al conjunto de prueba), resultando en que el modelo no tenga oportunidad de aprender o validar esa marca. Este método aumentó artificialmente el tamaño de la muestra para estas marcas subrepresentadas, asegurando que cada marca tenga un número suficiente de instancias distribuidas entre los conjuntos de formación, validación y prueba. Este paso fundamental previene fallos catastróficos en categorías raras y es un requisito previo para cualquier rendimiento significativo del modelo y su generalización en el conjunto completo de marcas.

Este paso requiere un modelo segmental preentrenado sobre el conjunto de datos inicial y el Modelo de Segmento de Cualquier Cosa (SAM)33.

Segmentar objetos fuente: Para imágenes de cajas de cigarrillos de marcas infrarrepresentadas, utiliza el modelo SAM para generar máscaras de segmentación precisas. Utiliza el modo de indicación puntual, haciendo clic en la Característica de Marca de la Caja de Cigarrillos para iniciar la segmentación. Valida y refina manualmente las máscaras generadas para garantizar la precisión. Guarda las imágenes segmentadas de las cajas de cigarrillos con fondos transparentes como archivos PNG. Esto crea una biblioteca de instancias de objetos aislados.

Generar máscaras de fondo: Utiliza el modelo segmental de línea base preentrenado para realizar la segmentación de instancias sobre un conjunto de imágenes de fondo (imágenes con espacio libre amplio o fondos simples). El modelo generará máscaras binarias que indican las regiones ya ocupadas por los objetos.

Máscaras de proceso y pegar objetos: Para cada máscara de fondo, utiliza la biblioteca OpenCV (función 'cv2.approxPolyDP' con un factor épsilon de 0,02 * perímetro de contorno) para realizar ajustes de curva y linealizar los bordes de la máscara, obteniendo una representación poligonal simplificada del espacio libre. Identifica el área de polígonos contiguos más grande dentro de la máscara de fondo como la región de la pasta objetivo. Selecciona aleatoriamente un objeto fuente segmentado de la biblioteca. Redimensionarla (manteniendo la relación de aspecto) y aplicar una transformación afín (rotación menor entre -5° y +5°, y ligera cizalladura) para que encaje de forma natural dentro de la región de la pasta objetivo, asegurando que no se solapen con los límites de los objetos existentes. Utiliza la mezcla alfa para pegar el objeto transformado de forma fluida sobre la imagen de fondo en la ubicación calculada. El marco general de la tecnología de aumento de datos basada en la técnica de copiar y pegar en áreas específicas se muestra en la Figura 2. Genera programáticamente un nuevo archivo de anotación txt correspondiente para el objeto pegado, actualizando las coordenadas del cuadro delimitador y la etiqueta de clase.

Conjunto de datos final aumentado: Este proceso offline genera 600 nuevas imágenes sintéticas. Combínalas con las 4.835 imágenes originales y otras 1.167 imágenes generadas aplicando las técnicas tradicionales de aumento descritas anteriormente para formar el conjunto final de datos de 6.602 imágenes. Divide el conjunto de datos final en conjuntos de entrenamiento (70%, 4.621 imágenes), validación (20%, 1.320 imágenes) y test (10%, 661 imágenes), asegurando que las imágenes de la misma secuencia original se mantengan dentro de la misma división para evitar fugas de datos.

Modificación del modelo para construir el detector mejorado propuesto
Los algoritmos optimizados de detecciónde objetos 34 han logrado avances notables en la inspección industrial en los últimos años. Esta sección proporciona un procedimiento detallado paso a paso para modificar la arquitectura del modelo base para crear el modelo propuesto. Las modificaciones se implementan editando el archivo de configuración del modelo (por ejemplo, config.yaml) y asegurando que las definiciones de módulos personalizados correspondientes se incluyan en la base de código. La justificación de cada modificación se proporciona para esclarecer su papel en la resolución de desafíos específicos de detección. La estructura del modelo propuesto se muestra en la Figura 3.

Sustitución de módulos de muestreo descendente por el módulo ADown: El módulo estándar Convolution-BatchNorm-SiLU (CBS) utilizado para el muestreo reducido emplea una convolución en estratificación única, que puede actuar como cuello de botellade información 35, descartando potencialmente características detalladas cruciales para reconocer cajas pequeñas de cigarrillos y logotipos detallados de marca. El módulo ADown está diseñado para aliviar esto implementando una estructura de doble rama que captura y preserva un conjunto más rico de características durante la reducción de resolución espacial. Una rama prioriza la retención de detalles locales de alta frecuencia, mientras que la otra captura una visión más amplia y rica en contexto. La fusión de estas características complementarias da lugar a una representación más robusta e informativa para las capas posteriores.

Pasos de acción y implementación
Definición de módulo: Asegúrese de que un módulo personalizado de PyTorch llamado ADown esté definido dentro de los archivos de definición del modelo del proyecto. Este módulo debe contener dos ramas paralelas. La primera rama debe consistir en una capa de convolución bidimensional con un núcleo de 3x3 y una zancada de 2. La segunda rama debe consistir secuencialmente en una capa de max-pooling de 2x2 (con paso 2) seguida de una capa de convolución 1x1. Las salidas de estas dos ramas deben concatenarse a lo largo de la dimensión del canal, y el mapa de características resultante se pasa a través de una capa final de convolución 1x1 para integrar los canales y producir la salida. La estructura del módulo ADown se muestra en la Figura 4.

Edición del archivo de configuración: Abre el archivo de configuración del modelo base (config.yaml). Identifica sistemáticamente cada instancia del módulo CBS configurada para el muestreo reducido (es decir, donde el parámetro de paso está establecido en 2). Sustituye cada una de estas entradas del módulo CBS por el nuevo módulo ADown.

Motivación de diseño: El diseño de ADown está motivado por la necesidad de mitigar la pérdida de información en convoluciones estándar de estratificación, que pueden ser perjudiciales para objetos pequeños. Su estructura de doble rama está inspirada en la idea del procesamiento paralelo para capturar tanto detalles espaciales de alta frecuencia (mediante convolución) como información contextual de baja frecuencia (mediante pooling), proporcionando así una representación de características multiescala más rica para capas posteriores.

Integración del módulo iEMA
Fundamento y principio de diseño: Para mejorar la capacidad del modelo de detectar objetivos pequeños y aquellos parcialmente ocultos, es esencial incorporar un mecanismo que pueda modelar eficazmente contextos espaciales a múltiples escalas. El módulo iEMA logra esto integrando un componente Efficient Multi-scale Attention (EMA)36 dentro de una estructura de bloque residual invertido (iRMB)37 . El iRMB proporciona una base computacionalmente eficiente usando convoluciones separables en profundidad, mientras que el componente EMA captura explícitamente interacciones espaciales a escala cruzada mediante un diseño paralelo multirama. Esta integración permite al modelo recalibrar dinámicamente los pesos de las características, centrando la atención en las regiones espaciales más discriminativas a diferentes escalas, mejorando así el reconocimiento bajo oclusión y para objetos pequeños.

Pasos de acción-implementación
Definición del módulo: Asegúrese de que se defina un módulo personalizado de PyTorch llamado iEMA. Este módulo debe implementar primero un bloque residual invertido. Este bloque suele comenzar con una convolución puntual para la expansión del canal, seguida de una convolución en profundidad (por ejemplo, 3x3) para la extracción de características espaciales, y finalmente una convolución puntual para la proyección del canal. Inmediatamente después de este bloque, debería implementarse el mecanismo de atención de la EMA. El mecanismo EMA suele emplear convoluciones agrupadas e interacciones interdimensionales para generar eficientemente un mapa de atención espacial a múltiples escalas sin una sobrecarga computacional excesiva. La estructura del módulo iEMA se muestra en la Figura 5.

Edición de archivos de configuración: En el archivo de configuración config.yaml, localiza las secciones que definen la red de cuello, específicamente las capas inmediatamente posteriores a los módulos C2F. En estas ubicaciones estratégicas, inserta una nueva capa que llame al módulo iEMA.

Motivación de diseño: El módulo iEMA se basa en el principio de mejorar la discriminabilidad de características integrando la extracción local de características (mediante convolución en profundidad) con un mecanismo de modelado global del contexto (EMA) ligero pero eficaz. Este enfoque híbrido permite al modelo centrarse de forma adaptativa en regiones informativas a diferentes escalas, lo cual es crucial para reconocer logotipos y textos de marca parcialmente visibles.

Sustitución de la cabeza de detección por el módulo DynamicHead
Fundamento y principio de diseño: El cabezal de detección original puede no manejar de forma óptima la significativa variación de escala de las cajas de cigarrillos y la compleja interacción entre tareas de localización y clasificación. El módulo DynamicHead aborda esto unificando tres formas de atención en una estructura coherente: conciencia de escala, conciencia espacial y atención consciente de la tarea. El componente consciente de la escala fusiona dinámicamente características de diferentes niveles de la pirámide de características, asegurando que objetos de todos los tamaños estén representados eficazmente. El componente espacialmente consciente emplea una estrategia de muestreo disperso para enfocar los recursos computacionales en las regiones más informativas dentro de los mapas de características. El componente consciente de la tarea adapta la representación de características específicamente para los objetivos distintos de la regresión de la caja delimitadora y la clasificación de categorías. Este enfoque unificado conduce a predicciones más precisas y robustas.

Pasos de acción-implementación
Definición de módulo: Este es un módulo complejo que abarca los tres mecanismos de atención descritos por las Ecuaciones (1) a (4). Su estructura interna incluirá capas para calcular pesos a escala, realizar atención espacial deformable y aplicar transformaciones de características específicas de cada tarea.

Ecuación 1(1)

Ecuación 2(2)

Ecuación 3(3)

Ecuación 4(4)

Donde WL(F) denota el mapa final de características refinadas en la atención, obtenido aplicando secuencialmente el π consciente de la escala L(F), el π consciente del espacio y los mecanismos de atenciónconscientes de la tarea π C(F) al rasgo de entrada F. Específicamente, en la Ecuación (2), πL(F) calcula un peso de atención a escala promediando primero las dimensiones espaciales (S) y del canal (C), pasándolo por una función lineal f(⋅) y una activación sigmoide dura σ(⋅). En la Ecuación (3), πS(F) realiza una atención espacial escasa agregando características de K puntos clave muestreados pk, cada uno con un desplazamiento aprendible Δpk para centrarse en regiones discriminativas y un escalar de importancia Δm k. En la Ecuación (4), πC(F) implementa una atención consciente de la tarea aplicando una transformación lineal (gobernada por parámetros aprendidos (α1, β1,α 2,β 2)) a cada canal y seleccionando la respuesta máxima, permitiendo que la cabeza se especialice en tareas de clasificación y regresión. La estructura del módulo DynamicHead se muestra en la Figura 6.

Edición de archivos de configuración: En el archivo config.yaml, encuentra la sección que define la cabeza del modelo, que originalmente contiene el módulo Detect. Sustituyéndolo por una nueva entrada que llame al módulo DynamicHead.

Motivación de diseño: El módulo DynamicHead se basa en la observación de que las cabezas de detección de objetos deben adaptarse a la escala, la ubicación espacial y la tarea. Su marco de atención unificado, formalizado en Ecuaciones. (1-4), permite al modelo recalibrar dinámicamente las respuestas de características basándose en estas tres dimensiones, lo que lleva a predicciones más robustas contra la variación de escala y el desorden de fondo.

Formación en modelos
Asegúrate de que PyTorch 2.1.0, CUDA 12.1 y todas las dependencias estén instaladas.

Mando de entrenamiento
Antes de reentrenar, prepara los datos de imagen dividida y los datos de anotación en un formato estándar de detección de una sola etapa. Crea un archivo .yaml que contenga la ruta de imagen y la categoría de datos. Según la mejora del modelo, el archivo .yaml original del detector es reemplazado por el archivo .yaml propuesto. Escribe el archivo train.py, importa el paquete detector de una sola etapa, carga el modelo de entrenamiento y la ruta de datos, y establece algunos parámetros de entrenamiento, incluyendo imgze=640, epochs=100, batch=4, workers=0, device='0', optimizer='SGD', close_mosaic=10, etc.

Hiperparámetros: Los parámetros clave son: tamaño de la imagen de entrada (640 x 640), tamaño del lote (4), tasa de aprendizaje inicial (0,01) con planificador de recocido coseno, optimizador SGD con momento (0,937) y decaimiento de peso (0,0005). La mejora de mosaico está activada por defecto.

Monitorización de la formación: El proceso de entrenamiento generará métricas para cada época. Monitoriza las curvas para pérdida de entrenamiento/validación y mAP a 0,5 para asegurar la convergencia y evitar sobreajuste. Entrenarse durante 100 épocas suele ser suficiente.

Evaluación y despliegue de modelos
Evaluación: Después del entrenamiento, el mejor modelo se guarda como runs/train/exp/weights/best.pt. Avalíalo en el conjunto val usando: bash python val.py --data cigarette_dataset.yaml --weights runs/train/exp/weights/best.pt. El script mostrará Precisión, Recordación, mAP a 0,5, etc. Confirma que el mAP cumple el umbral requerido (por ejemplo, 97,9%).

Inferencia para verificación: Ejecuta inferencia sobre imágenes de muestra para verificar visualmente los resultados de la detección: bash python detect.py --weights runs/train/exp/weights/best.pt --source path/to/test/images --conf 0.5. Verificando el razonamiento, se pueden obtener los resultados de detección de cada imagen y la velocidad de detección del modelo.

Despliegue: Para un despliegue en tiempo real en el sistema de la grúa apiladora, convierte el modelo PyTorch (best.pt, ~4,7 MB) a un formato como TensorRT o ONNX para optimizar la velocidad de inferencia. La salida final son cuadros delimitadoros con etiquetas de clase (nombres de marca) y puntuaciones de confianza.

Acceso restringido. Inicie sesión o comience una prueba gratuita para ver este contenido.

Resultados

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Entorno experimental y configuración de parámetros
Se realizaron experimentos para verificar el rendimiento del modelo propuesto en el marco de aprendizaje profundo PyTorch, y los detalles del entorno experimental se enumeran en la Tabla 1. Aquí utilizamos un conjunto de datos especial que contenía 6.602 imágenes y que se dividió aleatoriamente en conjuntos de entrenamiento, validación y prueba en una proporción de 7:2:1. Todos los experimentos utilizaron imágenes de entrada con una r...

Acceso restringido. Inicie sesión o comience una prueba gratuita para ver este contenido.

Discusión

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Compromiso entre precisión y eficiencia
Un logro central de este modelo es su superior equilibrio entre precisión y eficiencia computacional. Como se evidencia en la Tabla 2, el modelo presentado alcanza el mayor mAP mientras simultáneamente tiene el menor número de parámetros y el segundo FLOP más bajo entre los modelos de detectores de una sola etapa comparados. Esto se traduce directamente en beneficios prácticos: un modelo más pequeño es más rápid...

Acceso restringido. Inicie sesión o comience una prueba gratuita para ver este contenido.

Divulgaciones

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Los autores no declaran que no hay intereses financieros directos en competencia. Esta investigación se llevó a cabo en colaboración con Longyan Tobacco Industrial Co., Ltd., donde trabajan los autores Hongli Deng y Wencan Li, y Baoji Cigarrillos Factory, donde trabaja el autor Baobin Luo. Estas afiliaciones proporcionaron el escenario de aplicación y los datos de campo para el estudio. Los autores académicos (Jun Liu, Jianguang Yi, Feng Yang, Xiaobo Zhao) no declaran conflictos de interés financieros ni no financieros respecto a la publicación de esta obra.

Agradecimientos

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Este trabajo fue financiado por el Método de Medición de Temperatura para Colar Billetes Basado en Reflector Precedido y Multilongitud de Onda (Nº LZY24E050002) financiado por los Fondos Conjuntos de la Fundación Provincial de Ciencias Naturales de Zhejiang de China, y el Método de Medición de Campo de Temperatura en Línea de Cavidad de Cucharón No Cerrado y No Isotérmico (Nº 2023K231), financiado por el Proyecto de Planificación Científica y Tecnológica de Quzhou.

Acceso restringido. Inicie sesión o comience una prueba gratuita para ver este contenido.

Materiales

Lista de materiales utilizados en este artículo
NombreEmpresaNúmero de catálogoComentarios
Lector de códigosHikvisionID5050Equipo Hikvision: Se usa para leer códigos de barras en palés, necesito conectar una fuente de alimentación de 24V
Cámara industrialHikvisionMV-CA013-A0GM, MV-CS016-10GMNecesito conectar una fuente de alimentación de 24V
Luz LEDHIKROBOTMV-LLDS-1002-38-WUna fuente de luz de un metro proporciona condiciones de iluminación suficientes para la cámara
LenteHikvisionMVL-HF0828M-6MPEdistancia focal: 8mm, rango de apertura: F2.8~F16, píxel: 6 millones
MVSHikvisionV4.5.1Software Hikvision: Utilizado para depurar cámaras, ajustar parámetros de cámara y recoger datos
PycharmJetBrains2020.1.3 x64Utilizado para entrenar modelos de aprendizaje profundo y desarrollar sistemas de detección
Varios soportes metálicosLongyan Tobacco Industrial Co., Ltd.Aleación de aluminio 7075-T6Usado para reparar cámaras y lectores de código
Varios cables de redLongyan Tobacco Industrial Co., Ltd.Cabeza de cristal RJ45Conecta la estación base entre el ordenador industrial y el punto de acceso inalámbrico, conecta la cámara y el interruptor, etc
SwicthTP-LinkTL-SH1005Hay 8 interfaces de cable Ethernet que requieren una fuente de alimentación de 220V
Maestro de la VisiónHikvisionV4.3.0Software Hikvision: Utilizado para la comparación de plantillas y la detección de resultados de imágenes
Dispositivo de acceso inalámbricoShandong HuachuangxunlianBH-ANT5158S-14HV, BH-MS-AC1600HWHDebido al gran movimiento que requiere la grúa apiladora, el cable de red no puede conectar la cámara al ordenador industrial, y se necesita un dispositivo de acceso inalámbrico para garantizar el buen funcionamiento de la red de cámaras

Referencias

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Chen, C., Liu, J., Yin, H., Huang, B. A Vision-Based Method for Detecting the Position of Stacked Goods in Automated Storage and Retrieval Systems. Sensors. 25 (10), 2623(2025).
  2. Yu, X., Liao, X., Li, W., Liu, X., Tao, Z. Logistics automation control based on machine learning algorithm. Cluster Comput. 22 (Suppl 4), 14003-14011 (2019).
  3. Liu, J., et al. Benders decomposition for the multi-agent location and scheduling problem on unrelated parallel machines. Soft Computing. 29 (1), 195-212 (2025).
  4. Haffner, O., Kuˇcera, E., Rosinová, D. Applications of Machine Learning and Computer Vision in Industry 4.0. Appl. Sci. 14 (6), 2431(2024).
  5. Bo, Q., et al. Formulation of receiving/retrieving strategy for automatic high rack finished cigarette warehouse. Tobacco Sci Technol. 57 (6), 92-98 (2024).
  6. Voulodimos, A., Doulamis, N., Doulamis, A., Protopapadakis, A. Deep learning for computer vision: A brief review. Computat Intell Neurosci. 2018 (1), 7068349(2018).
  7. Khan, A. I., Al-Habsi, S. Machine learning in computer vision. Proc Comp Sci. 167, 1444-1451 (2020).
  8. Xu, S., et al. Computer vision techniques in construction: a critical review. Arch Computat Meth Eng. 28 (5), 3383-3397 (2021).
  9. Xu, P. Progress of Object detection: Methods and future directions. Second IYSF Acad Sympos Artif Intell Comp Eng SPIE. 12079, 530-542 (2021).
  10. Sreelakshmi, P. R., Swaraj, K. P. Occlusion resilient object detection under various situations using deep learning techniques: A review. AIP Conf Proc AIP Publishing LLC. 3037 (1), 020042(2024).
  11. Rich feature hierarchies for accurate object detection and semantic segmentation. Girshick, R., Donahue, J., Darrell, T., Malik, J. Proc IEEE Conf Comp Vision Pattern Recognit, , 580-587 (2014).
  12. Fast R-CNN. Girshick, R. Proc IEEE Int Conf Comp Vision, , 1440-1448 (2015).
  13. You only look once: Unified, real-time object detection. Redmon, J., Divvala, S., Girshick, R., Farhadi, A. Proc IEEE Conf Comp Vision Pattern Recognit, , 779-788 (2016).
  14. Hussain, M. YOLO-v1 to YOLO-v8, the rise of YOLO and its complementary nature toward digital manufacturing and industrial defect detection. Machines. 11 (7), 677(2023).
  15. Li, C., et al. YOLOv6: A single-stage object detection framework for industrial applications. arxiv. , (2022).
  16. Li, D., Liu, Y., Hu, C., Wang, Y., Wen, X. Research and application of intelligent stocktaking method based on weighing and image recognition technology in publishing industry. Logistics Technol Applicat. 30 (1), 134-142 (2025).
  17. Wang, X., Qian, S., Zhang, J., Guo, J., Pan, C. Exploration and application of library book stocktaking system based on computer vision and artificial intelligence technology. Library J. 41 (7), 96(2022).
  18. Sun, H., Li, P. Design and development of intelligent warehouse stocktaking system based on multi pattern visual recognition technology. Construct Machinery Equip. 56 (4), 107-111 (2025).
  19. Ren, S., He, K., Girshick, R., Jian, S. Faster R-CNN: Towards real-time object detection with region proposal networks. IEEE Transact Pattern Anal Machine Intell. 39 (6), 1137-1149 (2016).
  20. Speed/Accuracy Trade-offs for Modern Convolutional Object Detectors. Huang, J., et al. Proc IEEE Conf Comput Vis Pattern Recognit. (CVPR), , 7310-7311 (2017).
  21. Bochkovskiy, A., Wang, C. Y., Liao, H. Y. M. YOLOv4: Optimal Speed and Accuracy of Object Detection. arXiv. , (2020).
  22. Tian, Y., Ye, Q., Doermann, D. YOLOv12: Attention-Centric Real-Time Object Detectors. arXiv. , (2025).
  23. Cheng, T., et al. YOLO-World: Real-Time Open-Vocabulary Object Detection. arXiv. , (2024).
  24. Khanam, R., Hussain, M. Yolov11: An overview of the key architectural enhancements. Arxiv. , (2024).
  25. YOLOv8: A Novel Object Detection Algorithm with Enhanced Performance and Robustness. Varghese, R., Sambath, M. 2024 Int Conf Adv Data Eng Intell Comput Sys (ADICS), , IEEE. 1-6 (2024).
  26. Wan, D., et al. YOLO-MIF: Improved YOLOv8 with Multi-Information fusion for object detection in Gray-Scale images. Adv Eng Info. 62, 102709(2024).
  27. Feature Pyramid Networks for Object Detection. Lin, T. Y., et al. Proc IEEE Conf Comp Vision Pattern Recognit (CVPR), , 2117-2125 (2017).
  28. Searching for MobileNetV3. Proc IEEE/CVF Int Conf Comp Vision (ICCV). Howard, A., et al. , 1314-1324 (2019).
  29. GhostNet: More Features from Cheap Operations. Han, K., et al. Proc IEEE/CVF Conf Comp Vision Pattern Recognit (CVPR), , 1580-1589 (2020).
  30. Yolov9: Learning what you want to learn using programmable gradient information. Wang, C. Y., Yeh, I. H., Mark Liao, H. Y. European conference on computer vision, , Cham Springer Nat Switzerland. 1-21 (2024).
  31. Dynamic head: Unifying object detection heads with attentions. Dai, X., et al. Proc IEEE/CVF Conf Comp Vision Pattern Recognit, , 7373-7382 (2021).
  32. Zhu, X., et al. Overview of Research on Image Data Enhancement Technology. Soft Guide. 20 (5), 1-5 (2021).
  33. Segment anything. Kirillov, A., et al. Proc IEEE/CVF Int Conf Comp Vision, , 4015-4026 (2023).
  34. Jiang, H., Wang, Y., Kang, J. Overview of object detection models and optimization methods. J Automatica Sinica. 47 (6), 1367-1393 (2021).
  35. Deep Residual Learning for Image Recognition. He, K., Zhang, X., Ren, S., Sun, J. Proc IEEE Conf Comput Vis Pattern Recognit (CVPR), , 770-778 (2016).
  36. Efficient multi-scale attention module with cross-spatial learning. ICASSP 2023-2023 IEEE Int Conf Acoustics Speech Signal Proc (ICASSP). Ouyang, D., et al. , IEEE. 1-5 (2023).
  37. Rethinking mobile block for efficient attention-based models. Zhang, J., et al. 2023 IEEE/CVF Int Conf Computer Vis (ICCV) IEEE Comp Soc, , 1389-1400 (2023).
  38. Wang, Y., et al. Multi-Type Ship Target Detection in Complex Marine Background Based on YOLOv11. Processes. 13 (1), 249(2025).
  39. Shao, X., et al. Multi-Scale Feature Pyramid Network: A Heavily Occluded Pedestrian Detection Network Based on ResNet. Sensors. 21 (5), 1820(2021).
  40. YOLOv7: Trainable Bag-of-Freebies Sets New State-of-the-Art for Real-Time Object Detectors. Wang, C. Y., Bochkovskiy, A., Liao, H. Y. M. Proc IEEE/CVF Conf Comput Vis Pattern Recognit (CVPR), , 7464-7475 (2023).

Acceso restringido. Inicie sesión o comience una prueba gratuita para ver este contenido.

Reimpresiones y permisos

Solicitar permiso para reutilizar el texto o las figuras de este artículo de JoVE

Solicitar permiso

Etiquetas

Object DetectionCigarette Brand IdentificationReal Time DetectionSingle Stage RegressionAdaptive DownsamplingMulti Scale AttentionDynamic Detection HeadVisual RecognitionModel LightweightOcclusion Detection
Video próximamente

Artículos relacionados