Artículo de investigación

Evaluación en tiempo real del orden de alineación del tabaco cortado utilizando un modelo mejorado de regresión de una sola etapa

DOI:

10.3791/71669

29 de mayo de 2026

En este artículo

Resumen

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Se desarrolla un modelo mejorado de regresión de una sola etapa para la detección en tiempo real del orden de alineación del tabaco cortado. El enfoque integra tres optimizaciones estructurales y un método personalizado de predicción de orientación para mejorar la precisión de la detección mientras se reducen los parámetros del modelo y la complejidad computacional, permitiendo una evaluación eficiente de la alineación del tabaco cortado en entornos de producción industrial.

Resumen

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

El orden del tabaco cortado, definido como la consistencia de alineación del tabaco cortado a lo largo del eje del cigarrillo, es un factor crítico en la optimización de la calidad de producción. La evaluación precisa y automatizada de esta propiedad sigue siendo un reto debido a las complejas estructuras de las hebras y las condiciones variables de imagen. Se desarrolla un modelo mejorado de regresión de una sola etapa para permitir la detección fiable del orden de alineación del tabaco cortado. El enfoque incorpora tres modificaciones arquitectónicas: un método interactivo de muestreo multifrecuencia para preservar la información de características, una estrategia de fusión complementaria triple para mejorar la representación de características a múltiples escalas, y un cabezal de detección dinámica para mejorar la localización a diferentes escalas. Además, se implementa un método personalizado de predicción de orientación para cuantificar el orden de alineamiento. El modelo se evalúa con un conjunto de datos de imágenes industriales, logrando una precisión media del 89,9%, una precisión del 90,6% y una memoria de recuperación del 88,7%. En comparación con el modelo base, el enfoque propuesto reduce los parámetros del modelo en un 30,8% (de 2,6 millones a 1,8 millones) y la complejidad computacional en un 21,5 % (de 6,5G a 5,1G), mientras mejora el rendimiento. En general, el método permite una evaluación eficiente y precisa del orden de alineación del tabaco cortado y demuestra su idoneidad para aplicaciones industriales en tiempo real.

Introducción

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

El orden del tabaco cortado se refiere al grado de alineación axial del tabaco cortado dentro de un cigarrillo. Comprender los factores que influyen en esta propiedad, como la morfología del tabaco y los parámetros neumáticos de transporte, es esencial para optimizar los procesos de corte y ensamblaje. Por ello, investigar estos factores influyentes se ha convertido en una estrategia clave para las empresas tabacaleras que buscan reducir costes y mejorar la eficiencia de la producción. La evaluación tradicional del orden del tabaco cortado se basa en métodos manuales, que son ineficientes y a menudo carecen de consistencia y precisión. Por ello, existe una necesidad urgente en la industria de un sistema de detección automatizado, preciso y en tiempo real para optimizar los procesos de producción. Con el rápido avance del aprendizaje profundo, la evaluación automatizada del orden del tabaco cortado basada en la detección de objetos se ha vuelto factible. Sin embargo, la implementación de estos sistemas de evaluación en las líneas de producción sigue siendo un tema de investigación en gran medida inexplorado. No obstante, la tecnología de visión artificial se ha aplicado con éxito a tareas de inspección en otroscampos, proporcionando referencias valiosas para este estudio. En este contexto, los detectores basados en redes neuronales convolucionales (CNN) han surgido como el paradigma dominante y generalmente se categorizan en enfoques de dos etapas, como Faster R-CNN2, y marcos de una sola etapa, comola serie 3,4 You Only Look Once (YOLO).

En los últimos años, los algoritmos de detección de objetos basados en aprendizaje profundo, en particular el marco Faster R-CNN, han demostrado un potencial significativo en diversos ámbitos. Sin embargo, su aplicación directa a escenarios industriales y profesionales específicos suele estar limitada por entornos operativos complejos y requisitos únicos de tareas. En consecuencia, se han propuesto numerosas mejoras personalizadas para abordar estos desafíos. En el análisis de imágenes médicas, por ejemplo, Su et al.5 se centraron en optimizar parámetros y refinar las arquitecturas de red para mejorar la precisión de detección de objetivos pequeños y críticos en la detección de nódulos pulmonares. En la detección de defectos industriales, Chen et al.6 abordaron la interferencia de texturas en la inspección de tejidos integrando filtros de Gabor —optimizados mediante algoritmos genéticos— en la columna vertebral Faster R-CNN para suprimir eficazmente fondos complejos. Para superar los desafíos de la escasez de datos y la complejidad ambiental en la detección de objetivos submarinos, Zeng et al.7 introdujeron una red de oclusión adversarial. Esta red compite con el detector durante el entrenamiento, obligando al modelo a aprender características más robustas y así mitigando el sobreajuste. Además, para tareas de recuperación de grano fino como la identificación de instancias específicas, Li et al.8 mejoraron Faster R-CNN mediante estrategias de concatenación en capas de características y ajuste fino, mejorando significativamente su rendimiento en imágenes de baja resolución. Wang et al.9 propusieron recientemente un marco Faster R-CNN multipartido, que preserva la privacidad, y que permite el cálculo seguro de imágenes cifradas y parámetros de modelo mediante protocolos novedosos para división segura, exponenciación y logaritmo. Sun et al.10 demostraron la eficacia de un R-CNN más rápido mejorado para reconocer múltiples tipos de defectos en los cubos de ruedas, logrando una precisión media media (mAP) superior a la R-CNN y YOLOv3. En conjunto, estos esfuerzos subrayan la evolución continua de Faster R-CNN hacia una mayor adaptabilidad, robustez y aplicabilidad en diversos escenarios reales. Paralelamente a estos avances en detectores de dos etapas, también han experimentado un desarrollo sustancial marcos de una sola etapa como la serie YOLO.

Como alternativa destacada a los detectores de dos etapas, la serie YOLO ha obtenido un reconocimiento significativo tanto en la industria como en la investigación debido a su arquitectura eficiente y excelente rendimiento de detección en tiempo real. Desde la introducción del modelo de primera generación por Redmon et al.11en 2016, las iteraciones sucesivas han abordado progresivamente diversas limitaciones técnicas, lo que ha impulsado a los investigadores a desarrollar adaptaciones especializadas para aplicaciones específicas de dominio. En sistemas de monitorización del tráfico, por ejemplo, Jamtsho et al.12 implementaron YOLOv2 combinado con un algoritmo de seguimiento de centroides para identificar con precisión las matrículas de motoristas sin casco en los transmisiones de vídeo, reduciendo efectivamente los falsos positivos manteniendo una alta tasa de detección del 98,52%. Para entornos submarinos desafiantes, Neelamegam et al.13 desarrollaron un modelo híbrido YOLO-Transformer que integra la capacidad de detección en tiempo real de YOLO con mecanismos de atención basados en transformadores para una mejor comprensión contextual. Al incorporar datos en tiempo real de sensores IoT sobre factores ambientales como la turbidez y los niveles de luz, el modelo se adapta dinámicamente a condiciones cambiantes, logrando una precisión de detección del 97,5% y superando a los modelos convencionales en escenarios ruidosos y de baja visibilidad. De manera similar, Zhang et al.14 propusieron un modelo mejorado de YOLO para aplicaciones de teledetección. Para abordar los retos de la representación insuficiente de características y la confusión de fondo, introdujeron módulos especializados para la mejora de características, fusión multiescala y conciencia global del contexto, que mejoran significativamente la precisión de detección de objetos pequeños. En conjunto, estos estudios demuestran la evolución continua de la serie YOLO hacia una mayor adaptabilidad, robustez y eficacia en diversos escenarios reales.

A pesar de estos avances, las versiones recientes de la familia YOLO, como YOLOv113, no están inherentemente optimizadas para las complejidades texturales y estructurales específicas del tabaco cortado en entornos industriales. Sus operaciones estándar de reducción de muestreo pueden provocar la pérdida de características de grano fino que son cruciales para distinguir el tabaco alineado del tallado desordenado. Además, sus cabezales de detección a escala fija tienen dificultades para manejar eficazmente la naturaleza multiescala de las características del tabaco bajo condiciones de imagen variables.

Para abordar estos desafíos, este artículo propone un modelo mejorado de regresión de una sola etapa basado en YOLOv11n, combinado con un método personalizado de predicción de orientación, para una detección robusta en línea del orden del tabaco cortado. Las principales contribuciones de este artículo son tres. (1) Se propone un método de muestreo interactivo multifrecuencia (MFID). Las operaciones estándar de convolución strided o pooling descartan información de grano fino, mientras que MFID descompone explícitamente las características en componentes de baja y alta frecuencia usando la transformada wavelet de Haar. Este enfoque preserva más información original y mitiga la pérdida de información durante el muestreo reducido. (2) Un método de fusión complementaria triple (TCF) está diseñado para mejorar la calidad de las características fusionando información semántica superficial, media y profunda. Aunque operaciones simples de concatenación o suma se usan comúnmente para la fusión de características, TCF introduce una fusión ponderada guiada por capa intermedia con ramas de peso inversas, logrando así complementariedad entre información semántica y detallada. (3) Se introduce una cabeza de detección dinámica (DynamicHead) para reemplazar la cabeza de detección original. La cabeza de detección original se basa en operaciones de convolución a escala fija; en contraste, DynamicHead integra mecanismos de atención conscientes de escala, espaciales y conscientes de la tarea. Esto permite un ajuste dinámico de la importancia de las características y una fusión de características multiescala más flexible y eficaz, mejorando así la capacidad del modelo para localizar y clasificar con precisión características relacionadas con el orden.

Acceso restringido. Inicie sesión o comience una prueba gratuita para ver este contenido.

Protocolo

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Este estudio no involucró sujetos humanos, animales vertebrados ni tejidos regulados; por lo tanto, no se requería aprobación ética ni la aprobación de un comité de revisión institucional. El conjunto de datos utilizado en este estudio fue obtenido de Longyan Tobacco Industry Co., Ltd. Se recogieron imágenes de cinco lotes de producción independientes durante un periodo de tres meses. El muestreo se realizó de forma aleatoria en diferentes momentos del día (mañana, tarde y noche) para captar variaciones naturales en las condiciones de producción. El conjunto de datos incluye muestras que cubren un rango de humedad del tabaco del 12%–18%, velocidades de corte de 1,5, 2,0 y 2,5 m/s, y presiones de transporte neumáticas de 0,4, 0,5 y 0,6 MPa, asegurando así la cobertura de las condiciones típicas de producción.

Adquisición y Configuración de Conjuntos de Datos
Configuración de hardware
El sistema de adquisición de imagen se configuró para cumplir con los requisitos de detección del orden del tabaco cortado en cigarrillos que no queman por calor. Consistía principalmente en una cámara industrial, una lente industrial, una fuente de luz visual y una unidad de control industrial. El sistema empleaba una cámara industrial MV-CH120-10GC combinada con un objetivo industrial MVL-KF0818M-12MP para capturar imágenes en alta definición de la región del tabaco cortado en la superficie de varillas de cigarrillos seccionados. La cámara estaba situada a una distancia de trabajo de 150 mm desde la superficie de la varilla de cigarrillos. La fuente de luz LED en tira se montaba coaxialmente con la cámara a una distancia de 80 mm del objetivo, con un ángulo de incidencia de 45°. La imagen se realizó dentro de un recinto negro mate para eliminar la interferencia de la luz ambiental. La carcasa es una capucha de aluminio pintada de negro mate con dimensiones internas de 400 mm (ancho) × 350 mm (profundidad) × 300 mm (alto), y superficies interiores recubiertas con pintura negra mate (reflectancia < 5% a 550 nm) para minimizar los reflejos internos y garantizar condiciones de iluminación consistentes. Para garantizar la calidad y consistencia de la imagen, se utilizó una fuente de luz MV-LRDS-H-95-30-W para establecer un entorno de iluminación estable, minimizando el impacto de las variaciones de la luz ambiental en la extracción de contornos de hebras de tabaco y el reconocimiento de orientación. Las imágenes adquiridas eran recibidas, procesadas y almacenadas por un ordenador industrial PC1010-AX360, que también realizaba algoritmos de reconocimiento posteriores, cálculos de resultados y salida de interfaz. No se realizó calibración ni corrección explícita de distorsión de la cámara, ya que la combinación de cámara industrial y objetivo mostraba una distorsión radial insignificante (menos del 0,5% en los bordes de la imagen) dentro del campo de visión de 896 × 1600 píxeles. La cámara y la fuente de luz estaban montadas rígidamente sobre un marco fijo para garantizar la estabilidad posicional durante la adquisición de la imagen. La intensidad de la fuente de luz se mantuvo a un nivel constante durante la adquisición de la imagen. El campo de visión se configuró para cubrir completamente la región del tabaco cortado expuesto dentro de la estructura de soporte de acero.

Ajuste de parámetros de cámara
Se activaba la adquisición de imágenes, y se capturaban imágenes después de que el cigarrillo de muestra se colocara y seccionara y luego se guardara en formato JPG. Para garantizar la consistencia de las imágenes adquiridas, los parámetros de adquisición se establecieron manualmente. Concretamente, la resolución de imagen se estableció en 896 × 1600. El tiempo de exposición se estableció inicialmente en 4000 μs y podía ajustarse finamente dentro de un rango de 3000 a 6000 μs según el brillo in situ. Todo el ajuste de parámetros se realizó con la muestra colocada dentro del gabinete negro mate descrito anteriormente, bajo condiciones de iluminación totalmente controladas. No había luz ambiental externa durante la sintonización, ya que el sistema de imagen funcionaba en un entorno totalmente cerrado con las luces de la sala apagadas. La ganancia se estableció inicialmente en 2 dB y se controló dentro de un rango de 0 a 6 dB según los niveles de ruido. El valor gamma se estableció en 0,8 y el balance de blancos se configuró con parámetros fijos. Los parámetros finales de adquisición se establecieron de la siguiente manera: tiempo de exposición = 4000 μs, ganancia = 2 dB, gamma = 0,8, modo de balance de blancos = fijo, resolución de imagen = 896 × 1600 píxeles y formato de imagen = JPG. Para el balance de blancos, se utilizó el modo de parámetros fijos. La calibración se realizó utilizando una tarjeta de referencia blanca estándar (X-Rite ColorChecker) colocada en la posición de la muestra. Las ganancias de canales rojo y azul se ajustaron hasta que los valores RGB de la tarjeta blanca se igualaron con una desviación del ±2%. Tras la calibración, los parámetros del balance de blancos se fijaron de la siguiente manera: ganancia roja = 1,2, ganancia verde = 1,0 (fija) y ganancia azul = 1,5. La calibración se realizaba una vez después de cada arranque del sistema o siempre que la fuente de luz mostraba signos de envejecimiento que pudieran causar una deriva de temperatura de color. Estos ajustes ayudaron a garantizar límites claros del tabaco cortado y una distribución estable del brillo, al tiempo que cumplían con los requisitos de procesamiento para la segmentación posterior de hebras de tabaco, el cálculo de orientación y el análisis de orden.

Colección de imágenes
La adquisición de imágenes se centró en la zona de tabaco cortado expuesta en la superficie de varillas de cigarrillo que no se queman tras la sección. Durante la detección, la muestra de cigarrillo se entregaba primero a la estación de inspección, donde su postura y posición se ajustaban y fijaban mediante el mecanismo de posicionamiento de la muestra. El mecanismo de posicionamiento consiste en una abrazadera neumática con guías de alineación en forma de V. El sistema alcanza una repetibilidad posicional de ±0,5 mm durante 1000 ciclos consecutivos, como lo confirman las mediciones del sensor de desplazamiento láser. Posteriormente, el material de envolvimiento exterior se seccionaba de forma estable mediante el mecanismo de corte, exponiendo completamente el tabaco cortado en superficie dentro del campo de visión del sistema de visión. Se utilizaba una hoja circular giratoria (diámetro 50 mm, grosor 0,3 mm, material acero de alta velocidad). La profundidad de corte se estableció en 1,5 mm con una velocidad de rotación de 300 rpm. La consistencia del corte se monitorizaba mediante retroalimentación del codificador lineal, manteniendo una variación de grosor dentro de ±0,05 mm. Una vez estable la posición de la muestra y la región de imagen claramente definida, la adquisición de imagen se realizaba utilizando la cámara industrial bajo una iluminación estable proporcionada por la fuente de luz. Se recopilaron un total de 634 imágenes; las imágenes típicas se muestran en la Figura 1. El conjunto de datos incluye tres niveles de densidad de tabaco (bajo, medio, alto; aproximadamente 180, 220 y 260 mg/cm 3), orientaciones de hebras que abarcan entre −180° y 180°, y condiciones de iluminación que van desde la iluminación normal hasta condiciones de borde con poca luz. La iluminancia se midió utilizando un luxímetro digital calibrado (TA8133, con precisión ±3%) y el sensor situado en la superficie de la muestra. El rango normal de iluminación medido es de 200–800 lux, proporcionado por la fuente de luz LED en tira dentro de la campana cerrada, sin fuga de luz ambiental. El valor en el extremo bajo (aproximadamente 200 lux) representa una condición de caso límite creada al atenuar la fuente de luz para evaluar la robustez del modelo. Además, la oclusión parcial de las hebras de tabaco (que varía entre el 10% y el 50%) está presente en aproximadamente el 30% de las imágenes. Estas variaciones reflejan una verdadera diversidad en las líneas de producción.

figure-protocol-1
Figura 1. Imágenes representativas en bruto del tabaco cortado adquiridas por el sistema de visión. (a–h) Ejemplos representativos de imágenes en bruto de tabaco cortado capturadas en condiciones de campo industrial utilizando el sistema de adquisición de imágenes. Las imágenes se obtuvieron con una resolución de 896 × 1600 píxeles bajo iluminación controlada utilizando una fuente de luz en tira para asegurar un brillo uniforme y minimizar interferencias ambientales. Estas imágenes ilustran variaciones en la distribución, densidad y orientación de las cadenas de tabaco antes del procesamiento del modelo. Por favor, haz clic aquí para ver una versión ampliada de esta figura.

Anotación de imagen
Utilizando la herramienta de código abierto LabelImg, se dibujaban cuadros delimitados alrededor de elementos visibles de soporte de tabaco y acero. Se asignó el ángulo correcto como etiqueta para cada caja delimitadora. El eje horizontal (0°) se definía como la dirección hacia la derecha paralela al borde inferior de la imagen. Para cada hilo de tabaco, la función de medición de ángulo de la herramienta de anotación se utilizaba para dibujar una línea a lo largo del eje mayor de la hebra. El ángulo se registraba como el ángulo entre este eje y la referencia horizontal (rango: −180° a 180°). Las anotaciones se guardaban en el formato estándar de detección de una sola etapa, con un archivo TXT correspondiente a cada imagen. Cada archivo .txt contiene líneas formateadas como: class_id x_center y_center altura de ancho. Las coordenadas se normalizan a [0,1] en relación con las dimensiones de la imagen. Clase 0 = hilo de tabaco, clase 1 = soporte de acero. La etiqueta del ángulo se almacena como una sexta columna en el archivo de .txt de anotaciones, añadida después de los cinco campos estándar de YOLO. El formato exacto por línea es: class_id x_center y_center ángulo de altura de ancho. El valor del ángulo se almacena en grados como un número de coma flotante que va de −180,0 a 180,0, con dos decimales (por ejemplo, 45,75). Línea de ejemplo: 0 0,5230 0,4170 0,0850 0,0620 38,25.

Control de calidad
Un segundo anotador revisó un 20% seleccionado aleatoriamente de las imágenes anotadas. La selección aleatoria se realizó usando la función random.sample() de la biblioteca aleatoria de Python con una semilla aleatoria fija de 2024. Se generó una lista de todos los nombres de archivos de imagen, y el 20% de las imágenes se muestrearon sin reemplazo usando este generador de números aleatorios sembrados, asegurando una selección reproducible a través de procedimientos repetidos de control de calidad. Cualquier discrepancia se discutía y resolvía, asegurando la coherencia del etiquetado. La concordancia entre anotadores se evaluó mediante desviación angular: la diferencia absoluta media entre las etiquetas angulares de los dos anotadores fue de 2,8° (desviación estándar = 1,5°). Se revisaron y conciliaron las anotaciones con desviación >5°.

Modelo de regresión de una sola etapa para la detección del orden del tabaco cortado
La detección del orden de alineación del tabaco cortado es crucial para mejorar tanto el proceso de fabricación como la calidad final del producto en la producción de cigarrillos. Sin embargo, esta tarea de inspección se enfrenta a varios desafíos, como el solapamiento de tabaco cortado, pequeños tamaños de objetivos y una iluminación desigual, todos los cuales comprometen la precisión y robustez de la detección. Se utiliza un modelo mejorado de regresión de una sola etapa basado en YOLOv11n para la detección en línea del orden del tabaco cortado. El marco propuesto identifica con precisión las características morfológicas del tabaco cortado durante la formación de la varilla de cigarrillo, permitiendo una detección fiable de la regularidad del alineamiento mientras mejora la precisión, la robustez y la capacidad de procesamiento en tiempo real. La configuración general del marco propuesto de regresión de una sola etapa se muestra en la Figura 2.

figure-protocol-2
Figura 2. Arquitectura general del modelo de regresión de una sola etapa propuesto. El diagrama ilustra la estructura completa de la red, incluyendo la columna vertebral, el cuello y la cabeza de detección. La columna vertebral extrae características multiescala, incorporando módulos interactivos de muestreo de descenso multifrecuencia (MFID) para preservar la información de características. El mástil integra características utilizando la estrategia de fusión triple complementaria (TCF) para mejorar la representación multinivel. El cabezal de detección adopta el módulo DynamicHead, que integra mecanismos de atención conscientes de escala (πL), conscientes espacialmente (πS) y conscientes de tareas (πC) para mejorar el rendimiento en localización y clasificación. Por favor, haz clic aquí para ver una versión ampliada de esta figura.

Módulo de Reducción de Muestreo de Información Multifrecuencia (MFID)
En la red troncal de YOLOv11, la operación convolucional con un paso de 2 realiza el muestreo descendente saltándose píxeles. Este proceso descarta directamente la mitad de la información espacial, lo que resulta en la pérdida de detalles de alta frecuencia (por ejemplo, bordes y texturas de objetos pequeños) y una pérdida significativa de información para objetivos pequeños. Además, las operaciones de max-pooling y promedio-pooling en la columna vertebral también descartan información detallada dentro de las regiones de los objetos, características suaves e introducen ruido, todo lo cual afecta negativamente al aprendizaje de características.

Para abordar estos problemas, se introduce un módulo MFID, inspirado en el concepto de descomposición jerárquica dewavelet 15,16. Este módulo primero descompone las características en dos partes complementarias utilizando la transformada wavelet de Haar: información de fondo de baja frecuencia, que mejora la clasificación, y detalles de alta frecuencia ricos en bordes y texturas, que mejoran la detección de objetivos pequeños. Para reforzar aún más la percepción de objetivos pequeños, el módulo MFID incorpora dos ramas adicionales: una rama de max-pooling que aprovecha la invariancia de la traducción para preservar características finas de objetivos pequeños, y una rama de convolución en escalado que utiliza parámetros aprendibles para lograr una mayor capacidad representacional y una composición de información más rica. A través de esta estructura multirama, el módulo MFID conserva información espacial y de frecuencia más completa durante el muestreo descendente. La arquitectura del módulo MFID se ilustra en la Figura 3.

figure-protocol-3
Figura 3. Estructura del módulo MFID. El módulo MFID separa las características de entrada en componentes de baja y alta frecuencia utilizando una transformada de wavelet de Haar para preservar la información estructural crítica durante el muestreo descendente. HLL denota el componente de aproximación de baja frecuencia, mientras que HLH, HHL y HHH representan componentes de detalle de alta frecuencia en las direcciones horizontal, vertical y diagonal, respectivamente. El símbolo 2↓ indica un muestreo descendente doble. Los mapas de características de múltiples ramas se fusionan mediante mecanismos de concatenación y acceso para mejorar la representación de características. Por favor, haz clic aquí para ver una versión ampliada de esta figura.

Durante el muestreo descendente, la imagen se descompone utilizando la transformada wavelet de Haar, adoptada por su simplicidad y eficiencia en la descomposición de características de baja y alta frecuencia, lo que la hace adecuada para tareas de detección en tiempo real. HL y H H denotan los filtros de descomposición pasa y paso alto, respectivamente, y se emplean para extraer información de baja y alta frecuencia de la imagen. La función base de wavelet y la función de escalado para una transformada de Haar unidimensional y de un nivel se definen usando la Ecuación 1 de la siguiente manera:

figure-protocol-4 (1)

La función base de Haar se define usando la Ecuación 2 de la siguiente manera:

figure-protocol-5 (2)

Aquí, los parámetros j y k denotan respectivamente el coeficiente de escala y la cantidad de traslación de la función base de Haar. Específicamente, la función base de Haar de orden cero se define usando la Ecuación 3 de la siguiente manera:

figure-protocol-6 (3)

En la Figura 3, el símbolo 2↓ denota muestreo descendente doble. Una descomposición en wavelet de Haar en dos niveles produce cuatro componentes: la aproximación de baja frecuencia (HLL) y los componentes de detalle de alta frecuencia en las direcciones horizontal (HLH), vertical (HHL) y diagonal (HHH). El componente HLL transporta información de contorno, fondo y global, mientras que los componentes de alta frecuencia (HLH, HHL y HHH) capturan características de borde, textura y grano fino.

Los componentes de alta frecuencia HLH, HHL y HHH obtenidos tras el muestreo descenso doble son concatenados por la operación Concat, integrando así la información detallada multidireccional para generar la información figure-protocol-7detallada integrada de alta frecuencia, como se muestra en la Ecuación 4.

figure-protocol-8 (4)

Posteriormente, se realiza una fusión de información secundaria en la rama de max-pooling para integrar características detalladas con características globales, generando así información figure-protocol-9reconstruida, como se muestra en la Ecuación 5, que incorpora un conjunto más amplio de características salientes y reutiliza información detallada de alta frecuencia para mejorar la representación de características.

figure-protocol-10 (5)

A partir de entonces, se emplea un mecanismo de acceso para regular dinámicamente el flujo de información, y se figure-protocol-11 aprovecha para guiar la identificación de pequeñas características objetivo dentro del figure-protocol-12, preservando características útiles mientras suprime interferencias ruidosas inherentes e inútiles. El mecanismo de acceso se define como: gating(x) = Linear_2(ReLU(Linear_1(x))), donde Linear_1 reduce la dimensión del canal en un factor de reducción de 4, y Linear_2 la restaura a la dimensión original del canal. La salida del mecanismo de compuerta pasa por una activación sigmoide para producir pesos de modulación en el rango [0,1]. Los parámetros aprendibles incluyen las matrices de pesos y los términos de sesgo de ambas capas lineales, que se inicializan mediante inicialización uniforme. Esto garantiza que la información detallada y crítica de las características esté correctamente equilibrada y utilizada, dando lugar a la característica figure-protocol-13 detallada final tal como se presenta en la Ecuación 6.

figure-protocol-14 (6)

Finalmente, la información de reducción de muestreo de la convolución de la zancada, el vector de baja frecuencia y la característica detallada final se concatenan mediante Concat para ampliar la interacción de muestreo de la característica a través de múltiples dimensiones y bandas de frecuencia, como se muestra en la Ecuación 7.

figure-protocol-15 (7)

Pasos de acción y implementación
Definición del módulo
Un módulo personalizado de PyTorch llamado MFID debe definirse dentro de los archivos de definición del modelo del proyecto. La implementación de este módulo consta de cuatro caminos paralelos: (1) Transformada wavelet: se aplica una descomposición de dos niveles al mapa de características de entrada usando filtros de wavelet de Haar predefinidos, generando un componente de aproximación de baja frecuencia y componentes de detalle de alta frecuencia en las direcciones horizontal, vertical y diagonal, tras lo cual se concatenan los tres componentes de alta frecuencia; (2) Max-pooling: se aplica max-pooling a la entrada para preservar características destacadas; (3) Convolución stridée: el muestreo estándar se realiza a través de una capa convolucional con una zancada de 2; (4) Reconstrucción y fusión de características: primero, la información de alta frecuencia obtenida de la transformada wavelet se fusiona con las características de la rama de max-pooling; Posteriormente, se emplea un mecanismo de compuerta guiado por la información de baja frecuencia para filtrar características de grano fino; Finalmente, se concatenan las características procesadas de grano fino, los componentes de baja frecuencia y la salida de convolución en estratificación para obtener el mapa final de características con muestreo reducido.

Edición de archivos de configuración
El archivo de configuración del modelo base (config.yaml) debe abrirse. Todas las instancias de módulos estándar de reducción de muestreo tanto en la red troncal como en la de cuello deben identificarse sistemáticamente. Cada entrada identificada del módulo de reducción debe ser reemplazada por el módulo MFID.

Motivación de diseño
El módulo MFID está diseñado para mitigar la pérdida de información en operaciones estándar de muestreo reducido, lo cual es especialmente perjudicial para la detección de objetos pequeños. Su concepto central está inspirado en la descomposición jerárquica de wavelets. Al separar explícitamente la información global de baja frecuencia de la información de detalle de alta frecuencia en la imagen y procesarla en consecuencia, el módulo garantiza que las características críticas de textura y bordes se preserven durante el muestreo descendente. La incorporación de ramas max-pooling y strided-convolution captura y complementa aún más características desde perspectivas complementarias—específicamente, invariancia de traducción frente a representación aprendible. Mediante fusión multirama, el módulo proporciona a las capas de red subsecuentes una representación de características multifrecuencia más informativa y robusta. Todos los parámetros arquitectónicos no especificados y las configuraciones de capa siguen la configuración predeterminada de implementación del framework YOLOv11n dentro de PyTorch.

Módulo de Fusión de Triple Cruzamiento (TCF)
En la etapa de fusión de características del cuello de la arquitectura de red YOLOv11, normalmente se utiliza una operación simple de concatenación para fusionar mapas de características de la misma escala. Sin embargo, este enfoque directo tiene limitaciones claras: primero, no tiene en cuenta completamente las diferencias semánticas entre características en distintos niveles; Segundo, la falta de modelado explícito de las correlaciones entre canales hace que las características de pequeños objetivos sean propensas a diluirse o perderse durante la fusión, comprometiendo así el rendimiento de la detección. Para abordar estos problemas, se introduce un método de fusión más interactivo, denominado módulo TCF, 17. Este método emplea una estrategia de fusión progresiva multinivel que guía el flujo de información hacia la detección de objetivos pequeños mediante transmisión entre capas. También incorpora operaciones no lineales adicionales para explorar información a nivel profundo a través de escalas, mejorando así la fusión de características multiescala. A diferencia de los módulos convencionales que dependen de la simple adición o fusión media, TCF adopta un enfoque de fusión ponderada. Esto le permite aprender información detallada de forma adaptativa en cada nivel, optimizar dinámicamente las rutas de extracción de información y centrarse en las características más discriminativas, mejorando en última instancia la precisión de la detección. La arquitectura del módulo TCF se ilustra en la Figura 4.

figure-protocol-16
Figura 4. Estructura del módulo TCF. El módulo TCF realiza fusión de características multinivel a través de capas superficiales, medias y profundas para mejorar la representación de objetivos pequeños. P representa los mapas de características de entrada en diferentes niveles. Conv denota operaciones de convolución, Upsampling indica aumento de muestreo de características, y AdaptiveAvgPool representa el agrupamiento medio adaptativo. El módulo integra características calibradas mediante fusión ponderada e interacción entre capas para mejorar la complementariedad semántica y espacial. Por favor, haz clic aquí para ver una versión ampliada de esta figura.

En la tarea de detección de objetos, la información contenida en la característica de capa profunda Pi+1 y la característica de capa superficial Pi-1 difiere significativamente. Para potenciar la fusión de información entre capas, se introduce la capa intermedia Pi como la capa final de fusión de características para equilibrar las diferencias entre la información de características a distintos niveles.

Primero, la información de entrada de las capas superficial, media y profunda se procesa utilizando la función de activación sigmoide para generar características figure-protocol-17ponderadas , figure-protocol-18, y figure-protocol-19, que sirven para fortalecer características clave y debilitar las redundantes, como se muestra en la Ecuación 8.

figure-protocol-20 (8)

En segundo lugar, la información de entrada de las capas superficial, media y profunda se multiplica elemento por elemento por las características ponderadas mapeadas para generar características figure-protocol-21calibradas , figure-protocol-22, y figure-protocol-23, como se muestra en la Ecuación 9. La importancia de las características se ajusta dinámicamente mediante el mecanismo de atención en el peso, logrando así una selección adaptativa y recalibración de características.

figure-protocol-24 (9)

En la etapa de fusión de características de capa intermedia, se aprovechan dos ramas de peso inverso para fusionarse con las características calibradas de capa superficial y profunda, respectivamente, filtrando la información detallada falsa inducida por el ruido en las características de capa superficial y la información semántica asociada sesgada en las características de capa profunda. Posteriormente, la información multirama se integra, y las características originales, calibradas y interactivas de esta capa, así como las características calibradas de capa superficial y profunda, se fusionan. Esto logra la preservación y complementación de la información de características multiescala, mitiga los problemas de pérdida de información en objetivos pequeños y errores de juicio, y finalmente produce características figure-protocol-25fusionadas de capa intermedia, que se formulan usando la Ecuación 10 de la siguiente manera:

figure-protocol-26 (10)

Las asociaciones entre la capa superficial, la capa profunda y la capa media se establecen por separado, como se muestra en las Ecuaciones 11 y 12.

figure-protocol-27 (11)

figure-protocol-28 (12)

Finalmente, las salidas de los tres caminos de fusión de características se concatenan mediante la operación Concat para preservar la independencia de características de cada camino individual. La información clave de cada camino se aprende dinámicamente en función de los pesos α, β y γ, que se definen como parámetros escalares aprendibles inicializados a 1.0 y optimizados mediante retropropagación durante el entrenamiento, permitiendo un equilibrio dinámico de contribuciones de caminos superficiales, medios y profundos de características. Además, se emplean operaciones convolucionales para agregar información contextual, eliminar respuestas incoherentes en los límites de características causadas por la concatenación entre capas y optimizar la adquisición y representación refinada de información detallada de pequeños objetivos. El proceso se formula usando la Ecuación 13 de la siguiente manera:

figure-protocol-29 (13)

Pasos de acción y implementación
Definición del módulo
Un módulo personalizado de PyTorch llamado TCF debe definirse dentro de los archivos de definición del modelo del proyecto. Este módulo toma como entrada los mapas de características de capa superficial, intermedia y capa profunda extraídos de diferentes etapas de la red troncal. Su flujo interno de procesamiento consta de tres pasos principales: (1) Calibración de características: la función sigmoide se aplica a cada una de las tres capas de características de entrada para generar mapas de pesos, que luego se multiplican elemento por elemento con los mapas originales para mejorar características clave mientras suprimen las redundantes; (2) Fusión interactiva: en la etapa de fusión de características de capa media, se introducen dos ramas de peso inverso para fusionarse con las características calibradas de capa superficial y profunda, respectivamente, filtrando información detallada falsa inducida por el ruido en las características de capa superficial y la información semántica asociada sesgada en las características de capa profunda; (3) Agregación multicamino: las características originales, las características calibradas, las características interactivas y las características fusionadas con información superficial y profunda se integran, tras lo cual se aplican operaciones convolucionales para eliminar respuestas incoherentes en los límites de características causadas por la concatenación entre capas, generando finalmente características fusionadas ricas en información multiescala.

Edición de archivos de configuración
El archivo de configuración del modelo (config.yaml) debe abrirse. Las secciones de fusión de características en la red de cuello —específicamente, las capas donde se fusionan características de diferentes etapas de la red troncal—. En estas posiciones, las capas originales de operaciones de concatenación simples deben reemplazarse por una llamada al módulo TCF, asegurando que las entradas del módulo estén correctamente conectadas a las características superficiales, intermedias y profundas correspondientes.

Motivación de diseño
El diseño del módulo TCF está motivado por los desafíos de la disparidad y la pérdida de información durante la fusión de características. Las características superficiales son ricas en detalles pero contienen un ruido considerable, mientras que las características profundas presentan una semántica fuerte pero baja resolución. Para abordar esto, el módulo TCF introduce una característica de capa intermedia como equilibrador de información e incorpora caminos cuidadosamente diseñados para calibración, interacción y agregación para maximizar las ventajas complementarias de las características entre niveles. La motivación subyacente es establecer un mecanismo de fusión más eficaz capaz de evaluar dinámicamente la importancia de las características en cada nivel e integrar selectivamente la información. Como resultado, genera una representación de características de alta calidad para la cabeza de detección posterior, rica tanto en detalles como en información semántica, lo que la hace especialmente adecuada para el reconocimiento de objetos pequeños.

Módulo DynamicHead
El componente de cabeza de detección cumple la función fundamental de realizar el reconocimiento de objetos multiescala sobre representaciones de características generadas por la columna vertebral y las redes de fusión de características. Este proceso permite la localización espacial precisa de objetos detectados, la asignación categórica y la estimación de fiabilidad de las predicciones de cajas delimitadoras. Dadas las importantes variaciones a escala de las características objetivo en los datos visuales y la densa concentración de propuestas de cajas delimitadoras en ciertos marcos, la identificación precisa del tabaco cortado requiere el análisis de patrones multiescala. Para abordar esto, el método adopta la arquitecturaDynamicHead 18 como sustituto del cabezal de detección nativo en YOLOv11n, estableciendo un marco de autoatención que integra mecanismos conscientes de escala, espacial y conscientes de tareas para mejorar tanto la capacidad de detección como la eficiencia operativa. La configuración estructural del componente DynamicHead se ilustra en la Figura 5.

figure-protocol-30
Figura 5. Estructura del módulo de detección Dynamichead. El módulo DynamicHead incorpora tres mecanismos secuenciales de atención: consciente de escala (πL), consciente espacialmente (πS) y consciente de la tarea (πC). Estos componentes ajustan dinámicamente la importancia de las características a través de escalas, regiones espaciales y tareas de detección. Este diseño mejora tanto la precisión de localización como el rendimiento de clasificación al permitir el refinamiento adaptativo de características dentro de la cabeza de detección. Por favor, haz clic aquí para ver una versión ampliada de esta figura.

Esta arquitectura comprende tres unidades de atención especializadas: componentes conscientes de escala (πL), conscientes del espacio (πS) y conscientes de la tarea (πC). El mecanismo de atención consciente de escala (πL) primero promedia el mapa de características de entrada a lo largo de dimensiones espaciales y de canal. El resultado se pasa por una capa de proyección lineal seguida de una activación sigmoide dura para generar pesos de escala, que luego se multiplican elemento por elemento con el mapa de características original. El mecanismo de atención espacialmente consciente (πS) emplea convolución deformable con K = 9 puntos de muestreo seleccionados de forma dispersa. Predice vectores desplazados Δpk y escalares de modulación Δm k para cada punto de muestreo, y luego agrega las características muestreadas para producir pesos de atención espacial. El mecanismo de atención consciente de la tarea (πC) aplica una transformación lineal aprendible a cada canal de forma independiente usando dos conjuntos de parámetros (α1, β1 y α2, β2). Selecciona la respuesta máxima entre las dos representaciones transformadas para adaptar dinámicamente las características a tareas de clasificación y regresión. Finalmente, estos tres mecanismos de atención se aplican secuencialmente al mapa de características de entrada como F_out = πC(πS(πL(F) · F) · F) · F. El mecanismo consciente de la escala emplea ponderación de características cruzadas para combinar de forma adaptativa representaciones multirresolución, refinando así la sensibilidad del modelo a las variaciones dimensionales. El componente espacialmente consciente implementa ponderación de énfasis regional dentro de los mapeos de características, dirigiendo el enfoque computacional hacia entidades en primer plano mientras suprime interferencias de fondo irrelevantes. Mientras tanto, el módulo consciente de tareas modula dinámicamente las representaciones de salida para objetivos específicos, refinando tanto los resultados de clasificación como de regresión para reforzar la precisión del modelo y la robustez operativa. El procedimiento computacional está formalizado en las Ecuaciones 14–17.

figure-protocol-31 (14)

figure-protocol-32 (15)

figure-protocol-33 (16)

figure-protocol-34 (17)

Aquí, WL(F) denota la representación de características enriquecidas por atención, mientras que πL(F), πS(F) y πC(F) corresponden a operaciones de atención a escala, espacial y orientadas a tareas, respectivamente. La transformación f representa una capa de proyección lineal, σ(x) indica procesamiento de activación sigmoide dura, K especifica la cantidad de puntos espaciales seleccionados de forma dispersa, pk+Δp k introduce ajustes de posición para enfatizar áreas discriminativas, Δmk constituye una medida de significancia entrenómable para el punto espacial pk, y α(F) y β(F) son funciones paramétricas aprendibles que rigen los umbrales de activación. Entre ellos, K se establece en 9 en todos los experimentos, ya que este valor proporciona suficiente cobertura espacial manteniendo la eficiencia computacional.

Pasos de acción y implementación
Definición del módulo
Un módulo personalizado de PyTorch llamado DynamicHead debe definirse dentro de los archivos de definición del modelo del proyecto. La implementación de este módulo consta de tres unidades de atención aplicadas secuencialmente: (1) Atención consciente de escala: las capas de características en diferentes escalas se ponderan dinámicamente usando parámetros aprendibles; (2) Atención espacialmente consciente: basada en el concepto de convolución deformable, esta unidad se centra en ubicaciones espaciales dispersas pero discriminativas dentro de los mapas de características; (3) Atención consciente de la tarea: los umbrales de activación se aprenden dinámicamente para optimizar las representaciones de características para tareas de clasificación y regresión, respectivamente. Estos tres mecanismos de atención se aplican secuencialmente a la pirámide de características de entrada, produciendo finalmente características para la predicción. Todos los módulos se implementaron utilizando operaciones estándar de PyTorch, incluyendo capas convolucionales, capas lineales, funciones de activación y mecanismos de atención como se describió anteriormente.

Edición de archivos de configuración
El archivo de configuración del modelo (config.yaml) debe abrirse. La sección que define la cabeza de detección debe estar localizada. La configuración original de la cabeza de detección, que normalmente comprende una serie de capas convolucionales para clasificación y regresión, debe ser reemplazada por una llamada al módulo DynamicHead, asegurando que su entrada esté conectada a la salida de la pirámide de características por la red del mástil.

Motivación de diseño
Las cabezas de detección tradicionales suelen aplicar el mismo conjunto de parámetros convolucionales a todas las capas de características, ubicaciones espaciales y tareas, careciendo de adaptabilidad específica para cada tarea. La introducción del módulo DynamicHead está motivada por la complejidad de las tareas de detección, con el objetivo de desacoplar y abordar estos desafíos mediante una arquitectura unificada basada en la atención. Su motivación de diseño es triple: (1) enfocarse adaptativamente en capas de características correspondientes a objetivos de diferentes tamaños a través del módulo de conciencia de escala; (2) concentrar los recursos computacionales en regiones objetivo en primer plano en lugar de en el fondo mediante el módulo de conciencia espacial; y (3) optimizar dinámicamente las representaciones de características para los objetivos distintos de clasificación y regresión mediante el módulo consciente de la tarea. Esta combinación de desacoplamiento y optimización dinámica mejora la precisión de localización y la fiabilidad de clasificación del modelo para objetivos densamente dispuestos y multiescala, como el tabaco cortado.

Método de evaluación personalizado para el orden del tabaco cortado
Descripción del módulo y principio de diseño: La evaluación cuantitativa del orden de alineación del tabaco cortado es esencial para evaluar la estabilidad del proceso de fabricación y predecir la calidad del producto final en la producción de cigarrillos. Los métodos tradicionales de evaluación se basan en la inspección visual manual, que es subjetiva, consume mucho tiempo y no puede proporcionar mediciones cuantitativas consistentes. Para abordar estas limitaciones, se utiliza un método personalizado de predicción de ángulos integrado con el detector de regresión de una sola etapa mejorado. El principio fundamental de este método es establecer un marco de referencia espacial utilizando la estructura de soporte de acero dentro de la varilla del cigarrillo como referencia geométrica. Debido a que el soporte de acero mantiene una orientación fija durante la fabricación, sirve como línea de referencia ideal para calcular la orientación relativa del tabaco cortado individualmente. Al medir los ángulos absolutos del tabaco cortado detectado y el soporte de acero respecto a la línea de referencia horizontal y calcular posteriormente sus diferencias angulares relativas, el método proporciona una evaluación cuantitativa del orden de alineamiento. Un ángulo relativo de cero indica un paralelismo perfecto entre una hebra y el soporte, mientras que el aumento de la desviación angular indica un alineamiento más pobre. El eje de referencia horizontal se define como la línea paralela al borde inferior de la imagen, orientada de izquierda a derecha. Este eje corresponde a 0°, con ángulos positivos medidos en sentido antihorario y ángulos negativos medidos en sentido horario desde este eje. La métrica final de ordenidad se obtiene promediando los ángulos relativos de todas las hebras detectadas dentro de una imagen, permitiendo una gradación de calidad consistente y objetiva.

Pasos de acción y implementación
Definición del módulo de cálculo de ángulos
Implementa un módulo de postprocesamiento que procese las salidas de detección del modelo mejorado de regresión de una sola etapa. Para cada objeto detectado (tabaco cortado y soporte de acero), extrae las coordenadas de la caja delimitadora. Calcula las coordenadas del punto central de cada objeto detectado usando la Ecuación 18. Calcula las coordenadas del punto central de la imagen basándote en las dimensiones de la imagen usando la Ecuación 19.

figure-protocol-35
figure-protocol-36(18)

figure-protocol-37
figure-protocol-38(19)

donde x₁, x₂, y₁, y₂ denotan las coordenadas de las cuatro esquinas de la caja delimitadora detectada para un hilo de tabaco o el soporte de acero; c, x y c y representan las coordenadas de sus respectivos puntos centrales dentro de la región de detección; W y h indican el ancho y la altura de la imagen del cigarrillo; dx y y definen las coordenadas del punto central de la imagen.

Cálculo del ángulo absoluto
Para cada hilo de tabaco detectado y el soporte de acero, calcula el vector desde el centro de la imagen hasta el centro del objeto. Calcular el ángulo absoluto relativo a la línea de referencia horizontal usando la función arcotangente, tal como se formula en la Ecuación 20. El ángulo se calcula usando atan2(d_y, d_x), donde atan2 es la función tangente inversa de cuatro cuadrantes disponible en la biblioteca matemática de Python. Esta función devuelve valores en el rango (−π, π] radianes, que luego se convierten en grados, dando lugar a ángulos de salida en el rango (−180°, 180°]. El manejo en cuadrantes es automático con atan2 según los signos de d_y y d_x. Esto da como resultado unacero para el soporte de acero y uncorte para cada hilo de tabaco.

figure-protocol-39 (20)

Cálculo del ángulo relativo
Para cada hilo de tabaco detectado, calcular el ángulo relativo restando el ángulo absoluto del soporte de acero del ángulo absoluto del hilo, como se muestra en la Ecuación 21. El valor absoluto garantiza mediciones positivas de desviación angular.

figure-protocol-40 (21)

Generación de métricas de ordenidad
Agrega los ángulos relativos de todas las hebras detectadas dentro de una sola imagen. Calcular el ángulo relativo medio sumando todos los ángulos relativos To y dividiendo por el número total de hibras detectadas n, tal y como se formula en la Ecuación 22. Este valor medio sirve como medida cuantitativa del orden de alineación para esa imagen.

figure-protocol-41 (22)

Implementación de calificación de calidad
Implementa una función de clasificación que asigne el valor calculado a calificaciones cualitativas basadas en umbrales predefinidos, tal y como se define en la Ecuación 23. Los umbrales de clasificación (0°–30° = Excelente, 30°–60° = Bueno, >60° = Pobre) se establecieron tras consultar con tres expertos en control de calidad de Longyan Tobacco Industry Co., Ltd. Estos expertos evaluaron de forma independiente 200 imágenes de muestra y correlacionaron los ángulos relativos medios calculados con la calidad de alineación percibida, utilizando una escala de tres categorías (Excelente, Bueno y Pobre). Se seleccionaron los límites de 30° y 60° como cortes de consenso donde el acuerdo entre expertos superaba el 90%. Esta calificación permite una interpretación intuitiva de los resultados cuantitativos para el personal de control de calidad.

figure-protocol-42 (23)

Edición de archivos de configuración
El archivo de configuración del modelo (config.yaml o model.yaml) debe abrirse. La sección de postprocesado o la parte de ajustes de inferencia de la configuración debe estar ubicada. El módulo de cálculo de ángulos personalizado debe estar correctamente referenciado y habilitado. Los ajustes de análisis sintáctico de salida deben verificarse para extraer correctamente las coordenadas de la caja delimitadora tanto para el tabaco cortado como para el soporte de acero. No se requiere inserción adicional de capas para este método de evaluación, ya que funciona como un módulo de postprocesamiento tras las salidas de la cabeza de detección.

Motivación de diseño
El diseño de este método de evaluación personalizado está motivado por la necesidad de transformar la inspección visual subjetiva en mediciones cuantitativas objetivas y reproducibles. La inspección manual tradicional sufre de variabilidad entre observadores y no puede proporcionar datos numéricos continuos para la optimización del proceso. Al aprovechar el soporte de acero como referencia geométrica natural dentro de la varilla de cigarrillos, el método elimina la necesidad de marcadores de calibración externos y garantiza la consistencia de la medición entre diferentes imágenes y lotes de producción. El uso de vectores de punto central y cálculos de arctangente proporciona un enfoque matemáticamente robusto y computacionalmente eficiente para la estimación de ángulos, lo que lo hace adecuado para su despliegue en tiempo real. Este cálculo vectorial desde el centro de la imagen hasta el centro del objeto está diseñado para ser invariante al campo de visión de la cámara y a la posición de la varilla dentro de la imagen, asegurando así robustez bajo condiciones de captura variables. La estrategia de promediado entre múltiples hebras detectadas tiene en cuenta las variaciones naturales en la orientación de las hebras y proporciona una métrica de orden global estadísticamente fiable. Un sistema de clasificación de tres niveles traduce mediciones numéricas continuas en categorías de calidad accionables, facilitando la toma de decisiones rápidas en el control de calidad de la línea de producción. En conjunto, este enfoque integrado combina las capacidades de detección del modelo mejorado de regresión de una sola etapa con cálculos geométricos precisos, permitiendo una evaluación integral y automatizada del orden de alineación del tabaco cortado.

Entrenamiento con modelos para la detección de orden en el tabaco cortado
PyTorch 2.1.0, Compute Unified Device Architecture (CUDA) 12.1, y todas las dependencias deben estar correctamente instaladas. La implementación sigue los pipelines estándar de PyTorch YOLO y puede reproducirse en función de las descripciones detalladas de los módulos y los pasos de configuración proporcionados.

Mando de entrenamiento
Antes de reentrenar, deben prepararse los conjuntos de datos de imágenes particionadas y los archivos de anotación en el formato estándar de detección de una sola etapa (por ejemplo, formato YOLO con un archivo de .txt por imagen). Se debe crear un archivo .yaml de configuración de conjunto de datos que especifica las rutas de imagen, el número de clases (soporte de tabaco cortado y acero) y los nombres de clases. Basándose en las mejoras del modelo descritas anteriormente, el archivo de configuración .yaml original del detector debería ser reemplazado por el archivo .yaml propuesto, que incorpora los módulos MFID, TCF y DynamicHead. El script de train.py debe escribirse o modificarse para importar el paquete detector de una sola etapa, cargar el modelo de entrenamiento y la configuración del conjunto de datos, y establecer los siguientes parámetros de entrenamiento: imgsz=640, epochs=100, batch=4, workers=0, device='0', optimizer='SGD', close_mosaic=10, etc. La semilla aleatoria se fijó a 42, y los pesos del modelo se inicializaron usando la estrategia de inicialización predeterminada proporcionada por el marco de aprendizaje profundo. La reproducibilidad se aseguraba estableciendo torch.backends.cudnn.deterministic = Verdadero y torch.backends.cudnn.benchmark = Falso.

Hiperparámetros
Los hiperparámetros clave configurados para el entrenamiento son los siguientes: resolución de imagen de entrada de 896 × 1600 píxeles; tamaño de lote de 4, limitado por la memoria GPU; tasa de aprendizaje inicial de 0,01 con un planificador de recocido coseno para decaimiento gradual; optimizador de descenso de gradiente estocástico (SGD) con momento de 0,912 para acelerar la convergencia; y decaimiento de peso de 0,0004 para regularización. Las imágenes se normalizaron usando la media [0,485, 0,456, 0,406] y la desviación estándar [0,229, 0,224, 0,225]. La mejora incluyó un giro horizontal aleatorio (50%), ajuste aleatorio de brillo (±20%) y rotación aleatoria (±15°). La mejora en mosaico está habilitada por defecto durante las primeras épocas de entrenamiento para mejorar la robustez del modelo a diferentes escalas y oclusiones de objetos. Se desactiva en las últimas 10 épocas (close_mosaic = 10) para refinar la precisión de la detección.

Seguimiento de la formación
Durante la formación, el marco genera métricas completas en cada época. La función de pérdida es una suma ponderada de tres componentes: pérdida por clasificación (entropía cruzada binaria [BCE] con logits), pérdida por localización (intersección completa sobre la pérdida de unión [IoU]) y pérdida de objetidad (BCE). Los pesos totales de pérdida se establecieron como λ_cls = 0,5, λ_box = 0,05 y λ_obj = 1,0. Las curvas de pérdida de entrenamiento y validación deben monitorizarse para asegurar una convergencia estable y detectar cualquier signo de sobreajuste. El mAP con un umbral de IoU de 0,5 (mAP@0,5) en el conjunto de validación se utiliza como principal indicador de rendimiento para la detección de hebras de tabaco cortado. Dado el tamaño del conjunto de datos y la complejidad del modelo, el entrenamiento para 100 épocas suele ser suficiente para la convergencia. El punto de control del modelo con mejor rendimiento se guarda automáticamente en función del mAP de validación.

Evaluación y despliegue del modelo
Evaluación
Tras completar el entrenamiento, los pesos óptimos del modelo se guardan como runs/train/exp/weights/best.pt. El modelo entrenado debe evaluarse en el conjunto de validación dedicado usando el siguiente comando: python val.py --data cigarette_dataset.yaml --weights runs/train/exp/weights/best.pt. El script de evaluación genera métricas clave de rendimiento, incluyendo precisión, recuperación y mAP@0,5, para ambas clases de detección (tabaco cortado y soporte de acero). El mAP debe verificarse para cumplir el umbral requerido para el despliegue industrial (por ejemplo, >95% para la detección de cadenas). El umbral de despliegue (mAP >95% para la detección de cadenas) representa un requisito interno de rendimiento para el entorno industrial objetivo. El resultado reportado refleja el rendimiento en un conjunto de pruebas diverso que incluye casos límite desafiantes. La mAP del modelo para condiciones de producción rutinarias supera el 96% cuando se evalúa sobre un subconjunto filtrado para obtener una iluminación ideal y oclusión mínima. El subconjunto de producción rutinaria se definió por los siguientes criterios: iluminación dentro del rango de 500–800 lux (iluminación óptima), porcentaje de oclusión inferior al 10% (solapamiento mínimo) y ausencia de reflejos especulares visibles. Este subconjunto contiene 427 imágenes, que representan aproximadamente el 67% del conjunto de pruebas. Este subconjunto corresponde a las condiciones estándar de producción diurna bajo iluminación normal y disposición bien orientada de los hilos.

Verificación de inferencia
Para validar visualmente el rendimiento de detección del modelo en imágenes no vistas, se realiza inferencia sobre imágenes de prueba de muestra usando el siguiente comando: python detect.py --weights runs/train/exp/weights/best.pt --source path/to/test/images --conf 0.5. Este comando genera imágenes anotadas con cajas delimitadoras alrededor de soportes detectados de tabaco cortado y acero. La velocidad de inferencia se midió en una GPU NVIDIA GeForce RTX 3080 Ti (12 GB de VRAM) usando CUDA 12.1 y PyTorch 2.1.0. Los frames por segundo (FPS) reportados se calcularon como la media de más de 100 pases hacia adelante consecutivos tras 50 iteraciones de calentamiento. Además, se informa de la velocidad de inferencia (en fotogramas por segundo) para confirmar su idoneidad en tiempo real para el entorno de despliegue.

Despliegue de modelos
Para permitir el despliegue en tiempo real en el sistema de control industrial, el modelo entrenado de PyTorch (best.pt, aproximadamente 7–9 MB) debe exportarse a un formato de inferencia optimizado, como TensorRT o Open Neural Network Exchange (ONNX). Esta conversión mejora la velocidad de inferencia manteniendo la precisión de la detección. Para exportar ONNX, usa: torch.onnx.export(model, dummy_input, "model.onnx", opset_version=11, input_names=["imágenes"], output_names=["salidas"]). Para la conversión a TensorRT, usa: trtexec --onnx=model.onnx --saveEngine=model.trt --fp16 --workspace=4096. El modo de precisión FP16 se utilizaba para optimizar la velocidad de inferencia. El modelo desplegado final genera coordenadas de caja delimitadora, etiquetas de clase (hilo de tabaco cortado o soporte de acero) y puntuaciones de confianza para cada objeto detectado, que sirven como entradas al método personalizado de evaluación de ángulos utilizado para cuantificar el orden del tabaco cortado.

Acceso restringido. Inicie sesión o comience una prueba gratuita para ver este contenido.

Resultados

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Entorno experimental
Todos los experimentos se realizaron utilizando el marco de aprendizaje profundo PyTorch, con configuraciones detalladas de hardware y software resumidas en la Tabla 1. Un total de 634 imágenes se dividieron aleatoriamente en conjuntos de entrenamiento, validación y prueba en una proporción de 7:2:1. Durante el entrenamiento, las imágenes de entrada se redimensionaron uniformemente a 896 × 1600 píxeles, y la tasa inicial de aprend...

Acceso restringido. Inicie sesión o comience una prueba gratuita para ver este contenido.

Discusión

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Una ventaja clave del modelo propuesto en la detección del orden del tabaco cortado es su equilibrio entre precisión en la detección y eficiencia computacional. Esta tarea requiere el procesamiento en tiempo real de numerosos tabacos de grano fino en imágenes de alta resolución, imponiendo exigencias estrictas de precisión y velocidad del modelo. Como se muestra en la Tabla 2, el modelo propuesto alcanza el mayor mAP@0,5 (89,9%) para detectar soportes de tabaco y acero c...

Acceso restringido. Inicie sesión o comience una prueba gratuita para ver este contenido.

Divulgaciones

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Los autores no declaran que no hay intereses financieros directos en competencia. Esta investigación se llevó a cabo en Longyan Tobacco Industrial Co., Ltd., que proporcionó el escenario de aplicación y los datos de campo para el estudio. Los autores académicos no declaran conflictos de interés financieros ni no financieros respecto a la publicación de esta obra.

Agradecimientos

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Esta investigación fue financiada por el proyecto sobre tecnología de medición de producción para productos de cigarrillos que no queman por calor y control de la temperatura y humedad ambiental (Grant No. FJZYKJJH2022YB014).

Acceso restringido. Inicie sesión o comience una prueba gratuita para ver este contenido.

Materiales

Lista de materiales utilizados en este artículo
NombreEmpresaNúmero de catálogoComentarios
Lector de códigosHikvisionID5050Se usaba para leer códigos de barras en palés; requiere una fuente de alimentación de 24 V
Conjunto de datos (imágenes de tabaco cortado)Longyan Tobacco Industrial Co., Ltd.N/AConjunto de datos de imágenes personalizadas del tabaco cortado utilizado para entrenamiento, validación y pruebas de modelos
Marco de aprendizaje profundo (PyTorch 2.1.0)Fundación PyTorchSoftware de código abiertoUtilizado para el desarrollo y entrenamiento de modelos de aprendizaje profundo
Cámara industrialHikvisionMV-CH120-10GCUtilizado para la adquisición de imágenes; requiere una fuente de alimentación de 24 V
Ordenador industrialTecnología YanzhiPC1010-AX360Utilizado para procesamiento de imágenes, inferencia de modelos y almacenamiento de datos
Fuente de luz LEDHikrobotMV-LRDS-H-95-30-WFuente de luz en tira que proporciona una iluminación estable para la imagen
LenteHikvisionMVL-KF0818M-12MPDistancia focal: 8 mm; rango de apertura: F1.8 y guiño; F16; Resolución de 12 MP
Soportes metálicosLongyan Tobacco Industrial Co., Ltd.Aleación de aluminio 7075-T6Utilizado para montar y estabilizar componentes de hardware
Cables de redLongyan Tobacco Industrial Co., Ltd.Cabeza de cristal RJ45Utilizado para conectar ordenadores industriales, cámaras y dispositivos de red
Python (versión 3.9)Fundación de Software PythonSoftware de código abiertoEntorno de programación para la implementación
CambioTP-LinkTL-SH10058 puertos Ethernet; requiere una fuente de alimentación de 220 V
Punto de acceso inalámbrico (módulo de comunicación industrial)Shandong Huachuang XunlianBH-ANT5158S-14HV; BH-MS-AC1600HWHPermite la comunicación inalámbrica entre cámara y ordenador industrial
Software de control de cámara (MVS)HikvisionV4.5.1Utilizado para depuración de cámaras, configuración de parámetros y adquisición de datos
Software de procesamiento de visión (Vision Master)HikvisionV4.3.0Utilizado para la comparación de plantillas y detección de resultados de imágenes
Entorno de desarrollo integrado (PyCharm)JetBrains2020.1.3 x64Utilizado para el desarrollo de modelos e implementación del sistema
Kit de herramientas CUDA (versión 12.1)NVIDIAKit de herramientas de software (sin número de catálogo)Permite la aceleración de GPU para entrenamiento e inferencia

Reimpresiones y permisos

Solicitar permiso para reutilizar el texto o las figuras de este artículo de JoVE

Solicitar permiso

Etiquetas

Evaluaci n de la ordenaci ndetecci n en tiempo realsubmuestreo de caracter sticasfusi n de caracter sticas multiescalacabezal de detecci n din micopredicci n de la orientaci nconjunto de datos de im genes industrialesoptimizaci n de la calidad de la producci n

Artículos relacionados