$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
Este estudio no involucró sujetos humanos, animales vertebrados ni tejidos regulados; por lo tanto, no se requería aprobación ética ni la aprobación de un comité de revisión institucional. El conjunto de datos utilizado en este estudio fue obtenido de Longyan Tobacco Industry Co., Ltd. Se recogieron imágenes de cinco lotes de producción independientes durante un periodo de tres meses. El muestreo se realizó de forma aleatoria en diferentes momentos del día (mañana, tarde y noche) para captar variaciones naturales en las condiciones de producción. El conjunto de datos incluye muestras que cubren un rango de humedad del tabaco del 12%–18%, velocidades de corte de 1,5, 2,0 y 2,5 m/s, y presiones de transporte neumáticas de 0,4, 0,5 y 0,6 MPa, asegurando así la cobertura de las condiciones típicas de producción.
Adquisición y Configuración de Conjuntos de Datos
Configuración de hardware
El sistema de adquisición de imagen se configuró para cumplir con los requisitos de detección del orden del tabaco cortado en cigarrillos que no queman por calor. Consistía principalmente en una cámara industrial, una lente industrial, una fuente de luz visual y una unidad de control industrial. El sistema empleaba una cámara industrial MV-CH120-10GC combinada con un objetivo industrial MVL-KF0818M-12MP para capturar imágenes en alta definición de la región del tabaco cortado en la superficie de varillas de cigarrillos seccionados. La cámara estaba situada a una distancia de trabajo de 150 mm desde la superficie de la varilla de cigarrillos. La fuente de luz LED en tira se montaba coaxialmente con la cámara a una distancia de 80 mm del objetivo, con un ángulo de incidencia de 45°. La imagen se realizó dentro de un recinto negro mate para eliminar la interferencia de la luz ambiental. La carcasa es una capucha de aluminio pintada de negro mate con dimensiones internas de 400 mm (ancho) × 350 mm (profundidad) × 300 mm (alto), y superficies interiores recubiertas con pintura negra mate (reflectancia < 5% a 550 nm) para minimizar los reflejos internos y garantizar condiciones de iluminación consistentes. Para garantizar la calidad y consistencia de la imagen, se utilizó una fuente de luz MV-LRDS-H-95-30-W para establecer un entorno de iluminación estable, minimizando el impacto de las variaciones de la luz ambiental en la extracción de contornos de hebras de tabaco y el reconocimiento de orientación. Las imágenes adquiridas eran recibidas, procesadas y almacenadas por un ordenador industrial PC1010-AX360, que también realizaba algoritmos de reconocimiento posteriores, cálculos de resultados y salida de interfaz. No se realizó calibración ni corrección explícita de distorsión de la cámara, ya que la combinación de cámara industrial y objetivo mostraba una distorsión radial insignificante (menos del 0,5% en los bordes de la imagen) dentro del campo de visión de 896 × 1600 píxeles. La cámara y la fuente de luz estaban montadas rígidamente sobre un marco fijo para garantizar la estabilidad posicional durante la adquisición de la imagen. La intensidad de la fuente de luz se mantuvo a un nivel constante durante la adquisición de la imagen. El campo de visión se configuró para cubrir completamente la región del tabaco cortado expuesto dentro de la estructura de soporte de acero.
Ajuste de parámetros de cámara
Se activaba la adquisición de imágenes, y se capturaban imágenes después de que el cigarrillo de muestra se colocara y seccionara y luego se guardara en formato JPG. Para garantizar la consistencia de las imágenes adquiridas, los parámetros de adquisición se establecieron manualmente. Concretamente, la resolución de imagen se estableció en 896 × 1600. El tiempo de exposición se estableció inicialmente en 4000 μs y podía ajustarse finamente dentro de un rango de 3000 a 6000 μs según el brillo in situ. Todo el ajuste de parámetros se realizó con la muestra colocada dentro del gabinete negro mate descrito anteriormente, bajo condiciones de iluminación totalmente controladas. No había luz ambiental externa durante la sintonización, ya que el sistema de imagen funcionaba en un entorno totalmente cerrado con las luces de la sala apagadas. La ganancia se estableció inicialmente en 2 dB y se controló dentro de un rango de 0 a 6 dB según los niveles de ruido. El valor gamma se estableció en 0,8 y el balance de blancos se configuró con parámetros fijos. Los parámetros finales de adquisición se establecieron de la siguiente manera: tiempo de exposición = 4000 μs, ganancia = 2 dB, gamma = 0,8, modo de balance de blancos = fijo, resolución de imagen = 896 × 1600 píxeles y formato de imagen = JPG. Para el balance de blancos, se utilizó el modo de parámetros fijos. La calibración se realizó utilizando una tarjeta de referencia blanca estándar (X-Rite ColorChecker) colocada en la posición de la muestra. Las ganancias de canales rojo y azul se ajustaron hasta que los valores RGB de la tarjeta blanca se igualaron con una desviación del ±2%. Tras la calibración, los parámetros del balance de blancos se fijaron de la siguiente manera: ganancia roja = 1,2, ganancia verde = 1,0 (fija) y ganancia azul = 1,5. La calibración se realizaba una vez después de cada arranque del sistema o siempre que la fuente de luz mostraba signos de envejecimiento que pudieran causar una deriva de temperatura de color. Estos ajustes ayudaron a garantizar límites claros del tabaco cortado y una distribución estable del brillo, al tiempo que cumplían con los requisitos de procesamiento para la segmentación posterior de hebras de tabaco, el cálculo de orientación y el análisis de orden.
Colección de imágenes
La adquisición de imágenes se centró en la zona de tabaco cortado expuesta en la superficie de varillas de cigarrillo que no se queman tras la sección. Durante la detección, la muestra de cigarrillo se entregaba primero a la estación de inspección, donde su postura y posición se ajustaban y fijaban mediante el mecanismo de posicionamiento de la muestra. El mecanismo de posicionamiento consiste en una abrazadera neumática con guías de alineación en forma de V. El sistema alcanza una repetibilidad posicional de ±0,5 mm durante 1000 ciclos consecutivos, como lo confirman las mediciones del sensor de desplazamiento láser. Posteriormente, el material de envolvimiento exterior se seccionaba de forma estable mediante el mecanismo de corte, exponiendo completamente el tabaco cortado en superficie dentro del campo de visión del sistema de visión. Se utilizaba una hoja circular giratoria (diámetro 50 mm, grosor 0,3 mm, material acero de alta velocidad). La profundidad de corte se estableció en 1,5 mm con una velocidad de rotación de 300 rpm. La consistencia del corte se monitorizaba mediante retroalimentación del codificador lineal, manteniendo una variación de grosor dentro de ±0,05 mm. Una vez estable la posición de la muestra y la región de imagen claramente definida, la adquisición de imagen se realizaba utilizando la cámara industrial bajo una iluminación estable proporcionada por la fuente de luz. Se recopilaron un total de 634 imágenes; las imágenes típicas se muestran en la Figura 1. El conjunto de datos incluye tres niveles de densidad de tabaco (bajo, medio, alto; aproximadamente 180, 220 y 260 mg/cm 3), orientaciones de hebras que abarcan entre −180° y 180°, y condiciones de iluminación que van desde la iluminación normal hasta condiciones de borde con poca luz. La iluminancia se midió utilizando un luxímetro digital calibrado (TA8133, con precisión ±3%) y el sensor situado en la superficie de la muestra. El rango normal de iluminación medido es de 200–800 lux, proporcionado por la fuente de luz LED en tira dentro de la campana cerrada, sin fuga de luz ambiental. El valor en el extremo bajo (aproximadamente 200 lux) representa una condición de caso límite creada al atenuar la fuente de luz para evaluar la robustez del modelo. Además, la oclusión parcial de las hebras de tabaco (que varía entre el 10% y el 50%) está presente en aproximadamente el 30% de las imágenes. Estas variaciones reflejan una verdadera diversidad en las líneas de producción.

Figura 1. Imágenes representativas en bruto del tabaco cortado adquiridas por el sistema de visión. (a–h) Ejemplos representativos de imágenes en bruto de tabaco cortado capturadas en condiciones de campo industrial utilizando el sistema de adquisición de imágenes. Las imágenes se obtuvieron con una resolución de 896 × 1600 píxeles bajo iluminación controlada utilizando una fuente de luz en tira para asegurar un brillo uniforme y minimizar interferencias ambientales. Estas imágenes ilustran variaciones en la distribución, densidad y orientación de las cadenas de tabaco antes del procesamiento del modelo. Por favor, haz clic aquí para ver una versión ampliada de esta figura.
Anotación de imagen
Utilizando la herramienta de código abierto LabelImg, se dibujaban cuadros delimitados alrededor de elementos visibles de soporte de tabaco y acero. Se asignó el ángulo correcto como etiqueta para cada caja delimitadora. El eje horizontal (0°) se definía como la dirección hacia la derecha paralela al borde inferior de la imagen. Para cada hilo de tabaco, la función de medición de ángulo de la herramienta de anotación se utilizaba para dibujar una línea a lo largo del eje mayor de la hebra. El ángulo se registraba como el ángulo entre este eje y la referencia horizontal (rango: −180° a 180°). Las anotaciones se guardaban en el formato estándar de detección de una sola etapa, con un archivo TXT correspondiente a cada imagen. Cada archivo .txt contiene líneas formateadas como: class_id x_center y_center altura de ancho. Las coordenadas se normalizan a [0,1] en relación con las dimensiones de la imagen. Clase 0 = hilo de tabaco, clase 1 = soporte de acero. La etiqueta del ángulo se almacena como una sexta columna en el archivo de .txt de anotaciones, añadida después de los cinco campos estándar de YOLO. El formato exacto por línea es: class_id x_center y_center ángulo de altura de ancho. El valor del ángulo se almacena en grados como un número de coma flotante que va de −180,0 a 180,0, con dos decimales (por ejemplo, 45,75). Línea de ejemplo: 0 0,5230 0,4170 0,0850 0,0620 38,25.
Control de calidad
Un segundo anotador revisó un 20% seleccionado aleatoriamente de las imágenes anotadas. La selección aleatoria se realizó usando la función random.sample() de la biblioteca aleatoria de Python con una semilla aleatoria fija de 2024. Se generó una lista de todos los nombres de archivos de imagen, y el 20% de las imágenes se muestrearon sin reemplazo usando este generador de números aleatorios sembrados, asegurando una selección reproducible a través de procedimientos repetidos de control de calidad. Cualquier discrepancia se discutía y resolvía, asegurando la coherencia del etiquetado. La concordancia entre anotadores se evaluó mediante desviación angular: la diferencia absoluta media entre las etiquetas angulares de los dos anotadores fue de 2,8° (desviación estándar = 1,5°). Se revisaron y conciliaron las anotaciones con desviación >5°.
Modelo de regresión de una sola etapa para la detección del orden del tabaco cortado
La detección del orden de alineación del tabaco cortado es crucial para mejorar tanto el proceso de fabricación como la calidad final del producto en la producción de cigarrillos. Sin embargo, esta tarea de inspección se enfrenta a varios desafíos, como el solapamiento de tabaco cortado, pequeños tamaños de objetivos y una iluminación desigual, todos los cuales comprometen la precisión y robustez de la detección. Se utiliza un modelo mejorado de regresión de una sola etapa basado en YOLOv11n para la detección en línea del orden del tabaco cortado. El marco propuesto identifica con precisión las características morfológicas del tabaco cortado durante la formación de la varilla de cigarrillo, permitiendo una detección fiable de la regularidad del alineamiento mientras mejora la precisión, la robustez y la capacidad de procesamiento en tiempo real. La configuración general del marco propuesto de regresión de una sola etapa se muestra en la Figura 2.

Figura 2. Arquitectura general del modelo de regresión de una sola etapa propuesto. El diagrama ilustra la estructura completa de la red, incluyendo la columna vertebral, el cuello y la cabeza de detección. La columna vertebral extrae características multiescala, incorporando módulos interactivos de muestreo de descenso multifrecuencia (MFID) para preservar la información de características. El mástil integra características utilizando la estrategia de fusión triple complementaria (TCF) para mejorar la representación multinivel. El cabezal de detección adopta el módulo DynamicHead, que integra mecanismos de atención conscientes de escala (πL), conscientes espacialmente (πS) y conscientes de tareas (πC) para mejorar el rendimiento en localización y clasificación. Por favor, haz clic aquí para ver una versión ampliada de esta figura.
Módulo de Reducción de Muestreo de Información Multifrecuencia (MFID)
En la red troncal de YOLOv11, la operación convolucional con un paso de 2 realiza el muestreo descendente saltándose píxeles. Este proceso descarta directamente la mitad de la información espacial, lo que resulta en la pérdida de detalles de alta frecuencia (por ejemplo, bordes y texturas de objetos pequeños) y una pérdida significativa de información para objetivos pequeños. Además, las operaciones de max-pooling y promedio-pooling en la columna vertebral también descartan información detallada dentro de las regiones de los objetos, características suaves e introducen ruido, todo lo cual afecta negativamente al aprendizaje de características.
Para abordar estos problemas, se introduce un módulo MFID, inspirado en el concepto de descomposición jerárquica dewavelet 15,16. Este módulo primero descompone las características en dos partes complementarias utilizando la transformada wavelet de Haar: información de fondo de baja frecuencia, que mejora la clasificación, y detalles de alta frecuencia ricos en bordes y texturas, que mejoran la detección de objetivos pequeños. Para reforzar aún más la percepción de objetivos pequeños, el módulo MFID incorpora dos ramas adicionales: una rama de max-pooling que aprovecha la invariancia de la traducción para preservar características finas de objetivos pequeños, y una rama de convolución en escalado que utiliza parámetros aprendibles para lograr una mayor capacidad representacional y una composición de información más rica. A través de esta estructura multirama, el módulo MFID conserva información espacial y de frecuencia más completa durante el muestreo descendente. La arquitectura del módulo MFID se ilustra en la Figura 3.

Figura 3. Estructura del módulo MFID. El módulo MFID separa las características de entrada en componentes de baja y alta frecuencia utilizando una transformada de wavelet de Haar para preservar la información estructural crítica durante el muestreo descendente. HLL denota el componente de aproximación de baja frecuencia, mientras que HLH, HHL y HHH representan componentes de detalle de alta frecuencia en las direcciones horizontal, vertical y diagonal, respectivamente. El símbolo 2↓ indica un muestreo descendente doble. Los mapas de características de múltiples ramas se fusionan mediante mecanismos de concatenación y acceso para mejorar la representación de características. Por favor, haz clic aquí para ver una versión ampliada de esta figura.
Durante el muestreo descendente, la imagen se descompone utilizando la transformada wavelet de Haar, adoptada por su simplicidad y eficiencia en la descomposición de características de baja y alta frecuencia, lo que la hace adecuada para tareas de detección en tiempo real. HL y H H denotan los filtros de descomposición pasa y paso alto, respectivamente, y se emplean para extraer información de baja y alta frecuencia de la imagen. La función base de wavelet y la función de escalado para una transformada de Haar unidimensional y de un nivel se definen usando la Ecuación 1 de la siguiente manera:
(1)
La función base de Haar se define usando la Ecuación 2 de la siguiente manera:
(2)
Aquí, los parámetros j y k denotan respectivamente el coeficiente de escala y la cantidad de traslación de la función base de Haar. Específicamente, la función base de Haar de orden cero se define usando la Ecuación 3 de la siguiente manera:
(3)
En la Figura 3, el símbolo 2↓ denota muestreo descendente doble. Una descomposición en wavelet de Haar en dos niveles produce cuatro componentes: la aproximación de baja frecuencia (HLL) y los componentes de detalle de alta frecuencia en las direcciones horizontal (HLH), vertical (HHL) y diagonal (HHH). El componente HLL transporta información de contorno, fondo y global, mientras que los componentes de alta frecuencia (HLH, HHL y HHH) capturan características de borde, textura y grano fino.
Los componentes de alta frecuencia HLH, HHL y HHH obtenidos tras el muestreo descenso doble son concatenados por la operación Concat, integrando así la información detallada multidireccional para generar la información
detallada integrada de alta frecuencia, como se muestra en la Ecuación 4.
(4)
Posteriormente, se realiza una fusión de información secundaria en la rama de max-pooling para integrar características detalladas con características globales, generando así información
reconstruida, como se muestra en la Ecuación 5, que incorpora un conjunto más amplio de características salientes y reutiliza información detallada de alta frecuencia para mejorar la representación de características.
(5)
A partir de entonces, se emplea un mecanismo de acceso para regular dinámicamente el flujo de información, y se
aprovecha para guiar la identificación de pequeñas características objetivo dentro del
, preservando características útiles mientras suprime interferencias ruidosas inherentes e inútiles. El mecanismo de acceso se define como: gating(x) = Linear_2(ReLU(Linear_1(x))), donde Linear_1 reduce la dimensión del canal en un factor de reducción de 4, y Linear_2 la restaura a la dimensión original del canal. La salida del mecanismo de compuerta pasa por una activación sigmoide para producir pesos de modulación en el rango [0,1]. Los parámetros aprendibles incluyen las matrices de pesos y los términos de sesgo de ambas capas lineales, que se inicializan mediante inicialización uniforme. Esto garantiza que la información detallada y crítica de las características esté correctamente equilibrada y utilizada, dando lugar a la característica
detallada final tal como se presenta en la Ecuación 6.
(6)
Finalmente, la información de reducción de muestreo de la convolución de la zancada, el vector de baja frecuencia y la característica detallada final se concatenan mediante Concat para ampliar la interacción de muestreo de la característica a través de múltiples dimensiones y bandas de frecuencia, como se muestra en la Ecuación 7.
(7)
Pasos de acción y implementación
Definición del módulo
Un módulo personalizado de PyTorch llamado MFID debe definirse dentro de los archivos de definición del modelo del proyecto. La implementación de este módulo consta de cuatro caminos paralelos: (1) Transformada wavelet: se aplica una descomposición de dos niveles al mapa de características de entrada usando filtros de wavelet de Haar predefinidos, generando un componente de aproximación de baja frecuencia y componentes de detalle de alta frecuencia en las direcciones horizontal, vertical y diagonal, tras lo cual se concatenan los tres componentes de alta frecuencia; (2) Max-pooling: se aplica max-pooling a la entrada para preservar características destacadas; (3) Convolución stridée: el muestreo estándar se realiza a través de una capa convolucional con una zancada de 2; (4) Reconstrucción y fusión de características: primero, la información de alta frecuencia obtenida de la transformada wavelet se fusiona con las características de la rama de max-pooling; Posteriormente, se emplea un mecanismo de compuerta guiado por la información de baja frecuencia para filtrar características de grano fino; Finalmente, se concatenan las características procesadas de grano fino, los componentes de baja frecuencia y la salida de convolución en estratificación para obtener el mapa final de características con muestreo reducido.
Edición de archivos de configuración
El archivo de configuración del modelo base (config.yaml) debe abrirse. Todas las instancias de módulos estándar de reducción de muestreo tanto en la red troncal como en la de cuello deben identificarse sistemáticamente. Cada entrada identificada del módulo de reducción debe ser reemplazada por el módulo MFID.
Motivación de diseño
El módulo MFID está diseñado para mitigar la pérdida de información en operaciones estándar de muestreo reducido, lo cual es especialmente perjudicial para la detección de objetos pequeños. Su concepto central está inspirado en la descomposición jerárquica de wavelets. Al separar explícitamente la información global de baja frecuencia de la información de detalle de alta frecuencia en la imagen y procesarla en consecuencia, el módulo garantiza que las características críticas de textura y bordes se preserven durante el muestreo descendente. La incorporación de ramas max-pooling y strided-convolution captura y complementa aún más características desde perspectivas complementarias—específicamente, invariancia de traducción frente a representación aprendible. Mediante fusión multirama, el módulo proporciona a las capas de red subsecuentes una representación de características multifrecuencia más informativa y robusta. Todos los parámetros arquitectónicos no especificados y las configuraciones de capa siguen la configuración predeterminada de implementación del framework YOLOv11n dentro de PyTorch.
Módulo de Fusión de Triple Cruzamiento (TCF)
En la etapa de fusión de características del cuello de la arquitectura de red YOLOv11, normalmente se utiliza una operación simple de concatenación para fusionar mapas de características de la misma escala. Sin embargo, este enfoque directo tiene limitaciones claras: primero, no tiene en cuenta completamente las diferencias semánticas entre características en distintos niveles; Segundo, la falta de modelado explícito de las correlaciones entre canales hace que las características de pequeños objetivos sean propensas a diluirse o perderse durante la fusión, comprometiendo así el rendimiento de la detección. Para abordar estos problemas, se introduce un método de fusión más interactivo, denominado módulo TCF, 17. Este método emplea una estrategia de fusión progresiva multinivel que guía el flujo de información hacia la detección de objetivos pequeños mediante transmisión entre capas. También incorpora operaciones no lineales adicionales para explorar información a nivel profundo a través de escalas, mejorando así la fusión de características multiescala. A diferencia de los módulos convencionales que dependen de la simple adición o fusión media, TCF adopta un enfoque de fusión ponderada. Esto le permite aprender información detallada de forma adaptativa en cada nivel, optimizar dinámicamente las rutas de extracción de información y centrarse en las características más discriminativas, mejorando en última instancia la precisión de la detección. La arquitectura del módulo TCF se ilustra en la Figura 4.

Figura 4. Estructura del módulo TCF. El módulo TCF realiza fusión de características multinivel a través de capas superficiales, medias y profundas para mejorar la representación de objetivos pequeños. P representa los mapas de características de entrada en diferentes niveles. Conv denota operaciones de convolución, Upsampling indica aumento de muestreo de características, y AdaptiveAvgPool representa el agrupamiento medio adaptativo. El módulo integra características calibradas mediante fusión ponderada e interacción entre capas para mejorar la complementariedad semántica y espacial. Por favor, haz clic aquí para ver una versión ampliada de esta figura.
En la tarea de detección de objetos, la información contenida en la característica de capa profunda Pi+1 y la característica de capa superficial Pi-1 difiere significativamente. Para potenciar la fusión de información entre capas, se introduce la capa intermedia Pi como la capa final de fusión de características para equilibrar las diferencias entre la información de características a distintos niveles.
Primero, la información de entrada de las capas superficial, media y profunda se procesa utilizando la función de activación sigmoide para generar características
ponderadas ,
, y
, que sirven para fortalecer características clave y debilitar las redundantes, como se muestra en la Ecuación 8.
(8)
En segundo lugar, la información de entrada de las capas superficial, media y profunda se multiplica elemento por elemento por las características ponderadas mapeadas para generar características
calibradas ,
, y
, como se muestra en la Ecuación 9. La importancia de las características se ajusta dinámicamente mediante el mecanismo de atención en el peso, logrando así una selección adaptativa y recalibración de características.
(9)
En la etapa de fusión de características de capa intermedia, se aprovechan dos ramas de peso inverso para fusionarse con las características calibradas de capa superficial y profunda, respectivamente, filtrando la información detallada falsa inducida por el ruido en las características de capa superficial y la información semántica asociada sesgada en las características de capa profunda. Posteriormente, la información multirama se integra, y las características originales, calibradas y interactivas de esta capa, así como las características calibradas de capa superficial y profunda, se fusionan. Esto logra la preservación y complementación de la información de características multiescala, mitiga los problemas de pérdida de información en objetivos pequeños y errores de juicio, y finalmente produce características
fusionadas de capa intermedia, que se formulan usando la Ecuación 10 de la siguiente manera:
(10)
Las asociaciones entre la capa superficial, la capa profunda y la capa media se establecen por separado, como se muestra en las Ecuaciones 11 y 12.
(11)
(12)
Finalmente, las salidas de los tres caminos de fusión de características se concatenan mediante la operación Concat para preservar la independencia de características de cada camino individual. La información clave de cada camino se aprende dinámicamente en función de los pesos α, β y γ, que se definen como parámetros escalares aprendibles inicializados a 1.0 y optimizados mediante retropropagación durante el entrenamiento, permitiendo un equilibrio dinámico de contribuciones de caminos superficiales, medios y profundos de características. Además, se emplean operaciones convolucionales para agregar información contextual, eliminar respuestas incoherentes en los límites de características causadas por la concatenación entre capas y optimizar la adquisición y representación refinada de información detallada de pequeños objetivos. El proceso se formula usando la Ecuación 13 de la siguiente manera:
(13)
Pasos de acción y implementación
Definición del módulo
Un módulo personalizado de PyTorch llamado TCF debe definirse dentro de los archivos de definición del modelo del proyecto. Este módulo toma como entrada los mapas de características de capa superficial, intermedia y capa profunda extraídos de diferentes etapas de la red troncal. Su flujo interno de procesamiento consta de tres pasos principales: (1) Calibración de características: la función sigmoide se aplica a cada una de las tres capas de características de entrada para generar mapas de pesos, que luego se multiplican elemento por elemento con los mapas originales para mejorar características clave mientras suprimen las redundantes; (2) Fusión interactiva: en la etapa de fusión de características de capa media, se introducen dos ramas de peso inverso para fusionarse con las características calibradas de capa superficial y profunda, respectivamente, filtrando información detallada falsa inducida por el ruido en las características de capa superficial y la información semántica asociada sesgada en las características de capa profunda; (3) Agregación multicamino: las características originales, las características calibradas, las características interactivas y las características fusionadas con información superficial y profunda se integran, tras lo cual se aplican operaciones convolucionales para eliminar respuestas incoherentes en los límites de características causadas por la concatenación entre capas, generando finalmente características fusionadas ricas en información multiescala.
Edición de archivos de configuración
El archivo de configuración del modelo (config.yaml) debe abrirse. Las secciones de fusión de características en la red de cuello —específicamente, las capas donde se fusionan características de diferentes etapas de la red troncal—. En estas posiciones, las capas originales de operaciones de concatenación simples deben reemplazarse por una llamada al módulo TCF, asegurando que las entradas del módulo estén correctamente conectadas a las características superficiales, intermedias y profundas correspondientes.
Motivación de diseño
El diseño del módulo TCF está motivado por los desafíos de la disparidad y la pérdida de información durante la fusión de características. Las características superficiales son ricas en detalles pero contienen un ruido considerable, mientras que las características profundas presentan una semántica fuerte pero baja resolución. Para abordar esto, el módulo TCF introduce una característica de capa intermedia como equilibrador de información e incorpora caminos cuidadosamente diseñados para calibración, interacción y agregación para maximizar las ventajas complementarias de las características entre niveles. La motivación subyacente es establecer un mecanismo de fusión más eficaz capaz de evaluar dinámicamente la importancia de las características en cada nivel e integrar selectivamente la información. Como resultado, genera una representación de características de alta calidad para la cabeza de detección posterior, rica tanto en detalles como en información semántica, lo que la hace especialmente adecuada para el reconocimiento de objetos pequeños.
Módulo DynamicHead
El componente de cabeza de detección cumple la función fundamental de realizar el reconocimiento de objetos multiescala sobre representaciones de características generadas por la columna vertebral y las redes de fusión de características. Este proceso permite la localización espacial precisa de objetos detectados, la asignación categórica y la estimación de fiabilidad de las predicciones de cajas delimitadoras. Dadas las importantes variaciones a escala de las características objetivo en los datos visuales y la densa concentración de propuestas de cajas delimitadoras en ciertos marcos, la identificación precisa del tabaco cortado requiere el análisis de patrones multiescala. Para abordar esto, el método adopta la arquitecturaDynamicHead 18 como sustituto del cabezal de detección nativo en YOLOv11n, estableciendo un marco de autoatención que integra mecanismos conscientes de escala, espacial y conscientes de tareas para mejorar tanto la capacidad de detección como la eficiencia operativa. La configuración estructural del componente DynamicHead se ilustra en la Figura 5.

Figura 5. Estructura del módulo de detección Dynamichead. El módulo DynamicHead incorpora tres mecanismos secuenciales de atención: consciente de escala (πL), consciente espacialmente (πS) y consciente de la tarea (πC). Estos componentes ajustan dinámicamente la importancia de las características a través de escalas, regiones espaciales y tareas de detección. Este diseño mejora tanto la precisión de localización como el rendimiento de clasificación al permitir el refinamiento adaptativo de características dentro de la cabeza de detección. Por favor, haz clic aquí para ver una versión ampliada de esta figura.
Esta arquitectura comprende tres unidades de atención especializadas: componentes conscientes de escala (πL), conscientes del espacio (πS) y conscientes de la tarea (πC). El mecanismo de atención consciente de escala (πL) primero promedia el mapa de características de entrada a lo largo de dimensiones espaciales y de canal. El resultado se pasa por una capa de proyección lineal seguida de una activación sigmoide dura para generar pesos de escala, que luego se multiplican elemento por elemento con el mapa de características original. El mecanismo de atención espacialmente consciente (πS) emplea convolución deformable con K = 9 puntos de muestreo seleccionados de forma dispersa. Predice vectores desplazados Δpk y escalares de modulación Δm k para cada punto de muestreo, y luego agrega las características muestreadas para producir pesos de atención espacial. El mecanismo de atención consciente de la tarea (πC) aplica una transformación lineal aprendible a cada canal de forma independiente usando dos conjuntos de parámetros (α1, β1 y α2, β2). Selecciona la respuesta máxima entre las dos representaciones transformadas para adaptar dinámicamente las características a tareas de clasificación y regresión. Finalmente, estos tres mecanismos de atención se aplican secuencialmente al mapa de características de entrada como F_out = πC(πS(πL(F) · F) · F) · F. El mecanismo consciente de la escala emplea ponderación de características cruzadas para combinar de forma adaptativa representaciones multirresolución, refinando así la sensibilidad del modelo a las variaciones dimensionales. El componente espacialmente consciente implementa ponderación de énfasis regional dentro de los mapeos de características, dirigiendo el enfoque computacional hacia entidades en primer plano mientras suprime interferencias de fondo irrelevantes. Mientras tanto, el módulo consciente de tareas modula dinámicamente las representaciones de salida para objetivos específicos, refinando tanto los resultados de clasificación como de regresión para reforzar la precisión del modelo y la robustez operativa. El procedimiento computacional está formalizado en las Ecuaciones 14–17.
(14)
(15)
(16)
(17)
Aquí, WL(F) denota la representación de características enriquecidas por atención, mientras que πL(F), πS(F) y πC(F) corresponden a operaciones de atención a escala, espacial y orientadas a tareas, respectivamente. La transformación f representa una capa de proyección lineal, σ(x) indica procesamiento de activación sigmoide dura, K especifica la cantidad de puntos espaciales seleccionados de forma dispersa, pk+Δp k introduce ajustes de posición para enfatizar áreas discriminativas, Δmk constituye una medida de significancia entrenómable para el punto espacial pk, y α(F) y β(F) son funciones paramétricas aprendibles que rigen los umbrales de activación. Entre ellos, K se establece en 9 en todos los experimentos, ya que este valor proporciona suficiente cobertura espacial manteniendo la eficiencia computacional.
Pasos de acción y implementación
Definición del módulo
Un módulo personalizado de PyTorch llamado DynamicHead debe definirse dentro de los archivos de definición del modelo del proyecto. La implementación de este módulo consta de tres unidades de atención aplicadas secuencialmente: (1) Atención consciente de escala: las capas de características en diferentes escalas se ponderan dinámicamente usando parámetros aprendibles; (2) Atención espacialmente consciente: basada en el concepto de convolución deformable, esta unidad se centra en ubicaciones espaciales dispersas pero discriminativas dentro de los mapas de características; (3) Atención consciente de la tarea: los umbrales de activación se aprenden dinámicamente para optimizar las representaciones de características para tareas de clasificación y regresión, respectivamente. Estos tres mecanismos de atención se aplican secuencialmente a la pirámide de características de entrada, produciendo finalmente características para la predicción. Todos los módulos se implementaron utilizando operaciones estándar de PyTorch, incluyendo capas convolucionales, capas lineales, funciones de activación y mecanismos de atención como se describió anteriormente.
Edición de archivos de configuración
El archivo de configuración del modelo (config.yaml) debe abrirse. La sección que define la cabeza de detección debe estar localizada. La configuración original de la cabeza de detección, que normalmente comprende una serie de capas convolucionales para clasificación y regresión, debe ser reemplazada por una llamada al módulo DynamicHead, asegurando que su entrada esté conectada a la salida de la pirámide de características por la red del mástil.
Motivación de diseño
Las cabezas de detección tradicionales suelen aplicar el mismo conjunto de parámetros convolucionales a todas las capas de características, ubicaciones espaciales y tareas, careciendo de adaptabilidad específica para cada tarea. La introducción del módulo DynamicHead está motivada por la complejidad de las tareas de detección, con el objetivo de desacoplar y abordar estos desafíos mediante una arquitectura unificada basada en la atención. Su motivación de diseño es triple: (1) enfocarse adaptativamente en capas de características correspondientes a objetivos de diferentes tamaños a través del módulo de conciencia de escala; (2) concentrar los recursos computacionales en regiones objetivo en primer plano en lugar de en el fondo mediante el módulo de conciencia espacial; y (3) optimizar dinámicamente las representaciones de características para los objetivos distintos de clasificación y regresión mediante el módulo consciente de la tarea. Esta combinación de desacoplamiento y optimización dinámica mejora la precisión de localización y la fiabilidad de clasificación del modelo para objetivos densamente dispuestos y multiescala, como el tabaco cortado.
Método de evaluación personalizado para el orden del tabaco cortado
Descripción del módulo y principio de diseño: La evaluación cuantitativa del orden de alineación del tabaco cortado es esencial para evaluar la estabilidad del proceso de fabricación y predecir la calidad del producto final en la producción de cigarrillos. Los métodos tradicionales de evaluación se basan en la inspección visual manual, que es subjetiva, consume mucho tiempo y no puede proporcionar mediciones cuantitativas consistentes. Para abordar estas limitaciones, se utiliza un método personalizado de predicción de ángulos integrado con el detector de regresión de una sola etapa mejorado. El principio fundamental de este método es establecer un marco de referencia espacial utilizando la estructura de soporte de acero dentro de la varilla del cigarrillo como referencia geométrica. Debido a que el soporte de acero mantiene una orientación fija durante la fabricación, sirve como línea de referencia ideal para calcular la orientación relativa del tabaco cortado individualmente. Al medir los ángulos absolutos del tabaco cortado detectado y el soporte de acero respecto a la línea de referencia horizontal y calcular posteriormente sus diferencias angulares relativas, el método proporciona una evaluación cuantitativa del orden de alineamiento. Un ángulo relativo de cero indica un paralelismo perfecto entre una hebra y el soporte, mientras que el aumento de la desviación angular indica un alineamiento más pobre. El eje de referencia horizontal se define como la línea paralela al borde inferior de la imagen, orientada de izquierda a derecha. Este eje corresponde a 0°, con ángulos positivos medidos en sentido antihorario y ángulos negativos medidos en sentido horario desde este eje. La métrica final de ordenidad se obtiene promediando los ángulos relativos de todas las hebras detectadas dentro de una imagen, permitiendo una gradación de calidad consistente y objetiva.
Pasos de acción y implementación
Definición del módulo de cálculo de ángulos
Implementa un módulo de postprocesamiento que procese las salidas de detección del modelo mejorado de regresión de una sola etapa. Para cada objeto detectado (tabaco cortado y soporte de acero), extrae las coordenadas de la caja delimitadora. Calcula las coordenadas del punto central de cada objeto detectado usando la Ecuación 18. Calcula las coordenadas del punto central de la imagen basándote en las dimensiones de la imagen usando la Ecuación 19.

(18)

(19)
donde x₁, x₂, y₁, y₂ denotan las coordenadas de las cuatro esquinas de la caja delimitadora detectada para un hilo de tabaco o el soporte de acero; c, x y c y representan las coordenadas de sus respectivos puntos centrales dentro de la región de detección; W y h indican el ancho y la altura de la imagen del cigarrillo; dx y y definen las coordenadas del punto central de la imagen.
Cálculo del ángulo absoluto
Para cada hilo de tabaco detectado y el soporte de acero, calcula el vector desde el centro de la imagen hasta el centro del objeto. Calcular el ángulo absoluto relativo a la línea de referencia horizontal usando la función arcotangente, tal como se formula en la Ecuación 20. El ángulo se calcula usando atan2(d_y, d_x), donde atan2 es la función tangente inversa de cuatro cuadrantes disponible en la biblioteca matemática de Python. Esta función devuelve valores en el rango (−π, π] radianes, que luego se convierten en grados, dando lugar a ángulos de salida en el rango (−180°, 180°]. El manejo en cuadrantes es automático con atan2 según los signos de d_y y d_x. Esto da como resultado unacero para el soporte de acero y uncorte para cada hilo de tabaco.
(20)
Cálculo del ángulo relativo
Para cada hilo de tabaco detectado, calcular el ángulo relativo restando el ángulo absoluto del soporte de acero del ángulo absoluto del hilo, como se muestra en la Ecuación 21. El valor absoluto garantiza mediciones positivas de desviación angular.
(21)
Generación de métricas de ordenidad
Agrega los ángulos relativos de todas las hebras detectadas dentro de una sola imagen. Calcular el ángulo relativo medio sumando todos los ángulos relativos To y dividiendo por el número total de hibras detectadas n, tal y como se formula en la Ecuación 22. Este valor medio sirve como medida cuantitativa del orden de alineación para esa imagen.
(22)
Implementación de calificación de calidad
Implementa una función de clasificación que asigne el valor calculado a calificaciones cualitativas basadas en umbrales predefinidos, tal y como se define en la Ecuación 23. Los umbrales de clasificación (0°–30° = Excelente, 30°–60° = Bueno, >60° = Pobre) se establecieron tras consultar con tres expertos en control de calidad de Longyan Tobacco Industry Co., Ltd. Estos expertos evaluaron de forma independiente 200 imágenes de muestra y correlacionaron los ángulos relativos medios calculados con la calidad de alineación percibida, utilizando una escala de tres categorías (Excelente, Bueno y Pobre). Se seleccionaron los límites de 30° y 60° como cortes de consenso donde el acuerdo entre expertos superaba el 90%. Esta calificación permite una interpretación intuitiva de los resultados cuantitativos para el personal de control de calidad.
(23)
Edición de archivos de configuración
El archivo de configuración del modelo (config.yaml o model.yaml) debe abrirse. La sección de postprocesado o la parte de ajustes de inferencia de la configuración debe estar ubicada. El módulo de cálculo de ángulos personalizado debe estar correctamente referenciado y habilitado. Los ajustes de análisis sintáctico de salida deben verificarse para extraer correctamente las coordenadas de la caja delimitadora tanto para el tabaco cortado como para el soporte de acero. No se requiere inserción adicional de capas para este método de evaluación, ya que funciona como un módulo de postprocesamiento tras las salidas de la cabeza de detección.
Motivación de diseño
El diseño de este método de evaluación personalizado está motivado por la necesidad de transformar la inspección visual subjetiva en mediciones cuantitativas objetivas y reproducibles. La inspección manual tradicional sufre de variabilidad entre observadores y no puede proporcionar datos numéricos continuos para la optimización del proceso. Al aprovechar el soporte de acero como referencia geométrica natural dentro de la varilla de cigarrillos, el método elimina la necesidad de marcadores de calibración externos y garantiza la consistencia de la medición entre diferentes imágenes y lotes de producción. El uso de vectores de punto central y cálculos de arctangente proporciona un enfoque matemáticamente robusto y computacionalmente eficiente para la estimación de ángulos, lo que lo hace adecuado para su despliegue en tiempo real. Este cálculo vectorial desde el centro de la imagen hasta el centro del objeto está diseñado para ser invariante al campo de visión de la cámara y a la posición de la varilla dentro de la imagen, asegurando así robustez bajo condiciones de captura variables. La estrategia de promediado entre múltiples hebras detectadas tiene en cuenta las variaciones naturales en la orientación de las hebras y proporciona una métrica de orden global estadísticamente fiable. Un sistema de clasificación de tres niveles traduce mediciones numéricas continuas en categorías de calidad accionables, facilitando la toma de decisiones rápidas en el control de calidad de la línea de producción. En conjunto, este enfoque integrado combina las capacidades de detección del modelo mejorado de regresión de una sola etapa con cálculos geométricos precisos, permitiendo una evaluación integral y automatizada del orden de alineación del tabaco cortado.
Entrenamiento con modelos para la detección de orden en el tabaco cortado
PyTorch 2.1.0, Compute Unified Device Architecture (CUDA) 12.1, y todas las dependencias deben estar correctamente instaladas. La implementación sigue los pipelines estándar de PyTorch YOLO y puede reproducirse en función de las descripciones detalladas de los módulos y los pasos de configuración proporcionados.
Mando de entrenamiento
Antes de reentrenar, deben prepararse los conjuntos de datos de imágenes particionadas y los archivos de anotación en el formato estándar de detección de una sola etapa (por ejemplo, formato YOLO con un archivo de .txt por imagen). Se debe crear un archivo .yaml de configuración de conjunto de datos que especifica las rutas de imagen, el número de clases (soporte de tabaco cortado y acero) y los nombres de clases. Basándose en las mejoras del modelo descritas anteriormente, el archivo de configuración .yaml original del detector debería ser reemplazado por el archivo .yaml propuesto, que incorpora los módulos MFID, TCF y DynamicHead. El script de train.py debe escribirse o modificarse para importar el paquete detector de una sola etapa, cargar el modelo de entrenamiento y la configuración del conjunto de datos, y establecer los siguientes parámetros de entrenamiento: imgsz=640, epochs=100, batch=4, workers=0, device='0', optimizer='SGD', close_mosaic=10, etc. La semilla aleatoria se fijó a 42, y los pesos del modelo se inicializaron usando la estrategia de inicialización predeterminada proporcionada por el marco de aprendizaje profundo. La reproducibilidad se aseguraba estableciendo torch.backends.cudnn.deterministic = Verdadero y torch.backends.cudnn.benchmark = Falso.
Hiperparámetros
Los hiperparámetros clave configurados para el entrenamiento son los siguientes: resolución de imagen de entrada de 896 × 1600 píxeles; tamaño de lote de 4, limitado por la memoria GPU; tasa de aprendizaje inicial de 0,01 con un planificador de recocido coseno para decaimiento gradual; optimizador de descenso de gradiente estocástico (SGD) con momento de 0,912 para acelerar la convergencia; y decaimiento de peso de 0,0004 para regularización. Las imágenes se normalizaron usando la media [0,485, 0,456, 0,406] y la desviación estándar [0,229, 0,224, 0,225]. La mejora incluyó un giro horizontal aleatorio (50%), ajuste aleatorio de brillo (±20%) y rotación aleatoria (±15°). La mejora en mosaico está habilitada por defecto durante las primeras épocas de entrenamiento para mejorar la robustez del modelo a diferentes escalas y oclusiones de objetos. Se desactiva en las últimas 10 épocas (close_mosaic = 10) para refinar la precisión de la detección.
Seguimiento de la formación
Durante la formación, el marco genera métricas completas en cada época. La función de pérdida es una suma ponderada de tres componentes: pérdida por clasificación (entropía cruzada binaria [BCE] con logits), pérdida por localización (intersección completa sobre la pérdida de unión [IoU]) y pérdida de objetidad (BCE). Los pesos totales de pérdida se establecieron como λ_cls = 0,5, λ_box = 0,05 y λ_obj = 1,0. Las curvas de pérdida de entrenamiento y validación deben monitorizarse para asegurar una convergencia estable y detectar cualquier signo de sobreajuste. El mAP con un umbral de IoU de 0,5 (mAP@0,5) en el conjunto de validación se utiliza como principal indicador de rendimiento para la detección de hebras de tabaco cortado. Dado el tamaño del conjunto de datos y la complejidad del modelo, el entrenamiento para 100 épocas suele ser suficiente para la convergencia. El punto de control del modelo con mejor rendimiento se guarda automáticamente en función del mAP de validación.
Evaluación y despliegue del modelo
Evaluación
Tras completar el entrenamiento, los pesos óptimos del modelo se guardan como runs/train/exp/weights/best.pt. El modelo entrenado debe evaluarse en el conjunto de validación dedicado usando el siguiente comando: python val.py --data cigarette_dataset.yaml --weights runs/train/exp/weights/best.pt. El script de evaluación genera métricas clave de rendimiento, incluyendo precisión, recuperación y mAP@0,5, para ambas clases de detección (tabaco cortado y soporte de acero). El mAP debe verificarse para cumplir el umbral requerido para el despliegue industrial (por ejemplo, >95% para la detección de cadenas). El umbral de despliegue (mAP >95% para la detección de cadenas) representa un requisito interno de rendimiento para el entorno industrial objetivo. El resultado reportado refleja el rendimiento en un conjunto de pruebas diverso que incluye casos límite desafiantes. La mAP del modelo para condiciones de producción rutinarias supera el 96% cuando se evalúa sobre un subconjunto filtrado para obtener una iluminación ideal y oclusión mínima. El subconjunto de producción rutinaria se definió por los siguientes criterios: iluminación dentro del rango de 500–800 lux (iluminación óptima), porcentaje de oclusión inferior al 10% (solapamiento mínimo) y ausencia de reflejos especulares visibles. Este subconjunto contiene 427 imágenes, que representan aproximadamente el 67% del conjunto de pruebas. Este subconjunto corresponde a las condiciones estándar de producción diurna bajo iluminación normal y disposición bien orientada de los hilos.
Verificación de inferencia
Para validar visualmente el rendimiento de detección del modelo en imágenes no vistas, se realiza inferencia sobre imágenes de prueba de muestra usando el siguiente comando: python detect.py --weights runs/train/exp/weights/best.pt --source path/to/test/images --conf 0.5. Este comando genera imágenes anotadas con cajas delimitadoras alrededor de soportes detectados de tabaco cortado y acero. La velocidad de inferencia se midió en una GPU NVIDIA GeForce RTX 3080 Ti (12 GB de VRAM) usando CUDA 12.1 y PyTorch 2.1.0. Los frames por segundo (FPS) reportados se calcularon como la media de más de 100 pases hacia adelante consecutivos tras 50 iteraciones de calentamiento. Además, se informa de la velocidad de inferencia (en fotogramas por segundo) para confirmar su idoneidad en tiempo real para el entorno de despliegue.
Despliegue de modelos
Para permitir el despliegue en tiempo real en el sistema de control industrial, el modelo entrenado de PyTorch (best.pt, aproximadamente 7–9 MB) debe exportarse a un formato de inferencia optimizado, como TensorRT o Open Neural Network Exchange (ONNX). Esta conversión mejora la velocidad de inferencia manteniendo la precisión de la detección. Para exportar ONNX, usa: torch.onnx.export(model, dummy_input, "model.onnx", opset_version=11, input_names=["imágenes"], output_names=["salidas"]). Para la conversión a TensorRT, usa: trtexec --onnx=model.onnx --saveEngine=model.trt --fp16 --workspace=4096. El modo de precisión FP16 se utilizaba para optimizar la velocidad de inferencia. El modelo desplegado final genera coordenadas de caja delimitadora, etiquetas de clase (hilo de tabaco cortado o soporte de acero) y puntuaciones de confianza para cada objeto detectado, que sirven como entradas al método personalizado de evaluación de ángulos utilizado para cuantificar el orden del tabaco cortado.