Для проверки эффективности предложенной комбинированной модели YOLOv11 и CNN в мониторинге безопасности производственной линии был сформирован набор данных, охватывающий различные сценарии опасных ситуаций. Данный набор содержит 12 000 изображений сцен на производственной линии, разделенных на обучающую, валидационную и тестовую выборки в соотношении 7:1,5:1,5 с фиксированным случайным числом (seed) 42. Он охватывает различные условия работы, включая стандартное освещение, недостаточное освещение, частичное перекрытие, сильное перекрытие, размытие при движении и сложные фоны. Порог уверенности для вывода был установлен на уровне 0,5, а порог подавления не-максимумов (NMS) — на уровне 0,45. Все эксперименты повторяли трижды; результаты представлены как среднее значение ± стандартное отклонение. Категории разметки включают рабочих, защитные каски, роботизированные манипуляторы, опасные зоны, инструменты и транспортные средства, с использованием формата PASCAL Visual Object Classes (VOC). Порог пересечения над объединением (IoU) установлен на уровне 0,5, а согласованность разметки подтверждена путем перекрестной проверки двумя специалистами. Входные изображения были равномерно масштабированы до 640 × 640 и дополнены с помощью метода Mosaic. Обучение проводилось с использованием оптимизатора SGD с начальной скоростью обучения 0,01, моментом 0,9, затуханием весов 0,0005 и размером пакета (batch size) 32. Обучение длилось 200 эпох, а для корректировки скорости обучения использовалось косинусное отжиг (cosine annealing).
Для тщательной оценки эффективности модели использовался ряд метрик: средняя средняя точность (mAP), количество кадров в секунду (FPS) для определения скорости обработки кадров изображения, точность (precision) для оценки достоверности положительных прогнозов, полнота (recall) для измерения способности модели обнаруживать истинно положительные результаты и площадь под кривой (AUC), указывающая на площадь под рабочей характеристической кривой (ROC), что отражает общую классификационную способность модели. Формулы расчета приведены в уравнениях (4), (5), (6), (7), (8), (9), (10), (11):
(4)
(5)
(6)
Напомним,
(7)
(8)
(9)
(10)
(11)
Здесь mAP@0.5 означает среднюю среднюю точность при пороге IoU 0.5; N — количество категорий; APi — средняя точность i-й категории; а mAP@[0.5:0.95] — среднее значение mAP, рассчитанное для порогов IoU от 0.5 до 0.95. TP, FP, FN и TN представляют собой количество истинно положительных, ложноположительных, ложноотрицательных и истинно отрицательных результатов соответственно. F — общее количество обработанных кадров, T — общее время обработки, TPR — доля истинно положительных результатов, а FPR — доля ложноположительных результатов.
Для компонента детектирования YOLOv11 функция потерь представлена в уравнении (12):
(12)
Где Lcoord обозначает отклонение между предсказанным кадром и реальным кадром, Lconf измеряет ошибку уверенности предсказанного кадра, Lclass измеряет ошибку предсказания категории, а λcoord, λconf и λclass являются весовыми коэффициентами, используемыми для балансировки соответствующих функций потерь.
Анализ данных в Таблице 1 показывает, что предлагаемый метод обеспечивает mAP@0.5 на уровне 0.91 и mAP@0.5:0.95 на уровне 0.82, что представляет собой улучшение на 0.04 и 0.04 соответственно по сравнению с YOLOv5. Его F1-score составляет 0.935, что также выше, чем у сравниваемых моделей. Скорость детектирования составляет 120 FPS, что в четыре раза выше, чем у Faster R-CNN, но немного ниже, чем у YOLOv10 и YOLOv11. Количество параметров составляет 6.7M, что всего на 1.5M больше, чем у YOLOv11, при этом mAP@0.5 выше на 0.03. По сравнению с EfficientDet, имеющей схожие вычислительные затраты, точность выше на 0.06, в то время как количество параметров меньше на 56%. Данные демонстрируют, что внедренное многомасштабное слияние и механизм внимания эффективно повышают точность детектирования малоразмерных целей, обеспечивая хороший баланс между скоростью и точностью. Резюмируя, наш предлагаемый метод достигает баланса между точностью и скоростью детектирования. mAP@0.5 на 0.02 выше, чем у второй по эффективности модели, F1-score достигает 0.935, а 6.7M параметров достаточно для практического развертывания. Многомасштабное слияние и механизм внимания улучшают распознавание малых и перекрытых целей в сложных сценах. Модель балансирует точность и эффективность, что делает ее подходящей для сценариев в реальном времени, таких как мониторинг промышленной безопасности. Следует отметить, что во всех сравниваемых моделях используются официальные предобученные веса с единообразным входным разрешением 640 × 640, порогом NMS 0.45 и порогом уверенности 0.5.
| Метод | mAP@0.5 | mAP@0.5:0.95 | F1-мера | FPS | Параметры (M) |
| YOLOv5 | 0.87 | 0.78 | 0.89 | 130 | 7.1 |
| EfficientDet | 0.85 | 0.73 | 0.88 | 50 | 15.3 |
| RetinaNet | 0.82 | 0.68 | 0.85 | 45 | 37.6 |
| Faster R-CNN | 0.84 | 0.7 | 0.87 | 30 | 45.2 |
| YOLOv10 | 0.89 | 0.77 | 0.88 | 135 | 5.3 |
| YOLOv11 | 0.88 | 0.75 | 0.895 | 140 | 5.2 |
| НАШ МЕТОД | 0.91 | 0.82 | 0.935 | 120 | 6.7 |
Таблица 1: Сводная таблица сравнения производительности моделей. Анализ данных показывает, что предлагаемый метод обеспечивает mAP@0.5 равный 0,91 и mAP@0.5:0.95 равный 0,82, что представляет собой улучшение на 0,04 и 0,04 соответственно по сравнению с YOLOv5. Его показатель F1-score составляет 0,935, что также выше, чем у сравниваемых моделей. Скорость детектирования составляет 120 FPS, что в четыре раза выше, чем у Faster R-CNN, но немного ниже, чем у YOLOv10 и YOLOv11. Количество параметров составляет 6,7M, что всего на 1,5M больше, чем у YOLOv11, при этом mAP@0.5 выше на 0,03. По сравнению с EfficientDet, имеющим схожие вычислительные затраты, точность выше на 0,06, в то время как количество параметров на 56% меньше. Данные демонстрируют, что внедренное многомасштабное слияние и механизм внимания эффективно повышают точность детектирования малоразмерных целей, обеспечивая хороший баланс между скоростью и точностью. Резюмируя, наш предлагаемый метод достигает баланса между точностью и скоростью детектирования. mAP@0.5 на 0,02 выше, чем у второй по эффективности модели, F1-score достигает 0,935, а 6,7M параметров достаточно для практического развертывания. Многомасштабное слияние и механизм внимания улучшают распознавание малых и перекрытых целей в сложных сценах. Модель балансирует точность и эффективность, что делает ее подходящей для сценариев реального времени, таких как мониторинг промышленной безопасности. Следует отметить, что во всех сравниваемых моделях использовались официальные предобученные веса с единообразным входным разрешением 640 × 640, единообразным порогом NMS 0,45 и единообразным порогом уверенности 0,5.
Рисунок 2 содержит углубленный анализ типов ложных срабатываний модели. YOLOv11 + CNN имеет самый низкий уровень ложного обнаружения фона (85 раз/10 000 кадров), при этом большинство ложных срабатываний происходит на похожих объектах (62 раза) и в сценах с частичным перекрытием (48 раз). Анализ ROC-кривых показывает, что TPR модели достиг 0,9 (AUC = 0,98) при FPR равном 0,1, а минимальный интервал между кривыми подтверждает высокую надежность уверенности детектирования. Результаты данного анализа не только подтверждают эффективность модели, но и определяют четкий технический план для последующей оптимизации ложных срабатываний, в частности, путем улучшения способности модели различать похожие объекты.

Рисунок 2. Анализ ошибок. Анализ типов ложных срабатываний модели. Модель YOLOv11 + CNN имеет самый низкий уровень ложных срабатываний на фоне (85 раз/10 000 кадров), при этом большинство ложных срабатываний сосредоточено на схожих объектах (62 раза) и в сценах с частичным перекрытием (48 раз). Анализ ROC-кривой показывает, что TPR модели достигло 0,9 (AUC = 0,98) при FPR 0,1, а минимальное расстояние между кривыми подтверждает надежность уверенности обнаружения. Результаты данного анализа не только подтверждают эффективность модели, но и определяют четкую техническую дорожную карту для последующей оптимизации ложных срабатываний, в частности, путем усиления способности модели различать схожие объекты. Нажмите здесь, чтобы просмотреть увеличенную версию этого рисунка.
Рисунок 3 демонстрирует сравнение производительности модели на различных аппаратных платформах. YOLOv11 + CNN обеспечивает сверхнизкую задержку 18 ms на граничном тензорном процессоре (TPU) с колебанием всего ±2 ms, при этом энергопотребление поддерживается на уровне 15 W. Тесты пропускной способности показывают, что модель достигает скорости обработки 70 FPS на устройствах граничных вычислений Jetson Xavier, при этом задержка 99-го перцентиля удерживается в пределах 50 ms. Данные показатели производительности при развертывании позволяют модели адаптироваться к требованиям различных вычислительных платформ в промышленных областях. Анализ ошибок дополнительно показывает, что модель сохраняет стабильную производительность в условиях ограниченных ресурсов, что подтверждает ее применимость в инженерной практике.

Рисунок 3. Показатели развертывания. Сравнение производительности модели на различных аппаратных платформах. YOLOv11 + CNN обеспечивает сверхнизкую задержку 18 ms на Edge TPU (с колебанием всего ±2 ms) при энергопотреблении 15 W. Тесты пропускной способности показывают, что модель достигает скорости обработки 70 FPS на устройствах граничных вычислений Jetson Xavier, при этом задержка на уровне 99-го процентиля удерживается в пределах 50 ms. Эти показатели производительности развертывания свидетельствуют о том, что модель может адаптироваться к требованиям развертывания на различных вычислительных платформах в промышленных областях. Анализ ошибок дополнительно показывает, что модель сохраняет стабильную производительность в условиях ограниченных ресурсов, что подтверждает ее инженерную применимость. Пожалуйста, нажмите здесь, чтобы просмотреть увеличенную версию этого рисунка.
Рисунок 4 демонстрирует разницу в эффективности обнаружения каждой модели в шести целевых категориях. Модель YOLOv11 + CNN достигла точности 0,96 в задаче распознавания защитных касок, что на 4 процентных пункта выше показателя базовой модели. Пунктирный график указывает на минимальные колебания производительности модели по категориям (±0,05), что отражает ее способность к обобщению. Матрица ошибок, представленная в виде тепловой карты, выявляет 15% взаимных ложных срабатываний при определении опасной зоны и роботизированного манипулятора. Этот результат задает четкое направление для последующей оптимизации модели.

Рисунок 4. Анализ обнаружения категорий. Сравнение различий в эффективности обнаружения каждой модели по шести целевым категориям. Модель YOLOv11 + CNN достигла точности 0,96 в задаче распознавания защитных касок, что на 4 процентных пункта выше показателей эталонной модели. Точечный график показывает, что модель демонстрирует минимальные колебания эффективности между категориями (±0,05), что отражает её способность к обобщению. Матрица ошибок, представленная в виде тепловой карты, выявляет 15% взаимных ложных срабатываний при обнаружении опасной зоны и роботизированного манипулятора. Этот результат задает четкое направление для последующей оптимизации модели. Пожалуйста, нажмите здесь, чтобы просмотреть увеличенную версию этого рисунка.
Рисунок 5 содержит подробные данные о процессе обучения каждой модели. YOLOv11 + CNN демонстрирует самую высокую скорость сходимости: функция потерь снижается до 0,1 в течение 30 эпох, а разрыв между кривой mAP на валидационной выборке и обучающем наборе данных стабильно составляет менее 1%. Анализ графика полосы погрешностей показывает, что итоговый показатель mAP@0.5 модели на валидации стабилизируется на уровне 0,94 ± 0,01, а диапазон колебаний производительности составляет всего одну треть от диапазона RetinaNet. Эти результаты подтверждают эффективность протокола совместного обучения. Модель демонстрирует преимущества в производительности на ранних этапах обучения, что указывает на способность ее архитектурного дизайна быстро извлекать признаки.

Рисунок 5. Анализ процесса обучения. Запись процесса обучения для каждой модели. YOLOv11 + CNN демонстрирует самую высокую скорость сходимости (потери падают до 0.1 в течение 30 эпох), а разрыв между кривой mAP на валидационном наборе и тренировочном наборе всегда составляет менее 1%. Анализ графика с полосой погрешности показывает, что итоговый показатель mAP@0.5 модели на валидации стабилен на уровне 0.94 ± 0.01, а диапазон колебаний производительности составляет лишь одну треть от диапазона RetinaNet. Эти результаты подтверждают эффективность протокола совместного обучения. Модель демонстрирует преимущества в производительности на ранних этапах обучения, что указывает на то, что ее архитектурный дизайн позволяет быстро извлекать признаки. Пожалуйста, нажмите здесь, чтобы просмотреть увеличенную версию этого рисунка.
Таблица 2 представляет количественные результаты эффективности различных моделей детектирования в сложных условиях среды. Тестовые данные при стандартном освещении и в различных экстремальных сценариях показывают, что YOLOv11 + CNN сохраняет оптимальную производительность при всех условиях. При стандартном освещении mAP@0.5 этой модели достигла 0,91, что значительно выше, чем у YOLOv5 (0,87) и Faster R-CNN (0,84). При ухудшении условий окружающей среды эффективность каждой модели снижается в разной степени, однако YOLOv11 + CNN демонстрирует наибольшую устойчивость к внешним воздействиям: в условиях низкой освещенности (< 50 lux) производительность снижается всего на 3% (до 0,88), что лучше, чем снижение на 5% у сравнительной модели; в сценариях с сильным перекрытием объектов (> 50%) показатель mAP сохраняется на уровне 0,78, а снижение производительности (13%) значительно меньше, чем у YOLOv5 (15%) и Faster R-CNN (16%). Эти результаты демонстрируют, что YOLOv11 + CNN повышает адаптивность модели к сложным факторам, таким как изменение освещенности и перекрытия, за счет улучшенного слияния признаков и механизмов внимания, что подтверждает возможность практического применения в промышленных сценариях.
| Условие испытания | YOLOv11 + CNN | YOLOv5 | Faster R-CNN | Колебания производительности |
| Стандартное освещение | 0.91 | 0.87 | 0.84 | 0.01 |
| Слабое освещение (< 50 люкс) | 0.88 (-3%) | 0.82 (-5%) | 0.79 (-5%) | 0.02 |
| Частичная окклюзия (30%–50%) | 0.85 (-6%) | 0.80 (-7%) | 0.76 (-8%) | 0.03 |
| Сильная окклюзия (> 50%) | 0.78 (-13%) | 0.72 (-15%) | 0.68 (-16%) | 0.04 |
| Размытие в движении | 0.83 (-8%) | 0.77 (-10%) | 0.73 (-11%) | 0.05 |
Таблица 2: Таблица количественного анализа адаптивности к условиям окружающей среды. Эффективность различных моделей детектирования в сложных условиях, определенная с помощью количественного анализа. Тестовые данные, полученные при стандартном освещении и в различных экстремальных сценариях, показывают, что YOLOv11 + CNN сохраняет самую высокую производительность при всех условиях тестирования. При стандартном освещении показатель mAP@0.5 данной модели достиг 0.91, что значительно выше, чем у YOLOv5 (0.87) и Faster R-CNN (0.84). При ухудшении условий окружающей среды производительность каждой модели снижается в разной степени, однако YOLOv11 + CNN демонстрирует наибольшую устойчивость к внешним воздействиям среди оцениваемых моделей: в условиях низкой освещенности (< 50 lux) производительность снижается всего на 3% (до 0.88), что лучше, чем снижение на 5% у сравнительной модели; в сценариях с сильным перекрытием объектов (> 50%) значение mAP сохраняется на уровне 0.78, а снижение производительности (13%) значительно меньше, чем у YOLOv5 (15%) и Faster R-CNN (16%). Эти результаты демонстрируют, что YOLOv11 + CNN повышает адаптивность модели к сложным факторам, таким как изменение освещенности и помехи при перекрытии, за счет улучшенного механизма слияния признаков и структуры внимания, что подтверждает возможность практического применения в промышленных сценариях.
В таблице 3 показано, что в данном эксперименте использовался оптимизатор SGD с моментом 0.9 для ускорения сходимости и подавления осцилляций. Начальная скорость обучения 0.01 применялась с косинусным отжигом (cosine annealing), который постепенно снижался в процессе обучения для уточнения оптимизации. Для применения L2-регуляризации и уменьшения переобучения был введен коэффициент распада весов (weight decay) 0.0005. Размер пакета (batch size) 32 позволил сбалансировать вычислительную эффективность и стабильность оценки градиента. 200 эпох обучения обеспечили достаточную сходимость. Параметры были адаптированы для задачи одностадийного детектирования, обеспечивая баланс между скоростью обучения и точностью.
| Параметр | Значение |
| Оптимизатор | SGD (стохастический градиентный спуск) |
| Начальная скорость обучения | 0.01 |
| Импульс | 0.9 |
| Регуляризация весов (Weight decay) | 0.0005 |
| Размер партии | 32 |
| Эпохи обучения | 200 |
| Планирование скорости обучения | Косинусное отжиг (Cosine annealing) |
Таблица 3: Таблица гиперпараметров обучения. В данном эксперименте использовался оптимизатор SGD с моментом 0.9 для ускорения сходимости и подавления осцилляций. Начальная скорость обучения 0.01 применялась с косинусным отжигом (cosine annealing), которая постепенно снижалась в процессе обучения для уточнения оптимизации. Для применения L2-регуляризации и уменьшения переобучения был введен коэффициент затухания весов (weight decay) 0.0005. Размер пакета (batch size) 32 позволил сбалансировать вычислительную эффективность и стабильность оценки градиента. 200 эпох обучения обеспечили достаточную сходимость. Параметры были адаптированы для задачи одноэтапного детектирования, обеспечивая баланс между скоростью обучения и точностью.
Таблица 4 показывает, что при использовании YOLOv11 в качестве базовой модели значение mAP@0.5 составляет 0.89. Внедрение только многомасштабного слияния снижает точность до 0.88. Последующее последовательное наслоение канального внимания и пространственного внимания повышает точность до 0.90 и 0.89 соответственно. Совместная точность всех модулей достигает 0.91, что на 0.02 выше базового показателя. Данные свидетельствуют о том, что канальное внимание напрямую повышает точность, а комбинированная работа многомасштабного слияния и механизмов внимания обеспечивает оптимальный результат.
| Конфигурация | mAP@0.5 |
| YOLOv11 (базовая модель) | 0.89 |
| + Многомасштабное слияние | 0.88 |
| + Многомасштабное внимание + внимание к каналам | 0.9 |
| + Многомасштабное пространственное внимание | 0.89 |
| Полный модуль (YOLOv11 + CNN) | 0.91 |
Таблица 4: Таблица абляционного теста. При использовании YOLOv11 в качестве базовой модели значение mAP@0.5 составляет 0,89. Внедрение только многомасштабного слияния снижает точность до 0,88. Добавление канального внимания или пространственного внимания после многомасштабного слияния повышает точность до 0,90 и 0,89 соответственно. Совокупная точность всех модулей достигает 0,91, что на 0,02 выше базового показателя. Данные показывают, что в данных условиях канальное внимание дает больший прирост, чем пространственное внимание, а комбинированная производительность многомасштабного слияния и внимания является оптимальной.
Рисунок 6 систематически оценивает эффективность модели в экстремальных условиях. mAP YOLOv11 + CNN снизился всего на 6% (до 0,88) в условиях низкой освещенности и по-прежнему составил 0,78 (что на 8% выше эталонного показателя) в сценах с сильными перекрытиями объектов. Эти результаты демонстрируют адаптивность модели к окружающей среде, эффективно решая распространенные проблемы изменения освещенности и локальных перекрытий в промышленном производстве, что обеспечивает стабильную работу системы детектирования.

Рисунок 6. Адаптивность к условиям окружающей среды. Систематическая оценка производительности модели в экстремальных условиях. mAP модели YOLOv11 + CNN снизился всего на 6% (до 0.88) в условиях низкой освещенности и остался на уровне 0.78 (что на 8% выше контрольного показателя) в сценах с сильным перекрытием объектов. Эти результаты демонстрируют адаптивность модели к окружающей среде, что позволяет эффективно решать проблемы, связанные с изменением освещения и локальным перекрытием объектов в промышленном производстве, обеспечивая тем самым стабильную работу системы обнаружения. Пожалуйста, нажмите здесь, чтобы просмотреть увеличенную версию этого рисунка.
Рисунок 7 демонстрирует различия в распределении признаков между YOLOv11 и YOLOv11 + CNN для шести типов промышленных объектов с помощью снижения размерности t-SNE. На левом рисунке видно, что признаки базовой модели YOLOv11 характеризуются значительным внутриклассовым разбросом (внутриклассовое расстояние 2.34 ± 0.15), особенно в категориях «Опасная зона» (красный) и «Транспортное средство» (фиолетовый), где наблюдается существенное перекрытие, что согласуется с 15% частотой ложного обнаружения в экспериментальной группе 3. На правом рисунке показано, что усовершенствованная модель YOLOv11 + CNN значительно повышает внутриклассовую компактность за счет модуля усиления признаков, увеличивая среднее расстояние между центрами кластеров в каждой категории в 1,8 раза.

Рисунок 7. Сравнение распределения признаков t-SNE. Сравнение различий в распределении признаков между YOLOv11 и YOLOv11 + CNN для шести типов промышленных целей с помощью снижения размерности t-SNE. На левом рисунке показано, что признаки базовой модели YOLOv11 демонстрируют значительную внутриклассовую дисперсию (внутриклассовое расстояние 2,34 ± 0,15), особенно в категориях «Опасная зона» (красный) и «Транспортное средство» (фиолетовый), где наблюдается существенное перекрытие, что согласуется с 15%-ным уровнем ложных срабатываний в экспериментальной группе 3. На правом рисунке показано, что усовершенствованная модель YOLOv11 + CNN значительно повышает внутриклассовую компактность за счет модуля усиления признаков, при этом среднее расстояние между центрами кластеров в каждой категории увеличилось в 1,8 раза. Пожалуйста, нажмите здесь, чтобы просмотреть увеличенную версию этого рисунка.
Рисунок 8 подтверждает вклад каждого модуля с помощью систематических экспериментов по абляции. Результаты абляции показывают, что добавление канального внимания после многомасштабного слияния увеличивает mAP@0.5 до 0.90, в то время как добавление пространственного внимания увеличивает mAP@0.5 до 0.89. Полный модуль обеспечивает наивысшее значение mAP@0.5, равное 0.91. Визуализация на тепловой карте показывает, что комбинированный механизм внимания может одновременно усиливать отклик детекции как в центре опасной зоны (значение активации: +0.15), так и для малых целей на краю (+0.08). Экспериментальные данные демонстрируют, что многомасштабное слияние признаков и механизмы внимания оказывают кумулятивный эффект, позволяя модели соответствовать требованиям по детектированию целей на различных масштабах.

Рисунок 8. Эксперимент по модульной абляции. Подтверждение вклада каждого модуля с помощью систематических экспериментов по абляции. Результаты абляции показывают, что добавление канального внимания после многомасштабного слияния увеличивает mAP@0.5 до 0.90, в то время как добавление пространственного внимания увеличивает mAP@0.5 до 0.89. Полный модуль обеспечивает наивысшее значение mAP@0.5, равное 0.91. Визуализация тепловой карты показывает, что комбинированный механизм внимания может одновременно усиливать отклик детектирования в центре опасной зоны (значение активации: +0.15) и для малых целей по краям (+0.08). Экспериментальные данные демонстрируют, что многомасштабное слияние признаков и механизмы внимания обладают кумулятивным эффектом, позволяя модели соответствовать требованиям к детектированию целей в разных масштабах. Пожалуйста, нажмите здесь, чтобы просмотреть увеличенную версию этого рисунка.
ДОСТУПНОСТЬ ДАННЫХ:
Полные необработанные изображения и видеопотоки с производственных линий являются объектом ограничений промышленной конфиденциальности и не подлежат публичному разглашению. В «Описании дополнительного набора данных» (Supplemental File 1) приведены сведения о сборе данных, распределении категорий и сценариев, спецификации аннотирования, процедуры контроля качества, разделение данных, методы предварительной обработки и аугментации. «Псевдокод и структура воспроизводимости» (Supplemental File 2) содержит рабочий процесс на уровне псевдокода, описания конфигураций и рекомендации по воспроизведению. Анонимизированный подмножество данных и дополнительные вспомогательные материалы могут быть запрошены у автора, ответственного за переписку, для некоммерческих академических исследований при условии соблюдения институциональных ограничений и требований конфиденциальности.
Дополнительный файл 1. Описание дополнительного набора данных. В этом файле описаны протокол сбора данных, охват сценариев, распределение классов, спецификации аннотирования, процедуры контроля качества, разделение на обучающую/валидационную/тестовую выборки, предварительная обработка и процедуры аугментации. Пожалуйста, нажмите здесь, чтобы скачать этот файл.
Дополнительный файл 2. Псевдокод и основа для воспроизводимости. В данном файле приведены детали рабочего процесса на уровне псевдокода и сведения о конфигурации для предобработки, обучения, оценки и развертывания, а также описаны ограничения на использование необработанных промышленных видеозаписей и доступ к вспомогательным материалам. Пожалуйста, нажмите здесь, чтобы скачать этот файл.