Исследовательская статья

Алгоритм динамического планирования и оптимизации ресурсов для деятельности профсоюзов путем интеграции трансформера и обучения с подкреплением

38 просмотров

DOI:

10.3791/72544

28 августа 2026 г.

В этой статье

Краткое содержание

В данной работе исследуется алгоритм оптимизации динамического планирования, объединяющий Transformer и обучение с подкреплением PPO, с акцентом на частые конфликты ресурсов и задержки отклика при планировании деятельности профсоюзов.

Аннотация

Для решения проблемы снижения организационной эффективности, вызванной частыми конфликтами при распределении ресурсов и задержками в планировании при управлении деятельностью профсоюзов, в данной работе предлагается алгоритм динамического планирования, объединяющий Transformer и PPO (Proximal Policy Optimization). В рамках конкретной реализации сначала разрабатывается унифицированная структура моделирования сценария планирования для преобразования состояний мероприятий, персонала и ресурсов в тензорные входные данные, что позволяет обеспечить интеграцию многомерных ограничений. Затем механизм многоголового внимания Transformer используется для кодирования временных рядов исторических запросов на проведение мероприятий и статусов ресурсов, извлечения многомерных пространственно-временных признаков и усиления восприятия рисков возникновения конфликтов. Впоследствии, на основе результатов кодирования и стратегической сети PPO, генерируются действия по планированию из текущего состояния для повышения адаптивности стратегии к сложным условиям. Наконец, за счет обновления путем прунинга и механизма коррекции функции преимущества гарантируются стабильность стратегии в процессе итераций и улучшение показателей планирования. Эксперименты показали, что при плотности задач 1000 среднее время принятия решения алгоритмом планирования составляет 0,72 s, а средняя задержка отклика — 1,59 s, что свидетельствует о высокой скорости отклика и эффективности принятия решений. Для семи типов мероприятий и уровней сложности коэффициент конфликтов ресурсов составляет 0,05–0,12; средний коэффициент использования ресурсов — 0,75–0,86; а индекс стабильности планирования — 0,8–0,91, что эффективно снижает частоту конфликтов при распределении ресурсов и обеспечивает высокую стабильность планирования. В условиях высокой конкурентности индекс баланса ресурсов и индекс робастности переноса стратегии составляют 0,88 и 0,85 соответственно, что указывает на хорошую адаптивность к нагрузкам при параллельном выполнении задач.

Введение

Деятельность профсоюзов связана с комплексным планированием множества задач и ресурсов, что требует от системы эффективных возможностей динамического реагирования1,2. Требования к мероприятиям часто меняются, а распределение персонала и площадок носит сложный характер, что может легко привести к конфликтам в расписании и нерациональному использованию ресурсов3,4. Точная фиксация истории мероприятий и статуса ресурсов в режиме реального времени, а также повышение способности выявлять потенциальные конфликты и реагировать на них, являются ключевыми факторами повышения операционной эффективности организации5,6. Интеграция передовых технологий моделирования временных рядов и алгоритмов обучения с подкреплением позволяет достичь глубокого понимания и интеллектуальной оптимизации в сложных условиях планирования, что помогает максимизировать использование ресурсов, ускорить реагирование при составлении графиков и способствовать интеллектуальной модернизации управления деятельностью профсоюзов.

Однако существующие на практике подходы к планированию в значительной степени основаны на статических правилах и не способны адаптироваться к частым изменениям задач и колебаниям ресурсов, что часто приводит к увеличению времени отклика и серьезным конфликтам ресурсов. При планировании деятельности профсоюзов типы задач крайне разнообразны; использование ресурсов строго ограничено и часто меняется, а зависимости между мероприятиями и конкуренция за ресурсы формируют сложную карту планирования7,8. На практике график мероприятий не может быть эффективно согласован с доступными временными окнами таких ресурсов, как персонал и помещения9,10, что часто приводит к конфликтам, снижающим общую согласованность организационных операций11,12. Перед системой планирования стоит не одна цель оптимизации, а задача достижения баланса между многомерными показателями, такими как минимизация конфликтов ресурсов, максимизация скорости отклика, стабильность стратегии планирования и уровень выполнения задач13,14, что характеризует типичную многокритериальную оптимизацию. Кроме того, деятельность профсоюзов имеет выраженные фазы и циклы, поэтому стратегии планирования должны динамически адаптироваться к изменяющейся структуре спроса на ресурсы на разных этапах выполнения задач. Статические планы, созданные один раз, не могут поддерживать среду исполнения с высокой частотой изменений15,16. В существующей логике планирования отсутствует глубокое изучение поведения задач в прошлом и закономерностей изменения состояния ресурсов. Она не способна обеспечить точное прогнозирование и вывод стратегий на будущее17,18. Стратегия планирования системы медленно реагирует на внезапно возникающие задачи и временные изменения в ресурсах, что влияет на общую устойчивость функционирования19,20. Создание системы планирования, обладающей прогностической способностью, гибкостью и стабильностью, стало ключевым техническим требованием в практических приложениях. Это требует от модели высокого уровня восприятия многомерной информации, памяти последовательностей и способностей к миграции стратегий, а также поддержания устойчивого принятия решений и ресурсного баланса в многозадачной среде, что позволит обеспечить интеллектуальную оптимальную координацию планирования деятельности профсоюзов.

В многочисленных исследованиях предлагались различные решения проблемы динамического планирования. Среди них сочетание глубокого обучения и обучения с подкреплением продемонстрировало высокую адаптивность и возможности оптимизации. Некоторые ученые используют LSTM (долгую краткосрочную память)21,22 для моделирования данных временных рядов в сочетании со стратегиями обучения с подкреплением для оптимизации поведения при планировании, чего удалось достичь с определенными результатами. Другой тип исследований основан на эвристическом методе с использованием жадного алгоритма, где основной акцент делается на простоте и эффективности принятия решений по планированию, что подходит для сценариев с четко определенными правилами23,24. В других работах изучалось применение глубокой Q-сети (DQN) для планирования, что позволило улучшить стратегии за счет аппроксимации функции ценности25,26. Однако данные методы имеют такие недостатки, как недостаточное выявление долгосрочных зависимостей, нестабильное обновление стратегий и значительные задержки отклика при работе в сложных и меняющихся сценариях совместной деятельности, что затрудняет удовлетворение потребностей планирования при высокой плотности и разнообразии задач. Таким образом, создание алгоритма планирования с эффективным извлечением признаков и стабильным обновлением стратегий стало «узким местом», которое необходимо преодолеть в современных исследованиях.

В исследованиях многодоменного планирования архитектура Transformer применялась для различных задач прогнозирования временных рядов и оптимизации планирования благодаря механизму многоголового самовнимания, который эффективно улавливает долгосрочные временные зависимости27,28. При сочетании с алгоритмом PPO в обучении с подкреплением стратегия обновляется стабильно и эффективно за счет обрезки целевой функции; этот подход продемонстрировал хорошие результаты в таких областях, как управление роботами и интеллектуальное производство29,30,31. В некоторых исследованиях предпринимались попытки интегрировать Transformer с обучением с подкреплением для сложного планирования ресурсов32. Однако при динамическом планировании деятельности профсоюзов мало исследований затрагивают сочетание различных типов деятельности и сложных ресурсных ограничений. В ряде работ использовались графовые нейронные сети для моделирования взаимосвязи между ресурсами и задачами, что позволило повысить точность идентификации конфликтов33,34. Некоторые ученые оптимизировали планирование ресурсов на основе граничных вычислений для повышения эффективности и производительности модели35,36. Тем не менее, такие методы все еще обладают ограниченными возможностями моделирования временного контекста. На основании этого в данной работе предлагается использовать Transformer для кодирования последовательностей исторической деятельности и состояний ресурсов в сочетании с политической сетью PPO, чтобы обеспечить высокую чувствительность к рискам конфликтов и стабильное обновление стратегий планирования для удовлетворения меняющихся и сложных потребностей в планировании деятельности профсоюзов.

В более современных исследованиях оптимизация планирования ресурсов рассматривалась с различных ракурсов, таких как консолидация VM для повышения энергоэффективности в облачных вычислениях37, алгоритмы аутентификации в сотовых сетях38, улучшенная консолидация VM с живой миграцией для устойчивых облачных вычислений39, оптимизация трафика с использованием прогнозирования времени ожидания и эволюционных алгоритмов40, а также облачные хранилища на базе блокчейна с улучшенной оптимизацией и сохранением целостности данных41. Хотя эти работы содержат ценные сведения об алгоритмах распределения и оптимизации ресурсов, они в первую очередь ориентированы на облачную инфраструктуру, телекоммуникации или системы хранения данных и не учитывают специфику ограничений по видам деятельности, динамические конфликты ресурсов между персоналом и площадками, а также требования к планированию в режиме реального времени, характерные для управления деятельностью профсоюзов. Данное различие дополнительно подчеркивает необходимость создания специализированного механизма планирования, адаптированного к организационному контексту деятельности профсоюзов.

Существующие методы планирования деятельности профсоюзов часто не позволяют учитывать долгосрочные пространственно-временные зависимости и поддерживать стабильность стратегии в условиях динамических изменений, что приводит к медленному времени отклика и возникновению многочисленных конфликтов за ресурсы. Чтобы восполнить эти пробелы в исследованиях, в данной работе предлагается модель оптимизации планирования, основанная на принципе, согласно которому многоголовое внимание Transformer может эффективно кодировать исторические последовательности для прогнозирования конфликтов, а оптимизация проксимальной политики (PPO) с ограниченной целевой функцией обеспечивает стабильное и адаптивное обновление стратегии. В частности, Transformer применяется для кодирования последовательностей состояний мероприятий и ресурсов, извлекая ключевые пространственно-временные признаки для улучшения прогнозирования конфликтов, а PPO используется для эффективной генерации действий по планированию и стабильных обновлений. Разработана единая матрица ограничений для сопоставления мероприятий, персонала и помещений, что улучшает распознавание сложных зависимостей. Основные инновации данной работы включают: (1) интеграцию временного кодирования и обучения с подкреплением специально для планирования деятельности профсоюзов; (2) механизм внимания с учетом конфликтов, который приоритизирует восприятие рисков; и (3) обновление с прунингом и коррекцией функции преимущества для обеспечения устойчивости стратегии при высокой степени параллелизма. Обширные эксперименты при различной плотности и сложности задач подтверждают превосходство данной модели над существующими методами по скорости отклика, использованию ресурсов и стабильности, что представляет собой практичное и масштабируемое интеллектуальное решение для управления деятельностью профсоюзов.

Протокол

Рисунок 1 демонстрирует структуру системы планирования совместной деятельности, которая объединяет моделирование временных рядов и обучение с подкреплением. Входной слой интегрирует графики мероприятий, доступность ресурсов и информацию о временных окнах персонала, а затем с помощью модуля графа ограничений формирует многомерную матрицу конфликтов между задачами и ресурсами. Трансформер выполняет кодирование с многоголовым вниманием (multi-head attention) по исторической последовательности состояний действий и ресурсов, создавая скрытые состояния с временными зависимостями. Модуль стратегии использует результаты кодирования для генерации распределений действий и оценки состояния, после чего принимает решения по планированию путем сэмплирования действий. Результаты выполнения передаются обратно в среду, что обновляет статус ресурсов и генерирует мгновенные награды. На этой основе модуль оптимизации выстраивает целевую функцию отсечения (clipping objective function), оценивает функцию преимущества и корректирует оценку сети ценности, чтобы ограничить дрейф стратегии и обеспечить стабильное обновление алгоритмов планирования. Между модулями формируется замкнутый цикл данных для обеспечения высокой чувствительности к конфликтам ресурсов и адаптивного обновления стратегий в динамических средах, что повышает способность к интеллектуальному реагированию и эффективность распределения ресурсов системы планирования совместной деятельности в многозадачных и жестко ограниченных сценариях.

Моделирование сценариев планирования деятельности объединения
Все запросы на осуществление деятельности в системе планирования организованы в виде дискретных последовательностей планирования на основе временных шагов. Каждое мероприятие определяется четким временем начала и окончания, категориями ресурсов, этапами и уровнями приоритета. Статус использования площадки моделируется как двумерная матрица временных слотов, где горизонтальная ось представляет стандартизированную единицу времени, а вертикальная ось — номер пространственного ресурса. Статус ресурса отмечается как «доступен» или «занят», что формирует карту начального распределения ресурсов со статической структурой. Информация о графике работы персонала расширяется в измерении «время-личность» для построения непрерывного вектора временных окон, в каждом из которых фиксируется статус персонала (выполнение задачи или простой) и номер отдела. Вся входная информация интегрируется в трехмерную тензорную структуру, где обозначает дискретный временной шаг, обозначает количество ресурсных единиц, а обозначает соответствующий код атрибута использования ресурса (например, занятость, номер мероприятия, приоритет использования и т. д.). Такая структура позволяет системе планирования считывать конфигурацию ресурсов в любой момент времени, обеспечивая унифицированное представление различных типов статусов ресурсов.

После привязки информации о задаче к модели устанавливается вектор интенсивности задачи на основе приоритета активности и периода использования ресурсов. Комбинации задач, которые могут вызвать конфликт, отмечаются с помощью метода обнаружения перекрытия временных окон. Конфликтные комбинации преобразуются в наборы узлов, а наборы ребер строятся на основе общих типов ресурсов и периодов для явного представления неявных зависимостей. Итоговый построенный граф задач содержит граничную информацию о временной последовательности, перекрытии ресурсов или конфликте ограничений, обеспечивая структурную основу для последующего обнаружения конфликтов и формирования стратегии планирования. Эта структура сохраняет динамическую природу планирования задач и непрерывные изменения статуса ресурсов, а также поддерживает восприятие изменений в ограничениях планирования в режиме реального времени.

Для обнаружения конфликтов в качестве исходных условий для анализа используются разреженные перекрывающиеся области временного и ресурсного измерений в тензорной структуре. Для пар задач с перекрывающимися целями планирования применяется статическое кодирование отношений. Построение графовой структуры G=(V,E,C), где V представляет собой множество активных узлов, E — ребра, созданные на основе ресурсных конфликтов, а C — матрицу кодирования весов конфликтов для ребер. Функция веса конфликта определяется в следующем виде:

Уравнение для ковариационной матрицы; включает суммирование, дельта-функцию, весовой коэффициент; статистический анализ.    (1)

Среди них Cuv — вес конфликта между операциями u и v; u, v — индексы операций; R — общее количество типов ресурсов; δuvr ∈ {0,1} указывает, перекрываются ли временные окна операций u и v на ресурсе r; ωr — вес чувствительности к конфликтам для ресурса r. Данная функция вычисляет взвешенную сумму интенсивностей конфликтов, учитывая различия в значимости ресурсных конфликтов для результатов планирования, при этом сохраняя количественное выражение распределения силы конфликтов.

Приведенная выше структура графа конфликтов преобразуется в матрицу граничных ограничений с помощью представления в виде разреженной матрицы. Каждый элемент матрицы содержит степень конфликта ресурсов. Матрица встроена в процесс принятия решений по планированию для определения возможности параллельного выполнения задач, в то время как логика экранирования действий (action-shielding) реализована в сети стратегий. Для борьбы с периодической агрегацией активности и высокоплотными всплесками задач внедрен механизм динамического обновления, который отслеживает изменения статуса задач и модифицирует содержимое матрицы в режиме реального времени по мере освобождения или добавления ресурсов, обеспечивая непрерывность и согласованность границ планирования на протяжении всего процесса эволюции задач.

Применение данной структуры графа конфликтов позволяет системе планирования визуально моделировать потенциальные «узкие места» ресурсов и паттерны перекрытия задач, что повышает эффективность декуплирующего анализа сложных сценариев ограничений в сети принятия решений. Поведение планировщика больше не опирается на логическое сопоставление на основе правил. Вместо этого система ищет оптимальный путь в пространстве ограничений, что расширяет возможности динамического балансирования локальных ресурсных конфликтов с глобальной картой задач. Система способна поддерживать стабильность планирования и когерентность задач в условиях колебания ресурсов, а также частого добавления или удаления задач.

Рисунок 2 представляет собой схему структуры сети, основанную на весовых отношениях конфликтов задач. Каждый узел на рисунке представляет задачу, подлежащую планированию, а линии между узлами указывают на конфликты в использовании ресурсов. Толщина ребра отражает вес конфликта: чем серьезнее конфликт, тем толще линия. Расчет веса объединяет перекрытие ресурсов и учитывает чувствительность различных ресурсов к конфликтам для формирования совокупной интенсивности конфликта между задачами. Структура графа показывает, что некоторые задачи образуют области с плотными связями, что указывает на значительную конкуренцию за использование ресурсов. Подобный феномен локальной агрегации конфликтов является основным источником узких мест в ресурсах и задержек задач в процессе планирования, что позволяет алгоритму планирования соответственно определять цели приоритизации. Для расположения узлов используется стратегия силового алгоритма (force-directed layout) для автоматической агрегации задач с высоким уровнем конфликта, что позволяет системе планирования идентифицировать ключевые группы задач и оптимизировать распределение стратегий, тем самым повышая общую согласованность планирования и координацию ресурсов.

Кодирование последовательности исторических состояний
На основании построенного графа конфликтов и матрицы ограничений следующим шагом является кодирование исторических последовательностей действий и состояний ресурсов, чтобы временные паттерны, лежащие в основе этих ограничений, могли быть извлечены для последующего принятия решений. Основная информация в сценарии планирования состоит из запросов на выполнение действий, изменений статуса ресурсов и записей об обратной связи по задачам. Эта информация представляет собой несколько гетерогенных временных рядов, соответствующих таким атрибутам, как временные точки событий, идентификаторы использования ресурсов и статус выполнения действий. Для унификации структуры обработки каждый тип входных данных кодируется в виде последовательности векторов равной длины и устанавливается единый временной индекс для обеспечения выравнивания состояний при временной синхронизации. Входной блок в каждый момент времени представляется в виде конкатенации трех наборов векторов признаков: вектор признаков действия определяет тип задачи, приоритет и номер этапа; вектор признаков ресурсов фиксирует текущую занятость ресурсов, оставшуюся мощность и положение доступного окна; вектор признаков обратной связи описывает, было ли выполнение задачи в предыдущий момент времени успешным, а также произошли ли события конфликта ресурсов или задержки.

Все признаки подвергаются линейному преобразованию и отображаются в одно и то же размерное пространство для получения стандартизированной матрицы эмбеддингов X ∈ ℝT×d, где T — количество временных шагов, а d — единая размерность эмбеддинга. Для сохранения временной структуры входная матрица поэлементно складывается с матрицей позиционного кодирования P для формирования входных данных с учетом позиционной информации:

Z = X + P   (2)

Z представляет собой итоговую входную последовательность, которая служит входными данными для последующего механизма внимания. В архитектуре позиционного кодирования используется фиксированный шаблон синусоидальной и косинусоидальной функций, чтобы предотвратить утечку информации из будущего и обеспечить строгое соблюдение причинно-следственных ограничений в процессе кодирования. Описанная выше структура позволяет модели одновременно воспринимать характеристики задачи, состояние ресурсов и временную позицию. Она формирует полноценную основу памяти состояний, предоставляя высокоразрешенную унифицированную структуру для последующего механизма внимания.

Модуль внимания обрабатывает входную последовательность для выявления потенциальных взаимосвязей между несколькими временными шагами. Для раздельной обработки последовательности используются несколько групп голов внимания, что повышает чувствительность модели к различным типам путей эволюции состояний. Каждая голова внимания формирует на основе входной последовательности матрицу запросов Q, матрицу ключей K и матрицу значений V, вычисляет матрицу распределения весов и генерирует взвешенное представление. Выход одноголового внимания определяется следующим образом:

Формула механизма внимания, Attention(Q,K,V)=softmax(QKᵀ/√dₖ)V, используемая в нейронных сетях.   (3)

дк — это количество размерностей признаков на одну головку. В данной формуле QK представляет собой сходство между моментами, √дк используется для численной стабильности, а функция softmax обеспечивает нормализацию весов. Различные головки внимания фокусируются на разных комбинациях временных шагов, и фиксируемые ими динамические зависимости также разнообразны, что помогает выявить скрытые закономерности, такие как предвестники конфликтов задач, паттерны потребления ресурсов и аномальные тенденции обратной связи.

Все выходы голов внимания объединяются и пропускаются через слой линейного преобразования для создания единой кодирующей последовательности, которая служит входным состоянием для сети генерации стратегии планирования. Эта последовательность кодирует траекторию поведения задач, характеристики изменения ресурсов и влияние предыдущих отклонений при выполнении в текущем окне планирования, что эффективно решает проблему высокой исторической зависимости в поведении планирования и разреженного выражения признаков. В выходной слой кодирования включены модули остаточных связей и нормализации слоя для повышения стабильности обучения и возможностей сохранения экспрессии глубокой сети.

Выходная последовательность скрытых состояний не только сохраняет информацию о временной эволюции, но и реагирует на изменения, вызванные внезапными задачами или временным несоответствием ресурсов, демонстрируя высокую адаптивность. Такая структурная схема позволяет избежать явного определения правил, обеспечивает структурированное моделирование динамических сред планирования и помогает последующим модулям принятия решений генерировать варианты расписания с глобальной согласованностью и локальной адаптивностью в многокритериальных условиях.

Генерация стратегии динамического планирования
Закодированные последовательности скрытых состояний, которые объединяют как временные зависимости, так и информацию о конфликтах ресурсов, затем подаются в сеть стратегий для генерации действий по планированию, адаптирующихся к текущей среде. Последовательность скрытых состояний, выводимая модулем кодирования, используется в качестве входных данных для сети стратегии планирования. Набор векторов состояний в каждый момент времени составляет выражение наблюдения за текущей средой, охватывающее эволюцию характеристик задач, тенденции использования ресурсов и траектории исторической обратной связи. Размерность представления состояния и длина временного окна фиксированы, а непрерывность изменений состояния фиксируется с помощью механизма скользящего обновления. Перед отправкой вектора состояния в сеть стратегий он нормализуется и подвергается реорганизации признаков, чтобы входные данные сохраняли стабильное численное распределение в многомерном пространстве, тем самым снижая риск взрыва градиента и колебания сходимости.

Структура сети стратегии использует двухветвевой выходной модуль, где одна ветвь генерирует распределение действий, а другая выводит оценку функции ценности состояния. Пространство действий включает в себя все планируемые задачи и распределяемые ресурсы. Механизм отбора кандидатов отфильтровывает недопустимые или избыточные комбинации операций для формирования ограниченного набора допустимых действий. Ветвь стратегии выводит распределение вероятностей π(at|st), где at представляет действие по планированию на данном шаге по времени, а st — текущее входное состояние. Для выбора действий из распределения в целях фактического планирования используется стандартная стратегия гауссового или softmax-сэмплирования. Другим выходом является оценка функции ценности состояния, которая представляет собой ожидаемое долгосрочное вознаграждение в данном состоянии и используется для оценки и обновления стратегии.

В сети политик скрытый слой применяет функции активации и пакетную нормализацию для повышения нелинейной выразительности и ускорения сходимости сети. В процессе принятия решений приоритет выполнения, стоимость планирования ресурсов и историческая производительность различных задач рассматриваются как факторы внимания и применяются к механизму выбора действий через специальную весовую матрицу для формирования адаптивно регулируемой структуры вывода политики. Такая архитектура позволяет избежать зависимости от фиксированных правил, тем самым повышая гибкость стратегии при возникновении внезапных конфликтов и структурных «узких мест».

Стратегия планирования использует механизм случайной выборки для генерации фактической последовательности действий. В каждом цикле планирования из текущего распределения действий выбирается исполняемое действие, после чего обновляются статус ресурсов и метка узла задачи. После выполнения действия система рассчитывает мгновенное вознаграждение обратной связи на основе изменений ресурсов и результатов выполнения задачи, чтобы оценить влияние данного раунда планирования на общую цель. Дизайн вознаграждения учитывает несколько измерений, включая скорость завершения задач, эффективность использования ресурсов и степень подавления конфликтов. С помощью комплексных показателей обеспечивается обратная связь с модулем обновления стратегии.

Весь процесс планирования представляет собой построение цепи марковских решений и использует метод эмпирического сэмплирования траекторий для записи последовательности состояние-действие-награда, обозначаемой как (st, at, rt, st+1). Оптимизация стратегии основана на построении функции преимущества, где оценка преимущества определяется в следующем виде:

Формула обучения с подкреплением, At = rt + γV(st+1) - V(st), математическая концепция.    (4)

At представляет собой значение преимущества, rt — текущее мгновенное вознаграждение, γ — коэффициент дисконтирования вознаграждения, а V(st) и V(st+1) — значения функции состояния в текущем и следующем состояниях соответственно. Функция преимущества отражает степень превосходства текущего действия по сравнению со средним показателем эффективности стратегии. Она используется для последующего улучшения стратегии. Если At > 0, это означает, что текущее действие лучше среднего ожидаемого результата, и вероятность его выбора должна быть увеличена; в противном случае тенденция к его выбору должна быть снижена.

В процессе обновления стратегии, чтобы избежать осцилляций, вызванных избыточной амплитудой обновлений, применяется механизм усечения целевого распределения для ограничения диапазона изменений между новой и старой стратегиями, что обеспечивает непрерывность и стабильность выходных данных сети. Между распределением действий и обратной связью по вознаграждению устанавливается тесная связь, позволяющая стратегии мгновенно реагировать на изменения в сложных ограничениях. Данный механизм поддерживает стабильность принятия решений и рациональное распределение ресурсов в ситуациях с частой сменой задач или внезапным несоответствием ресурсов, эффективно предотвращая такие проблемы, как дублирующее распределение, перегрузка ресурсов или заторы в очереди задач. Система планирования способна поддерживать оптимальное рабочее состояние при различной плотности задач и дефиците ресурсов, демонстрируя высокую адаптивность.

Итерация стратегии и механизм стабильного обновления
Для того чтобы созданные стратегии планирования оставались стабильными и их эффективность не снижалась в ходе многократных раундов обучения, в данном подразделе представлен механизм итеративного обновления с применением клиппирования и коррекции преимущества. Устанавливается интервал обновления усечения между старой и новой стратегиями, а функция цели клиппирования используется для ограничения дрейфа стратегии с целью предотвращения шока планирования в процессе обновления стратегии. Сеть оценки корректируется в сочетании с функцией преимущества для повышения точности долгосрочного планирования.

Распределение вероятностей выходных действий сети стратегии склонно к резким колебаниям в ходе итераций непрерывного планирования, что может привести к нестабильному поведению или нарушению распределения ресурсов. Чтобы смягчить эффект «планировочного шока», вызванного дрейфом стратегии, разработан усеченный интервал обновления для контроля диапазона изменений между новой и старой стратегиями, а также введен ограничивающий член для уточнения целевой функции. Вероятность исторической стратегии фиксируется в раунде выборки, после чего на основе текущей вероятности стратегии формируется коэффициент отношения. Целевая функция обновления стратегии определяется следующим образом:

Уравнение оптимизации, формула, иллюстрация статического равновесия, использование в образовательных исследованиях.    (5)

Здесь gt = πθ(at|st)/πθold(at|st) обозначает отношение вероятностей между новой и старой стратегиями; ε — порог отсечения, ограничивающий диапазон обновления стратегии. Если отношение превышает этот порог, вместо него используется значение отсечения, чтобы предотвратить возникновение избыточных градиентов из-за экстремальных выборок, обеспечивая тем самым корректировку параметров сети в пределах заданного диапазона. Такая структура динамически ограничивает диапазон изменений выходной стратегии для каждого раунда планирования, поддерживая плавность и согласованность выходных данных стратегии при плотном распределении задач и значительно снижая уровень осцилляции поведения планировщика.

Целевая функция стратегии дополняется членами регуляризации и вознаграждения за энтропию в процессе обновления для повышения разнообразия распределения действий и предотвращения преждевременной сходимости. Каждый раунд обновлений стратегии использует несколько пакетов выборок траекторий опыта для циклического обучения, что позволяет поддерживать широту охвата пространства состояний. При сравнении распределения вероятностей выходной последовательности действий до и после обновления рассчитывается степень отклонения распределения, а жесткий порог отсекает недопустимый диапазон возмущений стратегии. Этот механизм обеспечивает граничный контроль при переносе стратегий планирования между циклами, подавляя тем самым переобучение, вызванное резкими изменениями состояния ресурсов.

Обновление стратегии опирается на оценку состояния, предоставляемую функцией ценности. Отклонения в оценке ценности состояния могут напрямую влиять на правильность функции преимущества, тем самым изменяя направление итерации стратегии. Для повышения точности оценки разработан механизм обратного распространения по нескольким временным рядам, при котором для корректировки текущей ценности состояния используется дисконтированная кумулятивная ценность будущих вознаграждений. Для вознаграждения при обратном распространении используется структура обобщенного оценивания преимущества (Generalized Advantage Estimation, GAE), которая определяется следующим образом:

Уравнение функции ценности для обучения с подкреплением, Σγ^t(r+γV(s'))-V(s), анализ формулы. (6)

Ât — скорректированное значение преимущества; λ — коэффициент баланса обратного распространения; rt+l представляет собой мгновенное вознаграждение на (t+l-м) шаге; V(st+l) — значение состояния, выводимое оценочной сетью. Данная структура объединяет краткосрочную мгновенную обратную связь и долгосрочные ожидания состояния для коррекции отклонений в предсказаниях отклика стратегии при будущих конфликтах ресурсов, пиковых нагрузках и накоплении задач. λ регулирует глубину обратного распространения и автоматически настраивается в периоды резких колебаний динамики ресурсов для повышения устойчивости отклика оценочной сети к внезапным событиям.

Многомасштабная зависящая от времени структура, встроенная в функцию преимущества, позволяет оценочной сети моделировать долгосрочные тенденции ресурсов. Для обнаружения отклонения выходных данных стратегии используется индекс согласованности поведения стратегии, который позволяет оценить, не проявляет ли сеть чрезмерную реакцию на ошибку оценки. Остаточные члены разности обратной связи контролируют поведение обновления стратегии, при этом целевой показатель обучения и амплитуда обновления весов функции ценности динамически корректируются. Сеть ценности и сеть стратегии оптимизируются совместно, чтобы оценка ценности не отклонялась от цели завершения задачи, предотвращая при этом ошибочное определение статуса ресурсного конфликта при высокочастотном планировании.

Данный механизм стабильного обновления политики позволяет эффективно поддерживать управляемость и согласованность обновлений поведения политики в высокоразмерной динамической среде задач, повышая эффективность охвата задач и гибкость использования ресурсов, а также формируя непрерывно итерируемую структуру интеллектуального планирования. Поведение планирования предотвращает попадание в локальный оптимум при долгосрочной эволюции и повышает общую адаптивность к изменениям паттернов задач и колебаниям циклов ресурсов.

Рисунок 3A демонстрирует тенденцию изменения значения целевой функции в зависимости от количества итераций обучения при различных условиях порога отсечения. Горизонтальная ось представляет количество итераций обучения, а вертикальная — числовое значение ограниченной целевой функции. ε установлено на уровнях 0.1, 0.2 и 0.3, что соответствует различным степеням интенсивности контроля дрейфа стратегии. Кривая, соответствующая меньшему значению ε, характеризуется меньшими колебаниями, и целевая функция остается стабильной. При ε = 0.1 общее значение целевой функции находится в диапазоне от 0.8 до 1, что свидетельствует о постепенности и стабильности обновления стратегии. Однако большее значение ε приводит к выраженным колебаниям. При ε = 0.3 общее значение целевой функции находится в пределах от 0.65 до 0.95, а кривая целевой функции демонстрирует большую амплитуду осцилляции, что отражает риск серьезного отклонения в процессе обновления стратегии. Чем меньше порог, тем стабильнее стратегия, что подходит для сред планирования с жесткими ограничениями. Рисунок 3B показывает изменения обобщенной оценки преимущества (generalized advantage estimate) при различных коэффициентах балансировки обратного хода. λ установлено на значения 0.8, 0.9 и 1.0 соответственно для управления глубиной обратного хода будущих вознаграждений. Кривая показывает, что чем выше λ, тем меньше колебания GAE, тем более плавным является долгосрочный тренд и тем точнее фиксируется потенциальное влияние поведения планирования через несколько шагов. Кривая при λ = 0.8 демонстрирует выраженные периодические колебания, что указывает на ее большую чувствительность к мгновенным вознаграждениям и лучшую пригодность для краткосрочных внезапных задач. Напротив, λ = 1.0 больше ориентировано на моделирование долгосрочных тенденций и подходит для сценариев с периодическими задачами.

Анализ вычислительной сложности и масштабируемости
Вычислительная сложность предлагаемой архитектуры Transformer-PPO определяется двумя основными компонентами: энкодером Transformer и оптимизацией стратегии PPO.

Для энкодера Transformer с L слоями, H голов вниманием, размерностью эмбеддинга d и длиной входной последовательности T (историческим временным окном) временная сложность одного прямого прохода составляет O(L·T2·d + L·T·d2), где член T2 обусловлен механизмом самовнимания. В данной реализации L = 3, H = 4, d = 128, а T зафиксировано на уровне 100 временных шагов, что обеспечивает приемлемые вычислительные затраты. При увеличении исторических окон квадратичный член T2 становится доминирующим фактором; однако на практике планирование деятельности профсоюзов обычно предполагает ограниченные исторические горизонты (например, скользящие окна за один квартал или один год), а разрешение временного шага может быть скорректировано для баланса между точностью и эффективностью.

Для компонента PPO сеть стратегий и сеть ценности представляют собой облегченные многослойные перцептроны MLP (256 и 128 нейронов в скрытом слое), сложность вывода которых составляет O(d·m), где m — количество скрытых блоков, что ничтожно мало по сравнению с энкодером Transformer. Обновление стратегии в процессе обучения включает несколько эпох градиентных обновлений мини-батчей со сложностью O(B·E·d2), где B — размер батча, а E — количество эпох обновления.

С точки зрения масштабируемости, данная архитектура обладает тремя преимущественными свойствами. Во-первых, механизм внимания может быть распараллелен по временным шагам, что обеспечивает эффективное ускорение с помощью GPU. Во-вторых, размер модели не зависит от количества действий или ресурсов, поскольку матрица ограничений конструируется динамически для каждого шага планирования, а не встроена в виде фиксированных параметров. Это позволяет развертывать одну и ту же обученную модель в объединениях разного масштаба без необходимости повторного обучения. В-третьих, для сценариев с чрезвычайно большим масштабом можно сократить длину окна истории T и размерность эмбеддинга d в качестве компромисса, либо использовать вариант с разреженным вниманием для снижения сложности с O(T2) до O(T log T) или O(T).

Результаты

Экспериментальные данные
Для всесторонней оценки эффективности представленного в данной работе алгоритма динамического планирования Transformer-PPO в качестве эталонного набора данных используются данные по управлению мероприятиями крупного профсоюза предприятия за последние три года. Этот набор данных содержит более 5 000 записей о мероприятиях различных типов, включая собрания, тренинги и развлекательные мероприятия, с информацией о планировании нескольких ресурсов, таких как помещения, оборудование и персонал. В каждой записи подробно указаны время начала и окончания мероприятия, требования к ресурсам, приоритет и фактический статус исполнения (включая события конфликтов и использование ресурсов). Для имитации динамических изменений в реальных сценариях данные были дополнены дополнительными 10% случайных всплесков задач и событий изменения ресурсов (таких как временный захват площадки и корректировка временных окон персонала) для проверки устойчивости алгоритма в условиях высокой неопределенности. Последовательность непрерывных состояний обеспечивает структурированный ввод для временного моделирования Transformer и обучения стратегии PPO. В ходе эксперимента сравнивались показатели планирования при различной плотности и сложности задач, чтобы обеспечить охват типичных сценариев реального применения; также проводилось сравнение с популярной в настоящее время моделью LSTM-PPO, моделью планирования с жадным поиском и моделью планирования на основе стратегии DQN.

Кодировщик Transformer состоит из 3 слоев, каждый из которых имеет 4 головки внимания, размерность эмбеддинга 128 и размер скрытого слоя сети прямого распространения 256. Сеть стратегии (policy network) и сеть ценности (value network) используют один и тот же выход Transformer в качестве входных данных, после чего разделяются на два отдельных многослойных перцептрона (MLP). Каждый MLP имеет два скрытых слоя с 256 и 128 нейронами соответственно с использованием функции активации ReLU. Все линейные слои инициализированы с помощью равномерной инициализации Ксавье (Xavier uniform initialization).

В качестве оптимизатора используется Adam со скоростью обучения 3 × 10-4, размером пакета 64 и коэффициентом энтропии 0,01. Параметр отсечения PPO ε установлен на уровне 0,2, коэффициент дисконтирования γ = 0,99, а λ GAE = 0,95. Обучение модели проводится в течение 5 000 эпизодов, при этом каждый эпизод содержит до 100 шагов планирования. Для предотвращения взрыва градиента применяется отсечение градиента с максимальной нормой 0,5. Данные параметры были подобраны с помощью предварительного поиска по сетке и соответствуют общепринятой практике в задачах планирования на основе обучения с подкреплением. Все эксперименты выполняются на одном графическом ускорителе GPU (память 40 GB) с использованием Python 3.9 и фреймворка для глубокого обучения (см. Таблицу материалов).

Временная тенденция выходных данных многоголового внимания, остаточное усиление при временной вариации признаков кодирования и стратификация приоритетов задач
Используя фактическую историю планирования в качестве входных данных, запросы задач, статус использования ресурсов и статус обратной связи по исполнению извлекаются на непрерывных временных шагах, а информация различных типов встраивается в единое пространство признаков с помощью линейного отображения и позиционного кодирования. Механизм многоголового внимания параллельно вычисляет временные корреляции между различными последовательностями признаков и формирует три типа последовательностей весов внимания: для задач, ресурсов и обратной связи. Каждый тип весов отражает интенсивность внимания модели к соответствующему состоянию на каждом временном шаге. После нормализации строится кривая тенденции, отражающая фокус восприятия слоя кодирования и структуру динамических изменений различных информационных измерений в истории планирования. Этот процесс выполняется на основе фактической траектории выполнения действий и журнала использования ресурсов в сценарии планирования.

Рисунок 4 демонстрирует динамику внимания механизма многоголового внимания (multi-head attention) к различным информационным состояниям при планировании совместной деятельности. По горизонтальной оси отложен временной шаг, отражающий непрерывное продвижение последовательности планирования, а по вертикальной оси — нормализованный вес внимания в диапазоне [0,1], который представляет относительную значимость характеристик задач, состояния ресурсов и статуса обратной связи для модели. Внимание к характеристикам задач имеет четко выраженный пик примерно на 15-м шаге. На раннем этапе планирования модель в приоритетном порядке фиксирует временные характеристики ключевых задач для прогнозирования потенциальных конфликтов и узких мест в ресурсах, что отражает чувствительность к рискам на данном этапе планирования деятельности. Кривая внимания к состоянию ресурсов демонстрирует периодические колебания, при этом общий вес внимания варьируется от 0,2 до 0,8, что отражает непрерывное отслеживание системой планирования изменений в занятости ресурсов, поддержку сложной обработки совместного использования и распределения ресурсов, а также эффективное реагирование на динамическую конкуренцию за ресурсы между несколькими параллельными задачами. Внимание к статусу обратной связи постепенно возрастает, и пик веса наблюдается в районе 35-го шага, что подчеркивает значимость обратной связи по результатам выполнения и аномальным условиям на средних и поздних этапах планирования; это помогает корректировать стратегию для устранения отклонений в расписании и повышать общую робастность планирования. Данная тенденция показывает, что структура кодирования, интегрирующая механизм многоголового внимания, способна фиксировать тонкие изменения временных признаков и повышать адаптивность стратегий планирования к различным ресурсам и сложным зависимостям между задачами, тем самым повышая общую эффективность и стабильность динамического планирования совместной деятельности.

Выполняется обработка последовательности кодирования скрытого состояния и структуры отклика признаков задачи. Часть сравнения состояний выстраивает пути распространения признаков до и после остаточной связи при одном и том же условии ввода, отслеживает временную эволюцию скрытого состояния на последовательных временных шагах и извлекает признаки его локальной стабильности и глобальной непрерывности для анализа плавности эволюции выражения состояния в процессе передачи информации. Тенденция отклика с приоритетом задачи извлекается из пути активации признаков при различных стратегиях весовых коэффициентов планирования. Путем отслеживания уровней активации различных категорий задач во времени фиксируется эффект динамической настройки модели в отношении способности к дифференциации задач.

Рисунок 5A показывает динамику скрытого состояния модели до и после применения механизма остаточных связей. Горизонтальная ось представляет собой временной шаг, а вертикальная — значение скрытого состояния. Исходный выход без остаточной связи характеризуется сильными колебаниями, выраженной локальной нестабильностью и разрывами тренда. Синяя сплошная линия представляет значение состояния после применения остаточной структуры. Общий тренд остается стабильным, а колебания значительно снижаются, что указывает на достижение моделью эффекта буферизации градиента и усиления признаков в процессе распространения состояния. Данное явление подтверждает роль остаточного механизма в повышении стабильности структур с долгосрочными зависимостями, эффективно подавляя затухание информации, вызванное увеличением глубины слоев, и расширяя возможности непрерывного представления последовательностей исторических состояний. На рисунке 5B представлена динамика активации признаков для трех типов задач во временном ряду. Горизонтальная ось — временной шаг, вертикальная ось — значение активации признака, что отражает временную чувствительность и стратегическое внимание к задачам с разным уровнем приоритета. Задачи с низким приоритетом демонстрируют тенденцию к затуханию, при этом значение активации признака на поздних этапах падает ниже 0.5, что указывает на то, что модель уделяет им должное внимание на ранних стадиях планирования, и со временем постепенно ослабляет ресурсный отклик; характеристики задач со средним приоритетом медленно растут со временем с периодическими осцилляциями, что отражает гибкое восприятие и отслеживание моделью колебаний их спроса; задачи с высоким приоритетом сохраняют непрерывную тенденцию к росту, при этом значение активации признака всегда остается выше 2 с высоким и стабильным уровнем активации, что свидетельствует о неизменно высокой степени оперативности модели по отношению к таким задачам. Этот дифференцированный отклик демонстрирует способность модуля кодирования состояний точно определять атрибуты задач и обеспечивает иерархическую основу для принятия решений при генерации стратегии планирования.

Многомерный анализ эволюции производительности алгоритма динамического планирования Transformer-PPO
На основе кодирования Transformer исторических последовательностей планирования и состояния ресурсов извлекаются пространственно-временные признаки в качестве входных данных состояния PPO; затем сеть стратегий выдает действие по планированию, а среда возвращает мгновенные вознаграждения и обновляет статус; в процессе обучения записываются исходные показатели каждого раунда, после чего шум устраняется с помощью фильтрации скользящим средним и анализируется тенденция сходимости алгоритма; при финальной визуализации исходные данные демонстрируют мгновенную динамику, а сглаженная кривая отражает долгосрочное улучшение производительности, подтверждая, что модель достигает стабильного планирования за счет моделирования временных рядов и оптимизации стратегии.

Рисунок 6A,B демонстрирует многомерный анализ эволюции производительности алгоритма динамического планирования Transformer-PPO. Колебания исходных данных отражают мгновенный шум в процессе планирования, в то время как сглаженные данные позволяют выделить долгосрочный тренд с помощью скользящего среднего, что устраняет влияние краткосрочных помех на оценку производительности алгоритма и облегчает наблюдение за эволюцией показателей. Анализ сглаженных данных показывает, что динамическая связь между вознаграждением и энтропией стратегии характеризуется логарифмическим ростом кривой вознаграждения, что свидетельствует о том, что стратегия быстро обучается эффективно планировать действия посредством исследования; на более поздних этапах рост замедляется, и значение насыщения вознаграждения стабилизируется на уровне около 12, что указывает на приближение стратегии к локальному оптимуму. Энтропия стратегии постепенно снижается с примерно 2,2 в начале до примерно 0,6. PPO сохраняет необходимую способность к исследованию за счет компонента вознаграждения за энтропию. Высокий уровень исследования (высокая энтропия) на раннем этапе способствует быстрому росту вознаграждений, в то время как на более поздних стадиях стратегия балансирует между исследованием и использованием ресурсов посредством прунинга и обновления. Скоординированная оптимизация коэффициента конфликтов и использования ресурсов показывает, что коэффициент конфликтов падает до уровня ниже 10%, а его нижний предел отражает конфликты, которые невозможно устранить в реальной системе из-за случайности задач. Эта тенденция к снижению напрямую связана со способностью Transformer кодировать исторические последовательности активности, что позволяет модели проактивно предсказывать конкуренцию за ресурсы. Использование ресурсов увеличилось почти до 75%, что соответствует закону убывающей предельной отдачи. Тот факт, что степень использования не достигла более высокого уровня, является обоснованным, так как чрезмерная загрузка может вызвать задержки в очередях. Сокращение числа конфликтов высвободило больше доступных ресурсов, а оптимизированное распределение ресурсов еще больше подавило возникновение конфликтов.

Оценка скорости отклика и эффективности принятия решений
Сравнение среднего времени принятия решения и средней задержки отклика при различной плотности задач (количество задач: 100, 300, 500, 700, 1000). Сравнение модели планирования Transformer-PPO, представленной в данной работе, с моделью LSTM-PPO, моделью планирования с жадным поиском и моделью планирования на основе стратегии DQN.

Рисунок 7A,B демонстрирует среднее время принятия решения и среднюю задержку отклика для четырех стратегий планирования при различных условиях плотности задач, что отражает способность алгоритма принимать решения в режиме реального времени и скорость отклика системы в сценариях с высокой нагрузкой. С увеличением количества задач для каждой стратегии наблюдается тенденция к росту обоих показателей, однако темпы этого роста и стабильность различаются. В сценариях с высокой интенсивностью задач структура Transformer-PPO сохраняет относительно стабильные показатели среднего времени принятия решения. При плотности задач 1000 среднее время принятия решения составляет 0.72s, а средняя задержка отклика — 1.59s, что обусловлено главным образом эффектом сжатия пространства состояний за счет кодирования временных признаков и эффективным исключением недопустимых операций в пространстве действий. Напротив, стратегия DQN демонстрирует увеличение времени принятия решений и задержек отклика по мере роста числа задач, что отражает ее ограниченную способность к обобщению политик при многомерных переходах между состояниями. Хотя стратегия Greedy принимает решения быстрее при любом количестве задач, ее эффективность отклика снижается на сложных графах задач из-за отсутствия моделирования долгосрочных зависимостей. LSTM-PPO обладает определенной способностью к восприятию времени при моделировании последовательностей, но показывает плохие результаты в сценариях с долгосрочными зависимостями из-за ограниченной глубины структуры. Результаты выявляют ключевое влияние архитектурного проектирования на скорость отклика системы планирования и подчеркивают необходимость скоординированной оптимизации механизма кодирования и эффективности выборки политик в условиях высокой конкурентности.

Оценка частоты конфликтов и использования ресурсов
При различных условиях сложности типов деятельности (одиночный тип, независимые несколько типов, перекрестные несколько типов, многоэтапный рабочий процесс, межведомственное взаимодействие, временная вставка, повторяющийся цикл) проводится статистический анализ частоты конфликтов ресурсов и среднего коэффициента использования ресурсов. Модель планирования Transformer-PPO, представленная в данной работе, сравнивается с моделями планирования LSTM-PPO, жадным поиском и DQN.

Рисунок 8A,B демонстрирует интенсивность конфликтов за ресурсы и средний коэффициент использования ресурсов для различных моделей планирования на семи уровнях сложности деятельности. Вертикальная ось представляет модель планирования, а горизонтальная — тип деятельности. Общая тенденция показывает, что по мере увеличения сложности структуры деятельности (например, многоэтапные процессы, межведомственное взаимодействие, временные вставки и повторяющиеся циклы) интенсивность конфликтов во всех моделях возрастает. Жадная стратегия (greedy strategy) и схема DQN демонстрируют ограниченную адаптивность к динамическим изменениям и явно недостаточный контроль конфликтов. Модель Transformer-PPO сохраняет низкую интенсивность конфликтов в условиях высокой сложности с общим показателем 0,05–0,12, что отражает ее глубокое понимание структуры зависимостей задач и изменений ресурсов. Что касается использования ресурсов, Transformer-PPO поддерживает высокий уровень при всех условиях, особенно при перекрестном взаимодействии нескольких типов и временных вставках. Ее стратегия динамической регулировки эффективно сокращает простои ресурсов, обеспечивая средний коэффициент использования ресурсов на уровне 0,75–0,86. Данные подтверждают, что модель Transformer-PPO обеспечивает лучший баланс между гибкостью планирования и эффективностью использования ресурсов, обладая большей практичностью и масштабируемостью.

Стабильность планирования
Индекс стабильности планирования рассчитывается при различных условиях сложности типов деятельности (одиночный тип, несколько независимых типов, несколько перекрестных типов, многостадийный процесс, межведомственное взаимодействие, временная вставка и повторяющийся цикл). Модель планирования Transformer-PPO, представленная в данной работе, сравнивается с моделями планирования LSTM-PPO, жадным поиском и DQN.

Таблица 1 представляет результаты сравнения индекса стабильности планирования для различных моделей планирования при семи условиях сложности типов деятельности. Выбранный тип сложности отражает эффективность стабильности системы планирования в нескольких сценариях. Значение индекса варьируется от 0 до 1. Чем выше значение, тем выше устойчивость модели к нарушениям планирования и тем стабильнее результат стратегии. Экспериментальные результаты показывают, что Transformer-PPO сохраняет высокий индекс стабильности при всех структурах задач. В частности, в сценариях с многотипным, межведомственным взаимодействием и повторяющимися циклами стабильность его стратегии планирования выше, чем у других моделей, что демонстрирует высокую способность к сохранению структуры и адаптивному планированию. Общий индекс стабильности планирования составляет от 0.8 до 0.91. Напротив, стабильность жадного алгоритма и DQN значительно снижалась по мере усложнения структуры задач, что сопровождалось явным джиттером стратегии и отклонениями при исполнении. LSTM-PPO демонстрирует некоторую стабильность, но его общая эффективность остается ниже, чем у Transformer-PPO. Данное сравнение подтверждает положительный вклад механизма многоголового внимания (multi-head attention) и механизма обновления с прунингом стратегии в стабильность результатов планирования, подчеркивая преимущество модели в плане стабильности в сценариях со сложной совместной деятельностью.

Анализ адаптации к нагрузке при параллельном выполнении задач
По мере дальнейшего увеличения количества параллельных задач система планирования должна решать две сопутствующие проблемы: конфликты распределения ресурсов и снижение обобщающей способности стратегии. Чтобы протестировать адаптивность планирования различных моделей при расширении нагрузки задач, в данном разделе установлены три уровня параллелизма задач (низкий: 100 элементов, средний: 500 элементов и высокий: 1000 элементов) для мониторинга распределения системных ресурсов и согласованности отклика стратегии в течение цикла планирования. Для отражения баланса нагрузки различных ресурсных единиц в процессе планирования используется индекс балансировки ресурсов, который рассчитывается следующим образом:

Формула статического равновесия, уравнение Br, символьный математический анализ.    (7)

ui представляет собой фактический коэффициент использования единиц ресурса; ū представляет собой средний коэффициент использования всех ресурсов; а N представляет собой общее количество ресурсов. Диапазон значений составляет [0,1], и чем ближе значение к 1, тем более сбалансированным является распределение ресурсов.

Индекс устойчивости переноса стратегии Rs измеряет степень согласованности результатов выполнения стратегии при различных условиях нагрузки задач и определяется следующим образом:

Формула статического равновесия: Rs=1−(1/T)ΣTt=1 ||πt(L)−πt(H)||1/2, диаграмма математического анализа.    (8)

πt(L) и πt(H) — это распределения стратегий планирования при сценариях с низкой и высокой нагрузкой соответственно, а T — общий временной шаг. Чем ближе это значение к 1, тем выше робастность миграции стратегии и ее адаптивность.

В таблице 2 систематически представлены показатели эффективности четырех моделей планирования с точки зрения балансировки ресурсов и робастности переноса стратегий при различных уровнях параллелизма задач. Уровни параллелизма задач установлены как низкий (100 элементов), средний (500 элементов) и высокий (1000 элементов) соответственно, что отражает адаптивность планирования модели при разном масштабе нагрузки задач. Результаты показывают, что модель Transformer-PPO достигает наивысшего индекса балансировки ресурсов на всех уровнях нагрузки, что свидетельствует о ее способности рационально распределять ресурсы в сценариях параллельного выполнения нескольких задач. В то же время индекс робастности переноса стратегий также значительно выше, чем у сравниваемых моделей, что демонстрирует высокую согласованность и адаптивность стратегий. В условиях высокого параллелизма индекс балансировки ресурсов и индекс робастности переноса стратегий составляют 0.88 и 0.85 соответственно. Для сравнения, LSTM-PPO показала второй по величине результат, в то время как алгоритм Greedy и модель DQN продемонстрировали значительное снижение эффективности при высокой нагрузке, при этом более выраженными оказались неравномерное распределение ресурсов и усиление колебаний стратегий. Данная оценка четко выявила различия в управлении ресурсами и робастности стратегий в системе планирования при расширении нагрузки задач и дополнительно подтвердила применимость и превосходство комбинированного решения Transformer-PPO для динамического и сложного планирования совместной деятельности.

Сравнение с дополнительными современными методами
Для дальнейшего сопоставления предлагаемого метода с современными (SOTA) подходами для решения задач планирования были реализованы три репрезентативных алгоритма из последних публикаций, сочетающих глубокое обучение с обучением с подкреплением: (1) Transformer+DQN42, в котором используется тот же кодировщик Transformer, что и в нашем методе, но PPO заменен на DQN для обучения стратегии, как это исследовалось в последних работах по планированию на основе функций ценности; (2) GRU+PPO43, где кодировщик Transformer заменен на управляемый рекуррентный блок (GRU) для фиксации временных зависимостей, что представляет передовые методы на базе RNN; и (3) GraphSAGE+PPO44, использующий кодировщик GraphSAGE для моделирования отношений между задачами и ресурсами в виде графов, что отражает современные подходы с применением графовых нейронных сетей для планирования. Все методы обучались в идентичных экспериментальных условиях (один и тот же набор данных, плотность задач 1000 и настройки эпизодов), а гиперпараметры были оптимизированы с помощью поиска по сетке для обеспечения объективности сравнения. Каждый метод оценивался в течение 10 независимых запусков, и фиксировались средние значения ключевых показателей эффективности (задержка отклика, частота конфликтов ресурсов, использование ресурсов и индекс стабильности планирования).

Как показано в Таблице 3, предложенный метод Transformer+PPO последовательно превосходит все три базовых SOTA-решения по всем оцениваемым показателям. Средняя задержка отклика предложенного метода (1.59s) значительно ниже, чем у Transformer+DQN (2.13s), GRU+PPO (1.89s) и GraphSAGE+PPO (1.72s), что указывает на более высокую эффективность принятия решений. Коэффициент конфликтов ресурсов у предложенного метода (0.09) также является самым низким, что свидетельствует о более эффективном упреждающем предотвращении конфликтов. Это улучшение обусловлено механизмом многоголового внимания Transformer, который захватывает долгосрочные зависимости эффективнее, чем GRU или GraphSAGE, в сочетании со стабильными обновлениями стратегии PPO. С точки зрения использования ресурсов предложенный метод достигает показателя 0.82, что как минимум на 8 процентных пунктов выше результатов других методов и демонстрирует более эффективное распределение ресурсов. Индекс стабильности предложенного метода (0.88) также является самым высоким, что подтверждает, что целевая функция обрезания (clipping objective) и коррекция GAE в PPO обеспечивают более робастные стратегии планирования, чем DQN или другие варианты PPO. В целом, результаты подтверждают, что конкретное сочетание Transformer и PPO в предложенном фреймворке дает явные преимущества по сравнению с современными альтернативными архитектурами, что дополнительно обосновывает возможность его применения при динамическом планировании деятельности объединений.

ЗАЯВЛЕНИЕ О ДОСТУПНОСТИ ДАННЫХ:
Анонимизированный набор данных, использованный в данном исследовании, вместе с конвейером предобработки данных и скриптами оценки, был помещен в репозиторий Figshare и доступен по адресу https://doi.org/10.6084/m9.figshare.33059243 (DOI: 10.6084/m9.figshare.33059243). Набор данных содержит графики активности, журналы использования ресурсов и записи о конфликтных событиях крупного профсоюза предприятия, при этом вся персонально идентифицируемая и коммерчески конфиденциальная информация была удалена.

Схема рабочего процесса машинного обучения, демонстрирующая сопоставление задач, петли обратной связи и оптимизацию стратегии.
Рисунок 1: Структура системы планирования деятельности объединения. Запросы на выполнение работ, доступность ресурсов и информация о временных окнах персонала интегрируются для построения графа ограничений «задача–ресурс» и матрицы конфликтов. Последовательности действий и состояний ресурсов из истории кодируются с помощью Transformer с многоголовым вниманием (multi-head attention). Закодированные состояния подаются на сети стратегии и ценности проксимальной оптимизации стратегии (PPO), которые генерируют вероятности действий по планированию и оценки ценности состояния. Выбранные действия обновляют среду планирования и генерируют вознаграждения. Затем отсекаемая целевая функция PPO и обобщенная оценка преимущества используются для обновления модели, формируя замкнутую петлю обратной связи для адаптивного планирования и распределения ресурсов. Пожалуйста, нажмите здесь, чтобы просмотреть увеличенную версию этого рисунка.

Диаграмма топологии сети, где узлы связаны задачами, иллюстрирующая структуру взаимосвязанной системы.
Рисунок 2: Сеть весов конфликтов задач (толщина ребер отражает степень серьезности конфликта). Каждый узел представляет собой деятельность, ожидающую планирования, а каждое ребро — конфликт, вызванный одновременным использованием персонала, помещений, оборудования или других ресурсов. Толщина ребер пропорциональна рассчитанному весу конфликта, при этом более толстые ребра указывают на более серьезные конфликты. Плотно связанные группы узлов представляют собой потенциальные «узкие места» ресурсов и кластеры конкурирующих задач. Для размещения сильно конфликтующих задач ближе друг к другу используется алгоритм Force-directed layout. Пожалуйста, нажмите здесь, чтобы просмотреть увеличенную версию этого рисунка.

Графики обучения с подкреплением: clipped policy objective, оценки GAE; анализ итераций обучения.
Рисунок 3: Динамические характеристики стабильности стратегии и оценки преимущества в процессе итераций оптимизации расписания. (A) Clipped Policy Objective при различных значениях ε. (B) Колебания GAE при различных настройках λ. Нажмите здесь, чтобы просмотреть увеличенную версию этого рисунка.

График зависимости веса внимания от временного шага; сравнение состояний задачи, ресурса и обратной связи; нормированные значения.
Рисунок 4: Временная тенденция выходных данных многоголового внимания Пожалуйста, нажмите здесь, чтобы просмотреть увеличенную версию этого рисунка.

Динамика скрытых состояний, сравнение активации признаков, графики временных шагов, анализ остаточных связей.
Рисунок 5: Остаточное усиление и стратификация приоритетов задач при временной вариации признаков кодирования. (A) Сравнение скрытых состояний до и после остаточной связи. (B) Временная активация признаков для различных приоритетов задач. Пожалуйста, нажмите здесь, чтобы просмотреть увеличенную версию этого рисунка.

Графики вознаграждения и энтропии стратегии; частота конфликтов и использование ресурсов по эпохам обучения.
Рисунок 6: Многомерный анализ эволюции производительности. (A) Вознаграждение и энтропия стратегии (B) Частота конфликтов и использование ресурсов. Пожалуйста, нажмите здесь, чтобы просмотреть этот рисунок в более крупном размере.

Графики, сравнивающие время принятия решения и задержку ответа в зависимости от объема задач для алгоритмов: Transformer-PPO, LSTM-PPO, Greedy, DQN.
Рисунок 7: Среднее время принятия решения и средняя задержка ответа. (A): Время принятия решения при различной нагрузке задачами. (B): Задержка ответа при различной нагрузке задачами. Пожалуйста, нажмите здесь, чтобы просмотреть увеличенную версию этого рисунка.

Тепловая карта сравнения частоты конфликтов ресурсов и среднего использования; анализ производительности алгоритма.
Рисунок 8: Сравнение частоты конфликтов ресурсов и среднего использования ресурсов (A) Частота конфликтов ресурсов. (B) Среднее использование ресурсов Нажмите здесь, чтобы просмотреть этот рисунок в большем размере.

Условие сложности активностиTransformer-PPOLSTM-PPOЖадный алгоритмDQN (глубокая Q-сеть)
Одиночный тип0.910.860.740.78
Многотипная независимая0.880.810.70.73
Многотипное чередование0.850.760.650.68
Многоэтапный рабочий процесс0.830.730.610.66
Межведомственное сотрудничество0.80.70.590.63
Временная вставка0.860.780.680.72
Период повторения0.840.750.640.69

Таблица 1: Сравнение индекса стабильности планирования при различной сложности видов деятельности. Сравниваются индексы стабильности планирования моделей Transformer–PPO, long short-term memory–PPO (LSTM–PPO), greedy-search и deep Q-network (DQN) в семи условиях: однотипные виды деятельности, независимые многотипные виды деятельности, пересекающиеся многотипные виды деятельности, многоэтапные рабочие процессы, межведомственное взаимодействие, вставка временных задач и цикличные виды деятельности. Индекс стабильности варьируется от 0 до 1, при этом более высокие значения указывают на большую устойчивость к нарушениям планирования и более согласованные результаты применения стратегии.

Условие параллелизма задачМодель планированияИндекс ресурсного балансаИндекс робастности переноса стратегий
Низкая параллельность (100 задач)Transformer-PPO0.940.92
LSTM-PPO0.890.85
Жадный алгоритм0.830.78
глубокая Q-сеть (DQN)0.850.81
Средний уровень параллелизма (500 задач)Transformer-PPO0.910.89
LSTM-PPO0.860.82
Жадный алгоритм0.780.71
DQN (глубокая Q-сеть)0.810.76
Высокая параллельность (1000 задач)Transformer-PPO0.880.85
LSTM-PPO0.820.76
Жадный алгоритм0.70.63
DQN (глубокая Q-сеть)0.750.68

Таблица 2: Оценка адаптивности к нагрузке при параллельном выполнении задач. Сравнение индекса баланса ресурсов и индекса робастности переноса политики для четырех моделей планирования в условиях низкой, средней и высокой степени параллелизма, что соответствует 100, 500 и 1 000 одновременным задачам соответственно. Оба индекса варьируются от 0 до 1, при этом более высокие значения указывают на более сбалансированное распределение ресурсов и большую согласованность политик планирования при изменении нагрузки задач.

МетодСредняя задержка отклика (с)Коэффициент конфликта ресурсовИспользование ресурсовИндекс стабильности
Transformer+DQN2.13 ± 0.120.18 ± 0.020.68 ± 0.030.76 ± 0.04
GRU+PPO1.89 ± 0.090.15 ± 0.010.72 ± 0.020.79 ± 0.03
GraphSAGE+PPO1.72 ± 0.080.13 ± 0.010.74 ± 0.020.82 ± 0.03
Предлагаемый1.59 ± 0.050.09 ± 0.010.82 ± 0.020.88 ± 0.02
(Transformer+PPO)

Таблица 3: Сравнение эффективности с дополнительными современными методами. Предложенный метод Transformer–PPO сравнивается с Transformer–DQN, PPO на базе управляемого рекуррентного блока (GRU–PPO) и GraphSAGE–PPO при идентичных экспериментальных условиях и плотности задач 1,000. Результаты представляют собой средние значения по 10 независимым запускам. Оцениваемые показатели включают задержку отклика в секундах, частоту конфликтов ресурсов, коэффициент использования ресурсов и индекс стабильности планирования. Более низкие значения задержки отклика и частоты конфликтов свидетельствуют о более высокой эффективности, тогда как более высокие показатели использования ресурсов и индексы стабильности указывают на лучший результат.

Обсуждение

Экспериментальные результаты демонстрируют, что предложенный алгоритм Transformer-PPO стабильно превосходит базовые методы (LSTM-PPO, жадный поиск и DQN) по всем показателям оценки. Столь высокая эффективность может быть обусловлена двумя ключевыми факторами. Во-первых, механизм многоголового самовнимания (multi-head self-attention) архитектуры Transformer эффективно улавливает долгосрочные временные зависимости в последовательностях действий и состояний ресурсов, что позволяет проактивно выявлять потенциальные конфликты. Это объясняет, почему уровень конфликтов остается низким даже при высокой сложности (например, при межведомственном взаимодействии и временном внедрении задач), так как модель способна предвидеть конкуренцию за ресурсы до ее возникновения. Во-вторых, ограниченная целевая функция (clipped objective function) и коррекция преимущества на основе GAE в PPO обеспечивают стабильное обновление стратегии, предотвращая резкие колебания в решениях по планированию и поддерживая высокую устойчивость при различных нагрузках задач.

По сравнению с существующими подходами к планированию, предлагаемый метод устраняет недостатки моделей на базе LSTM, которые подвержены проблеме затухающих градиентов в длинных последовательностях, а также преодолевает слабую обобщающую способность жадных методов и методов DQN в динамических средах. Хотя LSTM-PPO демонстрирует умеренную эффективность, эта модель не обеспечивает стабильность, когда зависимости между задачами охватывают длительные временные интервалы, что отражается в более высоких показателях конфликтности и более низком балансе ресурсов при высокой степени параллелизма. Жадный алгоритм, несмотря на вычислительную эффективность, не обладает способностью к прогнозированию, что приводит к субоптимальному распределению ресурсов и увеличению задержек отклика. DQN, с другой стороны, демонстрирует осцилляцию стратегии из-за отсутствия ограничения области доверия, что ухудшает его производительность в многозадачных сценариях.

Тем не менее, данное исследование имеет несколько ограничений. Набор данных получен из одного профсоюза предприятия, что может ограничить возможность обобщения полученных результатов на другие организационные контексты. Кроме того, модель предполагает, что вся информация о действиях и ресурсах полностью наблюдаема, что может быть неверно в реальных условиях, где данные являются неполными или зашумленными. Вычислительные затраты энкодера Transformer также растут с увеличением длины исторического окна, что может повлиять на возможность применения модели в режиме реального времени для чрезвычайно крупномасштабных систем.

Будущая работа может быть сосредоточена на расширении модели для работы в частично наблюдаемых средах с использованием рекуррентного оценивания состояния, а также на внедрении методов мета-обучения для обеспечения быстрой адаптации к новым объединениям при ограниченном объеме исторических данных. Мы также планируем развернуть алгоритм в совместной облачно-периферийной архитектуре для сокращения задержки принятия решений и поддержки распределенного планирования. Кроме того, интеграция компонентов объяснимого ИИ могла бы предоставить интерпретируемые обоснования планирования для операторов-людей, что повысит доверие и упростит практическое внедрение.

В данной работе исследуется алгоритм оптимизации динамического планирования, который объединяет архитектуру Transformer и обучение с подкреплением PPO, с особым вниманием к частым конфликтам ресурсов и задержкам отклика при планировании деятельности профсоюза. Алгоритм тщательно анализирует пространственно-временные характеристики истории деятельности и состояния ресурсов с помощью механизма многоголового внимания (multi-head attention), что расширяет возможности выявления потенциальных рисков возникновения конфликтов. В сочетании со стабильным механизмом обновления функции ограничения (clipping objective function) стратегии это обеспечивает эффективность отклика и распределения ресурсов в динамической среде. Данный метод демонстрирует превосходную стабильность планирования, эффективность использования ресурсов и возможности контроля конфликтов для сложных и разнообразных типов деятельности и объемов задач. Эмпирический анализ показывает, что алгоритм имеет малую задержку отклика при высокой плотности задач. При семи различных типах и уровнях сложности деятельности коэффициент конфликтов ресурсов составляет 0,05–0,12, средняя загрузка ресурсов — 0,75–0,86, а индекс стабильности планирования — 0,8–0,91. Он поддерживает низкий уровень конфликтов ресурсов и высокую сбалансированность ресурсов, что значительно превосходит показатели современных основных моделей планирования LSTM-PPO, жадного поиска (greedy search) и DQN. В то же время робастность переноса стратегии и стабильность планирования находятся на высоком уровне, что указывает на сильную адаптивность и помехоустойчивость алгоритма. Данное преимущество в производительности обеспечивает надежную техническую поддержку системы управления деятельностью профсоюза в сценариях динамического и изменяющегося планирования ресурсов.

Раскрытие информации

Авторы заявляют об отсутствии финансовых конфликтов интересов.

Благодарности

Нет данных

Материалы

Список материалов, использованных в этой статье
ИмяКомпанияКаталожный номерКомментарии
Python 3.9Python Software Foundationhttps://www.python.org/downloads/release/python-390/Основной язык программирования
PyTorch 1.12Meta AIhttps://pytorch.org/get-started/previous-versions/Фреймворк глубокого обучения (реализация Transformer/PPO)
NumPy 1.23NumPy Developershttps://numpy.org/doc/stable/release/1.23.0-notes.htmlБиблиотека для численных вычислений
Matplotlib 3.5Matplotlib Development Teamhttps://matplotlib.org/stable/users/installing.htmlВизуализация результатов
Набор данных о планировании деятельности профсоюзаВнутренняя база данных сотрудничающего предприятия (анонимизированная)Недоступно публично в связи с соглашением о конфиденциальности; исследователи могут обратиться к автору для получения доступаБолее 5 000 записей о мероприятиях (собрания, обучение, досуг) профсоюза крупного предприятия за три года
NVIDIA A100 GPU
PyTorch

Ссылки

  1. Bosire RK, Muya J, Matula D. Employee recognition programs and employee output as moderated by workers’ union activities: evidence from Kenyatta National Hospital (KNH), Kenya. Saudi J Bus Manag Stud. 2021;6(3):61-70.
  2. Carneiro B, Costa HA. Digital unionism as a renewal strategy? Social media use by trade union confederations. J Ind Relat. 2022;64(1):26-51.
  3. Geelan T. Introduction to the special issue: the internet, social media and trade union revitalization—still behind the digital curve or catching up? New Technol Work Employ. 2021;36(2):123-39.
  4. Hennebert MA, Pasquier V, Lévesque C. What do unions do…with digital technologies? An affordance approach. New Technol Work Employ. 2021;36(2):177-200.
  5. Panagiotopoulos P. Digital audiences of union organising: a social media analysis. New Technol Work Employ. 2021;36(2):201-18.
  6. Wang W, Seifert R. Trade-union-engendered employee trust in senior management: a case study of digitalisation. Ind Relat J. 2024;55(6):472-91.
  7. Katsabian T. Collective action in the digital reality: the case of platform-based workers. Mod Law Rev. 2021;84(5):1005-40.
  8. Holgate J. Trade unions in the community: building broad spaces of solidarity. Econ Ind Democr. 2021;42(2):226-47.
  9. Ovi RP, Rana MS, Jodder PK, Sarkar B. Performance evaluation of e-service delivery of union digital centers at the local level using composite indexing method: a study of Batiaghata upazilla in Khulna district. Inf Dev. 2024;40(4):620-34.
  10. Crossan J, et al. Colours of democracy: trade union banners and the contested articulations of democratic spatial practices. Trans Inst Br Geogr. 2023;48(1):23-38.
  11. Victor C, Kavishe AM. The challenges faced by trade unions in improving employee welfare and strategies to address them: a case of the Tanzania Union of Government and Health Employees (TUGHE) at the National Health Insurance Fund (NHIF). Afr J Empir Res. 2025;6(1):189-200.
  12. Rogalewski A. Trade unions challenges in organising Polish workers: a comparative case study of British and Swiss trade union strategies. Eur J Ind Relat. 2022;28(4):385-404.
  13. Pacetti V, Rossi P, Romens AI. Remotizzare, o non remotizzare: questo è il dilemma. Imprese e sindacati di fronte alla remotizzazione ibrida del lavoro. Stato Merc. 2023;43(3):421-49.
  14. Hunt T, Connolly H. COVID-19 and the work of trade unions: adaptation, transition and renewal. Ind Relat J. 2023;54(2):150-66.
  15. Joyce S, Stuart M, Forde C. Theorising labour unrest and trade unionism in the platform economy. New Technol Work Employ. 2023;38(1):21-40.
  16. Dupuis M. Algorithmic management and control at work in a manufacturing sector: workplace regime, union power and shopfloor conflict over digitalisation. New Technol Work Employ. 2025;40(1):81-101.
  17. Suryadevara S. Real-time task scheduling optimization in WirelessHART networks: challenges and solutions. Int J Adv Eng Technol Innov. 2022;1(3):29-55.
  18. Roşu D, Cojanu F, Ştefănică V, et al. Experimental management of work collectives through social and socialization activities. J Phys Educ Sport. 2022;22(7):1742-47.
  19. Ahmed AAA, et al. Multi-project scheduling and material planning using Lagrangian relaxation algorithm. Ind Eng Manag Syst. 2021;20(4):580-87.
  20. Gao H, et al. TBDB: token bucket-based dynamic batching for resource scheduling supporting neural network inference in intelligent consumer electronics. IEEE Trans Consum Electron. 2024;70(1):1134-44.
  21. Ouhame S, Hadi Y, Ullah A. An efficient forecasting approach for resource utilization in cloud data centers using a CNN-LSTM model. Neural Comput Appl. 2021;33(16):10043-55.
  22. Valarmathi K, Kanaga Suba Raja S. Resource utilization prediction technique in the cloud using a knowledge-based ensemble random forest with an LSTM model. Concurr Eng. 2021;29(4):396-404.
  23. Yang Y, Shen H. Deep reinforcement learning enhanced greedy optimization for online scheduling of batched tasks in cloud HPC systems. IEEE Trans Parallel Distrib Syst. 2022;33(11):3003-14.
  24. Tang B, Luo J, Obaidat MS, Vijayakumar P. Container-based task scheduling in a cloud-edge collaborative environment using a priority-aware greedy strategy. Cluster Comput. 2023;26(6):3689-705.
  25. Zhang Y, Zou YH, Zhang XD. Manufacturing resource scheduling based on a deep Q-network. Wuhan Univ J Nat Sci. 2022;27(6):531-38.
  26. Mangalampalli S, et al. DRLBTSA: deep reinforcement learning-based task-scheduling algorithm in cloud computing. Multimed Tools Appl. 2024;83(3):8359-87.
  27. Wang Y, Wang Q, Chu X. Energy-efficient online scheduling of transformer inference services on GPU servers. IEEE Trans Green Commun Netw. 2022;6(3):1649-59.
  28. Liu L, et al. Dynamic sparse attention for scalable transformer acceleration. IEEE Trans Comput. 2022;71(12):3165-78.
  29. He X, et al. Channel assignment and power allocation for throughput improvement with PPO in B5G heterogeneous edge networks. Digit Commun Netw. 2024;10(1):109-16.
  30. Liu H, et al. A new multi-domain cooperative resource scheduling method using proximal policy optimization. Neural Comput Appl. 2024;36(9):4931-45.
  31. Jin J, Xu Y. Optimal policy characterization enhanced proximal policy optimization for multitask scheduling in cloud computing. IEEE Internet Things J. 2022;9(9):6418-33.
  32. Chavva M, Veera S. Dynamic cost-aware language models: a real-time framework for optimizing cloud resource recommendations. Int J Mach Learn Sustain Dev. 2023;5(2):1-15.
  33. Zhao Z, et al. Link scheduling using graph neural networks. IEEE Trans Wirel Commun. 2023;22(6):3997-4012.
  34. Zhang Z, et al. A resource optimization scheduling model and algorithm for heterogeneous computing clusters based on GNN and RL. J Supercomput. 2024;80(16):24138-72.
  35. Chai F, et al. Joint multi-task offloading and resource allocation for mobile edge computing systems in satellite IoT. IEEE Trans Veh Technol. 2023;72(6):7783-95.
  36. Luo Q, et al. Resource scheduling in edge computing: a survey. IEEE Commun Surv Tutor. 2021;23(4):2131-65.
  37. Gupta A, Namasudra S, Kumar P. An enhanced strategy for energy-efficient cloud computing environment through VM consolidation. In: Dagur A, Singh K, Mehra PS, Shukla DK, editors. Intelligent Computing and Communication Techniques. Boca Raton (FL): CRC Press; 2025. p. 330–34. https://doi.org/10.1201/9781003530176-46
  38. Sombo B, Apeh ST, Edeoghon IA. Review on authentication algorithms in cellular communication networks. Cloud Comput Data Sci. 2025;6(1):54-66.
  39. Gupta A, Kumar P, Namasudra S. Sustainable cloud computing: an enhanced energy-efficient VM consolidation approach using live migration. Iran J Comput Sci. 2026;9:27. doi:10.1007/s42044-025-00385-y.
  40. García F, et al. Traffic optimization through waiting prediction and evolutive algorithms. Int J Interact Multimed Artif Intell. 2025;9(3):96-103.
  41. Sharma P, Namasudra S, Lorenz P. Blockchain-based cloud storage system with enhanced optimization and integrity preservation. Presented at: IEEE International Conference on Communications (ICC); Rome, Italy; 2023. p. 3744-49.
  42. Ding F, et al. Transformer-enhanced DQN approach for energy- and cost-efficient large-scale dynamic workflow scheduling in a heterogeneous environment. IEEE Internet Things J. 2024;11(22):37351-67.
  43. Yu H, Tang N, Zhu Z, Guo Z. Flexible job-shop scheduling via gated recurrent unit and deep reinforcement learning. Knowl Based Syst. 2025;330:114734. doi:10.1016/j.knosys.2025.114734.
  44. Do KH, et al. Graph Neural PPO for joint user association and resource allocation in Open RAN [conference paper]. Presented at: 40th International Conference on Information Networking (ICOIN); Hanoi, Vietnam; 2026. p. 37-42.

Перепечатки и разрешения

Теги

Алгоритм Transformerоптимизация проксимальной политики (PPO)многоголовое вниманиестабильность планированияраспределение ресурсовпространственно-временные признакивосприятие рисков возникновения конфликтов