Dati sperimentali
Per valutare in modo esaustivo le prestazioni dell'algoritmo di pianificazione dinamica Transformer-PPO presentato in questo articolo, l'esperimento utilizza dati di gestione delle attività provenienti da un'ampia organizzazione aziendale relativi agli ultimi tre anni come dataset di riferimento. Questo dataset contiene oltre 5.000 registrazioni di attività, comprendenti diverse tipologie, tra cui riunioni, formazione e intrattenimento, con informazioni di pianificazione relative a diverse risorse, come sedi, attrezzature e personale. Ogni registrazione riporta l'orario di inizio e di fine dell'attività, i requisiti di risorse, la priorità e lo stato effettivo di esecuzione (inclusi eventi di conflitto e utilizzo delle risorse). Per simulare cambiamenti dinamici in scenari reali, i dati sono stati arricchiti con un ulteriore 10% di attività burst casuali e di eventi di modifica delle risorse (ad esempio, occupazione temporanea di un sito o aggiustamenti delle finestre temporali del personale), al fine di verificare la robustezza dell'algoritmo in un ambiente altamente incerto. La sequenza continua di stati fornisce un input strutturato per la modellazione temporale del Transformer e per l'addestramento della politica PPO. L'esperimento ha confrontato le prestazioni di pianificazione in condizioni di diverse densità e complessità dei compiti, per garantire che la valutazione copra scenari tipici delle applicazioni reali, confrontandola con il modello LSTM-PPO attualmente diffuso, un modello di pianificazione basato su ricerca greedy e un modello di pianificazione basato su politica DQN.
L'encoder Transformer comprende 3 livelli, ognuno con 4 testine di attenzione, una dimensione dell'embedding di 128 e una dimensione nascosta feed-forward di 256. La rete per le politiche e la rete per i valori condividono lo stesso output del Transformer come ingresso, per poi divergere in due percettroni multistrato (MLP) separati. Ogni MLP ha due strati nascosti con rispettivamente 256 e 128 neuroni, utilizzando l'attivazione ReLU. Tutti i livelli lineari sono inizializzati mediante inizializzazione uniforme di Xavier.
L'ottimizzatore è Adam con un tasso di apprendimento di 3 × 10-4, una dimensione del batch di 64 e un coefficiente di entropia di 0,01. Il parametro di clipping di PPO ε è impostato a 0,2, il fattore di sconto γ = 0,99 e GAE λ = 0,95. Il modello viene addestrato per 5.000 episodi, ciascuno contenente fino a 100 passaggi di pianificazione. Viene applicato il clipping del gradiente con una norma massima di 0,5 per prevenire l'esplosione del gradiente. Questi parametri sono stati selezionati tramite una ricerca preliminare su griglia ed sono in linea con le pratiche comuni nei compiti di pianificazione basati sull'apprendimento per rinforzo. Tutti gli esperimenti sono eseguiti su un singolo acceleratore GPU (memoria da 40 GB), utilizzando Python 3.9 e un framework di apprendimento profondo (vedere la Tabella dei materiali).
Andamento temporale dell'output dell'attenzione multi-testa, potenziamento residuo sotto variazione temporale delle caratteristiche di codifica e stratificazione della priorità del compito
Utilizzando la cronologia effettiva di pianificazione come input, vengono estratti a intervalli temporali consecutivi la richiesta di attività, lo stato di utilizzo delle risorse e lo stato di esecuzione del feedback, e le informazioni di diverso tipo vengono incorporate in uno spazio di caratteristiche unificato tramite mappatura lineare e codifica posizionale. Il meccanismo di attenzione multi-testa calcola in parallelo le correlazioni temporali tra diverse sequenze di caratteristiche e produce tre tipi di sequenze di pesi attentivi: compito, risorsa e feedback. Ogni tipo di peso rappresenta l'intensità di attenzione del modello verso lo stato corrispondente in ciascun passo temporale. Dopo la normalizzazione, viene tracciata una curva di tendenza per riflettere il focus percettivo del livello di codifica e la struttura di variazione dinamica delle diverse dimensioni informative nella cronologia di pianificazione. Questo processo viene completato sulla base della traiettoria effettiva di esecuzione delle attività e del registro di utilizzo delle risorse nello scenario di pianificazione.
Figura 4 mostra l'andamento dinamico dell'attenzione del meccanismo di attenzione multi-testa su diverse informazioni di stato nella pianificazione delle attività dell'unione. Il passo temporale è sull'asse orizzontale, che riflette l'avanzamento continuo della sequenza di pianificazione, mentre l'asse verticale rappresenta il peso normalizzato dell'attenzione, limitato all'intervallo [0,1], indicante l'importanza relativa attribuita dal modello alle caratteristiche del compito, allo stato delle risorse e allo stato del feedback. L'attenzione verso le caratteristiche del compito mostra un picco evidente intorno al quindicesimo passo. Nella fase iniziale della pianificazione, il modello dà priorità all'acquisizione delle caratteristiche temporali dei compiti chiave per prevedere potenziali conflitti e colli di bottiglia delle risorse, riflettendo la sensibilità al rischio in questa fase della pianificazione delle attività. La curva di attenzione relativa allo stato delle risorse mostra fluttuazioni periodiche, con un peso complessivo compreso tra 0,2 e 0,8, indicando il monitoraggio continuo da parte del sistema di pianificazione delle variazioni nell'occupazione delle risorse, sostenendo l'elaborazione complessa della condivisione e dell'allocazione delle risorse e consentendo una risposta efficace alla competizione dinamica per le risorse tra più compiti concorrenti. L'attenzione verso lo stato del feedback aumenta gradualmente, con un picco del peso intorno al passo 35, evidenziando la focalizzazione del modello sul feedback dei risultati di esecuzione e sulle condizioni anomale nelle fasi intermedie e finali della pianificazione, il che aiuta ad aggiustare la strategia per affrontare deviazioni nella pianificazione e migliorare la robustezza dell'intero processo di pianificazione. Questo andamento dimostra che una struttura di codifica che integra il meccanismo di attenzione multi-testa è in grado di catturare variazioni sottili nelle caratteristiche temporali e di potenziare l'adattabilità delle strategie di pianificazione a risorse eterogenee e dipendenze complesse tra i compiti, migliorando così l'efficienza e la stabilità complessive della pianificazione dinamica delle attività dell'unione.
Viene elaborata la sequenza di codifica dello stato nascosto e la struttura della risposta alle caratteristiche del compito. La parte di confronto dello stato costruisce i percorsi di propagazione delle caratteristiche prima e dopo la connessione residua nelle stesse condizioni di input, osserva l'evoluzione temporale dello stato nascosto attraverso passi temporali consecutivi ed estrae le caratteristiche di stabilità locale e continuità globale per analizzare l'evoluzione regolare dell'espressione dello stato durante la trasmissione dell'informazione. La tendenza della risposta prioritaria al compito viene estratta dal percorso di attivazione delle caratteristiche attraverso diverse strategie di pesatura della pianificazione. Monitorando i livelli di attivazione delle diverse categorie di compito nel tempo, si cattura l'effetto di aggiustamento dinamico del modello sulla capacità di differenziazione dei compiti.
Figura 5A mostra l'andamento dello stato nascosto del modello prima e dopo l'applicazione del meccanismo di connessione residua. L'asse orizzontale rappresenta il passo temporale, mentre l'asse verticale rappresenta il valore dello stato nascosto. L'uscita originale senza connessione residua presenta ampie oscillazioni, con evidenti instabilità locali e interruzioni di tendenza. La linea continua blu rappresenta il valore dello stato dopo l'applicazione della struttura residua. L'andamento complessivo rimane stabile e le fluttuazioni sono notevolmente ridotte, indicando che il modello raggiunge un buffer dei gradienti e un potenziamento delle caratteristiche durante la propagazione dello stato. Questo fenomeno conferma il ruolo del meccanismo residuo nel migliorare la stabilità delle strutture con dipendenze a lungo termine, sopprimendo efficacemente l'attenuazione dell'informazione causata da strati più profondi e potenziando la capacità espressiva continua delle sequenze di stati storici. Figura 5B illustra la dinamica di attivazione delle caratteristiche per tre tipi di attività in una serie temporale. L'asse orizzontale rappresenta il passo temporale, mentre l'asse verticale rappresenta il valore di attivazione delle caratteristiche, riflettendo la sensibilità temporale e l'attenzione strategica delle attività a diversi livelli di priorità. Le attività a bassa priorità mostrano un andamento decrescente, e il valore di attivazione delle caratteristiche decresce al di sotto di 0,5 nella fase successiva, indicando che il modello presta loro adeguata attenzione nella fase iniziale della pianificazione, riducendo gradualmente la risposta alle risorse nel tempo; le caratteristiche delle attività a media priorità aumentano lentamente nel tempo, con oscillazioni periodiche, riflettendo la capacità del modello di percepire e seguire in modo flessibile le fluttuazioni della domanda; le attività ad alta priorità mantengono un andamento costantemente crescente nel tempo, con il valore di attivazione delle caratteristiche che rimane sempre superiore a 2, mostrando un livello di attivazione elevato e stabile, indicando che il modello mantiene costantemente un alto grado di reattività verso queste attività. Questa risposta differenziata dimostra la capacità del modulo di codifica dello stato di identificare con precisione gli attributi delle attività e fornisce una base gerarchica per la presa di decisione nella generazione della strategia di pianificazione.
Analisi evolutiva multidimensionale delle prestazioni dell'algoritmo di scheduling dinamico transformer-ppo
Sulla base della codifica Transformer delle sequenze storiche di scheduling e dello stato delle risorse, vengono estratte caratteristiche spaziotemporali come input di stato per PPO; quindi la rete delle politiche genera l'azione di scheduling, e l'ambiente fornisce ricompense immediate e aggiorna lo stato; durante il processo di addestramento, vengono registrati gli indicatori originali di ogni ciclo, dopodiché il rumore viene eliminato mediante filtraggio con media mobile, analizzando così la tendenza di convergenza dell'algoritmo; nella visualizzazione finale, i dati originali mostrano dinamiche istantanee, mentre la curva regolarizzata riflette il miglioramento delle prestazioni a lungo termine, dimostrando che il modello raggiunge uno scheduling stabile attraverso la modellazione delle serie temporali e l'ottimizzazione della politica.
Figura 6A,B mostra l'analisi dell'evoluzione delle prestazioni multidimensionali dell'algoritmo dinamico di pianificazione Transformer-PPO. Le fluttuazioni nei dati originali riflettono il rumore istantaneo nel processo di pianificazione, mentre i dati smussati estraggono la tendenza a lungo termine mediante una media mobile, eliminando l'interferenza delle perturbazioni a breve termine sulla valutazione delle prestazioni dell'algoritmo e rendendo più agevole l'osservazione dell'evoluzione delle prestazioni. Analizzando i dati smussati, la relazione dinamica tra il reward e l'entropia della politica mostra che la curva del reward cresce in modo logaritmico, e la politica impara rapidamente a pianificare efficacemente le azioni attraverso l'esplorazione; in una fase successiva la crescita tende a stabilizzarsi, e il valore di saturazione del reward si attesta intorno a 12, indicando che la politica è vicina a un ottimo locale. L'entropia della politica decresce gradualmente da circa 2,2 all'inizio fino a circa 0,6. PPO mantiene la capacità di esplorazione necessaria grazie al termine di reward per l'entropia. Un'elevata esplorazione (entropia elevata) nella fase iniziale favorisce un rapido aumento dei reward, mentre la strategia successiva bilancia esplorazione e sfruttamento attraverso potatura e aggiornamento. L'ottimizzazione coordinata tra tasso di conflitto e utilizzo delle risorse mostra che il tasso di conflitto scende al di sotto del 10%, e il suo limite inferiore riflette i conflitti che non possono essere eliminati nel sistema reale a causa della casualità dei compiti. Questa tendenza discendente è direttamente attribuibile alla capacità del Transformer di codificare sequenze storiche di attività, consentendo al modello di prevedere proattivamente i contendenti per le risorse. L'utilizzo delle risorse è aumentato fino a quasi il 75%, in linea con la legge dei rendimenti marginali decrescenti. È ragionevole che l'utilizzo non abbia raggiunto livelli più elevati, poiché un utilizzo eccessivo potrebbe causare ritardi di coda. La riduzione dei conflitti ha liberato ulteriori risorse disponibili, e un'allocazione ottimizzata delle risorse ha ulteriormente ridotto i conflitti.
Valutazione della velocità di risposta e dell'efficienza del processo decisionale
Confronto del tempo medio di decisione e del ritardo medio di risposta in condizioni di diverse densità di compiti (numero di compiti: 100, 300, 500, 700, 1000). Confronto del modello di scheduling Transformer-PPO presentato in questo articolo con il modello LSTM-PPO, il modello di scheduling basato su ricerca greedy e il modello di scheduling strategico DQN.
Figura 7A,B mostra il tempo medio di decisione e il ritardo medio di risposta per le quattro strategie di pianificazione in diverse condizioni di densità dei compiti, riflettendo la capacità dell'algoritmo di prendere decisioni in tempo reale e la reattività del sistema in scenari ad alto carico. All'aumentare del numero di compiti, ciascuna strategia mostra un andamento crescente in entrambi gli indicatori, ma le entità degli aumenti e la stabilità differiscono. In scenari ad alta intensità di compiti, la struttura Transformer-PPO mantiene prestazioni relativamente stabili in termini di tempo medio di decisione. Quando la densità dei compiti è pari a 1000, il tempo medio di decisione è di 0,72 s e il ritardo medio di risposta è di 1,59 s, il che è principalmente dovuto all'effetto di compressione della codifica delle caratteristiche temporali sullo spazio degli stati e all'efficace evitazione di operazioni non valide nello spazio delle azioni. Al contrario, la strategia DQN presenta tempi di decisione e ritardi di risposta più lunghi all'aumentare del numero di compiti, riflettendo la sua limitata capacità di generalizzare le politiche attraverso transizioni di stato ad alta dimensionalità. Sebbene la strategia Greedy prenda decisioni più rapidamente al variare del numero di compiti, le sue prestazioni di risposta peggiorano su grafi di compiti complessi a causa della mancanza di modellazione delle dipendenze a lungo termine. LSTM-PPO possiede una certa capacità di percezione temporale nella modellazione sequenziale, ma presenta prestazioni scadenti in scenari con dipendenze a lungo termine a causa della profondità strutturale limitata. I risultati evidenziano l'importanza cruciale della progettazione strutturale sulla reattività del sistema di pianificazione e sottolineano la necessità di un'ottimizzazione coordinata del meccanismo di codifica e dell'efficienza del campionamento delle politiche in condizioni di alta concorrenza.
Valutazione del tasso di conflitto e dell'utilizzo delle risorse
In condizioni diverse di complessità del tipo di attività (tipo singolo, multi-tipo indipendente, multi-tipo incrociato, flusso di lavoro multistadio, collaborazione interdipartimentale, inserimento temporaneo, ciclo ripetuto), vengono analizzati statisticamente il tasso di conflitto delle risorse e il tasso medio di utilizzo delle risorse. Il modello di pianificazione Transformer-PPO proposto in questo articolo viene confrontato con i modelli di pianificazione LSTM-PPO, ricerca greedy e DQN.
Figura 8A,B mostra il tasso di conflitto delle risorse e l'utilizzo medio delle risorse per diversi modelli di pianificazione attraverso sette livelli di complessità delle attività. L'asse verticale rappresenta il modello di pianificazione, mentre l'asse orizzontale indica il tipo di attività. L'andamento generale mostra che, all'aumentare della complessità della struttura delle attività (come processi multistadio, collaborazione interdipartimentale, inserimento temporaneo e cicli ripetuti), il tasso di conflitto aumenta in tutti i modelli. La strategia greedy e lo schema DQN mostrano una limitata adattabilità ai cambiamenti dinamici e risultano chiaramente insufficienti nel controllo dei conflitti. Il modello Transformer-PPO mantiene comunque un tasso di conflitto basso anche in condizioni di alta complessità, con un tasso complessivo di conflitto delle risorse compreso tra 0,05 e 0,12, riflettendo la sua profonda comprensione della struttura delle dipendenze tra i compiti e delle variazioni delle risorse. Per quanto riguarda l'utilizzo delle risorse, Transformer-PPO mantiene un livello elevato in tutte le condizioni, in particolare con incroci di più tipi e inserimenti temporanei. La sua strategia di aggiustamento dinamico riduce efficacemente l'inattività delle risorse, con un tasso medio di utilizzo delle risorse compreso tra 0,75 e 0,86. I dati confermano che il modello Transformer-PPO raggiunge un migliore equilibrio tra flessibilità della pianificazione ed efficienza delle risorse, offrendo una maggiore praticabilità e scalabilità.
Stabilità della pianificazione
L'indice di stabilità della pianificazione viene calcolato in diverse condizioni di complessità del tipo di attività (tipo singolo, multi-tipo indipendente, multi-tipo incrociato, processo multistadio, collaborazione interdipartimentale, inserimento temporaneo e ciclo ripetuto). Il modello di pianificazione Transformer-PPO presentato in questo articolo viene confrontato con i modelli LSTM-PPO, ricerca greedy e DQN.
Tabella 1 presenta i risultati del confronto per l'indice di stabilità della pianificazione tra diversi modelli di pianificazione in sette condizioni di complessità del tipo di attività. Il tipo di complessità selezionato riflette le prestazioni di stabilità del sistema di pianificazione in scenari multipli. Il valore dell'indice varia da 0 a 1. Maggiore è il valore, maggiore è la resistenza del modello alle perturbazioni della pianificazione e più stabile è l'output della strategia. I risultati sperimentali mostrano che Transformer-PPO mantiene un indice di stabilità elevato in tutte le strutture di attività. In particolare, negli scenari con attività di tipo multiplo, collaborazione interdipartimentale e cicli ripetuti, la stabilità della strategia di pianificazione è superiore a quella degli altri modelli, dimostrando forti capacità di conservazione strutturale e di pianificazione adattiva. L'indice complessivo di stabilità della pianificazione varia da 0,8 a 0,91. Al contrario, la stabilità dell'algoritmo greedy e della DQN è diminuita significativamente all'aumentare della complessità della struttura delle attività, con evidenti oscillazioni della politica e deviazioni nell'esecuzione. LSTM-PPO mostra una certa stabilità, ma le sue prestazioni complessive rimangono inferiori a quelle di Transformer-PPO. Questo confronto conferma il contributo positivo del meccanismo di attenzione multi-testa e del meccanismo di aggiornamento con potatura della politica sulla stabilità dell'output di pianificazione, evidenziando il vantaggio del modello in scenari complessi di attività congiunte.
Analisi dell'adattamento al carico di concorrenza delle attività
All'aumentare del numero di attività concorrenti, il sistema di pianificazione deve affrontare le due sfide rappresentate dai conflitti nella distribuzione delle risorse e dalla ridotta generalizzazione delle politiche. Per verificare l'adattabilità della pianificazione di diversi modelli in condizioni di aumento del carico di lavoro, questa sezione definisce tre livelli di concorrenza delle attività (basso: 100 elementi, medio: 500 elementi, alto: 1000 elementi) al fine di monitorare la distribuzione delle risorse del sistema e la coerenza della risposta delle politiche durante il ciclo di pianificazione. L'indice di bilanciamento delle risorse viene utilizzato per riflettere l'equilibrio del carico tra le diverse unità di risorsa durante il processo di pianificazione ed è calcolato come segue:
(7)
ui rappresenta il tasso di utilizzo effettivo delle unità di risorsa; ū rappresenta il tasso medio di utilizzo di tutte le risorse; e N rappresenta il numero totale di risorse. L'intervallo di valori è [0,1] e più il valore si avvicina a 1, più la distribuzione delle risorse è bilanciata.
L'indice di robustezza del trasferimento delle politiche Rs misura il grado di coerenza dell'output delle politiche sotto diverse condizioni di carico di lavoro ed è definito come:
(8)
πt(L) e πt(H) sono rispettivamente le distribuzioni delle strategie di pianificazione in condizioni di carico basso e carico elevato, e T è il passo temporale totale. Più il valore si avvicina a 1, maggiore è la robustezza della migrazione della strategia e più elevata è l'adattabilità.
Tabella 2 presenta in modo sistematico le prestazioni dei quattro modelli di pianificazione in termini di bilanciamento delle risorse e robustezza del trasferimento delle politiche sotto carichi variabili di concorrenza dei compiti. I livelli di concorrenza dei compiti sono impostati rispettivamente a basso (100 elementi), medio (500 elementi) e alto (1000 elementi), riflettendo l'adattabilità del modello in scenari con diverse pressioni di scala dei compiti. I risultati mostrano che il modello Transformer-PPO raggiunge l'indice di bilanciamento delle risorse più elevato a tutti i livelli di carico, indicando la sua capacità di allocare razionalmente le risorse in scenari multi-compito concorrenti. Allo stesso tempo, anche l'indice di robustezza del trasferimento delle politiche risulta significativamente migliore rispetto ai modelli di confronto, dimostrando una forte coerenza e adattabilità delle politiche. In condizioni di alta concorrenza, gli indici di bilanciamento delle risorse e di robustezza del trasferimento delle politiche sono rispettivamente 0,88 e 0,85. In confronto, LSTM-PPO si colloca al secondo posto, mentre l'algoritmo Greedy e il modello DQN mostrano un degrado significativo delle prestazioni sotto carico elevato, con una distribuzione non uniforme delle risorse e un aumento delle fluttuazioni delle politiche più evidenti. Questa valutazione ha chiaramente evidenziato le differenze nella gestione delle risorse e nella robustezza delle politiche all'interno del sistema di pianificazione in caso di espansione del carico di lavoro, confermando ulteriormente l'applicabilità e il vantaggio della soluzione integrata Transformer-PPO per la pianificazione dinamica e complessa di attività congiunte.
Confronto con ulteriori metodi all'avanguardia
Per effettuare un ulteriore confronto del metodo proposto con approcci recenti all'avanguardia (SOTA), sono stati implementati tre algoritmi rappresentativi della letteratura più recente che combinano apprendimento profondo e apprendimento per rinforzo applicati ai problemi di pianificazione: (1) Transformer+DQN42, che utilizza lo stesso codificatore Transformer del nostro metodo ma sostituisce PPO con DQN per l'apprendimento della politica, come esplorato in recenti studi di pianificazione basati sui valori; (2) GRU+PPO43, che sostituisce il codificatore Transformer con un'unità ricorrente a porte (Gated Recurrent Unit, GRU) per catturare le dipendenze temporali, rappresentando metodi avanzati basati su reti neurali ricorrenti (RNN); e (3) GraphSAGE+PPO44, che impiega un codificatore GraphSAGE per modellare le relazioni tra attività e risorse sotto forma di grafi, rispecchiando approcci recenti basati su reti neurali su grafi per la pianificazione. Tutti i metodi sono stati addestrati nelle stesse condizioni sperimentali (stesso dataset, densità di attività pari a 1000 e configurazione delle epoche) con iperparametri ottimizzati mediante ricerca a griglia per garantire un confronto equo. Ogni metodo è stato valutato su 10 esecuzioni indipendenti, registrando i valori medi di metriche chiave di prestazione (ritardo di risposta, tasso di conflitto tra risorse, utilizzo delle risorse e indice di stabilità della pianificazione).
Come mostrato nella Tabella 3, il metodo proposto Transformer+PPO supera costantemente tutti e tre i baselines SOTA in tutte le metriche valutate. Il ritardo medio di risposta del metodo proposto (1,59 s) è significativamente inferiore rispetto a quello di Transformer+DQN (2,13 s), GRU+PPO (1,89 s) e GraphSAGE+PPO (1,72 s), indicando una maggiore efficienza nel processo decisionale. Il tasso di conflitto delle risorse del metodo proposto (0,09) è inoltre il più basso, indicando una migliore capacità di prevenzione proattiva dei conflitti. Questo miglioramento è attribuibile all'attenzione multi-testa del Transformer, che cattura le dipendenze a lungo raggio in modo più efficace rispetto al GRU o a GraphSAGE, combinata con gli aggiornamenti della politica stabili del PPO. Per quanto riguarda l'utilizzo delle risorse, il metodo proposto raggiunge un valore di 0,82, superando gli altri di almeno 8 punti percentuali, dimostrando un'allocazione delle risorse più efficiente. L'indice di stabilità del metodo proposto (0,88) è inoltre il più elevato, confermando che l'obiettivo di clipping e la correzione GAE nel PPO producono politiche di scheduling più robuste rispetto al DQN o ad altre varianti del PPO. Nel complesso, i risultati confermano che la combinazione specifica di Transformer e PPO nel framework proposto offre vantaggi evidenti rispetto alle architetture alternative recenti, rafforzando ulteriormente la sua applicabilità nella pianificazione delle attività sindacali dinamiche.
DICHIARAZIONE DI DISPONIBILITÀ DEI DATI:
Il set di dati anonimizzato utilizzato in questo studio, insieme alla pipeline di preelaborazione dei dati e agli script di valutazione, è stato depositato nel repository Figshare ed è pubblicamente disponibile all'indirizzo https://doi.org/10.6084/m9.figshare.33059243 (DOI: 10.6084/m9.figshare.33059243). Il set di dati contiene programmi di attività, registri di utilizzo delle risorse e registrazioni di eventi di conflitto provenienti da un grande sindacato aziendale, con tutte le informazioni identificabili personalmente e quelle sensibili dal punto di vista commerciale rimosse.

Figura 1: Struttura del sistema di pianificazione delle attività sindacali. Le richieste di attività, la disponibilità delle risorse e le informazioni sulle finestre temporali del personale vengono integrate per costruire un grafo delle restrizioni tra attività e risorse e una matrice di conflitti. Le sequenze storiche di attività e di stato delle risorse vengono codificate utilizzando un Transformer con attenzione multi-testa. Gli stati codificati vengono forniti alle reti di politica e di valore dell'ottimizzazione della politica prossimale (PPO), che generano probabilità di azioni di pianificazione e stime del valore dello stato. Le azioni selezionate aggiornano l'ambiente di pianificazione e generano ricompense. L'obiettivo PPO con clipping e la stima del vantaggio generalizzato vengono quindi utilizzati per aggiornare il modello, creando un ciclo di feedback chiuso per la pianificazione adattativa e l'allocazione delle risorse. Cliccare qui per visualizzare una versione ingrandita di questa figura.

Figura 2: Rete dei pesi dei conflitti tra attività (lo spessore dei collegamenti riflette la gravità del conflitto). Ogni nodo rappresenta un'attività in attesa di pianificazione, e ogni collegamento rappresenta un conflitto causato dall'uso sovrapposto di personale, sedi, attrezzature o altre risorse. Lo spessore dei collegamenti è proporzionale al peso del conflitto calcolato, con collegamenti più spessi che indicano conflitti più gravi. I gruppi di nodi densamente connessi rappresentano potenziali colli di bottiglia delle risorse e gruppi di attività in competizione. Viene utilizzato un layout basato su forze direzionate per posizionare più vicine le attività con conflitti maggiori. Cliccare qui per visualizzare una versione ingrandita di questa figura.

Figura 3: Caratteristiche dinamiche della stabilità della strategia e della stima del vantaggio durante l'iterazione di ottimizzazione della pianificazione. (A) Obiettivo della politica limitato con diversi valori di ε. (B) Fluttuazione del GAE al variare dei parametri λ. Cliccare qui per visualizzare una versione ingrandita di questa figura.

Figura 4: Andamento temporale dell'output dell'attenzione multi-testa Cliccare qui per visualizzare una versione ingrandita di questa figura.

Figura 5: Potenziamento residuo e stratificazione della priorità del compito in seguito alla variazione temporale delle caratteristiche di codifica. (A) Confronto dello stato nascosto prima e dopo la connessione residua. (B) Attivazione delle caratteristiche basata sul tempo per diverse priorità di compito. Cliccare qui per visualizzare una versione ingrandita di questa figura.

Figura 6: Analisi dell'evoluzione delle prestazioni multidimensionali. (A) Premio e Entropia della Politica (B) Tasso di Conflitto e Utilizzo delle Risorse. Cliccare qui per visualizzare una versione ingrandita di questa figura.

Figura 7: Tempo medio di decisione e ritardo medio di risposta. (A): Tempo di decisione con carichi di lavoro variabili. (B): Latenza di risposta con carichi di lavoro variabili. Cliccare qui per visualizzare una versione ingrandita di questa figura.

Figura 8: Confronto del tasso di conflitto delle risorse e dell'utilizzo medio delle risorse (A) Tasso di conflitto delle risorse. (B) Utilizzo medio delle risorse Cliccare qui per visualizzare una versione ingrandita di questa figura.
| Condizione di Complessità dell'Attività | Transformer-PPO | LSTM-PPO | Algoritmo Greedy | DQN |
| Unico Tipo | 0.91 | 0.86 | 0.74 | 0.78 |
| Multiplo Indipendente | 0.88 | 0.81 | 0.7 | 0.73 |
| Multiplo Intrecciato | 0.85 | 0.76 | 0.65 | 0.68 |
| Flusso di Lavoro Multistadio | 0.83 | 0.73 | 0.61 | 0.66 |
| Collaborazione Interdipartimentale | 0.8 | 0.7 | 0.59 | 0.63 |
| Inserimento Temporaneo | 0.86 | 0.78 | 0.68 | 0.72 |
| Periodo di Ripetizione | 0.84 | 0.75 | 0.64 | 0.69 |
Tabella 1: Confronto dell'indice di stabilità della pianificazione in base a diverse complessità delle attività. Gli indici di stabilità della pianificazione dei modelli Transformer–PPO, long short-term memory–PPO (LSTM–PPO), ricerca greedy, e deep Q-network (DQN) vengono confrontati in sette condizioni: attività di un singolo tipo, attività multiple indipendenti, attività multiple con sovrapposizioni, flussi di lavoro multistadio, collaborazione interdipartimentale, inserimento di attività temporanee e attività a ciclo ripetuto. L'indice di stabilità varia da 0 a 1, con valori più elevati che indicano una maggiore resistenza ai disturbi nella pianificazione e uscite della politica più coerenti.
| Condizione di Concorrenza delle Attività | Modello di Scheduling | Indice di Bilanciamento delle Risorse | Indice di Robustezza del Trasferimento della Politica |
| Bassa Concorrenza (100 Attività) | Transformer-PPO | 0.94 | 0.92 |
| LSTM-PPO | 0.89 | 0.85 |
| Algoritmo Greedy | 0.83 | 0.78 |
| DQN | 0.85 | 0.81 |
| Concorrenza Media (500 Attività) | Transformer-PPO | 0.91 | 0.89 |
| LSTM-PPO | 0.86 | 0.82 |
| Algoritmo Greedy | 0.78 | 0.71 |
| DQN | 0.81 | 0.76 |
| Alta Concorrenza (1000 Attività) | Transformer-PPO | 0.88 | 0.85 |
| LSTM-PPO | 0.82 | 0.76 |
| Algoritmo Greedy | 0.7 | 0.63 |
| DQN | 0.75 | 0.68 |
Tabella 2: Valutazione dell'adattabilità al carico di concorrenza delle attività. L'indice di bilanciamento delle risorse e l'indice di robustezza del trasferimento delle politiche dei quattro modelli di pianificazione vengono confrontati in condizioni di bassa, media e alta concorrenza, corrispondenti rispettivamente a 100, 500 e 1.000 attività simultanee. Entrambi gli indici variano da 0 a 1, con valori più elevati che indicano una distribuzione più equilibrata delle risorse e una maggiore coerenza delle politiche di pianificazione al variare del carico di lavoro.
| Metodo | Ritardo Medio di Risposta (s) | Tasso di Conflitto delle Risorse | Utilizzo delle Risorse | Indice di Stabilità |
| Transformer+DQN | 2.13 ± 0.12 | 0.18 ± 0.02 | 0.68 ± 0.03 | 0.76 ± 0.04 |
| GRU+PPO | 1.89 ± 0.09 | 0.15 ± 0.01 | 0.72 ± 0.02 | 0.79 ± 0.03 |
| GraphSAGE+PPO | 1.72 ± 0.08 | 0.13 ± 0.01 | 0.74 ± 0.02 | 0.82 ± 0.03 |
| Proposto | 1.59 ± 0.05 | 0.09 ± 0.01 | 0.82 ± 0.02 | 0.88 ± 0.02 |
| (Transformer+PPO) |
Tabella 3: Confronto delle prestazioni con ulteriori metodi all'avanguardia. Il metodo proposto Transformer–PPO viene confrontato con Transformer–DQN, unità ricorrente con porta (gated recurrent unit)–PPO (GRU–PPO) e GraphSAGE–PPO in condizioni sperimentali identiche con una densità di compiti pari a 1.000. I risultati rappresentano i valori medi ottenuti da 10 esecuzioni indipendenti. Gli esiti valutati includono il ritardo di risposta in secondi, la frequenza di conflitto delle risorse, la frequenza di utilizzo delle risorse e l'indice di stabilità della pianificazione. Valori più bassi di ritardo di risposta e frequenza di conflitto indicano prestazioni migliori, mentre valori più elevati di utilizzo delle risorse e indici di stabilità indicano prestazioni migliori.