Forschungsartikel

Dynamischer Planungs- und Ressourcenoptimierungsalgorithmus für gewerkschaftliche Aktivitäten durch Integration von Transformern und verstärkendem Lernen

38 Aufrufe

DOI:

10.3791/72544

28. August 2026

In diesem Artikel

Zusammenfassung

Diese Arbeit untersucht einen dynamischen Optimierungsalgorithmus für die Ablaufplanung, der Transformer und die Verstärkungslernmethode PPO integriert, und konzentriert sich dabei auf häufige Ressourcenkonflikte und Reaktionsverzögerungen bei der Planung von Vereinsaktivitäten.

Zusammenfassung

Um das Problem der verringerten organisatorischen Effizienz aufgrund häufiger Ressourcenzuweisungskonflikte und verzögerter Planungsreaktionen bei der Verwaltung von Gewerkschaftsaktivitäten zu lösen, schlägt dieser Artikel einen dynamischen Planungsalgorithmus vor, der Transformer und PPO (Proximal Policy Optimization) integriert. In der konkreten Implementierung wird zunächst eine einheitliche Modellierungsstruktur für Planungsszenarien entworfen, um Aktivitäts-, Personal- und Ressourcenzustände in Tensoreingaben umzuwandeln und so eine Integration mehrdimensionaler Einschränkungen zu erreichen. Anschließend wird der Multi-Head-Attention-Mechanismus des Transformers verwendet, um die Zeitreihe historischer Aktivitätsanfragen und Ressourcenstatus zu kodieren, mehrdimensionale räumlich-zeitliche Merkmale zu extrahieren und die Wahrnehmung von Konfliktrisiken zu verbessern. Danach werden basierend auf den Kodierungsergebnissen und dem PPO-Strategienetzwerk Planungsentscheidungen aus dem aktuellen Zustand heraus generiert, um die Anpassungsfähigkeit der Strategie an komplexe Umgebungen zu erhöhen. Schließlich werden durch das Pruning-Update und den Mechanismus zur Korrektur der Vorteilsfunktion die Stabilität der Strategie während der Iteration sowie eine verbesserte Planungsleistung sichergestellt. Experimente haben gezeigt, dass bei einer Aufgabendichte von 1000 die durchschnittliche Entscheidungszeit des Planungsalgorithmus 0,72 s und die durchschnittliche Antwortverzögerung 1,59 s beträgt, was auf eine hohe Reaktionsgeschwindigkeit und Entscheidungseffizienz hinweist. Bei sieben Aktivitätstypen und Komplexitätsstufen liegt die Ressourcenkonfliktrate zwischen 0,05 und 0,12; die durchschnittliche Ressourcennutzungsrate liegt zwischen 0,75 und 0,86; und der Planungsstabilitätsindex beträgt 0,8 bis 0,91, wodurch häufige Ressourcenzuweisungskonflikte effektiv reduziert und eine hohe Planungsstabilität erreicht wird. Unter Bedingungen hoher Parallelität betragen der Ressourcenbilanzindex und der Robustheitsindex für Strategieübertragung jeweils 0,88 und 0,85, was auf eine gute Anpassungsfähigkeit an parallele Aufgabenlasten hinweist.

Einleitung

Die Planung von Vereinsaktivitäten umfasst die komplexe Koordination mehrerer Aufgaben und Ressourcen, weshalb das System über effiziente dynamische Reaktionsfähigkeiten verfügen muss1,2. Die Anforderungen an die Aktivitäten ändern sich häufig, und die Verteilung von Personal- und Veranstaltungsortressourcen ist komplex, was leicht zu Planungskonflikten und Ressourcenverschwendung führen kann3,4. Die präzise Erfassung der Aktivitätsverläufe und des Echtzeit-Status der Ressourcen sowie die Verbesserung der Fähigkeit, potenzielle Konflikte zu erkennen und darauf zu reagieren, sind entscheidend, um die betriebliche Effizienz der Organisation zu steigern5,6. Die Integration fortschrittlicher Technologien zur Zeitreihenmodellierung und Algorithmen des Verstärkungslernens kann ein tiefes Verständnis komplexer Planungsumgebungen ermöglichen und eine intelligente Optimierung unterstützen, wodurch die Ressourcennutzung maximiert, die Reaktionsgeschwindigkeit bei der Planung beschleunigt und die intelligente Weiterentwicklung des Managements von Vereinsaktivitäten gefördert wird.

Bestehende Planungsmethoden in der Praxis basieren jedoch größtenteils auf festen Regeln und sind statisch, wodurch sie nicht in der Lage sind, sich an häufige Aufgabenänderungen und Schwankungen bei den Ressourcen anzupassen. Dies führt oft zu verlängerten Reaktionszeiten und schwerwiegenden Ressourcenkonflikten. Bei der Planung von Gewerkschaftsaktivitäten ist die Vielfalt der Aufgabentypen sehr groß; die Nutzung von Ressourcen ist stark eingeschränkt und unterliegt häufigen Änderungen; zudem bilden die Abhängigkeiten zwischen den Aktivitäten sowie die Konkurrenz um Ressourcen eine komplexe Planungsstruktur7,8. In der Praxis lässt sich der Aktivitätsplan nur unzureichend mit den verfügbaren Zeitfenstern von Ressourcen wie Personal und Veranstaltungsorten abstimmen9,10, was häufig zu Konflikten führt und die Gesamtkohärenz der organisatorischen Abläufe beeinträchtigt11,12. Das Planungssystem steht nicht vor einem einzelnen Optimierungsziel, sondern muss ein Gleichgewicht zwischen mehrdimensionalen Indikatoren finden, wie der Minimierung von Ressourcenkonflikten, der Maximierung der Reaktionsgeschwindigkeit, der Stabilität der Planungsstrategie und der Aufgabenabschlussrate13,14, wodurch typische Merkmale einer mehrzieligen Optimierung gegeben sind. Außerdem weisen Gewerkschaftsaktivitäten deutliche Phasen und Zyklen auf, sodass sich die Planungsstrategien dynamisch an die sich verändernden Strukturen des Ressourcenbedarfs in verschiedenen Aufgabenphasen anpassen müssen. Ein einmal erstellter statischer Plan kann die Ausführungsumgebung mit ihren häufigen Änderungen nicht unterstützen15,16. Die bisherige Planungslogik untersucht das historische Verhalten von Aufgaben und Muster von Ressourcenänderungen nicht ausreichend tiefgreifend. Sie ist daher nicht in der Lage, genaue Vorhersagen und strategische Ableitungen für die Zukunft zu liefern17,18. Die Reaktionsgeschwindigkeit der Planungsstrategie auf plötzlich auftretende Aufgaben und temporäre Ressourcenänderungen ist gering, was die Gesamtnachhaltigkeit des Betriebs beeinträchtigt19,20. Die Entwicklung eines Planungssystems mit Vorhersagefähigkeit, Flexibilität und Stabilität ist daher zu einer zentralen technischen Anforderung in praktischen Anwendungen geworden. Dazu muss das Modell über Fähigkeiten zur Wahrnehmung hochdimensionaler Informationen, zur Sequenzspeicherung und zur Strategieübertragung verfügen sowie robuste Entscheidungsfindung und Ressourcenbilanzierung in einer Umgebung mit mehreren Aufgaben gewährleisten, um eine intelligente und optimale Koordinierung der Planung von Gewerkschaftsaktivitäten zu ermöglichen.

Zahlreiche Studien haben verschiedene Lösungen für das Problem der dynamischen Planung vorgeschlagen. Dabei hat sich die Kombination aus Deep Learning und Verstärkendem Lernen als besonders anpassungsfähig und leistungsfähig bei der Optimierung erwiesen. Einige Forscher verwenden LSTM (Long Short-Term Memory)21,22, um Zeitreihendaten zu modellieren, und kombinieren diese mit Strategien des Verstärkenden Lernens, um das Planungsverhalten zu optimieren, wobei bereits gewisse Erfolge erzielt wurden. Eine weitere Forschungsrichtung nutzt eine auf einem Greedy-Algorithmus basierende heuristische Methode, die die Einfachheit und Effizienz von Planungsentscheidungen betont und sich für Szenarien mit klaren Regeln eignet23,24. Andere Arbeiten haben die Anwendung von Deep Q-Networks (DQN) für die Planung untersucht und verbesserte Strategien durch Wertfunktionsapproximation erreicht25,26. Diese Methoden weisen jedoch Probleme wie eine unzureichende Erfassung langfristiger Abhängigkeiten, instabile Strategieaktualisierungen und große Reaktionsverzögerungen auf, insbesondere bei komplexen und sich ständig verändernden Szenarien, wodurch die Anforderungen an die Planung von dichten und vielfältigen Aufgaben nur schwer erfüllt werden können. Daher stellt die Entwicklung eines Planungsalgorithmus mit effizienter Merkmalsextraktion und stabiler Strategieaktualisierung derzeit eine Hauptschwierigkeit dar, die überwunden werden muss.

In der Forschung zum mehrdomänigen Scheduling wurde die Transformer-Architektur aufgrund ihres Multi-Head-Self-Attention-Mechanismus, der langfristige zeitliche Abhängigkeiten effektiv erfasst, auf verschiedene Aufgaben der Zeitreihenvorhersage und der Optimierung von Abläufen angewandt27,28. In Kombination mit dem PPO-Algorithmus im Verstärkungslernen wird die Strategie durch Beschneiden der Zielfunktion stabil und effizient aktualisiert, wobei dieser Ansatz in Bereichen wie der Robotiksteuerung und der intelligenten Fertigung gute Leistung gezeigt hat29,30,31. Einige Studien haben versucht, den Transformer mit Verstärkungslernen zur komplexen Ressourcenplanung zu kombinieren32. Bei der dynamischen Planung von Vereinsaktivitäten befassen sich jedoch nur wenige Arbeiten mit der Kombination unterschiedlicher Aktivitätstypen und komplexer Ressourcenbeschränkungen. Einige Studien haben die Beziehung zwischen Ressourcen und Aufgaben mithilfe von Graph-Neural-Networks modelliert, um die Genauigkeit bei der Identifizierung von Konflikten zu verbessern33,34. Andere Forscher haben die Ressourcenplanung basierend auf Edge-Computing optimiert, um die Effizienz und Leistung des Modells zu steigern35,36. Solche Methoden weisen jedoch nach wie vor begrenzte Fähigkeiten bei der Modellierung des zeitlichen Kontexts auf. Vor diesem Hintergrund schlägt diese Arbeit vor, einen Transformer zur Kodierung historischer Aktivitäts- und Ressourcenstatussequenzen einzusetzen und diesen mit dem PPO-Police-Netzwerk zu kombinieren, um eine hohe Wahrnehmung von Konfliktrisiken sowie eine stabile Aktualisierung von Planungsstrategien zu erreichen, um den sich wandelnden und komplexen Anforderungen bei der Planung von Vereinsaktivitäten gerecht zu werden.

Aktuellere Studien haben die Optimierung der Ressourcenplanung aus verschiedenen Perspektiven untersucht, beispielsweise die VM-Konsolidierung zur Energieeffizienz im Cloud-Computing37, Authentifizierungsalgorithmen in Mobilfunknetzen38, verbesserte VM-Konsolidierung mit Live-Migration für nachhaltiges Cloud-Computing39, Verkehrsoptimierung mithilfe von Wartezeitvorhersage und evolutionären Algorithmen40 sowie blockchainbasierte Cloud-Speicherung mit verbesserter Optimierung und Integritätserhaltung41. Obwohl diese Arbeiten wertvolle Einblicke in die Ressourcenverteilung und Optimierungsalgorithmen liefern, konzentrieren sie sich vorrangig auf Cloud-Infrastrukturen, Telekommunikation oder Speichersysteme und berücksichtigen nicht speziell die mehrfachen Aktivitätstypen, dynamischen Konflikte zwischen Personal und Veranstaltungsorten sowie die Echtzeit-Anforderungen an die Planung, die für die Organisation von Gewerkschaftsaktivitäten charakteristisch sind. Dieser Unterschied unterstreicht weiterhin die Notwendigkeit eines dedizierten Planungsrahmens, der auf den organisatorischen Kontext von Gewerkschaftsaktivitäten zugeschnitten ist.

Bestehende Planungsmethoden für Gewerkschaftsaktivitäten erfassen häufig nicht die langfristigen räumlich-zeitlichen Abhängigkeiten und bewahren keine Policy-Stabilität inmitten dynamischer Veränderungen, was zu langsamen Reaktionszeiten und hohen Ressourcenkonflikten führt. Um diese Forschungslücken zu schließen, schlägt diese Studie ein Planungsoptimierungsmodell vor, das auf dem Prinzip basiert, dass die Multi-Head-Attention-Mechanismen von Transformern historische Sequenzen effektiv kodieren können, um Konflikte vorherzusagen, und dass die Proximale Policy-Optimierung (PPO) mit einer begrenzten Zielfunktion stabile und adaptive Policy-Updates gewährleistet. Konkret wird der Transformer eingesetzt, um Aktivitäts- und Ressourcenstatussequenzen zu kodieren und wichtige räumlich-zeitliche Merkmale zu extrahieren, um die Konflikterkennung im Voraus zu verbessern, und PPO wird kombiniert, um effiziente Planungsentscheidungen zu generieren und stabile Aktualisierungen zu ermöglichen. Eine einheitliche Einschränkungsmatrix wird entworfen, um Aktivitäten, Personal und Veranstaltungsorte abzubilden und die Erkennung komplexer Abhängigkeiten zu verbessern. Zu den zentralen Innovationen dieser Arbeit gehören: (1) die Integration von zeitlicher Kodierung und Verstärkendem Lernen speziell für die Planung von Gewerkschaftsaktivitäten; (2) ein konfliktorientierter Attention-Mechanismus, der die Wahrnehmung von Risiken priorisiert; und (3) ein Pruning-Update mit Korrektur der Advantage-Funktion, um die Robustheit der Strategie bei hoher Parallelität sicherzustellen. Umfangreiche Experimente unter verschiedenen Aufgabendichten und -komplexitäten belegen die Überlegenheit des Modells gegenüber bestehenden Methoden hinsichtlich Reaktionsgeschwindigkeit, Ressourcennutzung und Stabilität und bieten eine praktikable und skalierbare intelligente Planungslösung für das Management von Gewerkschaftsaktivitäten.

Protokoll

Abbildung 1 zeigt die Struktur eines Systems zur Planung von Vereinsaktivitäten, das Zeitreihenmodellierung und Verstärkendes Lernen integriert. Die Eingabeschicht kombiniert Aktivitätspläne, Ressourcenverfügbarkeit und Zeitfensterinformationen des Personals und erstellt mithilfe des Constraint-Graph-Moduls eine mehrdimensionale Matrix zur Darstellung von Aufgaben- und Ressourcenkonflikten. Der Transformer führt eine Multi-Head-Attention-Codierung über die historische Abfolge von Aktivitäts- und Ressourcenzuständen durch und erzeugt so verdeckte Zustände mit zeitlichen Abhängigkeiten. Das Policy-Modul nutzt die Codierungsergebnisse, um Aktionsverteilungen und Zustandsschätzungen zu generieren, und trifft Planungsentscheidungen durch Stichprobenziehung von Aktionen. Die Ausführungsergebnisse werden an die Umgebung zurückgegeben, wodurch der Ressourcenstatus aktualisiert und unmittelbare Belohnungen generiert werden. Auf dieser Grundlage erstellt das Optimierungsmodul eine beschnittene Zielfunktion, bewertet die Vorteilsfunktion und korrigiert die Schätzung des Wertnetzwerks, um eine Abdrift der Politik einzuschränken und stabile Aktualisierungen der Planungsstrategien sicherzustellen. Zwischen den Modulen entsteht eine geschlossene Datenschleife, die eine hochsensible Wahrnehmung von Ressourcenkonflikten und adaptive Strategieanpassungen in dynamischen Umgebungen ermöglicht und dadurch die Intelligenz der Reaktion sowie die Effizienz der Ressourcenverteilung im System zur Planung von Vereinsaktivitäten in Szenarien mit vielen Aufgaben und hohen Restriktionen verbessert.

Szenariomodellierung der Planung von Gewerkschaftsaktivitäten
Alle Aktivitätsanfragen im Planungssystem werden basierend auf Zeitschritten in diskrete Planungssequenzen unterteilt. Jede Aktivität ist durch klar definierte Start- und Endzeiten, Ressourcenkategorien, Phasen und Prioritätsstufen festgelegt. Der Standortnutzungsstatus wird als zweidimensionale Zeit-Slot-Matrix modelliert, wobei die horizontale Achse die standardisierte Zeiteinheit und die vertikale Achse die Anzahl der räumlichen Ressourcen darstellt. Der Ressourcenstatus wird als verfügbar oder belegt markiert, wodurch eine initiale Ressourcenverteilungskarte mit statischer Struktur entsteht. Die Personaleinsatzplanungs-Informationen werden in der Zeit-Identitäts-Dimension erweitert, um einen kontinuierlichen Zeitfenster-Vektor zu konstruieren, der jeweils den Aufgaben- oder Leerlaufstatus sowie die Abteilungsnummer des Personals erfasst. Alle Eingabedaten werden in einer dreidimensionalen Tensorstruktur zusammengeführt, wobei den diskreten Zeitschritt, die Anzahl der Ressourceneinheiten und den entsprechenden Ressourcennutzungs-Attributcode bezeichnet (z. B. ob die Ressource belegt ist, die Aktivitätsnummer, die Nutzungspriorität usw.). Diese Struktur ermöglicht es dem Planungssystem, die Ressourcenkonfiguration zu jedem beliebigen Zeitpunkt auszulesen und gewährleistet eine einheitliche Darstellung verschiedener Ressourcenstatus-Typen.

Nachdem die Aufgabeninformationen mit dem Modell verknüpft wurden, wird der Aufgabenintensitätsvektor basierend auf der Aktivitätspriorität und der Ressourcennutzungsdauer festgelegt. Die Kombinationen von Aufgaben, die zu Konflikten führen können, werden mithilfe der Überlappungserkennung von Zeitfenstern markiert. Konflikthafte Kombinationen werden in Knotenmengen umgewandelt, und Kantenmengen werden basierend auf gemeinsamen Ressourcentypen und -zeiträumen konstruiert, um implizite Abhängigkeiten explizit darzustellen. Der abschließend erstellte Aufgabengraph enthält Grenzinformationen zur zeitlichen Abfolge, Ressourcenüberlappung oder Beschränkungskonflikten und bietet eine strukturelle Grundlage für die anschließende Konflikterkennung und die Erzeugung von Planungsstrategien. Diese Struktur bewahrt den dynamischen Charakter der Aufgabenplanung und die kontinuierlichen Änderungen im Ressourcenstatus und unterstützt die Echtzeiterfassung von Änderungen in den Planungsbeschränkungen.

Die Konflikterkennung nutzt die spärlichen überlappenden Bereiche der Zeit- und Ressourcendimensionen in der Tensordarstellung als Ausgangsbedingungen für die Beurteilung. Sie führt eine statische Beziehungs-Codierung für Aufgabenpaare mit überlappenden Planungszielen durch. Es wird eine Graphstruktur G=(V,E,C) konstruiert, wobei V die Menge der aktiven Knoten, E die aufgrund von Ressourcenkonflikten entstandenen Kanten und C die Konfliktgewichtungs-Codierungsmatrix für die Kanten darstellt. Die Konfliktgewichtungsfunktion ist in der folgenden Form definiert:

Gleichung für die Kovarianzmatrix; beinhaltet Summation, Delta-Funktion, Gewichtungsfaktor; statistische Analyse.    (1)

Dabei ist Cuv das Konfliktgewicht zwischen den Aktivitäten u und v; u, v sind Aktivitätsindizes; R ist die Gesamtanzahl der Ressourcentypen; δuvr ∈ {0,1} gibt an, ob sich die Zeitfenster der Aktivitäten u und v bezüglich der Ressource r überlappen; ωr ist das Konfliktempfindlichkeitsgewicht der Ressource r. Diese Funktion führt eine gewichtete Summe der Konfliktintensitäten durch, wobei Unterschiede in der Bedeutung von Ressourcenkonflikten für die Ergebnisse der Terminplanung berücksichtigt werden, und behält gleichzeitig einen quantifizierbaren Ausdruck der Verteilung der Konfliktstärke bei.

Die oben genannte Konfliktgraph-Struktur wird durch eine dünn besetzte Matrixdarstellung in eine Beschränkungsgrenz-Matrix umgewandelt. Jeder Eintrag in der Matrix enthält das Ausmaß des Ressourcenkonflikts. Die Matrix wird in den Planungsentscheidungsprozess integriert, um zu bestimmen, ob Aufgaben parallel geplant werden können, während die Aktionsabschirmlogik im Politik-Netzwerk liegt. Um mit periodischer Aktivitätsaggregation und Aufgabenbursts mit hoher Dichte umzugehen, wird ein dynamischer Aktualisierungsmechanismus implementiert, der Änderungen im Aufgabenstatus überwacht und den Matrixinhalt in Echtzeit anpasst, sobald Ressourcen freigegeben oder hinzugefügt werden, um die Kontinuität und Konsistenz der Planungsgrenze während der gesamten Aufgabenentwicklung sicherzustellen.

Die Anwendung dieser Konfliktgraphstruktur ermöglicht es dem Planungssystem, potenzielle Ressourcenengpässe und Muster von Aufgabenüberschneidungen visuell abzubilden, wodurch die Effizienz der Entkopplungsanalyse des Entscheidungsnetzwerks bei komplexen Randbedingungsszenarien verbessert wird. Das Planungsverhalten basiert nicht länger auf regelbasiertem logischem Abgleich. Stattdessen wird der optimale Pfad im Beschränkungsraum gesucht, wodurch die Fähigkeit gestärkt wird, lokale Ressourcenkonflikte dynamisch mit der globalen Aufgabenübersicht auszugleichen. Das System kann die Stabilität der Planung und die Kohärenz der Aufgaben in einer Umgebung aufrechterhalten, in der sich Ressourcen verändern und Aufgaben häufig hinzugefügt oder entfernt werden.

Abbildung 2 zeigt ein Netzwerkstrukturdiagramm, das auf der Gewichtungsbeziehung von Aufgabekonflikten basiert. Jeder Knoten in der Abbildung repräsentiert eine zu planende Aufgabe, und die Linien zwischen den Knoten zeigen Ressourcennutzungskonflikte an. Die Dicke der Kante spiegelt das Gewicht des Konflikts wider. Je schwerwiegender der Konflikt, desto dicker ist die Linie. Die Gewichtungsberechnung integriert die Ressourcenüberlappung und kombiniert die Konfliktempfindlichkeit verschiedener Ressourcen, um eine zusammengesetzte Konfliktintensität zwischen Aufgaben zu bilden. Die Graphstruktur zeigt, dass einige Aufgaben eng verbundene Bereiche bilden, was auf einen erheblichen Wettbewerb um die Ressourcennutzung hinweist. Dieses Phänomen der lokalen Konfliktaggregation ist die Hauptursache für Ressourcenengpässe und Aufgabenverzögerungen im Planungsprozess, sodass der Planungsalgorithmus entsprechend Prioritäten für Konfliktbearbeitung festlegen kann. Die Anordnung der Knoten verwendet eine kraftbasierte Layoutstrategie, um Aufgaben mit hohen Konflikten automatisch zu gruppieren, wodurch das Planungssystem Schlüsselaufgabengruppen identifizieren und die Strategieverteilung optimieren kann, was die Gesamtkohärenz der Planung und die Ressourcenabstimmung verbessert.

Codierung der historischen Zustandssequenz
Basierend auf dem erstellten Konfliktgraphen und der Beschränkungsmatrix besteht der nächste Schritt darin, die historischen Aktivitätsabläufe und Ressourcenzustände zu kodieren, um die zeitlichen Muster, die diesen Beschränkungen zugrunde liegen, für nachfolgende Entscheidungsprozesse extrahieren zu können. Die Kerndaten des Planungsszenarios bestehen aus Aktivitätsanfragen, Änderungen des Ressourcenstatus und Rückmeldedaten zu Aufgaben. Diese Informationen bilden mehrere heterogene Zeitreihen, die verschiedenen Attributen entsprechen, wie etwa Zeitpunkten von Ereignissen, Kennungen der Ressourcennutzung und dem Status der Aktivitätsausführung. Um die Verarbeitungsstruktur zu vereinheitlichen, wird jeder Eingabetyp als Sequenz gleich langer Vektoren kodiert, und ein einheitlicher Zeitindex wird etabliert, um eine Zustandsausrichtung unter zeitlicher Synchronisation sicherzustellen. Die Eingabeeinheit zu jedem Zeitpunkt wird durch die Konkatenation dreier Gruppen von Merkmalsvektoren repräsentiert: Der Aktivitätsmerkmalsvektor beschreibt den Aufgabentyp, die Priorität und die Stufennummer; der Ressourcenmerkmalsvektor erfasst die aktuelle Ressourcenbelegung, die verbleibende Kapazität und die Position des verfügbaren Zeitfensters; der Rückmeldemerk-malsvektor gibt an, ob die Aufgabe im vorherigen Zeitpunkt reibungslos ausgeführt wurde und ob ein Ressourcenkonflikt oder eine Verzögerung aufgetreten ist.

Alle Merkmale werden linear transformiert und in denselben mehrdimensionalen Raum abgebildet, um eine standardisierte Embedding-Matrix X ∈ ℝT×d zu erhalten, wobei T die Anzahl der Zeitschritte und d die einheitliche Embedding-Dimension darstellt. Um die zeitliche Struktur beizubehalten, wird die Eingabematrix elementweise zur Positions-Codierungsmatrix P addiert, um die positionsbewusste Eingabe zu bilden:

Z = X + P   (2)

Z ist die endgültige Eingabesequenz, die als Eingabe für den nachfolgenden Attention-Mechanismus dient. Das Design der Positions-Codierung verwendet eine feste Sinus- und Kosinusfunktion als Vorlage, um einen Informationsleak über zukünftige Werte zu verhindern und sicherzustellen, dass die kausalen Bedingungen während der Codierung strikt eingehalten werden. Die oben beschriebene Struktur ermöglicht es dem Modell, Aufgabenmerkmale, Ressourcenstatus und Zeitposition gleichzeitig wahrzunehmen. Sie verfügt über eine vollständige Zustandsspeicher-Basis und bietet eine hochauflösende, einheitliche Struktur für den nachfolgenden Attention-Mechanismus.

Das Attention-Modul verarbeitet die Eingabesequenz, um mögliche Beziehungen zwischen mehreren Zeitpunkten zu erfassen. Mehrere Gruppen von Attention-Köpfen werden verwendet, um die Sequenz separat zu verarbeiten und dadurch die Empfindlichkeit des Modells gegenüber verschiedenen Arten von Zustandsentwicklungsverläufen zu erhöhen. Jeder Attention-Kopf erzeugt aus der Eingabesequenz eine Query-Matrix Q, eine Key-Matrix K und eine Value-Matrix V, berechnet die Gewichtungsverteilungsmatrix und erzeugt eine gewichtete Repräsentation. Die Ausgabe eines einzelnen Attention-Kopfes lautet:

Formel zur Attention-Mechanismus, Attention(Q,K,V)=softmax(QKᵀ/√dₖ)V, verwendet in neuronalen Netzwerken.   (3)

dk ist die Anzahl der Merkmalsdimensionen pro Kopf. In dieser Formel repräsentiert QK die Ähnlichkeit zwischen Zeitpunkten, √dk dient der numerischen Stabilität, und die Softmax-Funktion stellt die Gewichtsnormierung sicher. Unterschiedliche Attention-Köpfe konzentrieren sich auf verschiedene Kombinationen von Zeitintervallen, und die dynamischen Abhängigkeiten, die sie erfassen, sind ebenfalls vielfältig, wodurch implizite Regeln wie Vorläufer von Aufgabenkonflikten, Muster des Ressourcenverbrauchs und auffällige Trends in der Rückmeldung aufgedeckt werden können.

Alle Ausgaben der Attention-Heads werden verkettet und über eine lineare Transformationschicht geleitet, um eine einheitliche Kodierungssequenz zu erzeugen, die als Zustandseingabe für das Netzwerk zur Generierung von Planungsstrategien dient. Diese Sequenz kodiert die Verhaltensspur der Aufgabe, die Merkmale von Ressourcenänderungen sowie die Auswirkungen vorangegangener Ausführungsabweichungen im aktuellen Planungsfenster und löst damit effektiv das Problem der hohen historischen Abhängigkeit des Planungsverhaltens und der spärlichen Merkmalsdarstellung. Residuelle Verbindungen und Layer-Normalisierungsmoduln sind in die Kodierungsausgabeschicht integriert, um die Stabilität des Trainingsprozesses und die Fähigkeit zur Erhaltung von Darstellungen im tiefen Netzwerk zu verbessern.

Die Folge der verborgenen Ausgabezustände behält nicht nur die zeitliche Entwicklungsinformation bei, sondern reagiert auch auf Änderungen, die durch plötzliche Aufgaben oder vorübergehende Ressourcenmismatches entstehen, und zeigt damit eine starke Anpassungsfähigkeit. Dieser strukturelle Ansatz verzichtet auf die explizite Definition von Regeln, ermöglicht eine strukturierte Modellierung dynamischer Planungsumgebungen und unterstützt nachfolgende Policy-Module dabei, Planungslösungen mit globaler Konsistenz und lokaler Anpassungsfähigkeit unter Mehrzielbedingungen zu erzeugen.

Generierung von dynamischen Planungsstrategien
Die codierten Sequenzen der versteckten Zustände, die sowohl zeitliche Abhängigkeiten als auch Informationen zu Ressourcenkonflikten enthalten, werden anschließend in das Politik-Netzwerk eingespeist, um Planungsentscheidungen zu generieren, die sich an die aktuelle Umgebung anpassen. Die vom Kodiermodul ausgegebene Sequenz der verborgenen Zustände wird als Eingabe für das Netzwerk der Planungsstrategie verwendet. Der Zustandsvektor, der zu jedem Zeitpunkt festgelegt wird, bildet die aktuelle Beobachtungsdarstellung der Umgebung ab und erfasst die Entwicklung von Aufgabenmerkmalen, Ressourcennutzungstrends sowie historischen Feedback-Trajektorien. Die Dimension der Zustandsdarstellung und die Länge des Zeitfensters sind festgelegt, wobei die Kontinuität von Zustandsänderungen über einen Schiebeaktualisierungsmechanismus erfasst wird. Bevor der Zustandsvektor an das Politiknetzwerk übermittelt wird, erfolgen eine Normalisierung und eine Neugliederung der Merkmale, um sicherzustellen, dass die Eingabe eine stabile numerische Verteilung im hochdimensionalen Raum beibehält, wodurch Gradientenexplosionen und Konvergenschwankungen reduziert werden.

Die Struktur des Politik-Netzwerks verwendet ein zweigeteiltes Ausgabemodul, bei dem ein Zweig die Aktionsverteilung erzeugt und der andere die Schätzung der Zustandswertfunktion ausgibt. Der Aktionsraum umfasst alle planbaren Aufgaben und zuweisbaren Ressourcen. Der Kandidatenauswahlmechanismus filtert unzulässige oder überflüssige Kombinationen von Operationen heraus, um eine begrenzte, zulässige Menge von Aktionen zu bilden. Der Politik-Zweig gibt eine Wahrscheinlichkeitsverteilung π(at|st) aus, wobei at die Planungsaktion zum Zeitpunkt des Zeitschritts und st den aktuellen Zustandseingang darstellt. Zum Auswählen von Aktionen aus der Verteilung für die tatsächliche Planung wird eine standardisierte Gaußsche Stichprobe oder eine Softmax-Stichprobenstrategie verwendet. Die andere Ausgabe ist die Schätzung der Zustandswertfunktion, die die Erwartung des langfristigen Belohnungswerts im gegebenen Zustand repräsentiert und für die Bewertung und Aktualisierung der Politik verwendet wird.

Im Richtliniennetzwerk wendet die versteckte Schicht Aktivierungsfunktionen und Batch-Normalisierung an, um den nichtlinearen Ausdruck zu verbessern und die Netzwerkkonvergenz zu beschleunigen. Im Entscheidungsprozess werden die Ausführungspriorität, die Ressourcenplanungskosten und die historische Leistung verschiedener Aufgaben als Aufmerksamkeitsfaktoren berücksichtigt und über eine spezifische Gewichtungsmatrix in den Aktionsauswahlmechanismus integriert, um einen adaptiv einstellbaren Rahmen für die Richtlinienausgabe zu schaffen. Dieses Design vermeidet die Abhängigkeit von festen Regeln und erhöht somit die Flexibilität der Strategie bei der Bewältigung plötzlicher Konflikte und struktureller Engpässe.

Die Planungsstrategie verwendet einen Zufallsstichproben-Mechanismus, um die eigentliche Aktionssequenz zu erzeugen. In jedem Planungszyklus wird eine ausführbare Aktion aus der aktuellen Aktionsverteilung gezogen, und der Ressourcenstatus sowie die Markierung des Aufgabenknotens werden aktualisiert. Nach Ausführung der Aktion berechnet das System die unmittelbare Belohnung basierend auf den Änderungen der Ressourcen und dem Fortschritt der Aufgabe, um die Auswirkung dieser Planungsrunde auf das Gesamtziel zu messen. Die Belohnungskonzeption berücksichtigt mehrere Dimensionen, darunter die Aufgabenabschlussrate, die Effizienz der Ressourcennutzung und das Ausmaß der Konfliktdämpfung. Sie liefert dem Strategie-Update-Modul über umfassende Indikatoren Rückmeldung.

Der gesamte Planungsprozess erstellt eine Markov-Entscheidungskette und verwendet die empirische Trajektorien-Stichprobenerhebungsmethode, um die Zustands-Aktions-Belohnungs-Sequenz, bezeichnet als (st, at, rt, st+1), aufzuzeichnen. Die Strategieoptimierung beruht auf der Konstruktion der Vorteilsfunktion, wobei die Vorteilsschätzung in der folgenden Form definiert ist:

Formel des verstärkenden Lernens, At = rt + γV(st+1) - V(st), mathematisches Konzept.    (4)

At steht für den Vorteilswert, rt ist die aktuelle Sofortbelohnung, γ ist der Diskontfaktor für Belohnungen und V(st) sowie V(st+1) sind die Ausgaben der Zustandswertfunktion im aktuellen bzw. nächsten Zustand. Die Vorteilsfunktion spiegelt das Ausmaß wider, in dem die aktuelle Aktion gegenüber der durchschnittlichen Leistung der Strategie überlegen ist. Sie dient dazu, die nachfolgende Verbesserung der Strategie zu steuern. Wenn At > 0 gilt, bedeutet dies, dass die aktuelle Aktion besser ist als die durchschnittliche Erwartung, und ihre Wahrscheinlichkeit sollte erhöht werden; andernfalls sollte ihre Auswahlneigung verringert werden.

Während des Strategie-Update-Prozesses wird ein Trunkierungsmechanismus für die Zielverteilung angewandt, um Strategieoszillationen aufgrund übermäßiger Update-Amplituden zu vermeiden. Dieser begrenzt den Änderungsbereich zwischen neuen und alten Strategien und gewährleistet somit die Kontinuität und Stabilität der Netzwerkausgabe. Eine enge Kopplung zwischen der Aktionsverteilung und der Rückmeldung des Belohnungssignals ermöglicht es der Strategie, unmittelbar auf Veränderungen komplexer Randbedingungen zu reagieren. Der Mechanismus erhält die Stabilität der Entscheidungsfindung und eine rationelle Ressourcenplanung in Situationen, in denen sich Aufgaben häufig ändern oder Ressourcen plötzlich nicht mehr passend zur Verfügung stehen, und verhindert effektiv Probleme wie doppelte Zuweisungen, Ressourcenstaus oder Anstauungen in der Aufgabenwarteschlange. Das Planungssystem kann unter wechselnden Aufgabendichten und Ressourcenengpässen einen besseren Betriebszustand beibehalten und zeigt damit starke adaptive Fähigkeiten.

Strategie-Iteration und stabiler Aktualisierungsmechanismus
Um sicherzustellen, dass die generierten Planungsstrategien stabil bleiben und sich über wiederholte Trainingsrunden hinweg nicht verschlechtern, wird in diesem Abschnitt ein iterativer Aktualisierungsmechanismus mit Clipping und Vorteils-Korrektur eingeführt. Das Trunkierungs-Update-Intervall zwischen der alten und der neuen Strategie wird festgelegt, und die Clipping-Zielfunktion wird verwendet, um die Strategieabweichung einzuschränken und so einen Planungsschock während des Strategie-Update-Prozesses zu verhindern. Das Bewertungsnetzwerk wird in Kombination mit der Vorteilsfunktion korrigiert, um die Genauigkeit der langfristigen Planung zu verbessern.

Die Wahrscheinlichkeitsverteilung der Aktionsausgabe des Policy-Netzwerks neigt während kontinuierlicher Planungsiterationen zu starken Schwankungen, was zu instabilem Verhalten oder ungeordneter Ressourcenverteilung führen kann. Um den durch Policy-Drift verursachten Planungsschock zu verringern, wird ein abgeschnittenes Aktualisierungsintervall konzipiert, um den Änderungsbereich zwischen der neuen und der alten Policy zu begrenzen, und ein Restriktionsterm wird eingeführt, um die Zielfunktion zu verfeinern. Die Wahrscheinlichkeit der historischen Policy wird in der Abtastphase aufgezeichnet, und der Verhältnisterm wird mit der aktuellen Policy-Wahrscheinlichkeit gebildet. Das Ziel der Policy-Aktualisierung wird festgelegt als:

Optimierungsgleichung, Formel, statisches Gleichgewicht veranschaulicht, für bildungswissenschaftliche Zwecke    (5)

Hier bezeichnet gt = πθ(at|st)/πθold(at|st) das Verhältnis der Wahrscheinlichkeiten zwischen der neuen und der alten Strategie; ε ist die Abschneide-Schwelle, die den Bereich der Strategieaktualisierung begrenzt. Wenn das Verhältnis die Grenze überschreitet, wird stattdessen der abgeschnittene Wert verwendet, um zu verhindern, dass die Strategie übermäßige Gradienten aus extremen Stichproben erzeugt, wodurch sichergestellt wird, dass die Anpassung der Netzwerkparameter innerhalb des vorgegebenen Bereichs bleibt. Diese Struktur beschränkt dynamisch den Änderungsbereich der Ausgabestrategie in jeder Planungsrunde, bewahrt die Glattheit und Konsistenz der Strategieausgabe bei dichten Aufgabenverteilungen und reduziert signifikant die Schwankungsrate des Planungsverhaltens.

Die Ziel-Funktion der Politik wird während des Aktualisierungsprozesses um Regularisierungs- und Entropiebelohnungsterme erweitert, um die Diversität der Aktionsverteilung zu erhöhen und eine vorzeitige Konvergenz zu unterdrücken. Jede Runde der Politikaktualisierung nutzt mehrere Batches von Erfahrungstrajektorien-Stichproben für das schrittweise Training, wodurch eine breite Abdeckung im Zustandsraum erhalten bleibt. Wenn die Wahrscheinlichkeitsverteilung der ausgegebenen Aktionssequenz vor und nach der Aktualisierung verglichen wird, wird die Abweichungsrate der Verteilung berechnet, und eine feste Schwelle filtert den akzeptablen Störungsbereich der Politik heraus. Dieser Mechanismus bietet eine Grenzkontrolle für die Übertragung von Planungspolitiken über Zyklen hinweg und unterdrückt so Überanpassung aufgrund drastischer Änderungen im Ressourcenstatus.

Strategieaktualisierungen basieren auf der Zustandsbewertung, die von der Wertfunktion bereitgestellt wird. Abweichungen bei der Zustandswertschätzung können die Korrektheit der Advantage-Funktion direkt beeinflussen und dadurch die Richtung der Strategieiteration verändern. Um die Genauigkeit der Bewertung zu verbessern, wird ein Mehrfach-Zeitreihen-Backtracking-Mechanismus konstruiert, und der diskontierte kumulative Wert zukünftiger Belohnungen wird verwendet, um den aktuellen Zustandswert zu korrigieren. Die Backtracking-Belohnung verwendet die Struktur der Generalized Advantage Estimation (GAE), die wie folgt definiert ist:

Gleichung für die Verstärkungslern-Wertfunktion, Σγ^t(r+γV(s'))-V(s), Formelanalyse.    (6)

Ât ist der korrigierte Vorteilswert; λ ist der Rückverfolgungsbilanzkoeffizient; rt+l repräsentiert die unmittelbare Belohnung des (t+l)-ten Schritts; V(st+l) ist der vom Bewertungsnetzwerk ausgegebene Zustandswert. Diese Struktur integriert kurzfristiges, unmittelbares Feedback und langfristige Erwartungen an den Zustand, um Abweichungen in den Reaktionsvorhersagen der Strategie hinsichtlich zukünftiger Ressourcenkonflikte, Spitzenlasten und Aufgabenanhäufung zu korrigieren. λ steuert die Tiefe der Rückverfolgung und passt sich automatisch während Phasen starker dynamischer Ressourcenschwankungen an, um die Robustheit der Reaktion des Bewertungsnetzwerks auf plötzliche Ereignisse zu erhöhen.

Die in der Vorteilsfunktion eingebettete zeitabhängige Struktur auf mehreren Skalen ermöglicht es dem Bewertungsnetzwerk, langfristige Ressourcentrends zu modellieren. Bei der Erkennung von Abweichungen in der Politikausgabe wird der Index zur Konsistenz des Politikverhaltens verwendet, um zu bewerten, ob das Netzwerk übermäßig auf den Bewertungsfehler reagiert. Rückkopplungs-Differenz-Restterme überwachen das Verhalten der Politikaktualisierung, und das Trainingsziel sowie die Amplitude der Gewichtsaktualisierung der Wertefunktion werden dynamisch korrigiert. Das Wertnetzwerk und das Politiknetzwerk werden gemeinsam optimiert, um sicherzustellen, dass die Wertabschätzung nicht vom Ziel der Aufgabenerfüllung abweicht, und um gleichzeitig zu verhindern, dass eine hochfrequente Planung den Status von Ressourcenkonflikten falsch einschätzt.

Dieser stabile Mechanismus zur Aktualisierung von Strategien kann die Steuerbarkeit und Konsistenz von Verhaltensaktualisierungen effektiv in einer hochdimensionalen dynamischen Aufgabenumgebung aufrechterhalten, wodurch die Effizienz der Aufgabenabdeckung und die Flexibilität der Ressourcennutzung verbessert werden und sich eine kontinuierlich iterative, intelligente Planungsstruktur ergibt. Das Planungsverhalten verhindert, dass die langfristige Entwicklung in eine lokale Optimalität gerät, und erhöht die gesamte Anpassungsfähigkeit an Änderungen in den Aufgabenmustern sowie Schwankungen in den Ressourcenzyklen.

Abbildung 3A zeigt den Trend des Zielfunktionswerts in Abhängigkeit von der Anzahl der Trainingsiterationen unter verschiedenen Abschneidegrenzwerten. Die horizontale Achse stellt die Anzahl der Trainingsiterationen dar, die vertikale Achse den numerischen Wert der begrenzten Zielfunktion. ε wird auf 0,1, 0,2 und 0,3 festgelegt, was unterschiedliche Grade der Stärke der Steuerung des Politikdrifts repräsentiert. Die Kurve, die einem kleineren ε-Wert entspricht, schwankt weniger, und die Zielfunktion bleibt stabil. Bei ε = 0,1 liegt der Gesamtwert der Zielfunktion zwischen 0,8 und 1 und zeigt die schrittweise Anpassung und Stabilität der Strategieaktualisierung. Ein größerer ε-Wert hingegen führt zu deutlichen Schwankungen. Bei ε = 0,3 liegt der Gesamtwert der Zielfunktion zwischen 0,65 und 0,95, und die Kurve der Zielfunktion weist eine größere Oszillationsamplitude auf, was das Risiko einer starken Abweichung im Strategieaktualisierungsprozess widerspiegelt. Je kleiner der Schwellenwert, desto stabiler ist die Strategie, was sie für stark eingeschränkte Planungsumgebungen geeignet macht. Abbildung 3B zeigt die Veränderungen der verallgemeinerten Vorteilsschätzung unter verschiedenen Koeffizienten zur Rückverfolgungsbilanzierung. λ wird jeweils auf 0,8, 0,9 und 1,0 gesetzt, um die Tiefe der Rückverfolgung zukünftiger Belohnungen zu steuern. Die Kurve zeigt, dass bei höherem λ die GAE-Schwankungen geringer sind, der langfristige Trend glatter verläuft und der potenzielle Einfluss von Planungsverhalten über mehrere Schritte hinweg genauer erfasst wird. Die Kurve mit λ = 0,8 weist deutliche periodische Schwankungen auf, was darauf hinweist, dass sie stärker auf unmittelbare Belohnungen reagiert und sich besser für kurzfristige, plötzliche Aufgaben eignet. Im Gegensatz dazu konzentriert sich ein λ von 1,0 stärker auf die Modellierung langfristiger Trends und ist für periodische Aufgabenszenarien geeignet.

Analysen zur Rechenkomplexität und Skalierbarkeit
Die Rechenkomplexität des vorgeschlagenen Transformer-PPO-Frameworks ergibt sich aus zwei Hauptkomponenten: dem Transformer-Encoder und der PPO-Richtlinienoptimierung.

Für den Transformer-Encoder mit L Schichten, H Attention-Köpfen, einer Embedding-Dimension d und einer Eingabesequenzlänge T (dem historischen Zeitfenster) beträgt die Zeitkomplexität pro Vorwärtsdurchlauf O(L·T2·d + L·T·d2), wobei der Term T2 aus dem Selbst-Attention-Mechanismus resultiert. In der Implementierung gilt L = 3, H = 4, d = 128, und T ist auf 100 Zeitschritte festgelegt, was einen überschaubaren Rechenaufwand ergibt. Bei längeren historischen Fenstern wird der quadratische Term T2 zum dominierenden Faktor; in der Praxis umfasst die Planung von Gewerkschaftsaktivitäten jedoch typischerweise begrenzte historische Zeiträume (z. B. gleitende Fenster von einem Quartal oder einem Jahr), und die zeitliche Auflösung kann angepasst werden, um Genauigkeit und Effizienz auszugleichen.

Für die PPO-Komponente handelt es sich bei dem Policy-Netzwerk und dem Wert-Netzwerk um leichte MLPs (256 bzw. 128 Neuronen pro versteckter Schicht), deren Inferenzkomplexität O(d·m) beträgt, wobei m die Anzahl der versteckten Einheiten ist und im Vergleich zum Transformer-Encoder vernachlässigbar ist. Die Aktualisierung der Policy während des Trainings umfasst mehrere Epochen von Mini-Batch-Gradientenaktualisierungen mit einer Komplexität von O(B·E·d2), wobei B die Batch-Größe und E die Anzahl der Aktualisierungsepochen angibt.

Hinsichtlich der Skalierbarkeit weist das Framework drei vorteilhafte Eigenschaften auf. Erstens kann der Attention-Mechanismus über Zeitschritte hinweg parallelisiert werden, was eine effiziente GPU-Beschleunigung ermöglicht. Zweitens ist die Modellgröße unabhängig von der Anzahl der Aktivitäten oder Ressourcen, da die Nebenbedingungsmatrix bei jedem Planungsschritt dynamisch erstellt und nicht als feste Parameter eingebettet wird. Dadurch kann dasselbe trainierte Modell ohne erneutes Training in Verbänden unterschiedlicher Größe eingesetzt werden. Drittens kann bei extrem groß angelegten Szenarien die Länge des historischen Zeitfensters T und die Einbettungsdimension d als Kompromiss reduziert werden, oder die Variante mit spärlicher Attention (sparse attention) kann verwendet werden, um die O(T2)-Komplexität auf O(T log T) oder O(T) zu verringern.

Ergebnisse

Experimentelle Daten
Um die Leistung des in dieser Arbeit vorgestellten Transformer-PPO-Dynamischen-Zeitplanungs-Algorithmus umfassend zu bewerten, verwendet das Experiment als Benchmark-Datensatz Aktivitätsverwaltungsdaten einer großen Unternehmensgewerkschaft aus den letzten drei Jahren. Dieser Datensatz enthält über 5.000 Aktivitätsaufzeichnungen, die verschiedene Typen umfassen, darunter Sitzungen, Schulungen und Unterhaltungsveranstaltungen, sowie Planungsinformationen für mehrere Ressourcen wie Räumlichkeiten, Ausrüstung und Personal. Jeder Datensatz enthält Angaben zur Start- und Endzeit der Aktivität, den erforderlichen Ressourcen, der Priorität und dem tatsächlichen Ausführungsstatus (einschließlich Konfliktereignisse und Ressourcennutzung). Um dynamische Änderungen in realen Szenarien zu simulieren, wurden die Daten um zusätzliche 10 % zufälliger Burst-Aufgaben und Ressourcenänderungsereignisse ergänzt (wie beispielsweise vorübergehende Belegung von Standorten oder Anpassungen der Zeitfenster von Mitarbeitern), um die Robustheit des Algorithmus unter stark unsicheren Bedingungen zu überprüfen. Die kontinuierliche Zustandssequenz liefert strukturierte Eingaben für das Transformer-Zeitmodell und das PPO-Richtlinientraining. Im Experiment wurde die Zeitplanungsleistung unter verschiedenen Aufgabendichten und -komplexitäten verglichen, um sicherzustellen, dass die Bewertung typische Szenarien in praktischen Anwendungen abdeckt, und es wurde mit dem derzeit verbreiteten LSTM-PPO-Modell, einem Scheduling-Modell auf Basis von Greedy-Suche sowie einem DQN-Richtlinien-Scheduling-Modell verglichen.

Der Transformer-Encoder besteht aus 3 Schichten, jeweils mit 4 Attention-Köpfen, einer Einbettungsdimension von 128 und einer Feed-Forward-Verdecktengröße von 256. Das Richtliniennetzwerk und das Wertnetzwerk nutzen denselben Transformer-Ausgang als Eingabe und verzweigen sich anschließend in zwei separate mehrschichtige Perzeptrone (MLPs). Jeder MLP verfügt über zwei verdeckte Schichten mit jeweils 256 und 128 Neuronen und verwendet die ReLU-Aktivierung. Alle linearen Schichten werden mithilfe der Xavier-Uniform-Initialisierung initialisiert.

Der Optimierer ist Adam mit einer Lernrate von 3 × 10-4, einer Batch-Größe von 64 und einem Entropiekoeffizienten von 0,01. Der PPO-Abschneideparameter ε ist auf 0,2 festgelegt, der Diskontfaktor γ = 0,99 und GAE λ = 0,95. Das Modell wird über 5.000 Episoden trainiert, wobei jede Episode bis zu 100 Planungsschritte umfasst. Zur Verhinderung von Gradientenexplosion wird ein Gradient-Clipping mit einer maximalen Norm von 0,5 angewendet. Diese Parameter wurden mittels einer vorläufigen Gitter-Suche ausgewählt und entsprechen den üblichen Praktiken bei planungsbasierten Aufgaben mit Verstärkendem Lernen. Alle Experimente werden auf einem einzelnen GPU-Beschleuniger (40 GB Speicher) durchgeführt, unter Verwendung von Python 3.9 und einem Framework für maschinelles Lernen (siehe Tabelle der Materialien).

Zeitlicher Trend der Multi-Head-Attention-Ausgabe, residuale Verstärkung unter zeitlicher Variation der Kodierungsmerkmale und Aufgabenprioritätsstratifizierung
Unter Verwendung der tatsächlichen Planungshistorie als Eingabe werden der Aufgabenantrag, der Ressourcenverbrauch und der Status der Rückmeldung zur Ausführung in kontinuierlichen Zeitschritten extrahiert, und mehrere Informationstypen werden mittels linearer Abbildung und positionsbezogener Kodierung in einem einheitlichen Merkmalsraum eingebettet. Der Multi-Head-Attention-Mechanismus berechnet zeitliche Korrelationen zwischen verschiedenen Merkmalssequenzen parallel und erzeugt drei Arten von Attention-Gewichtssequenzen: Aufgabe, Ressource und Rückmeldung. Jeder Gewichtungstyp repräsentiert die Aufmerksamkeitsintensität des Modells bezüglich des entsprechenden Zustands in jedem Zeitschritt. Nach der Normalisierung wird eine Trendkurve erstellt, die den Wahrnehmungsschwerpunkt der Kodierungsschicht sowie die dynamische Struktur der Veränderungen in den verschiedenen Informationsdimensionen innerhalb der Planungshistorie widerspiegelt. Dieser Prozess basiert auf der tatsächlichen Ausführungssequenz der Aktivitäten und dem Protokoll zum Ressourcenverbrauch im Planungsszenario.

Abbildung 4 zeigt den dynamischen Verlauf der Aufmerksamkeit des Multi-Head-Aufmerksamkeitsmechanismus bezüglich unterschiedlicher Zustandsinformationen bei der Planung gemeinsamer Aktivitäten. Die Zeitschritte sind auf der horizontalen Achse abgetragen und spiegeln die kontinuierliche Fortschreitung der Planungssequenz wider; die vertikale Achse zeigt das normalisierte Aufmerksamkeitsgewicht, das im Intervall [0,1] liegt und die relative Wichtigkeit von Aufgabenmerkmalen, Ressourcenstatus und Feedbackstatus im Modell darstellt. Die Aufmerksamkeit für Aufgabenmerkmale zeigt um den 15. Zeitschritt herum einen deutlichen Peak. In der frühen Phase der Planung priorisiert das Modell die Erfassung zeitlicher Merkmale wichtiger Aufgaben, um potenzielle Konflikte und Engpässe bei den Ressourcen vorherzusagen, was die Risikosensitivität in diesem Stadium der Aktivitätsplanung widerspiegelt. Die Aufmerksamkeitskurve für den Ressourcenstatus weist periodische Schwankungen auf, wobei das Aufmerksamkeitsgewicht insgesamt zwischen 0,2 und 0,8 variiert. Dies spiegelt die kontinuierliche Verfolgung von Veränderungen in der Ressourcennutzung durch das Planungssystem wider, unterstützt die komplexe Verarbeitung von Ressourcenteilung und -zuweisung und ermöglicht eine effektive Reaktion auf den dynamischen Wettbewerb um Ressourcen zwischen mehreren gleichzeitigen Aufgaben. Die Aufmerksamkeit für den Feedback-Status nimmt allmählich zu, wobei der Gewichtspeak etwa bei Schritt 35 auftritt. Dies unterstreicht die Fokussierung des Modells auf die Rückmeldung von Ausführungsergebnissen und异常zuständen in mittleren und späteren Phasen der Planung, was hilft, die Strategie zur Korrektur von Planungsabweichungen anzupassen und die Robustheit der Gesamtplanung zu verbessern. Dieser Trend zeigt, dass eine Kodierungsstruktur, die den Multi-Head-Aufmerksamkeitsmechanismus integriert, feine zeitliche Veränderungen erfassen und die Anpassungsfähigkeit der Planungsstrategien an vielfältige Ressourcen sowie komplexe Aufgabenabhängigkeiten verbessern kann, wodurch die Gesamteffizienz und Stabilität der dynamischen Planung für gemeinsame Aktivitäten gesteigert wird.

Die Kodierungssequenz des versteckten Zustands und die Antwortstruktur der Aufgabenmerkmale werden verarbeitet. Der Zustandsvergleich konstruiert die Merkmalsweiterleitungswege vor und nach der Residualverbindung unter gleichen Eingangsbedingungen, beobachtet die zeitliche Entwicklung des versteckten Zustands über aufeinanderfolgende Zeitschritte hinweg und extrahiert dessen lokale Stabilitäts- und globale Kontinuitätsmerkmale, um die gleichmäßige Entwicklung der Zustandsdarstellung während der Informationsübertragung zu analysieren. Der aufgabengewichtete Antworttrend wird aus dem Aktivierungsweg der Merkmale über verschiedene Strategien zur Gewichtung der Planung extrahiert. Durch die Verfolgung der Aktivierungsgrade verschiedener Aufgabenkategorien über die Zeit wird der dynamische Anpassungseffekt des Modells auf die Fähigkeit zur Aufgabendifferenzierung erfasst.

Abbildung 5A zeigt den Verlauf des verborgenen Zustands des Modells vor und nach Anwendung des Residualverbindungsmechanismus. Die horizontale Achse stellt den Zeitschritt dar, die vertikale Achse den Wert des verborgenen Zustands. Die ursprüngliche Ausgabe ohne Residualverbindung schwankt stark und weist ausgeprägte lokale Instabilitäten sowie Trendbrüche auf. Die durchgezogene blaue Linie repräsentiert den Zustandswert nach Anwendung der Residualstruktur. Der Gesamtverlauf bleibt stabil, und die Schwankungen sind deutlich reduziert, was darauf hinweist, dass das Modell während der Zustandsweitergabe eine Gradientenpufferung und Merkmalsverstärkung erreicht. Dieses Phänomen bestätigt die Rolle des Residualmechanismus bei der Verbesserung der Stabilität langfristiger Abhängigkeitsstrukturen, wirksam unterdrückt die Informationsdämpfung durch tiefere Schichten und stärkt die kontinuierliche Ausdruckskraft historischer Zustandssequenzen. Abbildung 5B zeigt die Dynamik der Merkmalsaktivierung für drei Aufgabentypen in einer Zeitreihe. Die horizontale Achse entspricht dem Zeitschritt, die vertikale Achse dem Wert der Merkmalsaktivierung und spiegelt die zeitliche Empfindlichkeit sowie die strategische Aufmerksamkeit von Aufgaben unterschiedlicher Prioritätsstufen wider. Niedrigpriorisierte Aufgaben zeigen einen abnehmenden Trend, wobei der Wert der Merkmalsaktivierung im späteren Verlauf unter 0,5 sinkt; dies zeigt, dass das Modell ihnen zu Beginn der Planung angemessen Beachtung schenkt und die Ressourcenreaktion im Laufe der Zeit schrittweise abschwächt. Die Merkmale mittelpriorisierter Aufgaben steigen zeitlich langsam an und weisen periodische Oszillationen auf, was darauf hinweist, dass das Modell flexibel auf Nachfrageschwankungen reagiert und diese verfolgt. Hochpriorisierte Aufgaben weisen über die Zeit einen kontinuierlichen Anstieg auf, wobei der Wert der Merkmalsaktivierung stets über 2 bleibt und somit ein hohes, stabiles Aktivierungsniveau aufweist; dies zeigt, dass das Modell gegenüber diesen Aufgaben stets eine hohe Reaktionsbereitschaft aufrechterhält. Diese differenzierte Reaktion demonstriert die Fähigkeit des Zustandskodierungsmoduls, Aufgabenmerkmale präzise zu erkennen, und liefert eine hierarchische Grundlage für Entscheidungen bei der Generierung von Planungsstrategien.

Mehrdimensionale Leistungsentwicklungsanalyse des Transformer-PPO-Dynamikplanungsalgorithmus
Basierend auf der Transformer-Codierung historischer Planungssequenzen und des Ressourcenstatus werden räumlich-zeitliche Merkmale als Zustandseingabe für PPO extrahiert; anschließend gibt das Politiknetzwerk die Planungsaktion aus, und die Umgebung liefert unmittelbare Belohnungen und aktualisiert den Status; im Laufe des Trainingsprozesses werden die ursprünglichen Kennzahlen jeder Runde aufgezeichnet, anschließend wird das Rauschen durch eine gleitende Mittelwertfilterung eliminiert, und der Konvergenztrend des Algorithmus wird analysiert; in der abschließenden Visualisierung zeigen die Originaldaten die momentane Dynamik, während die geglättete Kurve die langfristige Leistungsverbesserung widerspiegelt, wodurch bestätigt wird, dass das Modell eine stabile Planung durch Zeitreihenmodellierung und Politikoptimierung erreicht.

Abbildung 6A,B zeigt die mehrdimensionale Analyse der Leistungsentwicklung des Transformer-PPO-Dynamik-Zuteilungsalgorithmus. Die Schwankungen in den Rohdaten spiegeln das momentane Rauschen im Zuteilungsprozess wider, während die geglätteten Daten mithilfe eines gleitenden Durchschnitts den langfristigen Trend extrahieren, kurzfristige Störungen bei der Bewertung der Algorithmusleistung eliminieren und die Beobachtung der Leistungsentwicklung erleichtern. Aus der Analyse der geglätteten Daten ergibt sich, dass der dynamische Zusammenhang zwischen Belohnung und Politikentropie zeigt, wie die Belohnungskurve logarithmisch ansteigt und die Politik durch Exploration schnell lernt, Aktionen effektiv zu planen; im späteren Verlauf verlangsamt sich das Wachstum, und der Sättigungswert der Belohnung stabilisiert sich bei etwa 12, was darauf hinweist, dass die Politik nahe am lokalen Optimum liegt. Die Politikentropie nimmt allmählich von anfänglich etwa 2,2 auf etwa 0,6 ab. PPO erhält die notwendige Erkundungsfähigkeit über den Entropie-Belohnungsterm. Eine hohe Erkundung (hohe Entropie) in der Anfangsphase fördert einen schnellen Anstieg der Belohnung, während die spätere Strategie Erkundung und Ausnutzung durch Beschränkung und Aktualisierung ausbalanciert. Die koordinierte Optimierung von Konfliktquote und Ressourcenauslastung zeigt, dass die Konfliktquote auf unter 10 % sinkt, wobei die untere Grenze Konflikte widerspiegelt, die aufgrund der Zufälligkeit der Aufgaben im realen System nicht eliminiert werden können. Dieser Abwärtstrend ist direkt auf die Fähigkeit des Transformers zurückzuführen, vergangene Aktivitätssequenzen zu kodieren und dadurch Konkurrenzen um Ressourcen proaktiv vorherzusagen. Die Ressourcenauslastung ist auf nahezu 75 % angestiegen, was dem Gesetz der abnehmenden Grenznutzen entspricht. Es ist plausibel, dass die Auslastung kein höheres Niveau erreicht, da eine übermäßige Auslastung Warteschlangenverzögerungen verursachen könnte. Die Verringerung der Konflikte hat zusätzliche verfügbare Ressourcen freigegeben, und eine optimierte Ressourcenverteilung hat Konflikte weiter unterdrückt.

Bewertung der Reaktionsgeschwindigkeit und Entscheidungseffizienz
Vergleich der durchschnittlichen Entscheidungszeit und durchschnittlichen Reaktionsverzögerung bei unterschiedlichen Aufgabendichten (Anzahl der Aufgaben: 100, 300, 500, 700, 1000). Vergleich des in dieser Arbeit vorgestellten Transformer-PPO-Zeitplanungsmodells mit dem LSTM-PPO-Modell, dem Zeitplanungsmodell mit Greedy-Suche und dem DQN-Strategie-Zeitplanungsmodell.

Abbildung 7A,B zeigt die durchschnittliche Entscheidungszeit und die durchschnittliche Antwortverzögerung für die vier Planungsstrategien unter verschiedenen Bedingungen der Aufgabendichte, wodurch die Fähigkeit des Algorithmus zur Echtzeit-Entscheidungsfindung und die Systemreaktionsfähigkeit unter Hochlastszenarien widergespiegelt werden. Mit steigender Anzahl von Aufgaben zeigt jede Strategie einen Anstieg bei beiden Kenngrößen, wobei die Höhe der Zunahme und die Stabilität variieren. In aufgabenintensiven Szenarien weist die Transformer-PPO-Struktur eine relativ stabile durchschnittliche Entscheidungszeit auf. Bei einer Aufgabendichte von 1000 beträgt die durchschnittliche Entscheidungszeit 0,72 s und die durchschnittliche Antwortverzögerung 1,59 s, was hauptsächlich auf den Komprimierungseffekt der zeitlichen Merkmalscodierung auf den Zustandsraum sowie die effektive Vermeidung ungültiger Operationen im Aktionsraum zurückzuführen ist. Im Gegensatz dazu weist die DQN-Strategie mit zunehmender Aufgabenanzahl längere Entscheidungszeiten und Antwortverzögerungen auf, was ihre begrenzte Fähigkeit zur Generalisierung von Strategien über hochdimensionale Zustandsübergänge widerspiegelt. Obwohl die Greedy-Strategie bei unterschiedlichen Aufgabenmengen schneller Entscheidungen trifft, verschlechtert sich ihre Antwortleistung bei komplexen Aufgabendiagrammen aufgrund fehlender Modellierung langfristiger Abhängigkeiten. LSTM-PPO verfügt über eine gewisse zeitliche Wahrnehmungsfähigkeit bei der Sequenzmodellierung, zeigt jedoch in Szenarien mit langfristigen Abhängigkeiten aufgrund der begrenzten strukturellen Tiefe schlechtere Leistung. Die Ergebnisse verdeutlichen den entscheidenden Einfluss des Strukturdesigns auf die Reaktionsfähigkeit des Planungssystems und unterstreichen die Notwendigkeit einer koordinierten Optimierung des Codierungsmechanismus und der Effizienz der Politikstichprobenahme unter Bedingungen hoher Parallelität.

Konfliktrate und Bewertung der Ressourcennutzung
Unter verschiedenen Bedingungen der Aktivitätstyp-Komplexität (einzelner Typ, mehrere unabhängige Typen, mehrere sich überschneidende Typen, mehrstufiger Workflow, interdisziplinäre Zusammenarbeit, vorübergehende Einfügung, wiederholter Zyklus) werden die Ressourcenkonfliktrate und die durchschnittliche Ressourcenauslastung statistisch analysiert. Das in dieser Arbeit vorgestellte Transformer-PPO-Zeitplanungsmodell wird mit den LSTM-PPO-, Greedy-Such- und DQN-Zeitplanungsmodellen verglichen.

Abbildung 8A,B zeigt die Ressourcenkonfliktrate und die durchschnittliche Ressourcennutzung für verschiedene Planungsmodelle über sieben Aktivitätskomplexitätsstufen hinweg. Die vertikale Achse stellt das Planungsmodell dar, die horizontale Achse den Aktivitätstyp. Der allgemeine Trend zeigt, dass mit zunehmender Komplexität der Aktivitätsstruktur (wie mehrstufige Prozesse, interdisziplinäre Zusammenarbeit, temporäre Einplanung und wiederholte Zyklen) die Konfliktrate in allen Modellen ansteigt. Die gierige Strategie und das DQN-Verfahren weisen eine begrenzte Anpassungsfähigkeit an dynamische Änderungen auf und sind bei der Konfliktkontrolle eindeutig unzureichend. Das Transformer-PPO-Modell hält auch unter komplexen Bedingungen eine niedrige Konfliktrate aufrecht, mit einer Gesamtkonfliktrate von 0,05–0,12, was auf ein tiefes Verständnis der Aufgabenabhängigkeiten und Ressourcenänderungen schließen lässt. Hinsichtlich der Ressourcennutzung bleibt das Transformer-PPO-Modell unter allen Bedingungen auf hohem Niveau, insbesondere bei mehrfacher Überlappung und temporärer Einplanung. Seine dynamische Anpassungsstrategie reduziert effektiv die Ressourcenleerlaufzeiten, mit einer durchschnittlichen Ressourcennutzungsrate von 0,75–0,86. Die Daten bestätigen, dass das Transformer-PPO-Modell ein besseres Gleichgewicht zwischen Planungsflexibilität und Ressourceneffizienz erreicht und eine höhere Praxistauglichkeit sowie Skalierbarkeit bietet.

Planungsstabilität
Der Planungsstabilitätsindex wird unter verschiedenen Bedingungen hinsichtlich der Aktivitätstyp-Komplexität berechnet (einzelner Typ, mehrere unabhängige Typen, mehrere sich überschneidende Typen, mehrstufiger Prozess, interdisziplinäre Zusammenarbeit, vorübergehende Einfügung und sich wiederholender Zyklus). Das in dieser Arbeit vorgestellte Transformer-PPO-Planungsmodell wird mit den LSTM-PPO-, Greedy-Such- und DQN-Planungsmodellen verglichen.

Tabelle 1 zeigt die Vergleichsergebnisse für den Planungsstabilitätsindex verschiedener Planungsmodelle unter sieben Komplexitätsbedingungen von Aktivitätstypen. Der ausgewählte Komplexitätstyp spiegelt die Stabilitätsleistung des Planungssystems über mehrere Szenarien hinweg wider. Der Indexwert liegt zwischen 0 und 1. Je höher der Wert, desto stärker ist die Widerstandsfähigkeit des Modells gegenüber Planungsstörungen und desto stabiler ist die Strategieausgabe. Die experimentellen Ergebnisse zeigen, dass Transformer-PPO unter allen Aufgabenstrukturen einen hohen Stabilitätsindex beibehält. Insbesondere in Szenarien mit mehreren Typen, interdepartementaler Zusammenarbeit und wiederholten Zyklen ist die Stabilität der Planungsstrategie besser als die der anderen Modelle, was starke Fähigkeiten zur Erhaltung der Struktur und zur adaptiven Planung belegt. Der gesamte Planungsstabilitätsindex liegt zwischen 0,8 und 0,91. Im Gegensatz dazu nahm die Stabilität des Greedy-Algorithmus und von DQN deutlich ab, als die Aufgabenstruktur komplexer wurde, mit offensichtlichem Policy-Jitter und Ausführungsabweichungen. LSTM-PPO weist eine gewisse Stabilität auf, bleibt aber in der Gesamtleistung hinter Transformer-PPO zurück. Dieser Vergleich bestätigt den positiven Beitrag des Multi-Head-Attention-Mechanismus und des Policy-Pruning-Update-Mechanismus zur Stabilität der Planungsausgabe und unterstreicht den Vorteil des Modells hinsichtlich Stabilität in komplexen Szenarien mit verbundenen Aktivitäten.

Analyse der Anpassung an die Last bei gleichzeitigen Aufgaben
Wenn die Anzahl gleichzeitiger Aufgaben weiter steigt, muss das Planungssystem die beiden Herausforderungen der Ressourcenverteilungskonflikte und der verminderten Generalisierungsfähigkeit der Strategien bewältigen. Um die Anpassungsfähigkeit verschiedener Modelle unter zunehmender Aufgabenlast zu testen, werden in diesem Abschnitt drei Stufen der Aufgabenparallelität festgelegt (niedrig: 100 Elemente, mittel: 500 Elemente und hoch: 1000 Elemente), um die Verteilung der Systemressourcen und die Konsistenz der Strategieantwort während des Planungszyklus zu überwachen. Der Ressourcenbilanz-Index wird verwendet, um die Lastverteilung auf verschiedene Ressourceneinheiten während des Planungsvorgangs widerzuspiegeln, und wie folgt berechnet:

Formel für statisches Gleichgewicht, Br-Gleichung, symbolische mathematische Analyse.    (7)

ui steht für die tatsächliche Auslastungsrate der Ressourceneinheiten; ū steht für die durchschnittliche Auslastungsrate aller Ressourcen; und N steht für die Gesamtanzahl der Ressourcen. Der Wertebereich liegt bei [0,1], und je näher der Wert an 1 ist, desto ausgewogener ist die Ressourcenverteilung.

Der Robustheitsindex für die Politikübertragung Rs misst das Ausmaß der Konsistenz der Politikausgabe unter verschiedenen Arbeitslastbedingungen und ist definiert als:

Formel für statisches Gleichgewicht: Rs=1−(1/T)ΣTt=1 ||πt(L)−πt(H)||1/2, mathematische Analyse-Diagramm.    (8)

πt(L) und πt(H) sind die Verteilungen der Planungsstrategie unter geringer und hoher Auslastungsszenarien, respectively, und T ist der gesamte Zeitschritt. Je näher der Wert bei 1 liegt, desto stärker ist die Robustheit der Strategiewanderung und desto höher die Anpassungsfähigkeit.

Tabelle 2 stellt systematisch die Leistung der vier Scheduling-Modelle hinsichtlich Ressourcenbalance und Robustheit der Politikübertragung unter variierenden Aufgabenparallelitätslasten dar. Die Aufgabenparallelitätsstufen sind jeweils auf niedrig (100 Elemente), mittel (500 Elemente) und hoch (1000 Elemente) eingestellt und spiegeln die Anpassungsfähigkeit des Modells unter unterschiedlichen Belastungen durch Aufgabenumfang wider. Die Ergebnisse zeigen, dass das Transformer-PPO-Modell bei allen Laststufen den höchsten Ressourcenbalance-Index erreicht, was seine Fähigkeit widerspiegelt, Ressourcen in Szenarien mit parallelen Mehrfachaufgaben rational zu verteilen. Gleichzeitig ist auch der Index für die Robustheit der Politikübertragung deutlich besser als bei den Vergleichsmodellen, was auf eine starke Konsistenz und Anpassungsfähigkeit der Politik hinweist. Unter Bedingungen hoher Parallelität betragen der Ressourcenbalance-Index und der Index für die Robustheit der Politikübertragung jeweils 0,88 und 0,85. Im Vergleich dazu belegte LSTM-PPO den zweiten Platz, während der Greedy-Algorithmus und das DQN-Modell unter hoher Last eine deutliche Leistungsminderung zeigten, wobei eine ungleichmäßige Ressourcenverteilung und zunehmende Politikschwankungen besonders auffällig waren. Diese Bewertung offenbarte eindeutig Unterschiede im Ressourcenmanagement und in der Politikrobustheit des Scheduling-Systems bei zunehmender Aufgabenlast und bestätigte zudem die Anwendbarkeit und Überlegenheit der Transformer-PPO-Verbundlösung für die dynamische und komplexe Planung gemeinsamer Aktivitäten.

Vergleich mit weiteren modernen Methoden
Um die vorgeschlagene Methode zusätzlich an aktuellen Spitzenverfahren (SOTA) zu messen, wurden drei repräsentative Algorithmen aus der neuesten Literatur implementiert, die maschinelles Lernen mit Verstärkendem Lernen für Planungsprobleme kombinieren: (1) Transformer+DQN42, wobei derselbe Transformer-Encoder wie in unserer Methode verwendet wird, jedoch DQN anstelle von PPO für das Policiernen eingesetzt wird, wie es in jüngsten wertbasierten Planungsstudien untersucht wurde; (2) GRU+PPO43, bei dem der Transformer-Encoder durch eine Gated Recurrent Unit (GRU) ersetzt wird, um zeitliche Abhängigkeiten abzubilden, was moderne, auf RNNs basierende Verfahren repräsentiert; und (3) GraphSAGE+PPO44, das einen GraphSAGE-Encoder verwendet, um Aufgaben-Ressourcen-Beziehungen als Graphen abzubilden, was aktuelle Ansätze mit graphbasierten neuronalen Netzen für die Terminplanung widerspiegelt. Alle Methoden wurden unter identischen experimentellen Bedingungen (denselben Datensatz, Aufgaben-Dichte von 1000 und gleicher Episodeneinrichtung) trainiert, wobei die Hyperparameter mittels Gittersuche optimiert wurden, um einen fairen Vergleich zu gewährleisten. Jede Methode wurde über 10 unabhängige Durchläufe evaluiert, und die Mittelwerte wesentlicher Leistungskennzahlen (Antwortverzögerung, Ressourcenkonflikt-Rate, Ressourcenauslastung und Stabilitätsindex der Planung) wurden erfasst.

Wie in Tabelle 3 gezeigt, übertrifft die vorgeschlagene Transformer+PPO-Methode bei allen ausgewerteten Metriken durchgängig alle drei SOTA-Baseline-Verfahren. Die durchschnittliche Antwortverzögerung der vorgeschlagenen Methode (1,59 s) ist deutlich geringer als die von Transformer+DQN (2,13 s), GRU+PPO (1,89 s) und GraphSAGE+PPO (1,72 s), was auf eine überlegene Effizienz bei der Entscheidungsfindung hinweist. Auch die Rate an Ressourcenkonflikten ist bei der vorgeschlagenen Methode mit 0,09 am niedrigsten, was auf eine bessere proaktive Vermeidung von Konflikten schließen lässt. Diese Verbesserung ist auf die Multi-Head-Attention des Transformers zurückzuführen, die langreichweitige Abhängigkeiten effektiver erfasst als GRU oder GraphSAGE, kombiniert mit den stabilen Policy-Updates von PPO. Hinsichtlich der Ressourcennutzung erreicht die vorgeschlagene Methode einen Wert von 0,82 und übertrifft damit die anderen Verfahren um mindestens 8 Prozentpunkte, was eine effizientere Ressourcenverteilung belegt. Auch der Stabilitätsindex der vorgeschlagenen Methode (0,88) ist am höchsten, was bestätigt, dass das Clipping-Objektiv und die GAE-Korrektur in PPO robustere Planungsstrategien hervorbringen als DQN oder andere PPO-Varianten. Insgesamt belegen die Ergebnisse, dass die spezifische Kombination aus Transformer und PPO im vorgeschlagenen Framework klare Vorteile gegenüber jüngeren alternativen Architekturen bietet und die Eignung für den Einsatz in der dynamischen Planung von Vereinsaktivitäten weiter untermauert.

VERFÜGBARKEITSERKLÄRUNG FÜR DATEN:
Der anonymisierte Datensatz, der in dieser Studie verwendet wurde, zusammen mit der Daten-Vorverarbeitungspipeline und den Evaluierungsskripten, wurde im Figshare-Repository hinterlegt und ist öffentlich verfügbar unter https://doi.org/10.6084/m9.figshare.33059243 (DOI: 10.6084/m9.figshare.33059243). Der Datensatz enthält Aktivitätspläne, Ressourcennutzungsprotokolle und Konflikt-Ereignisaufzeichnungen aus einer großen gewerkschaftlichen Organisation, wobei alle personenbezogenen und kommerziell sensiblen Informationen entfernt wurden.

Diagramm des maschinellen Lernablaufs mit Aufgabenabbildung, Feedback-Schleifen und Policy-Optimierung.
Abbildung 1: Struktur des Systems zur Planung von Vereinsaktivitäten. Anfrage für Aktivitäten, Informationen zur Ressourcenverfügbarkeit und zur personellen Zeitfenster werden integriert, um einen Aufgaben-Ressourcen-Bedingungsgraphen und eine Konfliktmatrix zu erstellen. Historische Sequenzen von Aktivitäten und Ressourcenzuständen werden mithilfe eines Transformers mit Multi-Head-Attention kodiert. Die kodierten Zustände werden an die Proximal Policy Optimization (PPO)-Policy- und Wertnetzwerke übergeben, die Wahrscheinlichkeiten für Planungsaktionen und Schätzungen der Zustandswerte generieren. Ausgewählte Aktionen aktualisieren die Planungsumgebung und erzeugen Belohnungen. Die begrenzte PPO-Zielfunktion und die verallgemeinerte Vorteilsschätzung werden anschließend verwendet, um das Modell zu aktualisieren, wodurch eine geschlossene Feedback-Schleife für adaptive Planung und Ressourcenverteilung entsteht. Bitte klicken Sie hier, um eine vergrößerte Version dieser Abbildung anzusehen.

Netzwerktopologiediagramm, Knoten durch Aufgaben verbunden, die die vernetzte Systemstruktur veranschaulichen.
Abbildung 2: Netzwerk der Aufgabenkonfliktgewichte (die Dicke der Kanten spiegelt die Schwere des Konflikts wider). Jeder Knoten repräsentiert eine noch zu planende Aktivität, und jede Kante steht für einen Konflikt, der durch die gleichzeitige Nutzung von Personal, Veranstaltungsorten, Ausrüstung oder anderen Ressourcen entsteht. Die Dicke der Kanten ist proportional zum berechneten Konfliktgewicht, wobei dickere Kanten schwerwiegendere Konflikte anzeigen. Dicht verbundene Knotengruppen stellen mögliche Engpässe bei Ressourcen und konkurrierende Aufgabencluster dar. Zur Positionsbestimmung der Knoten wird ein kraftbasiertes Layout verwendet, bei dem stark konkurrierende Aufgaben näher beieinander platziert werden. Bitte klicken Sie hier, um eine vergrößerte Version dieser Abbildung anzusehen.

Diagramme des Verstärkungslernens: Begrenztes Politikziel, GAE-Schätzungen; Analyse der Trainingsiteration.
Abbildung 3: Dynamische Eigenschaften der Strategiestabilität und der Vorteilsschätzung während der Iteration der Terminplanungsoptimierung. (A) Begrenztes Politikziel bei variierendem ε. (B) Schwankungen der GAE bei verschiedenen λ-Einstellungen. Bitte klicken Sie hier, um eine vergrößerte Version dieser Abbildung anzusehen.

Gewichtung der Aufmerksamkeit im Vergleich zum Zeitschritt; Aufgaben-, Ressourcen-, Feedback-Zustandsvergleich; normalisierte Werte.
Abbildung 4: Zeitlicher Verlauf der Ausgabe der Multi-Head-Aufmerksamkeit Bitte klicken Sie hier, um eine größere Version dieser Abbildung anzusehen.

Dynamik versteckter Zustände, Vergleich der Merkmalsaktivierung, Zeitpunktdiagramme, Analyse von Residualverbindungen.
Abbildung 5: Residuale Verbesserung und Aufgabenprioritätsstufung bei zeitlicher Variation der Kodierungsmerkmale. (A) Vergleich des versteckten Zustands vor und nach der Residualverbindung. (B) Zeitbasierte Merkmalsaktivierung für unterschiedliche Aufgabenprioritäten. Bitte klicken Sie hier, um eine größere Version dieser Abbildung anzusehen.

Belohnungs- und Policy-Entropie-Diagramme; Konfliktquote und Ressourcennutzung über Trainings-Epochen.
Abbildung 6: Analyse der mehrdimensionalen Leistungsentwicklung. (A) Belohnung und Policy-Entropie (B) Konfliktquote und Ressourcennutzung. Bitte klicken Sie hier, um eine vergrößerte Version dieser Abbildung anzusehen.

Diagramme zum Vergleich von Entscheidungszeit und Antwortverzögerung in Abhängigkeit vom Aufgabenumfang für Algorithmen: Transformer-PPO, LSTM-PPO, Greedy, DQN.
Abbildung 7: Durchschnittliche Entscheidungszeit und durchschnittliche Antwortverzögerung. (A): Entscheidungszeit bei variierender Arbeitslast. (B): Antwortverzögerung bei variierender Arbeitslast. Bitte klicken Sie hier, um eine größere Version dieser Abbildung anzusehen.

Heatmap-Vergleich der Ressourcenkonfliktrate und durchschnittlichen Auslastung; Analyse der Algorithmusleistung.
Abbildung 8: Vergleich der Ressourcenkonfliktrate und durchschnittlichen Ressourcenauslastung (A) Ressourcenkonfliktrate. (B) Durchschnittliche Ressourcenauslastung Bitte klicken Sie hier, um eine größere Version dieser Abbildung anzusehen.

AktivitätskomplexitätsbedingungTransformer-PPOLSTM-PPOGreedy-AlgorithmusDQN
Einzeltyp0.910.860.740.78
Mehrfachtyp unabhängig0.880.810.70.73
Mehrfachtyp verflochten0.850.760.650.68
Mehrstufiger Workflow0.830.730.610.66
Interdisziplinäre Zusammenarbeit0.80.70.590.63
Vorübergehende Einfügung0.860.780.680.72
Wiederholungszeitraum0.840.750.640.69

Tabelle 1: Vergleich des Stabilitätsindex für die Planung bei unterschiedlichen Aktivitätskomplexitäten. Die Stabilitätsindizes für die Planung der Modelle Transformer–PPO, langzeitkurzzeitgedächtnisbasiertes PPO (LSTM–PPO), gierige Suche (greedy-search) und tiefes Q-Netzwerk (DQN) werden unter sieben Bedingungen verglichen: einheitliche Aktivitäten, unabhängige mehrfache Aktivitätstypen, sich überschneidende mehrfache Aktivitätstypen, mehrstufige Workflows, interdisziplinäre Zusammenarbeit, zeitweilige Aufgabeneinbindung und sich wiederholende Aktivitätszyklen. Der Stabilitätsindex reicht von 0 bis 1, wobei höhere Werte eine größere Widerstandsfähigkeit gegenüber Planungsstörungen und konsistentere Policy-Ausgaben anzeigen.

Bedingung zur AufgabenparallelitätPlanungsmodellIndex zur RessourcenbalanceRobustheitsindex für Politikübertragung
Geringe Parallelität (100 Aufgaben)Transformer-PPO0.940.92
LSTM-PPO0.890.85
Greedy-Algorithmus0.830.78
DQN0.850.81
Mittlere Parallelität (500 Aufgaben)Transformer-PPO0.910.89
LSTM-PPO0.860.82
Greedy-Algorithmus0.780.71
DQN0.810.76
Hohe Parallelität (1000 Aufgaben)Transformer-PPO0.880.85
LSTM-PPO0.820.76
Greedy-Algorithmus0.70.63
DQN0.750.68

Tabelle 2: Bewertung der Anpassungsfähigkeit an die Last bei gleichzeitigen Aufgaben. Der Ressourcenbilanz-Index und der Robustheitsindex für die Übertragung von Steuerungsstrategien der vier Planungsmodelle werden unter Bedingungen geringer, mittlerer und hoher Parallelität verglichen, die jeweils 100, 500 und 1.000 gleichzeitige Aufgaben entsprechen. Beide Indizes reichen von 0 bis 1, wobei höhere Werte für eine ausgeglichenere Ressourcenverteilung und eine größere Konsistenz der Planungsstrategien bei wechselnden Aufgabenlasten stehen.

MethodeDurchschnittliche Antwortverzögerung (s)RatenkonfliktquoteRessourcennutzungStabilitätsindex
Transformer+DQN2.13 ± 0.120.18 ± 0.020.68 ± 0.030.76 ± 0.04
GRU+PPO1.89 ± 0.090.15 ± 0.010.72 ± 0.020.79 ± 0.03
GraphSAGE+PPO1.72 ± 0.080.13 ± 0.010.74 ± 0.020.82 ± 0.03
Vorgeschlagen1.59 ± 0.050.09 ± 0.010.82 ± 0.020.88 ± 0.02
(Transformer+PPO)

Tabelle 3: Leistungsvergleich mit zusätzlichen modernsten Methoden. Die vorgeschlagene Transformer–PPO-Methode wird unter identischen experimentellen Bedingungen bei einer Aufgabendichte von 1.000 mit Transformer–DQN, Gated Recurrent Unit–PPO (GRU–PPO) und GraphSAGE–PPO verglichen. Die Ergebnisse stellen Mittelwerte aus 10 unabhängigen Durchläufen dar. Die ausgewerteten Kenngrößen umfassen die Antwortverzögerung in Sekunden, die Ressourcenkonfliktquote, die Ressourcennutzungsquote sowie den Planungsstabilitätsindex. Geringere Antwortverzögerungen und Konfliktquoten weisen auf eine bessere Leistung hin, während höhere Werte der Ressourcennutzung und der Stabilitätsindizes eine bessere Leistung anzeigen.

Diskussion

Die experimentellen Ergebnisse zeigen, dass der vorgeschlagene Transformer-PPO-Algorithmus die Baseline-Methoden (LSTM-PPO, Greedy-Suche und DQN) bei allen Evaluierungsmetriken konsistent übertrifft. Die überlegene Leistung ist auf zwei entscheidende Faktoren zurückzuführen. Erstens erfasst der Multi-Head-Self-Attention-Mechanismus des Transformers effektiv langreichweitige zeitliche Abhängigkeiten in Aktivitäts- und Ressourcenstatussequenzen, wodurch potenzielle Konflikte proaktiv identifiziert werden können. Dies erklärt, warum die Konfliktrate auch bei hoher Komplexität (z. B. interdisziplinäre Zusammenarbeit und temporäre Einfügung) niedrig bleibt, da das Modell Ressourcenkonkurrenz bereits im Voraus antizipieren kann. Zweitens gewährleisten die gekürzte Zielfunktion und die auf GAE basierende Vorteilsbereinigung im PPO stabile Politikaktualisierungen, verhindern drastische Schwankungen bei den Planungsentscheidungen und sorgen für hohe Robustheit unter wechselnden Aufgabenlasten.

Im Vergleich zu bestehenden Planungsmethoden behebt die vorgeschlagene Methode die Einschränkungen von LSTM-basierten Modellen, die unter verschwindenden Gradienten bei langen Sequenzen leiden, und überwindet die geringe Verallgemeinerungsfähigkeit von Greedy- und DQN-Methoden in dynamischen Umgebungen. Obwohl LSTM-PPO eine moderate Leistung zeigt, versagt es bei langen zeitlichen Abhängigkeiten zwischen Aufgaben, die Stabilität aufrechtzuerhalten, was sich in höheren Konfliktraten und einer geringeren Ressourcenbalance bei hoher Parallelität widerspiegelt. Der Greedy-Algorithmus ist zwar rechentechnisch effizient, weist jedoch keine Weitsicht auf und führt zu suboptimaler Ressourcenverteilung, wodurch sich die Antwortverzögerungen erhöhen. DQN hingegen zeigt Policy-Oszillationen aufgrund des Fehlens einer Trust-Region-Beschränkung, was seine Leistung in Szenarien mit mehreren Aufgaben beeinträchtigt.

Trotzdem weist diese Studie mehrere Einschränkungen auf. Der Datensatz stammt aus einer einzelnen Unternehmensgewerkschaft, was die Übertragbarkeit der Ergebnisse auf andere organisatorische Kontexte einschränken kann. Außerdem setzt das Modell voraus, dass sämtliche Aktivitäts- und Ressourceninformationen vollständig beobachtbar sind, was in realen Szenarien mit unvollständigen oder verrauschten Daten nicht zutreffen mag. Der rechnerische Aufwand des Transformer-Encoders steigt zudem mit der Länge des historischen Zeitfensters, was die Echtzeit-Anwendbarkeit bei äußerst groß angelegten Systemen beeinträchtigen könnte.

Zukünftige Arbeiten können darauf abzielen, das Modell zur Handhabung teilweise beobachtbarer Umgebungen mithilfe rekurrenter Zustandsschätzung zu erweitern und Meta-Lern-Techniken einzubinden, um eine schnelle Anpassung an neue Zusammenschlüsse mit begrenzten historischen Daten zu ermöglichen. Außerdem planen wir, den Algorithmus in einer Cloud-Edge-Kollaborationsarchitektur bereitzustellen, um die Entscheidungslatenz zu verringern und verteilte Planung zu unterstützen. Darüber hinaus könnte die Integration erklärbarer KI-Komponenten nachvollziehbare Begründungen für die Planung liefern, was das Vertrauen und die praktische Anwendung verbessert.

Diese Arbeit untersucht einen dynamischen Optimierungsalgorithmus für die Terminplanung, der Transformer und die PPO-Verstärkungslernmethode integriert und sich auf häufige Ressourcenkonflikte sowie verzögerte Reaktionen bei der Planung von Vereinsaktivitäten konzentriert. Der Algorithmus analysiert mithilfe eines Mehrfach-Attention-Mechanismus detailliert die räumlich-zeitlichen Merkmale der Aktivitätsverläufe und des Ressourcenstatus und verbessert dadurch die Fähigkeit, potenzielle Konfliktrisiken zu erkennen. In Kombination mit dem stabilen Aktualisierungsmechanismus der Strategie für die geklammerte Zielfunktion ermöglicht er eine effiziente Reaktion und Ressourcenverteilung in dynamischen Umgebungen. Diese Methode zeigt hervorragende Fähigkeiten in Bezug auf Planungsstabilität, Ressourcennutzung und Konfliktkontrolle bei komplexen und vielfältigen Aktivitätsarten und Arbeitslasten. Die empirische Analyse zeigt, dass der Algorithmus bei hoher Aufgabenkonzentration eine geringe Reaktionsverzögerung aufweist. Bei sieben unterschiedlichen Aktivitätsarten und -komplexitäten liegt die Ressourcenkonfliktrate bei 0,05–0,12, die durchschnittliche Ressourcennutzung bei 0,75–0,86 und der Index der Planungsstabilität bei 0,8–0,91. Er hält eine niedrige Ressourcenkonfliktrate und ein hohes Maß an Ressourcenbalance aufrecht, was signifikant besser ist als bei den derzeit gängigen LSTM-PPO-, Greedy-Search- und DQN-Planungsmodellen. Gleichzeitig sind die Robustheit der Strategieübertragung und die Planungsstabilität beide gut, was darauf hinweist, dass der Algorithmus über eine starke Anpassungsfähigkeit und Störungstoleranz verfügt. Dieser Leistungsvorteil bietet eine solide technische Unterstützung für das Verwaltungssystem von Vereinsaktivitäten in dynamischen und wechselnden Szenarien der Ressourcenplanung.

Offenlegungen

Die Autoren erklären, dass sie keine finanziellen Interessenkonflikte haben.

Materialien

Liste der in diesem Artikel verwendeten Materialien
NameUnternehmenKatalognummerKommentare
Python 3.9Python Software Foundationhttps://www.python.org/downloads/release/python-390/Kernprogrammiersprache
PyTorch 1.12Meta AIhttps://pytorch.org/get-started/previous-versions/Tiefenlern-Framework (Implementierung von Transformer/PPO)
NumPy 1.23NumPy-Entwicklerhttps://numpy.org/doc/stable/release/1.23.0-notes.htmlBibliothek für numerische Berechnungen
Matplotlib 3.5Matplotlib-Entwicklungsteamhttps://matplotlib.org/stable/users/installing.htmlVisualisierung der Ergebnisse
Datensatz zur Terminplanung von GewerkschaftsaktivitätenInterner Datenbestand eines kooperierenden Unternehmens (anonymisiert)Nicht öffentlich zugänglich aufgrund einer Vertraulichkeitsvereinbarung; Forschende können den korrespondierenden Autor für den Zugang kontaktierenMehr als 5.000 Aktivitätseinträge (Besprechungen, Schulungen, Unterhaltung) aus einer großen Unternehmensgewerkschaft über einen Zeitraum von drei Jahren
NVIDIA A100 GPU
PyTorch

Referenzen

  1. Bosire RK, Muya J, Matula D. Employee recognition programs and employee output as moderated by workers’ union activities: evidence from Kenyatta National Hospital (KNH), Kenya. Saudi J Bus Manag Stud. 2021;6(3):61-70.
  2. Carneiro B, Costa HA. Digital unionism as a renewal strategy? Social media use by trade union confederations. J Ind Relat. 2022;64(1):26-51.
  3. Geelan T. Introduction to the special issue: the internet, social media and trade union revitalization—still behind the digital curve or catching up? New Technol Work Employ. 2021;36(2):123-39.
  4. Hennebert MA, Pasquier V, Lévesque C. What do unions do…with digital technologies? An affordance approach. New Technol Work Employ. 2021;36(2):177-200.
  5. Panagiotopoulos P. Digital audiences of union organising: a social media analysis. New Technol Work Employ. 2021;36(2):201-18.
  6. Wang W, Seifert R. Trade-union-engendered employee trust in senior management: a case study of digitalisation. Ind Relat J. 2024;55(6):472-91.
  7. Katsabian T. Collective action in the digital reality: the case of platform-based workers. Mod Law Rev. 2021;84(5):1005-40.
  8. Holgate J. Trade unions in the community: building broad spaces of solidarity. Econ Ind Democr. 2021;42(2):226-47.
  9. Ovi RP, Rana MS, Jodder PK, Sarkar B. Performance evaluation of e-service delivery of union digital centers at the local level using composite indexing method: a study of Batiaghata upazilla in Khulna district. Inf Dev. 2024;40(4):620-34.
  10. Crossan J, et al. Colours of democracy: trade union banners and the contested articulations of democratic spatial practices. Trans Inst Br Geogr. 2023;48(1):23-38.
  11. Victor C, Kavishe AM. The challenges faced by trade unions in improving employee welfare and strategies to address them: a case of the Tanzania Union of Government and Health Employees (TUGHE) at the National Health Insurance Fund (NHIF). Afr J Empir Res. 2025;6(1):189-200.
  12. Rogalewski A. Trade unions challenges in organising Polish workers: a comparative case study of British and Swiss trade union strategies. Eur J Ind Relat. 2022;28(4):385-404.
  13. Pacetti V, Rossi P, Romens AI. Remotizzare, o non remotizzare: questo è il dilemma. Imprese e sindacati di fronte alla remotizzazione ibrida del lavoro. Stato Merc. 2023;43(3):421-49.
  14. Hunt T, Connolly H. COVID-19 and the work of trade unions: adaptation, transition and renewal. Ind Relat J. 2023;54(2):150-66.
  15. Joyce S, Stuart M, Forde C. Theorising labour unrest and trade unionism in the platform economy. New Technol Work Employ. 2023;38(1):21-40.
  16. Dupuis M. Algorithmic management and control at work in a manufacturing sector: workplace regime, union power and shopfloor conflict over digitalisation. New Technol Work Employ. 2025;40(1):81-101.
  17. Suryadevara S. Real-time task scheduling optimization in WirelessHART networks: challenges and solutions. Int J Adv Eng Technol Innov. 2022;1(3):29-55.
  18. Roşu D, Cojanu F, Ştefănică V, et al. Experimental management of work collectives through social and socialization activities. J Phys Educ Sport. 2022;22(7):1742-47.
  19. Ahmed AAA, et al. Multi-project scheduling and material planning using Lagrangian relaxation algorithm. Ind Eng Manag Syst. 2021;20(4):580-87.
  20. Gao H, et al. TBDB: token bucket-based dynamic batching for resource scheduling supporting neural network inference in intelligent consumer electronics. IEEE Trans Consum Electron. 2024;70(1):1134-44.
  21. Ouhame S, Hadi Y, Ullah A. An efficient forecasting approach for resource utilization in cloud data centers using a CNN-LSTM model. Neural Comput Appl. 2021;33(16):10043-55.
  22. Valarmathi K, Kanaga Suba Raja S. Resource utilization prediction technique in the cloud using a knowledge-based ensemble random forest with an LSTM model. Concurr Eng. 2021;29(4):396-404.
  23. Yang Y, Shen H. Deep reinforcement learning enhanced greedy optimization for online scheduling of batched tasks in cloud HPC systems. IEEE Trans Parallel Distrib Syst. 2022;33(11):3003-14.
  24. Tang B, Luo J, Obaidat MS, Vijayakumar P. Container-based task scheduling in a cloud-edge collaborative environment using a priority-aware greedy strategy. Cluster Comput. 2023;26(6):3689-705.
  25. Zhang Y, Zou YH, Zhang XD. Manufacturing resource scheduling based on a deep Q-network. Wuhan Univ J Nat Sci. 2022;27(6):531-38.
  26. Mangalampalli S, et al. DRLBTSA: deep reinforcement learning-based task-scheduling algorithm in cloud computing. Multimed Tools Appl. 2024;83(3):8359-87.
  27. Wang Y, Wang Q, Chu X. Energy-efficient online scheduling of transformer inference services on GPU servers. IEEE Trans Green Commun Netw. 2022;6(3):1649-59.
  28. Liu L, et al. Dynamic sparse attention for scalable transformer acceleration. IEEE Trans Comput. 2022;71(12):3165-78.
  29. He X, et al. Channel assignment and power allocation for throughput improvement with PPO in B5G heterogeneous edge networks. Digit Commun Netw. 2024;10(1):109-16.
  30. Liu H, et al. A new multi-domain cooperative resource scheduling method using proximal policy optimization. Neural Comput Appl. 2024;36(9):4931-45.
  31. Jin J, Xu Y. Optimal policy characterization enhanced proximal policy optimization for multitask scheduling in cloud computing. IEEE Internet Things J. 2022;9(9):6418-33.
  32. Chavva M, Veera S. Dynamic cost-aware language models: a real-time framework for optimizing cloud resource recommendations. Int J Mach Learn Sustain Dev. 2023;5(2):1-15.
  33. Zhao Z, et al. Link scheduling using graph neural networks. IEEE Trans Wirel Commun. 2023;22(6):3997-4012.
  34. Zhang Z, et al. A resource optimization scheduling model and algorithm for heterogeneous computing clusters based on GNN and RL. J Supercomput. 2024;80(16):24138-72.
  35. Chai F, et al. Joint multi-task offloading and resource allocation for mobile edge computing systems in satellite IoT. IEEE Trans Veh Technol. 2023;72(6):7783-95.
  36. Luo Q, et al. Resource scheduling in edge computing: a survey. IEEE Commun Surv Tutor. 2021;23(4):2131-65.
  37. Gupta A, Namasudra S, Kumar P. An enhanced strategy for energy-efficient cloud computing environment through VM consolidation. In: Dagur A, Singh K, Mehra PS, Shukla DK, editors. Intelligent Computing and Communication Techniques. Boca Raton (FL): CRC Press; 2025. p. 330–34. https://doi.org/10.1201/9781003530176-46
  38. Sombo B, Apeh ST, Edeoghon IA. Review on authentication algorithms in cellular communication networks. Cloud Comput Data Sci. 2025;6(1):54-66.
  39. Gupta A, Kumar P, Namasudra S. Sustainable cloud computing: an enhanced energy-efficient VM consolidation approach using live migration. Iran J Comput Sci. 2026;9:27. doi:10.1007/s42044-025-00385-y.
  40. García F, et al. Traffic optimization through waiting prediction and evolutive algorithms. Int J Interact Multimed Artif Intell. 2025;9(3):96-103.
  41. Sharma P, Namasudra S, Lorenz P. Blockchain-based cloud storage system with enhanced optimization and integrity preservation. Presented at: IEEE International Conference on Communications (ICC); Rome, Italy; 2023. p. 3744-49.
  42. Ding F, et al. Transformer-enhanced DQN approach for energy- and cost-efficient large-scale dynamic workflow scheduling in a heterogeneous environment. IEEE Internet Things J. 2024;11(22):37351-67.
  43. Yu H, Tang N, Zhu Z, Guo Z. Flexible job-shop scheduling via gated recurrent unit and deep reinforcement learning. Knowl Based Syst. 2025;330:114734. doi:10.1016/j.knosys.2025.114734.
  44. Do KH, et al. Graph Neural PPO for joint user association and resource allocation in Open RAN [conference paper]. Presented at: 40th International Conference on Information Networking (ICOIN); Hanoi, Vietnam; 2026. p. 37-42.

Nachdrucke und Genehmigungen

Tags

Transformer-AlgorithmusProximal Policy OptimizationMulti-Head AttentionScheduling-StabilitätRessourcenallokationraumzeitliche MerkmaleKonfliktrisikowahrnehmung