Zaproponowany framework ML-HQNC został oceniony w porównaniu z Fast R-CNN, Bi-LSTM, CNN oraz XGBoost przy użyciu konwencjonalnych metryk klasyfikacji, w tym dokładności (Accuracy), precyzji (Precision), czułości (Recall), miary F1-score oraz pola pod krzywą charakterystyki pracy odbiornika (AUC), wraz z zaproponowanymi metrykami oceny: precyzją detekcji zainteresowania (Interest Detection Precision – IDP), indeksem stabilności wzorca kwantowego (Quantum Pattern Stability Index – QPSI) oraz przyrostem adaptacyjności międzydomenowej (Cross-Domain Adaptability Gain – CDAG). Definicje matematyczne tych metryk znajdują się w pliku uzupełniającym 1 (sekcja S5).
Aby ocenić stabilność proponowanego schematu, wszystkie eksperymenty powtórzono pięciokrotnie, stosując różne randomizacje początkowe. Raportowane wartości wydajności przedstawiono jako średnią ± odchylenie standardowe z pięciu serii pomiarowych. Istotność statystyczną między proponowanym schematem a modelami bazowymi oceniono za pomocą sparowanego testu t, przyjmując, że p < 0,05 oznacza wynik istotny statystycznie.
Jak podsumowano w Tabeli uzupełniającej 1, eksperymenty symulacyjne przeprowadzono z wykorzystaniem zbioru danych Teaching Quality Evaluation Dataset zawierającego 1 014 rekordów. Łącznie 800 rekordów wykorzystano do trenowania modelu, natomiast 200 rekordów zarezerwowano do testów. Zaproponowany framework ML-HQNC oraz modele porównawcze zaimplementowano w środowisku Jupyter Notebook przy użyciu języka Python. Atrybut Teaching_Quality służył jako pierwotna zmienna celu w publicznie dostępnym zbiorze danych Teaching Quality Evaluation Dataset i składał się z dwóch klas: Good oraz Excellent. Etykiety te zostały wykorzystane jako cele predykcji do trenowania i ewaluacji frameworka ML-HQNC. Wynikowe kategorie predykcji podsumowano w Tabeli 3. Tabela uzupełniająca 2 przedstawia wyniki walidacji etapu preprocessingu Box–Cox Robust IQR Scaling (BCRIS). Potok preprocessingu usunął brakujące i zdublowane rekordy, ograniczył wpływ wartości odstających, znormalizował rozkłady cech oraz poprawił spójność semantyczną i behawioralną przed transformacją cech i trenowaniem modelu.
Tabela 3: Zmienna celu w zbiorze danych Teaching Quality Evaluation Dataset. Opis oryginalnej zmiennej celu Teaching_Quality oraz jej kategorii klasyfikacji (Good i Excellent) wykorzystanych do trenowania i ewaluacji modelu. Kliknij tutaj, aby pobrać tę tabelę.
Tabela uzupełniająca 3 przedstawia reprezentatywne cechy wygenerowane przez Kwantowy Model Stanu Poznawczego (QCSM). Wyekstrahowane cechy opisują zachowania uczenia się studentów, w tym stan poznawczy, zaangażowanie, niepewność, przejścia między tematami oraz spójność behawioralną, i służyły jako dane wejściowe do następnego etapu selekcji cech QES-WOFS. Tabela uzupełniająca S4 zawiera końcowe cechy wybrane przez algorytm QES-WOFS wraz z ich kategoriami, poziomami względwego wpływu oraz rolami funkcjonalnymi w proponowanym modelu. Charakterystyka wyekstrahowanych wielowymiarowych cech behawioralnych została podsumowana w Tabeli uzupełniającej 5. Tabela uzupełniająca 6 przedstawia reprezentatywne struktury krawędzi wygenerowane podczas reprezentacji behawioralnej dla dwóch klas predykcji (Dobry i Bardzo dobry).
Jak pokazano na Rysunku 4 i w Tabeli 4, zaproponowany model ML-HQNC osiągnął najwyższą wartość miary F1 (87,9%) spośród ocenianych metod. Odpowiednie wartości F1 dla modeli Fast R-CNN, Bi-LSTM, CNN oraz XGBoost wyniosły odpowiednio 77,9%, 80,2%, 82,8% i 85,8%. Istotność statystyczną oceniono za pomocą dwustronnego niezależnego testu t (p < 0,05).
Rysunek 5 oraz Tabela 5 podsumowują wyniki precyzji wykrywania zainteresowania (IDP). Zaproponowana struktura ML-HQNC osiągnęła IDP na poziomie 89,3%, w porównaniu do 79,11%, 82,12%, 84,6% i 87,10% dla odpowiednio Fast R-CNN, Bi-LSTM, CNN i XGBoost. Rysunek 6 oraz Tabela 6 przedstawiają wyniki indeksu stabilności wzorca kwantowego (QPSI). Zaproponowana struktura osiągnęła wartość QPSI wynoszącą 92,7%, podczas gdy Fast R-CNN, Bi-LSTM, CNN i XGBoost osiągnęły odpowiednio 81,1%, 84,11%, 87,4% i 90,9%. Rysunek 7 oraz Tabela 7 podsumowują wyniki przyrostu adaptacyjności międzydomenowej (CDAG). Zaproponowana struktura ML-HQNC osiągnęła najwyższą wartość CDAG (0,95) w porównaniu z Fast R-CNN (0,78), Bi-LSTM (0,83), CNN (0,80) i XGBoost (0,86). Jak pokazano na Rysunku 8 i w Tabeli 8, zaproponowana struktura ML-HQNC osiągnęła najwyższą dokładność klasyfikacji (96,17%). Odpowiednie dokładności dla Fast R-CNN, Bi-LSTM, CNN i XGBoost wyniosły odpowiednio 85,10%, 87,21%, 90,14% i 93,19%. Rysunek 9 oraz Tabela 9 przedstawiają czas obliczeniowy wymagany przez każdą z metod. Zaproponowana struktura ML-HQNC wymagała 9,02 ms, podczas gdy Fast R-CNN, Bi-LSTM, CNN i XGBoost wymagały odpowiednio 31,2 ms, 27,5 ms, 22,4 ms i 17,6 ms. Rysunek 10 przedstawia analizę charakterystyki pracy odbiornika (ROC). Zaproponowana struktura ML-HQNC osiągnęła AUC na poziomie 0,944, co wskazuje na wysoką częstość prawdziwie dodatnich i niską częstość fałszywie dodatnich w obrębie ocenianego progu klasyfikacji.

Rysunek 4: Porównanie wyniku F1 dla różnych rozmiarów zbioru danych. Porównanie wyniku F1 osiągniętego przez ML-HQNC oraz konkurencyjne modele dla różnych rozmiarów zbioru danych. Wyniki przedstawiono jako średnia ± odchylenie standardowe z pięciu niezależnych serii eksperymentalnych (n = 5). Słupki błędów reprezentują jedno odchylenie standardowe. Istotność statystyczną oceniono za pomocą dwustronnego niezależnego testu t (p < 0.05). Kliknij tutaj, aby wyświetlić powiększoną wersję tego rysunku.
Tabela 4: Porównanie wyniku F1-score dla różnych rozmiarów zbiorów danych.Porównanie wyniku F1-score uzyskanego przez ML-HQNC i konkurencyjne modele. Wyniki przedstawiono jako średnia ± odchylenie standardowe z pięciu niezależnych serii eksperymentalnych (n = 5). Kliknij tutaj, aby pobrać tę tabelę.

Rycina 5: Porównanie precyzji wykrywania obszarów zainteresowania (IDP) dla różnych rozmiarów zbiorów danych. Porównanie precyzji wykrywania obszarów zainteresowania (IDP) uzyskanej przez model ML-HQNC oraz modele konkurencyjne dla różnych rozmiarów zbiorów danych. Wyniki przedstawiono jako średnia ± odchylenie standardowe z pięciu niezależnych serii eksperymentalnych (n = 5). Słupki błędów reprezentują jedno odchylenie standardowe. Istotność statystyczną oceniono za pomocą dwustronnego niezależnego testu t (p < 0.05). Kliknij tutaj, aby wyświetlić większą wersję tej ryciny.
Tabela 5: Porównanie precyzji wykrywania zainteresowań (Interest Detection Precision, IDP) dla różnych rozmiarów zestawów danych. Porównanie precyzji wykrywania zainteresowań (IDP) osiągniętej przez model ML-HQNC oraz modele konkurencyjne. Wyniki przedstawiono jako średnia ± odchylenie standardowe z pięciu niezależnych serii eksperymentalnych (n = 5). Kliknij tutaj, aby pobrać tę tabelę.

Rysunek 6: Porównanie indeksu stabilności wzorca kwantowego (QPSI) dla różnych rozmiarów zbiorów danych. Porównanie indeksu stabilności wzorca kwantowego (QPSI) osiągniętego przez model ML-HQNC oraz konkurencyjne modele przy różnych rozmiarach zbiorów danych. Wyniki przedstawiono jako średnia ± odchylenie standardowe z pięciu niezależnych serii eksperymentalnych (n = 5). Słupki błędu reprezentują jedno odchylenie standardowe. Istotność statystyczną oceniono za pomocą dwustronnego niezależnego testu t (p < 0.05). Kliknij tutaj, aby wyświetlić powiększoną wersję tego rysunku.
Tabela 6: Porównanie indeksu stabilności wzorca kwantowego (QPSI) dla różnych rozmiarów zbiorów danych. Porównanie indeksu stabilności wzorca kwantowego (QPSI) uzyskanego przez model ML-HQNC oraz modele konkurencyjne. Wyniki przedstawiono jako średnia ± odchylenie standardowe z pięciu niezależnych serii eksperymentalnych (n = 5). Kliknij tutaj, aby pobrać tę tabelę.

Rysunek 7: Porównanie zysku z adaptacyjności międzydomenowej (CDAG) dla różnych rozmiarów zestawów danych. Porównanie zysku z adaptacyjności międzydomenowej (CDAG) osiągniętego przez ML-HQNC oraz modele konkurencyjne dla różnych rozmiarów zestawów danych. Wyniki przedstawiono jako średnia ± odchylenie standardowe z pięciu niezależnych serii eksperymentalnych (n = 5). Słupki błędu reprezentują jedno odchylenie standardowe. Istotność statystyczną oceniono za pomocą dwustronnego niezależnego testu t (p < 0.05). Kliknij tutaj, aby wyświetlić większą wersję tego rysunku.
Tabela 7: Porównanie przyrostu adaptacyjności międzydomenowej (Cross-Domain Adaptability Gain, CDAG) dla różnych rozmiarów zbiorów danych. Porównanie przyrostu adaptacyjności międzydomenowej (CDAG) osiągniętego przez ML-HQNC i modele konkurencyjne. Wyniki przedstawiono jako średnia ± odchylenie standardowe z pięciu niezależnych serii eksperymentalnych (n = 5). Kliknij tutaj, aby pobrać tę tabelę.

Rycina 8: Porównanie dokładności klasyfikacji dla różnych rozmiarów zbiorów danych. Porównanie dokładności klasyfikacji osiągniętej przez ML-HQNC oraz konkurencyjne modele dla różnych rozmiarów zbiorów danych. Wyniki przedstawiono jako średnia ± odchylenie standardowe z pięciu niezależnych serii eksperymentalnych (n = 5). Słupki błędów reprezentują jedno odchylenie standardowe. Istotność statystyczną oceniono za pomocą dwustronnego niezależnego testu t (p < 0,05). Kliknij tutaj, aby wyświetlić powiększoną wersję tej ryciny.
Tabela 8: Porównanie dokładności klasyfikacji dla różnych rozmiarów zbiorów danych. Porównanie dokładności klasyfikacji uzyskanej przez model ML-HQNC oraz modele konkurencyjne. Wyniki przedstawiono jako średnia ± odchylenie standardowe z pięciu niezależnych serii eksperymentalnych (n = 5). Kliknij tutaj, aby pobrać tę tabelę.

Rysunek 9: Porównanie czasu obliczeń dla różnych rozmiarów zbiorów danych. Porównanie czasu wykonania obliczeń modelu ML-HQNC oraz modeli konkurencyjnych dla różnych rozmiarów zbiorów danych. Wyniki przedstawiono jako średnia ± odchylenie standardowe z pięciu niezależnych serii eksperymentalnych (n = 5). Słupki błędu reprezentują jedno odchylenie standardowe. Niższe wartości wskazują na krótszy czas wykonania obliczeń. Istotność statystyczną oceniono za pomocą dwustronnego niezależnego testu t (p < 0,05). Kliknij tutaj, aby wyświetlić większą wersję tego rysunku.
Tabela 9: Porównanie czasu obliczeniowego dla różnych rozmiarów zbiorów danych. Porównanie czasu wykonania obliczeń modelu ML-HQNC oraz modeli konkurencyjnych. Wyniki przedstawiono jako średnia ± odchylenie standardowe z pięciu niezależnych serii eksperymentalnych (n = 5). Niższe wartości wskazują na krótszy czas wykonania obliczeń. Kliknij tutaj, aby pobrać tę tabelę.

Rysunek 10: Porównanie powierzchni pod krzywą charakterystyki operacyjnej odbiornika (AUC).Porównanie AUC osiągniętego przez model ML-HQNC oraz modele konkurencyjne w identyfikacji zainteresowań studentów kierunków inżynieryjnych. Raportowane wartości AUC odpowiadają pojedynczemu przebiegowi eksperymentu, dlatego nie przedstawiono słupków błędów ani analiz istotności statystycznej. Kliknij tutaj, aby wyświetlić powiększoną wersję tego rysunku.
Rycina uzupełniająca 1 przedstawia macierz korelacji reprezentatywnych zmiennych behawioralnych. Silne korelacje dodatnie zaobserwowano pomiędzy Avg_Score a Course_Completion_Rate (0,81) oraz pomiędzy Attendance_Rate a Course_Completion_Rate (0,75). Umiarkowane korelacje zaobserwowano pomiędzy Avg_Score a Course_Completion (0,72) oraz pomiędzy Attendance_Rate a Time_Assignment_Percentage (0,74). Ryciny uzupełniające 2 i 3, wraz z Tabelą 10, podsumowują mapy dokładności treningowej i testowej. Zaproponowana struktura ML-HQNC osiągnęła dokładność treningową na poziomie 96,1% oraz dokładność testową na poziomie 93,8%, przewyższając wyniki metod porównawczych. Ryciny uzupełniające 4 i 5, wraz z Tabelą 11, podsumowują analizę zbieżności. Zaproponowana struktura ML-HQNC osiągnęła najniższą stratę treningową (0,21) i stratę testową (0,26), wykazując stabilną zbieżność w całym procesie optymalizacji.
Tabela 12 podsumowuje ogólną wydajność proponowanego modelu ML-HQNC oraz metod porównawczych we wszystkich metrykach oceny. Proponowany model osiągnął najwyższą wydajność w zakresie Accuracy, F1-score, AUC, IDP, QPSI oraz CDAG, wymagając jednocześnie najkrótszego czasu obliczeń spośród ocenianych metod. Tabela 13 przedstawia analizę ablacyjną poszczególnych komponentów proponowanego modelu. Stopniowe wprowadzanie etapu wstępnego przetwarzania BCRIS, reprezentacji behawioralnej QCSM, algorytmu selekcji cech QES-WOFS oraz pełnego klasyfikatora ML-HQNC przynosiło stopniową poprawę wydajności klasyfikacji, co demonstruje wkład każdego komponentu w funkcjonowanie całego modelu.
Tabela 10: Porównanie dokładności treningowej i testowej. Porównanie dokładności treningowej i testowej uzyskanej przez model ML-HQNC oraz modele konkurencyjne. Raportowane wartości odpowiadają jednemu przebiegowi eksperymentalnemu. Kliknij tutaj, aby pobrać tę tabelę.
Tabela 11: Porównanie strat podczas uczenia i testowania. Porównanie strat podczas uczenia i testowania uzyskanych przez model ML-HQNC oraz modele konkurencyjne. Raportowane wartości odpowiadają pojedynczemu przebiegowi eksperymentu. Kliknij tutaj, aby pobrać tę tabelę.
Tabela 12: Ogólne porównanie wydajności.Porównanie modelu ML-HQNC z konkurencyjnymi modelami z wykorzystaniem wielu metryk oceny. Wyniki przedstawiono jako średnia ± odchylenie standardowe z pięciu niezależnych serii eksperymentalnych (n = 5). Kliknij tutaj, aby pobrać tę tabelę.
DOSTĘPNOŚĆ DANYCH:
Oryginalny zbiór danych Teaching Quality Evaluation Dataset wykorzystany w niniejszym badaniu jest publicznie dostępny w repozytorium Kaggle (https://www.kaggle.com/datasets/ziya07/teaching-quality-evaluation-dataset). Dostęp do zbioru danych może wymagać uwierzytelnienia użytkownika i podlega warunkom użytkowania serwisu Kaggle. W celu zapewnienia powtarzalności przy jednoczesnym przestrzeganiu warunków licencjonowania oryginalnego zbioru danych, zasoby wygenerowane w ramach badania — w tym syntetyczny zbiór danych, kod źródłowy, pliki implementacyjne i konfiguracyjne, opisy cech, schemat przetwarzania wstępnego oraz dokumentacja pomocnicza niezbędna do odtworzenia opisanych eksperymentów — zostały złożone w otwartym repozytorium Zenodo: https://doi.org/10.5281/zenodo.21393413.

Rycina 3: Zbiór cech zestawu danych oceny jakości nauczania. Struktura i skład cech zestawu danych oceny jakości nauczania wykorzystanego do identyfikacji zainteresowań studentów kierunków technicznych. Kliknij tutaj, aby wyświetlić powiększoną wersję tej ryciny.
Rysunek uzupełniający 1: Macierz korelacji cech. Macierz korelacji przedstawiająca relacje parowe między reprezentatywnymi zmiennymi edukacyjnymi i behawioralnymi wykorzystanymi w proponowanym frameworku ML-HQNC. Kliknij tutaj, aby pobrać ten plik.
Rysunek uzupełniający 2: Porównanie dokładności treningu. Porównanie dokładności treningu osiągniętej przez model ML-HQNC oraz modele konkurencyjne w trakcie procesu uczenia. Kliknij tutaj, aby pobrać ten plik.
Rycina uzupełniająca 3: Porównanie dokładności testowania. Porównanie dokładności testowania osiągniętej przez ML-HQNC i konkurencyjne modele w trakcie procesu testowania. Kliknij tutaj, aby pobrać ten plik.
Rycina uzupełniająca 4: Analiza straty treningowej. Porównanie straty treningowej osiągniętej przez ML-HQNC i modele konkurencyjne podczas optymalizacji modelu. Kliknij tutaj, aby pobrać ten plik.
Rycina uzupełniająca 5: Analiza straty testowej. Porównanie straty testowej uzyskanej przez ML-HQNC oraz konkurencyjne modele podczas ewaluacji modelu. Kliknij tutaj, aby pobrać ten plik.
Tabela uzupełniająca 1: Parametry symulacji i ustawienia eksperymentalne. Podsumowanie parametrów symulacji, środowiska implementacji, podziału zbioru danych oraz ustawień eksperymentalnych wykorzystanych do oceny proponowanego frameworka ML-HQNC. Kliknij tutaj, aby pobrać ten plik.
Tabela uzupełniająca 2: Wyniki walidacji etapu preprocessingu Box–Cox Robust IQR Scaling (BCRIS). Porównanie reprezentatywnych charakterystyk zbioru danych przed i po preprocessingu, obejmujące brakujące wartości, duplikaty rekordów, obsługę wartości odstających, normalizację cech oraz spójność danych. Kliknij tutaj, aby pobrać ten plik.
Tabela uzupełniająca 3: Reprezentatywne cechy wygenerowane przez Kwantowy Model Stanu Poznawczego (QCSM). Reprezentatywne cechy behawioralne wygenerowane przez QCSM po wstępnym przetwarzaniu danych, w tym cechy stanu poznawczego, zaangażowania, niepewności, przejścia tematycznego oraz spójności behawioralnej. Kliknij tutaj, aby pobrać ten plik.
Tabela uzupełniająca 4: Cechy wybrane przez algorytm Quantum-Enhanced Swarm–Whale Optimization Feature Selection (QES-WOFS). Końcowy podzbiór cech wybrany przez algorytm QES-WOFS wraz z odpowiadającymi im kategoriami cech, względnymi poziomami wpływu i rolami funkcjonalnymi w proponowanym modelu. Kliknij tutaj, aby pobrać ten plik.
Tabela uzupełniająca 5: Kategorie przewidywania jakości nauczania. Opis kategorii przewidywania oraz reprezentatywnych cech behawioralnych wykorzystanych przez proponowany framework ML-HQNC. Kliknij tutaj, aby pobrać ten plik.
Tabela uzupełniająca 6: Analiza czułości marginesu.Podsumowanie analizy czułości marginesu przeprowadzonej podczas oceny modelu. Prosimy kliknąć tutaj, aby pobrać ten plik.
Plik uzupełniający 1: Metody uzupełniające, sformułowania matematyczne, metryki oceny i tabele uzupełniające.Plik ten zawiera szczegółowe sformułowania matematyczne dla metod Box–Cox Robust IQR Scaling (BCRIS), Quantum Cognitive State Model (QCSM), Quantum-Enhanced Swarm–Whale Optimization Feature Selection (QES-WOFS) oraz Meta-Learning Hybrid Quantum-Classical Neural Classifier (ML-HQNC), opisanych w głównym protokole. Zawiera on również definicje metryk oceny, parametry symulacji, ustawienia eksperymentalne oraz tabele uzupełniające S1–S6 wspierające wyniki przedstawione w głównym manuskrypcie. Kliknij tutaj, aby pobrać ten plik.