Artykuł badawczy

Wieloperspektywowe rozumowanie rozmyte i analiza zachowań uczących się online oparta na XGBoost

DOI:

10.3791/69515

17 marca 2026

W tym artykule

Informacja o sprostowaniu

Important: There has been an erratum issued for this article. View Erratum Notice

Podsumowanie

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Badanie wykorzystuje wieloperspektywiczny model rozumowania rozmytego oraz ulepszony algorytm ekstremalnego gradientu (XGBoost) (zoptymalizowany przez ulepszony algorytm optymalizacji szarego wilka) do analizy zachowań edukacyjnych online i klasyfikacji emocji komentarzy uczniów, zapewniając wsparcie dla spersonalizowanego nauczania i terminowej interwencji.

Streszczenie

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Dynamiczny rozwój edukacji online sprawił, że sale lekcyjne online stały się ważnym elementem tej dziedziny. Dogłębna analiza zachowań uczniów w nauczaniu online może pomóc nauczycielom zoptymalizować strategie nauczania i zapewnić spersonalizowane wsparcie w nauce. Aby przeprowadzić dogłębną analizę zachowań uczących się uczniów, badanie to zbiera dane z internetowych platform dydaktycznych i przetwarza je wcześniej. Następnie badanie to tworzy wieloperspektywiczny model rozumowania rozmytego obejmującego trzy wymiary: program nauczania, indywidualnego i klasowego, aby kompleksowo uwzględnić wyniki uczenia się uczniów na różnych poziomach. Model ten przetwarza niepewne informacje w danych o zachowaniu uczenia się poprzez zbiory rozmyte i reguły rozmyte, osiągając wielowymiarową ocenę wydajności uczenia się. Ulepszony algorytm XGBoost został zaprojektowany do klasyfikacji emocji uczniów w komentarzach. Ten ulepszony algorytm optymalizuje hiperparametry algorytmu XGBoost poprzez ulepszanie algorytmu optymalizacji szarego wilka. Algorytm zwiększa dokładność klasyfikacji emocji i dodatkowo bada tendencje emocjonalne oraz sprzężenie zwrotne dotyczące postaw stojących za ich zachowaniami edukacyjnymi. Wyniki pokazały, że z perspektywy programu nauczania wskaźnik ukończenia zadań kursowych na 3 tygodnie przed egzaminem był zasadniczo powyżej 45%, co było znacznie wyższym poziomem niż wskaźnik ukończenia trzy tygodnie po publikacji (oba poniżej 18%). Wyniki te wskazywały, że uczniowie częściej kończyli zadania przed terminem i mieli oczywistą prokrastynację. Maksymalna dokładność ulepszonego algorytmu klasyfikacji wyniosła 98,78%, co stanowiło 8,57%, 7,55%, 6,38% i 6,01% więcej niż model porównawczy, a średnie zużycie czasu wyniosło 58 ms. Wskaźniki przypominania emocji negatywnych, pozytywnych i neutralnych wynosiły 98,35%, 97,69% oraz 98,02%. Model badawczy może skutecznie analizować zachowania uczniów w nauce online i umożliwić wczesne rozpoznanie uczniów zagrożonych, ułatwiając spersonalizowane nauczanie i precyzyjną interwencję w edukacji online.

Wprowadzenie

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Głęboka integracja Internetu i technologii edukacyjnej sprawiła, że edukacja online przeszła z marginalnego uzupełnienia do formy głównego nurtu. Pod koniec 2023 roku liczba zarejestrowanych uczestników online na świecie przekroczyła 1,2 miliarda, a Chiny konsekwentnie zajmowały pierwsze miejsce na świecie zarówno pod względem liczby masowych otwartych kursów online (MOOC), jak i liczby uczestników 1,2. Jednak choć nauczanie online przynosi wygodę, ujawnia także wyzwania, takie jak nieprzejrzysty proces uczenia się, rozdzielenie nauczycieli i uczniów w czasie i przestrzeni oraz opóźnienia w regulacjach. Istnieje dodatnia korelacja między danymi o zachowaniach uczących się a wynikami w nauce. Dynamiczne dostrojenie na podstawie danych może zwiększyć wskaźniki ukończenia kursu o ponad 20% i znacząco zmniejszyć ryzyko porzucenia nauki 3,4,5. Dlatego przeprowadzanie analizy zachowań uczących się (LBA) jest kluczowe. W tym zakresie obecne metody obejmują statystykę opisową, eksplorację reguł asocjacyjnych oraz tradycyjną klasyfikacjęuczenia maszynowego 6. Wielu badaczy badało ten problem.

Aby przeprowadzić LBA, Li Y i in. wykorzystali dane o zachowaniach uczących się z internetowych platform dydaktycznych na Uniwersytecie Harvarda i Massachusetts Institute of Technology do stworzenia Pulse Neural Network (PNN) do przewidywania wyników nauki. Przeanalizowali korelację między zachowaniami uczenia się a wynikami. Model predykcji zachowań uczenia się online oparty na PNN osiągnął dokładność 99,80%7. Zeng B zaprojektował efektywny model wizualizacji zachowań nauki angielskiego online z wykorzystaniem analizy sekwencji z opóźnieniami oraz połączonych metod eksploracji danych i algorytmu minimalnego drzewa rozpiętego. Ponadto badanie stworzyło także internetową platformę inteligentnego uczenia się dla usług budowlanych Group Learning Path (GLP). Zaprojektowana metoda mogła skutecznie skonstruować GLP8. Zhao M i in. zaprojektowali dwuwarstwową pamięć długotrwałą (LSTM), aby ujawnić potencjalne problemy w nauce online uczniów. Korzystali z frameworka TensorFlow i języka Python, a także z danych z platform internetowych Kaggle, edX oraz Open University of UK. Ta sieć osiągała dobrą wydajność, z maksymalną dokładnością 83,4%9. Li F i in. zebrali i przeanalizowali dane dotyczące zachowań uczących się od 109 studentów studiów licencjackich, aby zrozumieć cechy zachowań grupowych różnych uczniów online. Badanie to wprowadziło analizę głównych komponentów w celu zmniejszenia wymiarowości danych oraz zastosowało aglomeratywne hierarchiczne klasteryzowanie do klasyfikowania uczniów w różne kategorie. Wśród nich 15 grup było zgrupowanych, a proponowana metoda miała dobrą dokładność klastrowania10.

Podsumowując, obecne badania nad LBA są dość zróżnicowane i wykorzystują szeroki zakres metod. Jednak te badania i metody mają również pewne niedociągnięcia. Na przykład w tekstach powtórkowych uczniów nie ma wystarczającego wydobywania informacji emocjonalnych, a statystyki opisowe nie są w stanie ujawnić złożonych mechanizmów interakcji stojących za zachowaniami. Klasyfikacja uczenia maszynowego często opiera się na cechach pojedynczej perspektywy, które oddzielają wielowymiarowe informacje o kursach, osobach i klasach. Aby lepiej wykonywać LBA, w tym badaniu zaprojektowano model Multi-Perspective Fuzzy Reasoning (MPFR) oraz skonstruuje model klasyfikacji emocji oparty na algorytmach Improved Grey Wolf Optimization (IGWO) oraz eXtreme Gradient Boosting (XGBoost).

W istniejących badaniach nad LBA, chociaż LSTM potrafi uchwycić korelację czasową zachowań uczących się, jego zdolność do obsługi niejasnych i niepewnych danych o zachowaniach uczących się jest słaba. Konwolucyjne Sieci Neuronowe (CNN) ma pewne zalety w wyodrębnianiu cech tekstowych, ale lepiej rejestruje cechy lokalne i jest trudna do integracji wielowymiarowych informacji globalnych kursów, osób i klas. W porównaniu z metodami głębokiego uczenia, takimi jak CNN i LSTM, model MPFR może rejestrować niepewne informacje w zachowaniach uczących się poprzez rozumowanie rozmyte. Na przykład "umiarkowany udział" i "podstawowa opanowanie" stanów rozmytych przez studentów rekompensuje ograniczenia lokalnej ekstrakcji cech CNN. IGWO-XGBoost równoważy dokładność i efektywność klasyfikacji sentymentów, kompensując czasochłonną klasyfikację sentymentu LSTM oraz słabe przetwarzanie CNN w semantycznym rozmytym przetwarzaniu. Celem tego badania jest zapewnienie trójwymiarowego wsparcia informacyjnego dla interwencji nauczania online poprzez połączenie wyników analizy zachowań i emocji. Innowacją badań jest stworzenie modelu MPFR obejmującego trzy wymiary: program nauczania, indywidualny i klasowy. Takie kompleksowe rozważanie z różnych perspektyw może kompleksowo i stereoskopowo odzwierciedlać wyniki uczenia się uczniów, unikając ważnych informacji, które mogłyby zostać przeoczone z jednej perspektywy. Ta metoda cechuje się dobrą skalowalnością platformy i może być dostosowana do głównych platform nauki online, takich jak Chaoxing i MOOC, czyli poprzez zunifikowany interfejs wstępnego przetwarzania danych bez potrzeby dodatkowych funkcji tworzenia platformy. Jednocześnie metoda ta została zamknięta jako proste narzędzie analityczne, a nauczyciele muszą jedynie przesłać podstawowe dane eksportowane z platformy, aby automatycznie generować raporty LBA bez skomplikowanych operacji technicznych.

Dostęp ograniczony. Zaloguj się lub rozpocznij wersję próbną, aby wyświetlić tę treść.

Protokół

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Projekt metody LBA uwzględniający MPFR i perspektywy emocjonalne

Tworzony jest wieloperspektywiczny system oceny do analizy zachowań uczniów w nauce online (SOLB) oraz model MPFR. Aby dalej analizować subiektywne odczucia uczniów podczas uczenia się, badanie to wykorzystuje algorytm XGBoost i projektuje algorytm IGWO do optymalizacji hiperparametrów w celu poprawy dokładności klasyfikacji.

Konstrukcja modelu MPFR dla LBA

Aby analizować SOLB, badanie to rozpoczyna się głównie od dwóch perspektyw, tworząc pełny plan analizy. Po pierwsze, w zakresie wyników w nauce, badanie uwzględnia trzy perspektywy: program nauczania, indywidualną i klasową, aby utworzyć model MPFR. Po drugie, jeśli chodzi o analizę sentymentu komentarzy uczniów, to badanie projektuje ulepszony algorytm XGBoost. Dzięki analizie wyników uczenia się i emocji sprzężenia zwrotnego ucznia, to badanie może lepiej przeanalizować SOLB. Jeśli chodzi o szczegóły techniczne analizy wyników uczenia się, to badanie najpierw wykorzystuje dane z platformy nauki online i przetwarza je wstępnie. Po drugie, badanie to wybiera kluczowe wskaźniki oceny wyników w nauce z różnych perspektyw, aby stworzyć kompleksowy system oceny. Następnie konstruowany jest odpowiadający mu model MPFR do oceny zachowań uczących się.

Badanie to wybiera dane z platformy Superstar (źródło: https://www.chaoxing.com/). Zawiera informacje z wielu wymiarów, takich jak zajęcia w klasie i ocena ocen, które mogą stanowić dobrą podstawę do późniejszego LBA. Po uzyskaniu danych należy je wstępnie przetworzyć, głównie w tym usuwanie nieistotnych pól, filtrowanie danych oraz kontrole integralności danych. Na przykład w danych nauczycieli należy usunąć nieistotne informacje, takie jak numer i wydział, do którego należy kurs. Następnie to badanie konstruuje inżynierię cech LBA na podstawie danych dotyczących zachowań uczących się platformy Superstar. Indeks LBA dla studentów stanowi podstawę inżynierii cech dla kolejnego modelu MPFR, a treść tego indeksu przedstawiona jest na Rysunku 1.

figure-protocol-1
Rysunek 1: Wskaźniki LBA przez studenta. Rysunek wyjaśnia trzy podstawowe wymiary (program nauczania, indywidualny, klasowy) studenta LBA oraz specyficzne wskaźniki oceny w każdym z nich, zapewniając wsparcie funkcjonalne dla modelu MPFR. Proszę kliknąć tutaj, aby zobaczyć większą wersję tej figurki.

Na Rysunku 1 wskaźniki LBA dla uczniów koncentrują się głównie na trzech perspektywach: kursie, indywidualnym i klasowym, z wyraźnym uwzględnieniem każdego wymiaru, zapewniając precyzyjne wsparcie cech dla budowy modeli MPFR. Wśród nich, pod względem wskaźników wymiaru kursu, badanie to wybiera wskaźnik ukończenia zadań kursowych, czas nauki oraz częstotliwość interakcji z kursem. Podstawowym zagadnieniem tego wymiaru jest ogólna jakość ukończenia zadań kursowych oraz terminowość uczestnictwa w nauce. Na przykład wskaźnik ukończenia zadań kursowych służy do śledzenia różnic w wskaźnikach ukończenia przed i po terminie; Czas trwania kursu służy do rozróżnienia różnych interwałów intensywności uczenia się; Częstotliwość interakcji na polu jest wykorzystywana do filtrowania skutecznych zachowań interaktywnych. Na poziomie osobistym jako wskaźniki oceny wybierane są osobiste postępy w nauce, jakość ukończenia prac domowych oraz wyniki egzaminów. Ten wymiar koncentruje się na stopniu dopasowania między osobistym postępem w nauce a wynikami opanowania wiedzy. Przykłady to porównanie osobistych postępów w nauce z planami kursów, ocena dokładności i efektywności wykonanych zadań oraz klasyfikacja poziomów opanowania wiedzy na podstawie wyników testów. Ponadto, jeśli chodzi o wymiar klasy, wybrane wskaźniki obejmują średnią ocenę klasową, aktywność interakcji klasowej oraz atmosferę nauki w klasie. Ten wymiar koncentruje się głównie na wpływie ogólnego środowiska nauki na zachowania jednostki. Na przykład średnia ocena służy do określenia względnego poziomu indywidualnych wyników w grupie; Aktywność interakcji klasowej służy do odzwierciedlenia stopnia zbiorowego uczestnictwa; Atmosfera nauki służy do analizy wpływu środowiska grupowego na zachowania uczące się. Aby analizować zachowania uczące się uczniów, konstruuje się model rozumowania rozmytego, a cechy zachowań uczących się są pozyskiwane z różnych perspektyw. Rozumowanie rozmyte to metoda rozumowania wykorzystująca logikę rozmytową, która przetwarza nieprecyzyjne lub niepewne informacje za pomocą zbiorów rozmytych i reguł rozmytych, a zaleta polega na dużej elastyczności i łatwym rozumieniu11,12. Rozumowanie rozmyte, jako podstawowy mechanizm obliczeniowy modeli MPFR, jest stosowane po inżynierii cech. Główny proces rozumowania rozmytego przedstawiono na Rysunku 2.

figure-protocol-2
Rysunek 2: Główny schemat rozmytego rozumowania. Rysunek pokazuje podstawowy proces rozumowania rozmytego, w tym cztery kluczowe kroki: fuzzyfikację, konstrukcję bazy reguł fuzzy, rozumowanie fuzzy i deblurring, a także wyjaśnia logikę modelu MPFR w obsłudze danych dotyczących niepewnych zachowań uczących się. Proszę kliknąć tutaj, aby zobaczyć większą wersję tej figurki.

Rozumowanie rozmyte obejmuje głównie rozmycie (fuzzyfikację), tworzenie Biblioteki Reguł Rozmytych (FRL), rozumowanie fuzzy oraz usuwanie rozmycia. Wśród nich rozmycie wymaga przekształcenia precyzyjnych danych wejściowych w zbiory rozmyte i polega na definiowaniu funkcji przynależności. FRL zawiera szereg reguł rozmytych i jest głównie używany do opisu relacji między wejściem a wyjściem. W ramach konstrukcji bazy reguł rozmytych badanie zaprasza trzech adiunktów technologii edukacyjnych z ≥ 8-letnim doświadczeniem dydaktycznym do wspólnego opracowania 28 reguł i ustala ostateczne reguły poprzez trzy rundy iteracji z wykorzystaniem "metody Delphi". Na przykład, Zasada 1: JEŚLI wskaźnik ukończenia zadania kursowego jest mniejszy niż 30%, a postępy indywidualne są opóźnione o 2 tygodnie → stanie wysokiego ryzyka. Rozumowanie rozmyte to proces wnioskowania rozmytych danych wejściowych opartych na FRL i uzyskiwania rozmytych wyników wyjściowych. Na koniec, rozmycie przekształca wynik rozmyty na dokładną wartość wyjściową. Badanie wybiera trójkątną funkcję przynależności, która jest szeroko wykorzystywaną funkcją w systemach logiki rozmytej i ma zalety takie jak duża elastyczność i wysoka wydajność obliczeniowa. Wyrażenie funkcji μA(x) przedstawiono w równaniu (1).

figure-protocol-3 (1)

W równaniu (1) x jest wartością wejściową specyficzną. a, b i c to trzy wierzchołki trójkąta. W rozmyciu pracy niniejsza praca wykorzystuje metodę centroidu do konwersji wyników wyjściowych. Metoda centroidalna to powszechnie stosowana technika rozmycia w logice rozmytej, która ma zalety takie jak silna intuicyjność, proste obliczenia oraz stabilność13. Wyrażenie metody centroidu przedstawiono w równaniu (2)14.

figure-protocol-4 (2)

W równaniu (2) f* to wartość wyjściowa po rozmyciu, która jest centroidem zbioru rozmytego. μ(x) jest funkcją przynależności. figure-protocol-5 jest sumą ważoną wszystkich punktów w zbiorze rozmytym. figure-protocol-6jest całką funkcji przynależności po wszystkich możliwych wartościach x. Racjonalność stosowania ręcznie definiowanych reguł i funkcji członkostwa w modelu MPFR odzwierciedla się w trzech aspektach. Po pierwsze, gwarancja kwalifikacji ekspertów: twórcami przepisów są trzej adiunkci technologii edukacyjnej, którzy zostali certyfikowani przez "Analityka Zachowań Uczenia się Online" z "Centrum Badań Edukacji Online Ministerstwa Edukacji", aby zapewnić zgodność przepisów z przepisami dotyczącymi edukacji i nauczania. Po drugie, przewaga efektywności: czas wnioskowania reguł ręcznych jest znacznie krótszy niż w metodach opartych na danych, co czyni je bardziej odpowiednimi dla potrzeb "wnioskowania w czasie rzeczywistym" platform edukacyjnych online i nie wymaga dużej ilości danych z adnotacjami, co zmniejsza koszty zbierania danych15. Po trzecie, dostosowanie się do podstawowego wymogu "interpretowalności" w scenariuszach edukacji online, ręcznie definiowane reguły i trójkątne funkcje członkostwa (Równanie 1) mogą bezpośrednio odpowiadać intuicyjnemu poznaniu w scenariuszach nauczania. Nauczyciele nie potrzebują złożonego technicznego wykształcenia, aby zrozumieć powody, dla których uczeń jest uznawany za zagrożonego. Metody oparte na danych, takie jak systemy neuro-fuzzy, mogą automatycznie optymalizować reguły. Jednak większość generowanych reguł to złożone wyrażenia matematyczne, które są trudne do interpretacji dla nauczycieli, co obniża akceptowalność modelu w rzeczywistej interwencji dydaktycznej.

Projekt ulepszonego modelu analizy nastroju do komentarzy uczniów dla XGBoost

Zaprojektowany model MPFR może analizować SOLB z trzech aspektów: kursu, indywidualnego i klasowego. Jednak zewnętrzna analiza danych behawioralnych ma ograniczenia w wyrażaniu subiektywnych uczuć uczniów. Dlatego, aby dalej analizować subiektywne odczucia uczniów dotyczące nauki, zbierane są i przetwarzane dodatkowe dane z platform MOOC zawierające informacje o komentarzach uczniów. Następnie XGBoost jest wykorzystywany do konstrukcji modelu klasyfikacji sentymentu. IGWO został zaprojektowany tak, aby optymalizować parametry i poprawić dokładność modelu klasyfikacji. Poprawa XGBoost odzwierciedla się w optymalizacji parametrów za pomocą algorytmu IGWO. Wstępne przetwarzanie danych jest kluczowym pierwszym krokiem przed budową i analizą modelu. Proces wstępnego przetwarzania danych przedstawiono na Rysunku 3.

figure-protocol-7
Rysunek 3: Proces wstępnego przetwarzania danych. Proces wstępnego przetwarzania danych obejmuje dziewięciostopniowe czyszczenie tekstu, segmentację słów, usuwanie słów stop, ekstrakcję rdzeni oraz rozpoznawanie słów sentymentalnych, dostarczając wysokiej jakości danych do późniejszej analizy zachowań i klasyfikacji sentymentów. Proszę kliknąć tutaj, aby zobaczyć większą wersję tej figurki.

Etapy wstępnego przetwarzania danych są następujące: Pierwszym krokiem jest wykonanie czyszczenia tekstu w celu usunięcia nieistotnych pól z danych platformy Chaoxing oraz odfiltrowania nieprawidłowych próbek. Jednocześnie pola nietekstowe i krótkie recenzje są usuwane z danych recenzji na platformie MOOC. Drugim krokiem jest przeprowadzenie przetwarzania segmentacyjnego. Wśród nich chińskie komentarze wykorzystują "precyzyjny tryb" Jieba do przetwarzania segmentacji tekstu, podczas gdy angielskie komentarze korzystają z funkcji segmentacji słów w bibliotece NLTK do przetwarzania. Trzecim krokiem jest usunięcie typowych słów przygranicznych, takich jak "de", "yes", "in" itd. Wśród nich chińskie słowa stop wykorzystują listę słów stop z Harbin Institute of Technology (https://github.com/goto456/stopwords/blob/master/hit_stopwords.txt). Słowa stop są usuwane przez dopasowanie słów. Angielskie słowa stop wykorzystują uniwersalną listę słów stop wbudowaną w bibliotekę NLTK, która jest również usuwana poprzez dopasowywanie słowo po słowie. Czwartym krokiem jest użycie stemmera biblioteki NLTK do wyodrębnienia rdzeni z tekstu i przywrócenia czasowników w angielskich danych do ich formy rdzenia. Piątym krokiem jest identyfikacja pozytywnych i negatywnych słów emocjonalnych w komentarzach na podstawie słownika emocjonalnego CNKI, aby zapewnić podstawę do późniejszej klasyfikacji emocjonalnej przed adnotacją. Szóstym krokiem jest wykonanie ekstrakcji cech. Wśród nich dane strukturalne na platformie Chaoxing są standaryzowane, natomiast wskaźniki klasyfikacji kodowane są osobno. Jednocześnie dane komentarzy platformy MOOC wykorzystują wstępnie wytrenowany model językowy (Bidirectional Encoder Representation from Transformers, BERT) do wyodrębniania cech tekstowych. Główną zaletą modelu BERT w ekstrakcji cech tekstowych jest możliwość dynamicznego generowania kontekstowych wektorów słów za pomocą głębokiej, dwukierunkowej architektury Transformer, skutecznie rozwiązując niejednoznaczność, której tradycyjne statyczne modele osadzania słów nie są w stanie poradzić. Siódmym krokiem jest rozwiązanie problemu niezrównoważonych kategorii sentymentu w danych komentarzy. Do jego przetwarzania stosuje się technikę Syntetycznej Nadpróbkowania Mniejszości (SMOTE). Do interpolacji wybieranych jest pięć próbek najbliższych sąsiadów, aby uzyskać syntetyczne próbki klasy mniejszościowej, z ustalonym losowym nasionem 42, aby zapewnić powtarzalność eksperymentu. Ósmym krokiem jest adnotacja i podział danych. Dziewiątym krokiem jest uzupełnienie brakujących wartości w danych o supergwiazdach i usunięcie wartości odstających. Podczas przetwarzania balansowania danych SMOTE tworzy nowe próbki kompozytowe poprzez interpolację między próbkami klas mniejszościowych, zwiększając tym samym liczbę próbek klas mniejszościowych i sprawiając, że rozkład klas zbioru danych jest bardziej zrównoważony –16,17. Wyrażenie SMOTE pokazano w równaniu (3).

Bmn = dm + rand(0,1) x (dmn - dm) (3)

W równaniu (3) Bmn jest sztucznie skonstruowaną próbą klasy mniejszościowej, dm to i-ta próba klasy mniejszościowej, a dmn to n-ta próba spośród k-najbliższych sąsiadów dm . Rand(0,1) to liczba losowa między 0 a 1. XGBoost poprawia wydajność predykcyjną, iteracyjnie dodając drzewa predykcji. Ma zalety takie jak wysoka dokładność, duża elastyczność oraz łatwość obsługi18,19. Etapy iteracyjnej konstrukcji modelu drzewa z użyciem XGBoost obejmują głównie: inicjalizację modelu, iteracyjne konstruowanie drzewa, funkcję celu oraz wyraz regularizacyjny. Przewidywana wartość wyjściowa figure-protocol-8 w t-tym iteracji jest przedstawiona w równaniu (4).

figure-protocol-9 (4)

W równaniu (4) figure-protocol-10 jest wartością predykcji modelu po t - 1 iteracji, ft(h) to funkcja predykcyjna modelu drzewa dodanego w t-tej iteracji, a h to wektor cech wejściowych. Funkcja celu minimalizująca XGBoost jest przedstawiona w równaniu (5).

figure-protocol-11 (5)

W równaniu (5) i to liczba próbek. I i J to całkowita liczba próbek i drzew, a j to liczba drzew. figure-protocol-12 jest funkcją strat, a gi jest prawdziwą etykietą i-tej próbki. figure-protocol-13jest przewidywaną wartością modelu dla i-tej próbki po t -tej iteracji. Ω(ft) to wyraz regularizacyjny, a (ft) to funkcja predykcyjna j-tego drzewa. Ogólne wyrażenie Ω(f) dla regularizacji pokazano w równaniu (6).

figure-protocol-14 (6)

W równaniu (6) γ oznacza współczynnik kary dla liczby węzłów liściowych, λ to współczynnik regularizacji L2 dla wagi węzłów liściowych, a w to waga węzłów liściowych. Jednak wybór hiperparametrów XGBoost ma bezpośredni i istotny wpływ na wydajność. Typowe hiperparametry XGBoost to szybkość uczenia, maksymalna głębokość drzewa oraz parametry regularizacyjne. Ze względu na potencjalnie dużą przestrzeń hiperparametrów, ręczna regulacja tych parametrów jest nie tylko czasochłonna, ale także trudna do znalezienia optymalnej kombinacji parametrów. Dlatego badanie to projektuje IGWO tak, aby optymalizować hiperparametry XGBoost. GWO poszukuje optymalnych rozwiązań, symulując hierarchię społeczną i strategie polowań wilków szarych, z korzyściami takimi jak mniejsza liczba parametrów i silna zdolność adaptacji20,21. W GWO początkowa pozycja populacji jest generowana zgodnie z równaniem (7).

figure-protocol-15  (7)

W równaniu (7) Puv to pozycja u-tego jednostki w wymiarze v-tym. figure-protocol-16 oraz figure-protocol-17 są górnym i dolnym ograniczeniem v-tej przestrzeni przeszukiwania. rand() to liczba losowa między [0,1]. Jednak algorytm GWO może napotkać problemy takie jak wolna prędkość zbieżności i utknięcie w lokalnych optymatach w środkowych i późniejszych etapach. Oznacza to również, że na tym etapie GWO może nie być w stanie skutecznie eksplorować całej przestrzeni rozwiązań, co utrudnia znalezienie globalnego optymalnego rozwiązania. Aby rozwiązać ten problem, badanie to ulepsza GWO z dwóch aspektów: wprowadzając Tent Chaotic Map (TCM) oraz Nieliniowy Współczynnik Zbieżności (NCF). TCM to proste chaotyczne odwzorowanie, które zapewnia, że potencjalne optymalne regiony rozwiązania nie zostaną przegapione podczas procesu wyszukiwania i unika powtarzających się poszukiwań tego samego obszaru22. Dzięki TCM można wygenerować bardziej jednolitą i losową populację początkową, a zdolność algorytmu do pokonywania lokalnych optymatów może zostać wzmocniona. Obliczenie TCM przedstawiono w równaniu (8).

figure-protocol-18 (8)

W równaniu (8) y jest parametrem sterującym. Rt i Rt+1 są zmiennymi stanu systemu w iteracji t-tej i t+1-tej. Wzór dla NCF z przedstawiono w równaniu (9).

figure-protocol-19 (9)

W równaniu (9) zmax to maksymalny współczynnik zbieżności, a tmax to maksymalna liczba iteracji. Ta nieliniowa metoda malejąca pozwala GWO utrzymać duży rozmiar kroku dla globalnego wyszukiwania na wczesnym etapie. W środkowym etapie wyszukiwania prędkość zbieżności przyspiesza, natomiast na późniejszym etapie lokalne przeszukiwanie realizowane jest mniejszymi krokami, skutecznie równoważąc możliwości wyszukiwania globalnego i lokalnego oraz poprawiając wydajność optymalizacji. Algorytm IGWO jest używany specjalnie do etapu optymalizacji hiperparametrów klasyfikatora sentymentów XGBoost, a jego główny proces przedstawiono na Rysunku 4.

figure-protocol-20
Rysunek 4: Główny proces IGWO. Rysunek przedstawia proces realizacji IGWO, w tym inicjalizację populacji opartą na chaotycznym mapowaniu namiotowym, aktualizację pozycji nieliniowych czynników zbieżności oraz optymalny indywidualny screening, a także wyjaśnia logikę optymalizacji hiperparametrów XGBoost. Proszę kliknąć tutaj, aby zobaczyć większą wersję tej figurki.

Na Rysunku 4 proces IGWO obejmuje: inicjalizację algorytmu; wykorzystanie TCM do inicjalizacji populacji; obliczanie początkowej wartości przystosowości każdego osobnika; używając NCF do aktualizacji pozycji wilków szarych; wybór rozwiązania o najlepszym dopasowaniu jako nowego optymalnego indywidualnego; oraz wydawanie optymalnego indywidualnego kandydata. Optymalna kombinacja hiperparametrów XGBoost może być generowana przez IGWO. Cały proces klasyfikacji sentymentów integruje wstępne przetwarzanie danych, optymalizację IGWO oraz ostateczny model XGBoost. Proces modelu klasyfikacji oparty na IGWO-XGBoost jest przedstawiony na Rysunku 5.

figure-protocol-21
Rysunek 5: Proces modelu klasyfikacji oparty na IGWO-XGBoost. Rysunek przedstawia cały proces modelu klasyfikacji sentymentów IGWO-XGBoost, od wprowadzania i wstępnego przetwarzania danych po partycjonowanie zbiorów danych, optymalizację hiperparametrów IGWO, konstrukcję modelu XGBoost oraz wyniki klasyfikacji, jasno prezentując łańcuch operacyjny modelu. Proszę kliknąć tutaj, aby zobaczyć większą wersję tej figurki.

Model oparty na IGWO-XGBoost obejmuje procesy takie jak dane wejściowe, wstępne przetwarzanie danych, partycjonowanie zbiorów danych, optymalizacja algorytmu IGWO, optymalna kombinacja hiperparametrów, konstrukcja XGBoost na podstawie optymalnej kombinacji hiperparametrów oraz wyniki klasyfikacji. Dzięki temu modelu klasyfikacji emocje w komentarzach uczniów można klasyfikować, co pozwala uzyskać bardziej intuicyjne zrozumienie subiektywnych odczuć uczniów wobec nauki. Konkretne wersje oprogramowania, losowe nasiona, specyfikacje sprzętowe, specyfikacje środowiskowe oraz źródła danych użyte w badaniu są przedstawione w Tabeli 1.

Typ zestawuKonkretny model i zawartość
Podstawowe oprogramowaniePython 3.9.7
Biblioteka podstawowaXGBoost 1.7.5、Scikit-learn 1.2.2、Jieba 0.42.1、NLTK 3.8.1、Pandas 1.5.3、NumPy 1.24.3、Matplotlib 3.7.1、Imbalanced-learn 0.10.1
Losowe ziarnoUstaw globalne losowe ziarno na 42
Specyfikacje sprzętowe/środowiskowe1. System operacyjny: Windows 10 Professional Edition (64 bity, numer wersji 22H2)
2. Procesor: Intel Core i5-12600KF (z częstotliwością główną 3,7GHz i dynamiczną częstotliwością przyspieszania 4,9GHz)
3. Pamięć: 64GB DDR4 (częstotliwość 3200MHz, obsługuje do 128GB pamięci)
4. Dysk masowy: 1TB SSD (Samsung 980 Pro, prędkość odczytu 7450MB/s)
5. Karta graficzna: NVIDIA GeForce RTX 3060 (12GB pamięci wideo)
Źródła zbiorów danych i szczegóły dostępu1. Zbiór danych platformy Superstar:
-Source Uniform Resource Locator (URL): https://www.chaoxing.com/
-Metoda pozyskiwania: aplikuj przez Chaoxing Education Big Data Open Platform (ścieżka aplikacji: oficjalna strona platformowa → centrum deweloperskie → interfejs danych → zestaw danych dotyczących zachowań uczących się)
2. Zestaw komentarzy platformy MOOC:
-Źródłowy URL: https://www.icourse163.org/.cn
-Metoda pozyskiwania: Aplikuj przez kanał "wsparcia badań danych" platformy MOOC
Niestandardowe skrypty lub modele1. Skrypt do wstępnego przetwarzania danych
2. Skrypt modelu MPFR
3. Skrypt modelu IGWO-XGBoost
 

Tabela 1: Konkretne wersje oprogramowania, losowe nasiona, specyfikacje sprzętowe, specyfikacje środowiskowe oraz źródła danych wykorzystywane w badaniach. Dostarcz szczegółową listę wymaganego środowiska oprogramowania i sprzętu, losowych ustawień zalążków, źródeł zbiorów danych oraz zakresu wyszukiwania hiperparametrów XGBoost dla badania, aby zapewnić powtarzalność i standaryzację eksperymentu.

Tabela 1 pokazuje, że badanie przyjmuje XGBoost 1.7.5 jako podstawową ramę modelu klasyfikacji sentymentów oraz wprowadza Scikit learn 1.2.2 do wstępnego przetwarzania danych, ekstrakcji cech i oceny modelu. Ponadto badanie jednolicie ustawia losowe ziarno na 42, aby zapewnić powtarzalność partycjonowania danych, nadpróbkowania SMOTE, optymalizacji hiperparametrów IGWO oraz wyników treningu modeli IGWO-XGBoost. Ponadto algorytm IGWO wyznacza przestrzeń przeszukiwania dla hiperparametrów XGBoost. Zakres przeszukiwania dla szybkości uczenia się wynosi [0,001, 0,3] w skali logarytmicznej, a maksymalna głębokość drzewa jest przeszukiwana w zbiorze całkowitym {3, 4,..., 15}. Zakres optymalizacji terminu regularizacyjnego L2 wynosi [0.1, 5.0], a współczynnik próbkowania każdego podzbioru cech drzewa jest optymalizowany w zakresie [0.6, 1.0]. Zakres strojenia dla minimalnej wagi węzłów liściowych wynosi [1, 10].

Zbiór danych oraz powiązany kod wstępnego przetwarzania i analizy zostały wygenerowane i przeanalizowane przez sam zespół. Podstawowe skrypty do wstępnego przetwarzania danych przedstawiono w Tabeli 2.

Import Pandas jako PD, Jieba, RE, Numpy jako NP
z nltk.tokenize import word_tokenize; from nltk.stem import PorterStemmer
Def Clean(Text, L):
return re.sub(r"[^\u4e00-\u9fa5]" if l=="zh" else r"[^a-zA-Z]", " ", text).strip()
Def Process (tekst, L):
t = jieba.lcut(text) if l=="zh" else word_tokenize(text)
return " ".join([PorterStemmer().stem(w) if l=="en" else w for w in t if w not in open ("hit_stopwords.txt").read().split()])
Def main(c,m,l):
cx=pd.read_csv(c).query("czas nauki kursu>=1 & wyniki egzaminu.notna()"); mc=pd.read_csv(m).query("comment text.str.len()>=5")
mc["t"]=mc["tekst komentarza"].apply(clean,args=("zh",)).apply(process,args=("zh",))
np.savez("out.npz",**{k:v dla k,v in locals().items()})

Tabela 2: Skrypt podstawowy do wstępnego przetwarzania danych. Przedstawić podstawowe informacje skryptowe do wstępnego przetwarzania danych, wyjaśnić kroki wstępnego przetwarzania odpowiadające skryptowi oraz dostarczyć techniczne odniesienia do replikacji metod badawczych.

Dostęp ograniczony. Zaloguj się lub rozpocznij wersję próbną, aby wyświetlić tę treść.

Wyniki

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Wyniki LBA uwzględniające klasyfikację wieloperspektywiczną i nastrojową

Aby zweryfikować wydajność, tworzy się środowisko eksperymentalne i opisuje zbiór danych eksperymentalnych. Ponadto badanie to wybiera algorytm porównawczy IGWO-XGBoost i analizuje oraz weryfikuje go za pomocą wskaźników takich jak dokładność, zużycie czasu i szybkość przywołania. W analizie wyników badanie dzieli ją na dwie jasne sekcje: wyniki LBA za pomocą MPFR oraz walidację wydajności klasyfikacji se...

Dostęp ograniczony. Zaloguj się lub rozpocznij wersję próbną, aby wyświetlić tę treść.

Dyskusja

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Do analizy SOLB w tym badaniu zaprojektowano modele MPFR i IGWO-XGBoost oraz wykorzystano dane z internetowych platform nauczania. W eksperymencie zaobserwowano wysoką spójność między oceną modelu wnioskowania a rzeczywistym wynikiem, co wskazuje na skuteczność modelu wnioskowania. Około 25% studentów miało czas nauki od 1 do 10 godzin na kursie. Odsetek uczniów z godzinami nauki w latach 11-20, 21-30, 31-40 godzin i powyżej 41 godzin wynosił 30%, 20%, 15% i 10%. Wskazuje to, że większość uczniów utrzymywała umiarkowane ...

Dostęp ograniczony. Zaloguj się lub rozpocznij wersję próbną, aby wyświetlić tę treść.

Oświadczenia

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Autorzy nie mają żadnych istotnych interesów finansowych ani niefinansowych, które mogliby ujawnić.

Podziękowania

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Badanie to zostało wsparte przez Projekt Doskonałej Młodzieży w ramach Programu Badań Naukowych Prowincji Hunan Departamentu Edukacji (Nazwa projektu: Badania nad strategią szkoleniową wysokiej jakości wykwalifikowanych talentów w produkcji sprzętu kierunki szkolnictwa wyższego stopnia zawodowego napędzane nową jakościową produktywnością; Grant nr 24B0985) oraz w 2025 roku w ramach Mechanical Industry Vocational Education Collaborative Innovation Project z Mechanical Industry Education Development Center (Nazwa projektu: Research on the Talent Training Mode of Innovation and Entrepreneurship Education for Equipment Manufacturing w wyższych szkołach zawodowych opartych na integracji przemysłu i edukacji; Projekt nr JXHYZX2026035).

Dostęp ograniczony. Zaloguj się lub rozpocznij wersję próbną, aby wyświetlić tę treść.

Materiały

Lista materiałów użytych w tym artykule
NazwaFirmaNumer katalogowyKomentarze
Model językowy BERT z pre-trenowanymBadania Googlehttps://github.com/google-research/bert
CNKI słownik emocjiCNKIhttps://www.cnki.net/
Platforma Chaoxing uczy się danych behawioralnychChaoxing INFORMATION TECHNOLOGY DEVELOPMENT Co., Ltdhttps://www.chaoxing.com/
Pamięć komputerowaUniwersalny dostawca sprzętu (brak konkretnego modelu)
Lista wycofanych terminów Instytutu Technologii HarbinaInstytut Technologii Harbinahttps://github.com/goto456/stopwords/blob/master/hit_s 
Intel Core i5-12600KF Intel CorporationBX8071512600KF
Narzędzie do segmentacji słów Jieba (tryb precyzyjny)Społeczność open source firm trzecichhttps://github.com/fxsjy/jieba.
Dane z przeglądu studentów platformy MOOCSieć Love Coursehttps://www.icourse163.org/
Biblioteka NLTKZespół deweloperski NLTKhttps://www.nltk.org/
Język programowania PythonPython Software Foundationhttps://www.python.org/
Scikit-learn 1.2.2Zespół Scikit Learnhttps://scikit-learn.org/stable/
Platforma Smart Tree uczy się danych behawioralnychInteligentna sieć drzewahttps://www.zhihuishu.com/
Technologia SMOTEZespół Imbalanced Learn DevelopmentZintegrowane z biblioteką Imbalanced Learn https://imbalanced-learn.org/stable/
System operacyjny Windows 10Korporacja Microsofthttps://www.microsoft.com/zh-cn/windows/windows-10
XGBoost 1.7.5Zespół deweloperski XGBoosthttps://xgboost.readthedocs.io/

Bibliografia

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Cebi, A., Araujo, R. D., Brusilovsky, P. Do individual characteristics affect online learning behaviors? An analysis of learners sequential patterns. J Res Technol Educ. 55 (4), 663-683 (2023).
  2. Wang, Y. Affective state analysis during online learning based on learning behavior data. Tech Knowl Learn. 28 (3), 1063-1078 (2023).
  3. Wang, K., Zheng, K., Wang, Y. Construction and empirical research of a subjective-and-objective-analysis model of the online learning behavior. Soft Comput. 29 (6), 2971-2982 (2025).
  4. Yang, J. Accurate prediction and analysis of college students' performance from online learning behavior data. IEIE Trans Smart Process Comput. 12 (5), 404-411 (2023).
  5. Du, K., et al. Image-Based Intelligent Classroom Monitoring and Learning Behavior Analysis via Joint Object Detection and Semantic Segmentation. Traitement Signal. 42 (4), 2323-2332 (2025).
  6. Alqahtani, S. Leveraging techniques of epistemic network analysis to discover behaviors of student learning reflections in online learning environments. Eng Technol Appl Sci Res. 14 (3), 14191-14199 (2024).
  7. Li, Y., Wang, X., Chen, F., Zhao, B., Fu, Q. Online learning behavior analysis and prediction based on spiking neural networks. J Social Comput. 5 (2), 180-193 (2024).
  8. Zeng, B. Visual interactive mobile analysis of online English learning behavior based on lagged sequence analysis approach. Int J Interact Mob Technol. 18 (10), 34-47 (2024).
  9. Zhao, M., Zhang, Z. Prediction of online learning behavior in universities based on long short-term memory networks. J Comput Methods Sci Eng. 25 (1), 502-513 (2025).
  10. Li, F., et al. SPOC online video learning clustering analysis: Identifying learners' group behavior characteristics. Comput Appl Eng Educ. 31 (4), 1059-1077 (2023).
  11. Atenyi, J. M., Wang, C. J. Fractional fuzzy inference system design and implementation for temperature control. Iran J Fuzzy Syst. 22 (2), 171-186 (2025).
  12. Alves, K., Ballini, R., Eduardo, P. Financial series forecasting: A new fuzzy inference system for crisp values and interval-valued predictions. Comput Econ. 65 (6), 3673-3721 (2025).
  13. TuuSzabo, B., Koczy, L. T. A highly accurate Mamdani fuzzy inference system for tennis match predictions. Fuzzy Optim Decis Making. 24 (1), 99-127 (2025).
  14. Chen, Y., Li, C. Study on sensible beginning divided-search enhanced Karnik-Mendel algorithms for centroid type-reduction of general type-2 fuzzy logic systems. AIMS Math. 9 (5), 11851-11876 (2024).
  15. Fumanal-Idocin, J., Andreu-Perez, J., Cordon, O., Hagras, H., Bustince, H. ARTxAI: Explainable Artificial Intelligence Curates Deep Representation Learning for Artistic Images Using Fuzzy Techniques. IEEE Trans. Fuzzy Syst. 32 (4), 1915-1926 (2024).
  16. Duan, L., Paknejad, J., Kim, H. Employee attrition prediction with convolutional neural network and synthetic minority over-sampling technique. J Bus Analytics. 8 (1), 24-35 (2025).
  17. Luo, H., Zeng, X., Chen, Y. Research on text classification of coal mine safety hazards based on SMOTE+ENN. China Mining Mag. 34 (1), 116-125 (2025).
  18. Binbusayyis, A., Mohemmed, S. Stability prediction in smart grid using PSO optimized XGBoost algorithm with dynamic inertia weight updation. CMES - Comput Model Eng Sci. 142 (1), 909-931 (2025).
  19. Mosa, M. A. Optimizing text classification accuracy: a hybrid strategy incorporating enhanced NSGA-II and XGBoost techniques for feature selection. Prog Artif Intell. 14 (2), 275-299 (2025).
  20. Luo, S. An interior design method based on the coupling of I-GWO and self-updating neural network under the background of green interaction. Int J Sustain Dev. 28 (1), 43-57 (2025).
  21. Prabhakar, K., Jain, S. K., Padhy, P. K. Virtual inertia control of isolated microgrids using GWO-optimized modified IMC controller. Trans Inst Meas Control. 47 (4), 733-745 (2025).
  22. Lai, Y., Kang, L., Cao, W. A multi-objective particle swarm optimization using logistics-tent chaotic map with GOBL and non-inertial Lévy flight. J Comput (Taiwan). 36 (1), 59-74 (2025).
  23. Hasibur, R., Uddin, M. A., Ria, Z. F., Rahman, R. M. Optimizing BERT for Bengali Emotion Classification: Evaluating Knowledge Distillation, Pruning, and Quantization. Comput. Model. Eng. Sci. 142 (2), 1637-1666 (2025).
  24. Liang, G., Jiang, C., Ping, Q., Jiang, X. Academic performance prediction associated with synchronous online interactive learning behaviors based on the machine learning approach Interact. Learn. Environ. 32 (6), 3092-3107 (2024).
  25. Mei, L. Model Construction of Higher Education Quality Assurance System Based on Fuzzy Neural Network. Informatica. 10 (10), 153-164 (2024).

Dostęp ograniczony. Zaloguj się lub rozpocznij wersję próbną, aby wyświetlić tę treść.

Przedruki i uprawnienia

Poproś o pozwolenie na ponowne wykorzystanie tekstu lub ilustracji tego artykułu JoVE

Poproś o pozwolenie

Sprostowanie

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Formal Correction: Erratum: Multi-Perspective Fuzzy Reasoning and XGBoost-Based Analysis of Online Learning Behavior
Posted by JoVE Editors on 5/25/2026. Citeable Link.

This corrects the article 10.3791/69515

Tagi

Online Learning BehaviorFuzzy ReasoningXGBoost AlgorithmEmotion ClassificationLearning PerformanceGrey Wolf OptimizationPersonalized TeachingLearning Behavior AnalysisProcrastination BehaviorOnline Education

Powiązane artykuły