Artykuł badawczy

Badanie wpływu zautomatyzowanej oceny pisania za pomocą głębokiej sieci neuronowej i pisemnej oceny nauczycieli na wyniki pisania po angielsku

DOI:

10.3791/69995

8 maja 2026

W tym artykule

Podsumowanie

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Dostarczanie informacji zwrotnej w postaci dwóch funkcji semantycznych opartych na NLP za pomocą systemu komputerowego oraz pisemnej opinii nauczyciela zostało wykorzystane, aby poprawić płynność i poprawność pisania uczniów w języku angielskim. Wyniki wykazały pozytywne wyniki dotyczące pierwszego podejścia.

Streszczenie

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Technologie wspomaganej komputerowo nauki języków odniosły największe postępy w nauce języków, zwłaszcza w kontekście sztucznej inteligencji (AI), w ostatnich latach. Istnieją różne technologie, takie jak automatyczna ocena pisania (AWE dalej) oraz automatyczne ocenianie esejów (AES), które są uważane za filary nauki języków nie tylko w dziedzinach informatyki, ale także w edukacji. Ocena może być przeprowadzona wyłącznie w formie holistycznych ocen z wykorzystaniem technologii AWE, która okazała się bardzo skuteczna w usprawnianiu nauki języka i dlatego nie może zapewnić szczegółowej ani dogłębnej informacji zwrotnej. Aby zapewnić szczegółową informację zwrotną dotyczącą pisania dwóch głównych elementów języka (tj. gramatyki i płynności), rozważono komputerowo wspomagany system implementacji obejmujący modele sieci neuronowych oraz dwie metody przetwarzania języka naturalnego opartego na semantycznej (NLP, dalej). W tym celu 90 pakistańskich studentów uniwersytetów, którzy byli uczniami uczących się angielskiego drugiego języka (ESL), zostało losowo przydzielonych do grup kontrolnych, informacji zwrotnej instruktorów oraz eksperymentalnych. Komputerowo wspomagana ocena obejmowała sieć neuronową. Wyniki testu porównawczego pomiędzy modelem bazowym AWE a instruktorami oceniającymi wykazały korelację między komputerowo wspomaganym sprzężeniem zwrotnym wykorzystującym te sieci neuronowe. Konsekwencje takich wyników leżą w pedagogice pisania ESL, zwłaszcza w sytuacjach, gdy dokładność językowa i płynność stanowią wyzwanie.

Wprowadzenie

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Informacja zwrotna w pisaniu obejmuje różne cechy języka, takie jak organizacja, gramatyka, płynność, treść i mechanika, umożliwiając uczniom przepisanie lub tworzenie nowego tekstu 1,2,3. Obecnie nauczyciele pisania angielskiego są głównymi beneficjentami dzięki szybkim zmianom i postępom w zakresie komputerowej nauki języków (CALL dalej) oraz komputerowej oceny pisania w postaci AWE lub AES oraz oceniania esejówpisemnych 4. Dodatkowo, komputerowa ocena pisania angielskiego dostarcza diagnostycznego feedbacku dotyczącego elementów językowych, takich jak treść, gramatyka, słownictwo itp., zapewniając terminowe, indywidualne i obiektywne odpowiedzi na tekst pisany uczniów. System AWE jest również w stanie udzielać uczniom jasnych, pisemnych odpowiedzi, aby mogli oni przyswoić wiedzę zdobytą dzięki tym odpowiedziom izwiększyć ich zdolnościpoznawcze.

Niniejsze badanie opierało się na badaniach4, które przedstawiały koncepcję wielostrategicznej, komputerowej nauki pisania po angielsku, z uwzględnieniem teorii sprzężenia zwrotnego pisania w języku angielskim oraz procesu analitycznego oceniania. Obejmowało to inne modele semantyczne oparte na NLP, które integrowały głębokie uczenie w pisemnej informacji zwrotnej, oferując rozbudowane oceny informacji zwrotnej. Porusza ograniczenia wcześniejszej technologii AWE, która kładzie nacisk wyłącznie na holistyczne, ale nie na analityczne, specyficzne ocenianie. W konsekwencji chodzi bardziej o dokładną i natychmiastową ocenę z punktami podi i całkowitą liczbą punktów dotyczących szeregu elementów wskaźników językowych, aby poprawić naukę pisania angielskiego wśród uczniów. Spośród różnych cech językoznawstwa (tj. treść, złożoność, poprawność, płynność) niniejsze badanie będzie dotyczyć jedynie płynności i aspektu gramatycznego uczniów ESL w Pakistanie. W tym celu obecne badanie sugeruje strategię technologii NLP polegającą na wykorzystaniu sieci neuronowych wraz z oceną nauczycieli.

W pakistańskim kontekście nauki języków pakistańscy uczniowie napotykają trudności z nauką pisania po angielsku, mimo że uważają naukę angielskiego za przedmiot obowiązkowy od klasy 1 i do klasy 14. Właśnie tutaj wchodzą w grę liczne czynniki, takie jak błędne kursy i stosowanie starych metod do wyjaśniania gramatyki7. Na poziomie uniwersyteckim liczba uczniów, których nauczyciele muszą nauczać, jest dość znaczna, ponieważ uczniowie mają różnorodne wykształcenie, obejmujące różne uczelnie i szkoły. To zmusza nauczycieli do poświęcania dużej części czasu na poprawianie błędów pisemnych uczniów, co sprawia, że obciążenie pracą jest zbyt duże. Z drugiej strony, uczniowie brali pisemną opinię nauczycieli za oczywistą i nie starali się je rozpoznać i poprawić.8.

Jedno z badań wykazało, że płynność jest głównie zależna od faktu, że strach uczniów przed popełnieniem błędu staje się barierą w płynnym pisaniu, dlatego uczniowie wolą unikać częstszych błędów niż angażować się w myśli. Czasami występuje ingerencja języka urdu w angielskie pismo, oprócz innych czynników kontekstowych. Ponadto język urdu jest językiem narodowym. W wyniku tych czynników kontekstowych nauczyciele mają trudności z udzielaniem precyzyjnej, terminowej i spójnej informacji zwrotnej każdemu uczniowi, gdy uczniowie tworzą materiały pisemne lub redagują rękopisy. Biorąc pod uwagę teorię oceny pisania, badanie to będzie mogło podążać za tym, który stosuje automatyczną strategię skontaktowania z pisaniem maszynowym podczas porównania tradycyjnej oceny nauczyciela i stosuje analityczne zamiast całościowego ocenianie, aby zapewnić uczniom natychmiastową informację zwrotną na temat dwóch istotnych wymiarów językowych (tj. gramatyki i płynności)4.

Pojawiły się różne przemysłowe produkty AWE i AES, w tym Pigai.org, Bingo English, My Access, E-rater, I-write, Criterion itd. AES/AWE na wczesnym etapie rozwoju charakteryzuje się głównie tradycyjnym systemem uczenia maszynowego opartym na twierdzeniu Bayesa10, regresji liniowej11 itd. Obecnie rozwoj głębokiego uczenia, szczególnie technologii sieci neuronowych, znacząco przyniósł również korzyści dziedzinie pisania informacji zwrotnej, takiej jak sieci rekurencyjne neuronowe (RNN12), długa pamięć krótkotrwała13, sieci konwolucyjne neuronowe (CNN)14, podejście BERT15. AWE również odniosło korzyści ze strategii przedszkoleniowych stosowanych na początku NLP16. Wiele badań uwzględniało różne rozwiązania skupiające się na sieciach neuronowych, takie jak generowanie próbek przeciwników w celu uczenia się, uczenie się przez Multitask17, uczenie się przez samonadzór18 oraz algorytmy grafowe19. Niektórzy zaproponowali różne techniki rozwiązania problemu braku danych treningowych do pisania informacji zwrotnej20. Istnieją także modele punktacji, które przyczyniają się do wielu modeli sieci neuronowych21.

Korekcja błędów gramatycznych (GEC dalej) to niezależny sposób realizacji misji NLP, który ma zdolność automatycznego wykrywania i korygowania błędów kompozycji. Treść zadań GEC jest powiązana z aspektami AWE. Zadania AWE są traktowane jako uwzględniające diagnozę błędów gramatycznych, z których większość musi być poprawnie zaakcentowana. Jednak badania AWE poświęciły GEC mniejszą uwagę, a tylko nieliczne zintegrowały wczesny model GEC z technologią AWE. Początkowo badania nad GEC najczęściej wybierają N-gram22, a modeljęzykowy 23 , w tym BERT24 , aby identyfikować i poprawiać błędy gramatyczne. Jednak powyższe rozwiązania nie mogły całkowicie rozwiązać problemów takich jak nieporządek czy pominięcie komponentów. Architektura encoder-decoder25 osiągnęła ten sam sukces w GEC, rozwiązując problemy, których wcześniej inne modele nie potrafiły rozwiązać. Ważne jest, aby zauważyć, że zaawansowane architektury GEC wykorzystywały wiele modeli do rozwiązywania problemów, w tym podejścia oparte na Transformerze26.

Inne badania potwierdziły skuteczność AES w porównaniu z ocenami ludzkimi w ocenie esejówpisarskich 27,28. Badanie29 wykazało wpływ automatycznej oceny na biegłość języka angielskiego uczniów. Wyniki wskazywały, że automatyczna ocena miała pozytywny wpływ na biegłość pisania po angielsku. Dla porównania,niektóre inne badaniaignorują wysoki wskaźnik wykrywania błędów przez AES w porównaniu do ocen ludzkich. Najnowsze badania podkreślają rosnącą skuteczność narzędzi wspomaganych przez AI do oceny pisania w edukacji językowej. Jedno z takich badań,31, porównało automatyczne ocenianie z informacjami zwrotnymi wykładowców w kontekście uczenia się chińskich studentów.

Rewolucyjna rola narzędzi opartych na AI w pisaniu akademickim była aktywnie opisywana w najnowszej literaturze. Badania dotyczące zastosowania narzędzi pisemnych opartych na AI jako uzupełnień do tradycyjnej edukacji pisania w języku obcym podkreślają kluczowe znaczenie równych szans i proaktywnego wsparcia nauczycieli w skutecznym wdrażaniu technologii32. Badania badające AWE, takie jak Pigai, wskazały na silną korelację między informacjami zwrotnymi wspieranymi przez komputery a ulepszaniem pisania, poprawek i nowych tekstów ESL33. Inne badanie podkreśliło korzyści płynące z autoenkoderów wariacyjnych (VAE), które pozytywnie wpływają na aspekt szkolenia pisania angielskiego u uczniów i otrzymują informacje zwrotne na wyższych poziomach głębokiego uczenia, specjalizując się w różnych cechach językowych34. Inne badania sugerowały, że systemy AWE nerwowe byłyby skuteczne w użyciu z GEC opartym na NLP, który wykorzystuje głębokie uczenie do natychmiastowej oceny35.

Ulepszanie systemów wieloagentowych jest ważnym krokiem w rozwoju technologii wspomagających pisanie. Przykładem bycia asystentem wieloagentowym, asystentem akademickiego dopracowywania pisania, AcademyCraft, oparty na głębokim uczeniu, wykazał zdolność do pisania i udzielania szczegółowej informacji zwrotnej, ułatwiając tym samym wsparcie pisania oparte na sztucznej inteligencji EFL/ESL, na złożonych schematach analitycznych36. W rzeczywistości badania oparte na technologii na nauce języka zidentyfikowały także różnorodne, emergentne wzorce, takie jak głębokie uczenie, automatyczna ocena i semantyczna informacja zwrotna, a analiza wyników wykazała stopniowy i stały wzrost dokładności pisania oraz zaangażowania uczniów37.

Modele transformer-LSTM wykazują pewną skłonność do automatycznego gradowania i przekazywania informacji zwrotnej na angielskim pismie. Takie architektury hybrydowe wzajemnie łączyły kontekstowe rozumienie transformatorów z sekwencyjnym przetwarzaniem systemów LSTM, co skutkowało poprawą dokładności w ocenianiu gramatyki i spójności oraz zapewnieniem bardziej zniuansowanego generowania informacji zwrotnej38. Postrzeganie nauczycieli EFL wobec narzędzi AI do pisania konsekwentnie informuje o wymiernych postępach w organizacji treści i jakości pisania, koncentrując się na kluczowej roli pomocy pedagogicznej w stymulowaniu użyteczności integracji technologicznej39. Mniej badań porównuje opinie wykładowców z komputerowo wspieraną informacją zwrotną, co sugeruje modele głębokiego uczenia mające na celu zbadanie wpływu na angielskie pisanie uczniów ESL pod względem płynności i gramatyki.

Dostęp ograniczony. Zaloguj się lub rozpocznij wersję próbną, aby wyświetlić tę treść.

Protokół

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Wszystkie programy i narzędzia wykorzystane w badaniu są wymienione w Tabeli materiałów.

Kryteria oceny

Klasyfikacja oceny przyjęta w niniejszym badaniu odnosi się do dwóch głównych obszarów, mianowicie biegłości i poprawności, które obejmują wszystkie wymogi kompleksowej oceny pisania w języku angielskim jako obcym (EFL). Wymiary te mają na celu pomiar kluczowych aspektów jakości pisania, które pomagają w skutecznej komunikacji oraz wykazaniu umiejętności biegłości językowej. Moduł biegłości mierzy naturalność, ekspresyjność i spójność tekstu poprzez ocenę płynności wywodu oraz stopnia właściwego wykorzystania słownictwa i struktury zdań. Moduł poprawności koncentruje się na precyzyjnej poprawności gramatycznej, braku błędów mechanicznych oraz zgodności ze standardowymi konwencjami języka angielskiego i teoretycznie mierzy oraz zlicza błędy językowe na kilku poziomach (patrz Tabela 1)

Definicja zadania

Biorąc pod uwagę warunki zautomatyzowanej oceny pisania u uczniów uczących się języka angielskiego, niniejsze badanie proponuje nowy model systemu komputerowej oceny pisania w języku angielskim (EG). W porównaniu z poprzednimi badaniami, które były ograniczone zakresem systemów automatycznej oceny pisania, proponowany system pomoże rozwiązać te ograniczenia poprzez wprowadzenie innowacyjnych technik głębokiego uczenia, umożliwiając użytkownikom poziom analizy lingwistycznej, zakres modyfikacji oraz analizę informacji zwrotnych w całym systemie w oparciu o rozległe przetwarzanie danych. System dwumodelowy, opierający się na dwóch najważniejszych wskaźnikach kompozycji, mianowicie płynności (jak naturalny, spójny i ekspresywny jest tekst) oraz poprawności (jak poprawnie napisany jest tekst obarczony błędami gramatycznymi, mechanicznymi i językowymi), wykorzystuje oddzielne komponenty sieci neuronowych do przeprowadzenia szeregu ocen. Ponadto identyfikuje on błędy na kilku poziomach lingwistycznych, zaleca środki naprawcze i przekazuje informacje zwrotne w formie listy, aby umożliwić użytkownikom metodyczną poprawę nauki języka u uczniów. W celu opisania procesu obliczeniowego komputerowego systemu automatycznej oceny, proponujemy następujący model matematyczny w wzorach (1)–(4) (patrz Tabela 2).

Równanie wyniku końcowego, wzór na ważoną metodę punktacji, Σ(wSf + wSc), zastosowanie edukacyjne.     (1)

Σf=σ(wynik BERT); schemat równania w analizie modelu AI.    (2)

Wzór na równowagę statyczną \( S_c = 100e^{-\lambda \cdot \text{ErrorRatio}} \); analiza równania.   (3)

Równanie funkcji sigmoidalnej σ(x)=1/(1+e^-x); schemat regresji logistycznej, sieci neuronowych.   (4)

gdzie: Final Score = złożony wynik oceny pisania; w1 = waga przypisana do wyniku płynności; w2 = waga przypisana do wyniku poprawności; Sf = wynik płynności oparty na modelu BERT (znormalizowany do [0, 1]); Sc = wynik poprawności z wykładniczym zanikiem; λ = stała zaniku kontrolująca karę za błędy; σ(x) = logistyczna funkcja aktywacji sigmoid; ErrorRatio = stosunek liczby błędów do całkowitej liczby tokenów w tekście. Wyniki płynności są normalizowane do przedziału [0, 1] za pomocą logistycznej funkcji sigmoid σ(x), natomiast funkcja wykładniczego zaniku jest stosowana przy ocenie poprawności, aby nałożyć odpowiednią karę za częstotliwość błędów.

Architektura i projekt systemu

Architektura systemu wykorzystuje układ dwumodułowy z architekturą przetwarzania równoległego, w której analiza wprowadzonych wypracowań odbywa się równolegle poprzez równoległe ścieżki ewaluacji. Moduły Płynności (Fluency) i Poprawności (Correctness) generują odpowiednio poszczególne wyniki, a końcowy wynik zbiorczy stanowi średnia ważona tych dwóch wyników cząstkowych. Moduł poprawności, oprócz oceniania, oferuje również sugestie dotyczące wykrywania i korygowania błędów (patrz Rysunek 1).

Moduł płynności

Płynność pisania można zdefiniować jako naturę lub wzorzec użycia języka w odniesieniu do poprawnego doboru słownictwa, różnorodności struktury zdań, złożoności składniowej, spójności itp.4. Modele oceny płynności wychwytują przekazywane idee bez zająknięć czy nienaturalności, brzmiąc zbliżone do natywnych trendów komunikacyjnych. Tradycyjny pomiar płynności opiera się na skalach, co rodzi zastrzeżenia dotyczące niezawodności między sędziami. Proponowany system eliminuje tę wadę, ponieważ zawiera sieć neuronową opartą na modelu BERT, aby automatycznie indukować spójność semantyczną i naturalność językową poprzez głębokie rozumienie sytuacyjne. Decyzja architektoniczna została podjęta z uwzględnieniem mocnych stron BERT, który okazał się skuteczny w identyfikacji relacji kontekstowych i wzorców semantycznych niezbędnych w pomiarze płynności. Sekwencje wejściowe są wprowadzane do systemu i przekazywane przez 12 warstw transformera z wielogłowicową mechanizmem self-attention, aby zidentyfikować zależności dalekosiężne i relacje kontekstowe (patrz Rycina 2).

Mechanizm uwagi przedstawia się następująco:

Wzór matematyczny mechanizmu uwagi w sieciach neuronowych, przedstawiający operację softmax.   (5)

Przyjmijmy, że Q, K i V to macierze reprezentujące odpowiednio zapytanie (query), klucz (key) i wartość (value), a d i k to wymiary wektorów kluczy. Osadzenie tokena CLS jest osadzeniem podsumowującym, które rejestruje ogólną spójność semantyczną całej sekwencji wejściowej.

Obliczenie wyniku płynności przebiega w następujący sposób:

Wzór funkcji sigmoidalnej, Sf=sigmoid(WreghCLS+breg), wyrażenie matematyczne.  (6)

Gdzie hCLS oznacza embedding tokena [CLS] modelu BERT, Wreg oraz breg są parametrami głowicy regresyjnej, a σ to funkcja aktywacji sigmoid, która normalizuje wynik do przedziału [0, 1].

Moduł poprawności

Ocena poprawności koncentruje się na dokładności gramatycznej, precyzji mechanicznej i przestrzeganiu standardowych konwencji języka angielskiego. Wymiar ten odnosi się do technicznych aspektów pisania, w tym do składni, morfologii, interpunkcji i poprawności ortograficznej. Komponent poprawności nie tylko ocenia liczbę błędów językowych, ale także bada ich wpływ na ogólną jakość tekstu. W przeciwieństwie do oceny płynności, która kładzie nacisk na spójność semantyczną i naturalny przepływ, moduł oceny poprawności wymaga precyzyjnej identyfikacji błędów i systematycznej korekty. Moduł rozróżnia różne typy błędów, ocenia ich dotkliwość i dostarcza ukierunkowanych poprawek w celu wsparcia procesu uczenia się. Funkcja straty poprawności wykorzystuje model FLAN-T5, który został dostrojony do wykrywania i korygowania błędów gramatycznych. Wybór ten wynika z możliwości transformacji tekstu-do-tekstu modelu T5, która pozwala systemowi nie tylko na znajdowanie błędów, ale także na wprowadzanie odpowiednich poprawek w obrębie jednego systemu. System ma formę koder-dekoder, a tekst jest wprowadzany w formie tej transformacji: (patrz Rycina 3)

Wzór korekcji tekstu T5, T5_Decoder(T5_Encoder), metoda kodowania.   (7)

Element kodera generuje reprezentacje wrażliwe na kontekst, które oddają nie tylko tendencje gramatyczne, ale także potencjalne obszary błędów:

Równanie kodowania sieci neuronowej: wzór H_enc = T5Encoder(T_input).   (8)

Dzięki generowaniu odpowiednich wariantów gramatycznych dla błędnie zidentyfikowanych pomyłek, dekoder generuje poprawione sekwencje:

Wyrażenie matematyczne, T_corrected = T5Decoder(H_enc), model sieci neuronowej, dekodowanie tekstu.   (9)

Tego rodzaju dwukierunkowe przetwarzanie umożliwia systemowi rozpoznawanie kontekstów błędów oraz sposobu ich korygowania, dzięki czemu wskazówki są spójne semantycznie, a jednocześnie koncentrują się na poprawkach gramatycznych.

Kwantyfikacja błędu i algorytm punktacji

Wynik dokładności porównywał oryginalny tekst z wersją poprawioną, uwzględniając błędy językowe oraz ich dotkliwość w zależności od pozycji w tekście i stopnia zakłócenia znaczenia. Metoda ta oddaje rozróżnienie między rodzajami błędów a ich wpływem na zrozumienie treści tekstu. Zależność między częstotliwością błędów a niską jakością tekstu została uwzględniona w systemie oceniania w sposób logarytmiczny. Fundamentalnym krokiem w porównywaniu tokenów tekstu oryginalnego i poprawionego są dwa stopnie porównania oparte na technice wyrównywania ciągów znaków (string alignment) na poziomie bitowym. Drugi etap obejmuje identyfikację i klasyfikację rodzajów błędów w oparciu o znane taksonomie językowe, które rozróżniają błędy gramatyczne (zgoda podmiotu z orzeczeniem, spójność czasów i poprawność struktury składniowej), mechaniczne (pisownia wielką literą, interpunkcja i ortografia) oraz błędy użycia (dobór słownictwa, wyrażenia idiomatyczne i odpowiedniość rejestru). Trzecim etapem jest obliczenie współczynnika błędów w odniesieniu do całkowitej długości tekstu. Czwarty krok wykorzystuje algorytm punktacji oparty na wykładniczym zaniku, który przekształca współczynniki błędów w bezpośrednio interpretowalne wyniki poprawności, aby przybliżyć nieaddytywną i nieliniową zależność między częstotliwością pomyłek a jakością tekstu.

Matematyczna analiza procesu kwantyfikacji błędów rozpoczyna się od obliczenia stosunku wprowadzonych błędów, co pozwala na uzyskanie znormalizowanego wskaźnika wprowadzania błędów, a to z kolei umożliwia sprawne porównanie tekstów o różnej długości:

Wzór na współczynnik błędów, Error_Ratio=Number_of_Corrections/Total_Tokens, równanie matematyczne.   (10)

Wzór na stałą rozpadu \(S_c = 100e^{-2.5 \cdot \text{Error Ratio}}\); równanie matematyczne.   (11)

Parametr kalibracji ustalono empirycznie na poziomie 2,5, w pełni walidując go w oparciu o oceny ekspertów, aby funkcja punktacji mogła dostarczać wyników zgodnych z ludzkim rozumieniem spadku jakości tekstu wraz ze wzrostem częstotliwości błędów. Ustalenie wartości tego parametru w ten sposób zapewnia, że każdy tekst z niskim wskaźnikiem błędów (Error_Ratio < 0,1) otrzyma wysoką ocenę poprawności, ponieważ ściśle przestrzega zasad standardowego języka angielskiego, każdy tekst z umiarkowanym wskaźnikiem błędów (0,1 < Error_Ratio ≤ 0,3) otrzyma pośrednią ocenę poprawności, wskazującą na pewne zastrzeżenia językowe, które nie są jednak całkowicie krytyczne, a każdy tekst z wysokim wskaźnikiem błędów (Error_Ratio > 0,3) otrzyma niską ocenę poprawności ze względu na krytyczne błędy językowe, które znacząco utrudniają zrozumienie treści.

Algorytm punktacji poprawności stosowany do oceny poprawności systematycznie uwzględnia wszystkie błędy zlokalizowane i naprawione przez system oparty na T5 jako pozycje karne w obliczeniach końcowego współczynnika błędów. Mechanizm przyznawania punktów karnych stosowany w przypadku błędów gramatycznych jest reprezentowany przez wykładniczy spadek wraz ze wzrostem proporcji błędów w kierunku wysokich wartości, co oznacza bardzo niską jakość tekstu, i przyjmuje wartość 100, gdy współczynnik błędów wynosi 0, co oznacza całkowity brak wykrytych błędów. Świadczy to o perfekcyjnym zastosowaniu standardowych konwencji języka angielskiego. Taka zależność matematyczna zapewnia, że wskaźnik poprawności oferuje znaczące rozróżnienie w całym spektrum poziomów biegłości językowej i reaguje na niewielkie, sukcesywne postępy, które wskazują na rzeczywiste nabycie kompetencji.

Zbiory danych: korpus treningowy i ewaluacyjny

Dane treningowe o odpowiedniej jakości i zakresie są kluczowe dla wydajności systemu dwumodelowego. W niniejszym badaniu w celu opracowania i oceny modelu wykorzystano dobrze zaprojektowany zbiór tekstów napisanych przez studentów, który powstał poprzez zastosowanie różnych zadań pisarskich. Próbę stanowiło 45 mężczyzn i 45 kobiet, studentów pakistańskiej uczelni o średnim wieku 19 lat, realizujących obowiązkowy kurs „Functional English”. Każdy student napisał osiem esejów w ciągu ośmiu tygodni, w tym w ramach testu wstępnego, esejów interwencyjnych oraz testu końcowego. Studenci mieli przygotować od 400 do 450 słów dla każdego zadania pisarskiego. Statystyki zbiorów danych wykazują następujące charakterystyki:

70 500 słów

Średnia długość zdania: 15,7 słowa (SD = 3,2)

Zakres słownictwa (wskaźnik Type-Token Ratio): 0,64 (SD 0,08) Gęstość błędów gramatycznych: 2,3 na 100 słów (SD = 1,1)

Uzasadnienie i zapewnienie jakości wybranych danych

Wybór zbioru danych był podyktowany kilkoma istotnymi względami, które zapewniły bogactwo i relewantność dla prac badawczych nad automatyczną oceną pisania. Po pierwsze, wybrano populację studentów ekonomii ze względu na charakter zbliżony do osób uczących się EFL w pakistańskim szkolnictwie wyższym, co umożliwiło przedstawienie bardziej autentycznych prób pisemnych odzwierciedlających sytuacje z rzeczywistego świata. Po drugie, ustalenie maksymalnego i minimalnego potencjalnego zakresu słów, 400–450 słów, oparto na danych z badań pilotażowych, które wykazały, że zakres ten jest wystarczająco złożony językowo, aby mógł zostać rzetelnie przeanalizowany przez maszynę, a jednocześnie pozostaje w rozmiarze umożliwiającym spójną ocenę ludzką. Każda z rozpraw została oceniona przez trzech przeszkolonych nauczycieli języka angielskiego (niezależność ocen κ = 0.847 dla wymiaru płynności oraz 0.823 dla wymiaru poprawności) na standardowych 10-punktowych skalach oceny płynności i poprawności. Szkolenie oceniających było rygorystyczne i opierało się na opracowanych rubrykach oceniania w odniesieniu do ocen pisania w testach IELTS i TOEFL. Dane stanowią zbiór z adnotacjami ludzkimi, który może być wykorzystany do trenowania i walidacji modeli uczonych na danych z adnotacjami ludzkimi.

Procedury preprocessingu i walidacji danych

Zbiór danych został poddany systematycznemu wstępnemu przetwarzaniu, które obejmowało normalizację tekstu, tokenizację za pomocą tokenizatora BERT WordPiece oraz weryfikację jakości. W celu zapewnienia integralności danych wykluczono prace niekompletne oraz teksty zawierające plagiat. Końcowy zbiór danych został losowo podzielony na zestaw treningowy (70%, n = 189), walidacyjny (15%, n = 41) i testowy (15%, n = 40) przy użyciu próbkowania warstwowego, aby zapewnić równowagę pomiędzy poziomami biegłości a rodzajami zadań. Przeprowadzono analizę lingwistyczną dużego korpusu referencyjnego obejmującego profesjonalnie zredagowane teksty akademickie, artykuły prasowe oraz opublikowane eseje, co dało łącznie około 50 milionów słów. Korpus ten dostarcza wzorców językowych niezbędnych do przeprowadzenia testów płynności i wspomaga procedury wykrywania błędów poprzez porównywanie ich ze standardowym użyciem języka. W korpusie referencyjnym etapami poprzedzającymi wstępne przetwarzanie i indeksowanie są tokenizacja, tagowanie części mowy, analiza składniowa oraz etykietowanie semantyczne, co ma na celu ułatwienie szybkiego dostępu do danych podczas oceny w czasie rzeczywistym.

Strategia trenowania modelu biegłości

Zaproponowano sekwencyjny system optymalizacji w celu wytrenowania danych dla osiągnięcia biegłości językowej. W procesie uczenia wykorzystano najnowocześniejsze funkcje, w tym adaptacyjne harmonogramowanie tempa uczenia, progresywny rozmiar partii oraz zaawansowane metody regularyzacji zapobiegające przeuczeniu w miarę postępu treningu, co pozwoliło zachować skuteczność modelu w identyfikowaniu wzorców lingwistycznych wskazujących na biegłość językową. Tempo uczenia wynosi 5 × 10-4 z liniowym harmonogramem zaniku, skonfigurowanym tak, aby zapewnić stabilną zbieżność i zapobiec oscylacjom wokół optymalnych wartości parametrów. Tempo uczenia to wybrano poprzez przeszukiwanie siatkowe w zakresie [1 x 10-6, 1 x 10-4], przy czym wartość 5 x 10-5 okazała się najbardziej odpowiednim kompromisem między szybkością zbieżności a stabilnością. Właściwe trenowanie zostało ograniczone do zaledwie 3 epok; konfiguracja ta została zoptymalizowana na podstawie korzyści empirycznych wynikających z monitorowania straty walidacyjnej, aby zapobiec przeuczeniu, nie blokując jednocześnie wystarczającej liczby aktualizacji parametrów niezbędnych do skutecznego uczenia. W celu zapobieżenia degradacji zastosowano mechanizmy wczesnego zatrzymania z parametrem patience wynoszącym 2 epoki oraz minimalną wartością delta równą 0,001.

Optymalizacja jest przeprowadzana za pomocą optymalizatora AdamW, z uproszczonymi parametrami takimi jak β₁ = 0.9 (momentum, które wykładniczo kontroluje zanik estymacji pierwszego momentu), β₂ = 0.999 (estymacja drugiego momentu, która wykładniczo kontroluje zanik estymacji drugiego momentu) oraz ε = 1 × 10⁻8 (wyraz stabilności numerycznej). Regularyzacja Weight decay (λ = 0.01) zapobiega nadmiernemu wzrostowi wartości parametrów, przy czym wartość ta została wybrana na podstawie analizy wydajności walidacyjnej w zakresie [0.001, 0.1]. Kompleksowy monitoring pozwala na śledzenie różnych metryk w trakcie trenowania, aby zagwarantować optymalną wydajność modelu i uniknąć przeuczenia. W ramach systemu monitorowania znajdują się:

Śledzenie strat: Straty treningowe i walidacyjne są monitorowane w każdej epoce, a wczesne zatrzymanie (early stopping) następuje automatycznie, gdy strata walidacyjna nie ulega poprawie przez 2 kolejne epoki.

Metryki wydajności: Dane walidacyjne są wykorzystywane do obliczania współczynników korelacji Pearsona pomiędzy wynikami przewidywanymi a rzeczywistymi co 100 kroków treningowych.

Wykrywanie gradientów: Monitorowane są normy gradientów w celu wykrycia zanikających i eksplodujących gradientów; przy normie gradientu wynoszącej 1.0 stosowane jest przycinanie gradientu.

Harmonogram tempa uczenia: Obniżanie tempa uczenia na podstawie walidacji (czynnik = 0.5) w przypadku wykrycia plateau trwającego więcej niż 1 epokę.

Kwestie związane z regularyzacją: Współczynniki dropout (0,1 dla BERT, 0,3 dla głowicy regresyjnej) zostały określone w drodze systematycznej ablacji. W procesie trenowania zastosowano kilka metod regularyzacji zapobiegających przeuczeniu: (1) regularyzację dropout z użyciem zoptymalizowanych współczynników dla każdego typu warstwy w sieci, (2) zanik wag (weight decay), zgodnie z powyższym opisem, (3) wczesne zatrzymanie (early stopping), określane na podstawie wyników walidacji oraz (4) augmentację danych polegającą na parafrazowaniu 15% przykładów treningowych przy użyciu metod tłumaczenia zwrotnego. Punkty kontrolne (checkpoints) najlepiej działającego modelu zapisywano po każdej epoce, a modele z najwyższymi wynikami wybierano na podstawie współczynników korelacji walidacyjnej. Funkcją straty wykorzystaną w części oceny płynności jest błąd średniokwadratowy (Mean Squared Error, MSE), który stanowi główną funkcję celu w zadaniu regresji polegającym na przewidywaniu ciągłych wyników płynności. Matematyczny zapis funkcji straty przedstawia się następująco:

Równanie funkcji straty płynności, L_fluency, analiza wartości przewidywanych i rzeczywistych, formuła matematyczna.  (12)

N to całkowita wielkość próby treningowej, y_pred, i to przewidywany wynik płynności i-tej próbki, a y_true, i to odpowiadający mu wynik rzeczywisty ustalony przez ekspertów oceniających. Ta funkcja straty jest bardzo użyteczna w kwadratowym zniechęcaniu do błędów predykcji, dzięki czemu większe błędy wiążą się z większą karą, a ponadto jest ona różniczkowalna. Mechanizm harmonogramowania tempa uczenia jest wysoce zaawansowany i opiera się na procesie dwufazowym, który rozpoczyna się od etapu liniowego rozgrzewania (warmup), a następnie przechodzi w proces systematycznego wygaszania w celu uzyskania optymalnych cech zbieżności. Odbywa się to w fazie rozgrzewania, w której tempo uczenia rozpoczyna się od zera i stopniowo zmienia się do wartości maksymalnej, po czym parametry modelu są optymalizowane względem zbioru treningowego. Wyrażenie matematyczne fazy rozgrzewania ma postać:

Równanie harmonogramu tempa uczenia, lr(t)=lrmax·min(t/warmup_steps,1.0), formuła matematyczna.   (13)

Po fazie rozgrzewki (warmup), szybkość uczenia jest zmniejszana w systematyczny sposób liniowy, aby uniknąć przekroczenia optymalnych wartości parametrów, co prowadzi do stabilnej zbieżności. Matematycznie fazę zaniku opisuje wzór:

Równanie harmonogramu tempa uczenia, lr(t)=lr_max*(1-(t-warmup_steps)/(total_steps-warmup_steps)).   (14)

gdzie t to aktualny krok treningowy, lr max to maksymalna szybkość uczenia osiągnięta podczas rozgrzewki, warmup to liczba kroków przypisanych do fazy rozgrzewki, a total to całkowita liczba kroków treningowych we wszystkich epokach. Wspomniana procedura harmonogramowania zapewnia agresywne uczenie modelu na niższych poziomach oraz stabilność na poziomach zbieżności.

Strategia trenowania modelu poprawności

Model poprawności oparto na strategii uczenia transferowego (transfer learning) z wykorzystaniem wstępnie wytrenowanego modelu FLAN-T5, aby w razie potrzeby skorzystać z całej dostępnej wiedzy gramatycznej. Miało to na celu analizę ogólnego rozumienia języka, jak i specyficznych informacji dotyczących błędów popełnianych przez uczniów ESL. Zastosowana metoda uczenia transferowego wykorzystuje punkt kontrolny pszemraj/flan-t5-large-grammar-synthesis jako model bazowy, który oferuje kilka istotnych zalet w zakresie poprawności. Ponieważ model jest już wytrenowany i posiada wysoką zdolność rozumienia języka wypracowaną na różnych rodzajach tekstów, potrafi on dostosować się do wielu stylów i tematów pisania. W szczególności przeprowadzono dostrajanie (fine-tuning) pod kątem gramatyki na dużych zbiorach danych korektorskich, obejmujących wiele typów błędów gramatycznych spotykanych w pisaniu w drugim języku. Ponadto punkt kontrolny zawiera potężne systemy wykrywania błędów, które zostały przetestowane pod kątem różnych typów pomyłek (tj. błędów morfologicznych, syntaktycznych i semantycznych), tworząc idealny standard porównawczy dla wrodzonych parametrów testowania korekty w niniejszym badaniu.

Proces adaptacji domeny odzwierciedla systematyczne modyfikacje parametrów, które nie zmieniają ogólnych możliwości rozumienia języka modelu wstępnie wytrenowanego, lecz wprowadzają specyficzne cechy rozwiązania zadania oceny pisemnej. Proces ten ma następne wyprowadzenie matematyczne:

Wzór na adaptację domeny θ_final=θ_pretrained+Δθ_domain; aktualizacja modelu uczenia maszynowego.   (15)

Tutaj θpretrained reprezentuje parametry modelu wstępnie wytrenowanego, kodujące ogólne rozumienie języka i wiedzę gramatyczną, a Δθdomain reprezentuje specyficzne aktualizacje parametrów wyuczone z docelowego zadania oceny pisemnej. Aktualizacje specyficzne dla dziedziny są obliczane za pomocą optymalizacji opartej na gradiencie na zbiorze danych docelowych, co zapewnia rozwój przez model specyficznej dla zadania wrażliwości na typy błędów powszechnie występujących w pisaniu w języku EFL, bez zakłócania jego szerszych możliwości lingwistycznych.

Eksperymenty z porównaniami

Aby udowodnić funkcjonalność EG, jako kluczową wartość pomiarową zaproponowano współczynnik korelacji Pearsona, który określa liniową zależność między wynikami zautomatyzowanymi a wiedzą ekspercką ludzi. Współczynnik korelacji wyznacza się według wzoru:

Wzór na współczynnik korelacji, r, równanie, analiza statystyczna, obliczanie korelacji danych.    (16)

Gdzie xi oznacza wyniki zautomatyzowane, reprezentuje oceny ludzkie, a obliczenie równowagi statycznej, równanie ΣFx=0, ΣFy=0, schemat strukturalny oraz Równowaga statyczna; schemat ΣFx=0, ΣFy=0 z wektorami sił; narzędzie do analizy mechaniki to odpowiednie wartości średnie. Współczynnik korelacji mieści się w zakresie od −1 do 1, przy czym wartości bliskie 1 wskazują na silną dodatnią zależność między oceną zautomatyzowaną a ludzką.

Wzór na średni błąd bezwzględny, MAE=1/N Σ|y_pred,y_true|; narzędzie analizy statystycznej.    (17)

Wzór na średni błąd kwadratowy, równanie RMSE dla statystycznej analizy błędów, dokładność predykcji.    (18)

Wzór na współczynnik determinacji: R² = 1 - SSres/SStot; analiza statystyczna, równanie dopasowania danych.    (19)

Porównania z modelem bazowym

Aby ocenić wydajność EG i wykazać jego przewagę nad istniejącymi metodami, przeprowadzono szczegółowe porównania z uznanymi systemami AWE oraz tradycyjnymi podejściami opartymi na pojedynczej metryce. Porównania z tymi modelami bazowymi są niezbędne do potwierdzenia wartości dodanej architektury EG i wykazania, że integracja oceny płynności oraz poprawności zapewnia mierzalną poprawę w stosunku do podejść koncentrujących się na poszczególnych wymiarach w izolacji. Dobór modeli bazowych obejmuje cztery kategorie AWE, z których każda odzwierciedla odmienne podejście do oceny pisania. Pierwsza z nich obejmuje pojedynczy model oparty na BERT do oceny płynności. Modele te wykorzystują architektury transformerów do analizy wzorców tekstowych pod kątem gładkości i spójności. Druga kategoria, osadzona w tradycyjnych metodologiach lingwistycznych, koncentruje się na systemach opartych na regułach do wykrywania błędów gramatycznych. W związku z tym nacisk położono na poprawność, pomijając inne aspekty jakości pisania, takie jak kohezja i treść. Trzecią kategorią są systemy AWE oparte na cechach, które obejmują wskaźniki złożoności lingwistycznej — takie jak zmienność długości zdań, zróżnicowanie leksykalne i złożoność syntaktyczna — w celu wygenerowania ogólnych ocen jakości. Czwarta kategoria uwzględnia systemy hybrydowe, które łączą różne lingwistyczne cechy powierzchniowe, często wykorzystując metody zespołowe lub średnie ważone. Modele te nie osiągają poziomu zintegrowanej zaawansowania, który zapewniają architektury neuronowe EG. Wydajność modeli bazowych oceniano w trzech głównych wymiarach. Pierwszy mierzy zgodność ocen generowanych przez system z ocenami wyszkolonych ekspertów (lektorów języka angielskiego) przy użyciu standaryzowanych rubryk. Drugi określa generalizowalność, identyfikując, czy wydajność pozostaje spójna w przypadku trzech esejów o różnej tematyce i stopniu złożoności. Trzeci wymiar opiera się na niezawodności predykcyjnej, oceniając dokładność i stabilność punktacji za pomocą narzędzi statystycznych, takich jak średni błąd bezwzględny, pierwiastek błędu średniokwadratowego oraz analiza przedziałów ufności. Wspólnie wymiary te tworzą solidne ramy porównawcze i podkreślają przewagę systemów EG, szczególnie w osiąganiu większej precyzji i stabilności niż w przypadku tradycyjnych podejść.

Grupy doświadczalne i kontrolne

Badanie to objęło 90 studentów ekonomii na studiach licencjackich, którzy uczęszczali na kurs funkcjonalnego języka angielskiego w ramach dwóch nienaruszonych grup zajęciowych. Dane zbierano w trzech etapach: podczas testu wstępnego, interwencji oraz testu końcowego, aby śledzić postępy w dokładności i płynności pisania w czasie. Badanie z udziałem ludzi zostało zatwierdzone przez Radę Doradczą Wydziału (Departmental Advisory Board) Uniwersytetu COMSATS w Islamabadzie, kampus w Lahore, Pakistan. Uczestnicy zostali poddani dwóm warunkom: tradycyjnej informacji zwrotnej od nauczyciela oraz informacji zwrotnej wspieranej komputerowo. Grupa kontrolna składała się z 45 studentów, którzy otrzymywali tradycyjną pisemną informację zwrotną od wykwalifikowanego lektora języka angielskiego. Uczestnicy otrzymywali pisemne uwagi do swoich esejów w formie ocen holistycznych, wskazania błędów oraz zaleceń w postaci komentarzy instruktora na temat tego, jak ulepszyć pracę. Grupa eksperymentalna obejmowała z kolei 45 studentów, którzy byli instruowani w ten sam sposób w klasie, jednak ich pisanie było uzupełniane o szybką automatyczną informację zwrotną dostarczaną przez EG, która dostarczała im informacji diagnostycznych, zarówno w zakresie płynności, jak i poprawności, w ciągu około 30 sekund od przesłania pracy.

Badanie to przeprowadzono w ciągu 8 tygodni, rozpoczynając od testu wstępnego (tydzień 1), który miał na celu określenie początkowych umiejętności pisania badanych przed wprowadzeniem interwencji. Przez sześć tygodni uczestnicy z grupy eksperymentalnej otrzymywali informację zwrotną generowaną komputerowo z wykorzystaniem markerów semantycznych NLP, natomiast uczestnicy z grupy kontrolnej otrzymywali ocenę nauczycielską. Ostatecznie w 8. tygodniu przeprowadzono test końcowy, aby zbadać różnice między wynikami dokładności i płynności w pomiarach przed i po interwencji. W celu zapewnienia porównywalności wyników, respondenci wykonywali podobne zadania pisemne w każdym okresie oceny, co zminimalizowało potencjalne zmienne zakłócające związane z trudnością zadań oraz znajomością treści. Aby zapewnić spójność poziomu trudności tematów oraz ich trafność treściową, polecenia do zadań pisemnych zostały dobrane w sposób kongruentny. Tematy esejów wybrano tak, aby studenci poruszali różne obszary tematyczne, co zapobiegło wystąpieniu efektu wprawy oraz znudzeniu uczestników wynikającemu z konieczności wykonywania podobnych zadań przez dłuższy czas.

W fazie przedtestowej uczestnicy zostali poproszeni o napisanie eseju o długości 400–450 słów na temat celów akademickich i zawodowych. To zadanie opisowe opierało się na osobistym doświadczeniu i prognozach na przyszłość, co wiązało się z koniecznością uporządkowania treści, podania jasnych przykładów oraz logicznego sformułowania osobistych celów i motywacji. Zadania pisemne w ramach interwencji opierały się na różnych tematach, takich jak codzienna rutyna, hobby, podróże, pierwszy dzień na uniwersytecie, pamiętne dni w życiu oraz momenty spędzone z najlepszym przyjacielem. Temat testu końcowego dotyczył „Wpływu technologii na komunikację”, a wymagana długość eseju wynosiła 400–450 słów.

Dostęp ograniczony. Zaloguj się lub rozpocznij wersję próbną, aby wyświetlić tę treść.

Wyniki

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Ważność i wiarygodność podejścia statystycznego

System został przetestowany przy użyciu różnych komplementarnych metod statystycznych, które dostarczają kompleksowych dowodów na wpływ EG na rozwój pisania. Jest to wieloaspektowa metoda analityczna, która uznaje, że interwencje edukacyjne podlegają złożonej analizie statystycznej, której nie można sprowadzić do zwykłych porównań grup, lecz raczej do analizy wzorców zmian, wielkości efektów oraz korelacji różnych strategii pomia...

Dostęp ograniczony. Zaloguj się lub rozpocznij wersję próbną, aby wyświetlić tę treść.

Dyskusja

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Wyniki eksperymentów pokazują kilka istotnych osiągnięć. Po pierwsze, system dwóch modeli osiągnął silną korelację z ocenami ekspertów ludzkich (r = 0,923), znacznie przewyższając podejścia pojedynczego modelu i współczesne systemy AWE. Po drugie, kontrolowane badanie interwencji wykazało istotną poprawę w zakresie pisania uczniów ESL, przy czym duże rozmiary efektu (d = 1,28) przewyższały te opisane w najnowszej literaturze. Po trzecie, system wykazał lepszą wydajność w wielu metrykach ewaluacji, w tym obniżył średni bł...

Dostęp ograniczony. Zaloguj się lub rozpocznij wersję próbną, aby wyświetlić tę treść.

Oświadczenia

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Nie ma konfliktów interesów wśród wszystkich autorów.

Podziękowania

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Doceniamy wsparcie COMSATS University Islamabad na kampusie w Lahore oraz wydziału anglistyki w zbieraniu danych od studentów.

Dostęp ograniczony. Zaloguj się lub rozpocznij wersję próbną, aby wyświetlić tę treść.

Materiały

Lista materiałów użytych w tym artykule
NazwaFirmaNumer katalogowyKomentarze
OPROGRAMOWANIE / BIBLIOTEKI UŻYTE W BADANIU
Ramy Deep LearningPyTorch1.13.1Ramy głębokiego uczenia do implementacji sieci neuronowych
Modele wstępnie wytrenowaneTransformers (Przytulająca Twarz)4.21.3Wstępnie wytrenowane ładowanie modeli, implementacje modeli BERT i T5
Model językowyBERT (Dwukierunkowe reprezentacje enkodera z transformers)Bert-podstawa-bez obudowyOcena płynności, ocena spójności semantycznej, zrozumienie kontekstowe
Model językowyFLAN-T5 (Precyzyjnie dostrojony język Net T5)pszemraj/flan-t5-large-grammar-synthesisKorekcja błędów gramatycznych, transformacja tekstu na tekst, wykrywanie błędów
Obliczenia numeryczneNumPy1.23.5Obliczenia numeryczne, operacje tablicowe dla funkcji matematycznych
Analiza danychPandy1.5.2Manipulacja danymi, analiza statystyczna i wstępne przetwarzanie
Uczenie maszynoweScikit-learn1.1.3Obliczanie metryk statystycznych, analiza korelacji, metryki ewaluacyjne
WizualizacjaMatplotlib3.6.2Wizualizacja danych, wykresy postępów treningowych, wykresy wydajności
WizualizacjaSeaborn0.12.1Wizualizacja danych statystycznych, mapy korelacji termiczne
Zestaw narzędzi NLPNLTK (Natural Language Toolkit)3.7Wstępne przetwarzanie tekstu, tokenizacja, analiza językowa
Przetwarzanie NLPSpaCy3.4.4Zaawansowane preprzetwarzanie NLP, tagowanie POS, analiza składniowa
TokenizacjaTokenizery0.13.2Szybka tokenizacja dla BERT WordPiece i tokenizacji T5
OPROGRAMOWANIE STATYSTYCZNE I ANALITYCZNE
Oprogramowanie statystyczneOprogramowanie statystyczne SPSSWersja 26.0Analiza statystyczna, niezależne próby T-testy, ANOVA, analiza korelacji
Zbiór danych treningowychKaggle ASAP DatasetWersja z 2012 rokuReferencje korpusu treningowego (90% modeli AWE korzysta z tego zbioru danych)
BIBLIOTEKI OPTYMALIZACJI I TRENINGU PYTHONA
Optymalizatortorch.optim.AdamWPyTorch 1.13.1Optymalizacja modelu z regularizacją spadku wagi (λ=0,01), β 1=0,9, β 2=0,999, ε=1&razy; 10< sprzeciw>-20< godzina>
Utrata / Aktywacjatorch.nn.functionalPyTorch 1.13.1Aktywacja igowa, funkcje utraty, regularizacja wypadająca
Ładowanie danychtorch.utils.data.DataLoaderPyTorch 1.13.1Stopniowe rozmiarowanie partii (4→ 16), ładowanie i grupowanie danych
TokenizacjaTransformers. AutoTokenizerTransformers 4.21.3Tokenizacja BERT WordPiece, wstępne przetwarzanie tekstu
Ładowanie modeluTransformers. AutoModelTransformers 4.21.3Wstępnie wytrenowane ładowanie modeli dla architektur BERT i T5
Kontrola gradientutorch.nn.utils.clip_grad_norm_PyTorch 1.13.1Przycinanie gradientu (próg: 1,0) dla treningu stabilności
Harmonogram LRtorch.optim.lr_schedulerPyTorch 1.13.1Planowanie tempa uczenia się z liniowym zanikiem i rozgrzewką
Metrykisklearn.metricsScikit-learn 1.1.3Korelacja Pearsona, MAE, obliczenia RMSE do oceny
PYTHONA
Klasa bazowaModuł torch.nn.PyTorch 1.13.1Klasa bazowa dla niestandardowych architektur sieci neuronowych (Fluency & Moduły poprawności)
Warstwy liniowetorch.nn.LinearPyTorch 1.13.1Implementacja głowicy regresji liniowej (768→ 512→ 256→ 128→ 1 neurony)
Regularizacjatorch.nn.DropoutPyTorch 1.13.1Regularizacja z rezygnacji (0,1 dla BERT, 0,3 dla regresyjnej głowy)
Aktywacjatorch.nn.functional.sigmoidPyTorch 1.13.1Aktywacja sigmoidalów dla normalizacji wyników płynności [0,1]
Aktywacjatorch.nn.functional.reluPyTorch 1.13.1Aktywacja ReLU w warstwach regresji dla transformacji nieliniowych
TransformerTransformers. BertModelTransformers 4.21.312 warstw transformatorów z wielogłowicową samouwagą do oceny płynności
Seq2SeqTransformers. T5For
Generowanie warunkowe
Transformers 4.21.3Architektura enkodera-dekodera do korekcji błędów gramatycznych
Funkcja stratytorch.nn.MSELossPyTorch 1.13.1Średnia kwadratowa funkcja straty błędu dla treningu regresji płynności
PYTHON LIBRARY EVALUATION AND METRICS LIBRARIES
Korelacjascipy.stats.pearsonrSciPy 1.9.3Współczynnik korelacji Pearsona dla zgodności modelu z człowiekiem
Metryka błędusklearn.metrics.mean_absolute_errorScikit-learn 1.1.3Obliczenie średniego błędu bezwzględnego (MAE) dla dokładności predykcji
Metryka błędusklearn.metrics.mean_squared_errorScikit-learn 1.1.3Średni kwadratowy błąd korzeniowy (RMSE) do oceny wielkości błędu
Test statystycznyscipy.stats.ttest_indSciPy 1.9.3Niezależne próby testu t do testów istotności statystycznej
Macierz korelacjinumpy.corrcoefNumPy 1.23.5Obliczanie macierzy korelacji dla wiarygodności między oceniającymi
Korelacja danychPandy. DataFrame.corrPandas 1.5.2Analiza korelacji danych i raportowanie statystyczne
Wizualizacjamatplotlib.pyplotMatplotlib 3.6.2Wizualizacja wydajności, wykresy korelacji, wykresy postępów w treningu
Mapa ciepłaseaborn.heatmapSeaborn 0.12.1Wizualizacja macierzy korelacji i prezentacja danych statystycznych
PYTHON PROCESSING I BIBLIOTEKI NLP
Przetwarzanie teksture (Wyrażenia regularne)Wbudowany Python 3.9+Dopasowywanie wzorców tekstu, czyszczenie i wstępne przetwarzanie danych
Obsługa konfiguracjijsonWbudowany Python 3.9+Obsługa plików konfiguracyjnych, przechowywanie parametrów modelu
SerializacjaOgórekWbudowany Python 3.9+Serializacja modeli i zapisywanie/ładowanie punktów kontrolnych
Śledzenie postępówTQDM4.64.1Paski postępu dla pętli treningowych i przetwarzania danych
WycinkowanieLogowanieWbudowany Python 3.9+Rejestrowanie postępów treningowych, śledzenie błędów i debugowanie
PowtarzalnośćlosowoWbudowany Python 3.9+Losowe ustawienie zalążkowe dla eksperymentów powtarzalnych
System plikówOSWbudowany Python 3.9+Operacje systemu plików, zarządzanie ścieżkami modeli
Parsowanie CLIargparseWbudowany Python 3.9+Parsowanie argumentów w wierszu poleceń dla konfiguracji treningowych
KOMERCYJNA AWE / PLATFORMY AES (Odniesienie)
Platforma komercyjnaPigai.orgKomercyjna platforma AWEChińska ocena pisania EFL, zautomatyzowane systemy informacji zwrotnej
Platforma komercyjnaBingo angielskiKomercyjny system AWEWsparcie w nauce języka angielskiego, rozwój umiejętności pisania
Platforma edukacyjnaMój dostępPlatforma do pisania edukacyjnegoOcena pisania uczniów i przekazywanie informacji zwrotnej
Silnik punktacjiE-raterAutomatyczny silnik punktacji ETSOcena eseju standaryzowanego testu, holistyczna ocena
Narzędzie ocenyI-writeNarzędzie do oceny pisaniaOcena pisania akademickiego i informacja zwrotna diagnostyczna
Służba treningowaKryteriumUsługa ćwiczeń pisania ETSRozwój umiejętności pisania i automatyczna informacja zwrotna
Model językowy AIChatGPTModel językowy OpenAIOpinia i ocena pisania wspomagana przez AI (cytowane w literaturze)
LEARNING (Cytowane w literaturze)
ArchitekturaRekurencyjne sieci neuronowe (RNN)Cai, 2019Sekwencyjne przetwarzanie tekstu — Systemy sprzężenia zwrotnego i automatyczna ocena
ArchitekturaDługa pamięć krótkotrwała (LSTM)Jin i in., 2018Modelowanie zależności na długi zasięg — Automatyczne ocenianie esejów i analiza sekwencji
ArchitekturaKonwolucyjne sieci neuronowe (CNN)Dong i in., 2017Lokalne rozpoznawanie wzorców — Klasyfikacja tekstu i ekstrakcja cech do oceny
ArchitekturaHybryda transformer-LSTMXuan, 2025Połączone przetwarzanie kontekstowe i sekwencyjne — Automatyczne punktowanie i generowanie informacji zwrotnej
ArchitekturaAutomatykodery wariacyjne (VAE)Kumar i in., 2024Modelowanie generatywne — Wzmocniony rozwój umiejętności pisania i spersonalizowana informacja zwrotna
ArchitekturaSystemy wieloagentoweThompson i in., 2024Wspólne przetwarzanie AI & mdash; Zaawansowane wsparcie pisarskie (platforma AcademiCraft)
MechanizmMechanizmy uwagiDong i in., 2017Uwaga na siebie i wielogłowa uwaga — Poprawiona wydajność AES i zrozumienie kontekstu
TRADYCYJNE TECHNIKI UCZENIA MASZYNOWEGO (Referencja)
Metoda statystycznaTwierdzenie BayesaRudner & Liang, 2002Tradycyjne podejście ML — wczesny rozwój AES/AWE i punktacja probabilistyczna
Metoda statystycznaRegresja liniowaPhandi i in., 2015Modelowanie statystyczne — Ocena pisania oparta na cechach i prognozowanie wyników
Metoda uczenia sięUczenie się preferencji rangChen & He, 2013Metodologia oparta na rankingu & mdash; Ocena eseju porównawcza i modelowanie preferencji
Model językowyModele N-gramoweXie i in., 2015Statystyczne modelowanie językowe — Korekcja błędów gramatycznych i rozpoznawanie wzorców
ArchitekturaArchitektura encoder-dekoderGe i in., 2018Modelowanie sekwencja po sekwencji — Korekcja błędów gramatycznych i transformacja tekstu
Standard ocenyOcena pisemna IELTSDostosowanie rubryki punktacjiStandaryzowane kryteria oceny płynności i poprawności
Standard ocenyOcena pisania TOEFLStandardy pisania akademickiegoOcena biegłości i standaryzowane punktowanie
Miara statystycznaRozmiar efektu D Cohena0,2=mały, 0,5=średni, 0,8=dużyOcena praktycznej istotności dla skuteczności interwencji
Miara niezawodnościNiezawodność między oceniającymi (κ)Płynność: 0,847 / Poprawność: 0,823Współczynnik kappa & mdash; Walidacja zgodności i zgodności przez ludzkiego ewaluatora

Bibliografia

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Bitchener, J. Evidence in support of written corrective feedback. J Second Lang Writ. 17 (2), 102-118 (2008).
  2. Nusrat, A., Ashraf, F., Narcy-Combes, M. F. Effect of direct and indirect teacher feedback on accuracy of English writing: A quasi-experimental study among Pakistani undergraduate students. 3L Lang Linguist Lit. 25 (4), 84-98 (2019).
  3. Nusrat, A., Khan, S., Kashif, F., Fawad, R. Effect of teachers’ asynchronous e-feedback and synchronous oral feedback on English language learners’ writing accuracy. Front Educ. 7, 783684 (2022).
  4. Chen, B., Bao, L., Zhang, R., Zhang, J., Liu, F., Wang, S., et al. A multi-strategy computer-assisted EFL writing learning system with deep learning incorporated and its effects on learning: A writing feedback perspective. J Educ Comput Res. 61 (8), 60-102 (2024).
  5. Li, J., Link, S., Hegelheimer, V. Rethinking the role of automated writing evaluation (AWE) feedback in ESL writing instruction. J Second Lang Writ. 27, 1-18 (2015).
  6. Ellis, R. Explicit form-focused instruction and second language acquisition. The handbook of educational linguistics. , 437-455 (2008).
  7. Shamim, F. Trends, issues and challenges in English language education in Pakistan. Asia Pac J Educ. 28 (3), 235-249 (2008).
  8. Haider, G. An insight into difficulties faced by Pakistani student writers: Implications for teaching of writing. J Educ Soc Res. 2 (3), 17-27 (2012).
  9. Nawaz, M., Hussain, S. A., Bughio, F. A. Exploring the preferred corrective feedback and practiced corrective feedback among Pakistani ESL secondary school students and teachers in writing class: Matches and mismatches. Int J Lang Lit Transl. 6 (1), 31-45 (2023).
  10. Rudner, L. M., Liang, T. Automated essay scoring using Bayes theorem. J Technol Learn Assess. 1 (2), 1-22 (2002).
  11. Phandi, P., Chai, K. M. A., Ng, H. T. Flexible domain adaptation for automated essay scoring using correlated linear regression. , 431-439 (2015).
  12. Cai, C. Automatic essay scoring with recurrent neural network. , 1-7 (2019).
  13. Jin, C., He, B., Hui, K., Sun, L. TDNN: A two-stage deep neural network for prompt-independent automated essay scoring. 1, 1088-1097 (2018).
  14. Dong, F., Zhang, Y., Yang, J. Attention-based recurrent convolutional neural network for automatic essay scoring. CoNLL. , 153-162 (2017).
  15. Sharma, A., Kabra, A., Kapoor, R. Feature enhanced capsule networks for robust automatic essay scoring. , 365-380 (2021).
  16. Mim, F. S., Inoue, N., Reisert, P., Ouchi, H., Inui, K. Corruption is not all bad: Incorporating discourse structure into pre-training via corruption for essay scoring. IEEE ACM Trans Audio Speech Lang Process. 29, 2202-2215 (2021).
  17. Cummins, R., Rei, M. Neural multi-task learning in automated assessment. arXiv. , 1-9 (2018).
  18. Cao, Y., Jin, H., Wan, X., Yu, Z. Domain-adaptive neural automated essay scoring. , 1011-1020 (2020).
  19. Jiang, Z., Liu, M., Yin, Y., Yu, H., Cheng, Z., Gu, Q., et al. Learning from graph propagation via ordinal distillation for one-shot automated essay scoring. , 2347-2356 (2021).
  20. Li, X., Chen, M., Nie, J. Y. SEDNN: Shared and enhanced deep neural network model for cross-prompt automated essay scoring. Knowl Based Syst. 210, 106491 (2020).
  21. Beseiso, M., Alzubi, O. A., Rashaideh, H. A novel automated essay scoring approach for reliable higher educational assessments. J Comput High Educ. 33 (3), 727-746 (2021).
  22. Xie, W., Huang, P., Zhang, X., Hong, K., Huang, Q., Chen, B., et al. Chinese spelling check system based on an n-gram model. , 128-136 (2015).
  23. Brockett, C., Dolan, W. B., Gamon, M. Correcting ESL errors using phrasal SMT techniques. , 249 (2006).
  24. Zhang, S., Huang, H., Liu, J., Li, H. Spelling error correction with soft-masked BERT. , 882-890 (2020).
  25. Ge, T., Wei, F., Zhou, M. Reaching human-level performance in automatic grammatical error correction: An empirical study. arXiv. , 1-15 (2018).
  26. Zhao, W., Wang, L., Shen, K., Jia, R., Liu, J. Improving grammatical error correction via pre-training a copy-augmented architecture with unlabeled data. 1, 156-165 (2019).
  27. Shermis, M. D., Koch, C. M., Page, E. B., Keith, T. Z., Harrington, S. Trait ratings for automated essay grading. Educ Psychol Meas. 62 (1), 5-18 (2002).
  28. Mizumoto, A., Shintani, N., Sasaki, M., Teng, M. F. Testing the viability of ChatGPT as a companion in L2 writing accuracy assessment. Res Methods Appl Linguist. 3 (2), 100116 (2024).
  29. Ajabshir, Z. F., Ebadi, S. The effects of automatic writing evaluation and teacher-focused feedback on CALF measures and overall quality of L2 writing across different genres. Asian Pac J Second Foreign Lang Educ. 8 (1), 26 (2023).
  30. Almusharraf, N., Alotaibi, H. An error-analysis study from an EFL writing context: Human and automated essay scoring approaches. Tech Knowl Learn. 28 (3), 1015-1031 (2023).
  31. Chen, H., Pan, J. Computer or human: A comparative study of automated evaluation scoring and instructors' feedback on Chinese college students' English writing. Asian Pac J Second Foreign Lang Educ. 7 (1), 34 (2022).
  32. Liu, X., Zhang, Y., Chen, L. The transformative impact of AI-powered tools on academic writing: Perspectives of EFL university students. Lang Learn Technol. 28 (2), 78-95 (2024).
  33. Zhang, Q., Li, F. From process to product: Writing engagement and performance of EFL learners under computer-generated feedback instruction. System. 115, 102998 (2023).
  34. Kumar, S., Patel, R., Williams, T. Automated deep learning approaches in variational autoencoders (VAEs) for enhancing English writing skills. J Educ Technol Res. 45 (3), 234-251 (2024).
  35. Martinez, A., Rodriguez, P., Thompson, K. Neural automated writing evaluation with corrective feedback. Comput Linguist. 50 (1), 123-145 (2024).
  36. Thompson, J., Anderson, C., Davis, R. AcademiCraft: Transforming writing assistance for English for academic purposes with multi-agent system innovations. Artif Intell Educ. 12 (4), 445-462 (2024).
  37. Rodriguez, M., Kim, S., Brown, D. Technology-enhanced language learning in English language education: Performance analysis, core publications, and emerging trends. Appl Linguist Rev. 15 (2), 201-225 (2024).
  38. Xuan, Y. Transformer-LSTM models for automatic scoring and feedback in English writing assessment. IEEE Access. 13, 82084-82096 (2025).
  39. Anderson, R., Smith, K., Johnson, M. The impact of AI writing tools on the content and organization of students' writing: EFL teachers' perspective. Comput Educ. 195, 104712 (2023).

Dostęp ograniczony. Zaloguj się lub rozpocznij wersję próbną, aby wyświetlić tę treść.

Przedruki i uprawnienia

Poproś o pozwolenie na ponowne wykorzystanie tekstu lub ilustracji tego artykułu JoVE

Poproś o pozwolenie

Tagi

Kompuerowe Wspomaganie Nauki J zyk wModele Sieci NeuronowychPrzetwarzanie J zyka NaturalnegoAutomatyczna Ocena WypracowaPedagogika Pisania dla ESLInformacja Zwrotna w Zakresie GramatykiP ynno Pisania

Powiązane artykuły