$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
Wszystkie programy i narzędzia wykorzystane w badaniu są wymienione w Tabeli materiałów.
Kryteria oceny
Klasyfikacja oceny przyjęta w niniejszym badaniu odnosi się do dwóch głównych obszarów, mianowicie biegłości i poprawności, które obejmują wszystkie wymogi kompleksowej oceny pisania w języku angielskim jako obcym (EFL). Wymiary te mają na celu pomiar kluczowych aspektów jakości pisania, które pomagają w skutecznej komunikacji oraz wykazaniu umiejętności biegłości językowej. Moduł biegłości mierzy naturalność, ekspresyjność i spójność tekstu poprzez ocenę płynności wywodu oraz stopnia właściwego wykorzystania słownictwa i struktury zdań. Moduł poprawności koncentruje się na precyzyjnej poprawności gramatycznej, braku błędów mechanicznych oraz zgodności ze standardowymi konwencjami języka angielskiego i teoretycznie mierzy oraz zlicza błędy językowe na kilku poziomach (patrz Tabela 1)
Definicja zadania
Biorąc pod uwagę warunki zautomatyzowanej oceny pisania u uczniów uczących się języka angielskiego, niniejsze badanie proponuje nowy model systemu komputerowej oceny pisania w języku angielskim (EG). W porównaniu z poprzednimi badaniami, które były ograniczone zakresem systemów automatycznej oceny pisania, proponowany system pomoże rozwiązać te ograniczenia poprzez wprowadzenie innowacyjnych technik głębokiego uczenia, umożliwiając użytkownikom poziom analizy lingwistycznej, zakres modyfikacji oraz analizę informacji zwrotnych w całym systemie w oparciu o rozległe przetwarzanie danych. System dwumodelowy, opierający się na dwóch najważniejszych wskaźnikach kompozycji, mianowicie płynności (jak naturalny, spójny i ekspresywny jest tekst) oraz poprawności (jak poprawnie napisany jest tekst obarczony błędami gramatycznymi, mechanicznymi i językowymi), wykorzystuje oddzielne komponenty sieci neuronowych do przeprowadzenia szeregu ocen. Ponadto identyfikuje on błędy na kilku poziomach lingwistycznych, zaleca środki naprawcze i przekazuje informacje zwrotne w formie listy, aby umożliwić użytkownikom metodyczną poprawę nauki języka u uczniów. W celu opisania procesu obliczeniowego komputerowego systemu automatycznej oceny, proponujemy następujący model matematyczny w wzorach (1)–(4) (patrz Tabela 2).
(1)
(2)
(3)
(4)
gdzie: Final Score = złożony wynik oceny pisania; w1 = waga przypisana do wyniku płynności; w2 = waga przypisana do wyniku poprawności; Sf = wynik płynności oparty na modelu BERT (znormalizowany do [0, 1]); Sc = wynik poprawności z wykładniczym zanikiem; λ = stała zaniku kontrolująca karę za błędy; σ(x) = logistyczna funkcja aktywacji sigmoid; ErrorRatio = stosunek liczby błędów do całkowitej liczby tokenów w tekście. Wyniki płynności są normalizowane do przedziału [0, 1] za pomocą logistycznej funkcji sigmoid σ(x), natomiast funkcja wykładniczego zaniku jest stosowana przy ocenie poprawności, aby nałożyć odpowiednią karę za częstotliwość błędów.
Architektura i projekt systemu
Architektura systemu wykorzystuje układ dwumodułowy z architekturą przetwarzania równoległego, w której analiza wprowadzonych wypracowań odbywa się równolegle poprzez równoległe ścieżki ewaluacji. Moduły Płynności (Fluency) i Poprawności (Correctness) generują odpowiednio poszczególne wyniki, a końcowy wynik zbiorczy stanowi średnia ważona tych dwóch wyników cząstkowych. Moduł poprawności, oprócz oceniania, oferuje również sugestie dotyczące wykrywania i korygowania błędów (patrz Rysunek 1).
Moduł płynności
Płynność pisania można zdefiniować jako naturę lub wzorzec użycia języka w odniesieniu do poprawnego doboru słownictwa, różnorodności struktury zdań, złożoności składniowej, spójności itp.4. Modele oceny płynności wychwytują przekazywane idee bez zająknięć czy nienaturalności, brzmiąc zbliżone do natywnych trendów komunikacyjnych. Tradycyjny pomiar płynności opiera się na skalach, co rodzi zastrzeżenia dotyczące niezawodności między sędziami. Proponowany system eliminuje tę wadę, ponieważ zawiera sieć neuronową opartą na modelu BERT, aby automatycznie indukować spójność semantyczną i naturalność językową poprzez głębokie rozumienie sytuacyjne. Decyzja architektoniczna została podjęta z uwzględnieniem mocnych stron BERT, który okazał się skuteczny w identyfikacji relacji kontekstowych i wzorców semantycznych niezbędnych w pomiarze płynności. Sekwencje wejściowe są wprowadzane do systemu i przekazywane przez 12 warstw transformera z wielogłowicową mechanizmem self-attention, aby zidentyfikować zależności dalekosiężne i relacje kontekstowe (patrz Rycina 2).
Mechanizm uwagi przedstawia się następująco:
(5)
Przyjmijmy, że Q, K i V to macierze reprezentujące odpowiednio zapytanie (query), klucz (key) i wartość (value), a d i k to wymiary wektorów kluczy. Osadzenie tokena CLS jest osadzeniem podsumowującym, które rejestruje ogólną spójność semantyczną całej sekwencji wejściowej.
Obliczenie wyniku płynności przebiega w następujący sposób:
(6)
Gdzie hCLS oznacza embedding tokena [CLS] modelu BERT, Wreg oraz breg są parametrami głowicy regresyjnej, a σ to funkcja aktywacji sigmoid, która normalizuje wynik do przedziału [0, 1].
Moduł poprawności
Ocena poprawności koncentruje się na dokładności gramatycznej, precyzji mechanicznej i przestrzeganiu standardowych konwencji języka angielskiego. Wymiar ten odnosi się do technicznych aspektów pisania, w tym do składni, morfologii, interpunkcji i poprawności ortograficznej. Komponent poprawności nie tylko ocenia liczbę błędów językowych, ale także bada ich wpływ na ogólną jakość tekstu. W przeciwieństwie do oceny płynności, która kładzie nacisk na spójność semantyczną i naturalny przepływ, moduł oceny poprawności wymaga precyzyjnej identyfikacji błędów i systematycznej korekty. Moduł rozróżnia różne typy błędów, ocenia ich dotkliwość i dostarcza ukierunkowanych poprawek w celu wsparcia procesu uczenia się. Funkcja straty poprawności wykorzystuje model FLAN-T5, który został dostrojony do wykrywania i korygowania błędów gramatycznych. Wybór ten wynika z możliwości transformacji tekstu-do-tekstu modelu T5, która pozwala systemowi nie tylko na znajdowanie błędów, ale także na wprowadzanie odpowiednich poprawek w obrębie jednego systemu. System ma formę koder-dekoder, a tekst jest wprowadzany w formie tej transformacji: (patrz Rycina 3)
(7)
Element kodera generuje reprezentacje wrażliwe na kontekst, które oddają nie tylko tendencje gramatyczne, ale także potencjalne obszary błędów:
(8)
Dzięki generowaniu odpowiednich wariantów gramatycznych dla błędnie zidentyfikowanych pomyłek, dekoder generuje poprawione sekwencje:
(9)
Tego rodzaju dwukierunkowe przetwarzanie umożliwia systemowi rozpoznawanie kontekstów błędów oraz sposobu ich korygowania, dzięki czemu wskazówki są spójne semantycznie, a jednocześnie koncentrują się na poprawkach gramatycznych.
Kwantyfikacja błędu i algorytm punktacji
Wynik dokładności porównywał oryginalny tekst z wersją poprawioną, uwzględniając błędy językowe oraz ich dotkliwość w zależności od pozycji w tekście i stopnia zakłócenia znaczenia. Metoda ta oddaje rozróżnienie między rodzajami błędów a ich wpływem na zrozumienie treści tekstu. Zależność między częstotliwością błędów a niską jakością tekstu została uwzględniona w systemie oceniania w sposób logarytmiczny. Fundamentalnym krokiem w porównywaniu tokenów tekstu oryginalnego i poprawionego są dwa stopnie porównania oparte na technice wyrównywania ciągów znaków (string alignment) na poziomie bitowym. Drugi etap obejmuje identyfikację i klasyfikację rodzajów błędów w oparciu o znane taksonomie językowe, które rozróżniają błędy gramatyczne (zgoda podmiotu z orzeczeniem, spójność czasów i poprawność struktury składniowej), mechaniczne (pisownia wielką literą, interpunkcja i ortografia) oraz błędy użycia (dobór słownictwa, wyrażenia idiomatyczne i odpowiedniość rejestru). Trzecim etapem jest obliczenie współczynnika błędów w odniesieniu do całkowitej długości tekstu. Czwarty krok wykorzystuje algorytm punktacji oparty na wykładniczym zaniku, który przekształca współczynniki błędów w bezpośrednio interpretowalne wyniki poprawności, aby przybliżyć nieaddytywną i nieliniową zależność między częstotliwością pomyłek a jakością tekstu.
Matematyczna analiza procesu kwantyfikacji błędów rozpoczyna się od obliczenia stosunku wprowadzonych błędów, co pozwala na uzyskanie znormalizowanego wskaźnika wprowadzania błędów, a to z kolei umożliwia sprawne porównanie tekstów o różnej długości:
(10)
(11)
Parametr kalibracji ustalono empirycznie na poziomie 2,5, w pełni walidując go w oparciu o oceny ekspertów, aby funkcja punktacji mogła dostarczać wyników zgodnych z ludzkim rozumieniem spadku jakości tekstu wraz ze wzrostem częstotliwości błędów. Ustalenie wartości tego parametru w ten sposób zapewnia, że każdy tekst z niskim wskaźnikiem błędów (Error_Ratio < 0,1) otrzyma wysoką ocenę poprawności, ponieważ ściśle przestrzega zasad standardowego języka angielskiego, każdy tekst z umiarkowanym wskaźnikiem błędów (0,1 < Error_Ratio ≤ 0,3) otrzyma pośrednią ocenę poprawności, wskazującą na pewne zastrzeżenia językowe, które nie są jednak całkowicie krytyczne, a każdy tekst z wysokim wskaźnikiem błędów (Error_Ratio > 0,3) otrzyma niską ocenę poprawności ze względu na krytyczne błędy językowe, które znacząco utrudniają zrozumienie treści.
Algorytm punktacji poprawności stosowany do oceny poprawności systematycznie uwzględnia wszystkie błędy zlokalizowane i naprawione przez system oparty na T5 jako pozycje karne w obliczeniach końcowego współczynnika błędów. Mechanizm przyznawania punktów karnych stosowany w przypadku błędów gramatycznych jest reprezentowany przez wykładniczy spadek wraz ze wzrostem proporcji błędów w kierunku wysokich wartości, co oznacza bardzo niską jakość tekstu, i przyjmuje wartość 100, gdy współczynnik błędów wynosi 0, co oznacza całkowity brak wykrytych błędów. Świadczy to o perfekcyjnym zastosowaniu standardowych konwencji języka angielskiego. Taka zależność matematyczna zapewnia, że wskaźnik poprawności oferuje znaczące rozróżnienie w całym spektrum poziomów biegłości językowej i reaguje na niewielkie, sukcesywne postępy, które wskazują na rzeczywiste nabycie kompetencji.
Zbiory danych: korpus treningowy i ewaluacyjny
Dane treningowe o odpowiedniej jakości i zakresie są kluczowe dla wydajności systemu dwumodelowego. W niniejszym badaniu w celu opracowania i oceny modelu wykorzystano dobrze zaprojektowany zbiór tekstów napisanych przez studentów, który powstał poprzez zastosowanie różnych zadań pisarskich. Próbę stanowiło 45 mężczyzn i 45 kobiet, studentów pakistańskiej uczelni o średnim wieku 19 lat, realizujących obowiązkowy kurs „Functional English”. Każdy student napisał osiem esejów w ciągu ośmiu tygodni, w tym w ramach testu wstępnego, esejów interwencyjnych oraz testu końcowego. Studenci mieli przygotować od 400 do 450 słów dla każdego zadania pisarskiego. Statystyki zbiorów danych wykazują następujące charakterystyki:
70 500 słów
Średnia długość zdania: 15,7 słowa (SD = 3,2)
Zakres słownictwa (wskaźnik Type-Token Ratio): 0,64 (SD 0,08) Gęstość błędów gramatycznych: 2,3 na 100 słów (SD = 1,1)
Uzasadnienie i zapewnienie jakości wybranych danych
Wybór zbioru danych był podyktowany kilkoma istotnymi względami, które zapewniły bogactwo i relewantność dla prac badawczych nad automatyczną oceną pisania. Po pierwsze, wybrano populację studentów ekonomii ze względu na charakter zbliżony do osób uczących się EFL w pakistańskim szkolnictwie wyższym, co umożliwiło przedstawienie bardziej autentycznych prób pisemnych odzwierciedlających sytuacje z rzeczywistego świata. Po drugie, ustalenie maksymalnego i minimalnego potencjalnego zakresu słów, 400–450 słów, oparto na danych z badań pilotażowych, które wykazały, że zakres ten jest wystarczająco złożony językowo, aby mógł zostać rzetelnie przeanalizowany przez maszynę, a jednocześnie pozostaje w rozmiarze umożliwiającym spójną ocenę ludzką. Każda z rozpraw została oceniona przez trzech przeszkolonych nauczycieli języka angielskiego (niezależność ocen κ = 0.847 dla wymiaru płynności oraz 0.823 dla wymiaru poprawności) na standardowych 10-punktowych skalach oceny płynności i poprawności. Szkolenie oceniających było rygorystyczne i opierało się na opracowanych rubrykach oceniania w odniesieniu do ocen pisania w testach IELTS i TOEFL. Dane stanowią zbiór z adnotacjami ludzkimi, który może być wykorzystany do trenowania i walidacji modeli uczonych na danych z adnotacjami ludzkimi.
Procedury preprocessingu i walidacji danych
Zbiór danych został poddany systematycznemu wstępnemu przetwarzaniu, które obejmowało normalizację tekstu, tokenizację za pomocą tokenizatora BERT WordPiece oraz weryfikację jakości. W celu zapewnienia integralności danych wykluczono prace niekompletne oraz teksty zawierające plagiat. Końcowy zbiór danych został losowo podzielony na zestaw treningowy (70%, n = 189), walidacyjny (15%, n = 41) i testowy (15%, n = 40) przy użyciu próbkowania warstwowego, aby zapewnić równowagę pomiędzy poziomami biegłości a rodzajami zadań. Przeprowadzono analizę lingwistyczną dużego korpusu referencyjnego obejmującego profesjonalnie zredagowane teksty akademickie, artykuły prasowe oraz opublikowane eseje, co dało łącznie około 50 milionów słów. Korpus ten dostarcza wzorców językowych niezbędnych do przeprowadzenia testów płynności i wspomaga procedury wykrywania błędów poprzez porównywanie ich ze standardowym użyciem języka. W korpusie referencyjnym etapami poprzedzającymi wstępne przetwarzanie i indeksowanie są tokenizacja, tagowanie części mowy, analiza składniowa oraz etykietowanie semantyczne, co ma na celu ułatwienie szybkiego dostępu do danych podczas oceny w czasie rzeczywistym.
Strategia trenowania modelu biegłości
Zaproponowano sekwencyjny system optymalizacji w celu wytrenowania danych dla osiągnięcia biegłości językowej. W procesie uczenia wykorzystano najnowocześniejsze funkcje, w tym adaptacyjne harmonogramowanie tempa uczenia, progresywny rozmiar partii oraz zaawansowane metody regularyzacji zapobiegające przeuczeniu w miarę postępu treningu, co pozwoliło zachować skuteczność modelu w identyfikowaniu wzorców lingwistycznych wskazujących na biegłość językową. Tempo uczenia wynosi 5 × 10-4 z liniowym harmonogramem zaniku, skonfigurowanym tak, aby zapewnić stabilną zbieżność i zapobiec oscylacjom wokół optymalnych wartości parametrów. Tempo uczenia to wybrano poprzez przeszukiwanie siatkowe w zakresie [1 x 10-6, 1 x 10-4], przy czym wartość 5 x 10-5 okazała się najbardziej odpowiednim kompromisem między szybkością zbieżności a stabilnością. Właściwe trenowanie zostało ograniczone do zaledwie 3 epok; konfiguracja ta została zoptymalizowana na podstawie korzyści empirycznych wynikających z monitorowania straty walidacyjnej, aby zapobiec przeuczeniu, nie blokując jednocześnie wystarczającej liczby aktualizacji parametrów niezbędnych do skutecznego uczenia. W celu zapobieżenia degradacji zastosowano mechanizmy wczesnego zatrzymania z parametrem patience wynoszącym 2 epoki oraz minimalną wartością delta równą 0,001.
Optymalizacja jest przeprowadzana za pomocą optymalizatora AdamW, z uproszczonymi parametrami takimi jak β₁ = 0.9 (momentum, które wykładniczo kontroluje zanik estymacji pierwszego momentu), β₂ = 0.999 (estymacja drugiego momentu, która wykładniczo kontroluje zanik estymacji drugiego momentu) oraz ε = 1 × 10⁻8 (wyraz stabilności numerycznej). Regularyzacja Weight decay (λ = 0.01) zapobiega nadmiernemu wzrostowi wartości parametrów, przy czym wartość ta została wybrana na podstawie analizy wydajności walidacyjnej w zakresie [0.001, 0.1]. Kompleksowy monitoring pozwala na śledzenie różnych metryk w trakcie trenowania, aby zagwarantować optymalną wydajność modelu i uniknąć przeuczenia. W ramach systemu monitorowania znajdują się:
Śledzenie strat: Straty treningowe i walidacyjne są monitorowane w każdej epoce, a wczesne zatrzymanie (early stopping) następuje automatycznie, gdy strata walidacyjna nie ulega poprawie przez 2 kolejne epoki.
Metryki wydajności: Dane walidacyjne są wykorzystywane do obliczania współczynników korelacji Pearsona pomiędzy wynikami przewidywanymi a rzeczywistymi co 100 kroków treningowych.
Wykrywanie gradientów: Monitorowane są normy gradientów w celu wykrycia zanikających i eksplodujących gradientów; przy normie gradientu wynoszącej 1.0 stosowane jest przycinanie gradientu.
Harmonogram tempa uczenia: Obniżanie tempa uczenia na podstawie walidacji (czynnik = 0.5) w przypadku wykrycia plateau trwającego więcej niż 1 epokę.
Kwestie związane z regularyzacją: Współczynniki dropout (0,1 dla BERT, 0,3 dla głowicy regresyjnej) zostały określone w drodze systematycznej ablacji. W procesie trenowania zastosowano kilka metod regularyzacji zapobiegających przeuczeniu: (1) regularyzację dropout z użyciem zoptymalizowanych współczynników dla każdego typu warstwy w sieci, (2) zanik wag (weight decay), zgodnie z powyższym opisem, (3) wczesne zatrzymanie (early stopping), określane na podstawie wyników walidacji oraz (4) augmentację danych polegającą na parafrazowaniu 15% przykładów treningowych przy użyciu metod tłumaczenia zwrotnego. Punkty kontrolne (checkpoints) najlepiej działającego modelu zapisywano po każdej epoce, a modele z najwyższymi wynikami wybierano na podstawie współczynników korelacji walidacyjnej. Funkcją straty wykorzystaną w części oceny płynności jest błąd średniokwadratowy (Mean Squared Error, MSE), który stanowi główną funkcję celu w zadaniu regresji polegającym na przewidywaniu ciągłych wyników płynności. Matematyczny zapis funkcji straty przedstawia się następująco:
(12)
N to całkowita wielkość próby treningowej, y_pred, i to przewidywany wynik płynności i-tej próbki, a y_true, i to odpowiadający mu wynik rzeczywisty ustalony przez ekspertów oceniających. Ta funkcja straty jest bardzo użyteczna w kwadratowym zniechęcaniu do błędów predykcji, dzięki czemu większe błędy wiążą się z większą karą, a ponadto jest ona różniczkowalna. Mechanizm harmonogramowania tempa uczenia jest wysoce zaawansowany i opiera się na procesie dwufazowym, który rozpoczyna się od etapu liniowego rozgrzewania (warmup), a następnie przechodzi w proces systematycznego wygaszania w celu uzyskania optymalnych cech zbieżności. Odbywa się to w fazie rozgrzewania, w której tempo uczenia rozpoczyna się od zera i stopniowo zmienia się do wartości maksymalnej, po czym parametry modelu są optymalizowane względem zbioru treningowego. Wyrażenie matematyczne fazy rozgrzewania ma postać:
(13)
Po fazie rozgrzewki (warmup), szybkość uczenia jest zmniejszana w systematyczny sposób liniowy, aby uniknąć przekroczenia optymalnych wartości parametrów, co prowadzi do stabilnej zbieżności. Matematycznie fazę zaniku opisuje wzór:
(14)
gdzie t to aktualny krok treningowy, lr max to maksymalna szybkość uczenia osiągnięta podczas rozgrzewki, warmup to liczba kroków przypisanych do fazy rozgrzewki, a total to całkowita liczba kroków treningowych we wszystkich epokach. Wspomniana procedura harmonogramowania zapewnia agresywne uczenie modelu na niższych poziomach oraz stabilność na poziomach zbieżności.
Strategia trenowania modelu poprawności
Model poprawności oparto na strategii uczenia transferowego (transfer learning) z wykorzystaniem wstępnie wytrenowanego modelu FLAN-T5, aby w razie potrzeby skorzystać z całej dostępnej wiedzy gramatycznej. Miało to na celu analizę ogólnego rozumienia języka, jak i specyficznych informacji dotyczących błędów popełnianych przez uczniów ESL. Zastosowana metoda uczenia transferowego wykorzystuje punkt kontrolny pszemraj/flan-t5-large-grammar-synthesis jako model bazowy, który oferuje kilka istotnych zalet w zakresie poprawności. Ponieważ model jest już wytrenowany i posiada wysoką zdolność rozumienia języka wypracowaną na różnych rodzajach tekstów, potrafi on dostosować się do wielu stylów i tematów pisania. W szczególności przeprowadzono dostrajanie (fine-tuning) pod kątem gramatyki na dużych zbiorach danych korektorskich, obejmujących wiele typów błędów gramatycznych spotykanych w pisaniu w drugim języku. Ponadto punkt kontrolny zawiera potężne systemy wykrywania błędów, które zostały przetestowane pod kątem różnych typów pomyłek (tj. błędów morfologicznych, syntaktycznych i semantycznych), tworząc idealny standard porównawczy dla wrodzonych parametrów testowania korekty w niniejszym badaniu.
Proces adaptacji domeny odzwierciedla systematyczne modyfikacje parametrów, które nie zmieniają ogólnych możliwości rozumienia języka modelu wstępnie wytrenowanego, lecz wprowadzają specyficzne cechy rozwiązania zadania oceny pisemnej. Proces ten ma następne wyprowadzenie matematyczne:
(15)
Tutaj θpretrained reprezentuje parametry modelu wstępnie wytrenowanego, kodujące ogólne rozumienie języka i wiedzę gramatyczną, a Δθdomain reprezentuje specyficzne aktualizacje parametrów wyuczone z docelowego zadania oceny pisemnej. Aktualizacje specyficzne dla dziedziny są obliczane za pomocą optymalizacji opartej na gradiencie na zbiorze danych docelowych, co zapewnia rozwój przez model specyficznej dla zadania wrażliwości na typy błędów powszechnie występujących w pisaniu w języku EFL, bez zakłócania jego szerszych możliwości lingwistycznych.
Eksperymenty z porównaniami
Aby udowodnić funkcjonalność EG, jako kluczową wartość pomiarową zaproponowano współczynnik korelacji Pearsona, który określa liniową zależność między wynikami zautomatyzowanymi a wiedzą ekspercką ludzi. Współczynnik korelacji wyznacza się według wzoru:
(16)
Gdzie xi oznacza wyniki zautomatyzowane, reprezentuje oceny ludzkie, a
oraz
to odpowiednie wartości średnie. Współczynnik korelacji mieści się w zakresie od −1 do 1, przy czym wartości bliskie 1 wskazują na silną dodatnią zależność między oceną zautomatyzowaną a ludzką.
(17)
(18)
(19)
Porównania z modelem bazowym
Aby ocenić wydajność EG i wykazać jego przewagę nad istniejącymi metodami, przeprowadzono szczegółowe porównania z uznanymi systemami AWE oraz tradycyjnymi podejściami opartymi na pojedynczej metryce. Porównania z tymi modelami bazowymi są niezbędne do potwierdzenia wartości dodanej architektury EG i wykazania, że integracja oceny płynności oraz poprawności zapewnia mierzalną poprawę w stosunku do podejść koncentrujących się na poszczególnych wymiarach w izolacji. Dobór modeli bazowych obejmuje cztery kategorie AWE, z których każda odzwierciedla odmienne podejście do oceny pisania. Pierwsza z nich obejmuje pojedynczy model oparty na BERT do oceny płynności. Modele te wykorzystują architektury transformerów do analizy wzorców tekstowych pod kątem gładkości i spójności. Druga kategoria, osadzona w tradycyjnych metodologiach lingwistycznych, koncentruje się na systemach opartych na regułach do wykrywania błędów gramatycznych. W związku z tym nacisk położono na poprawność, pomijając inne aspekty jakości pisania, takie jak kohezja i treść. Trzecią kategorią są systemy AWE oparte na cechach, które obejmują wskaźniki złożoności lingwistycznej — takie jak zmienność długości zdań, zróżnicowanie leksykalne i złożoność syntaktyczna — w celu wygenerowania ogólnych ocen jakości. Czwarta kategoria uwzględnia systemy hybrydowe, które łączą różne lingwistyczne cechy powierzchniowe, często wykorzystując metody zespołowe lub średnie ważone. Modele te nie osiągają poziomu zintegrowanej zaawansowania, który zapewniają architektury neuronowe EG. Wydajność modeli bazowych oceniano w trzech głównych wymiarach. Pierwszy mierzy zgodność ocen generowanych przez system z ocenami wyszkolonych ekspertów (lektorów języka angielskiego) przy użyciu standaryzowanych rubryk. Drugi określa generalizowalność, identyfikując, czy wydajność pozostaje spójna w przypadku trzech esejów o różnej tematyce i stopniu złożoności. Trzeci wymiar opiera się na niezawodności predykcyjnej, oceniając dokładność i stabilność punktacji za pomocą narzędzi statystycznych, takich jak średni błąd bezwzględny, pierwiastek błędu średniokwadratowego oraz analiza przedziałów ufności. Wspólnie wymiary te tworzą solidne ramy porównawcze i podkreślają przewagę systemów EG, szczególnie w osiąganiu większej precyzji i stabilności niż w przypadku tradycyjnych podejść.
Grupy doświadczalne i kontrolne
Badanie to objęło 90 studentów ekonomii na studiach licencjackich, którzy uczęszczali na kurs funkcjonalnego języka angielskiego w ramach dwóch nienaruszonych grup zajęciowych. Dane zbierano w trzech etapach: podczas testu wstępnego, interwencji oraz testu końcowego, aby śledzić postępy w dokładności i płynności pisania w czasie. Badanie z udziałem ludzi zostało zatwierdzone przez Radę Doradczą Wydziału (Departmental Advisory Board) Uniwersytetu COMSATS w Islamabadzie, kampus w Lahore, Pakistan. Uczestnicy zostali poddani dwóm warunkom: tradycyjnej informacji zwrotnej od nauczyciela oraz informacji zwrotnej wspieranej komputerowo. Grupa kontrolna składała się z 45 studentów, którzy otrzymywali tradycyjną pisemną informację zwrotną od wykwalifikowanego lektora języka angielskiego. Uczestnicy otrzymywali pisemne uwagi do swoich esejów w formie ocen holistycznych, wskazania błędów oraz zaleceń w postaci komentarzy instruktora na temat tego, jak ulepszyć pracę. Grupa eksperymentalna obejmowała z kolei 45 studentów, którzy byli instruowani w ten sam sposób w klasie, jednak ich pisanie było uzupełniane o szybką automatyczną informację zwrotną dostarczaną przez EG, która dostarczała im informacji diagnostycznych, zarówno w zakresie płynności, jak i poprawności, w ciągu około 30 sekund od przesłania pracy.
Badanie to przeprowadzono w ciągu 8 tygodni, rozpoczynając od testu wstępnego (tydzień 1), który miał na celu określenie początkowych umiejętności pisania badanych przed wprowadzeniem interwencji. Przez sześć tygodni uczestnicy z grupy eksperymentalnej otrzymywali informację zwrotną generowaną komputerowo z wykorzystaniem markerów semantycznych NLP, natomiast uczestnicy z grupy kontrolnej otrzymywali ocenę nauczycielską. Ostatecznie w 8. tygodniu przeprowadzono test końcowy, aby zbadać różnice między wynikami dokładności i płynności w pomiarach przed i po interwencji. W celu zapewnienia porównywalności wyników, respondenci wykonywali podobne zadania pisemne w każdym okresie oceny, co zminimalizowało potencjalne zmienne zakłócające związane z trudnością zadań oraz znajomością treści. Aby zapewnić spójność poziomu trudności tematów oraz ich trafność treściową, polecenia do zadań pisemnych zostały dobrane w sposób kongruentny. Tematy esejów wybrano tak, aby studenci poruszali różne obszary tematyczne, co zapobiegło wystąpieniu efektu wprawy oraz znudzeniu uczestników wynikającemu z konieczności wykonywania podobnych zadań przez dłuższy czas.
W fazie przedtestowej uczestnicy zostali poproszeni o napisanie eseju o długości 400–450 słów na temat celów akademickich i zawodowych. To zadanie opisowe opierało się na osobistym doświadczeniu i prognozach na przyszłość, co wiązało się z koniecznością uporządkowania treści, podania jasnych przykładów oraz logicznego sformułowania osobistych celów i motywacji. Zadania pisemne w ramach interwencji opierały się na różnych tematach, takich jak codzienna rutyna, hobby, podróże, pierwszy dzień na uniwersytecie, pamiętne dni w życiu oraz momenty spędzone z najlepszym przyjacielem. Temat testu końcowego dotyczył „Wpływu technologii na komunikację”, a wymagana długość eseju wynosiła 400–450 słów.