$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
Intensywna globalizacja edukacji i technologii cyfrowych zwiększyła potrzebę naukowej i wiarygodnej oceny poziomu pisania w języku angielskim w kontekście nauczania języków, rozwoju akademickiego i awansu kariery1. Tradycyjne oceny pisania, stosowane przez ludzką ocenę, mogą mierzyć subiektywne aspekty pisania, takie jak dokładność argumentacji i odpowiedniość kulturową2, ale są podatne na długie czasy realizacji, wysokie koszty robocizny oraz stronniczość wynikającą z doświadczenia i poglądów oceniających 3,4. Te ograniczenia są szczególnie dotkliwe w dużej praktyce, takiej jak międzynarodowe testy językowe (IELTS, TOEFL) czy inne kursy w języku angielskim prowadzone na uniwersytetach, gdzie ręczne ocenianie nie jest jedynym wymaganym w zakresie natychmiastowej informacji zwrotneji zakresu 5.
Systemy AWE stały się szeroko stosowane w tym kontekście dzięki przetwarzaniu w czasie rzeczywistym, standaryzacji i skalowalności6. Takie popularne narzędzia jak Grammarly (skupiający się na błędach gramatycznych i dopracowywaniu stylu) oraz ETS Criterion (który spełnia formalne normy pisania) są obecnie używane przez miliony uczniów w edukacji K-12, szkołach językowych, szkolnictwie wyższym oraz w szkoleniach indywidualnych7. Chociaż to są korzyści, efektywność technologiczna i zastosowanie edukacyjne systemów AWE wciąż budzą spory8. Technicznie rzecz biorąc, istniejące systemy są bardzo dokładne w zakresie obiektywnych wymiarów, w tym wykrywania błędów i różnorodności leksykalnej, gdzie korelacja z oceną ludzką może przekraczać 0,859. Jednak w bardziej subiektywnych obszarach, takich jak istotność treści, argumentacja logiczna i organizacja tekstu, korelacje często są niższe niż 0,7010. Taka dysproporcja niesie ze sobą ryzyko sprzyjania powierzchownej dokładności wśród uczniów kosztem ogólnej kompetencji w pisaniu11.
Kwestia równości ogranicza także edukacyjną użyteczność AWE. Obecne badania również skupiają się na łącznych wskaźnikach dokładności, pomijając możliwość odchyleń, które systematycznie szkodzą niektórym grupom12. Charakterystycznie cechy międzyjęzykowe wspólne dla uczniów chińskiego lub hiszpańskiego byłyby błędnie uznawane za błędy, co skutkowałoby systematycznym niedoszacowaniem13,14. Ponadto subiektywna akceptacja informacji zwrotnej AI przez uczniów jest zazwyczaj mało znana15. Badania wskazują, że prawie jedna trzecia uczniów niebędących native speakerami zgłasza nieodpowiedniość między wynikami AI a rzeczywistymi wynikami, a procesy dokładności technicznej, równości grupowej i satysfakcji uczniów wciąż są słabo rozumiane16.
Te słabości odzwierciedlają niedociągnięcia klasycznego paradygmatu dokładności17. Ramy, które uwzględniają jedynie zgodność między AI a oceną ludzką, nie mogą uwzględnić kwestii równości ani zaufania ucznia do systemu. W praktyce wartość edukacyjna AWE musi jednocześnie spełniać trzy warunki: precyzję techniczną, sprawiedliwość między grupami oraz akceptację przez ucznia18. Brak tak kompleksowego podejścia walidacyjnego pomaga wyjaśnić, dlaczego systemy AWE cieszą się szerokim przyjęciem, a jednocześnie ograniczone zaufanie do praktyki edukacyjnej19,20.
Aby sprostać temu wyzwaniu, niniejsze badanie wprowadza wielopoziomowe ramy walidacyjne, które integrują dokładność techniczną, sprawiedliwość grupową i indywidualną oraz percepcję ucznia w spójną strukturę. Proponowany framework XAI został zaprojektowany tak, aby być praktycznie wdrażany na istniejących platformach AWE, zapewniając nauczycielom i uczniom diagnostykę sprawiedliwości oraz przejrzyste wyjaśnienia wyników, a także może być stosowany na kursach pisania lub zajęciach przygotowujących do testów, aby ocenić jego zdolność do poprawy sprawiedliwości, interpretowalności i użyteczności dydaktycznej w rzeczywistych środowiskach oceniania.
W tym kontekście hipoteza jest AFMM badającym rolę pośredniczącą postrzeganej sprawiedliwości w określaniu związku między dokładnością a satysfakcją, a także rolę moderującą biegłość językową w wrażliwości na sprawiedliwość. Dlatego wnosi to wkład na dwa sposoby: teoretycznie: wzbogacając modele ewaluacyjne AWE poprzez opisywanie sprawiedliwości jako jednego z kluczowych wymiarów walidacji obok dokładności i percepcji, jak i praktycznie, dostarczając programistom strategii maksymalizujących sprawiedliwość, nauczycieli z kryteriami wyboru systemu uwzględniającego grupę, oraz edukacyjną wartość AWE poprzez wyjaśnienie, w jaki sposób kształtowane są postrzegania uczniów. Oprócz edukacji, ramy te są również zgodne z szerszą koncepcją XAI, pokazując, jak sprawiedliwość i postrzeganie użytkowników mogą zwiększać przejrzystość, zaufanie i akceptację w innych obszarach, takich jak opieka zdrowotna, systemy autonomiczne i cyberbezpieczeństwo.
Pytania badawcze:
1.To jakim stopniu system AWE wykazuje techniczną dokładność i sprawiedliwość w różnych grupach języków ojczystych i biegłych?
2. Jak wielopoziomowy system oceny oparty na XAI może poprawić przejrzystość i równość w automatycznym testowaniu pisania angielskiego?
PRZEGLĄD LITERATURY:
Czynniki wpływające na akceptację informacji zwrotnej AWE przez studentów zostały przeanalizowane za pomocą rozszerzonego modelu akceptacji technologii (TAM)21. Na podstawie danych ankietowych przeprowadzonych przez 448 chińskich uczniów korzystających z SEM ustalono, że użyteczność, łatwość obsługi i intencja miały istotny wpływ na subiektywne normy, zaufanie, poczucie własnej skuteczności, sprzężenie zwrotne poznawcze oraz cechy systemu. Jednak badanie dotyczyło pojedynczego narodu i jednej grupy studentów, co ogranicza zastosowanie uogólnień. Aby zbadać, jak chińscy uczniowie EFL reagują na opinie Pigai AWE22, badanie przeanalizowało powtarzające się zgłoszenia (n = 5) przez studentów uniwersytetów. Zauważono wczesny nacisk na korekcję błędów, niskie przyjmowanie informacji zwrotnej językowej oraz stopniowe pogłębianie odpowiedzi. Jednak wielkość próby była bardzo ograniczona, podobnie jak system AWE, który ogranicza zastosowanie i uogólnienie. Przekonania nauczycieli EFL dotyczące zastosowania narzędzia oceniania AI (CoGrader) zostały przeanalizowane, aby zidentyfikować czynniki wpływające na ich poglądy23. Dzięki mieszanemu badaniu przeprowadzonym na 10 saudyjskich nauczycielach uniwersyteckich, ankieta i wywiad wykazały, że opinie są mieszane, pozytywne, ale niechęć do pełnej pewności co do wiarygodności i całkowitej wymiany nauczycieli. Utrudnia to uogólnienie ze względu na ograniczoną próbę i ustawienia jednego kraju.
Biorąc pod uwagę rozwój lingwistyki korpusowej i technologii AI, badanie obejmowało frameworki AES24. Wykorzystano PCA do poprawy wskaźników językowych do oceny jakości pisania i odkryto, że łączenie mikro-cech z cechami zagregowanymi definiuje jakość pisania skuteczniej niż same cechy zagregowane. Nieliniowe podejście AES oparte na regresji lasu losowego przewyższyło pozostałe podejścia. Ponadto SHAP zidentyfikował kluczowe elementy językowe dla każdego ocenianego atrybutu, zwiększając przejrzystość systemu dzięki wyjaśnianej sztucznej inteligencji. Wyniki te mogą pomóc w ulepszaniu wielowymiarowych metod w ocenie i edukacji pisemnej. System współpracy człowiek-maszyna został wprowadzony, aby rozwiązać wyzwania związane z adnotacją arabskich pism, które często są kosztowne i czasochłonne. Metoda ta rozważa eseje oparte na siedmiu cechach literatury przy pomocy LLM. Procesy walidacji i taktyki promptingu zostały spersonalizowane, aby zapewnić spójność i dokładność. Współpraca ta skutkuje większą podażą oznaczonych zasobów i nie wpływa na jakość oceny, co pokazuje, że jest to skalowalna metoda adnotacji danych odpowiednia dla języków o niższych zasobach.
Wykorzystanie AI w edukacji daje możliwość znacznego obniżenia wymagań dotyczących oceniania i poprawy edukacji pisemnej 25,26. Jednocześnie naukowcy podkreślają, że dokładność AI nie jest jedynym aspektem istotnym dla jej odpowiedzialnego wykorzystania. Istnieją zasady sprawiedliwości i redukcji uprzedzeń, bezpieczeństwa i prywatności, odpowiedzialności, wyjaśnienia, przejrzystości, efektu edukacyjnego, uczciwości oraz ciągłego rozwoju. Najnowsze badania empirycznie oceniły punktację zero-shot opartą na GPT-4o, ze szczególnym uwzględnieniem tych wymagań. Badania koncentrowały się na postrzeganiu nauczycieli wobec ADWT w kontekście integralności edukacyjnej27. Badanie przekrojowe obejmujące 100 studentów studiów magisterskich i profesorów 10 przedmiotów sugeruje, że mimo że nauczyciele przypisują korzyści ADWT w osiąganiu celu edukacyjnego, ma on pewne ograniczenia, takie jak ograniczona dostępność, brak wiedzy oraz obawy dotyczące wpływu na integralność i kreatywność. Badania sugerują, że wraz z coraz większą integracją technologii AI z edukacją, kwestie etyczne i udział interesariuszy są niezbędne do ich skutecznego i odpowiedzialnego wykorzystania. Badania analizowały skuteczność technologii AI w porównaniu z ludzkimi oceniającymi w ocenie esejów przesłanych przez uczniów EFL(28 lat). Ocena 30 esejów wykazała, że choć AI oferowała wysokiej jakości komentarze pod względem treści, języka, organizacji i poprawności, to stale dawała niższe oceny niż osoby oceniające ludzi. Ponadto AI dostarczała bardziej szczegółową informację zwrotną, ale oceny z różnych narzędzi AI nie różniły się znacząco.
Luka badawcza:
Obecnie większość badań nad stypendiami AWE analizuje dokładność lub akceptację przez użytkowników. Bardzo niewielu bada, czy różnice w punktacji systematycznie niekorzystnie szkodzą grupom języka ojczystym lub biegłości. Chociaż wcześniejsze badania analizowały akceptację użytkowników lub ograniczały się do konkretnego systemu AWE z konkretnego kraju i wielkości próby, pojawiają się pytania dotyczące uogólnialności. Chociaż zarówno SHAP, jak i PCA to strategie XAI i zostały opracowane w celu zwiększenia przejrzystości, żadne badania nie analizowały mechanizmów sprawiedliwości ani tego, jak uczniowie wykorzystują informacje zwrotne AI z AWE. W literaturze nie ma rozbudowanych ram uwzględniających określone wymiary dokładności, analizy sprawiedliwości i postrzegania uczniów. Nie ma przykładu wyjaśnialnego modelu oceny, który uwzględniałby dokładność wewnątrz- i między oceniającymi, sprawiedliwość oraz percepcję ucznia. W tych badaniach proponowano i zweryfikowano wyjaśnialny model TLEF oraz zintegrowany model AFMM, aby ocenić dokładność, sprawiedliwość i postrzeganie uczniów jednocześnie wśród uczniów wielojęzycznych i o różnorodnych umiejętnościach.