Nauczanie projektowania eksperymentów
W niniejszym badaniu wykorzystano podstawową wersję open-source DeepSeek, opierając się na otwartym interfejsie API platformy do wywołań programistycznych. Pełny zestaw pięciu tekstów szablonów promptów, cztery poziomy wpisów przykładów zadań, tagi kategorii adnotacji transferowych oraz reguły mapowania dopasowań błędów pisarskich do szablonów zostały zestawione w dodatkowym aneksie. System posiadał stałe parametry wywołań: współczynnik temperatury wynoszący 0.7, natomiast generowana długość była ograniczana dynamicznie w zależności od typu pytania pisemnego. Proces ściśle przestrzegał stałej sekwencji: rekonstrukcja semantyczna > korekta stylistyczna > adaptacja kulturowa, wykonując zagnieżdżone wywołania łańcuchów promptów. Wyniki generowane przez model były ręcznie wybierane przez instruktora w celu uzyskania skutecznych tekstów do nauczania w klasie.
Do przeprowadzenia oceny manualnej zaproszono troje pełnoetatowych wykładowców pisania w języku angielskim na poziomie uniwersyteckim z ponad 5-letnim doświadczeniem. Przed oficjalnym ocenianiem wszyscy sędziowie przeszli ustandaryzowany trening, zapoznając się z wymiarami oceny, 5-punktową skalą punktową, transferem kulturowym, składnią, dyskursem oraz innymi szczegółami punktacji, a następnie przeszli kalibrację wstępną. Wszystkie eseje studentów zostały ocenione niezależnie przez dwóch nauczycieli w trybie ślepego, podwójnie ślepego oceniania. Jeśli różnica między ocenami dwóch sędziów przekraczała 1 punkt (w skali do 5), trzeci doświadczony nauczyciel rozstrzygał spór, a średnia z dwóch poprawnych ocen była przyjmowana jako ostateczny wynik manualny dla danej próbki. W fazie ewaluacji, w zależności od celów badawczych, uczestniczyły dwie grupy oceniających. Troje pełnoetatowych nauczycieli pisania w języku angielskim na uniwersytecie z ponad 5-letnim stażem prowadziło ślepe, podwójne ocenianie wszystkich próbek tekstów studenckich w eksperymencie właściwym, a trzeci doświadczony nauczyciel pełnił rolę arbitra w przypadku rozbieżności w ocenach przekraczających 1 punkt w skali 5-punktowej. Z kolei pięciu oceniających wzięło udział w teście niezawodności między sędziami z wykorzystaniem współczynnika korelacji wewnątrzklasowej (ICC), który przeprowadzono oddzielnie w celu weryfikacji spójności standardów oceny między sędziami. Różnica w liczbie oceniających wynika z odmiennych wymagań funkcjonalnych: trzech głównych nauczycieli zapewniło praktyczną punktację danych eksperymentalnych, podczas gdy rozszerzony panel pięciu oceniających dostarczył bardziej solidnych dowodów na niezawodność całego systemu ewaluacji.
Złożoność składniowa, ocena struktury tekstu BERT oraz podobieństwo semantyczne są oceniane w zakresie od 0 do 5 punktów. Wagi dla każdego wymiaru zostały ustalone zgodnie ze standardami nauczania i badań nad pisaniem w języku obcym: składnia 0,35, struktura tekstu 0,35 oraz logika i kultura 0,3. Wartości wag oparto na dojrzałych systemach ilościowej oceny pisania w tej samej dziedzinie. Moduł automatycznego oceniania AI został skalibrowany przy użyciu progów opartych na 15 wcześniej sklasyfikowanych wypracowań modelowych. Ocena ludzka odbywała się zgodnie z ujednoliconą pięciostopniową skalą ocen. Ocenianie maszynowe i kalibracja ludzka zostały połączone w celu przeprowadzenia weryfikacji przedeksperymentalnej przed formalną ewaluacją.
Zadanie dydaktyczne zostało zrealizowane w oparciu o trzy poziomy celów transferu: „składnia-struktura-kultura”, obejmując trzy rundy szkoleniowe, z których każda trwała jeden tydzień. Pierwsza runda polegała na przeredagowaniu zdań w celu zwiększenia różnorodności syntaktycznej i precyzji wypowiedzi; druga runda obejmowała rekonstrukcję struktury na poziomie akapitów w celu poprawy organizacji treści i spójności logicznej; trzecia runda koncentrowała się na transferze na poziomie kulturowym, aby wzmocnić międzykulturową świadomość pragmatyczną oraz zdolność adaptacji wypowiedzi. Ze względu na powtarzane pomiary zebrane od tych samych uczestników w teście wstępnym, podczas trzech kolejnych rund szkoleniowych oraz w teście końcowym, jako główną metodę statystyczną przyjęto analizę wariancji z powtarzanymi pomiarami (RM-ANOVA), aby zbadać główne efekty grupy (eksperymentalna vs kontrolna), główne efekty czasu pomiaru oraz efekt interakcji grupa × czas, który odzwierciedlał, czy zmiany wyników w trakcie szkolenia różniły się między obiema kohortami. Założenie sferyczności zweryfikowano testem Mauchly'ego; w przypadku naruszenia sferyczności zastosowano poprawkę Greenhouse'a-Geissera. Testy t dla próbek niezależnych zostały zarezerwowane wyłącznie do post-hoc parowych porównań międzygrupowych w poszczególnych punktach czasowych, natomiast korelacja Pearsona i d Cohena posłużyły odpowiednio do oceny spójności punktacji oraz kwantyfikacji wielkości efektu.
Wszystkie analizy statystyczne zostały określone przed rozpoczęciem gromadzenia danych. Do porównania wskaźników pisania przed i po interwencji pomiędzy dwiema grupami zastosowano testy t dla prób niezależnych, przyjmując pierwotną hipotezę zerową o braku różnic międzygrupowych w zakresie efektywności transferu umiejętności pisania. Analizę korelacji Pearsona wykorzystano do ilościowego określenia liniowej zależności między automatycznym ocenianiem przez AI a ocenami wystawionymi manualnie przez nauczycieli, natomiast wskaźnik d Cohena obliczono jako standaryzowaną wielkość efektu dla porównań międzygrupowych. Próg istotności dla wszystkich testów hipotez ustalono na poziomie α = 0.05, a dla wszystkich statystyk testowych obliczono 95% przedziały ufności. Do wykonania wszystkich obliczeń statystycznych wykorzystano program SPSS 26.0. W zbiorach danych dotyczących wyników testów uczniów oraz kwestionariuszy nie wystąpiły braki danych, ponieważ wszyscy uczestnicy ukończyli pełny trzyetapowy trening oraz powiązane z nim oceny; w związku z tym nie było konieczności stosowania imputacji ani usuwania przypadków z brakującymi wartościami.
Budowa systemu wskaźników oceny
Aby kompleksowo ocenić wyniki studentów w treningu transferu pisania w języku angielskim, w niniejszym badaniu skonstruowano wielowymiarowy system oceny obejmujący trzy poziomy celów transferu: „składnia-struktura-kultura”, integrujący biegłość językową, reakcję na model, informację zwrotną od nauczyciela oraz autopercepcję, i określono sześć kluczowych wskaźników. Po pierwsze, „wskaźnik transferu pisania” był kompleksowym wskaźnikiem oceny obejmującym różnorodność syntaktyczną, przejrzystość strukturalną oraz adaptacyjność kulturową, łączącym automatyczne punktowanie systemu z ręczną oceną nauczyciela w celu przeprowadzenia analizy ilościowej. „Wynik złożoności syntaktycznej” wykorzystywał technologię przetwarzania języka naturalnego do wyodrębniania cech takich jak średnia długość zdania, liczba poziomów zagnieżdżenia zdań podrzędnych oraz częstotliwość stosowania fraz czasownikowych, aby ocenić bogactwo i złożoność zdań konstruowanych przez studentów. Analiza „dopasowania stylu akademickiego” badała proporcję stosowania strony biernej oraz udział formalnego słownictwa, w oparciu o model NLP (Natural Language Processing), aby określić, czy tekst jest zgodny z normami stylistycznymi angielskiego pisania akademickiego. Ponadto w badaniu wprowadzono wymiar oceny subiektywnej, zbierając za pomocą kwestionariuszy dla nauczycieli opinie na temat akceptacji i praktyczności sugestii generowanych przez model, aby ocenić rzeczywisty wpływ nauczania wspomaganego przez AI. „Zmiany w ocenach nauczycielskich” odzwierciedlały wpływ nauczania wspomaganego przez AI na poprawę jakości pisania poprzez porównanie ocen wystawionych przez nauczycieli pracom studentów przed i po eksperymencie. Wreszcie, „Autoewaluacja zdolności transferu przez studenta” wykorzystywała tabelę poznania transferu, aby pomóc studentom w samodzielnej ocenie opanowania struktury, składni, kultury i innych wymiarów, zwiększając tym samym ich świadomość metapoznawczą i zdolność refleksji. Szczegółowe opisy i źródła danych dla każdego wskaźnika przedstawiono w Tabeli 3.
Wskaźniki składniowe i stylistyczne zostały obliczone automatycznie za pomocą analizy zależności oraz klasyfikacji opartej na modelu BERT, z znormalizowanymi wynikami w zakresie od 0 do 5; ocena manualna odbywała się w skali 5-stopniowej. Formuły obliczeniowe dla złożoności składniowej wykorzystywały całkowitą liczbę słów podzieloną przez liczbę klauzul jako główny mianownik. Źródło surowych danych: wypracowania z testów wstępnych i końcowych wszystkich 60 zakwalifikowanych studentów.
Wyniki eksperymentalne i analiza
Aby w sposób intuicyjny przedstawić kompleksowe różnice w wynikach uczniów w trzech wymiarach: transferu syntaktycznego, transferu strukturalnego i transferu kulturowego, na Rysunku 3 porównano średni wskaźnik transferu pisania uczniów z grupy eksperymentalnej i grupy kontrolnej przed i po przeprowadzeniu eksperymentu: Rysunek 3 wykazał różnicę w średnich wynikach między grupą eksperymentalną a grupą kontrolną w trzech wymiarach transferu syntaktycznego, strukturalnego i kulturowego. Grupa eksperymentalna wykazała znaczną poprawę zdolności transferu w każdym z wymiarów po zakończeniu eksperymentu, a zewnętrzny okrąg wykresu radarowego jest znacznie większy od okręgu wewnętrznego, co wskazuje, że metoda optymalizacji instrukcji oparta na modelu DeepSeek ma pozytywny wpływ na promowanie rozwoju zdolności transferu pisania w języku angielskim u uczniów. W przeciwieństwie do niej, w grupie kontrolnej poszczególne wskaźniki zdolności transferu pozostały stosunkowo niezmienione przed i po eksperymencie. Ogólna poprawa była ograniczona, co wskazuje, że tradycyjne metody nauczania lub narzędzia wspomagane przez AI, w których nie zoptymalizowano instrukcji systemowych, pełnią ograniczoną rolę w treningu transferu. Skuteczne pobudzenie potencjału uczenia się uczniów w wielowymiarowym transferze językowym okazało się być wyzwaniem.
Średnie indeksy transferu pisemnego w grupie eksperymentalnej w wymiarach transferu składniowego, transferu strukturalnego i transferu kulturowego przed eksperymentem wynosiły odpowiednio 3,0, 2,9 oraz 2,8, a po eksperymencie wzrosły do 4,3, 4,1 i 4,5, co oznacza wzrosty o odpowiednio 1,3, 1,2 i 1,7, wskazując na korzystny efekt interwencji zastosowanej metody nauczania na różnych poziomach transferu. Wyniki grupy kontrolnej przed eksperymentem wynosiły 3,0, 3,0 i 2,9. Po eksperymencie wartości te wzrosły odpowiednio do 3,4, 3,3 i 3,2, co jest wynikiem znacząco niższym niż w grupie eksperymentalnej. Szczególną uwagę zwraca wymiar transferu kulturowego, w którym grupa eksperymentalna wykazała najistotniejszą poprawę – wzrost z 2,8 do 4,5, czyli o 1,7 punktu, co jest wartością znacznie wyższą niż wzrost o 0,3 punktu w grupie kontrolnej. Wynik ten sugeruje, że proponowana metoda nauczania odgrywa istotną rolę w pomaganiu studentom w identyfikacji i adaptacji do norm ekspresji kulturowej języka angielskiego. Odzwierciedliło się to nie tylko w korektach formy językowej, ale także w zwiększeniu międzykulturowej świadomości pragmatycznej studentów oraz pogłębieniu ich rozumienia nawyków ekspresji kulturowej języka docelowego. Transfer językowy przejawiał się przede wszystkim w złożoności składniowej, adaptacji stylu językowego oraz w innych aspektach. W badaniu wykorzystano zautomatyzowaną technologię NLP do przeprowadzenia dogłębnej analizy tekstów pisemnych studentów, wyekstrahowano kluczowe cechy językowe i połączono je z ocenami nauczycieli, aby systematycznie ocenić zmiany w zdolnościach transferu językowego studentów w trzech rundach zadań.
Złożoność syntaktyczna i styl lingwistyczny
Pod względem złożoności syntaktycznej w badaniu odnotowano średnią długość zdania oraz liczbę poziomów zagnieżdżenia zdań w tekście wygenerowanym przez studentów po wykonaniu wyznaczonego zadania pisemnego w każdej rundzie zadań. Te dwa wskaźniki były powszechnie stosowane do pomiaru złożoności ekspresji językowej. Efektywnie odzwierciedlały one poziom rozwoju studentów w zakresie różnorodności zdań i zdolności do organizacji strukturalnej, co przedstawiono na Rysunku 4.
W ramach podłużnej analizy ewolucji złożoności składniowej, w grupie eksperymentalnej odnotowano wyraźną tendencję wzrostową w trzech rundach zadań, co odzwierciedla skuteczny wpływ treningu transferowego na zdolność studentów do kształtowania struktur językowych. Pod kątem średniej długości zdania, w grupie eksperymentalnej wzrosła ona z 12,5 słowa w zadaniu 1 do 16,1 słowa w zadaniu 3, co stanowi wzrost o 3,6 słowa i jest wynikiem znacząco wyższym niż wzrost w grupie kontrolnej, który w tym samym okresie wyniósł zaledwie 0,9 słowa (z 12,4 do 13,3). Podobnie, w wymiarze złożoności strukturalnej, mierzonej liczbą warstw zagnieżdżenia zdań składowych, grupa eksperymentalna odnotowała wzrost z 1,8 do 2,7 warstwy, podczas gdy w grupie kontrolnej wzrost ten był stosunkowo powolny, od 1,7 do 1,9 warstwy. Aby dodatkowo zweryfikować, czy różnica w złożoności składniowej między dwiema grupami studentów jest istotna statystycznie, w badaniu zastosowano testy t dla prób niezależnych do analizy średniej długości zdania oraz liczby poziomów zagnieżdżenia zdań składowych na trzech etapach zadań. Wyniki wykazały istotną różnicę między grupą eksperymentalną a kontrolną pod względem średniej długości zdania, t(58) = 4.23, p < 0.001, Cohen’s d = 0.98; stwierdzono również istotną różnicę w liczbie poziomów zagnieżdżenia zdań składowych, t(58) = 3.15, p = 0.002, Cohen’s d = 0.78. Porównanie to wykazało, że systematyczny trening transferowy nie tylko poprawił umiejętność konstruowania złożonych zdań przez studentów, ale także wzmocnił ich biegłość w strategiach organizacji gramatycznej. W szczególności podczas trzeciego etapu zadania studenci z grupy eksperymentalnej wykazali większą elastyczność w stosowaniu wielowarstwowych zdań składowych i złożonych struktur zdaniowych. Odzwierciedlało to zauważalne przejście w transferze językowym z poziomu „funkcjonalnego” na poziom bardziej „strategiczny”. Ścieżka treningowa zorientowana na transfer stale podnosiła umiejętności transferu składniowego studentów, skutecznie przełamując ograniczenia pisania pojedynczymi zdaniami oraz stałe wzorce ekspresji często spotykane w tradycyjnym nauczaniu. W zakresie adaptacji stylu językowego w badaniu przeanalizowano teksty pisane przez studentów przed i po eksperymencie. Wykorzystano model NLP do określenia proporcji słownictwa formalnego oraz częstotliwości użycia strony biernej jako kluczowych wskaźników oceny dopasowania stylu języka naukowego. Wskaźniki te odzwierciedlały, czy studenci posiadają świadomość językową i zdolność ekspresji pozwalającą na adaptację do stylu docelowego w pisaniu po angielsku. Odpowiednie wyniki przedstawiono na Rysunku 5.
Rysunek 5 przedstawia zmiany w dopasowaniu stylu akademickiego w grupie eksperymentalnej i grupie kontrolnej przed i po wykonaniu zadania, koncentrując się głównie na dwóch kluczowych wskaźnikach: udziale formalnego słownictwa oraz częstotliwości stosowania strony biernej. Ogólnie rzecz biorąc, po ukończeniu treningu transferowego opartego na modelu DeepSeek, zdolność adaptacji do stylu akademickiego w grupie eksperymentalnej uległa znaczącej poprawie, co dowodzi skuteczności tej metody nauczania w kształtowaniu świadomości norm językowych u studentów oraz ich umiejętności dostosowania się do stylu akademickiego. W odniesieniu do udziału formalnego słownictwa, w grupie eksperymentalnej wzrósł on z 0,42 przed zadaniem do 0,56 po zadaniu, co stanowi stosunkowo znaczący wzrost. W przeciwieństwie do tego, w grupie kontrolnej odnotowano jedynie niewielki wzrost, z 0,43 do 0,48, co sugeruje ograniczoną poprawę. Wynik ten wykazał, że po otrzymaniu systematycznych wskazówek dotyczących promptowania oraz informacji zwrotnej z modelu, studenci z grupy eksperymentalnej byli bardziej skłonni do używania w procesie pisania formalnego słownictwa spełniającego wymogi stylu akademickiego, a ich styl językowy stopniowo zbliżał się do standardów angielskiego pisania akademickiego. Jeśli chodzi o częstotliwość stosowania strony biernej, w grupie eksperymentalnej wzrosła ona znacząco z 0,18 przed zadaniem do 0,27 po zadaniu, co stanowi wzrost o 0,09; natomiast w grupie kontrolnej wzrost ten wyniósł zaledwie 0,02.
Aby dodatkowo zweryfikować, czy powyższe zmiany są istotne statystycznie, w badaniu przeprowadzono test t dla prób niezależnych na danych przed i po wykonaniu zadania. Wyniki wykazały, że w grupie eksperymentalnej nastąpiła istotna poprawa w proporcji słownictwa formalnego, t(58) = 3.89, p < 0.001, d Cohena = 0.92; wzrost częstotliwości użycia strony biernej był również istotny, t(58) = 4.56, p < 0.001, d Cohena = 1.05. Wskazuje to, że studenci w grupie eksperymentalnej poczynili znaczne postępy w adaptacji stylu językowego, a postępy te nie były przypadkowe, lecz stanowiły wynik połączonego efektu systematycznego kierowania za pomocą promptów oraz informacji zwrotnej z modelu.
Weryfikacja statystyczna
Ponadto, aby dodatkowo zweryfikować wiarygodność treści generowanych przez AI w praktyce nauczania, w badaniu porównano średnie wyniki treści generowanych przez AI oraz treści opracowanych przez nauczycieli w zależności od różnych typów promptów. Spójność między nimi oceniono poprzez obliczenie współczynnika korelacji Pearsona. Odpowiednie wyniki porównania przedstawiono w Tabeli 4. Tabela 4 pokazuje spójność treści generowanych przez AI oraz ocen nauczycieli w pięciu typach promptów zorientowanych na transfer. Z perspektywy średniego wyniku, ocena AI była ogólnie nieco niższa od oceny nauczyciela. Niemniej jednak, różnica ta mieściła się w rozsądnym zakresie w większości typów zadań, co wskazuje, że model DeepSeek wykazuje wysoką stabilność i wartość referencyjną w ocenie zadań z transferu pisania. W przypadku promptu dotyczącego transferu syntaktycznego średnia ocena nauczyciela wyniosła 4,1, a ocena AI 4,0, co oznacza różnicę zaledwie 0,1 między nimi. W promptach dotyczących transferu strukturalnego i logicznego ocena AI była o jedynie 0,1 punktu niższa od oceny nauczyciela, co wskazuje, że model potrafi lepiej symulować kryteria oceny nauczyciela w tych zadaniach, które wiążą się z wysokim stopniem struktury języka i jasnymi regułami. W przeciwieństwie do tego, odchylenia w punktacji w przypadku promptów dotyczących transferu kulturowego i transferu rejestru są stosunkowo wyraźne, z ocenami AI wynoszącymi odpowiednio 3,6 i 3,7, co jest wynikiem o 0,2 niższym od ocen nauczycieli, odzwierciedlając fakt, że AI nadal wykazuje pewne ograniczenia przy zadaniach o wysokim stopniu subiektywizmu, takich jak implikacje semantyczne i pragmatyka kulturowa. Niezawodność międzyoceniaczy oceniono za pomocą ICC (n = 5 oceniających). Ogólny wskaźnik ICC dla oceny manualnej wyniósł 0,86, a wskaźniki ICC dla każdego wymiaru mieściły się w zakresie od 0,82 do 0,89, co wskazuje na satysfakcjonującą zgodność między oceniającymi.
Dalsza analiza współczynnika korelacji Pearsona wykazała, że spójność wyników dla różnych promptów znajdowała się na wysokim poziomie, co wskazuje, że ocena AI była nie tylko zbliżona do oceny nauczyciela pod względem wartości, ale wykazywała również dobrą relację liniową w trendzie oceniania. Wśród nich współczynnik spójności dla promptu transferu syntaktycznego był najwyższy i wynosił 0.87, natomiast dla promptów transferu strukturalnego i logicznego wyniósł odpowiednio 0.83 i 0.85, co wskazuje, że wyniki ewaluacji AI w zakresie złożoności syntaktycznej, organizacji akapitów i spójności logicznej są wysoce zgodne z oceną nauczyciela. Może to wynikać z faktu, że zadania te mają jasne cele i mierzalne cechy językowe, co ułatwiło rozpoznawanie przez model i stabilną ocenę. Współczynnik korelacji dla promptu transferu domenowego wyniósł 0.81. Mimo niewielkiego spadku, nadal wykazał on silną zdolność ewaluacyjną, co wskazuje, że AI posiada pewien stopień zdolności oceny na poziomie adaptacji stylistycznej. Jednakże współczynnik spójności dla promptu transferu kulturowego wyniósł zaledwie 0.79, co było wynikiem niższym niż w przypadku innych typów, choć wciąż mieściło się w dopuszczalnym zakresie.
Aby zbadać przydatność różnych typów promptów w praktyce nauczania oraz stopień ich akceptacji przez nauczycieli, opracowano kwestionariusz satysfakcji z odpowiedzi na prompty. Pięciu nauczycieli języka angielskiego (oznaczonych jako T1–T5) poproszono o ocenę sugestii generowanych przez pięć typów promptów w pięciostopniowej skali (od bardzo niezadowolony do bardzo zadowolony), co przedstawiono na Rysunku 6: oceny pięciu nauczycieli dla pięciu typów promptów nieco się różnią, jednak ogólne uznanie było wysokie. Wśród nich najwyższe noty uzyskały prompty dotyczące „transferu składniowego” (syntactic transfer) oraz „transferu kulturowego” (cultural transfer), z średnią wynoszącą 4.0, co odzwierciedla ich wysoką praktyczność i adaptacyjność w nauczaniu. W przeciwieństwie do nich, prompt dotyczący „transferu rejestru” (register transfer) uzyskał stosunkowo niską ocenę, średnio zaledwie 2.4, a niektórzy nauczyciele, tacy jak T4 i T5, wystawili najniższe noty, co wskazuje, że jego wytyczne i adaptacyjność w zastosowaniach dydaktycznych wciąż wymagają poprawy.
Na poziomie indywidualnym wystąpiły wyraźne różnice w tendencjach oceniania nauczycieli. Ogólna ocena T1 była pozytywna, co wskazuje na wysoki stopień akceptacji pisania wspomaganego przez AI, podczas gdy oceny T5 były niskie w wielu wymiarach Promptów, szczególnie w zakresie „transferu rejestru” oraz „transferu logicznego”. Różnica ta może wynikać z doświadczenia dydaktycznego nauczycieli, preferencji językowych lub stopnia zaznajomienia się z narzędziami AI, co sugeruje, że przyszłe projektowanie Promptów powinno uwzględniać mechanizmy spersonalizowanego dostosowania, aby zwiększyć akceptację wśród różnych grup nauczycieli. Aby dodatkowo zweryfikować rzeczywisty wpływ nauczania wspomaganego przez AI na poprawę jakości pisania uczniów, w badaniu porównano zmiany w ocenach ogólnych grupy eksperymentalnej i grupy kontrolnej, wystawionych przez nauczycieli przed i po eksperymencie. Wyniki porównania przedstawiono na Rysunku 7.
Jak pokazano na Rysunku 7, ogólne wyniki grupy eksperymentalnej i grupy kontrolnej, ocenione przez nauczycieli przed i po eksperymencie, wykazały istotne różnice. Ogólnie, po zastosowaniu interwencji dydaktycznej w postaci optymalizacji instrukcji w oparciu o model DeepSeek, ogólny wynik grupy eksperymentalnej wykazał znaczną tendencję wzrostową. W przeciwieństwie do niej, zmiana wyników w grupie kontrolnej była stosunkowo niewielka. Średnia ocena nauczycielska grupy eksperymentalnej przed eksperymentem wynosiła 59,1 punktu, a średnia ocena po eksperymencie wzrosła znacząco do 74,4 punktu, co stanowi wzrost o 15,3 punktu. Wskazuje to, że nauczanie wspomagane przez AI miało pozytywny wpływ na jakość pisania uczniów. Z wykresu pudełkowego zaobserwowano, że zakres rozkładu wyników grupy eksperymentalnej również uległ rozszerzeniu. W szczególności pudełko wyników po eksperymencie znajduje się znacznie wyżej niż przed nim, a wartości maksymalne i minimalne wzrosły, co świadczy o znaczącej poprawie ogólnego poziomu uczniów. Z kolei zmiany wyników w grupie kontrolnej były stosunkowo ograniczone. Przed eksperymentem średni wynik grupy kontrolnej wynosił 60,1 punktu, a po eksperymencie 64,9 punktu, co stanowi wzrost o 4,8 punktu. Wzrost ten był znacznie niższy niż w grupie eksperymentalnej, a pudełko wyników grupy kontrolnej nie zmieniło się znacząco przed i po eksperymencie, co wskazuje, że tradycyjne metody nauczania lub nieoptymalizowane narzędzia wspomagane przez AI mają ograniczony wpływ na poprawę jakości pisania.
Ponadto w badaniu tym wykorzystano tabelę poznania transferowego, aby przeprowadzić studentów przez trzy rundy samooceny rozwoju ich umiejętności w zakresie dostosowania strukturalnego, transformacji zdań oraz ekspresji kulturowej, między innymi, w celu odzwierciedlenia trendu zmian w świadomości metapoznawczej studentów i ich opanowaniu strategii transferowych. Wyniki przedstawiono na Rysunku 8. Zgodnie z danymi z wykresu radarowego samooceny zdolności transferowych studentów przedstawionymi na Rysunku 8, samoocena studentów w pięciu wymiarach: transferu strukturalnego, transferu syntaktycznego, transferu kulturowego, transferu rejestru i transferu logicznego w trzech rundach zadań wykazała tendencję wzrostową, co wskazuje, że dzięki interwencji dydaktycznej w postaci optymalizacji instrukcji opartej na modelu DeepSeek, zdolność studentów do stosowania strategii transferowych uległa znacznej poprawie. W pierwszej rundzie zadań oceny w samoocenie studentów były ogólnie niskie. Wśród pięciu wymiarów „transfer strukturalny” i „transfer logiczny” uzyskały oceny odpowiednio 3,2 i 3,0, podczas gdy „transfer kulturowy” i „transfer rejestru” uzyskały 2,5 i 2,7, co wskazuje, że studenci wciąż nie byli biegli w identyfikowaniu i stosowaniu strategii transferowych. Do drugiej rundy zadań oceny każdego z elementów uległy poprawie, przy czym „transfer strukturalny” wzrósł do 3,8, „transfer syntaktyczny” do 3,5, a „transfer logiczny” do 3,7. Wykazało to, że dzięki wskazówkom nauczycieli i wsparciu w postaci informacji zwrotnych z modelu, studenci stopniowo opanowali kluczowe aspekty podstawowych operacji transferowych i zaczęli je stosować w praktycznym pisaniu. W trzeciej rundzie zadań oceny w samoocenie studentów znacząco wzrosły, przy czym „transfer strukturalny” i „transfer logiczny” osiągnęły odpowiednio 4,5 i 4,3, a pozostałe wymiary ustabilizowały się powyżej 4,0 punktów, co wykazuje trwały efekt wielokrotnych rund treningu transferowego w poprawie kontroli nad formą językową i zdolnością konstruowania tekstu. Na tym etapie studenci uformowali podstawową pętlę poznawczą między rozumieniem, wykonaniem a refleksją nad strategiami transferowymi. Oprócz informacji zwrotnych od nauczyciela, w badaniu przeprowadzono również ankietę satysfakcji dotyczącą funkcji pisania wspomaganego przez AI wśród wszystkich studentów z grupy eksperymentalnej, w wyniku czego zebrano łącznie 30 prawidłowo wypełnionych kwestionariuszy. Kwestionariusz oceniał działanie AI w trzech modułach funkcjonalnych: sugestie przeredagowania, optymalizacja strukturalna oraz wskazówki kulturowe i wymagał od studentów wyboru opcji zgodnie z pięciostopniową skalą standardów. Wyniki przedstawiono w Tabeli 5.
Zgodnie z wynikami ankiety satysfakcji studentów dotyczącej funkcji pisania wspomaganego przez AI przedstawionymi w Tabeli 5, studenci z grupy eksperymentalnej ogólnie pozytywnie ocenili działanie AI w trzech modułach funkcjonalnych: sugestii przeredagowania, optymalizacji struktury oraz podpowiedzi kulturowych, co wskazuje na dobre perspektywy zastosowania systemów pisania wspomaganego przez AI w celu zwiększenia wydajności treningu pisania i jakości wsparcia dydaktycznego. Ogólnie ponad 90% studentów zadeklarowało, że są „bardzo zadowoleni” lub „zadowoleni” z dwóch funkcji: „sugestii przeredagowania” oraz „optymalizacji struktury”, przy czym „sugestie przeredagowania” uzyskały najwyższy poziom satysfakcji, wynoszący 91%, co wskazuje na wysoki stopień uznania zdolności AI w zakresie rekonstrukcji syntaktycznej i szlifowania języka. W porównaniu z nimi satysfakcja z funkcji „podpowiedzi kulturowych” była stosunkowo niższa. Mimo to osiągnęła ona 83%, co wskazuje, że choć AI wykazuje pewną złożoność i subiektywizm w kierowaniu ekspresją międzykulturową, jej rola w pomaganiu studentom w identyfikowaniu i korygowaniu interferencji kulturowych języka ojczystego została uznana przez większość badanych. W odniesieniu do niezadowolenia, odsetek studentów, którzy wybrali odpowiedź „niezadowolony” lub „bardzo niezadowolony” we wszystkich trzech funkcjach, wyniósł mniej niż 5%, co świadczy o dobrej użyteczności i akceptacji funkcji wspomaganych przez AI w większości scenariuszy zastosowań. Warto zauważyć, że proporcja studentów, którzy ocenili funkcję „podpowiedzi kulturowych” jako „przeciętną”, była stosunkowo wysoka, co sugeruje, że obecna AI może nie w pełni spełniać oczekiwania studentów w kwestiach związanych z adaptacją kulturową i wciąż istnieje przestrzeń do ulepszeń. Kompleksowa analiza wykazuje, że metoda optymalizacji instrukcji oparta na DeepSeek została szeroko uznana przez studentów, szczególnie w zakresie wsparcia formy językowej.
RM-ANOVA
Przeprowadzono dwuczynnikową analizę wariancji z powtarzanymi pomiarami (RM-ANOVA), aby zbadać wpływ grupy (czynnik międzygrupowy: grupa eksperymentalna vs grupa kontrolna) oraz czasu (czynnik wewnątrzgrupowy: pretest, Zadanie 1, Zadanie 2, Zadanie 3, posttest), a także ich interakcję na wyniki transferu pisania w języku angielskim u studentów. Test Mauchly’ego wykazał naruszenie założenia sferyczności (p < 0.05), dlatego zastosowano korektę Greenhouse’a-Geissera w celu dostosowania stopni swobody dla efektów wewnątrzgrupowych. Wszystkie analizy oparto na n = 30 uczestnikach w każdej grupie. Wyniki przedstawiono w Tabeli 6:
Wyniki analizy ANOVA z powtarzanymi pomiarami z korekcją Greenhouse’a–Geissera wykazały istotne efekty główne dla Grupy, Czasu oraz interakcji Grupa × Czas we wszystkich mierzonych wymiarach (p < 0.001). W przypadku Ogólnego Indeksu Transferu zaobserwowano istotny efekt Grupy (F(1,58) = 76,32), a także istotny efekt Czasu (F(2,14,124,12) = 92,75) oraz istotną interakcję Grupa × Czas (F(2,14,124,12) = 68,49), co sugeruje, że zmiany w ogólnej wydajności transferu w czasie różniły się istotnie pomiędzy grupami.
Podobnie, transfer syntaktyczny wykazał istotne efekty dla Grupy (F(1,58) = 52,18), Czasu (F(2,11,122,38) = 71,26) oraz interakcji Grupa × Czas (F(2,11,122,38) = 45,73), co wskazuje na odmienne wzorce rozwoju zdolności transferu syntaktycznego w zależności od grup i punktów pomiarowych. W przypadku transferu strukturalnego również zidentyfikowano istotne efekty dla Grupy (F(1,58)=48,65), Czasu (F(2,09,121,22) = 67,81) oraz interakcji (F(2,09,121,22) = 41,36), co odzwierciedla spójną poprawę z trajektoriami zależnymi od grupy. Co istotne, transfer kulturowy wykazał najsilniejsze efekty: istotny efekt Grupy (F(1,58) = 81,44), wyraźny efekt Czasu (F(2,07,119,96) = 98,52) oraz silną interakcję Grupa × Czas (F(2,07,119,96) = 79,27), co sugeruje najbardziej znaczący i zróżnicowany wzorzec wzrostu w tym wymiarze. Ogólnie wszystkie wskaźniki wykazują statystycznie istotne efekty, potwierdzając, że interwencja wywarła stabilny i zróżnicowany wpływ na rozwój transferu w czasie.
DOSTĘPNOŚĆ DANYCH:
Wszystkie dane wygenerowane lub przeanalizowane w ramach niniejszego badania zostały zawarte w tym artykule. Surowe dane z oceny zostały przedstawione w Tabela uzupełniająca 1.

Rysunek 1: Kroki transformacji struktury zdania. (A) Strategie łączenia i wzmacniania czasowników w celu poprawy struktury zdania. (B) Alternatywne transformacje podmiotu, w tym podmioty w formie gerundium, bezokolicznika i rzeczowników. (C) Wykorzystanie fraz nieosobowych w celu zwiększenia różnorodności i zwięzłości zdań. (D) Przykłady dopracowanych wersji końcowych wykazujących poprawę stylu akademickiego i międzykulturowej ekspresji w języku angielskim. Kliknij tutaj, aby wyświetlić powiększoną wersję tego rysunku.

Rysunek 2: Schemat drzewa ewolucji zadań. Przedstawia on progresywną strukturę czteropoziomowych zadań transferowych, obejmujących poziom zdania, akapitu, dyskursu oraz poziom kulturowy. Kliknij tutaj, aby wyświetlić powiększoną wersję tego rysunku.

Rycina 3: Porównanie zdolności transferu pisania przed i po eksperymencie. Wykres radarowy przedstawia wyniki przed i po teście dla grupy eksperymentalnej oraz grupy kontrolnej w wymiarach transferu składniowego, strukturalnego i kulturowego. Kliknij tutaj, aby wyświetlić powiększoną wersję tej ryciny.

Rycina 4: Wykres liniowy trendu złożoności syntaktycznej. Przedstawiono zmiany w średniej długości zdań i poziomach zagnieżdżenia zdań składowych w trzech zadaniach treningowych. Kliknij tutaj, aby wyświetlić powiększoną wersję tej ryciny.

Rysunek 5: Dopasowanie terminologii akademickiej. Na rysunku przedstawiono zmiany w proporcji słownictwa formalnego i częstotliwości występowania strony biernej przed i po interwencji. Kliknij tutaj, aby wyświetlić powiększoną wersję tego rysunku.

Rysunek 6: Mapa ciepła satysfakcji z odpowiedzi na prompty. Podsumowano tutaj oceny pięciu typów szablonów promptów udzielone przez uczestniczących nauczycieli. Kliknij tutaj, aby wyświetlić powiększoną wersję tego rysunku.

Rycina 7: Wykres pudełkowy zmian w ocenach nauczycielskich. Wykres pudełkowy przedstawia rozkład i ogólne zmiany ocen pisania wystawionych przez nauczycieli dla dwóch grup przed i po eksperymencie. Kliknij tutaj, aby zobaczyć powiększoną wersję tej ryciny.

Rysunek 8: Wykres radarowy samooceny umiejętności transferu u studentów. Przedstawia on wyniki samooceny studentów w pięciu wymiarach transferu w trzech rundach szkoleniowych. Aby wyświetlić powiększoną wersję tego rysunku, kliknij tutaj.
| Proszę podać tekst źródłowy do przetłumaczenia. | Obsługa dla nauczyciela | Typ promptu | Operacja studenta | Wynik | Kryteria oceny |
| Oryginalne szkice tekstów napisanych przez studentów (zdania/akapity/eseje) | 1. Oznacz rodzaje transferu i poziomy zadań
2. Dostosuj parametry promptu, jeśli jest to konieczne | Pojedynczy prompt transferowy / Trzystopniowy zagnieżdżony łańcuch promptów | 1. Zapoznaj się ze strategiami przenoszenia wiedzy 2. Popraw wersje robocze na podstawie informacji zwrotnych od AI 3. Przeprowadź samoocenę | Tekst poprawiony przez AI + końcowy projekt poprawiony przez studenta | Złożoność syntaktyczna, racjonalność strukturalna, adekwatność kulturowa, spójność logiczna, standaryzacja rejestru (skala 0–5) |
Tabela 1: Podsumowanie schematu postępowania. Tabela ta podsumowuje pełny schemat operacyjny szkolenia z zakresu transferu pisania w języku angielskim wspomaganego przez AI, obejmując materiały wejściowe, działania nauczyciela i ucznia, rodzaje promptów, końcowe wyniki oraz odpowiadające im kryteria oceny.
| Kategoria projektu | Spis treści |
| Zrozumienie celów misji | Proszę o zwięzłe opisanie celów migracyjnych tej serii zadań redakcyjnych, takich jak dostosowanie strukturalne, adaptacja kulturowa oraz konwersja językowa. |
| Zastosowana strategia migracji | Prosimy o wymienienie przyjętych strategii migracji (można wybrać kilka odpowiedzi): |
| Dostosowanie strukturalne |
| Przekształcanie zdań |
| Zmiana języka |
| Manifestacje kulturowe |
| Wzmocnienie powiązań logicznych |
| Inne: _______ |
| Przepisuj przykłady i instrukcje | Wybierz 1–2 przeredagowane zdania, przedstaw wersje przed i po zmianach oraz wyjaśnij przyczyny wprowadzonych poprawek i zamierzone cele przekładu. |
| Napotkane trudności i wątpliwości | Opisz wszelkie problemy, jakie napotkałeś podczas migracji, lub pytania, jakie pojawiły się w związku z konkretnym sformułowaniem. |
Wynik samooceny
(w skali od 1 do 5 punktów) | Prosimy o ocenę przeredagowanego tekstu w oparciu o następujące trzy aspekty: |
| • Dokładność zastosowania strategii (/5) |
| • Naturalność i płynność wypowiedzi (/5) |
| • Dopasowanie kulturowe (/5) |
| Cele dotyczące przyszłej poprawy stylu pisania | Krótko opisz zdolność do transferu, którą chciałbyś wzmocnić lub zoptymalizować w kolejnej rundzie treningu |
Tabela 2: Tabela transferu poznawczego. Do samooceny strategii transferu pisania przez studentów przyjęto skalę ocen od 1 do 5 (1 = brak biegłości, 5 = pełna biegłość).
| Nazwa wskaźnika | Opis | Źródło danych |
| Indeks transferu pisma (0–5) | Ilościowy wskaźnik kompleksowo mierzący zdolność transferu językowego, obejmujący trzy poziomy: składnię, strukturę i kulturę. | Automatyczne ocenianie przez system + ocenianie ręczne przez nauczycieli |
| Wskaźnik złożoności syntaktycznej | W tym m.in. średnia długość zdania, liczba zdań podrzędnych, bogactwo fraz czasownikowych itd. | Automatyczna analiza NLP |
| Dostosowanie stylu akademickiego | Czy jest to zgodne z angielskimi standardami pisania akademickiego? | Ocena modelu przetwarzania języka naturalnego |
| Satysfakcja z odpowiedzi na prompt | Akceptacja i praktyczna ocena sugestii generowanych przez model w opinii nauczycieli | Kwestionariusz dla nauczyciela |
| Zmiany w ocenianiu podczas recenzji nauczyciela | Porównanie ocen nauczycieli przed i po eksperymencie w celu odzwierciedlenia poprawy jakości pisania | Arkusze ocen nauczycieli |
| Samoocena zdolności do transferu wiedzy u studentów | Studenci dokonują samooceny swojego stopnia opanowania poszczególnych wymiarów transferu | Wypełnij formularz świadomości migracyjnej |
Tabela 3: Podsumowanie wskaźników oceny, opisów i źródeł danych. Tabela ta wyjaśnia definicje, metody pomiaru oraz oryginalne źródła danych dla każdego z głównych wskaźników oceny w niniejszym badaniu.
| Typ promptu | Średnia ocena nauczycieli | Średnia punktacja AI | Współczynnik korelacji Pearsona |
| Transfer strukturalny | 4 | 3.9 | 0.83 |
| Transfer syntaktyczny | 4.1 | 4 | 0.87 |
| Transfer kulturowy | 3.8 | 3.6 | 0.79 |
| Transfer rejestrów | 3.9 | 3.7 | 0.81 |
| Transfer logiczny | 4.2 | 4.1 | 0.85 |
Tabela 4: Porównanie spójności między treściami wygenerowanymi przez AI a ocenami nauczycieli. Wyniki wykazują spójność między treściami wygenerowanymi przez AI a ocenami nauczycieli dla różnych typów promptów.
| Elementy funkcyjne | Bardzo zadowolony | Zadowolony | Ogólnie | Niezadowolony | Bardzo niezadowolony |
| Sugestia przeredagowania | 66% | 25% | 7% | 1.50% | 0.50% |
| Optymalizacja strukturalna | 60% | 30% | 7% | 2% | 1% |
| Wskazówki dotyczące hodowli | 55% | 28% | 12% | 3.50% | 1.50% |
Tabela 5: Statystyki badania satysfakcji studentów z funkcji wspomaganych przez AI.Statystyki przedstawiają rozkład satysfakcji studentów w zakresie funkcji przeredagowania tekstu, optymalizacji struktury oraz promptów kulturowych przez AI.
| Pomiar | Grupa F(df) | Czas F(df)GG | Grupa × Czas F(df)GG | p |
| Ogólny wskaźnik transferu | 76.32 (1, 58) | 92.75 (2.14, 124.12) | 68.49 (2.14, 124.12) | <0.001 |
| Transfer syntaktyczny | 52.18 (1, 58) | 71.26 (2.11, 122.38) | 45.73 (2.11, 122.38) | <0.001 |
| Transfer strukturalny | 48.65 (1, 58) | 67.81 (2.09, 121.22) | 41.36 (2.09, 121.22) | <0.001 |
| Transfer kulturowy | 81.44 (1, 58) | 98.52 (2.07, 119.96) | 79.27 (2.07, 119.96) | <0.001 |
Tabela 6: Podsumowanie wyników ANOVA z powtarzanymi pomiarami. Przedstawia ona wyniki dwuczynnikowej analizy ANOVA z powtarzanymi pomiarami dla ogólnych wyników transferu pisania oraz trzech jego podwymiarów, w tym efekty główne grupy, czasu oraz interakcję grupa-czas. Skróty: GG = korekta Greenhouse'a–Geissera.
Tabela uzupełniająca 1: Ocena surowych danych. Zawiera surowe dane wykorzystane we wszystkich analizach w niniejszym badaniu.Kliknij tutaj, aby pobrać ten plik.