$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
Eksperymenty i analiza
Wszystkie 32 uczestników dostarczyło danych początkowych. Dane po eksperymencie były dostępne dla 16 uczestników w każdej grupie (WCF i STEP-DWCF-R; Rysunek 2). Terminarz badania i wskaźniki są przedstawione na Rysunku 3, a przepływ feedbacku od końca do końca jest zilustrowany na Rysunku 4. Ustawienia eksperymentalne i parametry implementacji naszego systemu AI są przedstawione w Tabeli 1. Analizy przeprowadzono zgodnie z wcześniej określonym planem z zastosowaniem zasady intention-to-treat. Najpierw oceniliśmy równoważność początkową (Tabela 2), następnie przedstawiliśmy główny wynik (Rysunek 5 i Tabela 3), a następnie wyniki wtórne (Tabela 4) wraz z kontrolą odporności i niezawodności.
Równoważność początkowa
Na początku (tydzień 1) grupy były opisowo podobne pod względem wstępnie określonych zmiennych, w tym wskaźników demograficznych i wyników w piśmie w języku angielskim przed jakąkolwiek poprawą (Tabela 2). Pojedyncze oceny komponentów IELTS są przydzielane w krokach po 0,5 punktu, podczas gdy tabela przedstawia średnie dla grup. Średnie ogólne w tygodniu 1 (WCF = 5,625, STEP-DWCF-R = 5,500) są obliczane na podstawie tej samej tablicy użytej do wygenerowania Rysunku 5. Nie przeprowadzamy testów hipotez na poziomie początkowym; wszelkie pozostałe nierównoważności są rozwiązywane przez projekt przed-po i warunek Grupa × Czas w mieszanym modelu efektów oraz porównanie po eksperymencie, dostosowane do początku, jest prezentowane w sekcji Protokół.
Wynik główny
Rysunek 5 podsumowuje zmiany przed-po, podczas gdy Tabela 3 i Tabela 5 raportują oszacowania modelu i osiągnięcia po eksperymencie. Na początku (tydzień 1) średnie dla grup wynosiły 5,625 dla WCF i 5,500 dla STEP-DWCF-R, co daje nieistotną różnicę między grupami wynoszącą -0,125 punktów (SE = 0,133, t = -0,939, df = 29,90, p = 0,355, 95% CI [-0,397, 0,147]). Średnia w Tabeli 3, zatem, oszacowuje średnią WCF w tygodniu 1 na 5,625 z 95% CI [5,419, 5,831] (SE = 0,097, df = 15). Od tygodnia 1 do tygodnia 8 WCF poprawiło się o 0,3125 punktów (SE = 0,128, t = 2,44, df = 15, p = 0,028, 95% CI [0,039, 0,586]; standaryzowany efekt wewnątrzgrupowy dz = 0,61). STEP-DWCF-R poprawiło się o 1,0313 punktu (SE = 0,140, t = 7,34, df = 15, p = 2,44 × 10-6, 95% CI [0,732, 1,331]; dz = 1,84). Liniowy efekt mieszany kontrastu dla interakcji Grupa × Czas — czyli różnica różnic — wynosił 0,7188 punktu (SE = 0,190, t = 3,78, df = 29,75, p = 0,0007, 95% CI [0,330, 1,107]; Tabela 3), co wskazuje na większe zyski w przypadku STEP-DWCF-R. Po eksperymencie (tydzień 8) oszacowane średnie marginalne sprzyjały STEP-DWCF-R o 0,5938 punktu (test Welcha na średnich grupowych: SE = 0,115, t = 5,16, df = 29,74, p = 1,50 × 10-5, 95% CI [0,359, 0,829]). Zgodnie z tym, tabela osiągnięć (Tabela 5) pokazuje, że w tygodniu 8, 13% uczestników WCF osiągnęło ogół ≥ 6,5 i 0% osiągnęło ≥ 7,0 (liczby 2/16 i 0/16), podczas gdy 81% uczestników STEP-DWCF-R osiągnęło ≥ 6,5 i 25% osiągnęło ≥ 7,0 (liczby 13/16 i 4/16). Tabela 3 raportuje odpowiednie oszacowania efektów stałych i ich niepewność.
Wyniki na poziomie wymiaru
Tabela 4 podsumowuje zmiany przed-po w czterech wymiarach zadania 2. Zadanie odpowiedzi (TR) wykazało zyski w wysokości Δ = 0,25 punktu w przypadku WCF, w porównaniu z Δ = 0,95 w przypadku STEP-DWCF-R, co daje ΔΔ = 0,70 z 95% CI [0,28, 1,12] i Holm-skorygowane p = 0,006. Spójność i kohezja (CC) wykazały największy kontrast: WCF Δ = 0,30, STEP-DWCF-R Δ = 1,15, stąd ΔΔ = 0,85 (95% CI [0,44, 1,26], adj-p = 0,002). Zasoby leksykalne (LR) przestrzegały tego samego wzorca, z WCF Δ = 0,35 i STEP-DWCF-R Δ = 0,