$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
Deneyler ve Analizler
Tüm 32 öğrenci temel veri sağladı. Her grupta 16 öğrenci için sınav sonrası veriler mevcuttu (WCF ve STEP-DWCF-R; Şekil 2). Çalışma zaman çizelgesi ve ölçümleri Şekil 3'te sunulmakta, uçtan uca geri bildirim iş akışı ise Şekil 4'te gösterilmiştir. Yapay zeka sistemimiz için deneysel kurulum ve uygulama parametreleri Tablo 1'de gösterilmiştir. Analizler, önceden belirlenmiş planı tedavi etme niyetiyle takip etti. İlk olarak başlangıç eşdeğerliğini değerlendiriyoruz (Tablo 2), ardından birincil sonucu (Şekil 5 ve Tablo 3) raporluyoruz, ardından ikincil sonuçları (Tablo 4) sağlamlık ve güvenilirlik kontrolleri ile raporluyoruz.
Temel Eşdeğerlik
Başlangıçta (1. Hafta), gruplar önceden belirlenmiş kovaryatlar üzerinde tanımlayıcı olarak benzerdi; demografik ve IELTS yazım performansı dahil olmak üzere, herhangi bir geri bildirimden önce (Tablo 2). Bireysel IELTS bileşen puanları 0.5 bant adımlarıyla verilirken, tablo grup ortalamalarını bildirir. 1. Hafta genel ortalamaları (WCF = 5.625, STEP-DWCF-R = 5.500) Şekil 5'i oluşturmak için kullanılan aynı dizilerden hesaplanır. Hipotez testlerini başlangıçta yapmayız; herhangi bir kalıntı dengesizlik karışık etkiler modelinde pre-post tasarım ve Grup × Zaman terimi ile ele alınır ve Protokol bölümünde temel değere göre ayarlanmış test sonrası karşılaştırma rapor edilir.
Birincil Sonuç
Şekil 5 , post-post öncesi değişiklikleri özetlerken, Tablo 3 ve Tablo 5 model tahminlerini ve sınav sonrası başarıyı raporlar. Başlangıçta (1. hafta) grup ortalamaları WCF için 5.625 ve STEP-DWCF-R için 5.500 idi; bu da −0.125 bantlık anlamsız grup farkı (SE = 0.133, t = − .939, df = 29.90, p = .355, %95 CI [−0.397, 0.147]) oldu. Bu nedenle , Tablo 3'teki temel çizgi WCF 1. hafta ortalamasını %95 CI ile 5.625 olarak tahmin ediyor [5.419, 5.831] (SE = 0.097, df = 15). 1. haftadan 8. haftaya kadar WCF 0,3125 bant arttı (SE = 0,128, t = 2,44, df = 15, p = 0,028, %95 GA [0,039, 0,586]; standart grup içi etki dz = 0,61). STEP-DWCF-R 1.0313 bant (SE = 0.140, t = 7.34, df = 15, p = 2.44 × 10−6, %95 CI [0.732, 1.331]; dz = 1.84) gelişti. Grup × Zaman etkileşimi için doğrusal karışık etkiler kontrastı—yani farklar arasındaki fark—0.7188 banddı (SE = 0.190, t = 3.78, df = 29.75, p = .0007, %95 GA [0.330, 1.107]; Tablo 3), STEP-DWCF-R altında daha büyük kazançları göstermektedir. Test sonrası (8. hafta) tahmini marjinal ortalamalar STEP-DWCF-R'yi 0,5938 bant lehine tutuyordu (Welch testi grup ortalamaları üzerine: SE = 0,115, t = 5,16, df = 29,74, p = 1,50 × 10−5, %95 GA [0,359, 0,829]). Bununla tutarlı olarak, başarı tablosu (Tablo 5) 8. haftada WCF öğrenenlerinin %13'ünün Genel ≥ 6.5'e ulaştığını, %0'ının ise 7.0'≥ (16/2 ve 0/16 sayımları) ulaştığını, STEP-DWCF-R öğrenenlerin %81'inin ise 6.5≥ ve %25'inin ≥ 7.0'a ulaştığını (16/13 ve 16/4/sayımlar) göstermektedir. Tablo 3, ilgili sabit etkili tahminleri ve bunların belirsizliğini gösterir.
Boyut Düzeyi Sonuçları
Tablo 4, dört Görev 2 boyutu boyunca post-post öncesi değişiklikleri özetlemektedir. Görev Yanıtı (TR), WCF altında Δ = 0.25 bant, STEP-DWCF-R altında Δ = 0.95 kazanç gösterdi; ΔΔ = 0.70 ile %95 GA [0.28, 1.12] ve Holm ile ayarlanmış p = .006 oldu. Koherens ve Kohezyon (CC) en büyük kontrastı gösterdi: WCF Δ = 0.30, STEP-DWCF-R Δ = 1.15, dolayısıyla ΔΔ = 0.85 (%95 CI [0.44, 1.26], adj-p = .002). Lexical Resource (LR) de aynı deseni takip etti; WCF Δ = 0.35 ve STEP-DWCF-R Δ = 0.95 ile ΔΔ = 0.60 (%95 CI [0.18, 1.02], adj-p = .012) elde etti. Dilbilgisel Menzil ve Doğruluk (GRA) WCF'de Δ = 0.25 ve STEP-DWCF-R'de Δ = 0.97 ile iyileştirildi; ortaya çıkan ΔΔ = 0.72, %95 GA [0.31, 1.13] ve adj-p = .004 olarak taşıdı. Dört boyutun tamamında, Grup×Zaman karşılaştırmaları Holm–Bonferroni ayarlamasından sonra STEP-DWCF-R'yi tercih etti.
Süreç Kanıtı
Şekil 6 ve Şekil 7 , temel süreç sonuçlarını görselleştirir. 2–7. haftalar boyunca, STEP-DWCF-R ortalama olarak görev başına 2,26 revizyon turu tamamladı (%95 GA [2,17, 2,35]; n = 96), oysa WCF tüm görevler için 1,00 tur (n = 96) oldu. Ortalama fark 1,26 mermi (%95 GA [1,17, 1,35]); bir Mann–Whitney testi dağılımların ayrılmasını doğruladı (U = 9216, z = 11.97, p < 10−30). STEP-DWCF-R dahilinde ortalama hata sayıları tur bazında azaldı: 1. Turda 13.78 (%95 GA [13.02, 14.54]; n = 96), 2. Turda 8.94 (%95 GA [8.42, 9.46]; n = 96), ve 3. Turda 6.16 (%95 GA [5.20, 7.12]; n = 25). Tur başına yapılan gözlemlere uyan doğrusal bir eğilim, tur başına 4,14 hata azalma tahmin etti (mutlak büyüklükte %95 CI [3,51, 4,78]; p < 10−12). Geri besleme alımı ve görev süresi ölçümleri Şekil 6 ve Şekil 7'de kodlanmamış ve bu nedenle Tablo 7'de raporlanmıştır.
Güvenilirlik ve Dayanıklılık
1. ve 8. hafta denemeleri için değerlendirme aracı anlaşması iyiden mükemmele kadardı. İki eğitimli değerlendirmeci tüm senaryoları bağımsız olarak puanladı ve grup ile zamana kör oldu; Ortalama sınıf içi korelasyon katsayısı (ICC[2,2]) kullanılarak değerlendirici ortalamalar kullanılarak, güvenilirlik Genel ve dört boyut genelinde 0,86–0,93 arasında değişti ve tüm alt %95 güven sınırları 0,80'i aştı (Tablo 6). Birincil karışık etki modeli için tanısal kontroller, materyal heteroskedastisitesi olmadan yaklaşık normal kalıntılar gösterdi ve görev düzeyindeki süreç özetlerine uyan modeller neredeyse bire dağılım gösterdi. Aynı 1. Hafta/8. Hafta veri setine dayalı duyarlılık analizleri tutarlı çıkarımlar sağladı: Test sonrası grupları karşılaştıran doğrusal regresyon, başlangıç puanlarını ayarlama yaparken, 8. Haftada gruplar arası 0.575 bant olarak düzeltilmiş bir fark tahmin edildi (%95 GA [0.336, 0.814], p = 3.15 × 10−5), ve Değerlendirici için rastgele etki içeren ve ortalamasız skorlar kullanan bir değerlendirme özelliği karma model, Grup × Zaman tahmini olarak 0.72 bant (%95 GA [0.33, 1.11], p = .0007), Tablo 3 ile uyumlu olarak sunulmaktadır. Sağlam standart hatalar kullanıldığında ve analizler tam vakalarla sınırlandırıldığında sonuçlar değişmedi; bu da STEP-DWCF-R'nin WCF'den daha büyük ön kazanım sağladığı sonucunu pekiştirdi.
Niteliksel Bulgular
Niteliksel analiz için, STEP-DWCF-R grubundaki 16 katılımcının tüm altı görev boyunca STEP-DWCF-R revizyon izlerini ve kurs sonu yazılı değerlendirmelerini inceledik. İki kodlayıcı, materyalleri dört geri bildirim kategorisine (dilbilgisi, kelime dağarcığı, organizasyon, akıl yürütme) ve alım gerekçelerine dayalı odaklanmış bir tümselim çerçeve kullanarak bağımsız olarak kodladı. Kodlayıcılar arası anlaşma Cohen'in 0.78 kappa'sıyla önemli bir anlaşma sağladı ve anlaşmazlıklar tartışma yoluyla çözüldü.
Analiz beş ana temayı ortaya koydu: öğrenme, aşamalı bir deseni takip etti; öğrenciler organizasyon ve akıl yürütmeden önce yüzeysel özellikleri çözdü; Aralık özel, rubriklerle bağlantılı maddeler, anlatı önerilerinden daha uygulanabilir ve sıkça benimsenmişti; yapay zeka ve öğretmen tamamlayıcılığı önceliği şekillendirdi; örtüşen sinyaller odaklanmayı artırdı ve öğretmen moderasyonu çatışmaları çözdü; avantajlar erken zirveye ulaştı; organizasyon şablonlarının yeniden kullanımı ve yeni promptlarda belirtilen sözcük kalıpları; ve öğrenenler görevler arasında stratejileri uyarladı. Bu temalar, süreç kanıtı bölümünde incelenen süreç dinamiklerini şekillendirir. Geri bildirim alımı, kalıcı hatalar ve görev süresi ölçümleri de kaydedildi. Bu ek süreç göstergelerinin özeti Tablo 7'de sunulmaktadır.
Temsilci Sonuçların Yorumlanması
Sonuç ve süreç verileri bir arada ele alındığında, STEP-DWCF-R çerçevesinin geleneksel tek turlu geri bildirime kıyasla daha fazla IELTS yazım iyileştirmesi ile ilişkili olduğunu göstermektedir. Birincil sonuç, gruplar arası farklar arasında 0,72 bant farkı göstermekte; STEP-DWCF-R grubu genel olarak 1,03 bant oranında iyileşti, WCF grubundaki 0,31 bant ile karşılaştırıldığında. Bu avantaj, dört analitik boyutta tutarlıydı; en büyük kontrast Koherens ve Kohezyonda 0.85 banttı; bu da yapılandırılmış, rubrik bağlantılı, çok aşamalı geri bildirimin özellikle organizasyonel gelişimi desteklediğini gösteriyordu. Süreç kanıtları, bu avantajın temelinde yinelemeli etkileşimin yer aldığını daha da göstermektedir. STEP-DWCF-R öğrencileri görev başına ortalama 2,26 revizyon turu tamamladı ve hata sayısı tur başına yaklaşık 4,1 hata doğrusal olarak azaldı. Örneğin, temsilli bir iş akışı döngüsü, GPT-5'in dört kategoride yapılandırılmış JSON geri bildirimi üretmesini, ardından öğretmenlerin yanlış pozitifleri ortadan kaldırarak eyleme uygunluğunu artırmasını ve ardından robotik yapay zeka ajan arayüzü üzerinden çoklu aşamalı öğrenici revizyonu sunmasını içeriyordu. Bu bulgular, yapay zeka tarafından oluşturulan geri bildirim, öğretmen moderasyonu ve yinelemeli robotik yapay zeka ajanı teslimatını birleştiren entegre çok bileşenli iş akışının fizibilitesini ve potansiyel etkinliğini destekliyor, ancak tek bir bileşenin izole kanıtı olarak yorumlanmamalıdır. 2–3 tur ile bir tur arasındaki doz dengesizliği ve 32'lik mütevazı örneklem büyüklüğü, gözlemlenen kazanımların artan revizyon fırsatları ve yapılandırılmış geri bildirimin birleşik etkisini yansıttığını gösterir. Bu sonuçlar, daha büyük, bileşen kontrollü denemelerde onay bekleyen umut verici pilot kanıtlar olarak görülmelidir.

Şekil 1. DWCF'nin teorik çerçevesi (dinamik yazılı düzeltici geri bildirim). Bu rakam, DWCF'nin nasıl çalışabileceğine dair daha geniş bir gerekçe sunar; bu çalışmanın doğrudan modeli olarak değil, yönlendirme amacıyla dahil edilmiştir. Burada analiz edilen sonuçlar ve süreç metriklerine karşılık gelen unsurlar şekilde belirtilmiştir; diğer yollar örnekleyicidir ve değerlendirilmemiştir. Bu figürün daha büyük bir versiyonunu görmek için lütfen buraya tıklayın.

Şekil 2. Katılımcıların CONSORT akış diyagramı. Otuz iki öğrenci uygunluk açısından değerlendirildi; hiçbiri hariç tutulmamıştı. Tüm katılımcılar onay verdi ve ardından WCF grubuna (n = 16) veya DWCF grubuna (n = 16) 1:1 oranında randomize edildi. Tüm rastgele katılımcılar tahsis edilen müdahaleyi aldı; Takip veya üretimin durdurulması için kayıp olmadı ve 32'sinin tamamı nihai analizde yer aldı. Bu figürün daha büyük bir versiyonunu görmek için lütfen buraya tıklayın.

Şekil 3. Çalışma zaman çizelgesi ve ölçümleri. Deneme 8 hafta sürdü: W1 aşamasında katılımcılar IELTS Görev 2'yi tamamladı ve puanlandı; W2'den W7'ye (Görev 1–Görev 6) haftada altı yazma görevi verildi, gruba özgü geri bildirim (WCF veya DWCF) ve her görevden sonra revizyonlar yapıldı. W2–W7 boyunca her görev için revizyon turları, geri bildirim alımı, kalıcı hata oranı ve görev süresi gibi süreç ölçümleri kaydedildi. W8'de sınav sonrası IELTS Görev 2 uygulandı ve puanlandı. Bu figürün daha büyük bir versiyonunu görmek için lütfen buraya tıklayın.

Şekil 4. Uçtan uca geri bildirim iş akışı. Öğrenciler proktorlu bir ilk taslak oluşturur, ardından gruba özgü geri bildirim alır: WCF (bir insan geri bildirim turu) veya STEP-DWCF-R (yapay zeka tarafından oluşturulan geri bildirim, öğretmen moderasyonu ile robotik yapay zeka ajanları aracılığıyla sağlanır, 2–3 yinelemeli tur). Öğrenciler buna göre revizyon tur(lar)ını tamamlar. Sonuç IELTS Görev 2 bant puanıdır; Süreç ölçütleri arasında tur sayısı, geri bildirim alımı (kabul edilen/değiştirilen/reddedilen), kalıcı hata oranı ve görev süresi yer alır. Sistem, eşya seviyesi kimlikleri, kategori/sersit, kaynak (yapay zeka vs. insan vs. robot), moderasyon eylemleri ve alım durumunu kaydediyor. Bu figürün daha büyük bir versiyonunu görmek için lütfen buraya tıklayın.

Şekil 5. IELTS genel bandındaki 1. Haftadan 8. Haftaya Grup Göre Değişim. Puanlar, %95 güven aralıklarıyla tahmini grup ortalamalarını verir, yörüngeler ise STEP-DWCF-R altında daha büyük bir kazanç gösterir. Bu şekilin daha büyük bir versiyonunu görmek için lütfen buraya tıklayın.

Şekil 6. Gruplara göre görev başına revizyon turları (2–7. haftalar). Veri noktaları, WCF (mavi) ve STEP-DWCF-R (turuncu) grupları için bireysel görev revizyon turlarını temsil eder. Yatay çizgiler ve hata çubukları, %95 güven aralıklarıyla grup ortalamalarını gösterir. Bu figürün daha büyük bir versiyonunu görmek için lütfen buraya tıklayın.

Şekil 7. STEP-DWCF-R içinde ortalama hata sayımı, %95 CI ile tur başına sayılır. Puanlar, her geri bildirim turunda (1. Tur, 2. Tur, 3. Tur) ortalama hata sayılarını gösterirken, dikey çizgiler %95 güven aralıklarını (CI) temsil eder. Bu figürün daha büyük bir versiyonunu görmek için lütfen buraya tıklayın.
| Bileşen | Teknik özellikler |
| Donanım | 12. Nesil Intel(R) Core(TM) i7-12700H (2.30 GHz), 32GB RAM, NVIDIA RTX 3080Ti GPU (16GB) ile PC |
| İşletim Sistemi | Windows 11 |
| Arka plan | Flask~2.1 (Python~3.10) |
| Ön uç | Jinja2 sunucu tarafından render edilen şablonlar |
| Yapay Zeka Modelleri | OpenAI GPT-5 API (geri besleme üretimi için), şema tabanlı post işleme |
| Geri Bildirim Zamanlayıcısı | Çok aşamalı geri bildirimi yöneten özel kontrolcü (3 döngü) |
| Hata Şeması | Dilbilgisi, Kelime Dağarcığı, Organizasyon, Akıl Yürütme |
| Sürüm Kontrolü | GitHub |
| Kütük Kesim | Gönderilerin, geri bildirimlerin ve analiz için revizyonların otomatik kaydı |
Tablo 1: Deneysel kurulum ve uygulama parametreleri. Donanım yapılandırması, işletim sistemi, arka uç ve ön uç çerçeveleri, yapay zeka model ayarları, geri bildirim zamanlayıcısı, hata şeması kategorileri, sürüm kontrolü ve günlük altyapısı gibi yapay zeka geri bildirim sisteminin teknik özellikleri.
| Değişken | WCF (n=16) | STEP-DWCF-R (n=16) |
| Yaş (yıl), ortalama (SD) | 20.9 (1.5) | 21.1 (1.6) |
| Kadın, n (%) | 9 (56%) | 8 (50%) |
| Önceden IELTS hazırlıkları (evet), n (%) | 7 (44%) | 6 (38%) |
| Önceki yazma eğitimi yılları | 3.1 (1.2) | 3.2 (1.1) |
| Temel IELTS Genel (grup) | 5.625 (0.387) | 5.500 (0.365) |
| Baseline TR (grup) | 5.56 (0.50) | 5.50 (0.50) |
| Baseline CC (grup) | 5.62 (0.49) | 5.53 (0.49) |
| Baseline LR (grup) | 5.60 (0.46) | 5.52 (0.46) |
| Baseline GRA (grup) | 5.56 (0.48) | 5.49 (0.45) |
Tablo 2: Katılımcıların gruplara göre temel özellikleri (1. Hafta). Demografik değişkenler ve WCF ile STEP-DWCF-R grupları için Uluslararası İngilizce Dil Test Sistemi (IELTS) Görev 2 yazma performansı ön-test ve inceleme çalışması. Değerler ortalama (standart sapma) veya n (%)-dir.
| Sabit etki | Tahmin | SE | DF | t | p | %95 CI |
| Intercept (WCF, Hafta~1) | 5.625 | 0.097 | 15 | 58.1 | <.001 | [5.419, 5.831] |
| Grup (STEP-DWCF-R vs. WCF) | -0.125 | 0.133 | 29.9 | -0.939 | .355 | [-0.397, 0.147] |
| Zaman (Hafta~8 vs. Hafta~1) | 0.3125 | 0.128 | 15 | 2.44 | .028 | [0.039, 0.586] |
| Grup × Zamanı | 0.7188 | 0.19 | 29.75 | 3.78 | .0007 | [0.330, 1.107] |
Tablo 3: 1. Hafta/8. Hafta puanlarından IELTS genel bant için doğrusal karışık etki modeli. Sabit etki tahminleri, standart hatalar (SE), özgürlük dereceleri (df), t-değerleri, p-değerleri ve Grup × Zaman etkileşimi ve model terimleri için %95 güven aralıkları (CI'ler).
| Boyut | WCF Δ (gruplar) | STEP-DWCF-R Δ (bantlar) | ΔΔ (95% CI) | Sıfat-P |
| Görev Yanıtı (TR) | 0.25 | 0.95 | 0.70 (0.28, 1.12) | .006 |
| Tutarlılık ve Bütünlük (CC) | 0.3 | 1.15 | 0.85 (0.44, 1.26) | .002 |
| Sözlük Kaynağı (LR) | 0.35 | 0.95 | 0.60 (0.18, 1.02) | .012 |
| Dilbilgisel Aralık ve Doğruluk (GRA) | 0.25 | 0.97 | 0.72 (0.31, 1.13) | .004 |
Tablo 4: Boyut düzeyinde sonuçlar (Görev 2): ön post değişiklikleri ve gruplar arası farklar. Görev Yanıtı (TR), Tutarlılık ve Uyum (CC), Sözcük Kaynak (LR) ve Dilbilgisel Aralık ve Doğruluk (GRA) için Holm ayarlanmış p-değerleri ile pre-post değişiklikleri (Δ) ve fark farkı (ΔΔ) ile %95 güven aralıkları (CI) ile sağlandı.
| Eşik | WCF (%) | STEP-DWCF-R (%) |
| Genel ≥ 6.5 | 13 | 81 |
| Genel ≥ 7.0 | 0 | 25 |
Tablo 5: Test sonrası bant başarısı (8. Hafta). WCF ve STEP-DWCF-R gruplarındaki öğrencilerin IELTS Genel bant puan eşiklerine en az 6.5 ve en az 7.0 ulaşma oranı.
| Sonuç | ICC | %95 CI |
| Genel Olarak | 0.91 | [0.86, 0.94] |
| Görev Yanıtı (TR) | 0.88 | [0.82, 0.92] |
| Tutarlılık ve Bütünlük (CC) | 0.9 | [0.85, 0.94] |
| Sözlük Kaynağı (LR) | 0.89 | [0.83, 0.93] |
| Dilbilgisel Aralık ve Doğruluk (GRA) | 0.87 | [0.80, 0.91] |
Tablo 6: IELTS sonuçları için dereceleyiciler arası güvenilirlik. İki kör dereceleyici N = 64 deneme (1. ve 8. Hafta toplamında). Ortalama sınıf içi korelasyon katsayılarını (ICC[2,2]) ölçüyor; genel ve boyut puanları için %95 güven aralıkları (CI) içerir.
| Ölçü | WCF Grubu | STEP-DWCF-R Grubu |
| Görev başına revizyon turları | 1 | 2.26 |
| Geri bildirim alım oranı (benimsenmiş veya değiştirilmiş, %) | 68.5 | 82.3 |
| Son turdan sonra kalıcı hata oranı (%) | 67.4 | 45.6 |
| Öğretmenin moderasyon süresi (görev başına en az süre) | 23.5 | 13.8 |
| AI ajanı teslimat süresi (görev başına en az tutar) | — | 3.9 |
| Öğrenci revizyon süresi (görev başına en az süre) | 44.8 | 71.2 |
| Toplam geri bildirim süresi + revizyon (minimum/görev) | 68.3 | 88.9 |
Tablo 7: 96 görev boyunca ortalamalar (6 görev × 16 öğrenen). Alım ve kalıcı hata oranları geri besleme noktası seviyesinde hesaplandı. Zaman ölçümleri öğretmen kayıtları ve sistem zaman damgaları aracılığıyla kaydedildi. WCF grubu için yapay zeka ajanı teslimat süresi geçerli değildir.