Yöntem makalesi

Yapılandırılmış ve yinelemeli makale desteği için yapay zeka ajanı sunumunu entegre eden dinamik yazılı düzeltici geri bildirim çerçevesi

DOI:

10.3791/71992

24 Temmuz 2026

Bu makalede

Özet

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Bu çalışma, çok aşamalı yapay zeka ve öğretmen destekli revizyonlar yoluyla IELTS yazı performansını artırmak için STEP-DWCF-R (Robotik Yapay Zeka Ajanı ile Dinamik Yazılı Düzeltici Geri Bildirim İçin Yapılandırılmış, Kademeli, Kanıt Odaklı Süreç) kıyaslamalarını sunmaktadır.

Özet

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Otomatik yazma geri bildirim sistemleri yaygındır, ancak çoğu statik, parçalı yorumlar sunar ve revizyon için sınırlı bir altyapı sağlar. Bu çalışma, bir öğretmen tarafından yönetilen yapay zeka geri bildirimin, bir haftalık görev döngüsünde birden fazla iteratif tur boyunca robotik yapay zeka ajanı aracılığıyla sunulduğu STEP-DWCF-R çerçevesini (Robotik Yapay Zeka Ajanı ile Dinamik Yazılı Düzeltici Geri Bildirim İçin Yapılandırılmış, Kademeli, Kanıta Dayalı Süreç) değerlendirmektedir. Sekiz haftalık yarı-deneysel bir denemede, 32 EFL öğrencisi ya geleneksel yazılı düzeltici geri bildirime (görev başına bir tur) ya da STEP-DWCF-R ile rastgele seçildi. Her iki grup da IELTS Görev 2 denemelerini başlangıç ve sonrası testte tamamladı; bunlar anonimleştirildi, rastgele yapıldı ve iki bağımsız değerlendirici tarafından puanlandı (ICC = 0.86–0.93). Doğrusal karışık etki modelleri, STEP-DWCF-R grubunun genel bant skorunda (Δ = 1.03 vs. 0.31 bant) ve dört analitik boyutta anlamlı daha büyük artışlar gösterdiğini, en büyük iyileşmenin ise Koherens ve Kohezyon'da gözlemlendiğini gösterdi. Süreç verileri, STEP-DWCF-R öğrenenlerinin her görev başına ortalama 2,26 revizyon turu tamamladığını ve hata sayılarının turlar arasında doğrusal olarak azaldığını gösterdi. Bu bulgular, yapay zeka tarafından oluşturulan geri bildirim, öğretmen moderasyonu ve yinelemeli robotik yapay zeka ajanı sunumunu kapsayan entegre STEP-DWCF-R çerçevesinin, geleneksel tek turlu geri bildirime kıyasla daha fazla IELTS yazım iyileştirmesi ile ilişkilendirildiğini ve EFL bağlamlarında yapay zeka ile güçlendirilmiş dinamik geri bildirimin pratik uygulamalarına işaret ettiğini göstermektedir.

Giriş

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Yazılı düzeltici geri bildirim (WCF), L2 yazma pedagojisinde merkezi olmaya devam ediyor. Kanıtlar, kapsamlı WCF'nin zamanla öğrenenlerin doğruluğunu artırdığını ve sınıf pratiği ile uyumlu olduğunda, otmentik bağlamlarda uygulanabilir odaklanmış yaklaşımlarla bir arada var olabileceğini göstermektedir 1,2,3. Son sınıf çalışmaları, sürdürülebilir ve kapsamlı WCF'nin sağladığı doğruluk ve akıcılıkta kalıcı artışlar göstermektedir. Geri bildirim kapsamı üzerine yapılan araştırmalar, öğretmenlerinher şeyi 4,5,6,7,8,9 olarak not almak yerine stratejik olarak hedeflemesi gerektiğini belirtmektedir. Paralel olarak, otomatik yazı değerlendirmesi (AWE) ve otomatik yazılı düzeltici geri bildirim (AWCF) hızla büyüdü. Bulgular karışıktır: bazı çalışmalar AWCF veya Criterion tarzı programlarla görev başarısı ve dilbilgisi aralığında artışlar gösterirken, diğerleri yalnızca öğretmenlere yönelik geri bildirimlere göre önemli bir avantaj bulmuyor veya çoğunlukla yerel, yüzeysel revizyonlar not ediyor. Bu heterojenliği yansıtmak için, tek bir kaynağa yaslanmak yerine kasıtlı olarak birden fazla AWCF çalışması arasında üçgenlemeyapıyoruz 10,11,12,13.

Geri bildirim sağlayanların kimlerin sağladığına dair inançları da önemlidir: algılanan kaynak üzerine yarı-deneysel çalışmalar, aynı geri bildirimin "öğretmen" ve "otomatik" olarak çerçevelendiğinde performans ve güvenin değişebileceğini göstererek AWCF tasarımlarında algı etkilerinin hesaba katılması gerekliliğinivurgulamaktadır 14,15. Bu çizgiyi genişleten yeni çalışmalar, eğitim robotlarının bedenli varlıkları sayesinde geri bildirim sağlayıcıları olarak da hareket edebileceğini ve öğrenen etkileşimini ve güvenini farklı şekillerdeetkileyebileceğini öne sürmektedir 16.

Tamamlayıcı bir araştırma hattı olan dinamik yazılı düzeltici geri bildirim (DWCF), kodlama ve hızlı revizyonla sık, yönetilebilir ve kapsamlı geri bildirim döngülerini vurgular. Birden fazla ortamdan elde edilen kanıtlar, DWCF'nin doğruluğu güvenilir şekilde artırdığını (akıcılık üzerinde sıklık etkileri ile) göstermektedir, ancak sonuçlar ders hedeflerine ve öğrenci nüfusuna göredeğişebilir: 17,18,19,20. Son olarak, üretken yapay zeka aracılı geri bildirim üzerine yapılan erken çalışmalar, öğretmenlerin yazı sonuçları ve potansiyel faydaları konusundaki geri bildirimleriyle eşitlik göstererek, L2 bağlamlarında insan ve yapay zeka geri bildiriminin daha yakın entegrasyonunu teşvik eder21,22.

Bu zorlukları ele almak için, yapılandırılmış, yinelemeli ve süreç odaklı yazma desteği sağlamak için tasarlanmış yeni çok aşamalı DWCF geri bildirim sistemi olan STEP-DWCF-R (Robotik Yapay Zeka Ajanı ile Dinamik Yazılı Düzeltici Geri Bildirim için Yapılandırılmış, Kademeli, Kanıt Odaklı Süreç) çerçevesini öneriyoruz. Sistemimiz, robotik bir yapay zeka ajanı arayüzü ve öğretmen moderasyonu aracılığıyla sunulan Büyük Dil Modelleri (LLM) öngörücü ve üretken gücünden yararlanarak, karmaşık yazım sorunlarını yönetilebilir kategorilere ayırmak, çoklu etkileşim turlarıyla geri bildirim vermek ve hem sonuç hem de süreç tabanlı metrikler kullanarak etkinliğini değerlendirmek için kullanır. Geri bildirimi yapılandırılmış ve etkileşimli bir sürece dönüştürerek, STEP-DWCF-R otomatik yazma desteğini statik hata düzeltmeden daha ilgi çekici, bedenli ve öğrenme odaklı bir sisteme doğru ilerletir.

Katkılarımız üç entegre ilerleme üzerine odaklanıyor. İlk olarak, hataları (örneğin dilbilgisi, tutarlılık) kategorize eden yapılandırılmış bir geri bildirim temsil şeması öneriyoruz; böylece robotik yapay zeka ajanı tarafından sağlanan LLM geri bildirimi hem uygulanabilir hem de pedagojik olarak yorumlanabilir hale getiriliyor. İkinci olarak, dil, yapı ve akıl yürütme üzerinden geri bildirimi birden fazla tur boyunca sıralayan yinelemeli çok aşamalı bir süreç sunuyoruz; böylece bilişsel yük azaltılır ve derinleştirilir. Üçüncü olarak, değerlendirmeyi post-puanların ötesine taşıyarak hata azaltma ve geri bildirim benimseme gibi süreç odaklı metrikleri de kapsayarak öğrenme etkisine daha zengin bir bakış sunuyoruz. WCF çerçeveleri, eğitim teknolojisinde yazılı düzeltici geri bildirimi sistemleştirmeye yönelik en erken girişimleri temsil eder. Otomatik Yazı Değerlendirmesi (AWE) ve Otomatik Deneme Puanlama (AES) ile ortaya çıkan bu sistemler, hata tespiti ve yeterlilikpuanını 13,14 olarak vurgulamıştır. Katkıları ölçeklenebilirlikte yatıyor: binlerce öğrenen, insan notlama darboğazı olmadan geri bildirim alabilir. Ancak bu çerçeveler genellikle statistik ve parçalı yorumlar sunar; örneğin dilbilgisi kontrolleri, sözcük önerileri veya öğrencilerin anlamlı revizyonlara dönüştürmekte zorlandığı küreselpuanlar 23,24,25,26.

Zamanla, WCF araştırmaları daha fazla teknoloji aracılı yaklaşımları da içerecek şekilde evrildi. Bu yeni sistemler, hesaplamalı yöntemleri kullanarak yazmanın daha geniş yönlerini yakalamayıamaçladı 13,21. Son zamanlarda, eğitim robotlarının yazı veya ders bağlamlarında geri bildirim sağlayıcı olarak görev yapmaya başladığı bedenli teknolojilerle kapsam daha da genişledi. Fiziksel varlıkları ve etkileşimli imkanları, güven, katılım ve öğrenci motivasyonu gibi yeni dinamikler ortaya çıkarır. Ancak bu gelişmelere rağmen, WCF'nin baskın yönelimi sonuçodaklı kalmaya devam etti 8,27: tek bir atışta puan veya izole yorumlar üretmek. Pedagojik olarak, bu yönelim, geri bildirimin taslaklar arasında revizyonu desteklemesi ve metabilişsel katılımı desteklemesi gereken biçimlendirici değerlendirmeyleörtüşmemektedir 16,28,29,30,31. Böylece, WCF'nin kavramsal sınırı kalıcı bir boşluk ortaya koyuyor: geri bildirim sağlanır, ancak öğrenme süreçlerini yönlendirmek için yapılandırılmaz veya sıralanmaz.

Bu sınırlamalara yanıt olarak, akademisyenler geri bildirim yazma konusunda daha dinamik yaklaşımlar keşfetmeye başladılar. Erken araştırmalar, öğrencilerin iskele rehberliği altında birden fazla kez revizyon yaptığı yinelemeli geri bildirim döngülerinin öneminivurguladı 17,32. Geri bildirimin yorumlanabilirliğini artırmak ve pedagojik hedeflerle uyumlu hale getirmek için yapılandırılmış hata kategorilendirmesi deönerilmiştir 33,34. DWCF çerçevesi kavramı, bu yönleri üç tasarım ilkesini entegre ederek pekiştirir: açık hata şemaları, aşamalı ve yinelemeli sunum ve süreç odaklı değerlendirmemetrikleri 19,35. Öğrencileri aynı anda birçok düzeltmeyle boğmak yerine, DWCF dikkati yazı katmanları arasında—yüzey doğruluğu, yapısal tutarlılık ve tartışmacı derinlik—ardışıkturlar 17,33 boyunca dağıtır. Değerlendirme, nihai puanların ötesine geçerek hata azaltma oranları, geri bildirim benimseme ve revizyonderinliği 10,19,25 gibi süreç göstergelerini de kapsar. Umut vaat etmesine rağmen, DWCF'nin pratik uygulamaları hâlâ az ve çoğu çalışma, onu büyük ölçekli, teknoloji aracılı bağlamlarda operasyonel hale getirmekte duruyor 10,36,37. Bu boşluk, DWCF'yi sadece teorize etmekle kalmayıp, aynı zamanda gerçek dünya eğitim ortamlarında uygulanabilirliğini gösteren çerçevelere olan ihtiyacı ortaya koyuyor. Şekil 1, literatürde önerilen DWCF'nin daha geniş teorik çerçevesini göstermektedir. Şekil, dinamik yazılı düzeltici geri bildirimin birden fazla düzeyde nasıl çalışabileceğine dair genel bir gerekçe sunar; hem ölçülen sonuçları (örneğin, doğruluk, tutarlılık) hem de mevcut çalışmadaki teorileştirilmiş ancak ölçülmemiş yapıları (örneğin, yazma kaygısı azaltma, akıcılık ve karmaşıklık) içerir. Bu çalışmanın doğrudan modeli olarak değil, teorik yönelim için dahil edilmiştir. Burada analiz edilen sonuçlar ve süreç metriklerine karşılık gelen unsurlar şekilde belirtilmiştir; Diğer yollar örnekleyicidir ve bu çalışmada değerlendirilmemiştir.

LLM'lerin ve multimodal sistemlerin ortaya çıkışı, DWCF'nin büyük ölçekte operasyonel hale getirilmesi için güçlü bir araç sunmaktadır. LLM'ler, sıfır atış ve az atış yetenekleriyle bağlam duyarlı geri bildirim üretebiliyor ve göreve özgü eğitimolmadan 21,22. Son deneyler, DWCF 13,37,38,39 prensipleriyle yakından uyumlu olan yönlendirici segmentasyon, aşamalı iyileştirme ve açıklama oluşturma potansiyellerini öne sürmektedir. İnsan-YZ iş birliğinde tamamlayıcı araştırmalar, yapay zeka geri bildirimiyle etkileşim kurma, uyum sağlama ve seçici olarak benimseme döngülerinin hem alım hem de revizyon kalitesini artırabileceğinigöstermiştir 25,30. Bu süreçler robotlar aracılığıyla somutlaştırıldığında, etkileşim teorik olarak çok modlu olma potansiyeline sahiptir—jest, ses ve varlığı birleştirerek—bu da öğrenenin algısını ve motivasyonunu daha da artırabilir40.

Yakınsal Gelişim Bölgesi (ZPD)41, Giriş Hipotezi42 ve Beceri EdinimiTeorisi 43'e dayanarak, STEP-DWCF-R'yi öğrenen desteği, girdi işleme ve beceri gelişimini birbirine bağlayan bir kontrolör olarak konumlandırıyoruz. Somut olarak, rubrik bağlantılı öğeler, zamanında birleştirilmiş listeler ve çok aşamalı öğretmen tarafından yönetilen yapay zeka–, insan ve robot–döngüler, revizyonu aracılık eden ve burada analiz edilen gözlemlenebilir uç noktaları sağlayan bir entegrasyon katmanında çalışır (IELTS Genel ve TR/CC/LR/GRA; turlar, alım, kalıcı hatalar, zaman). Kaygı azaltma gibi yazma yapıları teorize edilmiş ancak bu denemede ölçülmemiştir.

Protokol

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Bu protokol, Shangrao Anaokulu Eğitim Koleji İlköğretim Okulu'nun Etik Komitesi tarafından onaylandı. Tüm katılımcılar yetişkindi (≥18 yaşında) ve çalışmadan önce yazılı bilgilendirilmiş onay verdiler.

1. Çalışma tasarımı

NOT: EFL sınıfının kısıtlamaları nedeniyle (toplam kayıt N = 32), katılımcılar her biri 16 kişilik iki gruba rastgele ayrıldı. Bu örneklem büyüklüğü, mütevazı olmasına rağmen, konu içi ön tasarım ve önceki DWCFçalışmalarına 17,18,19,20 dayanan büyük etki boyutları göz önüne alındığında pilot araştırma için yeterli olduğu belirlenmiştir.

  1. Katılımcıları basit rastgeleleştirme kullanarak iki gruba (n = 16 her biri) ayırın. Tahsis dizisini bilgisayar tarafından oluşturulan rastgele sayı listesi kullanarak oluşturun. Temel değerlendirme tamamlanana kadar eğitmenden tahsisi gizlemek.
  2. Her iki grubun da aynı eğitmen tarafından, aynı materyaller ve iletişim saatleri kullanılarak ders verildiğinden emin olun.
  3. Geri bildirim ya doğrudan insan düzeltmesi (WCF) ile ya da yapay zeka ve öğretmen geri bildirimlerinin robotik bir yapay zeka ajanı aracılığıyla sunulduğu STEP-DWCF-R iş akışı yoluyla iletin.

2. Yazma Görevleri

  1. 1. haftada sınav koşullarında (≥250 kelime, 40 dakika) temel bir IELTS Görev 2 makalesi uygulayın.
  2. Haftada altı yazma görevi yapın (2–7. haftalar). Her görev için:
    1. WCF'de, makaleye bir tur insan geri bildirimi sunun.
    2. STEP-DWCF-R'de, yapay zeka geri bildirimi üretin, bunu bir insan öğretmenle birlikte yönetin ve robotik yapay zeka ajanına geri bildirimi etkileşimli olarak öğrenciye sunmasını talimat verin.
    3. STEP-DWCF-R'de, revizyon tamamlanana kadar STEP-DWCF-R geri besleme döngüsünü 2–3 tur boyunca tekrarlayın.
  3. 8. haftada aynı sınav koşulları altında IELTS Görev 2 sonrası deneme uygulaması yapın. Her iki grupta da aynı bir haftalık takvime uyun. 1. Tur geri bildirimini taslak gönderiminden sonraki 24 saat içinde STEP-DWCF-R ile ilet. Öğrencilerin 48 saat içinde tekrar yapıp yeniden göndermelerini zorunlu kılın. Sonraki turlar için aynı programı takip edin ve haftalık pencere içinde tüm döngüleri tamamlayın.

3. Geri Bildirim İş Akışı

  1. Her öğrenen taslağı GPT-5 API ile (model = "gpt-5", sıcaklık = 0.7, max_output_tokens = 2048) işleyerek dört sabit kategoride ayrıntılı geri bildirim oluşturun: Dilbilgisi, Kelime Dağarcığı, Organizasyon ve Akıl yürütme. Tam sistem isteği ve JSON çıkış şeması açık kaynak deposunda (https://github.com/YifangGaoinPG/Dynamic-Writing-Correction-Feedback/blob/main/evaluate.py, fonksiyon build_prompt() ve normalize_reasoning()) sağlanmıştır.
  2. Yapay zeka tarafından oluşturulan geri bildirimi aşağıdaki kriterlere göre denetleyin: yanlış pozitifleri veya yanlış yorumları kaldırın; IELTS kriterine uygun kritik konuları ekleyebilir; yorumların uygulanabilir ve teşvik edici olmasını sağlamak; ve dört kategorili şemaya uyum sağlamak. Moderasyon kararlarını manuel olarak kaydedin.
  3. Moderatör edilen geri bildirimi JSON formatında kaydedin ve robotik yapay zeka ajan arayüzüne (hafif bir Flask web uygulaması) yükleyin.
  4. Web arayüzü üzerinden geri bildirim sunun. Her kategori için yapılandırılmış tablolar gösterin (özet, sorunlar ve revizyon ipuçları). Öğrenen teşekkür ve açıklama taleplerini sistem kayıtları aracılığıyla kaydedin. Öğrencilere taslaklarını gözden geçirmeleri ve yeniden göndermeleri için talimat verin. Her görev başına bu döngüyü en fazla üç kez tekrarlayın.
  5. Doğrulama ve sorun giderme.
    1. Başarılı yapay zeka geri bildirim üretimini doğrulayın; çıktının geçerli JSON olup olmadığını, dört gerekli kategorinin tamamını içerdiğinden doğrulayın: Dilbilgisi, Kelime Dağarcığı, Organizasyon ve Akıl yürütme. Öğretmen moderasyonunun tamamlandığını doğrulamak, yanlış pozitiflerin kaldırıldığını, eksik sorunların eklendiğini ve moderasyonlu JSON dosyasının kaydedildiğini garantileyin.
    2. Moderatörlü JSON dosyasını yükleme uç noktası üzerinden Flask tabanlı robotik yapay zeka ajan arayüzüne yükleyin. Arayüz onay mesajı ve veritabanı log girişi üzerinden başarılı yüklemeyi onaylayın. Form gönderim kayıtları aracılığıyla öğrenen yeniden gönderimleri otomatik olarak kaydedin.
    3. Uyumsuz yapay zeka çıktılarını (örneğin, yanlış oluşturulmuş JSON, eksik kategoriler veya yanlış geri bildirim) ensure_json() ve normalize_reasoning() fonksiyonlarını kullanarak işleyin. API çıktısını gerektiğinde ayarlanmış istem parametreleriyle yeniden oluşturun. Gerekirse, öğretmen moderasyonu sırasında JSON'u manuel olarak düzeltin, böylece tüm dört kategorinin yüklemeden önce mevcut olduğundan emin olun.
      NOT: Ham yapay zeka geri bildirimi, öğretmen tarafından yönetilen versiyonlar ve sunulan arayüz çıktısı örnekleri depoda mevcuttur (veri/klasör ve defterler/).

4. Sonuç Ölçümü

  1. Birincil sonuç, IELTS genel bant puanındaki değişim olarak tanımlanır (1. haftadan 8. haftaya).
  2. İkincil sonuçları, Görev Yanıtı, Tutarlılık ve Bütünlük, Sözcük Kaynakları ve Dilbilgisel Aralık ve Doğruluktaki değişiklikler olarak tanımlayın.
  3. Tüm makaleleri değerlendirmek için IELTS Görev 2 puanlamasında deneyimli iki bağımsız değerlendirmeci atayın. Tüm makalelerden isimleri ve grup tanımlayıcılarını çıkarın. Makale sırasını rastgele yapın ve kör dereceleyicileri grup ataması ve zaman noktasına göre değerlendirin. Hem 1. Hafta başlangıç ve 8. Hafta sonrası sınav için aynı IELTS Görev 2 sorusunu kullanın. 0.5 banttan büyük anlaşmazlıklar tartışma yoluyla puanlama konusunda uzlaşmaya varılana kadar çözüm bul. Ortalama ölçümler sınıf içi korelasyon katsayısı (ICC[2,2]) kullanılarak dereceler arası güvenilirlik değerlendirin.

5. Süreç Ölçümü

  1. Her görev başına revizyon tur sayısını kaydedin.
  2. Öğrenenler tarafından geri bildirim alımını (benimsenmiş, değiştirilmiş, reddedilen) kayda geçirmek.
  3. Döngüler arasında kalıcı hataları takip edin.
  4. Öğretmen geri bildirim süresini, robot teslimat süresini ve öğrencinin revize süresini kaydet.

6. Veri Analizi

  1. Doğrusal karışık etki modellerini Grup, Zaman ve Grup × Zaman etkileşimiyle uydurun.
  2. Süreç ölçümleri için genelleştirilmiş karışık etki modelleri uygulanır.
  3. Etki boyutlarını, %95 güven aralıklarını ve ayarlanmış p-değerlerini bildirin.
  4. ANCOVA, rater-spesifik modeller ve sağlam SE'ler ile sağlamlık kontrolleri yapın.

7. Kod Erişilebilirliği

STEP-DWCF-R sistemini yeniden üretmek için gereken tüm kodlar, istemler, JSON şemaları ve örnek uygulama dosyaları https://github.com/YifangGaoinPG/Dynamic-Writing-Correction-Feedback'de açıkça erişilebilir.

Sonuçlar

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Deneyler ve Analizler

Tüm 32 öğrenci temel veri sağladı. Her grupta 16 öğrenci için sınav sonrası veriler mevcuttu (WCF ve STEP-DWCF-R; Şekil 2). Çalışma zaman çizelgesi ve ölçümleri Şekil 3'te sunulmakta, uçtan uca geri bildirim iş akışı ise Şekil 4'te gösterilmiştir. Yapay zeka sistemimiz için deneysel kurulum ve uygulama parametreleri Tablo 1'de gösterilmiştir. Analizler, önceden belirlenmiş planı tedavi etme niyetiyle takip etti. İlk olarak başlangıç eşdeğerliğini değerlendiriyoruz (Tablo 2), ardından birincil sonucu (Şekil 5 ve Tablo 3) raporluyoruz, ardından ikincil sonuçları (Tablo 4) sağlamlık ve güvenilirlik kontrolleri ile raporluyoruz.

Temel Eşdeğerlik

Başlangıçta (1. Hafta), gruplar önceden belirlenmiş kovaryatlar üzerinde tanımlayıcı olarak benzerdi; demografik ve IELTS yazım performansı dahil olmak üzere, herhangi bir geri bildirimden önce (Tablo 2). Bireysel IELTS bileşen puanları 0.5 bant adımlarıyla verilirken, tablo grup ortalamalarını bildirir. 1. Hafta genel ortalamaları (WCF = 5.625, STEP-DWCF-R = 5.500) Şekil 5'i oluşturmak için kullanılan aynı dizilerden hesaplanır. Hipotez testlerini başlangıçta yapmayız; herhangi bir kalıntı dengesizlik karışık etkiler modelinde pre-post tasarım ve Grup × Zaman terimi ile ele alınır ve Protokol bölümünde temel değere göre ayarlanmış test sonrası karşılaştırma rapor edilir.

Birincil Sonuç

Şekil 5 , post-post öncesi değişiklikleri özetlerken, Tablo 3 ve Tablo 5 model tahminlerini ve sınav sonrası başarıyı raporlar. Başlangıçta (1. hafta) grup ortalamaları WCF için 5.625 ve STEP-DWCF-R için 5.500 idi; bu da −0.125 bantlık anlamsız grup farkı (SE = 0.133, t = − .939, df = 29.90, p = .355, %95 CI [−0.397, 0.147]) oldu. Bu nedenle , Tablo 3'teki temel çizgi WCF 1. hafta ortalamasını %95 CI ile 5.625 olarak tahmin ediyor [5.419, 5.831] (SE = 0.097, df = 15). 1. haftadan 8. haftaya kadar WCF 0,3125 bant arttı (SE = 0,128, t = 2,44, df = 15, p = 0,028, %95 GA [0,039, 0,586]; standart grup içi etki dz = 0,61). STEP-DWCF-R 1.0313 bant (SE = 0.140, t = 7.34, df = 15, p = 2.44 × 10−6, %95 CI [0.732, 1.331]; dz = 1.84) gelişti. Grup × Zaman etkileşimi için doğrusal karışık etkiler kontrastı—yani farklar arasındaki fark—0.7188 banddı (SE = 0.190, t = 3.78, df = 29.75, p = .0007, %95 GA [0.330, 1.107]; Tablo 3), STEP-DWCF-R altında daha büyük kazançları göstermektedir. Test sonrası (8. hafta) tahmini marjinal ortalamalar STEP-DWCF-R'yi 0,5938 bant lehine tutuyordu (Welch testi grup ortalamaları üzerine: SE = 0,115, t = 5,16, df = 29,74, p = 1,50 × 10−5, %95 GA [0,359, 0,829]). Bununla tutarlı olarak, başarı tablosu (Tablo 5) 8. haftada WCF öğrenenlerinin %13'ünün Genel ≥ 6.5'e ulaştığını, %0'ının ise 7.0'≥ (16/2 ve 0/16 sayımları) ulaştığını, STEP-DWCF-R öğrenenlerin %81'inin ise 6.5≥ ve %25'inin ≥ 7.0'a ulaştığını (16/13 ve 16/4/sayımlar) göstermektedir. Tablo 3, ilgili sabit etkili tahminleri ve bunların belirsizliğini gösterir.

Boyut Düzeyi Sonuçları

Tablo 4, dört Görev 2 boyutu boyunca post-post öncesi değişiklikleri özetlemektedir. Görev Yanıtı (TR), WCF altında Δ = 0.25 bant, STEP-DWCF-R altında Δ = 0.95 kazanç gösterdi; ΔΔ = 0.70 ile %95 GA [0.28, 1.12] ve Holm ile ayarlanmış p = .006 oldu. Koherens ve Kohezyon (CC) en büyük kontrastı gösterdi: WCF Δ = 0.30, STEP-DWCF-R Δ = 1.15, dolayısıyla ΔΔ = 0.85 (%95 CI [0.44, 1.26], adj-p = .002). Lexical Resource (LR) de aynı deseni takip etti; WCF Δ = 0.35 ve STEP-DWCF-R Δ = 0.95 ile ΔΔ = 0.60 (%95 CI [0.18, 1.02], adj-p = .012) elde etti. Dilbilgisel Menzil ve Doğruluk (GRA) WCF'de Δ = 0.25 ve STEP-DWCF-R'de Δ = 0.97 ile iyileştirildi; ortaya çıkan ΔΔ = 0.72, %95 GA [0.31, 1.13] ve adj-p = .004 olarak taşıdı. Dört boyutun tamamında, Grup×Zaman karşılaştırmaları Holm–Bonferroni ayarlamasından sonra STEP-DWCF-R'yi tercih etti.

Süreç Kanıtı

Şekil 6 ve Şekil 7 , temel süreç sonuçlarını görselleştirir. 2–7. haftalar boyunca, STEP-DWCF-R ortalama olarak görev başına 2,26 revizyon turu tamamladı (%95 GA [2,17, 2,35]; n = 96), oysa WCF tüm görevler için 1,00 tur (n = 96) oldu. Ortalama fark 1,26 mermi (%95 GA [1,17, 1,35]); bir Mann–Whitney testi dağılımların ayrılmasını doğruladı (U = 9216, z = 11.97, p < 10−30). STEP-DWCF-R dahilinde ortalama hata sayıları tur bazında azaldı: 1. Turda 13.78 (%95 GA [13.02, 14.54]; n = 96), 2. Turda 8.94 (%95 GA [8.42, 9.46]; n = 96), ve 3. Turda 6.16 (%95 GA [5.20, 7.12]; n = 25). Tur başına yapılan gözlemlere uyan doğrusal bir eğilim, tur başına 4,14 hata azalma tahmin etti (mutlak büyüklükte %95 CI [3,51, 4,78]; p < 10−12). Geri besleme alımı ve görev süresi ölçümleri Şekil 6 ve Şekil 7'de kodlanmamış ve bu nedenle Tablo 7'de raporlanmıştır.

Güvenilirlik ve Dayanıklılık

1. ve 8. hafta denemeleri için değerlendirme aracı anlaşması iyiden mükemmele kadardı. İki eğitimli değerlendirmeci tüm senaryoları bağımsız olarak puanladı ve grup ile zamana kör oldu; Ortalama sınıf içi korelasyon katsayısı (ICC[2,2]) kullanılarak değerlendirici ortalamalar kullanılarak, güvenilirlik Genel ve dört boyut genelinde 0,86–0,93 arasında değişti ve tüm alt %95 güven sınırları 0,80'i aştı (Tablo 6). Birincil karışık etki modeli için tanısal kontroller, materyal heteroskedastisitesi olmadan yaklaşık normal kalıntılar gösterdi ve görev düzeyindeki süreç özetlerine uyan modeller neredeyse bire dağılım gösterdi. Aynı 1. Hafta/8. Hafta veri setine dayalı duyarlılık analizleri tutarlı çıkarımlar sağladı: Test sonrası grupları karşılaştıran doğrusal regresyon, başlangıç puanlarını ayarlama yaparken, 8. Haftada gruplar arası 0.575 bant olarak düzeltilmiş bir fark tahmin edildi (%95 GA [0.336, 0.814], p = 3.15 × 10−5), ve Değerlendirici için rastgele etki içeren ve ortalamasız skorlar kullanan bir değerlendirme özelliği karma model, Grup × Zaman tahmini olarak 0.72 bant (%95 GA [0.33, 1.11], p = .0007), Tablo 3 ile uyumlu olarak sunulmaktadır. Sağlam standart hatalar kullanıldığında ve analizler tam vakalarla sınırlandırıldığında sonuçlar değişmedi; bu da STEP-DWCF-R'nin WCF'den daha büyük ön kazanım sağladığı sonucunu pekiştirdi.

Niteliksel Bulgular

Niteliksel analiz için, STEP-DWCF-R grubundaki 16 katılımcının tüm altı görev boyunca STEP-DWCF-R revizyon izlerini ve kurs sonu yazılı değerlendirmelerini inceledik. İki kodlayıcı, materyalleri dört geri bildirim kategorisine (dilbilgisi, kelime dağarcığı, organizasyon, akıl yürütme) ve alım gerekçelerine dayalı odaklanmış bir tümselim çerçeve kullanarak bağımsız olarak kodladı. Kodlayıcılar arası anlaşma Cohen'in 0.78 kappa'sıyla önemli bir anlaşma sağladı ve anlaşmazlıklar tartışma yoluyla çözüldü.

Analiz beş ana temayı ortaya koydu: öğrenme, aşamalı bir deseni takip etti; öğrenciler organizasyon ve akıl yürütmeden önce yüzeysel özellikleri çözdü; Aralık özel, rubriklerle bağlantılı maddeler, anlatı önerilerinden daha uygulanabilir ve sıkça benimsenmişti; yapay zeka ve öğretmen tamamlayıcılığı önceliği şekillendirdi; örtüşen sinyaller odaklanmayı artırdı ve öğretmen moderasyonu çatışmaları çözdü; avantajlar erken zirveye ulaştı; organizasyon şablonlarının yeniden kullanımı ve yeni promptlarda belirtilen sözcük kalıpları; ve öğrenenler görevler arasında stratejileri uyarladı. Bu temalar, süreç kanıtı bölümünde incelenen süreç dinamiklerini şekillendirir. Geri bildirim alımı, kalıcı hatalar ve görev süresi ölçümleri de kaydedildi. Bu ek süreç göstergelerinin özeti Tablo 7'de sunulmaktadır.

Temsilci Sonuçların Yorumlanması

Sonuç ve süreç verileri bir arada ele alındığında, STEP-DWCF-R çerçevesinin geleneksel tek turlu geri bildirime kıyasla daha fazla IELTS yazım iyileştirmesi ile ilişkili olduğunu göstermektedir. Birincil sonuç, gruplar arası farklar arasında 0,72 bant farkı göstermekte; STEP-DWCF-R grubu genel olarak 1,03 bant oranında iyileşti, WCF grubundaki 0,31 bant ile karşılaştırıldığında. Bu avantaj, dört analitik boyutta tutarlıydı; en büyük kontrast Koherens ve Kohezyonda 0.85 banttı; bu da yapılandırılmış, rubrik bağlantılı, çok aşamalı geri bildirimin özellikle organizasyonel gelişimi desteklediğini gösteriyordu. Süreç kanıtları, bu avantajın temelinde yinelemeli etkileşimin yer aldığını daha da göstermektedir. STEP-DWCF-R öğrencileri görev başına ortalama 2,26 revizyon turu tamamladı ve hata sayısı tur başına yaklaşık 4,1 hata doğrusal olarak azaldı. Örneğin, temsilli bir iş akışı döngüsü, GPT-5'in dört kategoride yapılandırılmış JSON geri bildirimi üretmesini, ardından öğretmenlerin yanlış pozitifleri ortadan kaldırarak eyleme uygunluğunu artırmasını ve ardından robotik yapay zeka ajan arayüzü üzerinden çoklu aşamalı öğrenici revizyonu sunmasını içeriyordu. Bu bulgular, yapay zeka tarafından oluşturulan geri bildirim, öğretmen moderasyonu ve yinelemeli robotik yapay zeka ajanı teslimatını birleştiren entegre çok bileşenli iş akışının fizibilitesini ve potansiyel etkinliğini destekliyor, ancak tek bir bileşenin izole kanıtı olarak yorumlanmamalıdır. 2–3 tur ile bir tur arasındaki doz dengesizliği ve 32'lik mütevazı örneklem büyüklüğü, gözlemlenen kazanımların artan revizyon fırsatları ve yapılandırılmış geri bildirimin birleşik etkisini yansıttığını gösterir. Bu sonuçlar, daha büyük, bileşen kontrollü denemelerde onay bekleyen umut verici pilot kanıtlar olarak görülmelidir.

figure-results-1
Şekil 1. DWCF'nin teorik çerçevesi (dinamik yazılı düzeltici geri bildirim). Bu rakam, DWCF'nin nasıl çalışabileceğine dair daha geniş bir gerekçe sunar; bu çalışmanın doğrudan modeli olarak değil, yönlendirme amacıyla dahil edilmiştir. Burada analiz edilen sonuçlar ve süreç metriklerine karşılık gelen unsurlar şekilde belirtilmiştir; diğer yollar örnekleyicidir ve değerlendirilmemiştir. Bu figürün daha büyük bir versiyonunu görmek için lütfen buraya tıklayın.

figure-results-2
Şekil 2. Katılımcıların CONSORT akış diyagramı. Otuz iki öğrenci uygunluk açısından değerlendirildi; hiçbiri hariç tutulmamıştı. Tüm katılımcılar onay verdi ve ardından WCF grubuna (n = 16) veya DWCF grubuna (n = 16) 1:1 oranında randomize edildi. Tüm rastgele katılımcılar tahsis edilen müdahaleyi aldı; Takip veya üretimin durdurulması için kayıp olmadı ve 32'sinin tamamı nihai analizde yer aldı. Bu figürün daha büyük bir versiyonunu görmek için lütfen buraya tıklayın.

figure-results-3
Şekil 3. Çalışma zaman çizelgesi ve ölçümleri. Deneme 8 hafta sürdü: W1 aşamasında katılımcılar IELTS Görev 2'yi tamamladı ve puanlandı; W2'den W7'ye (Görev 1–Görev 6) haftada altı yazma görevi verildi, gruba özgü geri bildirim (WCF veya DWCF) ve her görevden sonra revizyonlar yapıldı. W2–W7 boyunca her görev için revizyon turları, geri bildirim alımı, kalıcı hata oranı ve görev süresi gibi süreç ölçümleri kaydedildi. W8'de sınav sonrası IELTS Görev 2 uygulandı ve puanlandı. Bu figürün daha büyük bir versiyonunu görmek için lütfen buraya tıklayın.

figure-results-4
Şekil 4. Uçtan uca geri bildirim iş akışı. Öğrenciler proktorlu bir ilk taslak oluşturur, ardından gruba özgü geri bildirim alır: WCF (bir insan geri bildirim turu) veya STEP-DWCF-R (yapay zeka tarafından oluşturulan geri bildirim, öğretmen moderasyonu ile robotik yapay zeka ajanları aracılığıyla sağlanır, 2–3 yinelemeli tur). Öğrenciler buna göre revizyon tur(lar)ını tamamlar. Sonuç IELTS Görev 2 bant puanıdır; Süreç ölçütleri arasında tur sayısı, geri bildirim alımı (kabul edilen/değiştirilen/reddedilen), kalıcı hata oranı ve görev süresi yer alır. Sistem, eşya seviyesi kimlikleri, kategori/sersit, kaynak (yapay zeka vs. insan vs. robot), moderasyon eylemleri ve alım durumunu kaydediyor. Bu figürün daha büyük bir versiyonunu görmek için lütfen buraya tıklayın.

figure-results-5
Şekil 5. IELTS genel bandındaki 1. Haftadan 8. Haftaya Grup Göre Değişim. Puanlar, %95 güven aralıklarıyla tahmini grup ortalamalarını verir, yörüngeler ise STEP-DWCF-R altında daha büyük bir kazanç gösterir. Bu şekilin daha büyük bir versiyonunu görmek için lütfen buraya tıklayın.

figure-results-6
Şekil 6. Gruplara göre görev başına revizyon turları (2–7. haftalar). Veri noktaları, WCF (mavi) ve STEP-DWCF-R (turuncu) grupları için bireysel görev revizyon turlarını temsil eder. Yatay çizgiler ve hata çubukları, %95 güven aralıklarıyla grup ortalamalarını gösterir. Bu figürün daha büyük bir versiyonunu görmek için lütfen buraya tıklayın.

figure-results-7
Şekil 7. STEP-DWCF-R içinde ortalama hata sayımı, %95 CI ile tur başına sayılır. Puanlar, her geri bildirim turunda (1. Tur, 2. Tur, 3. Tur) ortalama hata sayılarını gösterirken, dikey çizgiler %95 güven aralıklarını (CI) temsil eder. Bu figürün daha büyük bir versiyonunu görmek için lütfen buraya tıklayın.

BileşenTeknik özellikler
Donanım12. Nesil Intel(R) Core(TM) i7-12700H (2.30 GHz), 32GB RAM, NVIDIA RTX 3080Ti GPU (16GB) ile PC
İşletim SistemiWindows 11
Arka planFlask~2.1 (Python~3.10)
Ön uçJinja2 sunucu tarafından render edilen şablonlar
Yapay Zeka ModelleriOpenAI GPT-5 API (geri besleme üretimi için), şema tabanlı post işleme
Geri Bildirim ZamanlayıcısıÇok aşamalı geri bildirimi yöneten özel kontrolcü (3 döngü)
Hata ŞemasıDilbilgisi, Kelime Dağarcığı, Organizasyon, Akıl Yürütme
Sürüm KontrolüGitHub
Kütük KesimGönderilerin, geri bildirimlerin ve analiz için revizyonların otomatik kaydı

Tablo 1: Deneysel kurulum ve uygulama parametreleri. Donanım yapılandırması, işletim sistemi, arka uç ve ön uç çerçeveleri, yapay zeka model ayarları, geri bildirim zamanlayıcısı, hata şeması kategorileri, sürüm kontrolü ve günlük altyapısı gibi yapay zeka geri bildirim sisteminin teknik özellikleri.

DeğişkenWCF (n=16)STEP-DWCF-R (n=16)
Yaş (yıl), ortalama (SD)20.9 (1.5)21.1 (1.6)
Kadın, n (%)9 (56%)8 (50%)
Önceden IELTS hazırlıkları (evet), n (%)7 (44%)6 (38%)
Önceki yazma eğitimi yılları3.1 (1.2)3.2 (1.1)
Temel IELTS Genel (grup)5.625 (0.387)5.500 (0.365)
Baseline TR (grup)5.56 (0.50)5.50 (0.50)
Baseline CC (grup)5.62 (0.49)5.53 (0.49)
Baseline LR (grup)5.60 (0.46)5.52 (0.46)
Baseline GRA (grup)5.56 (0.48)5.49 (0.45)

Tablo 2: Katılımcıların gruplara göre temel özellikleri (1. Hafta). Demografik değişkenler ve WCF ile STEP-DWCF-R grupları için Uluslararası İngilizce Dil Test Sistemi (IELTS) Görev 2 yazma performansı ön-test ve inceleme çalışması. Değerler ortalama (standart sapma) veya n (%)-dir.

Sabit etkiTahminSEDFtp%95 CI
Intercept (WCF, Hafta~1)5.6250.0971558.1<.001[5.419, 5.831]
Grup (STEP-DWCF-R vs. WCF)-0.1250.13329.9-0.939.355[-0.397, 0.147]
Zaman (Hafta~8 vs. Hafta~1)0.31250.128152.44.028[0.039, 0.586]
Grup × Zamanı0.71880.1929.753.78.0007[0.330, 1.107]

Tablo 3: 1. Hafta/8. Hafta puanlarından IELTS genel bant için doğrusal karışık etki modeli. Sabit etki tahminleri, standart hatalar (SE), özgürlük dereceleri (df), t-değerleri, p-değerleri ve Grup × Zaman etkileşimi ve model terimleri için %95 güven aralıkları (CI'ler).

BoyutWCF Δ (gruplar)STEP-DWCF-R Δ (bantlar)ΔΔ (95% CI)Sıfat-P
Görev Yanıtı (TR)0.250.950.70 (0.28, 1.12).006
Tutarlılık ve Bütünlük (CC)0.31.150.85 (0.44, 1.26).002
Sözlük Kaynağı (LR)0.350.950.60 (0.18, 1.02).012
Dilbilgisel Aralık ve Doğruluk (GRA)0.250.970.72 (0.31, 1.13).004

Tablo 4: Boyut düzeyinde sonuçlar (Görev 2): ön post değişiklikleri ve gruplar arası farklar. Görev Yanıtı (TR), Tutarlılık ve Uyum (CC), Sözcük Kaynak (LR) ve Dilbilgisel Aralık ve Doğruluk (GRA) için Holm ayarlanmış p-değerleri ile pre-post değişiklikleri (Δ) ve fark farkı (ΔΔ) ile %95 güven aralıkları (CI) ile sağlandı.

EşikWCF (%)STEP-DWCF-R (%)
Genel ≥ 6.51381
Genel ≥ 7.0025

Tablo 5: Test sonrası bant başarısı (8. Hafta). WCF ve STEP-DWCF-R gruplarındaki öğrencilerin IELTS Genel bant puan eşiklerine en az 6.5 ve en az 7.0 ulaşma oranı.

SonuçICC%95 CI
Genel Olarak0.91[0.86, 0.94]
Görev Yanıtı (TR)0.88[0.82, 0.92]
Tutarlılık ve Bütünlük (CC)0.9[0.85, 0.94]
Sözlük Kaynağı (LR)0.89[0.83, 0.93]
Dilbilgisel Aralık ve Doğruluk (GRA)0.87[0.80, 0.91]

Tablo 6: IELTS sonuçları için dereceleyiciler arası güvenilirlik. İki kör dereceleyici N = 64 deneme (1. ve 8. Hafta toplamında). Ortalama sınıf içi korelasyon katsayılarını (ICC[2,2]) ölçüyor; genel ve boyut puanları için %95 güven aralıkları (CI) içerir.

ÖlçüWCF GrubuSTEP-DWCF-R Grubu
Görev başına revizyon turları12.26
Geri bildirim alım oranı (benimsenmiş veya değiştirilmiş, %)68.582.3
Son turdan sonra kalıcı hata oranı (%)67.445.6
Öğretmenin moderasyon süresi (görev başına en az süre)23.513.8
AI ajanı teslimat süresi (görev başına en az tutar)3.9
Öğrenci revizyon süresi (görev başına en az süre)44.871.2
Toplam geri bildirim süresi + revizyon (minimum/görev)68.388.9

Tablo 7: 96 görev boyunca ortalamalar (6 görev × 16 öğrenen). Alım ve kalıcı hata oranları geri besleme noktası seviyesinde hesaplandı. Zaman ölçümleri öğretmen kayıtları ve sistem zaman damgaları aracılığıyla kaydedildi. WCF grubu için yapay zeka ajanı teslimat süresi geçerli değildir.

Tartışma

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Bu çalışma, çok bileşenli dinamik yazılı düzeltici geri bildirim çerçevesi olan STEP-DWCF-R'yi, robotik bir yapay zeka ajanı ile sekiz haftalık bir IELTS yazma kursunda tek turlu WCF ile karşılaştırdı. STEP-DWCF-R, genel bant ve TR, CC, LR ve GRA genelinde daha büyük pre-post kazançları sağladı. STEP-DWCF-R kapsamındaki öğrenciler ayrıca daha fazla revizyon turu tamamladı ve daha hızlı hata azaltma gösterdi; modeller tur başına yaklaşık 4.1 hata azalma tahmin etti. En büyük gelişme tutarlılık ve kohezyonda (ΔΔ = 0.85) oldu; bu da yapılandırılmış, rubrikle bağlantılı geri bildirimin hem üst düzey organizasyonu hem de doğruluğu teşvik ettiğini gösterir. Bu bulgular, yinelemeli, kapsamlı geri bildirimin zamanla yazı doğruluğunu artırdığını gösteren önceki DWCF araştırmalarıylaörtüşmektedir 14,15,16,17.

STEP-DWCF-R iş akışı üç kritik adımdan oluşur. İlk olarak, yapay zeka sistemi, kısıtlı bir JSON şeması ve standart sistem isteğiyle dört kategoride (Gramer, Kelime Dağarcığı, Organizasyon, Akıl yürütme) ayrıntılı geri bildirim üretir. İkinci olarak, öğretmen çıktıyı moderatörlük ederek yanlış pozitifleri kaldırır, IELTS kritiğine uygun eksik kritik sorunları ekler, uygulanabilir ve teşvik edici ifadeler sağlar ve dört kategorili şemaya uyum sağlar. Bu moderasyon adımı, öğrencileri bunaltabilecek yapay zeka halüsinasyonlarını veya aşırı işaretlemeleri düzelten birincil sorun giderme mekanizması olarak hizmet eder. Özellikle, STEP-DWCF-R'de görev başına öğretmen moderasyon süresi WCF'ye göre daha düşüktü (13,8 dakika vs. 23,5 dakika), çünkü yapay zeka başlangıçta yapılandırılmış geri bildirimi üretiyor ve öğretmen sadece onu yönetiyordu. Üçüncü olarak, denetlenen geri bildirim, öğrenen teşekkürleri ve tekrar gönderimleri birden fazla turda kaydeden web tabanlı robotik yapay zeka aracı arayüzü aracılığıyla sunuluyor.

Mevcut yaklaşımlarla karşılaştırıldığında, STEP-DWCF-R belirgin sınırlamaları ele almaktadır. Geleneksel tek turlu WCF, eğitmen süresiyle sınırlı kalır ve genellikle sürekli tekrarlama için sınırlı fırsat sunar. Otomatik yazma değerlendirme araçları ölçeklenebilirlik sunar ancak genellikle statik, parçalı yorumlar sunar ve öğrenciler bunları anlamlı revizyonlara çevirmektezorlanır 20,21,22. Erken DWCF çalışmaları çoklu turlu geri bildirim döngülerinin etkinliğini gösterdi, ancak eğitmen tarafından yazılmış düzeltmelere dayanmaları büyüksınıflarda fizibilite endişelerini artırdı 14,15,16,17. Son zamanlarda yapılan üretken yapay zeka geri bildirim çalışmaları, öğretmenlerin yazma sonuçları üzerindeki geri bildirimiyle eşitlik sağladığını bildiriyor, ancak yapılandırılmış moderasyon veya yinelemesunumu yok 18,19. STEP-DWCF-R, yapay zeka ölçeklenebilirliğini öğretmen denetimi ve yinelemeli robotik yapay zeka ajanı sunumuyla birleştirerek öğretmen iş yükünü azaltırken revizyon sıklığını artırır.

Bazı sınırlamaları kabul ediyoruz. Görece küçük örneklem büyüklüğü (N = 32), bulgularımızın genellenebilirliğini sınırlıyor ve çalışma pilot bir araştırma olarak değerlendirilmelidir. İki koşul geri besleme dozunda farklıydı: WCF grubu görev başına yalnızca bir tur geri bildirim alırken, STEP-DWCF-R grubu 2–3 yineleme turundan geçti. Bu nedenle, STEP-DWCF-R grubunun üstün performansı, robotik yapay zeka ajanının veya sunum modalitesinin izole etkisi yerine, çoklu revizyon döngülerinin, yapay zeka tarafından oluşturulan geri bildirimin ve öğretmen moderasyonunun birleşik etkilerini yansıtır. Robotik yapay zeka ajanı tamamen sanal web tabanlı bir arayüzdür, bu yüzden etkileri yinelemeli yapının kendisinden ayrılamaz. Multimodal insan geri bildirimi (örneğin, konuşma ve jest) kontrol koşulu olarak dahil edilmedi çünkü geleneksel EFL yazı sınıflarında standart uygulama değildir ve ayrı bir deneysel paradigma gerektirir. Gelecekteki çalışmalar, bu bileşenleri daha da ayrıştırmak için dozajla eşleştirilmiş kontrol gruplarını (örneğin, çok turlu öğretmen geri bildirimi) içermelidir.

Bu sınırlamalara rağmen, STEP-DWCF-R çerçevesi yapay zeka destekli yazma eğitimi için pratik yönler sunar. Modüler mimarisi, büyük ölçekli EFL dersleri için öğrenme yönetim sistemlerine entegrasyon imkanı sağlar ve yapılandırılmış dört kategorili şeması akademik yazı veya disiplinlere özgü türler için uyarlanabilir. Gelecekteki iterasyonlar, bedenlenmiş ajanların teorik katılım faydalarından yararlanmak için çoklu modal sunumu inceleyebilir, ancak mevcut pilot proje, metin tabanlı yinelemeli yapay zeka-öğretmen iş birliğinin uygulanabilirliğini ortaya koyuyor. Buna rağmen, sonuç ölçütleri, süreç göstergeleri ve güçlü derecelendirmeler arası güvenilirlik arasındaki tutarlı desen, benzer EFL bağlamlarında bu çok bileşenli yaklaşımın uygulanabilirliğini ve potansiyel etkinliğini destekler.

Açıklamalar

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Yazarların rekabet eden çıkarları yoktur.

Teşekkürler

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Bu çalışma, Universiti Sains Malaysia Köprü Hibesi tarafından finanse edilmiştir, Proje No: R501-LR-RND003-0000001342-00000.

Malzemeler

Bu makalede kullanılan malzemelerin listesi
AdŞirketKatalog numarasıYorumlar
Flask (Web Framework)Pallets Projectshttps://flask.palletsprojects.comRobotik AI ajan web arayüzü için kullanılan Sürüm 2.1
GPT-5 APIOpenAIhttps://platform.openai.comYapılandırılmış JSON geri bildirim oluşturma için gpt-5 modeli, sıcaklık=0.7
Jinja2Pallets Projectshttps://jinja.palletsprojects.comWeb arayüzü için sunucu tarafından oluşturulan şablonlar
PythonPython Software Foundationhttps://www.python.orgArka uç komut dosyası için Sürüm 3.10
Windows 11Microsofthttps://www.microsoft.com/windowsAI geri bildirim sistemi için işletim sistemi

Yeniden basım ve izinler

Bu JoVE makalesinin metnini veya şekillerini yeniden kullanmak için izin iste

İzin iste

Etiketler

EngineeringEnglish writingwritten corrective feedback WCFdynamic written corrective feedback DWCFhuman AI collaborationfeedback uptakemixed effects models

İlgili makaleler