$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
Eğitim ve dijital teknolojilerin yoğun küreselleşmesi, İngilizce yazım düzeyinin dil öğretimi, akademik gelişim ve kariyer ilerlemesi için bilimsel ve güvenilir şekilde değerlendirilmesi ihtiyacınıartırmıştır 1. İnsan değerlendirmesi tarafından uygulanan geleneksel yazım değerlendirmeleri, yazının öznel yönlerini, örneğin tartışmanın titizliği ve kültüreluygunluk gibi faktörleri ölçebilir 2, ancak uzun geri dönüş sürelerine, yüksek iş masraflarına ve değerlendirici deneyimi ile eğilimlerinden kaynaklanan önyargıya karşıhassastır 3,4. Bu kısıtlamalar, uluslararası dil testleri (IELTS, TOEFL) veya üniversitelerde verilen diğer İngilizce derslerinde özellikle ciddi görülür; burada anlık geri bildirim ve kapsam açısından yeterli olan sadece manuel puanlamayeterli değildir 5.
AWE sistemleri, gerçek zamanlı işleme, standartlaştırma ve ölçeklenebilirlik sayesinde bu bağlamda yaygın olarakkullanılmıştır 6. Grammarly (dilbilgisi hataları ve stil iyileştirmesine odaklanan) ve ETS Kriterleri (resmi yazım normlarına bağlı kalan) gibi popüler araçlar şu anda K-12 eğitimi, dil okulları, yükseköğretim ve bireysel eğitimde milyonlarca öğrencitarafından kullanılmaktadır. Bunlar faydalar olsa da, AWE sistemlerinin teknolojik verimliliği ve eğitim uygulanabilirliği hâlâtartışmalıdır 8. Teknik olarak, mevcut sistemler hata tespiti ve sözcük çeşitliliği dahil nesnel boyutlarda son derece doğrudur; burada insan puanlama ile korelasyon 0.859'un üzerinde olabilir. Ancak, içerik alakası, mantıksal argümanlama ve metnin organizasyonu gibi daha öznel alanlarda korelasyonlar genellikle 0.7010'un altına düşer. Böyle bir orantısızlık, öğrenciler arasında yüzeysel doğruluğu teşvik etme tehlikesini taşır ve bunun bedeli yazı yetkinliğinin genel kaybınagelir.
Eşitlik meselesi ayrıca AWE'nin eğitim faydasını da sınırlar. Mevcut çalışmalar ayrıca doğruluğun toplam göstergelerine odaklanmaya eğilimlidir ve bazı grup12'yi sistematik olarak dezavantajlı olarak olumsuz etkileyen sapmalar olasılığını göz ardı etmektedir. Gösterge olarak, Çince veya İspanyolca öğrenenlerin ortak dillerarası özellikleri hata olarak yanılıyor ve bu da sistematik olarak hafife alınmaya yolaçacaktır 13,14. Ayrıca, öğrenenlerin yapay zeka geri bildiriminin öznel kabulü genellikle çok azbilinmektedir 15. Anketler, ana dili olmayan öğrenenlerin neredeyse üçte birinin yapay zeka puanları ile gerçek performans arasında uygunsuzluk olduğunu bildirdiğini, teknik doğruluk, grup eşitliği ve öğrenen memnuniyeti süreçlerinin hâlâ yeterince anlaşılmadığınıgösteriyor 16.
Bu zayıflıklar, klasik doğruluk paradigmasınıneksikliklerini yansıtır. 17. Yalnızca yapay zeka ile insan puanlaması arasındaki uyumu dikkate alan bir çerçeve, eşitlik veya öğrenenin sisteme olan güvenini yakalayamaz. Pratikte, AWE'nin eğitim değeri aynı anda üç koşulu karşılamalıdır: teknik hassasiyet, gruplar arasında adalet ve öğrencikabulü 18. Böylesine kapsamlı doğrulama yaklaşımının olmaması, AWE sistemlerinin yaygın olarak benimsenmesini ancak eğitim uygulamalarına sınırlı güveni neden olduğunuaçıklamaya yardımcı olur 19,20.
Bu zorluğu ele almak için mevcut çalışma, teknik doğruluğu, grup ve bireysel adaleti ile öğrenci algısını tutarlı bir yapıya entegre eden çok katmanlı bir doğrulama çerçevesi sunmaktadır. Önerilen XAI çerçevesi, öğretmenlere ve öğrencilere adalet tanıları ve şeffaf puan açıklamaları sunarak mevcut AWE platformlarında pratik uygulanacak şekilde tasarlanmıştır ve yazı kurslarında veya sınav hazırlık derslerinde gerçek değerlendirme ortamlarında adalet, yorumlanabilirlik ve öğretim faydasını artırma yeteneğini değerlendirebilir.
Bu bağlamda, hipotez, algılanan adaletin doğruluk ve tatmin arasındaki ilişkiyi belirlemede aracı rolünü ve dil yeterliliğinin adalet hassasiyeti üzerindeki moderatör rolünü araştırmak için bir AFMM'dir. Bu nedenle, hem teorik olarak, adaleti doğruluk ve algı ile birlikte ana doğrulama boyutlarından biri olarak tanımlayarak AWE'nin değerlendirme modellerini zenginleştirir ve pratikte geliştiricilere adaleti en üst düzeye çıkaran stratejiler sunarak, eğitimcilere grup duyarlı sistem seçim kriterleri sunar ve AWE'nin eğitim değerini öğrenenlerin algılarının nasıl şekillendiğini açıklayarak iki açıdan katkı sağlar. Eğitimin yanı sıra, çerçeve XAI'nin daha geniş kavramıyla da uyumlu olup, adalet ve kullanıcı algısının sağlık, otonom sistemler ve siber güvenlik gibi diğer alanlarda şeffaflık, güven ve kabulü nasıl artırabileceğini gösteriyor.
Araştırma Soruları:
1.To AWE sistemi, farklı ana dil ve yeterlilik grupları arasında teknik doğruluk ve adalet ne ölçüde gösteriyor?
2.XAI tabanlı çok katmanlı değerlendirme çerçevesi, otomatik İngilizce yazı değerlendirmesinde şeffaflık ve eşitliği nasıl artırabilir?
LITERATÜR INCELEMESI:
Üniversite öğrencileri tarafından AWE geri bildiriminin kabulünü etkileyen faktörler, genişletilmiş Teknoloji Kabulü Modeli (TAM)21 kullanılarak incelendi. SEM kullanan 448 Çinli öğrencinin anket verilerine dayanarak, faydalılık, kullanım kolaylığı ve niyetin öznel norm, güven, öz-etkinlik, bilişsel geri bildirim ve sistem özellikleri üzerinde önemli bir etkisi olduğu belirlendi. Ancak, çalışma tek bir ulus ve tek bir öğrenci grubuyla sınırlıydı, bu da genellemenin uygulanabilirliğini sınırlamaktadır. Çinli EFL öğrencilerinin Pigai AWEgeri bildirimi 22'ye nasıl yanıt verdiğini incelemek için, üniversite öğrencilerinden gelen tekrarlayan gönderimleri (n = 5) analiz edildi. Hata düzeltmesine erken dönemde vurgu yapıldığı, dilsel geri bildirimin düşük alındığı ve yanıtın kademeli derinleştiği belirtildi. Ancak, örneklem büyüklüğü çok sınırlıydı, uygulanabilirlik ve genellenebilirliği sınırlayan AWE sistemi de öyle. EFL öğretmenlerinin yapay zeka derecelendirme aracının (CoGrader) uygulanmasına dair inançları, görüşlerini etkileyen faktörleri belirlemek içinincelendi 23. 10 Suudi üniversite öğretmeni üzerinde yapılan karma yöntemli bir çalışma ve röportaj, karışık olumlu görüşler olduğunu, ancak güvenilirlik ve tam öğretmen değişimi konusunda tamamen emin olma isteksizliğinin olduğunu ortaya koydu. Bu, sınırlı örneklem ve tek ülke ortamı nedeniyle genellemeyi engeller.
Korpus dilbilimi ve yapay zeka teknolojisindeki gelişmeleri göz önünde bulundurarak, bir çalışma AESçerçeveleri 24'ü inceledi. PCA'yı kullanarak yazı kalitesini değerlendirmek için dilsel göstergeleri geliştirdi ve mikro özellikleri toplu özelliklerle birleştirmenin, yalnızca toplu özelliklerden daha etkili bir şekilde yazma kalitesini tanımladığını keşfetti. Rastgele Orman Regresyonuna dayalı doğrusal olmayan AES yaklaşımı diğer yaklaşımları geride bıraktı. Ayrıca, SHAP her değerlendirilen özellik için temel dil öğelerini belirledi ve açıklanabilir yapay zeka aracılığıyla sistem şeffaflığını artırdı. Bu sonuçlar, yazı değerlendirmesi ve eğitiminde çok boyutlu yöntemlerin geliştirilmesine yardımcı olabilir. İnsan-makine iş birliği sistemi, Arapça yazıların notlanması zorluklarını çözmek için tanıtıldı; çünkü bu yazılar genellikle pahalı ve zaman alıcıdır. Bu yöntem, LLM'in yardımıyla edebiyatın yedi özelliğine dayanan makaleleri ele alır. Doğrulama süreçleri ve yönlendirme taktikleri, tutarlılık ve doğruluk sağlamak için kişiselleştirildi. İşbirliği, etiketlenmiş kaynakların daha yüksek bir arzını sağlar ve değerlendirme kalitesini etkilemez; bu da düşük kaynaklı diller için uygun ölçeklenebilir bir veri açıklama yöntemi olduğunu gösterir.
Eğitim alanında yapay zekanın kullanımı, notlama gereksinimlerini önemli ölçüde azaltma ve yazma eğitimini geliştirme fırsatısunar 25,26. Aynı zamanda, araştırmacılar yapay zekanın doğruluğunun, sorumlu kullanımıyla ilgili tek unsur olmadığını vurguladı. Adalet ve önyargı azaltma, güvenlik ve gizlilik, hesap verebilirlik, açıklanabilirlik, şeffaflık, eğitim etkisi, bütünlük ve sürekli gelişim ilkeleri vardır. Son araştırmalar, GPT-4o temelinde sıfır atış puanlamalarını bu gereksinimlere odaklanarak ampirik olarak değerlendirmiştir. Araştırma, eğitimcilerin ADWT'lere yönelik eğitim bütünlüğü yönünde sahip olduğualgılara odaklandı 27. 100 lisansüstü öğrenci ve 10 konudan profesörün yer aldığı kesitsel çalışma, öğretmenlerin ADWT'lerin eğitim hedefine ulaşma faydalarını atfettiğine rağmen, sınırlı erişilebilirlik, bilgi eksikliği ve dürüstlük ile yaratıcılık üzerindeki etkisi konusunda endişe gibi bazı sınırlamalar olduğunu öne sürmektedir. Araştırma, yapay zeka teknolojileri eğitime daha entegre hale geldikçe, etik kaygılar ve paydaş katılımının başarılı ve sorumlu kullanımı için gerekli olduğunu öne sürdü. Araştırmalar, EFLöğrencileri 28 tarafından gönderilen makaleleri değerlendirmede yapay zeka teknolojilerinin insan değerlendiricilere kıyasla etkinliğini araştırdı. 30 makalenin değerlendirilmesi, yapay zekanın içerik, dil, organizasyon ve doğruluk açısından yüksek kaliteli yorumlar sunmasına rağmen, insan değerlendirme yapanlardan sürekli daha düşük puanlar verdiğini ortaya koydu. Ayrıca, yapay zeka daha kapsamlı geri bildirim sağladı, ancak çeşitli yapay zeka araçlarından alınan puanlar önemli ölçüde farklı değildi.
Araştırma Boşluğu:
Şu anda AWE burslarıyla ilgili çoğu araştırma ya doğruluk ya da kullanıcı kabulü üzerine inceleniyor. Çok az kişi, puanlama farklarının ana dil veya yeterlilik gruplarını sistematik olarak dezavantajlı olarak inceliyor. Önceki çalışmalar kullanıcı kabulünü incelemiş veya belirli bir ülke ve örneklem büyüklüğünden belirli bir AWE sistemiyle sınırlı olsa da, genellenebilirlikle ilgili sorular ortaya çıkmaktadır. Hem SHAP hem de PCA XAI stratejileri olup şeffaflığı artırmak için geliştirilmiş olsa da, hiçbir çalışma adalet mekanizmalarını veya öğrencilerin AWE'den gelen yapay zeka geri bildirimlerini nasıl kullandığını incelememiştir. Literatürde, doğruluk, adalet analizi ve öğrenici algılarının tanımlanmış boyutlarını düşünen kapsamlı çerçeveler yoktur. Dereceleyici içi ve aralı doğruluğu, adaleti ve öğrenci algılarını dikkate alan açıklanabilir bir değerlendirme modeli örneği yoktur. Bu araştırmada, çok dilli ve yeterlilik çeşitliliğindeki öğrenenler arasında doğruluk, adalet ve öğrenici algılarını aynı anda değerlendirmek için açıklanabilir bir çerçeve olan TLEF ve birleşik bir model olan AFMM önerilmiş ve doğrulanmıştır.