$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
MPFR ve duygusal bakış açılarını dikkate alan LBA yönteminin tasarımı
Öğrencilerin Çevrimiçi Öğrenme Davranışını (SOLB) analiz etmek için çok perspektifli bir değerlendirme sistemi oluşturulur ve bir MPFR modeli hazırlanır. Öğrencilerin öğrenmedeki öznel duygularını daha derin analiz etmek için, bu çalışma XGBoost algoritmasını benimser ve sınıflandırma doğruluğunu artırmak için hiperparametre optimizasyonu için IGWO algoritmasını tasarlar.
LBA için MPFR modelinin inşası
SOLB'yi analiz etmek için, bu çalışma esas olarak iki açıdan başlayarak tam bir analiz planı oluşturur. İlk olarak, öğrenme performansı açısından bu çalışma üç perspektifi ele alarak MPFR modelini oluşturmaktadır: müfredat, bireysel ve sınıf. İkinci olarak, öğrenci yorumlarının duygusal analizi açısından, bu çalışma geliştirilmiş bir XGBoost algoritması tasarlamaktadır. Öğrenme performansı ve öğrenci geri bildirim duygularının analizi sayesinde, bu çalışma SOLB'u daha iyi analiz edebilir. Öğrenme performans analizinin teknik detayları açısından, bu çalışma önce çevrimiçi bir öğrenme platformundan alınan verileri kullanır ve ön işlenir. İkinci olarak, bu çalışma farklı bakış açılarından temel öğrenme performans değerlendirme göstergelerini seçerek kapsamlı bir değerlendirme sistemi oluşturur. Sonrasında, öğrenme davranışını değerlendirmek için karşılık gelen bir MPFR modeli oluşturulur.
Bu çalışma, Superstar platformundan veri seçiyor (kaynak: https://www.chaoxing.com/). Sınıf etkinlikleri ve not değerlendirmesi gibi birden fazla boyuttan bilgi içerir ve sonraki LBA için iyi bir temel oluşturabilir. Veri alındıktan sonra, öncelikle alakasız alan silme, veri filtreleme ve veri bütünlüğü kontrolleri dahil olmak üzere ön işlenmiş olmalıdır. Örneğin, öğretmen verilerinde, dersin ait olduğu bölüm ve sayı gibi alakasız bilgiler kaldırılmalıdır. Daha sonra, bu çalışma LBA'nın özellik mühendisliğini Superstar platformunun öğrenme davranışı verilerine dayanarak inşa etmektedir. Öğrenci LBA indeksi, sonraki MPFR modeli için özellik mühendisliği temeli sağlar ve bu indeksin içeriği Şekil 1'de gösterilmiştir.

Şekil 1: Öğrenci LBA'sı için göstergeler. Şekil, öğrenci LBA'sının üç temel boyutunu (müfredat, bireysel, sınıf) ve her boyut altındaki özel değerlendirme göstergelerini netleştirerek MPFR modeline özellik desteği sağlar. Bu figürün daha büyük bir versiyonunu görmek için lütfen buraya tıklayın.
Şekil 1'de, öğrenci LBA göstergeleri esas olarak üç bakış açısı etrafında dönür: ders, bireysel ve sınıf; her boyuta net bir odaklanma ile MPFR modellerinin inşası için kesin özellik desteği sağlanır. Bunlar arasında, ders boyutu göstergeleri açısından, bu çalışma ders görevinin tamamlanma oranını, ders öğrenme süresini ve ders etkileşim sıklığını seçmektedir. Bu boyutun temel endişesi, ders görevlerinin genel tamamlanma kalitesi ve öğrenme katılımının zamanında gerçekleşmesidir. Örneğin, ders görevlerinin tamamlanma oranı, son tarih öncesi ve sonrası tamamlama oranlarındaki farkı takip etmek için kullanılır; Ders çalışmasının süresi, farklı öğrenme yoğunluğu aralıklarını ayırt etmek için kullanılır; Elbette etkileşim sıklığı, etkili etkileşimli davranışları filtrelemek için kullanılır. Kişisel düzeyde, kişisel öğrenme ilerlemesi, ödev tamamlama kalitesi ve sınav puanları değerlendirme göstergeleri olarak seçilir. Bu boyut, kişisel öğrenme ilerlemesi ile bilgi ustalığı sonuçları arasındaki uyum derecesine odaklanır. Örnekler arasında kişisel öğrenme ilerlemesini ders planlarıyla karşılaştırmak, tamamlanan ödevlerin doğruluğunu ve verimliliğini değerlendirmek ve test puanlarına göre bilgi ustalığı seviyelerini sınıflandırmak yer alır. Ayrıca, sınıf boyutu açısından seçilen göstergeler arasında sınıf ortalama puanı, sınıf etkileşim etkinliği ve sınıf öğrenme atmosferi yer alır. Bu boyut esas olarak genel öğrenme ortamının bireysel davranış üzerindeki etkisine odaklanır. Örneğin, ortalama not, gruptaki bireysel performans seviyesini belirlemek için kullanılır; sınıf etkileşimi etkinliği, kolektif katılım derecesini yansıtmak için kullanılır; Öğrenme ortamı, grup ortamının öğrenme davranışı üzerindeki itici etkisini analiz etmek için kullanılır. Öğrencilerin öğrenme davranışlarını analiz etmek için bulanık bir akıl yürütme modeli oluşturulur ve öğrenme davranışı özellikleri farklı bakış açılarından elde edilir. Bulanık akıl yürütme, belirsiz veya belirsiz bilgileri bulanık kümeler ve bulanık kurallar aracılığıyla işleyen bulanık mantık kullanılarak yapılan bir akıl yürütme yöntemidir ve güçlü esneklik ile kolay anlaşılma avantajlarınasahiptir 11,12. MPFR modellerinin temel hesaplama mekanizması olarak bulanık akıl yürütme, özellik mühendisliğinden sonra uygulanır. Bulanık akıl yürütmenin ana süreci Şekil 2'de gösterilmiştir.

Şekil 2: Bulanık akıl yürütmesinin ana akış şeması. Şekil, bulanık akıl yürütmenin temel sürecini ve dört temel adımı içerir: bulanıklaştırma, bulanık kural tabanının oluşturulması, bulanık akıl yürütme ve bulanıklaştırma, ayrıca MPFR modelinin belirsiz öğrenme davranışı verilerini işlemedeki mantığını netleştirir. Bu figürün daha büyük bir versiyonunu görmek için lütfen buraya tıklayın.
Bulanık akıl yürütme esas olarak bulanıklaştırma, Bulanık Kural Kütüphanesi (FRL) oluşturma, bulanık akıl yürütme ve bulanıklaştırmayı içerir. Bunlar arasında, bulanıklaştırma kesin giriş verilerinin bulanık kümelere dönüştürülmesini gerektirir ve üyelik fonksiyonlarının tanımlanmasını içerir. FRL, bir dizi bulanık kural içerir ve esas olarak giriş ile çıktı arasındaki ilişkiyi tanımlamak için kullanılır. Belirsiz kural tabanının oluşturulmasında, çalışma ≥ 8 yıllık öğretim deneyimine sahip üç eğitim teknolojisi doçentini davet ederek birlikte 28 kural geliştirir ve nihai kurallar "Delphi yöntemi" kullanılarak üç tur yineleme yoluyla belirlenir. Örneğin, Kural 1: Eğer ders görevinin tamamlanma oranı %30'dan azsa ve bireysel öğrenme ilerlemesi planın 2 hafta gerisindeyse → yüksek riskli durumdur. Bulanık akıl yürütme, bir FRL üzerine oluşturulan bulanık giriş verilerini çıkarma ve bulanık çıktı sonuçları elde etme sürecidir. Son olarak, bulanık çıktı sonucunu doğru bir çıktı değerine dönüştürür. Çalışma, bulanık mantık sistemlerinde yaygın olarak kullanılan ve güçlü esneklik ile yüksek hesaplama verimliliği gibi avantajlara sahip üçgen üyelik fonksiyonunu seçmektedir. A(x) μ fonksiyonunun ifadesi (1) denkleminde gösterilmiştir.
(1)
(1) denkleminde, x özel giriş değeridir. A, B ve C, bir üçgenin üç köşesidir. Bulanıklaştırma aşamasında, bu makale çıktı sonuçlarını dönüştürmek için centroid yöntemini kullanır. Centroid yöntemi, bulanık mantıkta yaygın olarak kullanılan bir bulanıklaştırma tekniğidir ve güçlü sezgisellik, basit hesaplama vekararlılık gibi avantajlara sahiptir 13. Centroid yönteminin ifadesi denklem (2)14'te gösterilmiştir.
(2)
(2) denkleminde, f* bulanıklaştırmadan sonra çıkan çıktı değeridir ve bulandırıcı kümenin merkezidir. μ(x) üyelik fonksiyonudur.
bulanık bir kümedeki tüm noktaların ağırlıklı toplamıdır.
üyelik fonksiyonunun x'in tüm olası değerleri üzerindeki integralidir. MPFR modelinde manuel olarak tanımlanmış kurallar ve üyelik fonksiyonlarının kullanılmasının rasyonelliği üç açıdan yansıtılır. İlk olarak, uzman yeterlilik garantisi: kural yapanlar üç eğitim teknolojisi doçentidir ve kuralların eğitim ve öğretim yasalarına uygun olduğundan emin olmak için "Eğitim Bakanlığı Çevrimiçi Eğitim Araştırma Merkezi"nin "Çevrimiçi Öğrenme Davranış Analisti" tarafından sertifikalandırılmıştır. İkinci olarak, verimlilik avantajı: Manuel kuralların çıkarım süresi, veri odaklı yöntemlere göre çok daha düşüktür, bu da çevrimiçi eğitim platformlarının "gerçek zamanlı çıkarım" ihtiyaçlarına daha uygun hale getirir ve büyük miktarda notlu veri gerektirmez, veri toplama maliyetleriniazaltır 15. Üçüncü olarak, çevrimiçi eğitim senaryolarında "yorumlanabilirlik" temel gereksinimine uyum sağlayarak, manuel olarak tanımlanan kurallar ve üçgen üyelik fonksiyonları (Denklem 1) öğretim senaryolarında sezgisel bilişe doğrudan karşılık gelebilir. Eğitimciler, bir öğrencinin risk altında olduğunu anlamasının nedenini anlamak için karmaşık teknik altyapıya ihtiyaç duymazlar. Nöro-bulanık sistemler gibi veri odaklı yöntemler kuralları otomatik olarak optimize edebilir. Ancak, üretilen kuralların çoğu karmaşık matematiksel ifadeler olup, eğitimcilerin yorumlaması zordur ve bu da modelin gerçek öğretim müdahalesinde kabul edilebilirliğini azaltır.
XGBoost için geliştirilmiş öğrenci yorum duygusu analiz modeli tasarımı
Tasarlanmış MPFR modeli, SOLB'u üç açıdan analiz edebilir: parkur, bireysel ve sınıf. Ancak, dışsal davranışsal veri analizinin öğrencilerin öznel duygularını ifade etmede sınırlamaları vardır. Bu nedenle, öğrencilerin öğrenme konusundaki öznel duygularını daha derin analiz etmek için, öğrenci yorum bilgisini içeren MOOC öğrenme platformlarından ek veriler toplanır ve ön işlenir. Daha sonra, XGBoost duygu sınıflandırma modelini oluşturmak için kullanılır. IGWO, sınıflandırma modelinin doğruluğunu artırmak için parametrelerini optimize etmek üzere tasarlanmıştır. XGBoost'un gelişimi, IGWO algoritması aracılığıyla parametre optimizasyonuna yansır. Veri ön işleme, model inşası ve analizinden önce kritik bir ilk adımdır. Veri ön işleme süreci Şekil 3'te gösterilmiştir.

Şekil 3: Veri ön işleme süreci. Dokuz aşamalı veri ön işleme süreci, metin temizliği, kelime segmentasyonu, durak kelime çıkarma, kök çıkarma ve duygusal kelime tanıma gibi süreçleri içerir; böylece sonraki davranış analizi ve duygusal sınıflandırma için yüksek kaliteli veri sağlanır. Bu figürün daha büyük bir versiyonunu görmek için lütfen buraya tıklayın.
Veri ön işleme adımları şöyledir: İlk adım, Chaoxing platform verilerindeki alakasız alanları kaldırmak ve geçersiz örnekleri filtrelemek için metin temizliği yapmaktır. Aynı zamanda, metin dışı alanlar ve kısa incelemeler MOOC platformundaki inceleme verilerinden kaldırılır. İkinci adım, segmentasyon işlemlerini gerçekleştirmektir. Bunlar arasında, Çince yorumlar kelime segmentasyonu işleme için Jieba'nın "kesin modu"nu kullanırken, İngilizce yorumlar işleme için NLTK kütüphanesinin kelime segmentasyon fonksiyonunu kullanır. Üçüncü adım, ''de'', ''evet'', ''in'' gibi yaygın durak kelimeleri kaldırmaktır. Bunlar arasında, Çin dur kelimeleri Harbin Teknoloji Enstitüsü'nün dur kelime listesini (https://github.com/goto456/stopwords/blob/master/hit_stopwords.txt) kullanır. Durdurma kelimeleri kelime eşleştirme ile silinir. İngilizce durak kelimeler, NLTK kütüphanesinde bulunan evrensel durak kelime listesini kullanır; bu da kelime kelime eşleştirme yoluyla silinir. Dördüncü adım, NLTK kütüphanesinin kök noktasını kullanarak metinden kökleri çıkarmak ve İngilizce verilerdeki fiilleri kök formuna geri yüklemektir. Beşinci adım, CNKI duygusal sözlüğüne dayanarak yorumlarda olumlu ve olumsuz duygusal kelimeleri tanımlamak, böylece sonraki duygusal sınıflandırma için ön-notasyon temeli sağlamaktır. Altıncı adım, özellik çıkarımı yapmaktır. Bunlar arasında, Chaoxing platformundaki yapılandırılmış veriler standartlaştırılmış, sınıflandırma göstergeleri ise ayrı ayrı kodlanmıştır. Aynı zamanda, MOOC platformunun bu yorum verileri, metin özelliklerini çıkarmak için önceden eğitilmiş bir dil modeli (Transformers'tan Çiftyönlü Kodlayıcı Temsili, BERT) yöntemini kullanır. BERT modelinin metin özellik çıkarımındaki temel avantajı, derin çift yönlü bir Transformer mimarisi aracılığıyla dinamik olarak bağlam farkında kelime vektörleri üretebilmesidir; bu da geleneksel statik kelime gömme modellerinin çözemediği belirsizliği etkili bir şekilde giderir. Yedinci adım, yorum verilerindeki dengesiz duygu kategorileri sorununu ele almaktır. Sentetik Azınlık Aşırı Örnekleme Tekniği (SMOTE) bu yöntemi işlemek için kullanılır. En yakın beş komşu örnek, sentetik azınlık sınıfı örnekleri oluşturmak için interpolasyon için seçilir; deneyin tekrarlanabilirliğini sağlamak için sabit rastgele tohum 42 olur. Sekizinci adım, veriyi nota etmek ve bölümlendirmektir. Dokuzuncu adım, süper yıldız verilerindeki eksik değerleri doldurmak ve istisnaları kaldırmaktır. Veri dengeleme işlemi yapılırken, SMOTE azınlık sınıf örnekleri arasında interpolasyon yaparak yeni bileşik örnekler oluşturur; böylece azınlık sınıf örneklerinin sayısını artırır ve veri setinin sınıf dağılımını daha dengelihale getirir 16,17. SMOTE'nin ifadesi denklem (3)'te gösterilmiştir.
Bmn = dm + rand(0,1) x (dmn - dm) (3)
(3) denkleminde, Bmn yapay olarak oluşturulmuş bir azınlık sınıfı örneğidir, dm i-ci azınlık sınıf örneğidir ve dmn d m'nin k-en yakın komşuları arasında n-ciörneklemdir. rand(0,1), 0 ile 1 arasında rastgele bir sayıdır. XGBoost, tahmin ağaçlarını yineleme olarak ekleyerek öngörü performansını artırır. Yüksek isabet, güçlü esneklik ve kullanım kolaylığı gibiavantajlara sahiptir 18,19. XGBoost kullanarak bir ağaç modeli yineleme adımları esas olarak şunları içerir: modeli başlatma, ağacın yinelemesel olarak oluşturulması, hedef fonksiyonu ve düzenleme terimi. T-ci yinelemede öngörülen çıktı
denklem (4)'te gösterilmiştir.
(4)
(4) denkleminde,
t - 1. yinelemeden sonraki model tahmin değeridir, ft(h) t-ci yinelemede eklenen ağaç modelinin tahmin fonksiyonudur ve h giriş özellik vektörüdür. XGBoost'un en aşağı düşülmesi için hedef fonksiyon (5) denkleminde gösterilmiştir.
(5)
(5) denkleminde, i örnek sayısıdır. I ve J, toplam örnek ve ağaç sayısıdır, j ise ağaç sayısıdır.
kayıp fonksiyonudur ve gi i-ci örneklemin gerçek etiketidir.
t-yinelenmesinden sonra i-nji örneklem için modelin tahmin edilen değeridir. Ω(ft) düzenlendirme terimidir ve (ft) j -th ağacının tahmin fonksiyonudur. Düzenlendirme için genel Ω(f) ifadesi denklem (6)'da gösterilmiştir.
(6)
(6) denkleminde, γ yaprak düğümlerinin miktarı için ceza katsayısı anlamına gelir; λ, yaprak düğümlerinin ağırlığı için L2 düzenleme katsayısıdır ve w yaprak düğümlerinin ağırlığıdır. Ancak, XGBoost hiperparametrelerinin seçimi performans üzerinde doğrudan ve anlamlı bir etkiye sahiptir. XGBoost'un yaygın hiperparametreleri arasında öğrenme hızı, ağacın maksimum derinliği ve düzenleme parametreleri bulunur. Potansiyel olarak büyük hiperparametre alanı nedeniyle, bu parametreleri manuel olarak ayarlamak sadece zaman alıcı olmakla kalmaz, aynı zamanda optimal parametre kombinasyonunu bulmak da zordur. Bu nedenle, bu çalışma IGWO'yu XGBoost'un hiperparametrelerini optimize etmek için tasarlamaktadır. GWO, gri kurtların sosyal hiyerarşisi ve avlanma stratejilerini simüle ederek optimal çözümler arar; daha az parametre ve güçlü uyum sağlama gibiavantajlarla 20,21. GWO'da, popülasyonun başlangıç konumu denklem (7)'de gösterildiği gibi üretilir.
(7)
(7) denkleminde, Puv, u-nuncu bireyin v-nji boyuttaki konumudur.
ve
v-ci arama uzayının üst ve alt sınırlarıdır. rand(), [0,1] arasında rastgele bir sayıdır. Ancak, GWO algoritması yavaş yakınsama hızı ve orta ve sonraki aşamalarda yerel optimumda takılma gibi sorunlarla karşılaşabilir. Bu aynı zamanda GWO'nun şu anda tüm çözüm alanını etkili bir şekilde keşfedemeyebileceği anlamına gelir ve bu da küresel optimal çözümü bulmayı zorlaştırır. Bu sorunu ele almak için, bu çalışma GWO'yu iki açıdan geliştiriyor: Çadır Kaotik Haritası (TCM) ve Doğrusal Olmayan Yakınsamaya Faktörü (NCF) tanıtımla. TCM, potansiyel optimal çözüm bölgelerinin arama sürecinde gözden kaçmamasını sağlayan ve aynıbölge 22'de tekrar yapılan aramaları önleyen basit bir kaotik haritalamadır. Bu nedenle, TCM sayesinde daha uniform ve rastgele bir başlangıç popülasyonu oluşturulabilir ve algoritmanın yerel optimumları aşma yeteneği geliştirilebilir. TCM'nin hesaplanması denklem (8)'de gösterilmiştir.
(8)
(8) denkleminde, y kontrol parametresidir. Rt ve Rt+1, t-i ve t+1-ci yinelemelerdeki sistem durum değişkenleridir. NCF z formülü denklem (9)'da gösterilmiştir.
(9)
(9) denkleminde, zmax maksimum yakınsamama faktörüdür ve tmax maksimum tekrarlama sayısıdır. Bu doğrusal olmayan azaltma yöntemi, GWO'nun erken aşamada küresel arama için büyük bir adım boyutunu korumasına olanak tanır. Aramanın orta aşamasında yakınsama hızı hızlanırken, sonraki aşamada yerel arama daha küçük adımlarla yapılır; böylece küresel ve yerel arama yetenekleri etkili bir şekilde dengelenir ve optimizasyon performansını artırır. IGWO algoritması, özellikle XGBoost duygu sınıflayıcısının hiperparametre optimizasyon aşaması için kullanılır ve ana süreci Şekil 4'te gösterilmiştir.

Şekil 4: IGWO'nun ana süreci. Şekil, IGWO'nun yürütme sürecini, çadır kaotik haritalamaya dayalı nüfus başlatma, doğrusal olmayan yakınsamama faktörlerinin konum güncellemesi ve optimal bireysel tarama dahil olmak üzere özetliyor ve XGBoost hiperparametrelerinin optimize edilmesinin mantığını netleştiriyor. Bu figürün daha büyük bir versiyonunu görmek için lütfen buraya tıklayın.
Şekil 4'te IGWO süreci şunları içerir: algoritmanın başlatılması; popülasyonu başlatmak için TCM kullanmak; her bireyin başlangıçtaki uygunluk değerini hesaplamak; NCF kullanarak gri kurt pozisyonlarını güncellemek; yeni optimal birey olarak en iyi uygunluklu çözümü seçmek; ve en iyi bireyi ortaya çıkarmak. XGBoost hiperparametrelerinin optimal kombinasyonu IGWO üzerinden çıktılanabilir. Duygusal sınıflandırmanın genel süreci, veri ön işlemesini, IGWO optimizasyonunu ve nihai XGBoost modelini entegre eder. IGWO-XGBoost temelli sınıflandırma modeli süreci Şekil 5'te gösterilmiştir.

Şekil 5: IGWO-XGBoost tabanlı sınıflandırma modeli süreci. Şekil, IGWO-XGBoost duygu sınıflandırma modelinin tüm sürecini göstermektedir; veri girişi ve ön işlemeden veri seti bölümlemesine, IGWO hiperparametre optimizasyonuna, XGBoost model inşasına ve sınıflandırma sonuç çıktısına kadar modelin işlem zincirini açıkça sunar. Bu figürün daha büyük bir versiyonunu görmek için lütfen buraya tıklayın.
IGWO-XGBoost'a dayalı model, giriş verisi, veri ön işlemesi, veri seti bölümleme, IGWO algoritması hiperparametre optimizasyonu, optimal hiperparametre kombinasyonu, optimal hiperparametre kombinasyonuna dayalı XGBoost oluşturma ve sınıflandırma sonuçlarının çıktısı gibi süreçleri içerir. Bu sınıflandırma modeli sayesinde, öğrenci yorumlarındaki duygular sınıflandırılabilir ve böylece öğrencilerin öğrenme konusundaki öznel duygularını daha sezgisel olarak kavramak elde edilir. Çalışmada kullanılan özel yazılım sürümleri, rastgele tohumlar, donanım spesifikasyonları, çevresel spesifikasyonlar ve veri seti kaynakları Tablo 1'de gösterilmiştir.
| Set tipi | Özel model ve içerik |
| Temel yazılım | Python 3.9.7 |
| Çekirdek kütüphane | XGBoost 1.7.5、Scikit-learn 1.2.2、Jieba 0.42.1、NLTK 3.8.1、Pandas 1.5.3、NumPy 1.24.3、Matplotlib 3.7.1、Imbalanced-learn 0.10.1 |
| Rastgele tohum | Küresel rastgele tohumu 42'ye ayarlayın |
| Donanım/ortam spesifikasyonları | 1. İşletim Sistemi: Windows 10 Profesyonel Sürüm (64 bit, sürüm numarası 22H2) |
| 2. İşlemci: Intel Core i5-12600KF (ana frekansı 3.7GHz ve dinamik hızlandırma frekansı 4.9GHz) |
| 3. Bellek: 64GB DDR4 (frekans 3200MHz, 128GB'a kadar bellek destekler) |
| 4. Depolama: 1TB SSD (Samsung 980 Pro, okuma hızı 7450MB/s) |
| 5. Grafik kartı: NVIDIA GeForce RTX 3060 (12GB video bellek) |
| Veri seti kaynakları ve erişim detayları | 1. Superstar platform veri seti: |
| -Kaynak Tekdüz Kaynak Bulucusu (URL): https://www.chaoxing.com/ |
| -Edinim yöntemi: Chaoxing Education Big Data açık platformu üzerinden başvurun (uygulama yolu: platform, resmi web sitesi → geliştirici merkezi→ veri arayüzü → öğrenme davranışı veri seti) |
| 2. MOOC platformu yorum veri seti: |
| -Kaynak URL: https://www.icourse163.org/.cn |
| -Edinim yöntemi: MOOC platformunun "veri araştırma desteği" kanalı üzerinden başvuru yapın |
| Özel scriptler veya modeller | 1. Veri ön işleme betiği |
| 2. MPFR model scripti |
3. IGWO-XGBoost model yazısı
|
Tablo 1: Araştırmada kullanılan özel yazılım sürümleri, rastgele tohumlar, donanım özellikleri, çevresel spesifikasyonlar ve veri seti kaynakları. Deneyin tekrarlanabilirliğini ve standartlaştırılmasını sağlamak için çalışmanın gerekli yazılım ve donanım ortamı, rastgele tohum ayarları, veri seti kaynakları ve XGBoost hiperparametre arama aralığının ayrıntılı bir listesini sunmak.
Tablo 1 , çalışmanın duygu sınıflandırma modelinin temel çerçevesi olarak XGBoost 1.7.5'i benimsediğini ve veri ön işleme, özellik çıkarımı ve model değerlendirmesi için Scikit Learn 1.2.2'yi tanıttığını göstermektedir. Ayrıca, çalışma rastgele tohumu eşit şekilde 42'ye ayarlayarak veri bölmelerinin, SMOTE aşırı örneklemenin, IGWO hiperparametre optimizasyonunun ve IGWO-XGBoost model eğitim sonuçlarının tekrarlanabilirliğini sağlamaktadır. Ayrıca, IGWO algoritması XGBoost hiperparametreleri için arama alanını ayarlar. Öğrenme hızının arama aralığı logaritmik ölçekte [0.001, 0.3]'tür ve ağacın maksimum derinliği tam sayı kümesi {3, 4,..., 15} içinde aranır. L2 düzenleme teriminin optimizasyon aralığı [0.1, 5.0]'dır ve her ağaç özellik alt kümesinin örnekleme oranı [0.6, 1.0] aralığında optimize edilmiştir. Yaprak düğümlerinin minimum ağırlığı için akort aralığı [1, 10]'dur.
Veri seti ve ilgili veri ön işleme ve analiz kodu ekip tarafından oluşturulup analiz edildi. Veri ön işleme için temel betikler Tablo 2'de gösterilmiştir.
| Pandas as PD, Jieba, Re, Numpy as NP |
| nltk.tokenize tarafından import word_tokenize; from nltk.stem import PorterStemmer |
| def clean(text, l): |
| return re.sub(r"[^\u4e00-\u9fa5]" if l=="zh" else r"[^a-zA-Z]", " ", text).strip() |
| def process(text, l): |
| t = jieba.lcut(metin) eğer l=="zh" aksi word_tokenize(metin) |
| return " ".join([PorterStemmer().stem(w) if l=="en" else w for w in t if w not in open("hit_stopwords.txt").read().split()]) |
| def main(c,m,l): |
| cx=pd.read_csv(c).query("Ders öğrenme süresi>=1 & sınav sonuçları.notna()"); mc=pd.read_csv(m).query("yorum text.str.len()>=5") |
| mc["t"]=mc["yorum metni"].apply(clean,args=("zh",)).apply(process,args=("zh",)) |
| np.savez("out.npz",**{k:v for k,v in locals().items()}) |
Tablo 2: Veri ön işleme için çekirdek betik. Veri ön işlemesi için temel script bilgilerini sunmak, scripte karşılık gelen ön işleme adımlarını netleştirmek ve araştırma yöntemlerinin çoğaltılması için teknik referanslar sağlamak.