本研究は、多視点のファジィ推論モデルと、改良されたグレイウルフ最適化アルゴリズムによって最適化された改良された極端勾配ブースティング(XGBoost)アルゴリズムを用いて、オンライン学習行動を分析し、学生のコメント感情を分類することで、個別化された指導とタイムリーな介入を支援します。
研究記事
本研究は、多視点のファジィ推論モデルと、改良されたグレイウルフ最適化アルゴリズムによって最適化された改良された極端勾配ブースティング(XGBoost)アルゴリズムを用いて、オンライン学習行動を分析し、学生のコメント感情を分類することで、個別化された指導とタイムリーな介入を支援します。
オンライン教育の急成長により、オンライン教室は教育分野の重要な一部となっています。オンライン授業における生徒の学習行動を深く分析することで、教師は指導戦略を最適化し、生徒にパーソナライズされた学習支援を提供できます。したがって、学生の学習行動を詳細に分析するために、本研究はオンライン教育プラットフォームからデータを収集し、それを前処理します。その後、本研究はカリキュラム、個人、クラスの3次元をカバーする多視点のファジィ推論モデルを構築し、学生の学習パフォーマンスを異なるレベルから包括的に考察します。このモデルは、学習行動データの不確実な情報をファジィ集合とファジィルールを通じて処理し、学習パフォーマンスの多次元評価を実現します。改良されたXGBoostアルゴリズムは、学生のコメント感情を分類するために設計されています。この改良アルゴリズムは、グレイウルフ最適化アルゴリズムを改良することでXGBoostアルゴリズムのハイパーパラメータを最適化しています。このアルゴリズムは感情分類の精度を高め、学習行動の背後にある感情傾向や態度フィードバックをさらに探求します。結果は、カリキュラムの観点から見ると、試験3週間前のコース課題の完了率はほぼ45%を超えており、課題発表後3週間の完了率(どちらも18%未満)よりもはるかに高いことを示しています。これらの結果は、学生が締め切り前に課題を完了する傾向が強くなり、明らかな先延ばし傾向があることを示しました。改良された分類アルゴリズムの最大精度は98.78%で、比較モデルより8.57%、7.55%、6.38%、6.01%高く、平均時間消費は58msでした。ネガティブ、ポジティブ、ニュートラル感情のリコール率は98.35%、97.69%、98.02%でした。この研究モデルは、学生のオンライン学習行動を効果的に分析し、リスクのある学生の早期発見を可能にすることで、個別化された指導とオンライン教育における正確な介入を促進します。
インターネットと教育技術の深い統合により、オンライン教育は周辺的な補完から主流の形態へと飛躍しました。2023年末までに、世界の登録オンライン学習者数は12億人を超え、中国は大規模オープンオンラインコース(MOOCs)の数と学習者数の両面で常に世界トップにランクされていました。しかし、オンライン授業は利便性をもたらす一方で、学習プロセスの不明白さ、教師と生徒の時間・空間での分離、規制の遅れといった課題も露呈しています。学習行動データと学業成績には正の相関関係があります。データに基づく動的調整は、コース修了率を20%以上向上させ、中退リスクを大幅に減らすことができます。したがって、学習行動分析(LBA)を実施することは非常に重要です。この問題に関して、現在の手法には記述統計、アソシエーションルールマイニング、そして従来の機械学習分類6があります。多くの学者がこの問題について研究しています。
LBAを実施するために、Li Yらはハーバード大学およびマサチューセッツ工科大学のオンライン教育プラットフォームからの学習行動データを活用し、学習成果を予測するためのパルスニューラルネットワーク(PNN)を構築しました。彼らは学習行動と成果の相関を分析しました。PNNに基づくオンライン学習行動予測モデルは99.80%の精度を記録しました。Zeng Bは、遅延シーケンス解析とデータマイニング手法、最小全域木アルゴリズムを用いて、オンライン英語学習行動を可視化する効率的なモデルを設計しました。さらに、この調査ではグループ学習パス(GLP)建設サービスのためのオンラインインテリジェントラーニングプラットフォームも確立されました。設計された方法はGLP8を成功裏に構築することができました。Zhao Mらは、学生のオンライン学習における潜在的な問題を明らかにするために、二重層の長短期記憶(LSTM)を設計しました。彼らはTensorFlowフレームワークとPython言語を使用し、Kaggle、edX、英国オープン大学といったオンラインプラットフォームのデータを活用しました。このネットワークは良好な性能を持ち、最大精度は83.4%9でした。Li Fらは、異なるオンライン学習者のグループ行動特性を理解するために、109人の学部生から学習行動データを収集・分析しました。本研究では、データの次元性を低減するために主成分分析を導入し、学習者をさまざまなカテゴリーに分類するために集約的階層的クラスタリングを用いました。そのうち15グループがクラスタリングされ、提案された方法はクラスタリング精度が良好でした。
まとめると、現在のLBA研究は非常に多様で、多様な手法を用いています。しかし、これらの研究や手法にはいくつかの欠点もあります。例えば、学生のレビューテキストにおける感情情報の掘り下げは不十分であり、記述的統計では行動の背後にある複雑な相互作用メカニズムを明らかにできません。機械学習の分類はしばしば単一視点の特徴に基づいており、コース、個人、クラスの多次元情報を分離します。LBAをより効果的に行うために、本研究は多視点ファジィ推論(MPFR)モデルを設計し、改良型グレイウルフ最適化(IGWO)および極限勾配ブースティング(XGBoost)アルゴリズムに基づく感情分類モデルを構築します。
既存のLBA研究では、学習行動の時間的相関を捉えられるものの、曖昧で不確実な学習行動データの扱いは弱いです。畳み込みニューラルネットワーク(CNN)はテキスト特徴抽出に一定の利点がありますが、局所的な特徴の捉え方に優れており、コース、個人、クラスの多次元グローバル情報を統合するのは困難です。CNNやLSTMなどの深層学習手法と比較して、MPFRモデルはファジィ推論を通じて学習行動における不確実な情報を捉えることができます。例えば、学生の「中程度の参加」と「基本的なファジィ状態の習熟」は、CNNの局所特徴抽出の限界を補っています。IGWO-XGBoostは、時間のかかるLSTM感情分類と弱いCNN意味的ファジィ処理を補い、感情分類の正確性と効率性のバランスを取っています。本研究は、行動分析と感情分析の結果を組み合わせることで、オンライン教育介入のための三次元情報支援を提供することを目指しています。本研究の革新は、カリキュラム、個別、クラスの3次元をカバーするMPFRモデルの構築にあります。この多角的な総合的な考察は、学生の学習成果を包括的かつ立体的に反映し、単一の視点から見落とされがちな重要な情報を回避できます。この方法はプラットフォームのスケーラビリティが高く、ChaoxingやMOOCなどの主流のオンライン学習プラットフォームにも適応可能であり、追加のプラットフォーム開発機能を必要とせずに統一されたデータ前処理インターフェースを通じて実現可能です。同時に、この手法はシンプルな分析ツールとしてカプセル化されており、教育者はプラットフォームからエクスポートした基本データをアップロードするだけで、複雑な技術的操作なしにLBAレポートを自動的に生成できます。
アクセスが制限されています。このコンテンツを表示するにはログインするか、トライアルを開始してください。
MPFRおよび感情的視点を考慮したLBA法の設計
学生のオンライン学習行動(SOLB)を分析するための多視点評価システムを構築し、MPFRモデルを設計します。学習における学生の主観的感情をさらに分析するため、本研究はXGBoostアルゴリズムを採用し、分類精度向上のためのハイパーパラメータ最適化用IGWOアルゴリズムを設計します。
LBAのMPFRモデルの構築
SOLBを分析するために、本研究は主に二つの視点から出発し、完全な分析計画を形成します。まず、学習パフォーマンスの観点から、本研究はカリキュラム、個人、クラスの三つの視点を考慮し、MPFRモデルを形成します。次に、学生コメントの感情分析に関して、本研究は改良されたXGBoostアルゴリズムを設計しています。学習パフォーマンスと生徒のフィードバック感情の分析を通じて、本研究はSOLBをより良く分析できます。学習パフォーマンス分析の具体的な技術的詳細に関しては、本研究はまずオンライン学習プラットフォームのデータを用いて、それを前処理します。第二に、本研究は異なる視点からコア学習パフォーマンス評価指標を選び、包括的な評価システムを構築します。その後、学習行動を評価するための対応するMPFRモデルが構築されます。
この研究はSuperstarプラットフォームからデータを選定しています(出典:https://www.chaoxing.com/)。教室活動や成績評価など複数の側面からの情報が含まれており、今後のLBAの良い基盤となります。データ取得後は、主に無関係なフィールド削除、データフィルタリング、データ整合性チェックなどを含む前処理が必要です。例えば、教員データでは、コースの番号や所属学科といった無関係な情報を削除する必要があります。その後、本研究はSuperstarプラットフォームの学習行動データに基づいてLBAの特徴工学を構築します。学生用LBA指数は、その後のMPFRモデルの特徴工学的基盤を提供し、この指数の内容は 図1に示されています。

図1:学生LBAの指標。 図は学生LBAの3つのコアな側面(カリキュラム、個人、クラス)と各次元の評価指標を明確にし、MPFRモデルの特徴的なサポートを提供しています。 この図の拡大版はこちらをクリックしてご覧ください。
図1では、学生のLBA指標は主にコース、個人、クラスの3つの視点を中心に展開し、各次元に明確に焦点を当てているため、MPFRモデル構築のための正確な特徴サポートを提供しています。その中で、コースの寸法指標として、本研究はコース課題の完了率、学習期間、コースとの交流頻度を選択しています。この次元の核心的な関心事は、コース課題の全体的な完了の質と学習参加のタイムリーさです。例えば、コースタスクの完了率は締め切り前後の完了率の違いを追跡するために使われます。学習期間は学習強度の異なる区間を区別するために使われます。当然の相互作用の頻度は効果的な相互作用行動をフィルタリングするために用いられます。個人レベルでは、学習進捗、宿題の完成度、試験スコアが評価指標として選ばれます。この次元は、個人の学習進捗と知識習得の結果とのマッチング度に焦点を当てています。例としては、個人の学習進捗とコースプランの比較、完了した課題の正確さと効率の評価、テストスコアに基づく知識習熟度の分類などがあります。さらに、クラスの次元では、選ばれた指標にはクラス平均スコア、クラスの交流活動、クラスの学習環境が含まれます。この次元は主に、全体的な学習環境が個人の行動に与える影響に焦点を当てています。例えば、平均成績はグループ内の個人のパフォーマンスの相対的なレベルを測るために使われます。階級間の相互作用の活動は、集団参加の度合いを反映するために用いられます。学習環境は、グループ環境が学習行動に与える駆動効果を分析するために用いられます。生徒の学習行動を分析するために、ファジィ推論モデルを構築し、異なる視点から学習行動の特徴を得ます。ファジィ推論はファジィ論理を用いて推論する方法であり、不正確または不確実な情報をファジィ集合やファジィルールを通じて処理し、強い柔軟性と理解しやすいという利点があります(11,12)。MPFRモデルの中核的な計算メカニズムであるファジィ推論は、特徴工学の後に適用されます。ファジィ推論の主な過程は図2に示されています。

図2:ファジィ推論の主なフローチャート。 図はファジィ推論の核心的なプロセスを示しており、4つの主要なステップからなる:ファジィ化、ファジィルールベースの構築、ファジィ推論、そして不確かな学習行動データを扱うMPFRモデルの論理を明確にしています。 この図の拡大版はこちらをクリックしてご覧ください。
ファジィ推論は主にファジィ化、ファジィルールライブラリ(FRL)の確立、ファジィ推論、そしてぼかし除去を含みます。その中でも、ファジィ化は正確な入力データをファジィ集合に変換し、メンバーシップ関数の定義を伴います。FRLは一連のファジィ規則を含み、主に入力と出力の関係を記述するために用いられます。ファジィルールの構築において、本研究は教育技術の准教授3名を招き、8年の教育≥経験を持つ4名の共同4名を招き、28のルールを共同で開発し、「デルファイ法」を用いた3回の反復を経て最終的なルールを決定します。例えば、ルール1:コース課題の完了率が30%未満で、個々の学習進捗がスケジュールより2週間遅れている場合→ハイリスク状態とします。ファジィ推論とは、FRL上に構築されたファジィ入力データを推論し、ファジィな出力結果を得るプロセスです。最後に、ぼかし除去によってぼやけた出力結果が正確な出力値に変換されます。本研究では、ファジィ論理システムで広く利用されている三角形メンバーシップ関数を選び、強い柔軟性と高い計算効率といった利点があります。関数A(x) μ の式は式(1)に示されています。
(1)
式(1)では、xは特定の入力値です。a、b、cは三角形の3つの頂点です。ぼかし除去では、本論文では重心法を用いて出力結果を変換します。重心法はファジィ論理でよく使われるぼかし除去技術であり、強い直感性、単純な計算、安定性といった利点があります。重心法の式は式(2)14に示されています。
(2)
式(2)では、f*はぼかし除去後の出力値であり、これはファジィ集合の重心です。μ(x) はメンバーシップ関数です。
はファジィ集合内のすべての点の重み付け和です。
はxのすべての可能な値に対する所属関数の積分です。MPFRモデルで手動で定義されたルールやメンバーシップ関数を使用することの合理性は、三つの側面に反映されています。まず専門家資格保証:規則制定者は教育技術の准教授3名で、教育省「オンライン教育研究センター」の「オンライン学習行動分析官」によって認定されており、教育・教育法に適合していることを保証されています。第二に、効率性の利点です。手動ルールの推論時間はデータ駆動型手法に比べてはるかに短く、オンライン教育プラットフォームの「リアルタイム推論」ニーズにより適しており、大量の注釈付きデータを必要としないため、データ収集コストを削減します。第三に、オンライン教育のシナリオにおける「解釈可能性」という核心的要件に適応することで、手動で定義されたルールや三角型メンバーシップ関数(式1)は、教育シナリオにおける直感的認知に直接対応できます。教育者は、生徒がリスクにさらされている理由を理解するのに複雑な技術的背景は必要ありません。ニューロファジィシステムのようなデータ駆動型手法は、ルールを自動的に最適化できます。しかし、生成されるルールの多くは複雑な数学的表現であり、教育者が解釈するのが難しく、実際の指導介入におけるモデルの受け入れ可能性を下げています。
XGBoost向けの学生コメント感情分析モデルの改良設計
設計されたMPFRモデルは、コース、個人、クラスの3つの側面からSOLBを分析できます。しかし、外部行動データ分析は学生の主観的感情を表現する上で限界があります。したがって、学生の学習に対する主観的な感情をさらに分析するために、学生のコメント情報を含むMOOC学習プラットフォームからの追加データを収集し、事前処理します。その後、XGBoostを用いて感情分類モデルを構築します。IGWOは分類モデルの精度を向上させるためにパラメータを最適化するよう設計されています。XGBoostの改良はIGWOアルゴリズムによるパラメータ最適化に反映されています。データ前処理はモデル構築と解析の前の重要な第一歩です。データ前処理のプロセスは 図3に示されています。

図3:データ前処理のプロセス。 9段階のデータ前処理プロセスには、テキストクレンジング、単語分割、ストップワード除去、語幹抽出、センチメントワード認識が含まれ、その後の行動分析やセンチメント分類のための高品質なデータを提供します。 この図の拡大版はこちらをクリックしてご覧ください。
データの前処理ステップは以下の通りです。最初のステップは、チャオシンプラットフォームのデータから無関係なフィールドを除去し、無効なサンプルをフィルタリングするためにテキストクリーニングを行うことです。同時に、MOOCプラットフォームのレビューデータからは非テキストフィールドや短いレビューが削除されます。次のステップはセグメンテーション処理を行うことです。その中でも、中国語のコメントは言葉の分割処理にJiebaの「精密モード」を用い、英語のコメントはNLTKライブラリの単語分割機能を使って処理しています。第三のステップは、「de」「yes」「in」などの一般的なストップワードを取り除くことです。その中でも、中国のストップワードはハルビン工業大学のストップワードリスト(https://github.com/goto456/stopwords/blob/master/hit_stopwords.txt)を使用しています。ストップワードはワードマッチングによって削除されます。英語のストップワードは、NLTKライブラリに組み込まれたユニバーサルストップワードリストを使用し、単語ごとのマッチングによって削除されます。第四段階は、NLTKライブラリの語幹を使ってテキストから語幹を抽出し、英語データの動詞を語幹の形に戻すことです。第五段階は、CNKI感情辞典に基づいてコメント内の肯定的・否定的な感情語を特定し、その後の感情分類のための事前注釈の基礎を提供することです。6番目のステップは特徴抽出を行うことです。その中で、Chaoxingプラットフォームの構造化データは標準化されており、分類指標は別途エンコードされています。同時に、MOOCプラットフォームのコメントデータは事前学習済み言語モデル(Transformersによる双方向エンコーダ表現、BERT)手法を用いてテキスト特徴を抽出しています。BERTモデルのテキスト特徴抽出における主な利点は、深い双方向トランスフォーマーアーキテクチャを通じて文脈認識のワードベクトルを動的に生成できることであり、従来の静的ワード埋め込みモデルでは処理できない曖昧さを効果的に解決できることです。第七のステップは、コメントデータにおける感情のバランスの欠如の問題に対処することです。合成少数派オーバーサンプリング技術(SMOTE)が処理に用いられています。5つの最近傍サンプルを補間のために選び、合成少数派クラスサンプルを作成します。実験の再現性を確保するために固定されたランダムシード42が割り当てられます。第8ステップはデータの注釈と分割です。第9ステップは、スーパースターデータの欠損値を埋め、外れ値を削除することです。データバランシング処理を行う際、SMOTEは少数派クラスサンプル間で補間することで新しい複合サンプルを作成し、これによりマイノリティクラスサンプル数を増やし、データセットのクラス分布をよりバランスよくします16,17。SMOTEの式は式(3)に示されています。
Bmn = dm + rand(0,1) x (dmn - dm) (3)
式(3)では、Bmnは人工的に構築された少数派クラスサンプル、dmはi番目のマイノリティクラスサンプル、dmnはdmのk-最近傍のn番目のサンプルです。rand(0,1) は 0 から 1 の間の乱数です。XGBoostは予測ツリーを反復的に追加することで予測性能を向上させます。高精度、高い柔軟性、使いやすさなどの利点があります。XGBoostを用いて木モデルを反復的に構築する手順は主に、モデルの初期化、木、目的関数、正則化項の反復構成です。t回目の反復での予測出力
は式(4)に示されます。
(4)
式(4)では、
は t 回目の反復後のモデル予測値、ft(h) は t 回目の反復で加えた木モデルの予測関数、h は入力特徴ベクトルです。XGBoostを最小化するための目的関数は式(5)に示されています。
(5)
式(5)では、iはサンプル数です。IとJはサンプルと木の合計数、jは木の数です。
は損失関数であり、gi は第i個サンプルの真のラベルです。
はt回目の反復後のi番目のサンプルのモデルの予測値です。Ω(ft) は正則化項、(ft) は j 番目の木の予測関数です。正則化の一般的な式Ω(f)は式(6)に示されています。
(6)
式(6)では、γは葉節の数に対するペナルティ係数を意味し、λは葉節の重みのL2正則化係数、wは葉節の重みを表します。しかし、XGBoostのハイパーパラメータの選択はパフォーマンスに直接的かつ重要な影響を与えます。XGBoostの一般的なハイパーパラメータには、学習率、木の最大深さ、正則化パラメータなどがあります。ハイパーパラメータ空間が大きくなる可能性があるため、手動でパラメータを調整するのは時間がかかるだけでなく、最適なパラメータの組み合わせを見つけるのも困難です。したがって、本研究はIGWOをXGBoostのハイパーパラメータ最適化する設計を行います。GWOは、グレーウルフの社会階層や狩猟戦略をシミュレートすることで最適解を探します。その利点はパラメータが少なく、適応力が高いです20,21。GWOでは、母集団の初期位置は式(7)に示されるように生成されます。
(7)
式(7)では、Puvはv次元におけるu番目の個体の位置です。
と
はv番目の探索空間の上限と下限です。rand()は[0,1]までの乱数です。しかし、GWOアルゴリズムは収束速度の遅さや、中期および後半段階で局所最適解に詰まるなどの問題に直面することがあります。これにより、現時点でGWOは解空間全体を効果的に探査できず、グローバルな最適解を見つけるのが困難になる可能性もあります。この問題に対処するため、本研究はテントカオスマップ(TCM)と非線形収束因子(NCF)の導入という2つの側面からGWOを改善します。TCMは単純なカオスマッピングであり、探索過程で最適な解領域を見逃さず、同じ領域の繰り返し探索を回避します。したがって、TCMを通じてより均一でランダムな初期集団を生成でき、局所最適解を克服するアルゴリズムの能力も向上します。TCMの計算は式(8)に示されています。
(8)
式(8)では、yが制御パラメータです。 Rt とR t+1 は、t 回目および t+1 回目の反復におけるシステム状態変数です。NCF zの式は式(9)に示されています。
(9)
式(9)では、zmaxが最大収束因子、tmaxが最大反復回数を示します。この非線形減少法により、GWOは初期段階でグローバル探索のために大きなステップサイズを維持できます。探索の中間段階では収束速度が加速し、後半段階では局所探索がより小さなステップで行われるため、グローバル検索と局所探索能力のバランスが効果的に調整され、最適化性能が向上します。IGWOアルゴリズムはXGBoostセンチメント分類器のハイパーパラメータ最適化段階に特化して使用され、その主なプロセスは 図4に示されています。

図4:IGWOの主なプロセス。 図は、テントカオスマッピングに基づく集団初期化、非線形収束因子の位置更新、最適な個別スクリーニングを含むIGWOの実行プロセスを概説し、XGBoostハイパーパラメータの最適化論理を明確にしています。 この図の拡大版はこちらをクリックしてご覧ください。
図4のIGWOプロセスには以下が含まれます:アルゴリズムの初期化;TCMを用いて集団を初期化し、各個人の初期適応度値を計算すること;NCFを使ってグレイウルフの位置を更新し、最適な適応度を持つ解を新たな最適個体として選び、そして最適な個体を出力します。XGBoostのハイパーパラメータの最適の組み合わせはIGWOを通じて出力可能です。感情分類の全体的なプロセスは、データ前処理、IGWO最適化、そして最終的なXGBoostモデルを統合しています。IGWO-XGBoostに基づく分類モデルのプロセスは図5に示されています。

図5:IGWO-XGBoostに基づく分類モデルプロセス。 図は、データ入力と前処理からデータセットの分割、IGWOハイパーパラメータ最適化、XGBoostモデル構築、分類結果の出力まで、IGWO-XGBoost感情分類モデルの全プロセスを示しており、モデルの操作チェーンを明確に示しています。 この図の拡大版はこちらをクリックしてご覧ください。
IGWO-XGBoostに基づくモデルには、入力データ、データ前処理、データセット分割、IGWOアルゴリズムのハイパーパラメータ最適化、最適ハイパーパラメータの組み合わせ、最適ハイパーパラメータの組み合わせに基づくXGBoostの構築、分類結果の出力などのプロセスが含まれます。この分類モデルを通じて、学生のコメントに含まれる感情を分類でき、学習に対する学生の主観的な感情をより直感的に理解することができます。研究で使用された具体的なソフトウェアバージョン、ランダムシード、ハードウェア仕様、環境仕様、データセットソースは表 1に示されています。
| セットタイプ | 具体的なモデルと内容 |
| 基本ソフトウェア | Python 3.9.7 |
| コアライブラリ | XGBoost 1.7.5、Scikit-learn 1.2.2、Jieba 0.42.1、NLTK 3.8.1、Pandas 1.5.3、NumPy 1.24.3、Matplotlib 3.7.1、Imbalanced-learn 0.10.1 |
| ランダムシード | グローバルランダムシードを42に設定します |
| ハードウェア/環境仕様 | 1. オペレーティングシステム:Windows 10 Professional Edition(64ビット、バージョン番号22H2) |
| 2. プロセッサー:Intel Core i5-12600KF(主周波数3.7GHz、動的加速周波数4.9GHz) | |
| 3. メモリ:64GB DDR4(周波数3200MHz、最大128GBメモリ支援) | |
| 4. ストレージ:1TB SSD(Samsung 980 Pro、読み取り速度7450MB/s) | |
| 5. グラフィックスカード:NVIDIA GeForce RTX 3060(12GBビデオメモリ) | |
| データセットのソースとアクセスの詳細 | 1. Superstarプラットフォームデータセット: |
| - ソース統一リソースロケーター(URL):https://www.chaoxing.com/ | |
| - 取得方法:チャオシン教育のビッグデータオープンプラットフォームを通じて申請(申請経路:プラットフォーム公式ウェブサイト→開発者センター→学習行動データセット→データインターフェース) | |
| 2. MOOCプラットフォームコメントデータセット: | |
| -ソースURL:https://www.icourse163.org/.cn | |
| - 取得方法:MOOCプラットフォームの「データリサーチサポート」チャネルを通じて応募 | |
| カスタムスクリプトまたはモデル | 1. データ前処理スクリプト |
| 2. MPFRモデルスクリプト | |
| 3. IGWO-XGBoostモデルスクリプト |
表1:研究で使用される特定のソフトウェアバージョン、ランダムシード、ハードウェア仕様、環境仕様、データセットソース。研究に必要なソフトウェアおよびハードウェア環境、ランダムシード設定、データセットソース、XGBoostハイパーパラメータ探索範囲の詳細なリストを提供し、実験の再現性と標準化を確保します。
表1は 、本研究が感情分類モデルのコアフレームワークとしてXGBoost 1.7.5を採用し、データ前処理、特徴抽出、モデル評価のためにScikit learn 1.2.2を導入していることを示しています。さらに、データ分割、SMOTEオーバーサンプリング、IGWOハイパーパラメータ最適化、IGWO-XGBoostモデルの訓練結果の再現性を確保するため、ランダムシードを一様に42に設定しています。さらに、IGWOアルゴリズムはXGBoostハイパーパラメータの探索空間を設定します。学習率の探索範囲は対数スケールで[0.001, 0.3]であり、木の最大深さは整数集合{3, 4,..., 15}で探索されます。L2正則化項の最適化範囲は[0.1, 5.0]であり、各木の特徴部分集合のサンプリング比は[0.6, 1.0]の範囲内で最適化されています。葉節の最小重量の調整範囲は[1, 10]です。
データセットおよび関連するデータ前処理および解析コードはチーム自身によって生成・解析されました。データ前処理のコアスクリプトは 表2に示されています。
| インポートPandasをPD、jieba、re、numpyをNPとして |
| nltk.tokenize import word_tokenize;from nltk.stem import PorterStemmer |
| def Clean(テキスト、l): |
| Return re.Sub(r"[^\u4e00-\u9fa5]" l=="zh" else r"[^a-zA-Z]", " ", text).strip() |
| def process(text, l): |
| t = jieba.lcut(text) もし l=="zh" ならば word_tokenize(テキスト) |
| return " ".join([PorterStemmer().stem(w) l=="en" でなければw for w in t if w in open("hit_stopwords.txt").read().split()]) |
| ディフェンス・メイン(C,M,L): |
| cx=pd.read_csv(c).query("コース学習期間>=1 & exam results.notna()");mc=pd.read_csv(m).query("comment text.str.len()>=5") |
| mc["t"]=mc["comment text"].apply(clean,args=("zh",)).apply(process,args=("zh",)) |
| NP.savez("out.npz",**{k:v for k,v in locals().items()}) |
表2:データ前処理用のコアスクリプト。データ前処理のためのスクリプトのコア情報を提示し、スクリプトに対応する前処理ステップを明確にし、研究手法の再現に関する技術的参考文献を提供します。
アクセスが制限されています。このコンテンツを表示するにはログインするか、トライアルを開始してください。
多視点および感情分類を考慮したLBA結果
性能を検証するために、実験環境を設定し、実験データセットを記述します。さらに、本研究では比較アルゴリズムIGWO-XGBoostを選択し、精度、時間消費、リコール率などの指標を用いて解析・検証します。結果分析では、MPFRによるLBAの結果とIGWO-XGBoostによる感情分類のパフォーマンス検証の2つの明確なセクションに分けられています。
MPFRによる行動分析の学習
MPFRの性能を検証し、学生の学習行動を多角的に分析するために、本研究ではWindows 10システムとIntel Core i5-12600KF中央処理装置を使用します。プロセッサの主周波数は3.7 GHz、動的加速周波数は4.9 GHz、最大メモリ容量は128GBです。データセットでは、1,000人から約50,000のデータ...
アクセスが制限されています。このコンテンツを表示するにはログインするか、トライアルを開始してください。
SOLBの分析のために、本研究はMPFRおよびIGWO-XGBoostモデルを設計し、オンライン教育プラットフォームのデータを用いました。実験では、推論モデルの評価と実際のスコアとの間に高い一貫性が見られ、推論モデルの有効性が示されました。約25%の学生がコース中に1〜10時間の学習時間をとっていました。11〜20歳、21〜30歳、31〜40時間、41時間以上の学習時間を持つ学生の割合は30%、20%、15%、10%でした。これは、大多数の学生が中程度の学習強度を維持している一方で、極めて短期的または長期的な学習に従事している学生は少数派であることを示している。XGBoostモデルのハイパーパラメータ最適化結果には異なる最適化アルゴリズムで違いがあり、IGWOの方が優れた性能を示しました。IGWO-XGBoostの分類時間とF1スコアはそれぞれ100msと0.968でした。IGWO-XGBoostの最大分類精度は98.78%、最小精度は95.02%で、比較モデルより有意に高かったです。IGWO-XGBoostのネガティブ、ポジティブ、ニュートラル感情の各リコール率は比較...
アクセスが制限されています。このコンテンツを表示するにはログインするか、トライアルを開始してください。
著者には開示すべき関連する財務的または非財務的利害関係はありません。
| 名前 | 会社 | カタログ番号 | コメント |
|---|---|---|---|
| BERT事前学習言語モデル | Googleでの調査 | https://github.com/google-research/bert | |
| CNKI感情辞典 | CNKI | https://www.cnki.net/ | |
| Chaoxingプラットフォームは行動データを学習します | 超興情報技術開発有限公司 | https://www.chaoxing.com/ | |
| コンピュータメモリ | ユニバーサルハードウェアサプライヤー(特定のモデルなし) | ||
| ハルビン工業大学の廃止された用語一覧 | ハルビン工業大学 | https://github.com/goto456/stopwords/blob/master/hit_s | |
| Intel Core i5-12600KF | インテル・コーポレーション | BX8071512600KF | |
| Jiebaワードセグメンテーションツール(精密モード) | サードパーティのオープンソースコミュニティ | https://github.com/fxsjy/jieba。 | |
| MOOCプラットフォームの学生レビューデータ | ラブコースネットワーク | https://www.icourse163.org/ | |
| NLTKライブラリ | NLTK開発チーム | https://www.nltk.org/ | |
| Pythonプログラミング言語 | Pythonソフトウェア財団 | https://www.python.org/ | |
| Scikit-learn 1.2.2 | Scikit 学習チーム | https://scikit-learn.org/stable/ | |
| Smart Treeプラットフォームは行動データを学習します | スマートツリーネットワーク | https://www.zhihuishu.com/ | |
| SMOTE技術 | 学習開発チームのバランスが崩れました | Imbalanced Learnライブラリに統合されている https://imbalanced-learn.org/stable/ | |
| Windows 10 オペレーティングシステム | マイクロソフト社 | https://www.microsoft.com/zh-cn/windows/windows-10 | |
| XGBoost 1.7.5 | XGBoost開発チーム | https://xgboost.readthedocs.io/ |
アクセスが制限されています。このコンテンツを表示するにはログインするか、トライアルを開始してください。
このJoVE記事のテキストまたは図の再利用許可をリクエスト
許可をリクエストThis corrects the article 10.3791/69515