$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
研究で使用されるすべてのソフトウェアとツールは 材料表に記載されています。
評価基準
本研究で採用された評価の分類は、流暢さと正確性という二つの主要な領域を対象としており、英語外国語(EFL)における文章の包括的な評価に必要なすべての要件を含んでいます。これらの次元は、効果的なコミュニケーションや言語能力の証明に役立つ文章の質の重要なポイントを測定することを目的としています。流暢さモジュールは、アイデアの滑らかさや単語や文構造の使い方のしっかりを測定することで、文章の自然さ、表現力、一貫性を測定します。正しさモジュールは、正確な文法的正確さ、機械的な完璧さ、標準的な英語慣習への適合性を目指し、仮に言語の誤りを複数のレベルで測定・カウントします。( 表1参照)
タスク定義
英語学習中の学生に対する自動ライティング評価の条件に従い、本研究はEGのコンピュータ支援英語ライティング評価システムの新しいモデルを提案しています。自動化評価システムの範囲に制限されていた従来の研究と比較して、提案されたシステムは革新的なディープラーニング技術の導入を通じて、広範なデータ処理に基づく言語分析、修正範囲、システム全体のフィードバック分析のレベルをユーザーに提供することで、これらの制約を解消する助けとなるでしょう。構成の最も重要な指標である流暢さ(作品がどれだけ自然で一貫性があり表現力豊かであるか)か(文法的、機械的、言語的な誤りが多いテキストがどれだけ正しく書かれているか)という二つの重要な指標を用い、ニューラルネットワークの別々の構成要素を用いて、デュアルモデルシステムは複数の評価を行う必要があります。さらに、複数の言語レベルでの誤りを特定し、修正措置を推奨し、リスト形式でフィードバックを提供して、ユーザーが体系的に生徒の言語学習を向上させることができます。コンピュータ支援自動評価システムの計算プロセスを記述するために、以下の数学モデルを式(1)–(4)で提案します( 表2参照)。
(1)
(2)
(3)
(4)
ここで:最終スコア = 総合ライティング評価スコア; w1 = 流暢さスコアに割り当てられた重み; w2 = 正しさスコアに割り当てられた重み; Sf = BERTベースの流暢性スコア(正規化[0, 1]); Sc = 指数減衰正しさスコア;λ = 減衰定数制御誤差ペナルティ;σ(x) = ロジスティック・シグモイド活性化関数;ErrorRatio = テキスト内のエラーとトークン数の比率。流暢度スコアはロジスティック・シグモイド関数σ(x)によって[0, 1]に正規化され、指数減衰関数は誤り周波数に適切なペナルティを課すために正しさを評価します。
システムアーキテクチャと設計
そのシステムアーキテクチャは並列処理アーキテクチャを持つ二モデルシステムを採用しており、入力エッセイの分析は並列評価経路を通じて並列で行われます。流暢さモジュールと正確性モジュールはそれぞれのスコアを算出し、最終的な総合スコアは2つのサブスコアの加重平均値です。正しさモジュールは、スコアリング以外にも誤り検出と訂正の提案を提供しています( 図1参照)。
フルエンシーモジュール
書き方の流暢さとは、語彙の正しい選択、文の構造の多様性、構文の複雑さ、一貫性などに関して言語の使用の性質やパターンとして定義できます。流暢さ評価モデルは、どもったりぎこちなく、ネイティブ主義的なコミュニケーショントレンドに近い、つまずくことなく伝えられるアイデアを捉えます。従来の流暢さ測定は尺度に基づいており、評価者間の信頼性に関する懸念が浮き彫りになります。提案されたシステムは、BERTベースのニューラルネットワークを含み、深い状況理解を通じて意味的整合性と言語的自然性を自動的に誘導することで、この欠点を克服しています。このアーキテクチャ上の決定は、流暢さ測定に必要な文脈的関係や意味パターンの特定に効果的であることが判明したBERTの強みを考慮してなされました。入力シーケンスはシステムに入力され、12のトランスフォーマー層を通過し、マルチヘッドセルフアテンションで長距離依存関係や文脈関係を特定します( 図2参照)。
注意のメカニズムは以下の通りです。
(5)
Q、K、V をそれぞれクエリ、キー、値を表現する行列、d と k をキーベクトルの次元とします。CLSトークン埋め込みは要約型で、入力シーケンス全体の意味的整合性を記録します。
流暢さスコアの計算方法は以下の通りです。
(6)
ここで hCLS は BERT [CLS] トークン埋め込み、Wレジグは回帰ヘッドのパラメータ bレジグ 、σ は出力を [0, 1] に正規化するシグモイド活性化関数です。
正しさモジュール
正しさ評価は、文法の正確さ、機械的な正確さ、標準的な英語慣習の遵守に焦点を当てています。この次元は、構文、形態論、句読点、スペルの正確さなど、書くことの技術的側面に関わります。正確性の要素は言語誤りの数を評価するだけでなく、テキスト全体の質への影響も検討します。流暢性評価が意味的一貫性と自然な流れを重視するのに対し、正確性評価モジュールは正確な誤りの特定と体系的な訂正を必要とします。このモジュールは異なるエラータイプを区別し、深刻度を評価し、学習改善を支援するための的確な修正を提供します。正しさの損失は、文法的な誤りの発見と訂正のために微調整されたFLAN-T5モデルを使用しています。この選択は、T5のテキスト間変換能力により、システムが単に故障検出だけでなく、1システム内で関連する修正を行うことも可能としています。このシステムはエンコーダ-デコーダ形式であり、テキストはこの変換の形で入力されます( 図3参照)
(7)
エンコーダ要素は文法的傾向だけでなく、失敗の可能性がある部分も捉える文脈依存の表現を生成します。
(8)
誤って識別された誤りに対して適切な文法的バリエーションを生成することで、デコーダは修正されたシーケンスを生成します:
(9)
このような双方向処理により、システムは誤りの文脈を認識し、文脈をどのように修正すべきかを把握し、ヒントは意味的に整合性を持ちつつも文法の訂正に集中できます。
誤差の定量化とスコアリングアルゴリズム
正確さのスコアは、言語的な誤りやテキスト内の位置、意味への干渉に基づく深刻さを考慮し、元の文章と正しい書き方を比較したものです。この方法は、誤りの種類とテキストの理解への影響を比較して捉えます。エラーの頻度とテキストの質の低さの関係は、採点システムにおいて対数的に強調されました。元のテキストと修正済みテキストのトークン比較における基本的なステップは、ビットごとの文字列アライメント技術に基づく2つの比較段階です。第二段階は、既知の言語分類法に基づいて誤りの種類を特定し分類し、文法誤り(主語と動詞の一致、時制の一貫性、統語構造の信頼性)、機械的誤り(大文字、句読点、綴り)、用法誤り(語の選択、慣用句、語域の適切性)を区別します。第三段階は、テキストの総長に基づいて誤り率を算出することです。第4ステップでは、誤りの比率を直接解釈可能な正しさスコアに変換し、誤りの頻度とテキスト品質の非加法的かつ非線形的な依存性を近似する指数減衰スコアアルゴリズムを活用します。
誤り定量化プロセスの数学的処理は、インストールされた誤りの比率を計算することから始まり、これにより正規化された誤りインストール率が得られ、これにより異なる長さのテキストを公平に比較できるようになります。
(10)
(11)
この比較パラメータは、人間の専門家の判断で完全に検証され、経験的に2.5の比較パラメータが確立され、エラー頻度の増加に伴うテキスト品質の低下に関して、人間の理解に沿った結果を得られるようにしています。このようにパラメータ値を設定することで、誤り率が低いテキスト(Error_Ratio < 0.1)は標準英語のルールに忠実に従って高い正しさスコアを得られます。中程度の誤り率(0.1 < Error_Ratio ≤ 0.3)のテキストは中間の正しさスコアとなり、言語学的な懸念が存在しつつも、完全に致命的ではないことを示しています。 誤り率が高いテキスト(Error_Ratio >0.3)は、理解の可能性に大きな影響を与える重要な言語学的問題があるため、正しさのスコアが低いとされています。
正しさ評価のための正しさスコアリングアルゴリズムは、最終誤差比率の計算において、T5ベースのシステムによって検出され修正されたすべての誤りをペナルティ項目として体系的に考慮します。文法誤りに対するペナルティクレジットの仕組みは、誤り比率の増加が指数関数的に減少し、高値に向かってテキストの質が非常に低く、誤り比率が0になると100になり、誤りが検出されないことを意味します。これは英語の標準的な慣習の完璧な使い方です。このような数学的関係により、正確さのコードは言語能力レベル全体のスペクトルにおいて重要な区別を提供し、実際の習得を示す小さな連続的な進歩にも反応します。
データセット:トレーニングおよび評価コーパス
十分な品質と範囲のトレーニングデータは、デュアルモデルシステムのパフォーマンスにとって極めて重要です。本研究では、学生が書いたテキストのよく設計されたデータセットを用いてモデルを開発・評価し、異なる執筆課題を用いて作成しました。サンプルは、平均年齢19歳のパキスタンの大学生45名と女性45名で構成され、必修科目として「機能英語」を履修していました。各生徒は8週間にわたり8つのエッセイを書き、試験前、介入エッセイ、テスト後の機会を含めました。生徒は各執筆課題で400〜450語を書くことが許されていました。データセットの統計量は以下の特徴を提供します。
70,500語
平均文長:15.7語(SD = 3.2)
語彙範囲(タイプ・トークン比):0.64(標準標準差0.08) 文法誤差密度:100語あたり2.3(標準差=1.1)
選定データの正当化とデータ品質保証
選ばれたデータセットは、自動化文書評価の研究成果に豊かさと関連性を持ついくつかの重要な考慮点によって推進されました。まず、経済学の学生層は、パキスタンの高等教育におけるEFL学習者に似た性質から選ばれ、より現実的な状況を反映したより本物の文章サンプルを提示できるようになったからです。第二に、最大および最小の潜在語域である400〜450語の確立は、パイロット研究のデータに基づき、この言語範囲は機械で確実に解析できる言語学的に十分複雑であり、人間の評価においても管理可能なサイズを維持していることが示されました。各作文は、3人の訓練を受けた英語教師(レーティング間信頼性 κ = 0.847、流暢度次元、0.823 正確度次元)によって、標準化された10点流暢度および正しさ評価尺度で評価されました。人間評価者の訓練は厳格で、IELTSやTOEFLのライティング評価に関するスコア評価基準に基づいていました。データは人間による注釈付きデータセットで構成されており、人間注釈付きデータ上で訓練するモデルの訓練や検証に利用できます。
データ前処理および検証の手順
このデータセットは体系的に前処理され、テキスト正規化、BERT WordPieceトークナイザーによるトークン化、品質検証チェックが含まれていました。不完全な作業を提出し、盗用されたテキストを作成した者はデータの整合性を判断するために含まれていません。最後のデータは、階層化されたサンプリングを通じて、習熟度レベルやタスクの種類にバランスを取るために、トレーニング(70%、n = 189)、検証(15%、n = 41)、テストセット(15%、n = 40)にランダムに分割されました。専門的に編集された学術テキスト、新聞記事、発表されたエッセイを含む大規模な参考資料群の言語学的分析で、約5,000万語に及びます。このコーパスは流暢さテストに必要な言語パターンを提供し、標準的な用法と比較することで誤り検出の手順を支援します。リファレンスコーパスでは、前処理とインデックス付けの前のステップはトークン化、品詞タグ付け、構文解析、意味的ラベリングで、リアルタイム評価時に効率的にアクセスできるようにします。
流暢さモデルのトレーニング戦略
データを流暢性を達成するための逐次最適化システムを提案します。このトレーニングは、適応型学習率スケジューリング、段階的バッチサイズ、高度な正則化手法など、学習進行中の過学習を防ぐ最先端の機能を用い、言語流暢さを示す言語パターンの特定におけるモデルの効果を維持しました。学習率は5×10-4 で、収束が安定し最適パラメータ値の周りで振動しないように設定された線形減衰スケジュールが設定されています。この学習率は[1 x 10-6, 1 x 10-4]のグリッドサーチによって決定され、収束速度と安定性の最も適切なトレードオフは5 x 10-5 です。実際の訓練は3エポックに制限され、検証損失トラッキングによって過学習を防ぎつつ、学習を効果的にするパラメータ更新を妨げずに過学習を防ぐために、実証的利点に基づいて最適化されています。分解を防ぐために、2エポックの忍耐と最小差0.001の期間で機構の早期停止が行われています。
最適化はAdamWオプティマイザによって行われ、β₁ = 0.9(運動量、第一モーメント推定値の指数関数的減衰を制御)、β₂ = 0.999(第二モーメント推定、第二モーメント推定の指数関数的減衰を制御)、ε = 1 × 10⁻8 (数値安定性項)などの簡略化された選択肢が適用されます。ウェイト減衰正則化(λ = 0.01)はパラメータの大きさが過度に大きくなるのを防ぎ、この値は範囲全体の検証性能解析によって選択されます[0.001, 0.1]。複雑なモニタリングは、トレーニング全体でさまざまな指標を監視し、モデルの最良のパフォーマンスを保証し、過学習を回避することができます。モニタリング枠組みに含まれるものは以下の通りです:
損失トラッキング:トレーニングおよび検証の損失は各エポック内で追跡され、2つの連続したエポックで検証ロスが改善しなくなった場合に自動的に早期停止が行われます。
パフォーマンス指標:検証データは、100回のトレーニングステップごとに予測スコアと実際のスコア間のピアソン相関係数を計算するために使用されます。
勾配センシング:勾配ノルムは消失や爆発する勾配を検出するために監視され、勾配ノルム1.0では勾配クリッピングが適用されます。
学習率スケジューリング:1回以上の時代の停滞が検出された場合、検証に基づく学習率低下(係数=0.5)。
正則化関連:系統的アブレーションにより、BERTが0.1、回帰ヘッドが0.3のドロップアウト率が検出されました。訓練過程では、過学習防止に基づくいくつかの正則化手法が用いられます。(1) ネットワーク内の層の種類ごとに最適化されたドロップアウト率を用いたドロップアウト正則化、(2) 上記のウェイト減衰、(3) 検証性能によって決定される早期停止、(4) トレーニング例の15%を逆翻訳法でパラフレーズしたデータ拡張。最も性能の良いモデルのチェックポイントは各エポック後に保存され、検証相関スコアに基づいて最も得点の高いモデルが選ばれました。流暢性評価部分で使用される損失関数は平均二乗誤差(MSE)であり、これは連続流暢性スコアを予測する回帰課題の主な目的関数です。損失の定式化は数学的に次のように表されます:
(12)
Nはトレーニングサンプルの総サイズ、y_pred、iは第iサンプルの予測流暢度スコア、y_trueは人間の専門家評価者によって与えられた対応するグラウンドトゥルーススコアです。この損失は、予測誤差と実際の誤差を二次的に抑制し、誤差が大きいほど大きなペナルティを受けやすくし、微分可能であることに非常に有用です。学習率スケジューリング機構は高度に進んでおり、2段階プロセスで、線形ウォームアップ段階から始まり、その後体系的な減衰プロセスを経て最適な収束特徴を作り出します。これはウォームアップ段階で行われ、学習率はゼロから始まり徐々に最大速度に変化し、その後モデルパラメータは訓練データセットに対して最適化されます。ウォームアップフェーズの数学的表現は次の通りです:
(13)
ウォームアップフェーズの後、学習率は最適パラメータ値のオーバーシュートを避けるために体系的に線形に減衰し、安定した収束をもたらします。数学的には、減衰相は次のようになります。
(14)
ここでtは現在の訓練ステップ、lr maxはウォームアップ中に達成された最大学習率、warmupはウォームアップフェーズに割り当てられたステップ数、totalはすべてのエポックにおけるトレーニングステップ数の合計です。前述のスケジューリング手順により、下位レベルでの積極的な学習と収束レベルでの安定性が保証されます。
正確性モデルの訓練戦略
正しさモデルは、事前学習済みFLAN-T5モデルを用いた転移学習戦略に基づいており、必要なすべての文法知識を活用しました。これは一般的な言語理解度とESL学習者が犯したミスに関する具体的な情報を探ることを目的としています。転移学習法はpszemraj/flan-t5-large-grammar-synthesisチェックポイントをベースモデルとして用い、正確性の面でいくつかの注目すべき利点があります。モデルはすでに訓練されており、さまざまな分野で高度な言語理解能力を有しているため、多様な文体やテーマに適応します。特に、第二言語の書き方で遭遇するような複数の文法誤りを含む大規模な訂正データセットに対して、文法特有の微調整が行われています。さらに、チェックポイントには形態的誤り、統語的誤り、意味誤りなど異なる種類の誤りに対して検証される強力な誤り検出システムが含まれており、研究の自然修正テストパラメータとの完全な比較基準を確立しています。
ドメイン適応プロセスは、事前学習モデルの言語理解の一般的な能力を変えることなく、評価タスクの記述ソリューションの特有の特徴を導入する体系的なパラメータ修正を反映しています。この適応の過程は数学的導出で次のようになります:
(15)
ここでθは一般的な言語理解と文法知識を符号化する事前学習モデルのパラメータを表し、 Δθドメイン は対象のライティング評価タスクから学習される特定のパラメータ更新を表します。ドメイン固有の更新は、ターゲットデータセットに対して勾配ベースの最適化によって計算され、EFLライティングに共通するエラータイプに対するタスク特有の感度を育成しつつ、広範な言語的能力を損なうことなく実現します。
比較実験
EGの機能を証明するために、Pearson相関係数が測定の鍵となる指標として提案され、自動化スコアと人間の専門知識との線形関係を決定します。相関係数は次の式で求められます。
(16)
ここでxi は自動スコア、は人間の評価、
と
はそれぞれの平均を表します。相関係数は−1から1の範囲で、1に近い値は自動評価と人間の評価の間に強い正の関係があることを示します。
(17)
(18)
(19)
ベースラインモデル比較
EGの性能を評価し、既存手法に対する優位性を示すために、確立されたAWEおよび従来の単一指標アプローチとの詳細な比較が行われます。これらのベースライン比較は、EGアーキテクチャの付加価値を検証し、流暢性と正確性の評価の統合が個別の次元に焦点を当てたアプローチに比べて測定可能な改善をもたらすことを示すために不可欠です。ベースラインモデルの選択はAWEの4つのカテゴリーをカバーし、それぞれが執筆の評価方法に対する独自の志向を反映しています。最初のモデルは流暢さを評価するための単一のBERTモデルを持っています。これらのモデルはトランスフォーマーアーキテクチャを用いて、テキストの滑らかさや一貫性のパターンを評価します。第二のカテゴリーは、伝統的な言語学的方法論に組み込まれており、文法的誤り検出のためのルールベースのシステムに焦点を当てています。そのため、焦点は正確さにとどまり、文章の品質に関わる一貫性や内容など他の側面は無視されていました。3つ目のカテゴリーは特徴ベースのAWEシステムで、変分文の長さ、語彙の多様性、統語の複雑さなど、言語複雑度の指標を含み、全体的な品質スコアを生成します。4つ目は、様々な表面的な言語的特徴を組み合わせることでハイブリッドシステムを考慮し、しばしばアンサンブル法や加重平均を用います。これらのモデルは、EGの神経アーキテクチャが達成する統合的な高度化には達していません。ベースラインモデルのパフォーマンスは主に3つの次元で評価されます。最初のものは、標準化されたルーブリックを用いて、システム生成の成績と訓練を受けた人間の専門家(英語講師)の評価との整合性を測定します。第二は一般化可能性を判断し、異なるテーマや複雑さを持つ3つのエッセイ間でパフォーマンスが一貫しているかどうかを判断します。第三の次元は予測信頼性に依存し、平均絶対誤差、平方根誤差、信頼区間分析などの統計的手法を通じてスコアリングの正確性と安定性を評価します。これらの側面は総合的に比較の強固な枠組みを確立し、特に従来のアプローチよりも高い精度と安定性を達成する点でEGシステムの優位性を強調しています。
実験群と対照群
この研究は、機能的な英語の授業を2つの完全なクラスで履修していた90人の学部経済学学生で構成されました。データは、事前テスト、介入、事後の3つのタイミングで取得され、時間経過による筆記の正確さと流暢さの進捗を追跡しました。このヒト被験者研究は、パキスタンのCOMSATS大学イスラマバード、ラホールキャンパスの学科諮問委員会によって承認されました。参加者は従来の人間のフィードバックとコンピュータによるフィードバックの2つの条件にさらされました。対照群は45名の学生で構成され、訓練を受けた英語教師から伝統的な書面によるフィードバックを受け取りました。参加者は、学生のエッセイに関する書面によるフィードバックを受け取り、総合的な評価、誤りの特定、そして指導者による課題改善に関するコメントの形で提案を受け取りました。実験グループは教室で同じ指導を受けた45名の学生で構成されていましたが、EGによる迅速な自動フィードバックの助けを借りて、提出から約30秒以内に流暢さと正確さの診断情報が提供されました。
この研究は8週間にわたって実施され、介入前に被験者の初期の作文能力を判断するための事前テスト(第1週)が実施されました。実験群ではNLP意味マーカーを用いたコンピュータベースのフィードバック、対照群では教師による評価が6週間行われました。最終的に、8週目のポストテストは、精度と流暢さスコアの事前・事後測定の違いを理解するために実施されました。比較可能性で同様の結果を得るために、回答者には各評価期間で同様の課題を執筆で行うよう求められ、課題の難易度や内容の習熟度といった交絡変数を最小限に抑えました。難易度に見合った文章の課題を揃え、内容の妥当性を設定するために、文章の課題は一貫性のある方法で選ばれました。エッセイのテーマは、参加者が長時間同じ課題をこなさずに練習効果や退屈を感じないように、さまざまな内容をカバーしていることを基準に選ばれました。
事前試験段階では、参加者は400〜450語のエッセイを書き、学業およびキャリア目標について書くよう求められました。この記述的な課題は、個人的な経験と将来の予測に基づいており、文章の整理、明確な例の提示、個人的な目標や動機の論理的な陳述が必要であることを意味します。介入執筆課題は、日常生活のルーティン、趣味、旅行、大学初日、思い出深い日々、親友の瞬間など、さまざまなテーマに基づいていました。テスト後の課題は「技術がコミュニケーションに与える影響」というテーマに関連しており、必要なエッセイの長さは400〜450語でした。