研究記事

英語とコクボロク符号混合文の低資源言語識別

DOI:

10.3791/69130

2026年1月2日

この記事について

サマリー

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

このプロトコルの目的は、文字nグラムと頻度辞書を組み合わせた教師なしモデルを用いて、英語とコクボロク符号混合テキスト内の単語レベル言語を正しく識別することです。

要約

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

多言語テキストの使用増加により、自動単語レベルの言語検出モデルの需要が高まっています。コクボロク語と英語の単語レベルでコードスイッチ文とコード混合文を特定するために、教師ありモデルを提案します。コードミックステキストに関する多くの研究が発表されており、いくつかのインドの言語についても含まれます。しかし、私たちの知る限り、私たちの研究は先駆的な試みであり、資源の少ない英語とコクボロクの言語ペアを初めて特定したものです。周波数辞書のデータと文字nグラムモデルのデータを統合する方法を用いています。ヴィテルビ技術は、文字nグラムマルコフモデルと頻度語彙を組み合わせ、単語レベルでの正確な言語識別を支援します。提案された手法は単語レベルの精度93.15%で良好な性能を発揮し、BiLSTM-CRFモデルの88.5%およびルールベースベースの85.3%を上回っています。これは、大量の注釈付きデータセットに依存せずに、低資源言語を扱うために語彙と統計的手法を組み合わせることの有効性を示しています。

概要

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

このデジタル時代において、ソーシャルメディアプラットフォーム上でのコードミキシングやコードスイッチングによる多言語コミュニケーションの急速な増加は、グローバルなコミュニケーションの中心となっています。テキスト内容内の言語を正確に識別する必要性は極めて重要です。観察の結果、ヒンディー語、ベンガル語、テルグ語など多くのインドの言語はすでに言語識別で探求されており、マニプリ語、ボド語、アッサム語など他のインドの低資源言語も言語識別研究で部分的に取り上げられていることが分かりました。しかし、言語学的にも構造的にも異なる資源の少ない言語であるコクボロク語のモデル開発には、依然として大きな研究のギャップがあります。

マニプリ語、アッサム語、ボド語の低資源言語とは異なり、コクボロク語は正書法に大きな変化があり、ローマ字またはベンガル文字で書かれ、コミュニケーションにおいてはしばしば同じ意味で書かれます。これにより、トークンの境界線、音写、キャラクターレベルでの特徴抽出に多くの曖昧さが生じ、文献ではほとんど考慮されてこなかった明確な課題となっています。さらに、コクボロク語は膠着語であり、その形態は豊富な接頭辞や接尾辞(例:-o、-do、-no)や音素的語調を含むため、インド・アーリア語族に対して開発された既存のコード混合言語識別モデルを適用するのがより困難です。

これらの問題はソーシャルメディアによってさらに強化されています。コクボロク語話者は、コードミックスやコードスイッチングだけでなく、コクボロク文の語彙不足を補うためにも英語の単語をテキストに混ぜる傾向があります。これにより、非標準的な正書法や文脈に応じた単語の使用が生まれ、ルールベースや純粋な語彙体系にとっては後退となります。

本研究では、周波数辞書と文字nグラム確率を組み合わせた教師なしモデルを提案し、ビタービ復号フレームワークを用いてこれらのギャップを埋めます。この手法は特に英語とコクボロク語の正書法、形態学的、文脈的複雑さに焦点を当てており、この低資源言語における語数レベルの言語障壁を体系的に扱い検出しようとする最初期の計算的試みの一つです。

コクボロクの背景
言語を意味する「コック」と人間を意味する「ボロク」という言葉が組み合わさって「コック・ボロク」という複合語を形成し、これは人間を意味します。「コック・ボロク」という用語は、トリプラ州のボロク族だけでなく、隣接するバングラデシュやミャンマーの国々、さらにミゾラム、マニプール、アッサムの住民が話す言語を指します。コクボロク語は主にトリプラ語で話され、ローマ字とベンガル文字の両方で書かれています。コクボロク語話者の大多数は、ベンガル文字よりもローマ字を好んでいます。実際には、チベット・ビルマン語族として知られる中チベット語族のサブグループがコクボロク語の起源です。コクボロク語とボド語は微妙に似ています。コクボロク語の36の変種は、ボド語とカチャリ語の両方と微妙な類似点を持っています。

コロマはオリジナルのコクボロク文字として知られていました。インド唯一の州であるトリプラ州は、1949年10月15日にインド連邦に統合されるまで184人によって統治されていました。 ラージラトナカル の書物に見られるコロマ文字は、歴史的な物語を書き記すために使われたものです。その後、14世紀にスクレシュワルとヴァネスワルという二人のブラフミンがこの言語をサンスクリット語に翻訳し、さらにベンガル文字にも翻訳しました。コクボロク語には、動詞から語幹同音異義、音素声調、動詞形態論、語順、動詞派生接尾辞が生成されます。

時が経つにつれて、コクボロクは英語、アラビア語、ベンガル語、ペルシャ語などの言語に出会うようになりました。コクボロク語にはさまざまな複雑な凝集構造が見られます。トリプラ州でコクボロク語を母語とする人々は、まだ広く採用された文字体系がないため、情報に簡単にアクセスできませんが、この点は取り組まれています。

トリプラではいくつかの方言が話されています。トリプラでは、トリプラ/トリプリ、デッバルマ、レアン、ジャマティア、ウチャイ、ノアティア、ルサイ、クキス、チャイマル、ハラム、サンタル、レプチャ、チャクマ、カシア、オラン、モグ、ガロスなど様々な方言が話されています。2011年の国勢調査報告によると、インドには1,011,294人のコクボロク語話者がおり、隣国バングラデシュには40万人以上がいます。

文献レビュー
著者らは、ヒンディー語、ベンガル語、英語のコードを混ぜたFacebook投稿の新しいデータセットを用いた自動言語識別の研究について説明しています。彼らは辞書ベースのアプローチや教師あり分類など、単語レベルでの言語識別に様々な手法を試みており、こうした環境で正確な言語識別のために文脈的な手がかりを考慮する重要性を強調しています。

本論文は、語彙ベース、文字レベル、単語レベルの手法を用いたヒンディー語と英語のコードブレンドを用いて、ソーシャルメディアプラットフォーム上のヘイトスピーチを特定するための注釈付きツイートデータセットを提示します。論文では、Nグラムに基づく誤り許容テキスト分類法を紹介しています。まず、システムはトレーニングセットデータ(ニュースグループの素材サンプルやフレーズなど)を用いてプロファイルを計算し、さまざまなカテゴリを反映させます。その後、システムは分類すべき特定の文書のプロファイルを作成します。最後に、各カテゴリプロファイルとドキュメントのプロファイル間の距離測定値を計算します。文書のプロファイルに最も近いカテゴリがシステム2によって選ばれます。

特徴ベクトルを作成するために、連続単語袋やスキップグラムモデルなど、いくつかのワード埋め込み技術が比較されました。Adaboost、ランダムフォレスト、K近傍、ガウスナイーブベイズ、サポートベクターマシン、ロジスティック回帰はすべて良好なクロスバリデーションスコアを得ました。3.過去のアプローチの概要は 表1に示されています。

辞書ベースの分類器を用い、本研究は研究で評価された3つの言語ペアリング(スペイン語-英語、オランダ語-英語、ドイツ語-トルコ語)で既存の分類器を上回る成果を上げ、ソーシャルメディアデータセットを用いています本研究のアプローチは、収束性とテスト性能の一貫性においてモデルのレジリエンスが向上し、コード混合テキストにおける感情分析の現行手法を3.31%の精度で上回っています。

ダニングの画期的な研究において、言語の統計的同定は、ニューメキシコ州立大学コンピューティング研究所による技術報告書6で初めて発表されました。本論文は、英語とテルグ語の符号混合データの組み合わせに基づく、隠れたマルコフモデル、ランダムフォレスト分類器法、条件付きランダムフィールド、ナイーブベイズ分類器を用いて、さまざまな教師あり学習のタイプを分析します。論文は英語、ボド語、アッサム語を含むインドの言語に焦点を当て、コードミックスされたソーシャルメディア資料における言語認識の新しいアプローチを論じています。研究者たちは深層学習モデルで双方向長期短期記憶(Bidirectional Long Short-term Memory)を用いています。

本論文では、グジャラート語が英語やヒンディー語と混在した大規模なデータセットを用いています。彼らはさまざまな機械学習分類器を用いていました。その中でも、サポートベクトル分類器は92%の精度で最高の精度を示しました。

オランダ語・英語ツイートのコードスイッチングと借用を区別するために、別分類段階では言語学的枠組みが用いられます。ルールベースのLID、サポートベクターマシン、意思決定木分類器を用いて、DTC(マイクロF1=.95)とルールベースのLIDシステム(マイクロF1=.95)がベスト10を達成していることを学習します。

彼らのモデルのパフォーマンスは、コードスイッチ攻撃性検出TRAC-1データセット、Hinglish Offensive Tweetデータセット、ユーモア分類データセット11を用いて評価されました。成人の語彙習得における読書による定着向上のため、確率的アプローチがL2の方法論として提案されました。コードミックステキスト12。辞書モジュールが組み込まれ、ワードレベルのコードミキシングを制御するために様々な教師あり分類器のテストを行うために使われます。

彼らは様々な指標を用いてコードスイッチングパターンを分析し、スペイン語-英語およびヒンディー語-英語の両方で、ニューラルネットワークモデルは条件付きランダムフィールド(CRF)モデルよりそれぞれ2.5ポイントと3.5ポイント差で劣っていることを発見しました。

バイリンガル語彙と英語テキストを入力として用い、この手法は語彙的言及にファクターグラフを構築し、与えられた「学習可能性」パラメータを最適化するコードスイッチテキストを生成します。本論文では、ヒンディー語と英語のコードスイッチングデータの言語ペアに基づいてCanVECツールボックスの概念をより深く理解しようとしています。彼らはF1スコアで87.99パーセントの精度15.16を達成しました。

著者らはまず、グジャラート語と英語17語のコードミキシングを検証し、3段階のパイプラインを用いて各トークンの言語を特定し、正書法を正規化し、セグメントを母語の文字に再表音します。次にヒンディー語と英語のコーパス18に焦点を移し、バイリンガル文構造に特化した新しい感情検出アルゴリズムを導入します。制御された実験を支援するために、単一言語データ上でスキップグラムモデルを訓練し、出力をブレンドして合成コードミックステキストを生成する19

次に、コンカニ語-英語のソーシャルメディアデータセット20がルールベースのワードレベルの識別手法で処理され、手動注釈付きトレーニングデータなしで堅牢な性能を実現します。さらに範囲を広げる研究では、Facebook22のようなプラットフォームの英語、ヒンディー語、ベンガル語、アッサム語の大量音訳コーパスを活用し、さまざまな単語レベルのタグ付け技術を評価しています。これに基づき、別のフレームワーク23は言語間を動的に切り替え、埋め込みまたは借用されたフレーズを高精度で検出します。農業分野では、パンジャーブ語-英語のコメントは複数のモデルを用いて分類されます。その中でも、nグラム分類器が最も高い精度を提供します。シンハラ語-英語CMSTでは、アンサンブル学習器(ランダムフォレスト、SVM、ナイーブベイズ、決定木、ロジスティック回帰)が比較され、ランダムフォレストがトップ25、キャラクターレベルの埋め込みとSVMの組み合わせはタミル語-英語およびマラヤーラム語-英語ペア26で強い成果を上げています。最後に、Crúbadán Project27は、ウェブをクロールして資源不足の言語コーパスを構築する大規模な取り組みとして提示され、将来のコードミキシング研究の基盤を築きます。

データセット主な結果正確さ/F1スコア/正確さ/預知/リコール
ヒンディー語・ベンガル語・英語のデータセットはFacebook投稿から取得単語レベルのソーシャルメディアテキストにおける言語識別の課題を強調しました89.30%
ニュース記事、文書言語識別にNグラムを用いて効果的に実行される0.99%
インドのコード混合データセット単語レベルの言語識別における高い精度を示す報告されていません(NR)
ウィキペディアベースのデータセット堅牢なトークンレベルのコードスイッチ検出報告されていません(NR)
ヒンディー語・英語ツイートヒンディー語と英語の感情分類の改善 コードミックス0.78%
多言語コーパス確立された基礎的な言語識別フレームワーク78.00%
Code_mixed 英語・テルグ語データCRFは最高のパフォーマンスを達成しました89.30%
英語・ボド符号混合テキスト高い単語レベルの精度を達成92.00%
コードミックスされたグジャラート語–ヒンディー語文字文レベルの言語識別精度は≈92%です92.00%
オランダ語・英語ツイートDTCおよびルールベースのモデルはF1 ≈0.95を記録しました95.00%
コードスイッチドデータセットモデル間の競争成績報告されていません(NR)
合成コード混合テキスト語彙学習の改善報告されていません(NR)
英語・カンナダ語コード混合テキスト実効自動LID報告されていません(NR)
TRAC-1、ヒングリッシュデータセットCRFはニューラルネットワークモデルで優れた性能を発揮しました91.00%
多言語オンラインデータ正確な語レベル語識別88.00%
ヒンディー語・英語ソーシャルメディアヒンディー語-英語の言語識別における高精度0.93%
英語・グジャラート語コード - 混合効果的なバイリンガル処理
ソーシャルメディアコードミックスデータセット感情検出の改善0.90%
コードミックス合成データ強埋め込み表現報告されていません(NR)
コンカニ語と英語のコードミックス ソーシャルメディアテキスト注釈なしの堅牢な性能0.89%
Twitterからのコードミックスデータセットスイッチ検出の改善90.20%
アッサム語・ベンガル語・ヒンディー語・英語正確な多言語言語識別91.00%
ソーシャルメディアコードミックステキストF1スコア ≈0.950.95%
英語・パンジャブ語コード混合データNグラムモデルが最も優れた性能を発揮しました0.88%
シンハラ語・英語コード混合データRFは最高の精度を達成しました0.92%
Facebookのコードミックスコメント改良されたワードレベルLID0.93%
クルバダン・コーパス低資源言語研究を可能にしました報告されていません(NR)
コードミックスデータセットワードレベルの言語識別で良好なパフォーマンスが示されています0.94%

表1:コード混合言語文献概要。

アクセスが制限されています。このコンテンツを表示するにはログインするか、トライアルを開始してください。

プロトコル

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

英語とコクボロクのコード混合・コードスイッチングされたテキストは、地元の会話やソーシャルメディア上の公開投稿から手動で収集されました。個人を特定できる情報や機密情報は収集されませんでした。すべての手続きは機関の倫理ガイドラインに従って行われました。

3. 設計と実装

3.1 アルゴリズム
3.1.1 文中の各トークン(S)について:
ある。頻度辞書を用いて、語彙確率Pレクシ を計算します。
b.Nグラムモデルに基づき、文字ベースの確率P が計算されます
c. 両者の加重補間:
P結合 = λlexi Plexi + λchar Pchar
3.1.2. 各トークンの確率 組み合わせPは放出確率として格納されています。
3.1.3. ビタビ法の適用:
ある。初期言語確率を提示します。
b.各トークンについて:
i. 遷移Pカウント 遷移(同一言語継続)を計算する。
そしてPスイッチ (言語切り替えの可能性)です。
ii. 言語経路を選択し、シーケンス確率を最大化する。
3.1.4. 最大確率の言語列Lを、全体の確率が最も高いもので出力します。

3.2 計算環境
すべての実験の実装はGoogle Colabプラットフォーム上のPython 3.10を使用して行われました。このシステムは、NumPy、Pandas、Matplotlibなどの基本的なPythonパッケージを使ってデータを処理・可視化し、scikit-learn(v1.3)を使って統計的予測や解析を行いました。周波数辞書の統合、文字nグラムモデリング、ViterbiデコードはカスタムPythonスクリプトで実装されました。モデルは1万文のデータセットで訓練・テストされ、トレーニングとテストは70/30の割合で行われました。

3.3 言語識別
文がトークン化されると、言語識別モジュールは各トークンがコクボロク語か英語かを判断します。システム全体のアーキテクチャは 図1に示されています。この言語割り当てを用いて、どの文字起こしモジュールが適切かを判断します。文字nグラムモデルと周波数辞書のデータを統合することで、トークンの言語が決定されます。

上記の2つの言語間の正書法の違いが大きいため、文脈的特徴を一切持たずにトークン自体の情報のみを使用する分類器はすでに良好に機能します。しかし、初期割り当ての後、ヴィタービアルゴリズムを用いた別の分類器が適用されます。この第二の分類器は、同語間語の誤分類を減らし、同じ言語に属する語のグループ化を有利にします。

figure-protocol-1
図1:Viterbiアルゴリズムリットムを用いた 単語レベルのパターン言語切り替えペナルティ。 この図の拡大版はこちらをクリックしてください。 

figure-protocol-2
図2:符号混合文の言語識別方法。この図の拡大版を見るにはこちらをクリックしてください。

辞書と文字モデルのためにCrúbadánコーパス27からデータを収集しました。このコーパスには、コクボロクのような少数民族言語を含む多くの言語が含まれています。

Crúbadánコーパスのデータセットは目的に不十分であるため、新しいコクボロク聖書データセットをテストしました。他の言語と比べて、利用可能な資料は比較的少ないです。したがって、本論文の混合文のデータは、プラチナジュビリー、ポピュレーショングループ、レストレーション・インターナショナル・グループ、クムルング、デパチャラ・バプテスト協会、ユナイテッド・ティプラサ・フォーラム(UTF)、デパチャラ・ユース・フェローシップ、クリシュナ・ナガール(EU)、ウチョイ・クリスチャン・フェローシップ(UCF)、ティプラ・クワスラン・ボドル、トライバル・エンジニアリング・ソサエティ、国立工科大学学生ボロク、インフォメーション・ヤルング、トリプラ・ウチョイ青年協会(TUYA)など、コクボロク語を話すWhatsAppグループから収集されました。

2021年8月から2023年12月の間に、これらのWhatsAppグループからコクボロク語と英語のコードミックス文合計1万件が収集されました。データセットの出典およびドメイン分布は 表2に記載されています。

名称総語数
コクボロク聖書の言葉718883
英語とコクボロクのコードミックス文68789

2:クボロクの総語数。

言語トータルトークン
コクボロク(TRP)711509
英語(英語)1767141

3:文字2グラムモデル。

いや、いいえ使用されるトータルコードミックス文
110,768

4:訓練された混合数。

キャラクターモデルと辞書はクルバダンのコーパス27から取られています。このコレクションは、多数の少数言語を含む幅広い言語でアクセス可能で、対象言語の資料をインターネット検索することで自動的に作成されます。特にコクボロクのコーパスは比較的小さいですが、このアプローチはもともとコクボロクのために作られました。

コクボロク語と英語のコーパスも存在しますが、特にコードミキシングやコードフリッピングの観点からデータセットが不足していたため、意図的に使用されませんでした。コクボロクのコーパスにはいくつかの英語用語も存在します。これらの単語( nodooなど)は英語コーパスよりも一般的です。

辞書と言語モデルは、個々の単語に依存しないラベル付けの役割を果たします。私たちの課題はKingらのものと比較されます。

語彙(lex)、文字(ch)、単語ラベルの確率は、語彙(ch)成分と語彙成分(lex)の周波数間に線形補間を作成するために利用されます。この組み合わせによる(コーム)確率は以下の式(1)に示されています。詳細な補間パラメータは 表3に示されています。補間戦略は 図2に示されています。

Pの結合 = λlexi ·Plexi + λchar ·Pキャラ(1)

ここで 0 ≤ λlexi、λchar ≤ 1;λlexi + λchar = 1。語彙的基盤のない単語は、語彙的確率が非常に低いがゼロではない。おそらく、両方の語彙言語に単語が欠けている場合、λlexi = 1であっても語彙確率ではなく文字モデルが実装に用いられると考えられます。

文字モデルの開発方法は、ダニングの文字nグラムマルコフ連鎖(1994年)に基づいています。これは、トークンの開始と終了時にそれぞれnグラムをカウントすることで、初期確率と遷移確率を推定することで実現されます。

訓練済みの2グラムモデルと4グラムモデルの性能比較は以下の通りです。

figure-protocol-3   (2)

figure-protocol-4·

figure-protocol-5 (3)

確率の初語と遷移語を掛け合わせると、言語モデル(4)を用いて単語の出現確率を得られます。

P(〈w1w2w3〉) = Pイニシャル(w1w2) ·P遷移(c3|〈w1w2)·P遷移(〉|1勝2敗3)(4)

コクボロク語は接頭辞や接尾辞が非常に豊富で、「o」「do」「no」といった接尾辞が基本語に付加される形態学的に粘着性のある言語です。2グラムは接尾辞境界での局所的な形態的遷移を効果的に捉え、4グラムはファイライディド、タンライナイムチャンカなどの語根や複合語に見られるより長い正書法依存を持つコクボロク語を捉えることができます。

これは大規模なコーパスに適用され、複数のデータ希薄性問題が起こる可能性が高まります。さらに、その文字の組み合わせがすべてのケースに現れるわけではなく、その場合確率がゼロになることもあります。ラムダ平滑化は、見えない文字を含む各nグラムに小さな値をゼロでない確率で付与することで、こうした問題を解決するために用いられます。ラムダの値は0.001に設定されています。

figure-protocol-6  (5)

ここで N = は n-グラムにおける異なる観測値の量を表します。

figure-protocol-7   (6)

ここでD=はnグラムで検出された差分の数です。観測されていないnグラムの確率は同じであると仮定されます。

figure-protocol-8   (7)

ここでCは文字サイズを示します。

Pcountλlexi、λcharの初期値は、Kokborokおよび英語コーパスの頻度解析によって経験的に設定されました。まず、λlexiを0.5に初期化し、語彙ベースと文字ベースの確率の両方に重み付けを行い、最初の実行では両者が同等に寄与するようにしました。この初期化レベルにより、データセット間の辞書と文字nグラムモデルの役割を比較することができました。

遷移パラメータ Pcount (同じ言語で継続)は、手動マーキングデータセット内の単一言語シーケンスとスイッチポイントの比率に基づいて0.6に設定されました。これらの値はチューニング時の収束の良い出発点となりました。その後、すべてのパラメータを繰り返し試行し、マシューズ相関係数(MCC)を最大化し、結果のセクションで詳細に示しました。

文脈的識別
コンテキストモデルは、独立識別フェーズで既に初期化された確率(Pcount および Pswitch)を使用し、Viterbi列デコードでそれらを精緻化することで遷移の不整合を減らし、言語切り替えを最適に検出します。

言語モデルの解析出力は文脈依存であり、主に現在のトークンとその後のトークンを組み合わせ、前後のトークンを組み合わせて得られます。同じ頻度値を持つ2つの単語が似た意味を持ち誤分類を引き起こす可能性があるため、文脈依存アプローチを用いて両言語に存在する類似項を見つけ出しました。

「no」「do」「o」「are」「da(日)」「go(行け)」「sa(言)」「rose(蔷薇)」「ring」など、多くの単語は両言語で似ています。そのため、このような曖昧さが生じたときに正しい言語を特定するのは非常に困難になり、時には言語が誤って分類されることもあります。

これらの言語識別の問題に対処するため、判別的隠れマルコフモデルと教師あり機械学習を用いた言語モデル群を提示しました。両言語の遷移確率は同じと仮定されます。同じ言語の Pcountの場合、継続確率が宣言すべき主要なパラメータです。これにより、言語を切り替える可能性を計算できます。

Pスイッチ = 1 − Pカウント(8)

ビタービ経路を用いた文脈分類は 図3に示されています。Viterbiアルゴリズムの目的は 、PcountPswitchに基づいて、トークン列の言語のうちどれが最適かを判定することです。

ヴィタービアルゴリズムは文脈分類に適用されます。 PcountPswitch はエッジにラベル付けに使われ、ノードは最初の分類器によって割り当てられた相対尤度でラベル付けされます。

コクボロク言語の使用可能性が高いため、最初の分類器のみが使用され、文脈情報が得られない場合は破線パスが選ばれました。

文脈に基づく調整の影響は 図4に示されています。これは、文脈情報がなければ「 Next week o phaisidi do」 というフレーズの2番目、3番目、5番目の単語が誤って英語(en)(破線)と識別されることを示しています。英語の方が確率はやや高いものの、相対的な値は近いです。

2つの言語シフトはペナルティを受け、遷移確率も考慮に入れた場合、その列の確率はヴィタービアルゴリズムの最適経路よりも低くなります。したがって、共通語が両言語に現れるよりも、他の言語から派生する可能性が大幅に高い単語だけが、短い連続で言語変化を引き起こす可能性があります。

マシューズ相関係数は、正確さ、想起率、正確性などの他の指標と比較して、真陽性・真陰性、偽陽性、偽陰性を考慮し、二値分類タスクに著しく適しているため、評価指標として選ばれました。

figure-protocol-9   (9)

アクセスが制限されています。このコンテンツを表示するにはログインするか、トライアルを開始してください。

結果

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

表4では、PtrpのMCCスコアとパラメータ調整結果を示しており、Kokborok語の開始配列への初期バイアスを計算し、同じ言語で継続する確率であるPcountを算出しました。

λ_lexPcount = 0.66Pcount = 0.70Pcount = 0.74Pcount = 0.79Pcount = 0.82Pcount = 0.86Pcount = 0.90Pcount = 0.92Pcount = 0.94
00....

アクセスが制限されています。このコンテンツを表示するにはログインするか、トライアルを開始してください。

ディスカッション

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

提案されたモデルは単語レベルで 93.15% の精度を示していますが、誤りの徹底的な分析により、英語とコクボロクのコードミックス言語識別の課題を浮き彫りにするいくつかの繰り返されるパターンが明らかになります。

借用語と曖昧な言葉の使用
誤りの多くは、コクボロク語で一般的になっている借用語の英語の単語の使用から生じています。ノーオ、ゴーリングローズアーといった単語は両言語で頻繁に登場し、同義語として同義語として使われることもあります。

これらの単語は、類似した正書法パターンや高い文脈頻度のために、システムによって誤分類されることもあります。例えば、Kokborokの接頭辞 do (命令文マーカー)は英語の助動詞 doと...

アクセスが制限されています。このコンテンツを表示するにはログインするか、トライアルを開始してください。

開示事項

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

著者には利益相反を主張するものはありません。

謝辞

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

地元のネイティブスピーカー、WhatsAppグループ、団体、学生組合、そしてインド聖書協会の皆様に感謝いたします。コードミックスされた文の生データセットの入手に協力していただきました。また、アルナーチャル・プラデーシュ州国立工科大学のコンピュータサイエンス・エンジニアリング学科とラブリープロフェッショナル大学にも、データセットの検証とテストの場を提供していただき感謝しています。

アクセスが制限されています。このコンテンツを表示するにはログインするか、トライアルを開始してください。

材料

この記事で使用された材料の一覧
名前会社カタログ番号コメント
ラズベリーパイ4ラズベリーパイ財団RPI4-MODBP-4GB低リソース言語処理に使用
MicroSDカード 64GBサンディスクSDSQUAR-064G-GN6MAOSおよびデータセットの保存のために
電源 5V/3A公式ラズベリーパイSC0218円周率ボードに電力を供給するために
USBマイクボヤBY-M1言語データ収集における音声入力
モニター(HDMI)LG22MK600Mテスト中の出力表示
キーボード&マウスコンボロジクールMK270インターフェース制御
WiFiドングル(Pi 3の場合)TP-リンクTL-WN725Nワイヤレスデータ転送(オンボードWiFiがない場合)
Python IDE(Thonny)オープンソース-プログラミング用のIDE
レキシコンデータセットカスタムビルド-コクボロクと英語のペア
Nグラムデータセットカスタムビルド英語とコクボロク語のペア
コード混合とコードスイッチカスタムビルド1万文ソーシャルメディアのテキスト、Whatsappのグループ、NGO、聖書などから収集しています

参考文献

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Code mixing: a challenge for language identification in the language of social media. Barman, U., et al. Proc 1st Workshop Comput Approaches Code Switch, , (2014).
  2. N-gram-based text categorization. Cavnar, W. B., Trenkle, J. M. Proc SDAIR-94 3rd Annu Symp Document Anal Inf Retr, 161175, 14(1994).
  3. Word level language identification in code-mixed data using word embedding methods for Indian languages. Inumella, C., et al. Proc Int Conf Adv Comput Commun Informatics (ICACCI), , IEEE. (2018).
  4. Claeser, D., Felske, D., Kent, S. Token level code-switching detection using Wikipedia as a lexical resource. Proc Int Conf German Soc Comput Linguist Lang Technol, , Springer. (2017).
  5. Dahiya, A., et al. Curriculum learning strategies for Hindi-English code-mixed sentiment analysis. Proc Int Joint Conf Artif Intell, , Springer. (2019).
  6. Dunning, T. Statistical identification of languages-Technical Report MCCS 94-273, Algorithms-computer science. , Computing Res Lab. (1994).
  7. Gundapu, S., Mamidi, R. Word level language identification in English Telugu code-mixed data. arXiv preprint. , (2020).
  8. Word level language identification on code-mixed English-Bodo text. Kalita, N. J., Agarwala, A. G., Das, J. IOP Conf Ser: Mater Sci Eng, 1020 (1), (2021).
  9. Sentence level language identification in Gujarati-Hindi code-mixed scripts. Kazi, M., Mehta, H., Bharti, S. Proc IEEE Int Symp Sustain Energy Signal Process Cyber Secur (iSSSC), , IEEE. (2020).
  10. Incorporating code-switching and borrowing in Dutch-English automatic language detection on Twitter. Kent, S., Claeser, D. Proc Future Technol Conf, , Springer. (2018).
  11. Machine learning based language modelling of code switched data. Kumar, V., et al. Proc Int Conf Electron Sustain Commun Syst (ICESC), , IEEE. (2020).
  12. Generating code-switched text for lexical learning. Labutov, I., Lipson, H. Proc 52nd Annu Meet Assoc Comput Linguist, , (2014).
  13. An automatic language identification system for code-mixed English-Kannada social media text. Sowmya, B. S. L., Shambhavi, B. R. Proc 2nd Int Conf Comput Syst Inf Technol Sustain Solut (CSITSS), , IEEE. (2017).
  14. Language identification and analysis of code-switched social media text. Mave, D., Maharjan, S., Solorio, T. Proc 3rd Workshop Comput Approaches Linguist Code-Switch, , (2018).
  15. Word level language identification in online multilingual communication. Nguyen, D., Dogruöz, A. S. Proc Conf Empir Methods Nat Lang Process (EMNLP), , Assoc Comput Linguist. (2013).
  16. Li, N., et al. Automatic language identification in code-switched Hindi-English social media text. J Open Humanit Data. 7, (2021).
  17. Language identification and translation of English and Gujarati code-mixed data. Patel, D., Parikh, R. Proc Int Conf Emerg Trends Inf Technol Eng (ic-ETITE), , IEEE. (2020).
  18. Domain-specific sentiment analysis approaches for code-mixed social network data. Pravalika, A., et al. Proc 8th Int Conf Comput Commun Netw Technol (ICCCNT), , IEEE. (2017).
  19. Word embeddings for code-mixed language processing. Pratapa, A., Choudhury, M., Sitaram, S. Proc Conf Empir Methods Nat Lang Process, , (2018).
  20. Word level language identification system for Konkani-English code-mixed social media text (CMST). Phadte, A., Wagh, R. Proc 10th Annu ACM India Compute Conf, , (2017).
  21. Estimating code-switching on Twitter with a novel generalized word-level language detection technique. Rijhwani, S., et al. Proc 55th Annu Meet Assoc Comput Linguist, , (2017).
  22. Word level language identification in Assamese-Bengali-Hindi-English code-mixed social media text. Sarma, N., Singh, S. R., Goswami, D. Proc Int Conf Asian Lang Process (IALP), , IEEE. (2018).
  23. Sarma, N., Singh, R. S., Goswami, D. SwitchNet: Learning to switch for word-level language identification in code-mixed social media text. Nat Lang Eng. 28 (3), 337-359 (2022).
  24. Sentiment analysis of English-Punjabi code mixed social media content for agriculture domain. Singh, M., Goyal, V., Raj, S. Proc Int Conf Inf Syst Comput Netw (ISCON), , IEEE. (2019).
  25. Language identification at word level in Sinhala-English code-mixed social media text. Shanmugalingam, K., Sumathipala, S. Proc Int Res Conf Smart Comput Syst Eng (SCSE), , IEEE. (2019).
  26. An effective way of word-level language identification for code-mixed Facebook comments using word-embedding via character-embedding. Veena, P. V., Kumar, M. A., Soman, K. P. Proc Int Conf Adv Comput Commun Informatics (ICACCI), , IEEE. (2017).
  27. The Crúbadán Project: Corpus building for. Scannell, K. P. Proc Web Corpora Workshop (WAC3-2007), , Presses Univ Louvain. (2007).
  28. The IUCL+ system: Word-level language identification via extended Markov models. King, L., et al. Proc 1st Workshop Comput Approaches Code Switch, , (2014).

アクセスが制限されています。このコンテンツを表示するにはログインするか、トライアルを開始してください。

再版と許可

このJoVE記事のテキストまたは図の再利用許可をリクエスト

許可をリクエスト

タグ

N
動画は近日公開

関連記事