この研究は、外国語アクセントの影響がメトリックと韻律音響パラメータの両方、および音声ラインナップのターゲット音声の選択にどの程度影響するかを確認するために、L1-L2-EnglishとL1-L2ポルトガル語を比較することを目的としています。
方法論記事
この研究は、外国語アクセントの影響がメトリックと韻律音響パラメータの両方、および音声ラインナップのターゲット音声の選択にどの程度影響するかを確認するために、L1-L2-EnglishとL1-L2ポルトガル語を比較することを目的としています。
本研究は、外国語アクセントの英語と外国語アクセントのブラジルポルトガル語の韻律音響的特徴と知覚的相関性の両方を調べ、話者の外国語アクセントとネイティブアクセントの制作がリスナーの知覚とどのように相関しているかを確認することを目的としています。方法論では、L2ブラジルポルトガル語のアメリカ人グループとL2英語のブラジル人グループとの音声生成手順と、両方の言語の音声ラインナップを実行する音声認識手順を実行しました。音声生成統計分析では、一般化加法モデルを実行して、反対クラスの共変量の平滑化効果を制御する特徴の各クラス(メトリックまたは韻律音響)に対する言語グループの影響を評価しました。音声知覚統計分析では、Kruskal-WallisテストとPost-hoc Dunn'sテストを実行して、リスナーが判断するスコアに対するラインナップの音声の影響を評価しました。それにもかかわらず、コサイン距離とユークリッド距離に基づく音響(音声)類似性テストを実施しました。その結果、f0のばらつき、持続時間、および声質の点で、言語グループ間で大きな音響的違いが示されました。ラインナップについては、f0、強度、および音声品質の韻律的特徴がリスナーの知覚判断と相関していることが示されました。
アクセントは、母国語(L1)と外国語(L2)の両方で、コミュニケーションと流暢さの顕著でダイナミックな側面です。1。外国語アクセントは、ターゲット言語のL2音声機能を表し、話者のL2経験、話し方、入力品質、説明などの変数に応じて(時間の経過とともに)変化する可能性があります。外国語アクセントは、外国語話者によって生成された L2 音声と、ターゲット言語のローカルまたは参照アクセントとの間の (スカラー) 程度として定量化できます2,3,4,5.
この研究は、外国語アクセントの英語と外国語アクセントのブラジルポルトガル語(BP)の韻律音響的特徴と知覚的相関の両方を調べるとともに、話者の外国語アクセントとネイティブアクセントの制作がリスナーの知覚とどの程度相関しているかを確認することを目的としています。法医学分野の先行研究では、外国語のアクセント識別における母音と子音の堅牢性は、個人の長期的な分析に対して安定している(The Lo Case6)、話者の高いID精度を参照している(The Lindbergh Case7)ことが示されています。しかし、持続時間、基本周波数(f0、つまりピッチの音響相関)、強度、および音声品質(VQ)に基づく韻律音響特性の探求は、ますます注目を集めています8,9。したがって、この研究における韻律音響機能の選択は、法医学音声学の分野で有望な道筋を表しています8,10,11,12,13.
本研究は、法医学的なケースにおける音声変装の一形態としての外国語アクセントに特化した研究によって支えられています14,15、および話者認識のための音声ラインナップの準備16,17。たとえば、ドイツ語、イタリア語、日本語、ブラジル語の英語話者の識別には、発話速度が重要な役割を果たしました18,19,20,21,22.発話速度に加えて、脳と認知基盤が記憶、注意、感情に欠損しているため、長期のスペクトルとf0の特徴は、ターゲット言語に精通しているL2に熟練した話者に挑戦します。これは、長時間の話しかしゃぶり23。法医学分野での外国語アクセントの見方は、実際に外国語アクセントのように聞こえるものの定義は、外国語アクセントのスピーチが極端にない程度にあるのではなく、リスナーのなじみのなさに大きく依存するということです24。
知覚領域では、1990年代半ばから犯罪者の認識に使われる一般的な法医学ツールは、犯罪現場で加害者を特定するために使用される視覚認識に類似した音声ラインナップ(聴覚認識)です16,25。ボイスラインナップでは、容疑者の声は、年齢、性別、地理的位置、方言、文化的地位などの社会言語学的側面で類似したフォイルと一緒に提示され、目撃者による識別に使用されます。音声ラインナップの成功または失敗は、音声サンプルの数とサンプルの持続時間によって異なります25,26。さらに、実際のサンプルでは、音声品質が一貫して音声認識の精度に影響を与えると考えられます。オーディオ品質が悪いと、voice27 の固有の特性が歪む可能性があります。音声の類似性の場合、f0 に基づく詳細な音声の詳細は、音声認識中にリスナーを混乱させる可能性があります28,29。このような音響的特徴は f0 を超えて拡張され、持続時間の要素と、強度と VQ30 のスペクトル特徴が含まれます。この複数の韻律的特徴のビューは、フォレンジック音声比較のコンテキストで、正確な話者識別を確保するために重要です9,14,15,29,31.
要約すると、法医学的音声学の研究は、過去数十年にわたって外国語のアクセントの識別に関していくつかのバリエーションを示しています。一方では、外国語のアクセントは話者を識別するプロセスに影響を与えないように思われます32,33(特に、話者が対象の外国語のアクセントに詳しくない場合34)。一方、逆方向の調査結果があります12,34,35。
この研究は、ヒト研究倫理委員会から承認を得ました。さらに、この研究に関与したすべての参加者から、データの使用と公開についてインフォームド コンセントが得られました。
1. 音声生成
注:グループ1の「L1 English-L2 BP」のリーディングタスクから音声を収集しました:The American English(米国から)のSピーカー(AmE-S)と、グループ2の「L1 BP-L2 English」の両方の「L1 BP-L2 English」:Brazilian Speakers(Bra-S)。音声生成のフローチャートについては、図 1 を参照してください。

図 1: 音声生成の概略フローチャート。 この図の拡大版を見るには、ここをクリックしてください。

図2:MAUS強制整列機能を使用した音声整列のスクリーンショット(A)破線の長方形は、'my_file.wav'/' my_file.txt'ファイルをドラッグ&ドロップしたり、フォルダからそのようなファイルを検索するために内部をクリックするためのものです。アップロードボタンは赤い矢印で示されます。(B)パネルAからアップロードされたファイル(青い矢印を参照)、使用するパイプライン、ファイルのペアの言語、返されるファイル形式、およびすべてのファイルを保持するための「true / false」ボタン。(C) チェックボックスの使用条件 (緑色の矢印を参照)、[Web サービスの実行] ボタン、および結果 (ダウンロードする TextGrid ファイル)。この図の拡大版を表示するには、ここをクリックしてください。

図3:再調整手順のスクリーンショット。(A)再調整手順の入力設定フォーム。(B)部分波形、f0(青)輪郭の広帯域スペクトログラム、および層1としてセグメント化(およびラベル付け)された6つの層:母音の開始から次の母音の開始(V_to_V)の単位。母音の開始(V_to_V);ティア2:母音(V)、子音(C)、および一時停止(#)の単位。Tier 3:音声表現V_to_V;Tier 4:テキストからのいくつかの単語。Tier 5:テキストからの音声のいくつかのチャンク(CH)。tier 6: 女性の AmE-S によって生成された各音声チャンクの最高音 (H) と最低音 (L) を含む声調層。(C)音響特徴の自動抽出のための入力設定。この図の拡大版を表示するには、ここをクリックしてください。
2. 音声認識
注:アメリカ人リスナーと英語で4つの音声ラインナップを、ブラジルのリスナーとBPで4つの音声ラインナップを実施しました。音声認識のフローチャートについては、図 4 を参照してください。

図 4: 音声知覚の概略フローチャート. この図の拡大版を見るには、ここをクリックしてください。

図 5: 音声認識のためのディレクトリ設定。ラインナップフォルダ。各フォルダには、6 つの L1 音声、L2 ターゲット音声、"CreateLineup" スクリプト、音声ラインナップ オーディオ ファイル (スクリプトの実行後に返される) が含まれています。この図の拡大版を表示するには、ここをクリックしてください。
音声生成の結果
このセクションでは、統計的に有意な韻律音響機能とリズムメトリクスのパフォーマンスについて説明しました。そのような韻律の特徴は、持続時間に関連する音声、明瞭度、一時停止率、および音声品質に関連するきらめきでした。リズムメトリクスは、音節の長さの標準偏差(SD)、子音のSD、発声または子音の持続時間のSD、および音節の長さの変動係数でした(補足表S1を参照)。
発話速度 (図 6A) は、L1-L2 BP よりも L1-L2 英語の方が急速に減少しますが、 どちらの L2 でもその速度は低くなります。音声速度は、音節の長さの SD (SD-S)、母音の SD (SD-V)、音節変動係数 (Varco-S) の 3 つのメトリックに関連しています。また、AmE-SグループとBra-Sグループの両方がL2に習熟していることを覚えておくことも重要です。このような速度は、音節の長さの値が高いことと、L1-L2 BPによって生成される変動性が低いことに影響され、傾斜が緩くなるようです。
アーティキュレーションレート (図 6D) は、SD-S、Varco-S、および音節リズム比 (RR-S) に関連しています。RR-Sは、短い音節と長い音節の比率を表します。このようなメトリクスは、文の長さや長さのばらつきにより、L2音声計画やL2認知負荷9,23,54に対して、影響を受ける音声速度と同様に、アーティキュレーション率に影響を与えるようです。韻律音響パラメータが影響を受けるような方法で、文の長さの領域ではより高い認知言語的負荷が必要になるかもしれません55。
音声とアーティキュレーションの速度の韻律音響的特徴に関して、私たちの調査結果は、話者が音節(および母音)の長さを変化させるほど、そのような速度が低くなることを示唆しています。我々は、L1 BPとL2 BPの両方の音声知覚は、L1とL2-Englishよりもやや遅く、L1-Englishは他のすべての言語レベルよりも速く聞こえるという仮説を立てています。この事実は、発話リズムと、L1-L2 BPがリズム連続体の音節タイミングの極に傾いているのに対し、L1-L2英語はストレスタイミングの極に向かって移動するという仮説に関連している可能性があります21,22。
ローカルシマー 図 6B は、SD-S と Varco-S の影響を受けます。Local shimmerについては、Bra-S、L1-BP、L2-Englishの両方のプロダクションは、音節の持続時間の変動性が増加するにつれて、やや単調な軌道を示します(SDとVarco、補足表S1を参照)。Bra-Sのプロダクションを聴くと、8.5〜9 dBの範囲の変動が少ないため、ボーカルの努力の認識が明らかになる場合があります。Bra-Sの音声は、音声負荷の影響を受けます。L1-BPは、文の長さが音節の長さの大きな変動にあまり敏感でないことに大きく影響されます(BPのリズムパターンは音節の変動が少ない22,56)。
ポーズ率 (図 6C) は、L2-英語の話者が L1-English、L1-BP、L2-BP のもの (L1-英語で平均 30 ミリ秒、L1-BP で 50 ミリ秒、L2-BP で 100 ミリ秒) よりも長い一時停止 (200 ミリ秒から 375 ミリ秒) を生成することを示しています。この場合、言語計画は、脳の活動の増加により、L2-英語の生成に影響を与えた可能性があります54,57。言語能力が高いほど、読み取り速度とspan54;それにもかかわらず、第二言語に堪能な話者であっても、読解課題は外国語スピーチの高次認知的側面と言語処理においてより多くの努力を示しました54,57。私たちの調査結果は、少なくとも予備的には、L2-BPスピーカーは、両方の言語のリズムパターンの違いにより、L2-英語よりも一時停止による影響が少ない可能性があることを示しています。

図6:韻律音響の特徴のための一般化加法モデル。 Y軸では、応答変数(モデル化する音響特徴)。X 軸には、予測変数 (因子 'Language' と、曲線の形状と軌跡を提供する加法モデル内の共変量 (つまり、平滑化効果: 'Language + 共変量')、および 'Language' の積と、応答変数のより正確な射影を提供するメトリック特徴 (つまり、 factor-smooth interactions: 'covariate:Language')。略語: GAMs = Generalized Additive Models.この図の拡大版を表示するには、ここをクリックしてください。
リズムメトリクスに関連して、SD-S (図 7A) の場合、話者が f0 曲線を変化させ、発話速度を増加させるほど、すべての言語レベルで SD-S が減少することが明らかになりました (これは 図 6A の鏡像効果)。子音のSDの場合(SD-C, 図7C)、L1-BPはL1英語とは対照的に、発話速度や一時停止時間が長くなるにつれて変動が小さくなります。このようなSDの方向は、L1-英語の音節の持続時間の変動が(統計的に)L1-BP44,58よりも有意に高いことから予測されます。Varco-S (図 7B および補足表 S1) は、同じ言語グループの L1 と L2 といくらか相関しているように思われます。f0の変動性と発話速度が増加すると、L1-BPではVarco-Sが減少し、L2-BPでは減少して減衰するように見えます。英語のプロダクションでは、f0の変動性と音声速度が増加しますが、L1-英語とL2-英語ではVarco-Sが増加および減衰します。
母音または子音のSDについて(SD-V_C、図7Dおよび補足表S1)について、我々の結果はVarco-Sの性能(図7B)といくつかの類似性を示している。たとえば、音声速度、一時停止時間、および f0 の変動性が高いほど、L1-BP と L2-BP の SD-V_C のフォール - ライズ トラジェクトリが促進されます。英語の作品では、このような韻律的な特徴が高い一方で、SD-V_Cはわずかに減少し、L1-英語では減衰し、わずかに増加し、L2-英語では減衰します。Varco-SとSD-V_Cの同じ言語グループのL1-L2との相関関係は、バックグラウンドノイズによる音声の音響パラメータの変化を指すロンバード効果によって部分的に説明できるかもしれません59。
外国語のスピーチでは、タスクの複雑さ(例えば、リーディングスピーチ)に応じて、話者はL1とL2の両方で同様の音響戦略を使用しています59,60。一方で、マルクーとアーネストスは、L2ロンバード語のスピーチにおけるf0の測定値(範囲と中央値)が、L2英語話者が彼らのL1オランダ語61,62の影響を受けていることを発見しました。一方、より最近の知見では、L2を話すときの認知負荷が高いため、L2ロンバード語の話し言葉はL1のロンバード語の話し方とは異なると予想されるが、L2英語話者はL1英語話者と同じ方向にロンバード語の話し言葉を発した63が提案されている。私たちの調査結果がMarcouxとErnestus63と一致し、Waaning59、Villegasら60、およびMarcouxとErnestus61,62からどの程度一致しているかについては、さらに調査が必要です。

図7:メトリック特徴の一般化加法モデル。Y軸では、応答変数(モデル化されるメトリック特徴)。X 軸には、予測変数 (因子 'Language' と、曲線の形状と軌跡を提供する加法モデル内の共変量 (つまり、平滑化効果: 'Language + 共変量')、および 'Language' の積と、応答変数のより正確な射影を提供するメトリック特徴 (つまり、 factor-smooth interactions: 'covariate:Language')。略語: GAMs = Generalized Additive Models.この図の拡大版を表示するには、ここをクリックしてください。
音声知覚の結果
BP ボイスのラインナップに関連して、ラインナップ #1 (図 8A) では、フォイルボイス #3 がターゲットボイスと判断されました。実は、ターゲットの声は#4でした。結果は、ホイル#3(83%)とターゲット音声#4(71%)との間に統計的に有意な差(補足表S1を参照)を示していません。ラインナップ #2 (図 8B) では、 ターゲット音声 #3 (40%) とフォイル #4 (20%) との比較でも、英語の音声ラインナップに統計的に有意な差は見られませんでした (補足表 S1 参照)。ラインナップ #1 (図 9A) では、フォイル #2 (26%) とターゲット音声 #4 (54%) の間に有意差はありませんでした (補足表 S1 参照)。
音声類似度の解析では、コサイン類似度(CoSim)とユークリッド距離(EucDist, [EucDist transformed]54)の両方が、ホイル#3とBPラインナップ#1のターゲットとの間に一貫した相関関係を示しました(CoSim = 0.99;EucDist = 77.4, [0.93])。ホイル#4とターゲットの相関は、BPラインナップ#2でも同様に強かった(CoSim = 0.99、EucDist = 76.3、[0.93])。英語のラインナップ #1 では、相関は CoSim (0.83( 0.83)で一貫していましたが、EucDist (213.0 [0.47] では弱かったり満足したりしました。全体として、CoSim と EucDist はどちらも、音声の類似性を判断する上で満足のいく手法でした。さらに、GahmanとElangovan52(補足表S1を参照)で指摘されているように、CoSimはわずかに効果的に機能しました。
類似性の観点から、誤報の増加につながったのは何でしょうか?韻律音響の特徴は、フォイルとターゲットボイスが(統計的に)有意に異なるパフォーマンスを発揮したにもかかわらず、図8A,Bおよび図9A)の異なるフォイルによって、リスナーの選択肢が多少多様化しているという証拠を示しました(図8C,D、および図9B)-D) です。このような判断は、韻律音響の特徴のクラス全体よりも、スピーカーが共有する1つ(またはおそらくそれ以上)の特定の音響機能に依存しているようです。たとえば、私たちの研究では、プロダクション間で(共)異なるいくつかの特徴が示されました。それにもかかわらず、知覚結果は、特定のフォイルがターゲットの音声に一致するかどうかの判断の好みを示しています8,35,64,65。今後の研究には、さらなる分析が必要である。
音響類似性のための多次元パラメトリック行列の選択を検討することは注目に値します66 この研究で提示されたものとして。私たちの調査結果は、f0、VQ、および強度に基づく音響特性を使用した以前の研究と一致しています9,35。このような機能は、法医学分野での話者比較タスクに顕著に推奨されます9,66。それにもかかわらず、現在の研究では、マクファーレンのガイドライン<の変種である sup class="xref">16,17 のバリエーションを使用して、外国語アクセントの話者認識のための音声ラインナップを準備しましたが、現在の研究では、どのフォイルもターゲット音声と類似していないことを強調することが重要です。さらに、私たちの声のラインナップ手順には、刺激の長さ、声の数、フォイルの選択(ここではランダム化)、話し方など、マクファーレンのガイドラインとの重要な違いが含まれていることを強調しなければなりません。
f0の韻律音響的特徴がどの程度リスナーの知覚に関連しているかは、研究で使用された話し方に大きく依存します。ここでは、リーディングパッセージを使用しました。大多数の耳の目撃者研究は、バランスの取れた解決策として(半)自発的な刺激を選択しています-例えば、DyVisコーパス67-これは現代の耳の目撃者の調査で広く採用されています28,68。私たちが読書課題を選んだ理由は、この原稿が書かれた時点では、私たちのコーパスが読書課題から得られたデータのみで構成されていたからです。ただし、(半)自発的なコーパスを編集するプロセスがすでに進行中であることを認識することが重要です。さらに、物語を読むという行為は、話者内と話者間の両方で、信頼できるレベルの均一性とバリエーションを生み出すことができます。これにより、音声比較を含む状況で、韻律的または音声的特性(個別または方言)に重点を置くことが容易になります。これは、外国語アクセントの生成中に声に負荷がかかる場合に特に顕著になり、熟練した話者の間でも顕著になります8,9,23,54。

図8:ブラジルのリスナーが行った4つのラインナップの結果を含む棒グラフ。 (A,B)ターゲット音声(青)とフォイル(水色)の間に有意差はありません。(C,D)箔押しとは大きく異なり、ターゲットボイスとしている。略語: NS = 非有意。この図の拡大版を表示するには、ここをクリックしてください。

図9:アメリカのリスナーが行った4つのラインナップの結果を含む棒グラフ。(A)ターゲット音声(赤)とホイル(ピンク)の間に有意でない差。(B、C、D)フォイルとターゲットボイスとの大きな違い。略語: NS = 非有意。この図の拡大版を表示するには、ここをクリックしてください。
補足表S1:音声生成統計 - 一般化加法モデル(GAM):F統計(自由度)、統計的に有意な各韻律音響特徴の調整済みR2(図6)、リズムメトリック(図7)) と、各滑らかな用語 (共変量) の個々の値が含まれます。音声知覚統計: Kruskall-Wallis χ2 統計 (自由度)、p 値、および調整された η2、およびターゲットとフォイル音声のペア (図 8) と 図 9) のペア間の各統計的に有意でない差 (図 9) のポストホック Dunn 検定 (strong class="xfig"図 9A<)).各ラインナップのコサイン距離とユークリッド距離の音響類似度行列。この図の拡大版を表示するには、ここをクリックしてください。
現在のプロトコルは、(法医学的)音声学の分野に目新しさをもたらします。それは、生産に基づくフェーズ(音響分析)と知覚に基づくフェーズ(判断分析)の2つのフェーズに分かれています。生産分析フェーズは、統計に加えて、データ準備と強制アライメント、再アライメント、および韻律音響特徴の自動抽出で構成されます。このプロトコルは、主に手動のセグメンテーションに基づく従来のプロトコルよりも高速かつ効率的な方法で、データ収集の段階をデータ分析に接続します。
ただし、プロトコル ステップ 1.3.6 から 1.3.6.9 に示されている再調整プロセスは、基本的にプロトコル ステップ 1.3.1 から 1.3.4 で生成された電話およびワード ユニットで機能します。再配置プロセスの目新しさは、音節層、単語に基づいて自動または手動で生成できる音声チャンク層、およびf0小節の計算に非常に役立つトーン層の3つの新しいテキスト層を含む新しいTextGridを生成することです。このプロトコルに提案された再調整ガイドラインは、L2 音声リズム21、69、70 の研究、機械学習技術を使用した外国アクセント程度の検出に関する研究22、および法医学領域9 の研究で以前に使用されていました。
プロトコルステップ1.3.7から1.3.7.10で提示された韻律的特徴の自動抽出は、現在の研究で証明できるような、韻律音響的特徴の多次元マトリックスを生成する。このような特徴には、メロディック、持続時間、およびスペクトル(音声品質および強度)の音声特徴71が含まれる。これらの音響的特徴のかなりの数は、感度が低く、フォレンジックまたは他のシナリオ72で最終的に収集されるノイズの多い音声録音に対してやや堅牢である。さらに、多次元行列は、いくつかの AI 技術を介して音声認識システムに適用できます (作業中)。これは、L2 発音クラス21 (作業中) の運韻の側面を教える際に依然として非常に役立ちます。
プロトコルのこの部分の統計分析は、特定の音響特徴と複数の言語要因の話者との間の複雑な関係を扱ったため、GAM法の使用を表しています。たとえば、特定の音響特徴をモデル化するには、音声生成中に何が起こっているかをより正確に説明できるように、マトリックスの他の音響特徴 (滑らかな項) がどのように機能するかを確認する必要がありました。
知覚分析については、音声ラインナップの作成と実装、統計分析、音響類似性分析によって現在のプロトコルが構成されました。ラインナップを準備するために、プロトコルのステップ2.2から2.2.1.9で説明されているように、ランダムにシーケンスされたフォイルとターゲット音声を含む各ラインナップのオーディオファイルを自動的に生成するPraat用のCreateLineupスクリプトを使用しました。
このプロトコルの統計分析では、データが分散分析 (ANOVA) の仮定を満たさなかったため、Kruskal-Wallis ノンパラメトリック検定を実行しました。リスナーによって評価され、ターゲットの声とフォイルに対して制御された判断スコアの間に関係ができたら、線形モデル統計を使用することを選択しました。
音響類似性解析では、Python用の AcousticSmilarity_cosine_euclidean スクリプトを使用しました。プログラムはコンピューターのディレクトリ ツリーをポップアップし、フォイルの韻律音響的特徴と、分析のラインナップを構成するターゲット音声を含むファイルを選択するようにユーザーに求めます。ボタンをクリックするだけで、スクリプトは '.txt' (タブ区切り) ファイルと '.csv' ファイルの両方で、コサイン、ユークリッド、変換 (0 対 1) ユークリッドの 3 つの類似行列を生成します。すべてのデータセット(フォイルとターゲットの韻律音響的特徴を含む「.txt」ファイル)はラインナップの元のフォルダにある必要があり、すべてのラインナップフォルダには AcousticSmilarity_cosine_euclidean スクリプトのコピーが必要であることに留意する必要があります。
要約すると、現在のプロトコルは(法医学)音声学研究を進めています。生産と知覚の分析、音響の類似性という異なるフェーズで構成され、データ収集と多次元音響特徴分析の間のギャップを埋めます。研究者は、生産と知覚の両方の側面を探求し、全体的な視点から恩恵を受けることができます。さらに、このプロトコルは研究の再現性を保証し、他の人がこの研究のガイドラインに基づいて構築できるようにします。
制限と今後の方向性
データ準備がプロトコルのステップ1.3.1から1.3.4で提案されたガイドラインに従えば、すべてがうまくいくことを心に留めておく必要があります。さらに、強制アライメント手順では、現在の作業で使用されている外部の事前トレーニング済み強制アライナー(MAUSのような)は、特に事前トレーニングされていない外国アクセント付きデータや事前トレーニング済みアライナーでさえ、オーディオの品質が良くないか、アライナーに音声言語が含まれていないかにかかわらず、セグメンテーションエラーの影響を受けやすいことに注意する必要があります(この事実は、専門家の作業をより困難で時間がかかります)。法医学的転写、特に長い音声ファイルの転写は、音声録音の正確で信頼性の高い表現に関して困難に遭遇します72。
また、長いオーディオファイルの文字起こしや整列には、いくつかの課題があります。アライナーのパフォーマンスは、話し方や音声環境、方言固有の要因の影響を受けます。アライナー固有の違いはありますが、一般的に、それらのパフォーマンスは類似しており、手動アライメント全体に匹敵するセグメンテーションを生成します73。さらに、MAUS では外国語の音声モデルが利用できないため、L1 および L2 英語の制作は、事前にトレーニングされたアメリカ英語の音響モデルを使用して実行されました。さらに、MAUSにはBPの事前学習済み音響モデルはありません。血圧データには、イタリア語の既存の音響モデルが使用されました(注、プロトコルステップ1.3.5.7を参照)。
将来の研究 (進行中) では、プロトコルの一部としてモントリオール強制アライナー (MFA)74 を使用します。MFAの大きな利点は、さまざまな言語(BPを含む)に対して事前トレーニングされた音響モデルと書記素から音素へのモデルが利用可能であること、および新しいデータセット(つまり、外国語アクセントの音声コーパス)に新しい音響モデルと書記素から音素へのモデルをトレーニングする機能です75。
著者には宣言すべき利益相反はありません。
この研究は、全米科学技術開発評議会 - CNPq、第一著者に助成金番号307010/2022-8、第二著者に助成金番号302194/2019-3の支援を受けました。筆者より、本研究の参加者の皆様の多大なるご協力と貴重なご貢献に心より感謝申し上げます。
| 名前 | 会社 | カタログ番号 | コメント |
|---|---|---|---|
| CreateLineup | Personal collection | # | 音声ラインナップ用スクリプト |
| Dell I3 (ソリッドステートドライブ - SSD) | Dell | # | ラップトップコンピュータPraat |
| Paul Boersma &David Weenink | # | 音声解析用ソフトウェア | |
| Python 3 | Python Software Foundation | # | インタープリター、高水準、汎用プログラミング言語 |
| R | The R Project for Statistical Computing | # | Programming language for stattistical computing |
| Shure Beta SM7B | Shure | # | Microphone |
| SpeechRhythmExtractor | Personal collection | # | Script for praat for automatic extraction of acoustic features |
| SurveyMonkey | SurveyMonkey Inc. | # | 無料のカスタマイズ可能な調査と、データ分析、サンプル選択、バイアス除去、データ表現を含む一連のバックエンドプログラムの組み立て。 |
| Tascam DR-100 MKII | Tascam | # | デジタルボイスレコーダー |
| ミュンヘン自動セグメンテーションシステム MAUS | ミュンヘン大学 | # | オーディオ (.wav) および言語情報 (.txt) ファイルの強制アライナー |
| VVUnitAligner | 個人コレクション | # | 音声単位の自動再調整と後処理のためのプラアットのスクリプト |
このJoVE記事のテキストまたは図の再利用許可をリクエスト
許可をリクエスト