この研究は、外国語アクセントの影響がメトリックと韻律音響パラメータの両方、および音声ラインナップのターゲット音声の選択にどの程度影響するかを確認するために、L1-L2-EnglishとL1-L2ポルトガル語を比較することを目的としています。
この研究は、外国語アクセントの影響がメトリックと韻律音響パラメータの両方、および音声ラインナップのターゲット音声の選択にどの程度影響するかを確認するために、L1-L2-EnglishとL1-L2ポルトガル語を比較することを目的としています。
本研究は、外国語アクセントの英語と外国語アクセントのブラジルポルトガル語の韻律音響的特徴と知覚的相関性の両方を調べ、話者の外国語アクセントとネイティブアクセントの制作がリスナーの知覚とどのように相関しているかを確認することを目的としています。方法論では、L2ブラジルポルトガル語のアメリカ人グループとL2英語のブラジル人グループとの音声生成手順と、両方の言語の音声ラインナップを実行する音声認識手順を実行しました。音声生成統計分析では、一般化加法モデルを実行して、反対クラスの共変量の平滑化効果を制御する特徴の各クラス(メトリックまたは韻律音響)に対する言語グループの影響を評価しました。音声知覚統計分析では、Kruskal-WallisテストとPost-hoc Dunn'sテストを実行して、リスナーが判断するスコアに対するラインナップの音声の影響を評価しました。それにもかかわらず、コサイン距離とユークリッド距離に基づく音響(音声)類似性テストを実施しました。その結果、f0のばらつき、持続時間、および声質の点で、言語グループ間で大きな音響的違いが示されました。ラインナップについては、f0、強度、および音声品質の韻律的特徴がリスナーの知覚判断と相関していることが示されました。
アクセントは、母国語(L1)と外国語(L2)の両方で、コミュニケーションと流暢さの顕著でダイナミックな側面です。1。外国語アクセントは、ターゲット言語のL2音声機能を表し、話者のL2経験、話し方、入力品質、説明などの変数に応じて(時間の経過とともに)変化する可能性があります。外国語アクセントは、外国語話者によって生成された L2 音声と、ターゲット言語のローカルまたは参照アクセントとの間の (スカラー) 程度として定量化できます2,3,4,5.
この研究は、外国語アクセントの英語と外国語アクセントのブラジルポルトガル語(BP)の韻律音響的特徴と知覚的相関の両方を調べるとともに、話者の外国語アクセントとネイティブアクセントの制作がリスナーの知覚とどの程度相関しているかを確認することを目的としています。法医学分野の先行研究では、外国語のアクセント識別における母音と子音の堅牢性は、個人の長期的な分析に対して安定している(The Lo Case6)、話者の高いID精度を参照している(The Lindbergh Case7)ことが示されています。しかし、持続時間、基本周波数(f0、つまりピッチの音響相関)、強度、および音声品質(VQ)に基づく韻律音響特性の探求は、ますます注目を集めています8,9。したがって、この研究における韻律音響機能の選択は、法医学音声学の分野で有望な道筋を表しています8,10,11,12,13.
本研究は、法医学的なケースにおける音声変装の一形態としての外国語アクセントに特化した研究によって支えられています14,15、および話者認識のための音声ラインナップの準備16,17。たとえば、ドイツ語、イタリア語、日本語、ブラジル語の英語話者の識別には、発話速度が重要な役割を果たしました18,19,20,21,22.発話速度に加えて、脳と認知基盤が記憶、注意、感情に欠損しているため、長期のスペクトルとf0の特徴は、ターゲット言語に精通しているL2に熟練した話者に挑戦します。これは、長時間の話しかしゃぶり23。法医学分野での外国語アクセントの見方は、実際に外国語アクセントのように聞こえるものの定義は、外国語アクセントのスピーチが極端にない程度にあるのではなく、リスナーのなじみのなさに大きく依存するということです24。
知覚領域では、1990年代半ばから犯罪者の認識に使われる一般的な法医学ツールは、犯罪現場で加害者を特定するために使用される視覚認識に類似した音声ラインナップ(聴覚認識)です16,25。ボイスラインナップでは、容疑者の声は、年齢、性別、地理的位置、方言、文化的地位などの社会言語学的側面で類似したフォイルと一緒に提示され、目撃者による識別に使用されます。音声ラインナップの成功または失敗は、音声サンプルの数とサンプルの持続時間によって異なります25,26。さらに、実際のサンプルでは、音声品質が一貫して音声認識の精度に影響を与えると考えられます。オーディオ品質が悪いと、voice27 の固有の特性が歪む可能性があります。音声の類似性の場合、f0 に基づく詳細な音声の詳細は、音声認識中にリスナーを混乱させる可能性があります28,29。このような音響的特徴は f0 を超えて拡張され、持続時間の要素と、強度と VQ30 のスペクトル特徴が含まれます。この複数の韻律的特徴のビューは、フォレンジック音声比較のコンテキストで、正確な話者識別を確保するために重要です9,14,15,29,31.
要約すると、法医学的音声学の研究は、過去数十年にわたって外国語のアクセントの識別に関していくつかのバリエーションを示しています。一方では、外国語のアクセントは話者を識別するプロセスに影響を与えないように思われます32,33(特に、話者が対象の外国語のアクセントに詳しくない場合34)。一方、逆方向の調査結果があります12,34,35。
この研究は、ヒト研究倫理委員会から承認を得ました。さらに、この研究に関与したすべての参加者から、データの使用と公開についてインフォームド コンセントが得られました。
1. 音声生成
注:グループ1の「L1 English-L2 BP」のリーディングタスクから音声を収集しました:The American English(米国から)のSピーカー(AmE-S)と、グループ2の「L1 BP-L2 English」の両方の「L1 BP-L2 English」:Brazilian Speakers(Bra-S)。音声生成のフローチャートについては、図 1 を参照してください。

図 1: 音声生成の概略フローチャート。 この図の拡大版を見るには、ここをクリックしてください。

図2:MAUS強制整列機能を使用した音声整列のスクリーンショット(A)破線の長方形は、'my_file.wav'/' my_file.txt'ファイルをドラッグ&ドロップしたり、フォルダからそのようなファイルを検索するために内部をクリックするためのものです。アップロードボタンは赤い矢印で示されます。(B)パネルAからアップロードされたファイル(青い矢印を参照)、使用するパイプライン、ファイルのペアの言語、返されるファイル形式、およびすべてのファイルを保持するための「true / false」ボタン。(C) チェックボックスの使用条件 (緑色の矢印を参照)、[Web サービスの実行] ボタン、および結果 (ダウンロードする TextGrid ファイル)。この図の拡大版を表示するには、ここをクリックしてください。

図3:再調整手順のスクリーンショット。(A)再調整手順の入力設定フォーム。(B)部分波形、f0(青)輪郭の広帯域スペクトログラム、および層1としてセグメント化(およびラベル付け)された6つの層:母音の開始から次の母音の開始(V_to_V)の単位。母音の開始(V_to_V);ティア2:母音(V)、子音(C)、および一時停止(#)の単位。Tier 3:音声表現V_to_V;Tier 4:テキストからのいくつかの単語。Tier 5:テキストからの音声のいくつかのチャンク(CH)。tier 6: 女性の AmE-S によって生成された各音声チャンクの最高音 (H) と最低音 (L) を含む声調層。(C)音響特徴の自動抽出のための入力設定。この図の拡大版を表示するには、ここをクリックしてください。
2. 音声認識
注:アメリカ人リスナーと英語で4つの音声ラインナップを、ブラジルのリスナーとBPで4つの音声ラインナップを実施しました。音声認識のフローチャートについては、図 4 を参照してください。

図 4: 音声知覚の概略フローチャート. この図の拡大版を見るには、ここをクリックしてください。

図 5: 音声認識のためのディレクトリ設定。ラインナップフォルダ。各フォルダには、6 つの L1 音声、L2 ターゲット音声、"CreateLineup" スクリプト、音声ラインナップ オーディオ ファイル (スクリプトの実行後に返される) が含まれています。この図の拡大版を表示するには、ここをクリックしてください。
発話産出の結果
本セクションでは、統計的に有意であった韻律・音響的特徴およびリズム指標のパフォーマンスについて述べました。これらの韻律的特徴には、持続時間に関連する発話速度、調音速度、ポーズ率、および声質に関連するシマーが含まれます。リズム指標は、音節持続時間の標準偏差(SD)、子音のSD、母音または子音の持続時間のSD、および音節持続時間の変動係数でした(補足表 S1を参照)。
The 発話速度 (図6A)L1-L2英語はL1-L2ブラジルポルトガル語よりも急速に減少するが、いずれのL2においてもその速度はより低い。 発話速度 3つの指標、すなわち音節持続時間の標準偏差(SD)に関連しています。SD-S)、母音の標準偏差(SD-V)、および音節変動係数(Varco-S)。また、AmE-S群とBra-S群のいずれもが、第二言語(L2)に堪能である点に留意することが重要です。このような速度は、L1-L2バイリンガル(BP)によって生じる音節持続時間の値が高くなり、変動性が低くなることに影響され、その結果、傾きが緩やかになると考えられます。
その 調音速度 (図6D)は、~に関連している SD-S, Varco-S、および音節リズム比(RR-S);後者は短音と長音の音節比を表します。このような指標は、〜に影響を与えると考えられます。 調音速度 罹患例と同様に 発話速度 文長および発話時間のばらつきが、第2言語(L2)における発話計画の負荷を高め、L2の認知負荷を増大させるため9,23,54文長という領域において、より高い認知言語的負荷が必要とされることがあり、それが韻律・音響パラメータに影響を及ぼす可能性がある。55.
の韻律・音響的特徴に関して 音声 および 調音速度我々の知見は、話者が音節(および母音)の長さをより変化させるほど、そのような速度が低下することを示唆している。我々は、L1およびL2のブラジルポルトガル語(BP)の音声知覚は、L1およびL2の英語よりもいくらか遅く、またL1の英語は他のすべての言語レベルよりも速いという仮説を立てている。この事実は、音声リズム、およびL1-L2 BPがリズム連続体の音節タイミング極に傾く一方で、L1-L2英語は強勢タイミング極に移動するという仮説に関連している可能性がある。21,22.
図6Bに示す局所的なシマー(Local shimmer)は、SD-SおよびVarco-Sの影響を受けます。局所的なシマーに関しては、Bra-S、L1-BP、およびL2-Englishのいずれの産出においても、音節持続時間の変動性(SDおよびVarco、補足表S1を参照)が増加するにつれて、ある程度単調な軌跡を示します。Bra-Sの産出を聴取した際、8.5から9 dBの範囲という低い変動により、発声努力の知覚が顕著になる可能性があります。Bra-Sの発話は、声帯への負荷(vocal load)の影響を受けます。L1-BPは文章の長さに強く影響され、音節持続時間の大きな変動に対しては感受性が低くなっています(BPのリズムパターンは音節変動が少ないことが示されています2,56)。
ポーズ率(図 6C)は、L2-英語話者が、L1-英語、L1-BP、L2-BP話者よりも長いポーズ(20 msから375 ms)を生成することを示している(平均はL1-英語で30 ms、L1-BPで50 ms、L2-BPで10 ms)。この場合、脳活動の増加により、音声計画がL2-英語の生成に影響を与えた可能性がある54,57。言語習熟度が高ければ、読書速度とスパンが向上すると予想されるが54、L2習熟話者であっても、読解課題は外国語音声の高次認知面および言語処理において、より多くの努力を要することが示された54,57。我々の知見は、少なくとも予備的な段階において、両言語のリズムパターンの違いにより、L2-BP話者はL2-英語話者よりもポーズの影響を受けにくい可能性を示している。

図6韻律・音響的特徴量に対する一般化加法モデル。 Y軸には応答変数(モデル化される音響的特徴量)を、X軸には予測変数(曲線の形状と軌跡を決定する加法モデル内の要因「Language」および共変量、すなわち平滑化効果:「Language + 共変量」、および応答変数をより正確に投影するための「Language」と計量的特徴量の積、すなわち要因と平滑化の相互作用:「共変量:Language」)を配置します。略語:GAMs = 一般化加法モデル。 この図の拡大版を表示するには、ここをクリックしてください。
リズム指標に関しては、 SD-S (図7A)、我々の知見は、話者がf0曲線をより変動させ、発話速度を上げるほど、より多くの SD-S すべての言語レベルで減少しています(〜の鏡像効果) 図6A)。子音の標準偏差(SD)の場合(SD-C, 図 7C)、L1英語とは対照的に、L1ブラジル・ポルトガル語(BP)では、発話速度やポーズ時間が長くなるにつれて変動が小さくなる傾向が示された。このような標準偏差(SD)の方向性は、音節時間の変動性がL1英語の方がL1-BPよりも(統計的に)有意に高いことから予測されるものである。44,58. The Varco-S (図7B および 付随表 S1)は、同一言語グループのL1およびL2とある程度の相関があると考えられます。f0の変動性と発話速度が増加するにつれて、L1-BPではVarco-Sが減少し、L2-BPでは減少および減衰する傾向が見られます。英語による発話においては、f0の変動性と 発話速度 増加し、Varco-SはL1英語およびL2英語に対して増加および減衰する。
母音または子音のSD(SD-V_C、図7Dおよび補足表S1)に関して、我々の結果はVarco-Sのパフォーマンスといくつかの類似性を示している(図7B)。例えば、より高い発話速度、ポーズ期間、およびf0変動性は、L1-BPおよびL2-BPにおいてSD-V_Cの下降-上昇トラジェクタリーを促進する。英語の発話においては、これらの韻律的特徴が高い一方で、SD-V_Cはわずかに減少し、L1-Englishでは減衰し、L2-Englishではわずかに増加した後に減衰する。同一言語グループのL1-L2に対するVarco-SとSD-V_Cの相関は、背景ノイズによる音声の音響パラメータの変化を指すロンバール効果によって部分的に説明できる可能性がある59。
外国語による発話において、タスクの複雑さ(例:読み上げ発話)に応じて、話者はL1(第一言語)とL2(第二言語)の両方で同様の音響戦略を用いることが報告されている59,60。一方で、MarcouxとErnestusは、L2ロンバード発話におけるf0の指標(範囲および中央値)から、L2英語話者がL1であるオランダ語の影響を受けていることが示唆されたと述べている61,62。他方、より最近の知見では、L2での発話は認知負荷が高いため、L2ロンバード発話はL1ロンバード発話とは異なると予想されるものの、L2英語話者はL1英語話者と同じ方向性のロンバード発話を行ったことが提案されている63。本研究の結果が、どの程度MarcouxおよびErnestus63と一致し、Waaning59、Villegasら60、およびMarcouxとErnestus61,62から乖離しているかについては、さらなる調査が必要である。

図7指標量的な特徴量に対する一般化加法モデル。 Y軸には応答変数(モデル化される指標的特徴)を、X軸には予測変数(曲線の形状および軌跡を規定する加法モデル内の要因「Language」と共変量(すなわち平滑化効果:「Language + 共変量」)、および応答変数のより正確な投影を可能にする「Language」と指標的特徴の積(すなわち要因・平滑化相互作用:「共変量:Language」))を配置します。略語:GAMs = 一般化加法モデル。 この図の拡大版を表示するには、ここをクリックしてください。
音声知覚の結果
BP音声ラインナップに関して、ラインナップ#1(図 8A)では、妨害音声#3がターゲット音声であると判断されました。実際には、ターゲット音声は音声#4でした。結果は、妨害音声#3(83%)とターゲット音声#4(71%)の間に統計的な有意差がないことを示しています(補足表 S1を参照)。ラインナップ#2(図 8B)において、ターゲット音声#3(40%)と妨害音声#4(20%)を比較したところ、英語の音声ラインナップにおいても統計的な有意差は認められませんでした(補足表 S1を参照)。ラインナップ#1(図 9A)では、妨害音声#2(26%)とターゲット音声#4(54%)の間に有意な差は見られませんでした(補足表 S1を参照)。
音声の類似性分析において、コサイン類似度(CoSim)とユークリッド距離(EucDist, [EucDist 変換後]54)は、いずれもBPラインナップ#1のフォイル#3とターゲットとの間で一貫した相関を示した(CoSim = 0.9; EucDist = 7.4, [0.93])。同様に、BPラインナップ#2では、フォイル#4とターゲットとの間の相関も強かった(CoSim = 0.9, EucDist = 76.3, [0.93])。英語ラインナップ#1では、CoSimでは一貫した相関(0.83)が見られたが、EucDistでは弱いか、あるいは十分な程度の相関であった(213.0, [0.47])。全体として、CoSimとEucDistはいずれも音声の類似性を判定する上で十分な手法であった。さらに、GahmanおよびElangovan52が述べたように(付録表S1参照)、CoSimの方がわずかにより効果的に機能した。
類似性の観点から、何が誤警報(false alarms)の増加を招いた可能性があるでしょうか。韻律・音響的特徴の解析では、ホイル(妨害刺激)とターゲット音声のパフォーマンスに(統計的に)有意な差が見られたものの、図 8A、Bおよび図 9Aに提示されたラインアップを除き、他のラインアップ(図 8C、Dおよび図 9B-D)では、リスナーの選択が異なるホイル間でいくらか分散していることが示されました。このような判断は、韻律・音響的特徴のクラス全体よりも、話者間で共有される1つ(あるいは複数)の特定の音響的特徴に、より依存していると考えられます。例えば、本研究では音声産出間で(共)変動するいくつかの特徴を提示しましたが、知覚的な結果は、ターゲット音声に一致する特定のホイルに対する判断の傾向を示しています8,35,64,65。さらなる分析が今後の課題となります。
本研究で提示したような、音響的類似性のための多次元パラメータ行列の選択について検討することは注目に値します6。我々の知見は、f0、VQ、および強度に基づく音響的特徴を用いた先行研究と一致しています9,35。このような特徴は、法科学分野における話者比較タスクにおいて極めて有効であると提案されています9,6。しかしながら、外国語アクセントのある話者の認識に向けた音声ラインナップの作成において、McFarlaneのガイドライン16,17の変法を用いたものの、本研究では、いずれのホイル(妨害刺激)もターゲット音声に類似しているとは予測されなかったことを強調しておくことが重要です。さらに、我々の音声ラインナップの手順は、刺激の長さ、音声数、ホイルの選択(本研究ではランダム化)、および発話スタイルを含め、McFarlaneのガイドラインとは重要な相違点があることを強調しなければなりません。
f0、声質、および強度の韻律・音響的特徴が聴取者の知覚にどの程度関連しているかは、研究で用いられる発話スタイルに大きく依存すると考えられます。本研究では、朗読文章を用いました。耳撃者(earwitness)に関する研究の多くは、バランスの取れた解決策として、(準)自発的な刺激(例:現代の耳撃者調査で広く採用されているDyVisコーパス6728,68)を選択しています。朗読タスクを選択した理由は、本原稿の作成時点で、我々のコーパスが朗読タスクから得られたデータのみで構成されていたためです。ただし、(準)自発的なコーパスの構築プロセスが既に進行中であることを認めることが重要です。さらに、物語を朗読するという行為は、話者内および話者間の両方において、信頼できるレベルの一貫性とバリエーションを生み出すことができます。これにより、声の比較を行う状況において、個人の特徴や方言などの韻律的または音声的な特性を強調することが容易になります。これは、熟練した話者であっても、外国語のアクセントを出す際の音声的負荷(vocal load)が発生する場合に特に顕著になります 8,9,23,54。

図8ブラジル人リスナーによって実施された4つのラインナップの結果を示す棒グラフ。 (A,B) ターゲット音声(青色)とフォイル(水色)の間に有意な差は認められない。(C,D) フォイル(妨害刺激)およびターゲット音声との間に有意な差が認められた。略語:NS = 有意差なし。 この図の拡大版を表示するには、ここをクリックしてください。

図9アメリカ人聴取者によって実施された4つのラインナップの結果を示す棒グラフ。 (A) ターゲット音声(赤色)とホイル(桃色)との間に有意な差はない。 (B,C,D)フォイルおよびターゲットボイスとの有意な差。略語:NS = 有意差なし。 この図の拡大版を表示するには、こちらをクリックしてください。
補足表 S1音声産出統計 - 一般化加法モデル (GAMs): F統計量(自由度)、調整済みR2 統計的に有意な各韻律・音響的特徴の(図6)、およびリズム指標(図7言語レベルごと、および各平滑化項(共変量)の個々の値について。音声知覚統計:クラスカル・ウォリス検定 χ2 統計量(自由度)、p値、および調整後の η2および、ペア比較のための事後検定としてDunn法(図8 および 図9ターゲット音声とフォイル音声のペア間における、統計的に有意ではない各差の(図8A,B および 図 9A)。各ラインナップにおけるコサイン距離およびユークリッド距離による音響類似度行列。 この図の拡大版を表示するには、ここをクリックしてください。
現在のプロトコルは、(法医学的)音声学の分野に目新しさをもたらします。それは、生産に基づくフェーズ(音響分析)と知覚に基づくフェーズ(判断分析)の2つのフェーズに分かれています。生産分析フェーズは、統計に加えて、データ準備と強制アライメント、再アライメント、および韻律音響特徴の自動抽出で構成されます。このプロトコルは、主に手動のセグメンテーションに基づく従来のプロトコルよりも高速かつ効率的な方法で、データ収集の段階をデータ分析に接続します。
ただし、プロトコル ステップ 1.3.6 から 1.3.6.9 に示されている再調整プロセスは、基本的にプロトコル ステップ 1.3.1 から 1.3.4 で生成された電話およびワード ユニットで機能します。再配置プロセスの目新しさは、音節層、単語に基づいて自動または手動で生成できる音声チャンク層、およびf0小節の計算に非常に役立つトーン層の3つの新しいテキスト層を含む新しいTextGridを生成することです。このプロトコルに提案された再調整ガイドラインは、L2 音声リズム21、69、70 の研究、機械学習技術を使用した外国アクセント程度の検出に関する研究22、および法医学領域9 の研究で以前に使用されていました。
プロトコルステップ1.3.7から1.3.7.10で提示された韻律的特徴の自動抽出は、現在の研究で証明できるような、韻律音響的特徴の多次元マトリックスを生成する。このような特徴には、メロディック、持続時間、およびスペクトル(音声品質および強度)の音声特徴71が含まれる。これらの音響的特徴のかなりの数は、感度が低く、フォレンジックまたは他のシナリオ72で最終的に収集されるノイズの多い音声録音に対してやや堅牢である。さらに、多次元行列は、いくつかの AI 技術を介して音声認識システムに適用できます (作業中)。これは、L2 発音クラス21 (作業中) の運韻の側面を教える際に依然として非常に役立ちます。
プロトコルのこの部分の統計分析は、特定の音響特徴と複数の言語要因の話者との間の複雑な関係を扱ったため、GAM法の使用を表しています。たとえば、特定の音響特徴をモデル化するには、音声生成中に何が起こっているかをより正確に説明できるように、マトリックスの他の音響特徴 (滑らかな項) がどのように機能するかを確認する必要がありました。
知覚分析については、音声ラインナップの作成と実装、統計分析、音響類似性分析によって現在のプロトコルが構成されました。ラインナップを準備するために、プロトコルのステップ2.2から2.2.1.9で説明されているように、ランダムにシーケンスされたフォイルとターゲット音声を含む各ラインナップのオーディオファイルを自動的に生成するPraat用のCreateLineupスクリプトを使用しました。
このプロトコルの統計分析では、データが分散分析 (ANOVA) の仮定を満たさなかったため、Kruskal-Wallis ノンパラメトリック検定を実行しました。リスナーによって評価され、ターゲットの声とフォイルに対して制御された判断スコアの間に関係ができたら、線形モデル統計を使用することを選択しました。
音響類似性解析では、Python用の AcousticSmilarity_cosine_euclidean スクリプトを使用しました。プログラムはコンピューターのディレクトリ ツリーをポップアップし、フォイルの韻律音響的特徴と、分析のラインナップを構成するターゲット音声を含むファイルを選択するようにユーザーに求めます。ボタンをクリックするだけで、スクリプトは '.txt' (タブ区切り) ファイルと '.csv' ファイルの両方で、コサイン、ユークリッド、変換 (0 対 1) ユークリッドの 3 つの類似行列を生成します。すべてのデータセット(フォイルとターゲットの韻律音響的特徴を含む「.txt」ファイル)はラインナップの元のフォルダにある必要があり、すべてのラインナップフォルダには AcousticSmilarity_cosine_euclidean スクリプトのコピーが必要であることに留意する必要があります。
要約すると、現在のプロトコルは(法医学)音声学研究を進めています。生産と知覚の分析、音響の類似性という異なるフェーズで構成され、データ収集と多次元音響特徴分析の間のギャップを埋めます。研究者は、生産と知覚の両方の側面を探求し、全体的な視点から恩恵を受けることができます。さらに、このプロトコルは研究の再現性を保証し、他の人がこの研究のガイドラインに基づいて構築できるようにします。
制限と今後の方向性
データ準備がプロトコルのステップ1.3.1から1.3.4で提案されたガイドラインに従えば、すべてがうまくいくことを心に留めておく必要があります。さらに、強制アライメント手順では、現在の作業で使用されている外部の事前トレーニング済み強制アライナー(MAUSのような)は、特に事前トレーニングされていない外国アクセント付きデータや事前トレーニング済みアライナーでさえ、オーディオの品質が良くないか、アライナーに音声言語が含まれていないかにかかわらず、セグメンテーションエラーの影響を受けやすいことに注意する必要があります(この事実は、専門家の作業をより困難で時間がかかります)。法医学的転写、特に長い音声ファイルの転写は、音声録音の正確で信頼性の高い表現に関して困難に遭遇します72。
また、長いオーディオファイルの文字起こしや整列には、いくつかの課題があります。アライナーのパフォーマンスは、話し方や音声環境、方言固有の要因の影響を受けます。アライナー固有の違いはありますが、一般的に、それらのパフォーマンスは類似しており、手動アライメント全体に匹敵するセグメンテーションを生成します73。さらに、MAUS では外国語の音声モデルが利用できないため、L1 および L2 英語の制作は、事前にトレーニングされたアメリカ英語の音響モデルを使用して実行されました。さらに、MAUSにはBPの事前学習済み音響モデルはありません。血圧データには、イタリア語の既存の音響モデルが使用されました(注、プロトコルステップ1.3.5.7を参照)。
将来の研究 (進行中) では、プロトコルの一部としてモントリオール強制アライナー (MFA)74 を使用します。MFAの大きな利点は、さまざまな言語(BPを含む)に対して事前トレーニングされた音響モデルと書記素から音素へのモデルが利用可能であること、および新しいデータセット(つまり、外国語アクセントの音声コーパス)に新しい音響モデルと書記素から音素へのモデルをトレーニングする機能です75。
著者には宣言すべき利益相反はありません。
この研究は、全米科学技術開発評議会 - CNPq、第一著者に助成金番号307010/2022-8、第二著者に助成金番号302194/2019-3の支援を受けました。筆者より、本研究の参加者の皆様の多大なるご協力と貴重なご貢献に心より感謝申し上げます。
| 名前 | 会社 | カタログ番号 | コメント |
|---|---|---|---|
| CreateLineup | Personal collection | # | 音声ラインナップ用スクリプト |
| Dell I3 (ソリッドステートドライブ - SSD) | Dell | # | ラップトップコンピュータPraat |
| Paul Boersma &David Weenink | # | 音声解析用ソフトウェア | |
| Python 3 | Python Software Foundation | # | インタープリター、高水準、汎用プログラミング言語 |
| R | The R Project for Statistical Computing | # | Programming language for stattistical computing |
| Shure Beta SM7B | Shure | # | Microphone |
| SpeechRhythmExtractor | Personal collection | # | Script for praat for automatic extraction of acoustic features |
| SurveyMonkey | SurveyMonkey Inc. | # | 無料のカスタマイズ可能な調査と、データ分析、サンプル選択、バイアス除去、データ表現を含む一連のバックエンドプログラムの組み立て。 |
| Tascam DR-100 MKII | Tascam | # | デジタルボイスレコーダー |
| ミュンヘン自動セグメンテーションシステム MAUS | ミュンヘン大学 | # | オーディオ (.wav) および言語情報 (.txt) ファイルの強制アライナー |
| VVUnitAligner | 個人コレクション | # | 音声単位の自動再調整と後処理のためのプラアットのスクリプト |