方法論記事

音声ラインナップにおける外国語アクセントと法医学的話者識別:韻律に基づく音響特徴の影響

DOI:

10.3791/66313

2024年9月27日

この記事について

サマリー

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

この研究は、外国語アクセントの影響がメトリックと韻律音響パラメータの両方、および音声ラインナップのターゲット音声の選択にどの程度影響するかを確認するために、L1-L2-EnglishとL1-L2ポルトガル語を比較することを目的としています。

要約

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

本研究は、外国語アクセントの英語と外国語アクセントのブラジルポルトガル語の韻律音響的特徴と知覚的相関性の両方を調べ、話者の外国語アクセントとネイティブアクセントの制作がリスナーの知覚とどのように相関しているかを確認することを目的としています。方法論では、L2ブラジルポルトガル語のアメリカ人グループとL2英語のブラジル人グループとの音声生成手順と、両方の言語の音声ラインナップを実行する音声認識手順を実行しました。音声生成統計分析では、一般化加法モデルを実行して、反対クラスの共変量の平滑化効果を制御する特徴の各クラス(メトリックまたは韻律音響)に対する言語グループの影響を評価しました。音声知覚統計分析では、Kruskal-WallisテストとPost-hoc Dunn'sテストを実行して、リスナーが判断するスコアに対するラインナップの音声の影響を評価しました。それにもかかわらず、コサイン距離とユークリッド距離に基づく音響(音声)類似性テストを実施しました。その結果、f0のばらつき、持続時間、および声質の点で、言語グループ間で大きな音響的違いが示されました。ラインナップについては、f0、強度、および音声品質の韻律的特徴がリスナーの知覚判断と相関していることが示されました。

概要

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

アクセントは、母国語(L1)と外国語(L2)の両方で、コミュニケーションと流暢さの顕著でダイナミックな側面です。1外国語アクセントは、ターゲット言語のL2音声機能を表し、話者のL2経験、話し方、入力品質、説明などの変数に応じて(時間の経過とともに)変化する可能性があります。外国語アクセントは、外国語話者によって生成された L2 音声と、ターゲット言語のローカルまたは参照アクセントとの間の (スカラー) 程度として定量化できます2,3,4,5.

この研究は、外国語アクセントの英語と外国語アクセントのブラジルポルトガル語(BP)の韻律音響的特徴と知覚的相関の両方を調べるとともに、話者の外国語アクセントとネイティブアクセントの制作がリスナーの知覚とどの程度相関しているかを確認することを目的としています。法医学分野の先行研究では、外国語のアクセント識別における母音と子音の堅牢性は、個人の長期的な分析に対して安定している(The Lo Case6)、話者の高いID精度を参照している(The Lindbergh Case7)ことが示されています。しかし、持続時間、基本周波数(f0、つまりピッチの音響相関)、強度、および音声品質(VQ)に基づく韻律音響特性の探求は、ますます注目を集めています8,9。したがって、この研究における韻律音響機能の選択は、法医学音声学の分野で有望な道筋を表しています8,10,11,12,13.

本研究は、法医学的なケースにおける音声変装の一形態としての外国語アクセントに特化した研究によって支えられています14,15、および話者認識のための音声ラインナップの準備16,17。たとえば、ドイツ語、イタリア語、日本語、ブラジル語の英語話者の識別には、発話速度が重要な役割を果たしました18,19,20,21,22.発話速度に加えて、脳と認知基盤が記憶、注意、感情に欠損しているため、長期のスペクトルとf0の特徴は、ターゲット言語に精通しているL2に熟練した話者に挑戦します。これは、長時間の話しかしゃぶり23。法医学分野での外国語アクセントの見方は、実際に外国語アクセントのように聞こえるものの定義は、外国語アクセントのスピーチが極端にない程度にあるのではなく、リスナーのなじみのなさに大きく依存するということです24

知覚領域では、1990年代半ばから犯罪者の認識に使われる一般的な法医学ツールは、犯罪現場で加害者を特定するために使用される視覚認識に類似した音声ラインナップ(聴覚認識)です16,25。ボイスラインナップでは、容疑者の声は、年齢、性別、地理的位置、方言、文化的地位などの社会言語学的側面で類似したフォイルと一緒に提示され、目撃者による識別に使用されます。音声ラインナップの成功または失敗は、音声サンプルの数とサンプルの持続時間によって異なります25,26。さらに、実際のサンプルでは、音声品質が一貫して音声認識の精度に影響を与えると考えられます。オーディオ品質が悪いと、voice27 の固有の特性が歪む可能性があります。音声の類似性の場合、f0 に基づく詳細な音声の詳細は、音声認識中にリスナーを混乱させる可能性があります28,29。このような音響的特徴は f0 を超えて拡張され、持続時間の要素と、強度と VQ30 のスペクトル特徴が含まれます。この複数の韻律的特徴のビューは、フォレンジック音声比較のコンテキストで、正確な話者識別を確保するために重要です9,14,15,29,31.

要約すると、法医学的音声学の研究は、過去数十年にわたって外国語のアクセントの識別に関していくつかのバリエーションを示しています。一方では、外国語のアクセントは話者を識別するプロセスに影響を与えないように思われます32,33(特に、話者が対象の外国語のアクセントに詳しくない場合34)。一方、逆方向の調査結果があります12,34,35

プロトコル

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

この研究は、ヒト研究倫理委員会から承認を得ました。さらに、この研究に関与したすべての参加者から、データの使用と公開についてインフォームド コンセントが得られました。

1. 音声生成

注:グループ1の「L1 English-L2 BP」のリーディングタスクから音声を収集しました:The American English(米国から)のSピーカー(AmE-S)と、グループ2の「L1 BP-L2 English」の両方の「L1 BP-L2 English」:Brazilian Speakers(Bra-S)。音声生成のフローチャートについては、図 1 を参照してください

figure-protocol-1
図 1: 音声生成の概略フローチャート。 この図の拡大版を見るには、ここをクリックしてください。

  1. 参加者
    1. 参加者の数言語(L1英語、L2 BP;L1 BP、L2 英語)、性別(女性または男性)、年齢(平均、標準偏差)、グループ特性(専門学生または学部生)、および各グループのL2能力レベル(上級または上級)
      注:本研究では、AmE-SとBra-Sの両方がL2に習熟していると見なされました(両方のグループはB2-C136として認定されました)。AmE-Sは、手続きが行われたとき、ブラジルに2年間住んでいました。Bra-Sは、手術が行われたとき、米国に2年以上住んでいました。海外に住んでいる間、どちらのグループも、少なくとも週に6日、1日~4〜5時間、勉強や仕事の目的でL2を話していました。
    2. 参加者を快適で静かな部屋に割り当て、各グループに読み物を提示します。
  2. データ・コレクション
    注:音声データは、次の言語のリーディングタスクから収集する必要があります:L1-英語、およびL2-BP;L1-BP、およびL2-英語。必要に応じて、参加者に事前にテキストを読ませてください。
    1. 録音手順
      1. 音声データは、適切な音響条件の静かな場所で録音してください。
      2. デジタルボイスレコーダー(資料の表を参照)37と一方向の電磁絶縁カーディオイドマイク(資料の表を参照)38を使用します
      3. オーディオデータを「.wav」形式で録音します。
      4. サンプリングレートを48kHz、量子化レートを16ビットに設定します.
        注:手順1.2.1.3および1.2.1.4で説明したサンプリングレートと量子化レートのオーディオ形式と構成は、高品質の品質とノイズリダクションを確保して、後の音響分析に使用されるスペクトル特性を保持するために適用されます。
  3. 音響解析
    注:音響解析手順は、強制アライメント、再アライメント、音響特徴抽出の3つのステップに分けます。
    1. 言語の転写('で。txt' ファイル) を使用します。
    2. '.txt'/'.wav' ファイルのペアに同じ名前 (つまり、'my_file.wav'/ 'my_file.txt').
      注: セクション 1.3.7 で概説されている手順のパフォーマンスを向上させるには、'.txt/.wav' ファイル タグの最初の 3 文字が言語方言、またはアクセントを表し、4 番目から 6 番目の文字が性別を示すことを強くお勧めします (例: EL1FEMEnglish L1 Fem の場合)ale)です。7 文字目以降、ユーザーはスピーカー番号を示す必要があります (たとえば、最初のスピーカーの場合は 001)。したがって、最初の '.txt/.wav' ペアは EL1FEM001 です。
    3. L1-L2言語ごとにフォルダを作成します。.
      注意: L1-L2 英語用のフォルダーと L1-L2 BP 用のフォルダー。
    4. 同じ言語のすべてのファイルペアが同じフォルダにあることを証明します。
    5. 強制アライメントを実施します。
      1. ミュンヘン自動セグメンテーション(MAUS)強制アライナー(webMAUS)39のWebインターフェイスに https://clarin.phonetik.uni-muenchen.de/BASWebServices/interface/Pipeline でアクセスします。
      2. の各ペアをドラッグアンドドロップします。wav / です。txt ファイルをフォルダから Files の破線の四角形に移動します (または、四角形の内側をクリックします 図 2A)。
      3. 「アップロード」ボタンをクリックして、ファイルをアライナーにアップロードします (図 2A の赤い矢印を参照)。
      4. 「サービス・オプション」メニューで次のオプションを選択します (図 2B): 「パイプライン名」に「G2P-MAUS-PHO2SYL」を選択します。英語 (米国) (言語の場合) L1-L2 英語データの場合。イタリア語 (IT) (言語用) if L1-L2 BP data.
        注:BPデータに「イタリア語」を選択したのは、webMAUSがBP強制アライメントの事前学習済み音響モデルを提供していないためです。音声学の文献では、イタリア語の音韻論には、BP40と同様に、ある程度同等の対称的な7母音の目録があり、子音の音響的類似性もあるとされています41,42
      5. 「出力形式」と「すべて保持」のデフォルトオプションをそのまま使用します。
      6. 使用条件に同意するために、「実行」オプション・ボックスをオンにします (図 2C の緑色の矢印を参照)。
      7. 「Run Web Service」ボタンをクリックして、アップロードしたファイルをaligner.
        で実行します。 注:各オーディオファイルについて、MAUS強制アライナーはPraat TextGridオブジェクト(ステップ1.3.1で説明した「.txt」ファイルから抽出された言語転写に基づいて、単語、音韻音節、および電話の注釈を含むPraatの事前にフォーマットされた「.txt」ファイル)を返します。
      8. Download as ZIP-File」ボタンをクリックして、TextGridファイルをzipファイル(図2C).
        としてダウンロードします。 注:圧縮されたTextGridファイルがオーディオファイルと同じフォルダにダウンロードされていることを確認してください。
      9. 音声解析ソフトウェア43で後で再調整するためにTextGridファイルを抽出します。
    6. 再調整を行います。
      1. https://github.com/leonidasjr/VVunitAlignerCode_webMAUS/blob/main/VVunitAligner.praat から Praat VVUnitAligner44 のスクリプトにアクセスしてダウンロードします。
      2. 同じ言語のすべてのファイル ペアと VVUnitAligner スクリプトが同じフォルダにあることを確認します。
        注: L1-L2 英語ファイルおよび VVunitAligner 用のフォルダー、および L1-L2 BP ファイルおよび VVunitAligner 用のフォルダー。
      3. 音声解析ソフトウェアを開きます。
      4. Praat |Praat スクリプトを開きオブジェクトウィンドウからスクリプトを呼び出します。
      5. 「実行」ボタンを一度クリックします。
        注: スクリプトを使用するための設定を含む「Phonetic sylable alignment」という形式が画面上にポップアップ表示されます (図 3A)。
      6. [言語] ボタンをクリックして、[英語 (米国)]、[ポルトガル語 (BR)]、[フランス語 (FR)]、または [スペイン語 (ES)] 言語から選択します。
      7. [チャンク セグメンテーション] ボタンをクリックして、[自動]、[強制 (手動)]、または [なし] のセグメンテーション手順から選択します。
      8. 新しいTextGridファイルを自動的に保存するには、TextGridファイルを保存オプションを確認してください。
      9. [OK] をクリックします |ステップ 1.3.5.7 .
        から音声単位を再調整するための Run ボタン 注: 各オーディオ ファイルについて、VVUnitAligner はセクション 1.3.7 用の新しい TextGrid ファイルを生成します (図 3B)。
    7. 音響特徴の自動抽出を行います。
      1. 韻律音響機能を自動的に抽出するために、https://github.com/leonidasjr/SpeechRhythmCode/blob/main/SpeechRhythmExtractor.praat からスクリプト SpeechRhythmExtractor45 にアクセスしてダウンロードします。
      2. 新しいフォルダを作成し、SpeechRhythmExtractorをすべての言語のオーディオ/TextGridファイルのすべてのペアと一緒に配置します。
      3. 音声解析ソフトウェアを開きます。
      4. Praat |Praat スクリプトを開きオブジェクトウィンドウからスクリプトを呼び出します。
      5. [実行] ボタンを 1 回だけクリックします。
        注:スクリプト設定を含むフォームが画面にポップアップ表示されます。出力 '.txt' ファイル名のボックスで、それに応じてファイルの名前を変更するか、既定の名前のままにします。
      6. 音声品質パラメータ・オプションをチェックして、出力ファイル VQ を音声品質 (図 3C).
        に保存します。 注:この2番目の出力ファイル(出力ファイルVQ)には、1と2番目の高調波(H1-H2)とケプストラルプロミネンスピーク(CPP)9の差のパラメータが含まれています
      7. 言語ターゲット」オプションにチェック・マークを付けて、「言語」、「方言」、または「アクセント」のラベルから選択します (図 3C)。
      8. 「単位」オプションをチェックして、f0 機能を Hz または半音で選択します (図 3C)。
      9. F0 しきい値の値、最小および最大 f0 しきい値 (図 3C).
        注意: 研究に特定の目的がある場合や事前に設定された特定のオーディオ機能がある場合を除き、ステップ1.3.7.9のパラメーターはデフォルト値のままにしておくことを強くお勧めします。
      10. [OK] をクリックします |音響機能 .
        の自動抽出のために実行します 注:スクリプトSpeechRhythmExtractorは、スピーカーから抽出された音響機能を含むタブ区切りの「.txt」ファイル(出力ファイル/出力ファイルVQ)を返します。
  4. 統計分析
    1. 音響機能を含むスプレッドシートを R46 環境 (または任意の統計ソフトウェア/環境) にアップロードします。
    2. 一般化加法モデル (GAM) ノンパラメトリック統計を実行します。
      1. R で GAM を実行します。
      2. 次のコマンドを入力して、Enter.
        キーを押します。 図書館(MGCV)
        model = gam(分析における計量/韻律音響の特徴 ~ 言語 + s(選択された計量の特徴、by = 言語) + その他の計量/韻律音響の特徴、データ = データフレーム)
        注:Rプログラミング言語でプロトコルのテスト統計を実行することにしたのは、学術コミュニティの音声学者(および言語学者)の間で人気が高まっているためです。Rは、主に音声フィールドワーク研究で使用されてきました47。ステップ 1.4.2.2 には擬似コードが含まれていることに注意してください。研究変数に従ってコードを記述します。

figure-protocol-2
図2:MAUS強制整列機能を使用した音声整列のスクリーンショット(A)破線の長方形は、'my_file.wav'/' my_file.txt'ファイルをドラッグ&ドロップしたり、フォルダからそのようなファイルを検索するために内部をクリックするためのものです。アップロードボタンは赤い矢印で示されます。(B)パネルAからアップロードされたファイル(青い矢印を参照)、使用するパイプライン、ファイルのペアの言語、返されるファイル形式、およびすべてのファイルを保持するための「true / false」ボタン。(C) チェックボックスの使用条件 (緑色の矢印を参照)、[Web サービスの実行] ボタン、および結果 (ダウンロードする TextGrid ファイル)。この図の拡大版を表示するには、ここをクリックしてください。

figure-protocol-3
図3:再調整手順のスクリーンショット。(A)再調整手順の入力設定フォーム。(B)部分波形、f0(青)輪郭の広帯域スペクトログラム、および層1としてセグメント化(およびラベル付け)された6つの層:母音の開始から次の母音の開始(V_to_V)の単位。母音の開始(V_to_V);ティア2:母音(V)、子音(C)、および一時停止(#)の単位。Tier 3:音声表現V_to_V;Tier 4:テキストからのいくつかの単語。Tier 5:テキストからの音声のいくつかのチャンク(CH)。tier 6: 女性の AmE-S によって生成された各音声チャンクの最高音 (H) と最低音 (L) を含む声調層。(C)音響特徴の自動抽出のための入力設定。この図の拡大版を表示するには、ここをクリックしてください。

2. 音声認識

注:アメリカ人リスナーと英語で4つの音声ラインナップを、ブラジルのリスナーとBPで4つの音声ラインナップを実施しました。音声認識のフローチャートについては、図 4 を参照してください

figure-protocol-4
図 4: 音声知覚の概略フローチャート. この図の拡大版を見るには、ここをクリックしてください。

  1. 参加者
    1. スピーチ制作プロトコルに参加した参加者から、グループごとに異なる参加者を選びます
      注:プロトコルのこの部分には、参加者の2つのグループが選ばれました:グループ1:American English(米国から)Listeners (AmE-L)、およびグループ 2: Brazilian Listeners (Bra-L)。本研究では、AmE-LとBra-Lの両方がL2に堪能であると見なされました(両グループはB2-C136 AmE-Lは、手順が実施されたときブラジルに2年間住んでいました。Bra-Lは、手続きが行われたとき、米国に2年以上住んでいました。海外に住んでいる間、どちらのグループも勉強や仕事の目的でL2を話していました(少なくとも週に6日、1日約4〜5時間
    2. )。
    3. 参加者の数言語(L1英語、L2 BP;L1 BP、L2 英語)、性別(女性または男性)、年齢(平均、標準偏差)、グループ特性(専門家または学部生)、および各グループのL2能力レベル
  2. 音声ラインナップ
    注: 音声ラインナップの手順は、音声ラインナップの準備と実行の 2 つの異なる手順に分けます。
    1. 英語用4名、BP用4名のボイスラインナップをご用意。
      1. セクション 1: 音声制作のスピーカーからオーディオ ファイルを取得します。
      2. 各言語要素のオーディオ ファイルが別々のフォルダーにあることを確認します。
      3. L1英語またはL1 BPの6つのボイスチャンクをランダムに選択します
        注: ラインナップの 6 つのボイスは、1 つのターゲットボイス5 つのフォイルを表しています。
      4. ステップ 2.2.1.3.
        に含まれるスピーカーの 1 つから、L2 英語または L2 BP の音声チャンクを選択します 注: 手順 2.2.1.4 の音声チャンクは参照音声です。チャンクの長さは約 20 秒でなければなりません8。
      5. https://github.com/pabarbosa/prosody-scripts-CreateLineUp から Praat CreateLineup48 のスクリプトにアクセスしてダウンロードします。
      6. CreateLineup スクリプトを実行する前に、L2 参照音声、L1 フォイル、および L1 ターゲット音声が同じフォルダにあることを確認します (<強力な class="xfig">図 5) 。
      7. 音声解析ソフトウェアを開きます。
      8. オブジェクト ウィンドウで、[Praat |Praat スクリプトを開いて、スクリプトを呼び出します。
      9. [実行] |Run.
        注: スクリプトは、(L2 参照音声) + (L1 ターゲット音声とランダムに配布されたフォイル) (図 5) の順序でファイルを返します
    2. ボイスラインナップの運営
      1. オンラインスペースを作成して、任意のプラットフォーム(SurveyMonkeyなど)でラインナップをホストします。資料表を参照)音声ラインナップをリモートで指揮するためのもの。
      2. オンラインスペースのリンクにアクセスします。
      3. CreateLineup スクリプトから返されたファイルをプラットフォームにアップロードします。
      4. 参加者の前に手順を実行して、すべてのステップをテストします。
        注:事前にリンクにアクセスし、ラインナップを実行して、すべてが正常に機能しているかどうかを確認することをお勧めします。
  3. 統計分析
    1. リスナーの判断のスコアを含むスプレッドシートをR環境(または任意の統計ソフトウェア/環境)にアップロードします。
      1. RでKruskal-Wallis検定を実行します。
      2. 次のコマンドを入力して、Enter.
        キーを押します。 model = kruskal.test(判断~音声ラインナップ、データ=データフレーム)
    2. 事後的なダンのテストを実行します。
      1. Rでダンのテストを実行します。
      2. 次のコマンドを入力して、Enter.
        キーを押します。 図書館
        model = dunnTest(判断~各音声ラインナップ, data = data, method = "bonferroni")
        注: 手順 2.3.1.2 と 2.3.2.2 のコードは擬似コードです (注 1.4.2.2 を参照)。
  4. 音響類似性解析
    1. ターゲットとフォイルとの間に有意でない違いが見られたラインナップ(ステップ2.2.1.3の注を参照)を選択します。
    2. 手順1.3.1から1.3.7.5、および手順1.3.7.8から1.3.7.10の手順を繰り返します。
    3. Python49, AcousticSimilarity_cosine_euclidean50 from https://github.com/leonidasjr/AcousticSimilarity/blob/main/AcousticSmilarity_cosine_euclidean.py.
      注: スクリプトは 3 つの行列 ('.txt' と '.csv' で) を返します。1 つはコサイン類似度 51,52、1 つはユークリッド距離52,53)、もう 1 つは変換されたユークリッド距離の値、およびターゲット ボイスと各フォイルのペアワイズ 比較です。
    4. スクリプトがラインナップデータセットの同じフォルダーにダウンロードされていることを証明します。
    5. [ファイルを開く...] ボタンをクリックして、スクリプトを呼び出します。
    6. [実行] |デバッグボタンなしで実行.
      注: 2 番目の [実行] ボタンには、[実行] または [デバッグなしで実行] または [スクリプトの実行] というタグが付けられている場合があります。これらはすべて同じコマンドを実行します。それは単に使用されるPython環境に依存します。
    7. 音響特性に基づいて音声類似性テストを実行します。
      注:コサイン類似度(またはコサイン距離)は、人工知能(AI)、特に自動音声認識(ASR)システムの機械学習に適用される手法です。これは、0 と 1 の間の類似性の尺度です。1 に近いコサイン類似性は、2 つの声が類似している可能性が非常に高いことを意味します。コサイン類似度が 0 に近いということは、音声が非類似である可能性が非常に高いことを意味します52。ユークリッド距離は、ユークリッド類似度と呼ばれることが多く、AI、機械学習、ASRでも広く使用されています。これは、ユークリッド空間53 の 2 点間の直線距離を表し、つまり、点が近い (距離の値が短い) ほど、ボイスはより類似しています。両方の手法で報告された結果をより明確に理解するために、ユークリッド距離の生スコアを 0 (音声類似性が少ない) から 1 (音声類似性が高い) までの値に変換しました54

figure-protocol-5
図 5: 音声認識のためのディレクトリ設定。ラインナップフォルダ。各フォルダには、6 つの L1 音声、L2 ターゲット音声、"CreateLineup" スクリプト、音声ラインナップ オーディオ ファイル (スクリプトの実行後に返される) が含まれています。この図の拡大版を表示するには、ここをクリックしてください。

結果

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

音声生成の結果
このセクションでは、統計的に有意な韻律音響機能とリズムメトリクスのパフォーマンスについて説明しました。そのような韻律の特徴は、持続時間に関連する音声、明瞭度、一時停止率、および音声品質に関連するきらめきでした。リズムメトリクスは、音節の長さの標準偏差(SD)、子音のSD、発声または子音の持続時間のSD、および音節の長さの変動係数でした(補足表S1を参照)。

発話速度 (図 6A) は、L1-L2 BP よりも L1-L2 英語の方が急速に減少しますが、 どちらの L2 でもその速度は低くなります。音声速度は、音節の長さの SD (SD-S)、母音の SD (SD-V)、音節変動係数 (Varco-S) の 3 つのメトリックに関連しています。また、AmE-SグループとBra-Sグループの両方がL2に習熟していることを覚えておくことも重要です。このような速度は、音節の長さの値が高いことと、L1-L2 BPによって生成される変動性が低いことに影響され、傾斜が緩くなるようです。

アーティキュレーションレート (図 6D) は、SD-SVarco-S、および音節リズム比 (RR-S) に関連しています。RR-Sは、短い音節と長い音節の比率を表します。このようなメトリクスは、文の長さや長さのばらつきにより、L2音声計画やL2認知負荷9,23,54に対して、影響を受ける音声速度と同様に、アーティキュレーション率に影響を与えるようです。韻律音響パラメータが影響を受けるような方法で、文の長さの領域ではより高い認知言語的負荷が必要になるかもしれません55

音声とアーティキュレーションの速度の韻律音響的特徴に関して、私たちの調査結果は、話者が音節(および母音)の長さを変化させるほど、そのような速度が低くなることを示唆しています。我々は、L1 BPとL2 BPの両方の音声知覚は、L1とL2-Englishよりもやや遅く、L1-Englishは他のすべての言語レベルよりも速く聞こえるという仮説を立てています。この事実は、発話リズムと、L1-L2 BPがリズム連続体の音節タイミングの極に傾いているのに対し、L1-L2英語はストレスタイミングの極に向かって移動するという仮説に関連している可能性があります21,22

ローカルシマー 図 6B は、SD-SVarco-S の影響を受けます。Local shimmerについては、Bra-S、L1-BP、L2-Englishの両方のプロダクションは、音節の持続時間の変動性が増加するにつれて、やや単調な軌道を示します(SDとVarco、補足表S1を参照)。Bra-Sのプロダクションを聴くと、8.5〜9 dBの範囲の変動が少ないため、ボーカルの努力の認識が明らかになる場合があります。Bra-Sの音声は、音声負荷の影響を受けます。L1-BPは、文の長さが音節の長さの大きな変動にあまり敏感でないことに大きく影響されます(BPのリズムパターンは音節の変動が少ない22,56)。

ポーズ率 (図 6C) は、L2-英語の話者が L1-English、L1-BP、L2-BP のもの (L1-英語で平均 30 ミリ秒、L1-BP で 50 ミリ秒、L2-BP で 100 ミリ秒) よりも長い一時停止 (200 ミリ秒から 375 ミリ秒) を生成することを示しています。この場合、言語計画は、脳の活動の増加により、L2-英語の生成に影響を与えた可能性があります54,57。言語能力が高いほど、読み取り速度とspan54;それにもかかわらず、第二言語に堪能な話者であっても、読解課題は外国語スピーチの高次認知的側面と言語処理においてより多くの努力を示しました54,57。私たちの調査結果は、少なくとも予備的には、L2-BPスピーカーは、両方の言語のリズムパターンの違いにより、L2-英語よりも一時停止による影響が少ない可能性があることを示しています。

figure-results-1
図6:韻律音響の特徴のための一般化加法モデル。 Y軸では、応答変数(モデル化する音響特徴)。X 軸には、予測変数 (因子 'Language' と、曲線の形状と軌跡を提供する加法モデル内の共変量 (つまり、平滑化効果: 'Language + 共変量')、および 'Language' の積と、応答変数のより正確な射影を提供するメトリック特徴 (つまり、 factor-smooth interactions: 'covariate:Language')。略語: GAMs = Generalized Additive Models.この図の拡大版を表示するには、ここをクリックしてください。

リズムメトリクスに関連して、SD-S (図 7A) の場合、話者が f0 曲線を変化させ、発話速度を増加させるほど、すべての言語レベルで SD-S が減少することが明らかになりました (これは 図 6A の鏡像効果)。子音のSDの場合(SD-C, 図7C)、L1-BPはL1英語とは対照的に、発話速度や一時停止時間が長くなるにつれて変動が小さくなります。このようなSDの方向は、L1-英語の音節の持続時間の変動が(統計的に)L1-BP44,58よりも有意に高いことから予測されますVarco-S (図 7B および補足表 S1) は、同じ言語グループの L1 と L2 といくらか相関しているように思われます。f0の変動性と発話速度が増加すると、L1-BPではVarco-Sが減少し、L2-BPでは減少して減衰するように見えます。英語のプロダクションでは、f0の変動性と音声速度が増加しますが、L1-英語とL2-英語ではVarco-Sが増加および減衰します。

母音または子音のSDについて(SD-V_C図7Dおよび補足表S1)について、我々の結果はVarco-Sの性能(図7B)といくつかの類似性を示している。たとえば、音声速度一時停止時間および f0 の変動性が高いほど、L1-BP と L2-BP の SD-V_C のフォール - ライズ トラジェクトリが促進されます。英語の作品では、このような韻律的な特徴が高い一方で、SD-V_Cはわずかに減少し、L1-英語では減衰し、わずかに増加し、L2-英語では減衰します。Varco-SSD-V_Cの同じ言語グループのL1-L2との相関関係は、バックグラウンドノイズによる音声の音響パラメータの変化を指すロンバード効果によって部分的に説明できるかもしれません59

外国語のスピーチでは、タスクの複雑さ(例えば、リーディングスピーチ)に応じて、話者はL1とL2の両方で同様の音響戦略を使用しています59,60。一方で、マルクーとアーネストスは、L2ロンバード語のスピーチにおけるf0の測定値(範囲と中央値)が、L2英語話者が彼らのL1オランダ語61,62の影響を受けていることを発見しました。一方、より最近の知見では、L2を話すときの認知負荷が高いため、L2ロンバード語の話し言葉はL1のロンバード語の話し方とは異なると予想されるが、L2英語話者はL1英語話者と同じ方向にロンバード語の話し言葉を発した63が提案されている。私たちの調査結果がMarcouxとErnestus63と一致し、Waaning59、Villegasら60、およびMarcouxとErnestus61,62からどの程度一致しているかについては、さらに調査が必要です。

figure-results-2
図7:メトリック特徴の一般化加法モデル。Y軸では、応答変数(モデル化されるメトリック特徴)。X 軸には、予測変数 (因子 'Language' と、曲線の形状と軌跡を提供する加法モデル内の共変量 (つまり、平滑化効果: 'Language + 共変量')、および 'Language' の積と、応答変数のより正確な射影を提供するメトリック特徴 (つまり、 factor-smooth interactions: 'covariate:Language')。略語: GAMs = Generalized Additive Models.この図の拡大版を表示するには、ここをクリックしてください。

音声知覚の結果
BP ボイスのラインナップに関連して、ラインナップ #1 (図 8A) では、フォイルボイス #3 がターゲットボイスと判断されました。実は、ターゲットの声は#4でした。結果は、ホイル#3(83%)とターゲット音声#4(71%)との間に統計的に有意な差(補足表S1を参照)を示していません。ラインナップ #2 (図 8B) では、 ターゲット音声 #3 (40%) とフォイル #4 (20%) との比較でも、英語の音声ラインナップに統計的に有意な差は見られませんでした (補足表 S1 参照)。ラインナップ #1 (図 9A) では、フォイル #2 (26%) とターゲット音声 #4 (54%) の間に有意差はありませんでした (補足表 S1 参照)。

音声類似度の解析では、コサイン類似度(CoSim)とユークリッド距離(EucDist, [EucDist transformed]54)の両方が、ホイル#3とBPラインナップ#1のターゲットとの間に一貫した相関関係を示しました(CoSim = 0.99;EucDist = 77.4, [0.93])。ホイル#4とターゲットの相関は、BPラインナップ#2でも同様に強かった(CoSim = 0.99、EucDist = 76.3、[0.93])。英語のラインナップ #1 では、相関は CoSim (0.83( 0.83)で一貫していましたが、EucDist (213.0 [0.47] では弱かったり満足したりしました。全体として、CoSimEucDist はどちらも、音声の類似性を判断する上で満足のいく手法でした。さらに、GahmanとElangovan52(補足表S1を参照)で指摘されているように、CoSimはわずかに効果的に機能しました。

類似性の観点から、誤報の増加につながったのは何でしょうか?韻律音響の特徴は、フォイルとターゲットボイスが(統計的に)有意に異なるパフォーマンスを発揮したにもかかわらず、図8A,Bおよび図9A)の異なるフォイルによって、リスナーの選択肢が多少多様化しているという証拠を示しました(図8C,D、および図9B)-D) です。このような判断は、韻律音響の特徴のクラス全体よりも、スピーカーが共有する1つ(またはおそらくそれ以上)の特定の音響機能に依存しているようです。たとえば、私たちの研究では、プロダクション間で(共)異なるいくつかの特徴が示されました。それにもかかわらず、知覚結果は、特定のフォイルがターゲットの音声に一致するかどうかの判断の好みを示しています8,35,64,65。今後の研究には、さらなる分析が必要である。

音響類似性のための多次元パラメトリック行列の選択を検討することは注目に値します66 この研究で提示されたものとして。私たちの調査結果は、f0、VQ、および強度に基づく音響特性を使用した以前の研究と一致しています9,35。このような機能は、法医学分野での話者比較タスクに顕著に推奨されます9,66。それにもかかわらず、現在の研究では、マクファーレンのガイドライン<の変種である sup class="xref">16,17 のバリエーションを使用して、外国語アクセントの話者認識のための音声ラインナップを準備しましたが、現在の研究では、どのフォイルもターゲット音声と類似していないことを強調することが重要です。さらに、私たちの声のラインナップ手順には、刺激の長さ、声の数、フォイルの選択(ここではランダム化)、話し方など、マクファーレンのガイドラインとの重要な違いが含まれていることを強調しなければなりません。

f0の韻律音響的特徴がどの程度リスナーの知覚に関連しているかは、研究で使用された話し方に大きく依存します。ここでは、リーディングパッセージを使用しました。大多数の耳の目撃者研究は、バランスの取れた解決策として(半)自発的な刺激を選択しています-例えば、DyVisコーパス67-これは現代の耳の目撃者の調査で広く採用されています28,68。私たちが読書課題を選んだ理由は、この原稿が書かれた時点では、私たちのコーパスが読書課題から得られたデータのみで構成されていたからです。ただし、(半)自発的なコーパスを編集するプロセスがすでに進行中であることを認識することが重要です。さらに、物語を読むという行為は、話者内と話者間の両方で、信頼できるレベルの均一性とバリエーションを生み出すことができます。これにより、音声比較を含む状況で、韻律的または音声的特性(個別または方言)に重点を置くことが容易になります。これは、外国語アクセントの生成中に声に負荷がかかる場合に特に顕著になり、熟練した話者の間でも顕著になります8,9,23,54

figure-results-3
図8:ブラジルのリスナーが行った4つのラインナップの結果を含む棒グラフ。 (A,B)ターゲット音声(青)とフォイル(水色)の間に有意差はありません。(C,D)箔押しとは大きく異なり、ターゲットボイスとしている。略語: NS = 非有意。この図の拡大版を表示するには、ここをクリックしてください。

figure-results-4
図9:アメリカのリスナーが行った4つのラインナップの結果を含む棒グラフ。(A)ターゲット音声(赤)とホイル(ピンク)の間に有意でない差。(BCD)フォイルとターゲットボイスとの大きな違い。略語: NS = 非有意。この図の拡大版を表示するには、ここをクリックしてください。

補足表S1:音声生成統計 - 一般化加法モデル(GAM):F統計(自由度)、統計的に有意な各韻律音響特徴の調整済みR2(図6)、リズムメトリック(図7)) と、各滑らかな用語 (共変量) の個々の値が含まれます。音声知覚統計: Kruskall-Wallis χ2 統計 (自由度)、p 値、および調整された η2、およびターゲットとフォイル音声のペア (図 8) と 図 9) のペア間の各統計的に有意でない差 (図 9) のポストホック Dunn 検定 (strong class="xfig"図 9A<)).各ラインナップのコサイン距離とユークリッド距離の音響類似度行列。この図の拡大版を表示するには、ここをクリックしてください。

ディスカッション

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

現在のプロトコルは、(法医学的)音声学の分野に目新しさをもたらします。それは、生産に基づくフェーズ(音響分析)と知覚に基づくフェーズ(判断分析)の2つのフェーズに分かれています。生産分析フェーズは、統計に加えて、データ準備と強制アライメント、再アライメント、および韻律音響特徴の自動抽出で構成されます。このプロトコルは、主に手動のセグメンテーションに基づく従来のプロトコルよりも高速かつ効率的な方法で、データ収集の段階をデータ分析に接続します。

ただし、プロトコル ステップ 1.3.6 から 1.3.6.9 に示されている再調整プロセスは、基本的にプロトコル ステップ 1.3.1 から 1.3.4 で生成された電話およびワード ユニットで機能します。再配置プロセスの目新しさは、音節層、単語に基づいて自動または手動で生成できる音声チャンク層、およびf0小節の計算に非常に役立つトーン層の3つの新しいテキスト層を含む新しいTextGridを生成することです。このプロトコルに提案された再調整ガイドラインは、L2 音声リズム216970 の研究、機械学習技術を使用した外国アクセント程度の検出に関する研究22、および法医学領域9 の研究で以前に使用されていました。

プロトコルステップ1.3.7から1.3.7.10で提示された韻律的特徴の自動抽出は、現在の研究で証明できるような、韻律音響的特徴の多次元マトリックスを生成する。このような特徴には、メロディック、持続時間、およびスペクトル(音声品質および強度)の音声特徴71が含まれる。これらの音響的特徴のかなりの数は、感度が低く、フォレンジックまたは他のシナリオ72で最終的に収集されるノイズの多い音声録音に対してやや堅牢である。さらに、多次元行列は、いくつかの AI 技術を介して音声認識システムに適用できます (作業中)。これは、L2 発音クラス21 (作業中) の運韻の側面を教える際に依然として非常に役立ちます。

プロトコルのこの部分の統計分析は、特定の音響特徴と複数の言語要因の話者との間の複雑な関係を扱ったため、GAM法の使用を表しています。たとえば、特定の音響特徴をモデル化するには、音声生成中に何が起こっているかをより正確に説明できるように、マトリックスの他の音響特徴 (滑らかな項) がどのように機能するかを確認する必要がありました。

知覚分析については、音声ラインナップの作成と実装、統計分析、音響類似性分析によって現在のプロトコルが構成されました。ラインナップを準備するために、プロトコルのステップ2.2から2.2.1.9で説明されているように、ランダムにシーケンスされたフォイルとターゲット音声を含む各ラインナップのオーディオファイルを自動的に生成するPraat用のCreateLineupスクリプトを使用しました。

このプロトコルの統計分析では、データが分散分析 (ANOVA) の仮定を満たさなかったため、Kruskal-Wallis ノンパラメトリック検定を実行しました。リスナーによって評価され、ターゲットの声とフォイルに対して制御された判断スコアの間に関係ができたら、線形モデル統計を使用することを選択しました。

音響類似性解析では、Python用の AcousticSmilarity_cosine_euclidean スクリプトを使用しました。プログラムはコンピューターのディレクトリ ツリーをポップアップし、フォイルの韻律音響的特徴と、分析のラインナップを構成するターゲット音声を含むファイルを選択するようにユーザーに求めます。ボタンをクリックするだけで、スクリプトは '.txt' (タブ区切り) ファイルと '.csv' ファイルの両方で、コサイン、ユークリッド、変換 (0 対 1) ユークリッドの 3 つの類似行列を生成します。すべてのデータセット(フォイルとターゲットの韻律音響的特徴を含む「.txt」ファイル)はラインナップの元のフォルダにある必要があり、すべてのラインナップフォルダには AcousticSmilarity_cosine_euclidean スクリプトのコピーが必要であることに留意する必要があります。

要約すると、現在のプロトコルは(法医学)音声学研究を進めています。生産と知覚の分析、音響の類似性という異なるフェーズで構成され、データ収集と多次元音響特徴分析の間のギャップを埋めます。研究者は、生産と知覚の両方の側面を探求し、全体的な視点から恩恵を受けることができます。さらに、このプロトコルは研究の再現性を保証し、他の人がこの研究のガイドラインに基づいて構築できるようにします。

制限と今後の方向性
データ準備がプロトコルのステップ1.3.1から1.3.4で提案されたガイドラインに従えば、すべてがうまくいくことを心に留めておく必要があります。さらに、強制アライメント手順では、現在の作業で使用されている外部の事前トレーニング済み強制アライナー(MAUSのような)は、特に事前トレーニングされていない外国アクセント付きデータや事前トレーニング済みアライナーでさえ、オーディオの品質が良くないか、アライナーに音声言語が含まれていないかにかかわらず、セグメンテーションエラーの影響を受けやすいことに注意する必要があります(この事実は、専門家の作業をより困難で時間がかかります)。法医学的転写、特に長い音声ファイルの転写は、音声録音の正確で信頼性の高い表現に関して困難に遭遇します72

また、長いオーディオファイルの文字起こしや整列には、いくつかの課題があります。アライナーのパフォーマンスは、話し方や音声環境、方言固有の要因の影響を受けます。アライナー固有の違いはありますが、一般的に、それらのパフォーマンスは類似しており、手動アライメント全体に匹敵するセグメンテーションを生成します73。さらに、MAUS では外国語の音声モデルが利用できないため、L1 および L2 英語の制作は、事前にトレーニングされたアメリカ英語の音響モデルを使用して実行されました。さらに、MAUSにはBPの事前学習済み音響モデルはありません。血圧データには、イタリア語の既存の音響モデルが使用されました(注、プロトコルステップ1.3.5.7を参照)。

将来の研究 (進行中) では、プロトコルの一部としてモントリオール強制アライナー (MFA)74 を使用します。MFAの大きな利点は、さまざまな言語(BPを含む)に対して事前トレーニングされた音響モデルと書記素から音素へのモデルが利用可能であること、および新しいデータセット(つまり、外国語アクセントの音声コーパス)に新しい音響モデルと書記素から音素へのモデルをトレーニングする機能です75

開示事項

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

著者には宣言すべき利益相反はありません。

謝辞

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

この研究は、全米科学技術開発評議会 - CNPq、第一著者に助成金番号307010/2022-8、第二著者に助成金番号302194/2019-3の支援を受けました。筆者より、本研究の参加者の皆様の多大なるご協力と貴重なご貢献に心より感謝申し上げます。

材料

この記事で使用された材料の一覧
名前会社カタログ番号コメント
CreateLineupPersonal collection#音声ラインナップ用スクリプト
Dell I3 (ソリッドステートドライブ - SSD) Dell#ラップトップコンピュータPraat
Paul Boersma &David Weenink#音声解析用ソフトウェア
Python 3Python Software Foundation#インタープリター、高水準、汎用プログラミング言語 
RThe R Project for Statistical Computing#Programming language for stattistical computing
Shure Beta SM7BShure#Microphone
SpeechRhythmExtractorPersonal collection#Script for praat for automatic extraction of acoustic features
SurveyMonkeySurveyMonkey Inc.#無料のカスタマイズ可能な調査と、データ分析、サンプル選択、バイアス除去、データ表現を含む一連のバックエンドプログラムの組み立て。
Tascam DR-100 MKIITascam#デジタルボイスレコーダー
ミュンヘン自動セグメンテーションシステム MAUSミュンヘン大学#オーディオ (.wav) および言語情報 (.txt) ファイルの強制アライナー
VVUnitAligner個人コレクション#音声単位の自動再調整と後処理のためのプラアットのスクリプト

参考文献

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Moyer, A. Foreign Accent: The Phenomenon of Non-native Speech. , Cambridge University Press. (2013).
  2. Munro, M., Derwing, T. Foreign accent, comprehensibility and intelligibility, redux. J Second Lang Pronunciation. 6 (3), 283-309 (2020).
  3. Levis, J. Intelligibility, Oral Communication, and the Teaching of Pronunciation. , Cambridge University Press. (2018).
  4. Munro, M. Applying Phonetics: Speech Science in Everyday Life. , Wiley-Blackwell. (2022).
  5. Gut, U. Speaker Classification. Muller, C. , Springer-Verlag. 75-87 (2007).
  6. Rogers, H. Foreign accent in voice discrimination: a case study. Forensic Linguistics. 5 (2), 203-208 (1998).
  7. Solan, L., Tiersma, P. Hearing Voices: Speaker Identification in Court. Hastings Law Journal. 54, 373-436 (2003).
  8. Alcaraz, J. The long-term average spectrum in forensic phonetics: From collation to discrimination of speakers. Estudios de Fonética Experimental / Journal o Experimental Phonetics. 32, 87-110 (2023).
  9. Silva, L. Jr, Barbosa, P. A. Voice disguise and foreign accent: Prosodic aspects of English produced by Brazilian Portuguese speakers. Estudios de Fonética Experimental / Journal o Experimental Phonetics. 32, 195-226 (2023).
  10. Munro, M., Derwing, T. Modeling perceptions of the accentedness and comprehensibility of L2 speech. Studies in Second Language Acquisition. 23 (4), 451-468 (2001).
  11. Keating, P., Esposito, C. Linguistic Voice Quality. Working Papers in Phonetics. , 85-91 (2007).
  12. Niebuhr, O., Skarnitzl, R., Tylečková, L. The acoustic fingerprint of a charismatic voice -Initial evidence from correlations between long-term spectral features and listener ratings. Proceedings of Speech Prosody. , 359-363 (2018).
  13. Segundo San, E. International survey on voice quality: Forensic practitioners versus voice therapists. Estudios de Fonética Experimental. 29, 8-34 (2021).
  14. Farrús, M. Fusing prosodic and acoustic information for speaker recognition. International Journal of Speech, Language and the Law. 16 (1), 169(2009).
  15. Farrús, M. Voice disguise in automatic speaker recognition. ACM Computing Surveys. 51 (4), 1-2 (2018).
  16. Nolan, F. A recent voice parade. The International Journal of Speech, Language and the Law. 10 (2), 277-291 (2003).
  17. McDougall, K. Ear-catching versus eye-catching? Some developments and current challenges in earwitness identification evidence. Speaker Individuality in Phonetics and Speech Sciences. Bernardasci, C., Dipino, D., Garassino, D., Negrinelli, S., Pellegrino, E., Schmid, S. , Officinaventuno. 33-56 (2021).
  18. Gut, U. Rhythm in L2 speech. Speech and Language Technology. 14 (15), 83-94 (2012).
  19. Urbani, M. Pitch Range in L1/L2 English. An Analysis of F0 using LTD and Linguistic Measures. Coop. , Libraria Editrice Università di Padova. (2012).
  20. Gonzales, A., Ishihara, S., Tsurutani, C. Perception modeling of native and foreign-accented Japanese speech based on prosodic features of pitch accent. J Acoust Soc Am. 133 (5), 3572(2013).
  21. Silva, L. Jr, Barbosa, P. A. Speech rhythm of English as L2: an investigation of prosodic variables on the production of Brazilian Portuguese speakers. J Speech Sci. 8 (2), 37-57 (2019).
  22. Foreign accent and L2 speech rhythm of English a pilot study based on metric and prosodic parameters. Silva, L. Jr, Barbosa, P. A. Proceedings of the II Brazilian Conference on Prosody (Anais II Congresso Brasileiro de Prosódia), 1, 41-50 (2023).
  23. Costa, A. El cerebro bilingüe: La neurociencia del lenguaje. , Penguin Randon House. (2017).
  24. Eriksson, A. Tutorial on forensic speech science: Part I. Forensic Phonetics. , (2005).
  25. Harvey, M., Giroux, M., Price, H. Lineup size influences voice identification accuracy. Applied Cognitive Psychology. 37 (5), 42-89 (2023).
  26. Pautz, N., et al. Identifying unfamiliar voices: Examining the system variables of sample duration and parade size. Q J Exp Psychol (Hove). 76 (12), 2804-2822 (2023).
  27. McDougall, K., Nolan, F., Hudson, T. Telephone transmission and earwitnesses: Performance on voice parades controlled for voice similarity. Phonetica. 72 (4), 257-272 (2015).
  28. Nolan, F., McDougall, K., Hudson, T. Some acoustic correlates of perceived (dis) similarity between same-accent voices. Proceedings of the International Congress of Phonetic Sciences (ICPhS 2011). , 1506-1509 (2011).
  29. Sheoran, S., Mahna, D. Voice identification and speech recognition: an arena of voice acoustics. Eur Chem Bull. 12 (5), 50-60 (2023).
  30. Hudson, T., McDougall, K., Hughes, V. Forensic phonetics. The Cambridge Handbook of Phonetics. Knight, R. -A., Setter, J. , Cambridge University Press. 631-656 (2021).
  31. Eriksson, A. The disguised voice: Imitating accents or speech styles and impersonating individuals. Language and identities. Llamas, C., Watt, D. , Edinburgh University Press. 86-96 (2010).
  32. Köster, O., Schiller, N. Different influences of the native language of a listener on speaker recognition. Forensic Linguistics. 4 (1), 18-27 (1997).
  33. The influence of native-language background on speaker recognition. Köster, O., Schiller, N., Künzel, H. Proceedings of the International Congress of Phonetic Sciences (ICPhS 1995), , 306-309 (1995).
  34. Thompson, C. P. A language effect in voice identification. Applied Cognitive Psychology. 1, 121-131 (1987).
  35. San Segundo, E., Univaso, P., Gurlekian, J. Sistema multiparamétrico para la comparación forense de hablantes. Estudios de Fonética Experimental. 28, 13-45 (2019).
  36. Council of Europe. Common European Framework of Reference for Languages: Learning, Teaching, Assessment. , Press Syndicate of the University of Cambridge. (2001).
  37. How to use Tascam DR-100 MKII: Getting started. , https://www.youtube.com/watch?v=O2E72uV9fWc (2018).
  38. Getting the most from your Shure SM58 microphone. , https://www.youtube.com/watch?v=wweNufW7EXA (2020).
  39. Kisler, T., Reichel, U. D., Schiel, F. Multilingual processing of speech via web services. Computer Speech & Language. 45, https://clarin.phonetik.uni-muenchen.de/BASWebServices/interface/WebMAUSBasic 326-347 (2017).
  40. Escudero, P., Boersma, P., Rauber, A., Bion, R. A cross-dialect acoustic description of vowels: Brazilian and European Portuguese. J Acoust Soc Am. 126 (3), 1379-1393 (2009).
  41. Post-aspiration in standard Italian: some first cross-regional acoustic evidence. Stevens, M., Hajek, J. Proceedings 11th Conference of the International Speech Communication Association (INTERSPEECH 2010), , 1557-1560 (2011).
  42. Barbosa, P., Madureira, S. Manual de Fonética Acústica Experimental: aplicações a dados do português. , Cortez. (2015).
  43. Boersma, P., Weenink, D. Praat: Doing phonetics by computer. (Version 6.1.38) [Computer program]. , https://www.praat.org/ (1992-2021).
  44. Silva, L. Jr VVUnitAligner. [Computer program]. , https://github.com/leonidasjr/VVunitAlignerCode_webMAUS (2022).
  45. Silva, L. Jr, Barbosa, P. A. SpeechRhythmExtractor [Computer program]. , https://github.com/leonidasjr/VowelCode (2019-2023).
  46. R Core Team. A language and environment for statistical computing. R Foundation for Statistical Computing. , https://www.R-project.org/ (2023).
  47. Pigoli, D., Hadjipantelis, P. Z., Coleman, J. Z., Aston, J. The statistical analysis of acoustic phonetic data. Journal of the Royal Statistical Society. 67 (5), 1103-1145 (2018).
  48. Barbosa, P. A. CreateLineup [Computer program]. , https://github.com/pabarbosa/prosody-scripts-CreateLineUp (2021).
  49. Van Rossum, G., Drake, F. L. Python 3 Reference Manual. , CreateSpace. (2009).
  50. Silva, L. Jr AcousticSimilarity_cosine_euclidean. [Computer program]. , https://github.com/leonidasjr/AcousticSimilarity/blob/main/AcousticSmilarity_cosine_euclidean.py (2024).
  51. Automatic assessment of voice similarity within and across speaker groups with different accents. Gerlach, L., McDougall, K., Kelly, F., Alexander, A. Proceedings of the International Congress of Phonetic Sciences (ICPhS 2023), , 3785-3789 (2023).
  52. Gahman, N., Elangovan, V. A comparison of document similarity algorithms. International Journal of Artificial Intelligence and Applications. 14 (2), 41-50 (2023).
  53. San Segundo, E., Tsanas, A., Gómez-Vilda, P. Euclidean distances as measures of speaker similarity including identical twin pairs: A forensic investigation using source and Filter voice characteristics. Forensic Science International. 270, 25-38 (2017).
  54. Speaker's voice characteristics and similarity measurement using Euclidean distances. Singh, M. K., Singh, N., Singh, A. K. Proceedings of the International Conference on Signal Processing and Communication (ICSC 2019), , 317-322 (2019).
  55. Darling-White, M., Banks, W. Speech rate varies with sentence length in typically developing children. J Speech Lang Hear Res. 64 (6), 2385-2391 (2021).
  56. Barbosa, P. A. Incursões em torno do ritmo da Fala. , Pontes Editores. (2006).
  57. Golestani, N., Pallier, C. Anatomical correlates of foreign speech sound production. Cereb Cortex. 17 (4), 929-934 (2007).
  58. Trouvain, J., Fauth, C., Möbius, B. Breath and non-breath pauses in fluent and disfluent phases of German and French L1 and L2 read speech. Proceedings of Speech Prosody. , 31-35 (2016).
  59. Waaning, J. The Lombard effect: the effects of noise exposure and being instructed to speak clearly on speech acoustic parameters. [Master's thesis]. , Radboud University. (2021).
  60. Villegas, J., Perkins, J., Wilson, I. Effects of task and language nativeness on the Lombard effect and on its onset and offset timing. J Acoust Soc Am. 149 (3), 1855(2021).
  61. Differences between native and non-native Lombard speech in terms of pitch range. Proceedings of the 23rd International Congress on Acoustics(ICA 2019). Marcoux, K., Ernestus, M. , 5713-5720 (2019).
  62. Marcoux, K., Ernestus, M. Pitch in native and non-native Lombard speech. Proceedings of the International Congress of Phonetic Sciences (ICPhS 2019). , 2605-2609 (2019).
  63. Marcoux, K., Ernestus, M. Acoustic characteristics of non-native Lombard speech in the DELNN corpus. Journal of Phonetics. 102, 1-25 (2024).
  64. Gil, J., San Segundo, E. La cualidad de voz en fonética judicial [Voice quality in judicial phonetics]. Lingüística Forense: la Lingüística en el ámbito legal y policial. Garayzábal, M., Jiménez, M., Reigosa, M. , Euphonía Ediciones. 154-199 (2014).
  65. Gil, J., San Segundo, E. El disimulo de la cualidad de voz en fonética judicial: Estudio perceptivo de la hiponasalidad [Voice quality disguise in judicial phonetics: A perceptual study of hyponasality. Panorama de la fonética española actual. Penas-báñez, M. A. , Arco Libros. 321-366 (2013).
  66. Passeti, R., Madureira, S., Barbosa, P. What can voice line-ups tell us about voice similarity. Proceedings of the International Congress of Phonetic Sciences (ICPhS 2023). , 3765-3769 (2023).
  67. Nolan, F. The DyViS database: Style-controlled recordings of 100 homogeneous speakers for forensic phonetic research. International Journal of Speech Language and the Law. 16 (1), 31-57 (2009).
  68. Caroll, D. Psychology of Language. , Wadsworth. (1994).
  69. Ortega-Llebaria, M., Silva, L. Jr, Nagao, J. Macro- and micro-rhythm in L2 English: Exploration and Refinement of Measures. Proceedings of the International Congress of Phonetic Sciences (ICPhS 2023). , 1582-1586 (2023).
  70. Fernández-Trinidad, M. Hacia la aplicabilidad de la cualidad de la voz en fonética judicial. Loquens. 9 (1-2), 1-11 (2022).
  71. Brouwer, S. The role of foreign accent and short-term exposure in speech-in-speech recognition. Atten Percep Psychophys. 81, 2053-2062 (2019).
  72. Love, R., Wright, D. Specifying challenges in transcribing covert recordings: Implications for forensic transcription. Front Commun. 6, 1-14 (2021).
  73. Meer, P. Automatic alignment for New Englishes: Applying state-of-the-art aligners to Trinidadian English. J Acoust Soc Am. 147 (4), 2283-2294 (2020).
  74. Montreal Forced Aligner: trainable text-speech alignment using Kaldi. McAuliffe, M., Socolof, M., Mihuc, S., Wagner, M., Sonderegger, M. Proceedings 18th Conference of the International Speech Communication Association (INTERSPEECH 2017), , 498-502 (2017).
  75. Chodroff, E. Montreal Forced Aligner: MFA Tutorial. , https://zenodo.org/records/7591607 (2023).

再版と許可

このJoVE記事のテキストまたは図の再利用許可をリクエスト

許可をリクエスト

タグ

Prosodic FeaturesSpeech PerceptionVoice QualityFundamental FrequencySpeaker RecognitionAcoustic Similarity

関連記事