Yöntem makalesi

Ses dizilişlerinde yabancı aksan ve adli konuşmacı tanımlama: prozodiye dayalı akustik özelliklerin etkisi

1.5K görüntülenme

DOI:

10.3791/66313

27 Eylül 2024

Bu makalede

Özet

Bu araştırma, L1-L2-İngilizce ve L1-L2 Portekizce arasında bir karşılaştırma yapmayı, yabancı bir aksanın etkisinin hem metrikleri hem de prozodik-akustik parametreleri ne kadar açıkladığını kontrol etmeyi ve ayrıca bir ses diziliminde hedef sesin seçimini kontrol etmeyi amaçladı.

Özet

Bu araştırma, yabancı aksanlı İngilizce ve yabancı aksanlı Brezilya Portekizcesi'nin hem prozodik-akustik özelliklerini hem de algısal bağıntılarını incelemeyi ve konuşmacıların yabancı ve yerli aksan üretimlerinin dinleyicilerin algısıyla nasıl ilişkili olduğunu kontrol etmeyi amaçlamaktadır. Metodolojide, L2 Brezilya Portekizcesi konuşan bir grup Amerikalı ve L2 İngilizce konuşan bir grup Brezilyalı ile bir konuşma üretim prosedürü ve her iki dil için ses dizilimi gerçekleştirdiğimiz bir konuşma algılama prosedürü gerçekleştirdik. Konuşma üretimi istatistiksel analizi için, dil gruplarının, karşı sınıfın ortak değişken(ler)inin yumuşatma etkisi için kontrol edilen özelliklerin her bir sınıfı (metrik veya prozodik-akustik) üzerindeki etkisini değerlendirmek için Genelleştirilmiş Katkı Modelleri çalıştırdık. Konuşma algısı istatistiksel analizi için, kadroların seslerinin dinleyiciler tarafından değerlendirilen puanlar üzerindeki etkisini değerlendirmek için bir Kruskal-Wallis testi ve bir post-hoc Dunn testi yaptık. Yine de Kosinüs ve Öklid mesafelerine dayalı akustik (ses) benzerlik testleri yaptık. Sonuçlar, dil grupları arasında f0'ın değişkenliği, süresi ve ses kalitesi açısından önemli akustik farklılıklar göstermiştir. Dizilişler için sonuçlar, f0, yoğunluk ve ses kalitesinin prozodik özelliklerinin dinleyicilerin algılanan yargılarıyla ilişkili olduğunu gösterdi.

Giriş

Aksan, hem ana dilde (L1) hem de yabancı dilde (L2) iletişim ve akıcılığın göze çarpan ve dinamik bir yönüdür1. Yabancı aksan, bir hedef dilin L2 fonetik özelliklerini temsil eder ve diğer değişkenlerin yanı sıra konuşmacının L2 deneyimine, konuşma tarzına, giriş kalitesine, anlatımına yanıt olarak (zamanla) değişebilir. Yabancı bir aksan, yabancı bir konuşmacı tarafından üretilen L2 konuşması ile hedef dilin yerel veya referans aksanı arasındaki (skaler) fark derecesi olarak ölçülebilir2,3,4,5.

Bu araştırma, yabancı aksanlı İngilizce ve yabancı aksanlı Brezilya Portekizcesi'nin (BP) hem prozodik-akustik özelliklerini hem de algısal bağıntılarını incelemenin yanı sıra, konuşmacıların yabancı ve yerli aksan üretimlerinin dinleyicilerin algısıyla ne ölçüde ilişkili olduğunu kontrol etmeyi amaçlamaktadır. Adli tıp alanında daha önce yapılan araştırmalar, yabancı aksan tanımlamasında ünlülerin ve ünsüzlerin sağlamlığının, bir bireyin uzun vadeli analizi için istikrarlı olduğunu (The Lo Case6) veya bir konuşmacının yüksek kimlik doğruluğuna atıfta bulunduğunu (The Lindbergh Case7) göstermiştir. Bununla birlikte, süreye, temel frekansa (f0, yani perdenin akustik korelasyonu), yoğunluğa ve ses kalitesine (VQ) dayalı prozodik-akustik özelliklerin keşfi, artan bir ilgi kazanmıştır8,9. Bu nedenle, bu çalışmada prozodik-akustik özellikler seçimi, adli fonetik alanında umut verici bir yolu temsil etmektedir8,10,11,12,13.

Bu araştırma, adli vakalarda bir ses kılık değiştirme biçimi olarak yabancı aksanlara adanmış çalışmalarla desteklenmektedir14,15 ve ayrıca konuşmacı tanıma için ses dizilerinin hazırlanması16,17. Örneğin, konuşma hızı, Almanca, İtalyanca, Japonca ve Brezilya dillerinde İngilizce konuşanların tanımlanmasında önemli bir rol oynamıştır18,19,20,21,22. Konuşma hızının yanı sıra, uzun vadeli spektral ve f0 özellikleri, L2 yetkin konuşmacıları hedef dile aşinalık konusunda zorlar çünkü beyin ve bilişsel temeller hafıza, dikkat ve duyguda bir eksiklik yaşar ve uzun konuşma dönüşleri sırasında konuşmacının fonetik performansına yansır23. Adli tıp alanındaki yabancı aksanlara bakış, kulağa gerçekten yabancı aksan gibi gelen şeyin tanımının, yabancı aksanlı konuşmanın hiç veya aşırı derecede olmamasına değil, dinleyicinin yabancılığına büyük ölçüde bağlı olduğu yönündedir24.

Algısal alanda, 1990'ların ortalarından beri suçluların tanınması için kullanılan yaygın bir adli araç, bir suç mahallindeki bir faili tanımlamak için kullanılan görsel tanımaya benzer olan Voice Lineup'tır (işitsel tanıma)16<,sup class="xref">25. Bir ses dizisinde, şüphelinin sesi, bir kulak tanığı tarafından kimlik tespiti için yaş, cinsiyet, coğrafi konum, lehçe ve kültürel durum gibi sosyolinguistik yönlerden benzer folyo seslerle birlikte sunulur. Bir ses diziliminin başarısı veya başarısızlığı, ses örneklerinin sayısına ve örnek sürelerine bağlı olacaktır25,26. Ayrıca, gerçek dünyadaki örnekler için, ses kalitesinin ses tanımanın doğruluğunu sürekli olarak etkilediği düşünülmektedir. Düşük ses kalitesi, bir voice27'nin benzersiz özelliklerini bozabilir. Ses benzerliği söz konusu olduğunda, f0'a dayalı ince fonetik ayrıntı, ses tanıma sırasında dinleyicinin kafasını karıştırabilir28,29. Bu tür akustik özellikler f0'ın ötesine uzanır ve süre unsurlarını ve yoğunluk ve VQ30'un spektral özelliklerini kapsar. Birden çok prozodik özelliğin bu görünümü, doğru konuşmacı tanımlamasını sağlamak için adli ses karşılaştırması bağlamında çok önemlidir9,14,15,29,31.

Özetle, adli fonetik çalışmaları, son on yılda yabancı aksan tanımlamasına ilişkin bazı farklılıklar göstermiştir. Bir yandan, yabancı bir aksan, bir konuşmacıyı tanımlama sürecini etkilemiyor gibi görünmektedir32,33 (özellikle konuşmacı hedef yabancı aksana aşina değilse34). Öte yandan ters yönde bulgular var12,34,35.

Protokol

Bu çalışma, bir insan araştırmaları etik kurulundan onay almıştır. Ayrıca, bu çalışmaya katılan tüm katılımcılardan verilerinin kullanılması ve yayınlanması için bilgilendirilmiş onam alınmıştır.

1. Konuşma üretimi

NOT: Hem Grup 1 tarafından üretilen 'L1 İngilizce-L2 BP' hem de Grup 2 tarafından üretilen 'L1 BP-L2 İngilizce' için okuma görevinden konuşma örnekleri topladık; bu gruplar sırasıyla Amerika İngilizcesi (ABD'den) Konuşmacılar (AmE-S) ve Brezilyalı Konuşmacılardır (Bra-S). Konuşma üretimine ilişkin akış şeması için Şekil 1'e bakınız.

figure-protocol-1
Şekil 1: Konuşma üretimine ilişkin şematik akış şeması. Bu şeklin daha büyük bir versiyonunu görüntülemek için lütfen buraya tıklayın.

  1. Katılımcılar
    1. Belirleyin katılımcı sayısı, the dil (L1 İngilizce, L2 Brezilya Portekizcesi; L1 Brezilya Portekizcesi, L2 İngilizce), the cinsiyet (dişi veya erkek), the yaş (ortalama, standart sapma), grup özellikleri (profesyoneller veya lisans öğrencileri) ve L2 yeterlilik düzeyi her grup için (ileri veya oldukça ileri aşamada).
      NOT: Mevcut araştırma için, hem AmE-S hem de Bra-S grupları L2 yeterliliğine sahip kabul edilmiştir (her iki grup da B2-C1 düzeyinde nitelendirilmiştir)36). Prosedürler yürütüldüğünde, AmE-S grubu Brezilya'da iki yıldır yaşamaktaydı. Bra-S grubu ise prosedürler yürütüldüğünde ABD'de iki yıldan fazla süredir yaşamaktaydı. Her iki grup da yurt dışında yaşadıkları süre boyunca, eğitim ve çalışma amacıyla haftada en az 6 gün, günde yaklaşık 4-5 saat L2 dillerini konuşmuşlardı.
    2. Katılımcıları rahat ve sessiz bir odaya yerleştirin ve her grup için okuma materyallerini sunun.
  2. Veri toplama
    NOT: Konuşma verileri şu dillerdeki bir okuma görevinden toplanmalıdır: L1-İngilizce ve L2-BP; L1-BP ve L2-İngilizce. Gerekiyorsa katılımcıların metinleri önceden okumasına izin verin.
    1. Kayıt prosedürleri
      1. Konuşma verilerini, uygun akustik koşullara sahip sessiz bir yerde kaydedin.
      2. Dijital bir ses kaydedici kullanın (bakınız Materyaller Tablosu)37 ve tek yönlü, elektromanyetik olarak izole edilmiş bir kardioid mikrofon (bakınız Materyaller Tablosu)38.
      3. Ses verilerini ' içinde kaydedin.wavform.
      4. Örnekleme hızını 48 kHz ve kuantalama hızını 16 bit olarak ayarlayın.
        NOT: 1.2.1.3 ve 1.2.1.4 adımlarında açıklanan ses formatı ile örnekleme ve kuantizasyon hızları yapılandırması, daha sonraki akustik analizlerde kullanılan spektral özelliklerin korunması amacıyla yüksek kaliteyi sağlamak ve gürültüyü azaltmak için uygulanmıştır.
  3. Akustik analiz
    NOT: Akustik analiz prosedürlerini üç adıma ayırın: zorunlu hizalama (forced-alignment), yeniden hizalama ve akustik özellik çıkarımı.
    1. Linguistik transkripsiyonu (bir '. şeklinde) yazın.Lütfen çevirilecek metni sağlayın.her bir ses dosyası için (.file) dosyası.
    2. ' çiftini etiketleyinLütfen çevirmemi istediğiniz metni (.txt dosyasının içeriğini) paylaşın. Metni gönderdiğinizde, belirttiğiniz tüm bilimsel ve akademik standartlara uygun olarak çeviriyi gerçekleştireceğim.'/'.wavaynı ada sahip dosyalar (örneğin, 'my_file.wav'/ 'my_file.Lütfen çevrilecek kaynak metni sağlayın. Metni ilettiğinizde, belirttiğiniz akademik standartlara ve JoVE çeviri yönergelerine uygun olarak profesyonelce Türkçeye çevireceğim.').
      NOT: Bölüm 1.3.7'de özetlenen prosedürün performansını artırmak için, '.txt/.wav' dosya etiketlerinin ilk üç karakterinin şunları temsil etmesi şiddetle önerilir: Dil, Diyalektveya Aksan, dördüncü ile altıncı karakterler ise şunları belirtir: Cinsiyet (örneğin, EL1FEM için Eİngilizce L1 Female). Yedinci karakterden itibaren, kullanıcı konuşmacı numarasını belirtmelidir (örneğin, 001 (ilk konuşmacı için). Sonuç olarak, ilk '.txt/.wav' çifti EL1FEM001.
    3. Her bir L1-L2 dili için bir klasör oluşturun.
      NOT: L1-L2 İngilizce için bir klasör ve L1-L2 BP için bir klasör.
    4. Aynı dildeki tüm dosya çiftlerinin aynı klasörde olduğunu doğrulayın.
    5. Zorunlu hizalamayı gerçekleştirin.
      1. Munich Automatic Segmentation (MAUS) zorunlu hizalayıcının web arayüzüne erişin (webMAUS)39 at https://clarin.phonetik.uni-muenchen.de/BASWebServices/interface/Pipeline.
      2. Her bir çifti sürükleyip bırakın.dalga formu / .Lütfen çevrilecek metni sağlayın. şuradan alınan dosyalar kesikli dikdörtgen içindeki klasöre Dosyalar (veya dikdörtgenin içine tıklayın, Şekil 2A).
      3. Tıklayın Yükle dosyaları hizalayıcıya yüklemek için kullanılan buton (kırmızı oka bakınız) Şekil 2A).
      4. Aşağıdaki seçenekleri seçin Hizmet seçenekleri menü (Şekil 2B): G2P-MAUS-PHO2SYL için Boru hattı adı; İngilizce (ABD) (için Dil) eğer L1-L2 İngilizce verileri; İtalyanca (IT) (için Dil) eğer L1-L2 BP verileri.
        NOT: webMAUS, BP zorlanmış hizalama (forced alignment) için önceden eğitilmiş akustik modeller sunmadığından, BP verileri için 'İtalyanca'yı seçtik. Fonetik literatürü, İtalyanca fonolojisinin tıpkı BP gibi, bir dereceye kadar karşılaştırılabilir ve simetrik bir yedi ünlü envanterine sahip olduğunu öne sürmektedir.40yanı sıra konsonantal akustik benzerlikler41,42.
      5. 'Çıktı formatı' ve 'Her şeyi tut' için varsayılan seçenekleri bırakın.
      6. Kontrol edin Çalıştır kullanım koşullarını kabul etmek için seçenek kutusu (yeşil oka bakınız Şekil 2C).
      7. Tıklayın Web Servisini Çalıştır yüklenen dosyaları hizalayıcıda çalıştırmak için buton.
        NOT: Her bir ses dosyası için MAUS zorlamalı hizalayıcı (forced aligner) bir Praat dosyası döndürür TextGrid nesne (1.3.1 adımında açıklanan '.txt' dosyasından çıkarılan dilbilimsel transkripsyona dayalı olarak kelimelerin, fonolojik hecelerin ve fonların anotasyonunu içeren, Praat ile önceden formatlanmış bir '.txt' dosyası).
      8. Tıklayın ZIP Dosyası olarak indir TextGrid dosyalarını sıkıştırılmış bir dosya olarak indirme düğmesi (Şekil 2C).
        NOT: Sıkıştırılmış TextGrid dosyalarının, ses dosyalarıyla aynı klasöre indirildiğinden emin olun.
      9. Fonetik analiz yazılımında daha sonra yeniden hizalama yapmak üzere TextGrid dosyalarını çıkarın43.
    6. Yeniden hizalamayı gerçekleştirin.
      1. Praat VVUnitAligner betiğine erişin ve indirin44 -dan / -den https://github.com/leonidasjr/VVunitAlignerCode_webMAUS/blob/main/VVunitAligner.praat.
      2. Aynı dildeki tüm dosya çiftlerinin ve VVUnitAligne'nin onaylandığını belgeleyinr betikler aynı klasördedir.
        NOT: L1-L2 İngilizce dosyaları ve VVunitAligner için bir klasör ile L1-L2 BP dosyaları ve VVunitAligner için bir klasör.
      3. Fonetik analiz yazılımını açın.
      4. Tıklayın Praat | Praat betiğini aç… betiği şuradan çağırmak için nesne penceresi.
      5. Tıklayın Çalıştır düğmeye bir kez basın.
        NOT: ... adlı bir form Fonetik hece hizalama betiğin kullanımına yönelik ayarları içeren pencere ekranda belirecektir (Şekil 3A).
      6. Tıklayın Dil 'İngilizce (ABD),' 'Portekizce (Brezilya),' 'Fransızca (Fransa)' veya 'İspanyolca (İspanya)' dillerinden seçim yapmaya yarayan düğme.
      7. Tıklayın Yığın segmentasyonu 'Otomatik', 'Zorlanmış (manuel)' veya 'Yok' segmentasyon prosedürlerinden birini seçmek için kullanılan buton.
      8. Kontrol edin TextGrid dosyalarını kaydedin yeni TextGrid dosyalarını otomatik olarak kaydetme seçeneği.
      9. Tıklayın Tamam | Çalıştır 1.3.5.7. adımdaki fonetik birimlerin yeniden hizalanması için butonlar.
        NOT: VVUnitAligner, her bir ses dosyası için bölüm 1.3.7 için yeni bir TextGrid dosyası oluşturacaktır (Şekil 3B).
    7. Akustik özelliklerin otomatik ekstraksiyonunu gerçekleştirin.
      1. SpeechRhythmExtractor betiğine erişin ve indirin45 den Prosodik-akustik özelliklerin otomatik olarak çıkarılması için https://github.com/leonidasjr/SpeechRhythmCode/blob/main/SpeechRhythmExtractor.praat.
      2. Yeni bir klasör oluşturun ve SpeechRhythmExtractor'ı tüm dillere ait tüm ses/TextGrid dosyası çiftleriyle birlikte buraya yerleştirin.
      3. Fonetik analiz yazılımını açın.
      4. Tıklayın Praat | Praat betiğini aç… betiği ... üzerinden çağırmak için nesne penceresi.
      5. Tıklayın Çalıştır düğmeye yalnızca bir kez basın.
        NOT: Ekranda betik ayarlarını içeren bir form belirecektir. Çıktı '.txt' dosya adı kutucuklarında, dosyaları uygun şekilde yeniden adlandırın veya varsayılan adları bırakın.
      6. Kontrol edin ses kalitesi parametreleri kaydetme seçeneği Çıktı dosyası VQ ses kalitesi için (Şekil 3C).
        NOT: Bu ikinci çıktı dosyası (the Çıktı dosyası VQ) 1 arasındaki farkın parametrelerini içerirst ve 2nd harmonikler (H1-H2) ve Cepstral Belirginlik Pik değerleri (CPP)9.
      7. Kontrol edin Dilbilimsel hedef 'Dil', 'Lehçe' veya 'Aksan' etiketlerinden birini seçme seçeneği (Şekil 3C).
      8. Kontrol edin Birim f0 özelliklerini Hz veya Yarım Ses (Semitones) cinsinden seçme seçeneği (Şekil 3C).
      9. şunlar için değerleri ayarlayın F0 eşiği, minimum ve maksimum f0 eşikleri (Şekil 3C).
        NOT: Araştırmanın özel amaçları veya önceden belirlenmiş spesifik ses özellikleri olmadığı sürece, 1.3.7.9. adımındaki parametrelerin varsayılan değerlerde bırakılması şiddetle önerilir.
      10. Tıklayın Tamam | Çalıştır akustik özelliklerin otomatik çıkarımı için.
        NOT: Senaryo KonuşmaRitmiÇıkarıcı sekme ile ayrılmış bir '.txt' dosyası döndürür (Çıktı dosyası/ Çıktı dosyası VQ) konuşmacılardan çıkarılan akustik özellikleri içeren.
  4. İstatistiksel analiz
    1. Akustik özellikleri içeren hesap çizelgesini R'ye yükleyin46 ortam (veya tercih edilen herhangi bir istatistik yazılımı/ortamı).
    2. Genelleştirilmiş Toplamsal Modeller (GAM'ler) non-parametrik istatistiklerini gerçekleştirin.
      1. R'da GAM'ler uygulayın.
      2. Aşağıdaki komutları yazın ve basın Giriş.
        library(mgcv)
        model = gam(the metrik/prozodik-akustik özellik analizinde ~ şunlar Dil + seçilen metrik özelliktarafından = -e/a tarafından Dil) + diğerleri metrik/prozodik-akustik özellikler, veri = the veri çerçevesi)
        NOT: Akademik camiadaki fonetikçiler (ve dilbilimciler) arasındaki artan popülaritesi nedeniyle, protokolün test istatistiklerini R programlama dilinde gerçekleştirmeye karar verdik. R, fonetik saha araştırmalarında yaygın olarak kullanılmıştır.471.4.2.2 numaralı adımın bir sözde kod (pseudo-code) içerdiğini unutmayın. Kodu araştırma değişkenlerine göre yazın.

figure-protocol-2
Şekil 2: MAUS zorunlu hizalayıcı kullanılarak yapılan fonetik hizalamadan alınan ekran görüntüsü. (A) Kesikli dikdörtgen, 'my_file.wav'/' my_file.txt' dosyalarını sürükleyip bırakmak veya klasörden bu dosyaları aramak için içerisine tıklamak içindir; yükleme düğmesi kırmızı okla belirtilmiştir. (B) A panelinden yüklenen dosyalar (mavi oka bakınız), kullanılacak işlem hattı, dosya çiftleri için dil, döndürülecek dosya formatı ve tüm dosyaları saklamak için bir 'true/false' düğmesi. (C) Kullanım Şartları onay kutusu (yeşil oka bakınız), Run Web Services düğmesi ve Sonuçlar (indirilecek TextGrid dosyaları). Bu şeklin daha büyük bir versiyonunu görüntülemek için lütfen buraya tıklayın.

figure-protocol-3
Şekil 3: Yeniden hizalama prosedürünün ekran görüntüsü. (A) Yeniden hizalama prosedürü için giriş ayarları formu. (B) Kısmi dalga formu, f0 (mavi) konturlu geniş bant spektrogramı ve altı segmente edilmiş (ve etiketlenmiş) katman: katman 1: bir ünlü başlangıcından bir sonraki ünlü başlangıcına kadar olan birimler (V_to_V); ünlü başlangıcı (V_to_V); katman 2: ünlü (V), ünsüz (C) ve duraksama (#) birimleri; katman 3: V_to_V fonik temsilleri; katman 4: metinden bazı kelimeler; katman 5: metinden bazı konuşma parçaları (CH); katman 6: kadın bir AmE-S tarafından üretilen her konuşma parçasının en yüksek (H) ve en düşük (L) tonlarını içeren tonal katman. (C) Akustik özelliklerin otomatik çıkarımı için giriş ayarları. Bu şeklin daha büyük bir versiyonunu görüntülemek için lütfen buraya tıklayın.

2. Konuşma algısı

NOT: Amerikalı dinleyicilerle İngilizce dilinde dört ses dizilimi ve Brezilyalı dinleyicilerle BP dilinde dört dizilim gerçekleştirdik. Konuşma algısına ilişkin akış şeması için Şekil 4'e bakınız.

figure-protocol-4
Şekil 4: Konuşma algısı için şematik akış şeması. Bu şeklin daha büyük bir versiyonunu görüntülemek için lütfen buraya tıklayınız.

  1. Katılımcılar
    1. Konuşma üretimi protokolüne katılan kişilerden farklı katılımcıları her bir grup için seçiniz.
      NOT: Protokolün bu bölümü için iki grup katılımcı seçilmiştir: Grup 1The AmAmerikalı Eİngilizce (ABD) Ldinleyiciler (AmE-L) ve Grup 2The Brazilian Ldinleyiciler (Bra-L). Mevcut araştırma için hem AmE-L hem de Bra-L, L2 yeterliliğine sahip olarak kabul edilmiştir (her iki grup da B2-C1 olarak nitelendirilmiştir)36 Prosedürler gerçekleştirildiğinde AmE-L grubu Brezilya'da iki yıldır yaşamaktaydı. Bra-L grubu ise prosedürler gerçekleştirildiğinde ABD'de iki yılı aşkın süredir yaşamaktaydı. Yurt dışında yaşadıkları süre boyunca, her iki grup da eğitim ve çalışma amaçlarıyla L2 konuşmaya devam etmiştir (haftada en az altı gün, günde yaklaşık 4 ila 5 saat).
    2. Belirleyin katılımcı sayısı, the dil (L1 İngilizce, L2 Brezilya Portekizcesi; L1 Brezilya Portekizcesi, L2 İngilizce), cinsiyet (dişi veya erkek), yaş (ortalama, standart sapma), grup özellikleri (profesyoneller veya lisans öğrencileri) ve L2 yeterlilik düzeyi her grup için.
  2. Ses dizilimleri
    NOT: Ses dizilimi prosedürlerini iki farklı adıma ayırın: ses dizilimlerinin hazırlanması ve uygulanması.
    1. İngilizce için dört ve BP için dört ses dizilimi hazırlayın.
      1. Bölüm 1: Konuşma üretimi kısmındaki konuşmacılardan ses dosyalarını alın.
      2. Her bir dil faktörüne ait ses dosyalarının ayrı klasörlerde olduğunu doğrulayın.
      3. L1 İngilizce veya L1 BP dilinde rastgele altı ses parçası seçin.
        NOT: Dizilimdeki altı ses şunları temsil etmektedir tek hedef ses ve beş folyo.
      4. 2.2.1.3 adımında yer alan konuşmacılardan birine ait L2 İngilizce veya L2 BP dilindeki bir ses parçasını seçin.
        NOT: 2.2.1.4 adımındaki ses parçası şudur: referans ses. Parçalar yaklaşık 20 saniye uzunluğunda olmalıdır.8.
      5. Praat CreateLineup betiğine erişin ve betiği indirin48 -den/dan https://github.com/pabarbosa/prosody-scripts-CreateLineUp
      6. CreateLineup betiğini çalıştırmadan önce L2 referans sesinin, L1 çeldiricilerin ve L1 hedef sesinin aynı klasörde olduğunu doğrulayın (Şekil 5).
      7. Fonetik analiz yazılımını açın.
      8. -den/dan nesne penceresitıklayın Praat | Praat betiğini aç… betiği çağırmak için.
      9. Tıklayın Çalıştır | Çalıştır.
        NOT: Betik, dosyayı şu sırada döndürür: (L2 referans sesi) + (L1 hedef sesi ve rastgele dağıtılmış çeldiriciler)Şekil 5).
    2. Ses dizilimlerinin çalıştırılması
      1. Tercih edilen herhangi bir platformda (örneğin, SurveyMonkey) sıralamaları barındırmak için çevrimiçi bir alan oluşturun. Şuraya bakın: Materyaller Tablosu) sesle teşhis işlemlerini uzaktan yürütmek için.
      2. Çevrimiçi alan bağlantısına erişin.
      3. CreateLineup betiğinden dönen dosyaları platforma yükleyin.
      4. Her adımı test etmek için prosedürü katılımcılardan önce uygulayın.
        NOT: Bağlantıya önceden erişilmesi ve her şeyin normal çalışıp çalışmadığını kontrol etmek için dizilimlerin çalıştırılması önerilir.
  3. İstatistiksel analiz
    1. Dinleyicilerin değerlendirme puanlarını içeren hesap çizelgesini R ortamına (veya tercih edilen herhangi bir istatistiksel yazılıma/ortama) yükleyin.
      1. Kruskal-Wallis testini R'da gerçekleştirin.
      2. Aşağıdaki komutları yazın ve basın Giriş.
        ​model = kruskal.test(kararlar ~ her biri sesle teşhis dizilimi, veri = şunlar veri çerçevesi)
    2. Post-hoc Dunn testi uygulayın.
      1. Dunn testini R'da gerçekleştirin.
      2. Aşağıdaki komutları yazın ve basın Girin.
        library(FSA)
        model = dunnTest(kararlar her biri sesle teşhis dizilimi, data = data, method = "Bonferroni")
        NOT: 2.3.1.2 ve 2.3.2.2 adımlarındaki kodlar yalancı kodlardır (bkz. NOT 1.4.2.2).
  4. Akustik benzerlik analizi
    1. Hedef ile herhangi bir çeldirici arasında anlamlı fark göstermeyen dizilimleri seçin (bkz. adım 2.2.1.3'teki NOT).
    2. 1.3.1 ile 1.3.7.5 arasındaki adımların ve 1.3.7.8 ile 1.3.7.10 arasındaki adımların prosedürlerini tekrarlayın.
    3. Python için betiğe erişin ve indirin49, AkustikBenzerlik_kosinüs_ökrid50 den https://github.com/leonidasjr/AcousticSimilarity/blob/main/AcousticSmilarity_cosine_euclidean.py.
      NOT: Betik üç matris (.txt ve .csv formatlarında) döndürür: biri Kosinüs benzerliği içindir51,52, biri Öklid uzaklığı için52,53ve biri Dönüştürülmüş Öklid uzaklık değerleri için, ayrıca hedef ses ile her bir çeldirici arasında ikili bir karşılaştırma için.
    4. Betiğin, dizilim veri kümesiyle aynı klasöre indirildiğinden emin olun.
    5. Tıklayın Dosyayı açın… betiği çağırmak için düğme.
    6. Tıklayın Çalıştır | Hata Ayıklama Olmadan Çalıştır butonlar
      NOT: İkinci Çalıştırın buton şu şekilde etiketlenebilir Çalıştır veya Hata Ayıklama Olmadan Çalıştır veya Betik Çalıştır. Hepsi aynı komutları yürütür. Bu durum yalnızca kullanılan Python ortamına bağlıdır.
    7. Akustik özelliklere dayalı ses benzerlik testleri gerçekleştirin.
      ​NOT: Kosinüs benzerliği (veya kosinüs uzaklığı), Yapay Zeka'da (AI), özellikle otomatik konuşma tanıma (ASR) sistemlerindeki makine öğrenmesinde uygulanan bir tekniktir. Sıfır ile bir arasında bir benzerlik ölçüsüdür. Bir'e yakın bir kosinüs benzerliği, iki sesin benzer olma olasılığının oldukça yüksek olduğu anlamına gelir. Sıfıra yakın bir kosinüs benzerliği ise seslerin büyük olasılıkla benzer olmadığını ifade eder.52Genellikle Öklid benzerliği olarak adlandırılan Öklid mesafesi; yapay zeka, makine öğrenimi ve otomatik konuşma tanımada (ASR) da yaygın olarak kullanılır. Bu mesafe, Öklid uzayındaki iki nokta arasındaki doğrusal mesafeyi temsil eder.53yani noktalar ne kadar yakınsa (mesafe değerleri ne kadar düşükse), sesler o kadar benzerdir. Her iki tekniğin rapor edilen sonuçlarının daha net anlaşılması için, Öklid mesafesi ham puanlarını sıfırdan (daha az ses benzerliği) bire (daha fazla ses benzerliği) kadar olan değerlere dönüştürdük54.

figure-protocol-5
Şekil 5: Konuşma algısı için dizin kurulumu. Sıralama klasörleri. Her klasör altı L1 sesi, L2 hedef sesi, "CreateLineup" betiği ve (betik çalıştırıldıktan sonra oluşturulan) ses sıralama ses dosyasını içerir. Bu şeklin daha büyük bir versiyonunu görüntülemek için lütfen buraya tıklayın.

Sonuçlar

Konuşma üretimi sonuçları
Bu bölümde, istatistiksel olarak anlamlı prosodik-akustik özelliklerin ve ritim metriklerinin performansını tanımladık. Bu prosodik özellikler; süre ile ilişkili olan konuşma, artikülasyon ve duraklama hızları ile ses kalitesi ile ilişkili olan shimmer'dır. Ritim metrikleri ise hece süresinin standart sapması (SD), konsonantın SD'si, vokalik veya konsonantal sürenin SD'si ve hece süresinin varyasyon katsayısıdır (bkz. Ek Tablo S1).

The Konuşma hızı (Şekil 6A) L1-L2 İngilizce için L1-L2 BP'ye göre daha hızlı azalmaktadır, ancak her iki L2 için de hız daha düşüktür. The Konuşma hızı üç metrikle ilgilidir - hece süresinin standart sapması (SD-S), ünlülerin standart sapması (SD-V), ve hece varyasyon katsayısı (Varco-S). Ayrıca hem AmE-S hem de Bra-S grubunun ikinci dillerinde (L2) yetkin olduklarının akılda tutulması önemlidir. Görünüşe göre bu hız, L1-L2 BP tarafından üretilen daha yüksek hece süresi değerleri ve daha düşük değişkenlikten etkilenerek eğimlerin daha az dik olmasına neden olmaktadır.

Eklemleme hızı (Şekil 6D), SD-S ve Varco-S'nin yanı sıra Hece Ritmi Oranı (RR-S) ile ilişkilidir; bu sonuncusu, kısa ve uzun heceler arasındaki oranı temsil eder. Bu tür metriklerin, cümle uzunluğu ve süredeki değişkenliğin daha yüksek L2 konuşma planlamasına ve L2 bilişsel yüküne yol açması nedeniyle etkilenen Konuşma hızı gibi, Eklemleme hızını da etkilediği görülmektedir9,23,54. Cümle uzunluğu alanında, prozodik-akustik parametrelerin etkileneceği şekilde daha yüksek bir bilişsel-dilbilimsel yük gerekebilir55.

Konuşma ve Eklemleme hızlarının prozodik-akustik özelliklerine ilişkin bulgularımız, bir konuşmacı hece (ve ünlü) sürelerini ne kadar çok değiştirirse, bu hızların o kadar düşük olduğunu göstermektedir. Hem L1 hem de L2 BP konuşma algısının L1 ve L2-İngilizceden biraz daha yavaş olduğu ve L1-İngilizcenin diğer tüm dil seviyelerinden daha hızlı duyulduğu hipotezini kurmaktayız. Bu durum, konuşma ritmiyle ve L1-L2 BP'nin ritim sürekliliğinin hece zamanlamalı kutbuna yönelirken, L1-L2 İngilizcenin vurgu zamanlamalı kutbuna doğru hareket ettiği hipoteziyle bağlantılı olabilir21,22.

Şekil 6B'deki Yerel parıltı (Local shimmer), SD-S ve Varco-S'den etkilenmektedir. Yerel parıltı için Bra-S, L1-BP ve L2-English üretimlerinin her ikisi de, hece süresi değişkenliği arttıkça (SD ve Varco, bkz. Ek Tablo S1) oldukça monotonik bir seyir izlemektedir. 8,5 ile 9 dB arasında değişen düşük varyasyon nedeniyle, Bra-S üretimleri dinlendiğinde vokal çaba algısı belirgin olabilir. Bra-S konuşması, vokal yükten etkilenmektedir. L1-BP, hece süresindeki yüksek varyasyonlara karşı daha az hassas olması nedeniyle cümle uzunluğundan yüksek düzeyde etkilenmektedir (BP ritmik paterni daha az hece varyasyonu gösterir22,56).

Duraksama oranı (Şekil 6C), L2-İngilizce konuşurlarının, L1-İngilizce, L1-BP ve L2-BP konuşurlarına göre daha uzun duraksamalar (200 ms ile 375 ms arasında) yaptığını göstermektedir (L1-İngilizce için ortalama 30 ms, L1-BP için 50 ms ve L2-BP için 100 ms). Bu durumda konuşma planlaması, artan beyin aktivitesi nedeniyle L2-İngilizce üretimini etkilemiş olabilir54,57. Daha yüksek dil yeterliliğinin daha yüksek okuma hızı ve kapsamı ile sonuçlanması beklenir54; buna rağmen, L2 yetkin konuşurlar için bile okuma görevleri, yabancı konuşmanın üst düzey bilişsel yönlerinde ve dil işlemede daha fazla çaba gerektirmiştir54,57. Bulgularımız, en azından öncül bir düzeyde, her iki dilin ritmik kalıplarındaki farklılıklar nedeniyle L2-BP konuşurlarının duraksamalardan L2-İngilizce konuşurlarına göre daha az etkilenebileceğini göstermektedir.

figure-results-1
Şekil 6Prosodik-akustik özellikler için Genelleştirilmiş Toplamsal Modeller. Y ekseninde bağımlı değişken (modellenecek akustik özellikler); X ekseninde ise eğrilerin şeklini ve gidişatını belirleyecek olan tahmin değişkenleri (yani düzleştirme etkileri: 'Dil + kovaryatlar' şeklinde olan 'Dil' faktörü ve eklemeli modellerdeki kovaryatlar) ve bağımlı değişkenin daha doğru bir projeksiyonunu sağlayacak olan 'Dil' ile bir metrik özelliğin çarpımı (yani faktör-düzleştirme etkileşimleri: 'kovaryat:Dil') yer alır. Kısaltma: GAMs = Genelleştirilmiş Eklemeli Modeller. Bu şeklin daha büyük bir versiyonunu görüntülemek için lütfen buraya tıklayın.

Ritim metrikleriyle ilgili olarak, SD-S için (Şekil 7A), bulgularımız bir konuşmacının f0 eğrisini ne kadar çok değiştirip konuşma hızını ne kadar artırırsa, tüm dil seviyeleri için SD-S değerinin o kadar azaldığını ortaya koymaktadır (Şekil 6A'nın aynadaki yansıması olan bir etki). Ünsüzler için SD (SD-C, Şekil 7C) durumunda L1-BP, L1 İngilizce'nin aksine, Konuşma hızı veya Duraksama süresi arttıkça düşük varyasyon sergiler. Bu tür bir SD yönelimi öngörülebilir durumdadır, çünkü L1-İngilizce'de hece süresi değişkenliği L1-BP'den (istatistiksel olarak) anlamlı derecede daha yüksektir44,58. Varco-S (Şekil 7B ve Ek Tablo S1), aynı dil grubunun L1 ve L2'si ile bir ölçüde ilişkili görünmektedir. f0 değişkenliği ve Konuşma hızı arttıkça, Varco-S değeri L1-BP için azalmakta, L2-BP için ise azalıyor ve sönümleniyor görünmektedir. İngilizce üretimler için, f0 değişkenliği ve Konuşma hızı artarken, Varco-S hem L1-İngilizce hem de L2-İngilizce için artmakta ve sönümlenmektedir.

Ünlüler veya ünsüzler için SD (SD-V_C, Şekil 7D ve Ek Tablo S1) ile ilgili olarak, sonuçlarımız Varco-S performansı ile bazı benzerlikler göstermektedir (Şekil 7B). Örneğin, daha yüksek Konuşma hızı, Duraksama süresi ve f0 değişkenliği, L1-BP ve L2-BP için SD-V_C'nin düşüş-yükseliş yörüngesini desteklemektedir. İngilizce üretimlerde, bu tür prozodik özellikler daha yüksekken, SD-V_C hafifçe azalmakta; L1-İngilizce için sönümlenmekte, L2-İngilizce için ise hafifçe artmakta ve ardından sönümlenmektedir. Varco-S ve SD-V_C'nin aynı dil gruplarının L1-L2'si ile olan korelasyonu, kısmen arka plan gürültüsü nedeniyle konuşmadaki akustik parametrelerin değişmesini ifade eden Lombard Etkisi ile açıklanabilir59.

Yabancı dil konuşmalarında, görevin karmaşıklığına bağlı olarak (örneğin, okunan konuşma), konuşmacıların hem L1 hem de L2'de benzer akustik stratejiler kullandıkları görülmüştür59,60. Bir yandan Marcoux ve Ernestus, L2 Lombard konuşmasındaki f0 ölçümlerinin (aralık ve medyan), L2 İngilizce konuşmacılarının L1 Felemenkçelerinden etkilendiklerini gösterdiğini bulmuşlardır61,62. Öte yandan, daha güncel bulgular, L2 ile konuşurken oluşan daha yüksek bilişsel yük nedeniyle L2 Lombard konuşmasının L1 Lombard konuşmasından farklı olması beklense de, L2 İngilizce konuşmacılarının L1 İngilizce konuşmacılarıyla aynı yönde Lombard konuşma ürettiklerini öne sürmektedir63. Bulgularımızın Marcoux ve Ernestus63 ile ne ölçüde uyumlu olduğu ve Waaning59, Villegas ve ark.60 ile Marcoux ve Ernestus'tan61,62 ne ölçüde ayrıldığına dair daha fazla araştırma yapılması gerekmektedir.

figure-results-2
Şekil 7: Metrik özellikler için Genelleştirilmiş Aditif Modeller. Y ekseninde yanıt değişkeni (modellenecek metrik özellikler); X ekseninde ise tahmin edici değişkenler (eğrilerin şeklini ve yörüngelerini sağlayacak olan aditif modellerdeki 'Language' faktörü ve kovaryantlar (yani düzeltme etkileri: 'Language + kovaryantlar') ve yanıt değişkeninin daha doğru bir projeksiyonunu sağlayacak olan 'Language' ile bir metrik özelliğin çarpımı (yani faktör-düzeltme etkileşimleri: 'kovaryant:Language')). Kısaltma: GAMs = Genelleştirilmiş Aditif Modeller. Bu şeklin daha büyük bir versiyonunu görüntülemek için lütfen buraya tıklayın.

Konuşma algısı sonuçları
BP ses dizilimleriyle ilgili olarak, 1 numaralı dizilimde (Şekil 8A), 3 numaralı çeldirici ses hedef ses olarak değerlendirilmiştir. Aslında hedef ses 4 numaralı sesti. Sonuçlar, 3 numaralı çeldirici (%83) ile 4 numaralı hedef ses (%71) arasında istatistiksel olarak anlamlı bir fark olmadığını göstermektedir (bkz. Ek Tablo S1). 2 numaralı dizilimde (Şekil 8B), 3 numaralı hedef ses (%40) ile 4 numaralı çeldirici (%20) arasındaki karşılaştırma da İngilizce ses dizilimleri için istatistiksel olarak anlamlı bir fark göstermemiştir (bkz. Ek Tablo S1). 1 numaralı dizilimde (Şekil 9A), 2 numaralı çeldirici (%26) ile 4 numaralı hedef ses (%54) arasında anlamlı bir fark görülmemiştir (bkz. Ek Tablo S1).

Ses benzerliği analizinde, hem Kosinüs benzerliği (CoSim) hem de Öklid mesafesi (EucDist, [EucDist  dönüştürülmüş]54), BP dizilimi #1 için 3 numaralı çeldirici ile hedef arasında tutarlı bir korelasyon göstermiştir (CoSim = 0.99; EucDist = 77.4, [0.93]). 4 numaralı çeldirici ile hedef arasındaki korelasyon, BP dizilimi #2'de benzer şekilde güçlüydü (CoSim = 0.99, EucDist = 76.3, [0.93]). İngilizce dizilimi #1'de korelasyon, CoSim için tutarlı (0.83) ancak EucDist için zayıf-yeterli düzeydeydi (213.0, [0.47]. Genel olarak, hem CoSim hem de EucDist ses benzerliğinin belirlenmesinde yeterli tekniklerdi. Ek olarak, Gahman ve Elangovan tarafından52 ele alındığı üzere, CoSim biraz daha etkili performans göstermiştir (bkz. Ek Tablo S1)).

Benzerlik açısından, yanlış alarmlarda artışa ne yol açmış olabilir? Prozodik-akustik özellikler, Şekil 8A,B ve Şekil 9A'da sunulan dizilimler hariç olmak üzere, çeldiriciler ve hedef seslerin (istatistiksel olarak) anlamlı derecede farklı performans göstermesine rağmen, dinleyicilerin tercihlerinin diğer dizilimlerde farklı çeldiriciler boyunca bir miktar çeşitlendiğini göstermiştir (Şekil 8C,D ve Şekil 9B-D). Bu tür bir yargının, genel bir prozodik-akustik özellikler sınıfından ziyade, konuşmacıların paylaştığı bir (veya belki daha fazla) spesifik akustik özelliğe daha fazla bağlı olduğu görülmektedir. Örneğin, çalışmamız üretimler arasında (ortak) varyasyon gösteren birkaç özellik sunmuştur; buna rağmen, algısal sonuçlar yargıların hedef sese uyması için spesifik bir çeldiriciye olan tercihlerini göstermektedir8,35,64,65. Gelecekteki çalışmalarda daha ayrıntılı analizlere ihtiyaç vardır.

Akustik benzerlik için bu çalışmada sunulan çok boyutlu parametrik matris seçeneğinin değerlendirilmesi dikkat çekicidir66. Bulgularımız, f0, VQ ve yoğunluğa dayalı akustik özelliklerin kullanıldığı önceki çalışmalarla uyumludur9,35. Bu tür özelliklerin, adli alandaki konuşmacı karşılaştırma görevleri için özellikle önerildiği bilinmektedir9,66. Bununla birlikte, yabancı aksanlı konuşmacı tanıma için ses dizilimlerinin hazırlanmasında McFarlane kılavuzlarının bir varyantını kullanmış olmamıza rağmen16,17, mevcut araştırmada hiçbir yanıltıcı sesin hedef sese benzer olduğunun öngörülmediğini vurgulamak önemlidir. Ayrıca, ses dizilimi prosedürümüzün; uyaran uzunluğu, ses sayısı, yanıltıcıların seçimi (burada randomize edilmiştir) ve konuşma tarzı dahil olmak üzere McFarlane kılavuzlarından önemli farklılıklar içerdiğini belirtmeliyiz.

f0, ses kalitesi ve yoğunluğun prozodik-akustik özelliklerinin dinleyicilerin algısıyla ne ölçüde ilişkili olduğu, araştırmada kullanılan konuşma tarzına yüksek derecede bağlı olacaktır. Burada, okuma pasajları kullandık. İşitme tanıklığı çalışmalarının çoğunluğu, güncel işitme tanıklığı araştırmalarında yaygın olarak kullanılan DyVis korpusu6728,68 gibi dengeli bir çözüm olarak (yarı) kendiliğinden gelişen uyaranları tercih etmektedir. Okuma görevlerini seçmemize yol açan neden, bu taslağın hazırlandığı sırada korpusumuzun yalnızca okuma görevlerinden elde edilen verilerden oluşuyor olmasıdır. Bununla birlikte, (yarı) kendiliğinden gelişen bir korpus derleme sürecinin halihazırda devam ettiğini belirtmek önemlidir. Ayrıca, bir hikayeyi okuma eylemi, hem konuşmacı içi hem de konuşmacılar arası düzeyde güvenilir bir tekdüzelik ve varyasyon düzeyi oluşturabilir. Bu durum, ses karşılaştırmayı içeren durumlarda prozodik veya fonetik özelliklerin -bireysel veya lehçesel- vurgulanmasını kolaylaştırır. Bu durum, yetkin konuşmacılar arasında bile yabancı bir aksanın üretimi sırasındaki vokal yüklenme örneklerinde özellikle belirgin hale gelir 8,9,23,54.

figure-results-3
Şekil 8: Brezilyalı dinleyiciler tarafından gerçekleştirilen dört dizilişin sonuçlarını içeren sütun grafikleri.(A,B) Hedef ses (mavi) ile bir çeldirici (açık mavi) arasında anlamlı olmayan fark. (C,D) Çeldiricilere ve hedef sese göre anlamlı farklar. Kısaltma: NS = anlamlı değil. Bu şeklin daha büyük bir versiyonunu görüntülemek için lütfen buraya tıklayın.

figure-results-4
Şekil 9: Amerikalı dinleyiciler tarafından gerçekleştirilen dört dizilimin sonuçlarını içeren sütun grafikleri. (A) Hedef ses (kırmızı) ile bir çeldirici (pembe) arasında anlamlı olmayan fark. (B,C,D) Çeldiriciler ve hedef ses ile olan anlamlı farklar. Kısaltma: NS = anlamlı değil. Bu şeklin daha büyük bir versiyonunu görüntülemek için lütfen buraya tıklayın.

Ek Tablo S1: Konuşma üretimi istatistikleri - Genelleştirilmiş Katkılı Modeller (GAM'lar): Her Dil seviyesi için istatistiksel olarak anlamlı olan her bir prozodik-akustik özelliğin (Şekil 6) ve ritim metriğinin (Şekil 7) F-istatistikleri (serbestlik dereceleri), düzeltilmiş R2 değerleri ve her bir düzleştirme teriminin (kovaryantlar) bireysel değerleri. Konuşma algısı istatistikleri: Kruskall-Wallis χ2 istatistikleri (serbestlik dereceleri), p-değerleri ve düzeltilmiş η2 değerleri ile hedef-yanıltıcı ses çiftleri (Şekil 8A,B ve Şekil 9A) arasındaki istatistiksel olarak anlamlı olmayan her bir fark için ikili karşılaştırma amacıyla yapılan post-hoc Dunn testi (Şekil 8 ve Şekil 9). Her bir dizilim için Kosinüs ve Öklid mesafesine ait akustik benzerlik matrisleri. Bu şeklin daha büyük bir versiyonunu görüntülemek için lütfen buraya tıklayın.

Tartışma

Mevcut protokol (adli) fonetik alanında bir yenilik sunmaktadır. İki aşamaya ayrılır: biri üretime dayalı (akustik analiz) ve diğeri algıya dayalı (yargı analizi). Üretim analizi aşaması, istatistiklerin yanı sıra Veri hazırlama ve Zorlamalı hizalama, Yeniden Hizalama ve Prozodik-akustik özelliklerin otomatik olarak çıkarılmasını içerir. Bu protokol, veri toplama aşamasını, ağırlıklı olarak manuel segmentasyona dayalı geleneksel protokollerden daha hızlı ve daha verimli bir şekilde veri analizine bağlar.

Ancak, 1.3.6 ila 1.3.6.9 arasındaki protokol adımlarında gösterilen yeniden hizalama işlemi, temel olarak 1.3.1 ila 1.3.4 arasındaki protokol adımlarında oluşturulan telefon ve kelime birimlerinde çalışır. Yeniden hizalama işleminin yeniliği, üç yeni metin katmanı içeren yeni bir TextGrid oluşturmasıdır: bir hece katmanı, kelimelere göre otomatik veya manuel olarak oluşturulabilen bir konuşma öbeği katmanı ve f0 ölçülerini hesaplamak için oldukça yararlı olabilecek bir ton katmanı. Bu protokol için önerilen yeniden düzenleme kılavuzları daha önce L2 konuşma ritmi 21,69,70 çalışmalarında, makine öğrenimi teknikleri22 kullanılarak yabancı aksan derecesinin tespitine yönelik çalışmalarda ve adli tıp alanındaki çalışmalarda 9 kullanılmıştır.

1.3.7 ila 1.3.7.10 protokol adımlarında sunulan prozodik özelliklerin otomatik olarak çıkarılması, mevcut araştırmada kanıtlanabileceği gibi çok boyutlu bir prozodik-akustik özellikler matrisi oluşturur. Bu özellikler arasında melodik, süresel ve spektral (ses kalitesi ve yoğunluğu) konuşma özellikleri71 bulunur. Bu akustik özelliklerin önemli bir kısmı, sonunda adli tıpta veya diğer senaryolarda toplanan gürültülü ses kayıtlarına karşı daha az hassas ve biraz sağlamdır72. Ayrıca, çok boyutlu matris, çeşitli AI teknikleri (devam eden çalışma) aracılığıyla konuşma tanıma sistemlerine uygulanabilir. L2 telaffuz sınıfları21'de (devam eden çalışma) prozodik yönlerin öğretiminde hala oldukça yararlı olabilir.

Protokolün bu bölümünün istatistiksel analizi, belirli bir akustik özellik ile birden fazla dil faktörü konuşmacısı arasındaki karmaşık bir ilişkiyi ele aldığımız için GAM yönteminin kullanımını temsil eder. Örneğin, belirli bir akustik özelliği modellemek için, konuşma üretimi sırasında neler olduğunu daha doğru bir şekilde tanımlayabilmemiz için matristeki diğer akustik özelliklerin (yumuşak terimler) nasıl performans göstereceğini kontrol etmek gerekiyordu.

Algı analizi ile ilgili olarak, mevcut protokol, ses dizilişlerinin hazırlanması ve uygulanması, istatistiksel analiz ve akustik benzerlik analizi ile oluşturulmuştur. Dizilişleri hazırlamak için, 2.2 ila 2.2.1.9 protokol adımlarında açıklandığı gibi rastgele sıralanmış folyolar ve hedef ses içeren her diziliş için otomatik olarak bir ses dosyası oluşturan Praat için CreateLineup komut dosyasını kullandık.

Bu protokolün istatistiksel analizi için, verilerimiz Varyans Analizi (ANOVA) varsayımlarını karşılamadığı için Kruskal-Wallis parametrik olmayan testini çalıştırdık. Dinleyiciler tarafından değerlendirilen ve hedef ses ile folyolar için kontrol edilen yargı puanları arasında bir ilişki kurduktan sonra, doğrusal model istatistiklerini kullanmayı seçtik.

Akustik benzerlik analizi için Python için AcousticSmilarity_cosine_euclidean betiğini kullandık. Program, bilgisayarın dizin ağacını açar ve kullanıcıdan folyoların prozodik-akustik özelliklerini içeren dosyayı ve analizde diziyi oluşturan hedef sesi seçmesini ister. Bir düğmeye tıklandığında, komut dosyası üç benzerlik matrisi oluşturur: hem '.txt' (sekmeyle ayrılmış) hem de '.csv' dosyalarında bir Kosinüs, bir Öklid ve dönüştürülmüş (sıfırdan bire) bir Öklid. Yine de her veri kümesinin (folyoların ve hedefin prozodik-akustik özelliklerini içeren '.txt' dosyası) dizinin orijinal klasöründe olması gerektiğini ve her diziliş klasörünün AcousticSmilarity_cosine_euclidean komut dosyasının bir kopyasına sahip olması gerektiğini aklımızda tutmalıyız.

Özetle, mevcut protokol (adli) fonetik araştırmalarında ilerlemektedir. Üretim ve algı analizlerinin yanı sıra akustik benzerlik gibi farklı aşamalardan oluşan bu program, veri toplama ile çok boyutlu akustik özellik analizi arasındaki boşluğu dolduruyor. Araştırmacılar hem üretim hem de algı yönlerini keşfederek bütünsel bir bakış açısından yararlanabilirler. Ayrıca, bu protokol araştırmanın tekrarlanabilirliğini sağlayarak başkalarının bu çalışmanın yönergelerini geliştirmesine olanak tanır.

Sınırlamalar ve gelecekteki yönler
Veri hazırlamanın 1.3.1 ila 1.3.4 protokol adımlarında önerilen yönergeleri takip etmesi durumunda her şeyin başarılı bir şekilde sonuçlanacağını yine de aklımızda tutmalıyız. Ayrıca, zorlamalı hizalama işlemlerinde, mevcut çalışmada kullanılan harici bir önceden eğitilmiş zorlamalı plak benzeri MAUS'un, özellikle önceden eğitilmemiş yabancı aksanlı verilerde ve hatta önceden eğitilmiş plaklarda, sesin iyi kalitede olmaması veya hizalayıcının ses dilini içermemesi fark etmeksizin segmentasyon hatalarına açık olduğunun farkında olmalıyız (bu durum uzmanın işini daha zor ve zaman alıcı hale getirecektir). Adli transkripsiyon, özellikle daha uzun ses dosyaları, sözlü kayıtların doğru ve güvenilir temsili konusunda zorluklarla karşılaşmaktadır72.

Daha uzun ses dosyalarının yazıya geçirilmesi ve hizalanmasında da çeşitli zorluklar vardır. Hizalayıcı performansı, konuşma stili ve fonetik ortamın yanı sıra lehçeye özgü faktörlerden etkilenir. Hizalayıcıya özgü farklılıklar olmasına rağmen, genel olarak performansları benzerdir ve genel olarak manuel hizalama ile iyi bir şekilde karşılaştırılan segmentasyonlar oluşturur73. Ayrıca, MAUS'ta yabancı konuşma modellerinin bulunmaması nedeniyle L1 ve L2 İngilizce prodüksiyonu, Amerikan İngilizcesinin önceden eğitilmiş akustik modeliyle yürütülmüştür. Ayrıca, MAUS'ta BP için önceden eğitilmiş akustik modeller yoktur. BP verileri için, önceden var olan İtalyanca akustik modeller kullanıldı (bkz. NOT, protokol adımı 1.3.5.7).

Gelecekteki çalışmalarda (devam ediyor), protokolün bir parçası olarak Montreal Zorlamalı Hizalayıcıyı (MFA)74 kullanacağız. MFA'nın büyük bir avantajı, çok çeşitli diller (BP dahil) için önceden eğitilmiş akustik modellerin ve grafemden foneme modellerin mevcudiyetinin yanı sıra herhangi bir yeni veri kümesine (yani, yabancı aksanlı konuşma külliyatımız) yeni akustik ve grafemden foneme modelleri eğitme yeteneğidir75.

Açıklamalar

Yazarların beyan edecekleri herhangi bir çıkar çatışması yoktur.

Teşekkürler

Bu çalışma, Ulusal Bilimsel ve Teknolojik Kalkınma Konseyi - CNPq tarafından desteklenmiştir, ilk yazar için hibe no. 307010/2022-8 ve ikinci yazar için hibe no. 302194/2019-3. Yazarlar, bu araştırmanın katılımcılarına cömert işbirlikleri ve paha biçilmez katkıları için içten teşekkürlerini sunarlar.

Malzemeler

Bu makalede kullanılan malzemelerin listesi
AdŞirketKatalog numarasıYorumlar
CreateLineupKişisel koleksiyon#Ses dizilimleri hazırlığı için praat için komut dosyası
Dell I3 (katı hal sürücülü - SSD) Dell#Dizüstü bilgisayar
PraatPaul Boersma & David Weenink#Fonetik analiz yazılımı
Python 3Python Yazılım Vakfı#Yorumlanmış, üst düzey, genel amaçlı programlama dili 
R: İstatistiksel Hesaplama için R Projesi#İstatistiksel hesaplama için programlama dili
Shure, Beta, SM7BShure#Microphone
SpeechRhythmExtractorKişisel koleksiyon#Praat için komut dosyası, akustik özelliklerin otomatik olarak çıkarılması için
SurveyMonkey, SurveyMonkeyInc.#Ücretsiz özelleştirilebilir anketlerin yanı sıra veri analizi, örnek seçimi, önyargısızlaştırma ve veri temsilini içeren bir dizi arka uç programı bir araya getirin.
Tascam DR-100 MKIITascam#Dijital ses kayıt cihazı
Münih Otomatik Segmentasyon Sistemi MAUSMünih Üniversitesi#Ses (.wav) ve dilsel bilgi (.txt) dosyalarının zorla hizalayıcı
VVUnitAlignerKişisel koleksiyon#Fonetik birimlerin otomatik olarak yeniden hizalanması ve sonradan işlenmesi için praat için komut dosyası
,, , ,

Kaynaklar

  1. Moyer, A. Foreign Accent: The Phenomenon of Non-native Speech. , Cambridge University Press. (2013).
  2. Munro, M., Derwing, T. Foreign accent, comprehensibility and intelligibility, redux. J Second Lang Pronunciation. 6 (3), 283-309 (2020).
  3. Levis, J. Intelligibility, Oral Communication, and the Teaching of Pronunciation. , Cambridge University Press. (2018).
  4. Munro, M. Applying Phonetics: Speech Science in Everyday Life. , Wiley-Blackwell. (2022).
  5. Gut, U. Speaker Classification. Muller, C. , Springer-Verlag. 75-87 (2007).
  6. Rogers, H. Foreign accent in voice discrimination: a case study. Forensic Linguistics. 5 (2), 203-208 (1998).
  7. Solan, L., Tiersma, P. Hearing Voices: Speaker Identification in Court. Hastings Law Journal. 54, 373-436 (2003).
  8. Alcaraz, J. The long-term average spectrum in forensic phonetics: From collation to discrimination of speakers. Estudios de Fonética Experimental / Journal o Experimental Phonetics. 32, 87-110 (2023).
  9. Silva, L. Jr, Barbosa, P. A. Voice disguise and foreign accent: Prosodic aspects of English produced by Brazilian Portuguese speakers. Estudios de Fonética Experimental / Journal o Experimental Phonetics. 32, 195-226 (2023).
  10. Munro, M., Derwing, T. Modeling perceptions of the accentedness and comprehensibility of L2 speech. Studies in Second Language Acquisition. 23 (4), 451-468 (2001).
  11. Keating, P., Esposito, C. Linguistic Voice Quality. Working Papers in Phonetics. , 85-91 (2007).
  12. Niebuhr, O., Skarnitzl, R., Tylečková, L. The acoustic fingerprint of a charismatic voice -Initial evidence from correlations between long-term spectral features and listener ratings. Proceedings of Speech Prosody. , 359-363 (2018).
  13. Segundo San, E. International survey on voice quality: Forensic practitioners versus voice therapists. Estudios de Fonética Experimental. 29, 8-34 (2021).
  14. Farrús, M. Fusing prosodic and acoustic information for speaker recognition. International Journal of Speech, Language and the Law. 16 (1), 169(2009).
  15. Farrús, M. Voice disguise in automatic speaker recognition. ACM Computing Surveys. 51 (4), 1-2 (2018).
  16. Nolan, F. A recent voice parade. The International Journal of Speech, Language and the Law. 10 (2), 277-291 (2003).
  17. McDougall, K. Ear-catching versus eye-catching? Some developments and current challenges in earwitness identification evidence. Speaker Individuality in Phonetics and Speech Sciences. Bernardasci, C., Dipino, D., Garassino, D., Negrinelli, S., Pellegrino, E., Schmid, S. , Officinaventuno. 33-56 (2021).
  18. Gut, U. Rhythm in L2 speech. Speech and Language Technology. 14 (15), 83-94 (2012).
  19. Urbani, M. Pitch Range in L1/L2 English. An Analysis of F0 using LTD and Linguistic Measures. Coop. , Libraria Editrice Università di Padova. (2012).
  20. Gonzales, A., Ishihara, S., Tsurutani, C. Perception modeling of native and foreign-accented Japanese speech based on prosodic features of pitch accent. J Acoust Soc Am. 133 (5), 3572(2013).
  21. Silva, L. Jr, Barbosa, P. A. Speech rhythm of English as L2: an investigation of prosodic variables on the production of Brazilian Portuguese speakers. J Speech Sci. 8 (2), 37-57 (2019).
  22. Foreign accent and L2 speech rhythm of English a pilot study based on metric and prosodic parameters. Silva, L. Jr, Barbosa, P. A. Proceedings of the II Brazilian Conference on Prosody (Anais II Congresso Brasileiro de Prosódia), 1, 41-50 (2023).
  23. Costa, A. El cerebro bilingüe: La neurociencia del lenguaje. , Penguin Randon House. (2017).
  24. Eriksson, A. Tutorial on forensic speech science: Part I. Forensic Phonetics. , (2005).
  25. Harvey, M., Giroux, M., Price, H. Lineup size influences voice identification accuracy. Applied Cognitive Psychology. 37 (5), 42-89 (2023).
  26. Pautz, N., et al. Identifying unfamiliar voices: Examining the system variables of sample duration and parade size. Q J Exp Psychol (Hove). 76 (12), 2804-2822 (2023).
  27. McDougall, K., Nolan, F., Hudson, T. Telephone transmission and earwitnesses: Performance on voice parades controlled for voice similarity. Phonetica. 72 (4), 257-272 (2015).
  28. Nolan, F., McDougall, K., Hudson, T. Some acoustic correlates of perceived (dis) similarity between same-accent voices. Proceedings of the International Congress of Phonetic Sciences (ICPhS 2011). , 1506-1509 (2011).
  29. Sheoran, S., Mahna, D. Voice identification and speech recognition: an arena of voice acoustics. Eur Chem Bull. 12 (5), 50-60 (2023).
  30. Hudson, T., McDougall, K., Hughes, V. Forensic phonetics. The Cambridge Handbook of Phonetics. Knight, R. -A., Setter, J. , Cambridge University Press. 631-656 (2021).
  31. Eriksson, A. The disguised voice: Imitating accents or speech styles and impersonating individuals. Language and identities. Llamas, C., Watt, D. , Edinburgh University Press. 86-96 (2010).
  32. Köster, O., Schiller, N. Different influences of the native language of a listener on speaker recognition. Forensic Linguistics. 4 (1), 18-27 (1997).
  33. The influence of native-language background on speaker recognition. Köster, O., Schiller, N., Künzel, H. Proceedings of the International Congress of Phonetic Sciences (ICPhS 1995), , 306-309 (1995).
  34. Thompson, C. P. A language effect in voice identification. Applied Cognitive Psychology. 1, 121-131 (1987).
  35. San Segundo, E., Univaso, P., Gurlekian, J. Sistema multiparamétrico para la comparación forense de hablantes. Estudios de Fonética Experimental. 28, 13-45 (2019).
  36. Council of Europe. Common European Framework of Reference for Languages: Learning, Teaching, Assessment. , Press Syndicate of the University of Cambridge. (2001).
  37. How to use Tascam DR-100 MKII: Getting started. , https://www.youtube.com/watch?v=O2E72uV9fWc (2018).
  38. Getting the most from your Shure SM58 microphone. , https://www.youtube.com/watch?v=wweNufW7EXA (2020).
  39. Kisler, T., Reichel, U. D., Schiel, F. Multilingual processing of speech via web services. Computer Speech & Language. 45, https://clarin.phonetik.uni-muenchen.de/BASWebServices/interface/WebMAUSBasic 326-347 (2017).
  40. Escudero, P., Boersma, P., Rauber, A., Bion, R. A cross-dialect acoustic description of vowels: Brazilian and European Portuguese. J Acoust Soc Am. 126 (3), 1379-1393 (2009).
  41. Post-aspiration in standard Italian: some first cross-regional acoustic evidence. Stevens, M., Hajek, J. Proceedings 11th Conference of the International Speech Communication Association (INTERSPEECH 2010), , 1557-1560 (2011).
  42. Barbosa, P., Madureira, S. Manual de Fonética Acústica Experimental: aplicações a dados do português. , Cortez. (2015).
  43. Boersma, P., Weenink, D. Praat: Doing phonetics by computer. (Version 6.1.38) [Computer program]. , https://www.praat.org/ (1992-2021).
  44. Silva, L. Jr VVUnitAligner. [Computer program]. , https://github.com/leonidasjr/VVunitAlignerCode_webMAUS (2022).
  45. Silva, L. Jr, Barbosa, P. A. SpeechRhythmExtractor [Computer program]. , https://github.com/leonidasjr/VowelCode (2019-2023).
  46. R Core Team. A language and environment for statistical computing. R Foundation for Statistical Computing. , https://www.R-project.org/ (2023).
  47. Pigoli, D., Hadjipantelis, P. Z., Coleman, J. Z., Aston, J. The statistical analysis of acoustic phonetic data. Journal of the Royal Statistical Society. 67 (5), 1103-1145 (2018).
  48. Barbosa, P. A. CreateLineup [Computer program]. , https://github.com/pabarbosa/prosody-scripts-CreateLineUp (2021).
  49. Van Rossum, G., Drake, F. L. Python 3 Reference Manual. , CreateSpace. (2009).
  50. Silva, L. Jr AcousticSimilarity_cosine_euclidean. [Computer program]. , https://github.com/leonidasjr/AcousticSimilarity/blob/main/AcousticSmilarity_cosine_euclidean.py (2024).
  51. Automatic assessment of voice similarity within and across speaker groups with different accents. Gerlach, L., McDougall, K., Kelly, F., Alexander, A. Proceedings of the International Congress of Phonetic Sciences (ICPhS 2023), , 3785-3789 (2023).
  52. Gahman, N., Elangovan, V. A comparison of document similarity algorithms. International Journal of Artificial Intelligence and Applications. 14 (2), 41-50 (2023).
  53. San Segundo, E., Tsanas, A., Gómez-Vilda, P. Euclidean distances as measures of speaker similarity including identical twin pairs: A forensic investigation using source and Filter voice characteristics. Forensic Science International. 270, 25-38 (2017).
  54. Speaker's voice characteristics and similarity measurement using Euclidean distances. Singh, M. K., Singh, N., Singh, A. K. Proceedings of the International Conference on Signal Processing and Communication (ICSC 2019), , 317-322 (2019).
  55. Darling-White, M., Banks, W. Speech rate varies with sentence length in typically developing children. J Speech Lang Hear Res. 64 (6), 2385-2391 (2021).
  56. Barbosa, P. A. Incursões em torno do ritmo da Fala. , Pontes Editores. (2006).
  57. Golestani, N., Pallier, C. Anatomical correlates of foreign speech sound production. Cereb Cortex. 17 (4), 929-934 (2007).
  58. Trouvain, J., Fauth, C., Möbius, B. Breath and non-breath pauses in fluent and disfluent phases of German and French L1 and L2 read speech. Proceedings of Speech Prosody. , 31-35 (2016).
  59. Waaning, J. The Lombard effect: the effects of noise exposure and being instructed to speak clearly on speech acoustic parameters. [Master's thesis]. , Radboud University. (2021).
  60. Villegas, J., Perkins, J., Wilson, I. Effects of task and language nativeness on the Lombard effect and on its onset and offset timing. J Acoust Soc Am. 149 (3), 1855(2021).
  61. Differences between native and non-native Lombard speech in terms of pitch range. Proceedings of the 23rd International Congress on Acoustics(ICA 2019). Marcoux, K., Ernestus, M. , 5713-5720 (2019).
  62. Marcoux, K., Ernestus, M. Pitch in native and non-native Lombard speech. Proceedings of the International Congress of Phonetic Sciences (ICPhS 2019). , 2605-2609 (2019).
  63. Marcoux, K., Ernestus, M. Acoustic characteristics of non-native Lombard speech in the DELNN corpus. Journal of Phonetics. 102, 1-25 (2024).
  64. Gil, J., San Segundo, E. La cualidad de voz en fonética judicial [Voice quality in judicial phonetics]. Lingüística Forense: la Lingüística en el ámbito legal y policial. Garayzábal, M., Jiménez, M., Reigosa, M. , Euphonía Ediciones. 154-199 (2014).
  65. Gil, J., San Segundo, E. El disimulo de la cualidad de voz en fonética judicial: Estudio perceptivo de la hiponasalidad [Voice quality disguise in judicial phonetics: A perceptual study of hyponasality. Panorama de la fonética española actual. Penas-báñez, M. A. , Arco Libros. 321-366 (2013).
  66. Passeti, R., Madureira, S., Barbosa, P. What can voice line-ups tell us about voice similarity. Proceedings of the International Congress of Phonetic Sciences (ICPhS 2023). , 3765-3769 (2023).
  67. Nolan, F. The DyViS database: Style-controlled recordings of 100 homogeneous speakers for forensic phonetic research. International Journal of Speech Language and the Law. 16 (1), 31-57 (2009).
  68. Caroll, D. Psychology of Language. , Wadsworth. (1994).
  69. Ortega-Llebaria, M., Silva, L. Jr, Nagao, J. Macro- and micro-rhythm in L2 English: Exploration and Refinement of Measures. Proceedings of the International Congress of Phonetic Sciences (ICPhS 2023). , 1582-1586 (2023).
  70. Fernández-Trinidad, M. Hacia la aplicabilidad de la cualidad de la voz en fonética judicial. Loquens. 9 (1-2), 1-11 (2022).
  71. Brouwer, S. The role of foreign accent and short-term exposure in speech-in-speech recognition. Atten Percep Psychophys. 81, 2053-2062 (2019).
  72. Love, R., Wright, D. Specifying challenges in transcribing covert recordings: Implications for forensic transcription. Front Commun. 6, 1-14 (2021).
  73. Meer, P. Automatic alignment for New Englishes: Applying state-of-the-art aligners to Trinidadian English. J Acoust Soc Am. 147 (4), 2283-2294 (2020).
  74. Montreal Forced Aligner: trainable text-speech alignment using Kaldi. McAuliffe, M., Socolof, M., Mihuc, S., Wagner, M., Sonderegger, M. Proceedings 18th Conference of the International Speech Communication Association (INTERSPEECH 2017), , 498-502 (2017).
  75. Chodroff, E. Montreal Forced Aligner: MFA Tutorial. , https://zenodo.org/records/7591607 (2023).

Yeniden basım ve izinler

Etiketler

Prozodik ÖzelliklerKonuşma AlgısıSes KalitesiTemel FrekansKonuşmacı TanımaAkustik Benzerlik