Konuşma üretimi sonuçları
Bu bölümde, istatistiksel olarak anlamlı prosodik-akustik özelliklerin ve ritim metriklerinin performansını tanımladık. Bu prosodik özellikler; süre ile ilişkili olan konuşma, artikülasyon ve duraklama hızları ile ses kalitesi ile ilişkili olan shimmer'dır. Ritim metrikleri ise hece süresinin standart sapması (SD), konsonantın SD'si, vokalik veya konsonantal sürenin SD'si ve hece süresinin varyasyon katsayısıdır (bkz. Ek Tablo S1).
The Konuşma hızı (Şekil 6A) L1-L2 İngilizce için L1-L2 BP'ye göre daha hızlı azalmaktadır, ancak her iki L2 için de hız daha düşüktür. The Konuşma hızı üç metrikle ilgilidir - hece süresinin standart sapması (SD-S), ünlülerin standart sapması (SD-V), ve hece varyasyon katsayısı (Varco-S). Ayrıca hem AmE-S hem de Bra-S grubunun ikinci dillerinde (L2) yetkin olduklarının akılda tutulması önemlidir. Görünüşe göre bu hız, L1-L2 BP tarafından üretilen daha yüksek hece süresi değerleri ve daha düşük değişkenlikten etkilenerek eğimlerin daha az dik olmasına neden olmaktadır.
Eklemleme hızı (Şekil 6D), SD-S ve Varco-S'nin yanı sıra Hece Ritmi Oranı (RR-S) ile ilişkilidir; bu sonuncusu, kısa ve uzun heceler arasındaki oranı temsil eder. Bu tür metriklerin, cümle uzunluğu ve süredeki değişkenliğin daha yüksek L2 konuşma planlamasına ve L2 bilişsel yüküne yol açması nedeniyle etkilenen Konuşma hızı gibi, Eklemleme hızını da etkilediği görülmektedir9,23,54. Cümle uzunluğu alanında, prozodik-akustik parametrelerin etkileneceği şekilde daha yüksek bir bilişsel-dilbilimsel yük gerekebilir55.
Konuşma ve Eklemleme hızlarının prozodik-akustik özelliklerine ilişkin bulgularımız, bir konuşmacı hece (ve ünlü) sürelerini ne kadar çok değiştirirse, bu hızların o kadar düşük olduğunu göstermektedir. Hem L1 hem de L2 BP konuşma algısının L1 ve L2-İngilizceden biraz daha yavaş olduğu ve L1-İngilizcenin diğer tüm dil seviyelerinden daha hızlı duyulduğu hipotezini kurmaktayız. Bu durum, konuşma ritmiyle ve L1-L2 BP'nin ritim sürekliliğinin hece zamanlamalı kutbuna yönelirken, L1-L2 İngilizcenin vurgu zamanlamalı kutbuna doğru hareket ettiği hipoteziyle bağlantılı olabilir21,22.
Şekil 6B'deki Yerel parıltı (Local shimmer), SD-S ve Varco-S'den etkilenmektedir. Yerel parıltı için Bra-S, L1-BP ve L2-English üretimlerinin her ikisi de, hece süresi değişkenliği arttıkça (SD ve Varco, bkz. Ek Tablo S1) oldukça monotonik bir seyir izlemektedir. 8,5 ile 9 dB arasında değişen düşük varyasyon nedeniyle, Bra-S üretimleri dinlendiğinde vokal çaba algısı belirgin olabilir. Bra-S konuşması, vokal yükten etkilenmektedir. L1-BP, hece süresindeki yüksek varyasyonlara karşı daha az hassas olması nedeniyle cümle uzunluğundan yüksek düzeyde etkilenmektedir (BP ritmik paterni daha az hece varyasyonu gösterir22,56).
Duraksama oranı (Şekil 6C), L2-İngilizce konuşurlarının, L1-İngilizce, L1-BP ve L2-BP konuşurlarına göre daha uzun duraksamalar (200 ms ile 375 ms arasında) yaptığını göstermektedir (L1-İngilizce için ortalama 30 ms, L1-BP için 50 ms ve L2-BP için 100 ms). Bu durumda konuşma planlaması, artan beyin aktivitesi nedeniyle L2-İngilizce üretimini etkilemiş olabilir54,57. Daha yüksek dil yeterliliğinin daha yüksek okuma hızı ve kapsamı ile sonuçlanması beklenir54; buna rağmen, L2 yetkin konuşurlar için bile okuma görevleri, yabancı konuşmanın üst düzey bilişsel yönlerinde ve dil işlemede daha fazla çaba gerektirmiştir54,57. Bulgularımız, en azından öncül bir düzeyde, her iki dilin ritmik kalıplarındaki farklılıklar nedeniyle L2-BP konuşurlarının duraksamalardan L2-İngilizce konuşurlarına göre daha az etkilenebileceğini göstermektedir.

Şekil 6Prosodik-akustik özellikler için Genelleştirilmiş Toplamsal Modeller. Y ekseninde bağımlı değişken (modellenecek akustik özellikler); X ekseninde ise eğrilerin şeklini ve gidişatını belirleyecek olan tahmin değişkenleri (yani düzleştirme etkileri: 'Dil + kovaryatlar' şeklinde olan 'Dil' faktörü ve eklemeli modellerdeki kovaryatlar) ve bağımlı değişkenin daha doğru bir projeksiyonunu sağlayacak olan 'Dil' ile bir metrik özelliğin çarpımı (yani faktör-düzleştirme etkileşimleri: 'kovaryat:Dil') yer alır. Kısaltma: GAMs = Genelleştirilmiş Eklemeli Modeller. Bu şeklin daha büyük bir versiyonunu görüntülemek için lütfen buraya tıklayın.
Ritim metrikleriyle ilgili olarak, SD-S için (Şekil 7A), bulgularımız bir konuşmacının f0 eğrisini ne kadar çok değiştirip konuşma hızını ne kadar artırırsa, tüm dil seviyeleri için SD-S değerinin o kadar azaldığını ortaya koymaktadır (Şekil 6A'nın aynadaki yansıması olan bir etki). Ünsüzler için SD (SD-C, Şekil 7C) durumunda L1-BP, L1 İngilizce'nin aksine, Konuşma hızı veya Duraksama süresi arttıkça düşük varyasyon sergiler. Bu tür bir SD yönelimi öngörülebilir durumdadır, çünkü L1-İngilizce'de hece süresi değişkenliği L1-BP'den (istatistiksel olarak) anlamlı derecede daha yüksektir44,58. Varco-S (Şekil 7B ve Ek Tablo S1), aynı dil grubunun L1 ve L2'si ile bir ölçüde ilişkili görünmektedir. f0 değişkenliği ve Konuşma hızı arttıkça, Varco-S değeri L1-BP için azalmakta, L2-BP için ise azalıyor ve sönümleniyor görünmektedir. İngilizce üretimler için, f0 değişkenliği ve Konuşma hızı artarken, Varco-S hem L1-İngilizce hem de L2-İngilizce için artmakta ve sönümlenmektedir.
Ünlüler veya ünsüzler için SD (SD-V_C, Şekil 7D ve Ek Tablo S1) ile ilgili olarak, sonuçlarımız Varco-S performansı ile bazı benzerlikler göstermektedir (Şekil 7B). Örneğin, daha yüksek Konuşma hızı, Duraksama süresi ve f0 değişkenliği, L1-BP ve L2-BP için SD-V_C'nin düşüş-yükseliş yörüngesini desteklemektedir. İngilizce üretimlerde, bu tür prozodik özellikler daha yüksekken, SD-V_C hafifçe azalmakta; L1-İngilizce için sönümlenmekte, L2-İngilizce için ise hafifçe artmakta ve ardından sönümlenmektedir. Varco-S ve SD-V_C'nin aynı dil gruplarının L1-L2'si ile olan korelasyonu, kısmen arka plan gürültüsü nedeniyle konuşmadaki akustik parametrelerin değişmesini ifade eden Lombard Etkisi ile açıklanabilir59.
Yabancı dil konuşmalarında, görevin karmaşıklığına bağlı olarak (örneğin, okunan konuşma), konuşmacıların hem L1 hem de L2'de benzer akustik stratejiler kullandıkları görülmüştür59,60. Bir yandan Marcoux ve Ernestus, L2 Lombard konuşmasındaki f0 ölçümlerinin (aralık ve medyan), L2 İngilizce konuşmacılarının L1 Felemenkçelerinden etkilendiklerini gösterdiğini bulmuşlardır61,62. Öte yandan, daha güncel bulgular, L2 ile konuşurken oluşan daha yüksek bilişsel yük nedeniyle L2 Lombard konuşmasının L1 Lombard konuşmasından farklı olması beklense de, L2 İngilizce konuşmacılarının L1 İngilizce konuşmacılarıyla aynı yönde Lombard konuşma ürettiklerini öne sürmektedir63. Bulgularımızın Marcoux ve Ernestus63 ile ne ölçüde uyumlu olduğu ve Waaning59, Villegas ve ark.60 ile Marcoux ve Ernestus'tan61,62 ne ölçüde ayrıldığına dair daha fazla araştırma yapılması gerekmektedir.

Şekil 7: Metrik özellikler için Genelleştirilmiş Aditif Modeller. Y ekseninde yanıt değişkeni (modellenecek metrik özellikler); X ekseninde ise tahmin edici değişkenler (eğrilerin şeklini ve yörüngelerini sağlayacak olan aditif modellerdeki 'Language' faktörü ve kovaryantlar (yani düzeltme etkileri: 'Language + kovaryantlar') ve yanıt değişkeninin daha doğru bir projeksiyonunu sağlayacak olan 'Language' ile bir metrik özelliğin çarpımı (yani faktör-düzeltme etkileşimleri: 'kovaryant:Language')). Kısaltma: GAMs = Genelleştirilmiş Aditif Modeller. Bu şeklin daha büyük bir versiyonunu görüntülemek için lütfen buraya tıklayın.
Konuşma algısı sonuçları
BP ses dizilimleriyle ilgili olarak, 1 numaralı dizilimde (Şekil 8A), 3 numaralı çeldirici ses hedef ses olarak değerlendirilmiştir. Aslında hedef ses 4 numaralı sesti. Sonuçlar, 3 numaralı çeldirici (%83) ile 4 numaralı hedef ses (%71) arasında istatistiksel olarak anlamlı bir fark olmadığını göstermektedir (bkz. Ek Tablo S1). 2 numaralı dizilimde (Şekil 8B), 3 numaralı hedef ses (%40) ile 4 numaralı çeldirici (%20) arasındaki karşılaştırma da İngilizce ses dizilimleri için istatistiksel olarak anlamlı bir fark göstermemiştir (bkz. Ek Tablo S1). 1 numaralı dizilimde (Şekil 9A), 2 numaralı çeldirici (%26) ile 4 numaralı hedef ses (%54) arasında anlamlı bir fark görülmemiştir (bkz. Ek Tablo S1).
Ses benzerliği analizinde, hem Kosinüs benzerliği (CoSim) hem de Öklid mesafesi (EucDist, [EucDist dönüştürülmüş]54), BP dizilimi #1 için 3 numaralı çeldirici ile hedef arasında tutarlı bir korelasyon göstermiştir (CoSim = 0.99; EucDist = 77.4, [0.93]). 4 numaralı çeldirici ile hedef arasındaki korelasyon, BP dizilimi #2'de benzer şekilde güçlüydü (CoSim = 0.99, EucDist = 76.3, [0.93]). İngilizce dizilimi #1'de korelasyon, CoSim için tutarlı (0.83) ancak EucDist için zayıf-yeterli düzeydeydi (213.0, [0.47]. Genel olarak, hem CoSim hem de EucDist ses benzerliğinin belirlenmesinde yeterli tekniklerdi. Ek olarak, Gahman ve Elangovan tarafından52 ele alındığı üzere, CoSim biraz daha etkili performans göstermiştir (bkz. Ek Tablo S1)).
Benzerlik açısından, yanlış alarmlarda artışa ne yol açmış olabilir? Prozodik-akustik özellikler, Şekil 8A,B ve Şekil 9A'da sunulan dizilimler hariç olmak üzere, çeldiriciler ve hedef seslerin (istatistiksel olarak) anlamlı derecede farklı performans göstermesine rağmen, dinleyicilerin tercihlerinin diğer dizilimlerde farklı çeldiriciler boyunca bir miktar çeşitlendiğini göstermiştir (Şekil 8C,D ve Şekil 9B-D). Bu tür bir yargının, genel bir prozodik-akustik özellikler sınıfından ziyade, konuşmacıların paylaştığı bir (veya belki daha fazla) spesifik akustik özelliğe daha fazla bağlı olduğu görülmektedir. Örneğin, çalışmamız üretimler arasında (ortak) varyasyon gösteren birkaç özellik sunmuştur; buna rağmen, algısal sonuçlar yargıların hedef sese uyması için spesifik bir çeldiriciye olan tercihlerini göstermektedir8,35,64,65. Gelecekteki çalışmalarda daha ayrıntılı analizlere ihtiyaç vardır.
Akustik benzerlik için bu çalışmada sunulan çok boyutlu parametrik matris seçeneğinin değerlendirilmesi dikkat çekicidir66. Bulgularımız, f0, VQ ve yoğunluğa dayalı akustik özelliklerin kullanıldığı önceki çalışmalarla uyumludur9,35. Bu tür özelliklerin, adli alandaki konuşmacı karşılaştırma görevleri için özellikle önerildiği bilinmektedir9,66. Bununla birlikte, yabancı aksanlı konuşmacı tanıma için ses dizilimlerinin hazırlanmasında McFarlane kılavuzlarının bir varyantını kullanmış olmamıza rağmen16,17, mevcut araştırmada hiçbir yanıltıcı sesin hedef sese benzer olduğunun öngörülmediğini vurgulamak önemlidir. Ayrıca, ses dizilimi prosedürümüzün; uyaran uzunluğu, ses sayısı, yanıltıcıların seçimi (burada randomize edilmiştir) ve konuşma tarzı dahil olmak üzere McFarlane kılavuzlarından önemli farklılıklar içerdiğini belirtmeliyiz.
f0, ses kalitesi ve yoğunluğun prozodik-akustik özelliklerinin dinleyicilerin algısıyla ne ölçüde ilişkili olduğu, araştırmada kullanılan konuşma tarzına yüksek derecede bağlı olacaktır. Burada, okuma pasajları kullandık. İşitme tanıklığı çalışmalarının çoğunluğu, güncel işitme tanıklığı araştırmalarında yaygın olarak kullanılan DyVis korpusu6728,68 gibi dengeli bir çözüm olarak (yarı) kendiliğinden gelişen uyaranları tercih etmektedir. Okuma görevlerini seçmemize yol açan neden, bu taslağın hazırlandığı sırada korpusumuzun yalnızca okuma görevlerinden elde edilen verilerden oluşuyor olmasıdır. Bununla birlikte, (yarı) kendiliğinden gelişen bir korpus derleme sürecinin halihazırda devam ettiğini belirtmek önemlidir. Ayrıca, bir hikayeyi okuma eylemi, hem konuşmacı içi hem de konuşmacılar arası düzeyde güvenilir bir tekdüzelik ve varyasyon düzeyi oluşturabilir. Bu durum, ses karşılaştırmayı içeren durumlarda prozodik veya fonetik özelliklerin -bireysel veya lehçesel- vurgulanmasını kolaylaştırır. Bu durum, yetkin konuşmacılar arasında bile yabancı bir aksanın üretimi sırasındaki vokal yüklenme örneklerinde özellikle belirgin hale gelir 8,9,23,54.

Şekil 8: Brezilyalı dinleyiciler tarafından gerçekleştirilen dört dizilişin sonuçlarını içeren sütun grafikleri.(A,B) Hedef ses (mavi) ile bir çeldirici (açık mavi) arasında anlamlı olmayan fark. (C,D) Çeldiricilere ve hedef sese göre anlamlı farklar. Kısaltma: NS = anlamlı değil. Bu şeklin daha büyük bir versiyonunu görüntülemek için lütfen buraya tıklayın.

Şekil 9: Amerikalı dinleyiciler tarafından gerçekleştirilen dört dizilimin sonuçlarını içeren sütun grafikleri. (A) Hedef ses (kırmızı) ile bir çeldirici (pembe) arasında anlamlı olmayan fark. (B,C,D) Çeldiriciler ve hedef ses ile olan anlamlı farklar. Kısaltma: NS = anlamlı değil. Bu şeklin daha büyük bir versiyonunu görüntülemek için lütfen buraya tıklayın.
Ek Tablo S1: Konuşma üretimi istatistikleri - Genelleştirilmiş Katkılı Modeller (GAM'lar): Her Dil seviyesi için istatistiksel olarak anlamlı olan her bir prozodik-akustik özelliğin (Şekil 6) ve ritim metriğinin (Şekil 7) F-istatistikleri (serbestlik dereceleri), düzeltilmiş R2 değerleri ve her bir düzleştirme teriminin (kovaryantlar) bireysel değerleri. Konuşma algısı istatistikleri: Kruskall-Wallis χ2 istatistikleri (serbestlik dereceleri), p-değerleri ve düzeltilmiş η2 değerleri ile hedef-yanıltıcı ses çiftleri (Şekil 8A,B ve Şekil 9A) arasındaki istatistiksel olarak anlamlı olmayan her bir fark için ikili karşılaştırma amacıyla yapılan post-hoc Dunn testi (Şekil 8 ve Şekil 9). Her bir dizilim için Kosinüs ve Öklid mesafesine ait akustik benzerlik matrisleri. Bu şeklin daha büyük bir versiyonunu görüntülemek için lütfen buraya tıklayın.