Strumienie głosowe człowieka są bogate w informacje, takie jak emocje1,2, stan zdrowia3,4, płeć biologiczna5, wiek6, a co ważniejsze, indywidualna tożsamość głosowa7,8. Badania sugerują, że ludzkie słuchacze mają mocną zdolność do rozpoznawania i rozróżniania tożsamości swoich rówieśników poprzez głosy, przezwyciężając wariacje wewnątrz-mówcy wokół przeciętnej reprezentacji tożsamości mówcy w przestrzeni akustycznej9. Takie różnice są spowodowane manipulacjami akustycznymi (częstotliwością podstawową i długością traktu głosowego, czyli F0 i VTL), które nie odpowiadają żadnym jasnym intencjom pragmatycznym9, prozodiami emocjonalnymi10 i pewnością głosu, która przekazuje uczucie pewności mówców11. Eksperymenty behawioralne skupią się na wielu czynnikach, które wpływają na wydajność słuchaczy w rozpoznawaniu mówców, w tym manipulacje związane z językiem8,12,13, cechy związane z uczestnikami, takie jak doświadczenie muzyczne czy umiejętność czytania14,15 oraz adaptacje dotyczące stymulacji, takie jak mowa wspak lub niesłowa16,17; więcej można znaleźć w przeglądach literatury18,19. Kilka ostatnich eksperymentów badało, jak indywidualna wariacja reprezentacji tożsamości mówcy może osłabić dokładność rozpoznawania, biorąc pod uwagę aspekty, takie jak wysoka i niska ekspresja emocjonalna16 oraz neutralne i przestraszone prozody5; sugeruje to wiele możliwych scenariuszy do dalszych badań20.
W celu wypełnienia pierwszej luki w badaniach, badanie proponuje, że neurofizjologiczne podstawy identyfikacji mówcy jeszcze nie w pełni badają, jak wariacje wewnątrz-mówcy wyzwania dla aktywności mózgu słuchaczy. Na przykład w zadaniu rozpoznawania mówcy opartego na fMRI autorstwa Zäske i wsp., prawa tylna górna zakręt skroniowy (pSTG), prawa dolna/środkowa zakręt czołowy (IFG/MFG), prawa środkowa zakręt czołowy i lewa caudata wykazywały zmniejszoną aktywność, gdy prawidłowo identyfikowano starych i nowych mówców, niezależnie od tego, czy treść językowa była taka sama czy różna21. Jednak wcześniejsze badanie EEG autorstwa Zäske i wsp. nie zaobserwowało tego efektu stary/nowy, gdy różnica tożsamości mówcy została wprowadzona poprzez różne teksty22. Konkretnie, większy, późny dodatni składnik (LPC) w zakresie od 300 do 700 ms, wykryty na elektrodzie Pz, gdy słuchacze spotkali swojego zapoznanego mówcę, który wyrażał ten sam tekst (czyli słysząc powtórkę o niezmienionej treści językowej), był nieobecny, gdy mówcy dostarczali nowe teksty.
Wsparciem dla twierdzenia Zäske i wsp.21 to badanie podejrzewa, że efekt stary/nowy nadal można zaobserwować pomimo różnic w treści językowej między sesjami szkoleniowymi i testowymi w analizach potencjałów związanych z zdarzeniem (ERP). Ta racja pochodzi od poglądu, że brak efektu stary/nowy w Zäske i wsp.22, w warunkach, gdy używano różnych tekstów, może być przypisany brakowi dodatkowej sesji kontrolnej podczas zadania szkoleniowego, aby zapewnić dokładne i skuteczne uczenie się tożsamości, jak sugerują Lavan i wsp.23. W związku z tym, pierwszym celem badania jest zbadanie i zweryfikowanie tej hipotezy. To badanie ma na celu przetestowanie tego, dodając sesję kontrolną do paradygmatu szkoleniowo-testowego22.
Kolejnym kluczowym pytaniem, które to badanie ma na celu udokumentować, jest odporność identyfikacji mówcy w obecności prozodii mowy. Poprzednie badania behawioralne sugerują, że słuchacze szczególnie mają trudności z rozpoznawaniem mówców w różnych prozodiach, co wskazuje na modulacyjną rolę kontekstu prozodycznego - słuchacze słabo się spisali w różnych warunkach treningu i testowania prozody. To badanie ma na celu przetestować to, eksponując słuchaczy do rozpoznawania zapoznanych mówców w pewnych lub wątpliwych prozodiach24. To badanie spodziewa się, że zaobserwowane różnice ERP pomogą wyjaśnić, jak prozodia mowy wpływa na rozpoznawanie tożsamości.
Głównym celem obecnego badania jest zbadanie odporności efektu stary/nowy w rozpoznawaniu mówcy, szczególnie badając, czy są różnice w rozpoznawaniu mów