Источник: Лаборатория Джонатана Фломбаума—Университет Джона Хопкинса
Разговорная речь, уникальное достижение человека, в значительной степени зависит…
1. Стимулы
2. Создание иллюзии
Восприятие языка в устной форме выигрывает от взаимодействия лицом к лицу, поскольку рот предоставляет хорошую визуальную информацию для артикуляции конкретных звуков.
Например, в непосредственной близости и беспрепятственной ситуации человек может наблюдать, как его друг упоминает о том, что ходит на пляж. В этом случае они используют визуальный ввод, наблюдая за движением вокруг губ и языка, чтобы четко осмыслить сказанное.
Однако, если друг продолжает говорить вне поля зрения в другой комнате, у него может возникнуть искушение посмотреть приглушенный телевизор, и поэтому он должен полагаться исключительно на зажатый голос, чтобы понять сообщение.
В этом случае то, что на самом деле было сказано в хвосте, медиатор, мешало тихому пинку и было неверно истолковано как тик. Это пример эффекта Мак-Гурка — иллюзии восприятия, которая возникает из-за несоответствия между звуковыми и визуальными сигналами.
В этом видео показано, как конструировать аудиовизуальные стимулы для проверки феномена, первоначально открытого Макгерком и Макдональдом. В нем также исследуется, как зрение взаимодействует с производством звука, чтобы понять, как люди изучают язык в очень раннем возрасте.
В этом эксперименте участников просят смотреть приглушенные видео, в которых произносится слово, такое как усиление, в то время как звук, такой как bane, одновременно воспроизводится на заднем плане. После этого их просят поделиться тем, что они услышали.
Чтобы понять, как возникает иллюзия, давайте сначала обсудим, как артикулируются фонемы — минимальные единицы звуков речи.
Например, bane и gain имеют одни и те же элементы во всех позициях, кроме первой, это звуки /b/ и /g/.
Хотя слова с этими начальными фонемами могут звучать одинаково, когда показывается /g/ и проигрывается /b/, ожидается, что люди услышат совершенно другой третий звук ?/d/?.
Причина, по которой /d/ слышен, заключается в том, что все три звука в основном производятся одинаковым образом, с небольшой разницей в том, где динамик создает препятствие в воздушном потоке, называемое точками артикуляции, или POA.
Например, когда издается звук /b/, губы обеспечивают обструкцию, что приводит к губной POA, в то время как для /g/ он называется нёбным в задней части рта. Что касается /d/, то ОА является стоматологическим, что является следствием прикосновения языка к верхним зубам.
Когда мозг интегрирует конфликтующие визуальные /g/ и слуховые /b/, он приходит к выводу, что конечный звук должен лежать где-то посередине POA, таким образом слыша /d/ и сообщая слово Dane.
При подготовке к демонстрации приобретите компьютер для демонстрации видео и смартфон с видеокамерой.
Сначала расположите камеру так, чтобы ваша голова занимала весь дисплей. Теперь запишите четыре 10-секундных клипа, каждый из которых содержит разные слова, которые следует повторять 10 раз со скоростью 1 слово/с. Обязательно передайте видео с усилением и банкой на компьютер для визуального воспроизведения.
Чтобы провести эксперимент, посадите участника перед компьютером. Откройте видеофайл для слова gain и выключите звук.
На телефоне откройте видео для проклятия. Разместите его за компьютером так, чтобы его экран был скрыт и отчетливо был слышен только звук.
Попросите участника смотреть на монитор компьютера и слушать. Затем воспроизведите оба видео одновременно.
Когда клипы закончатся, спросите участника, что он услышал. [Участник говорит: "Датчанин"]. Повторите процедуру, воспроизведя видео слова can на компьютере и представив аудио для панорамирования на телефоне. Еще раз спросите участника о том, что он услышал. [Участник говорит: "загар"].
Здесь слова «проклятие» и «сковорода» звучали вслух, пока участник наблюдал за тем, как его произносят ртом. Как правило, когда термин с фонемой /g/ отображается визуально и сочетается со звуком /b/, люди будут слышать /d/.
Точно так же, когда слово, начинающееся с /k/, сочетается со звуком /p/, люди будут слышать /t/.
Причина такого слухового восприятия связана с тем, как производятся звуки. Мозг пытается разрешить противоречивую информацию от глаз, видя движения губ ?/b/ и /p/?, в то время как уши слышат нёбные единицы?/g/ и /k/. В результате он приходит к выводу, что звуки должны лежать посередине, что приводит к восприятию стоматологических фонем ?/d/ и /t/.
Теперь, когда вы знакомы с тем, как получить эффект Мак-Гурка, давайте рассмотрим некоторые другие способы, с помощью которых исследователи используют этот феномен восприятия для изучения развития речи и случаев, в которых эффект изменяется.
Младенцы могут быть протестированы на эффект Мак-Гурка уже в возрасте пяти месяцев, когда они достигли прелингвистического развития, используя парадигму привыкания к времени взгляда.
В этой процедуре Розенблюм и его коллеги неоднократно представляли младенцам определенный слог, такой как va, как в аудио, так и в визуальной областях, прежде чем ввести несовпадающие фонемы на этапе тестирования.
У младенцев наблюдались признаки привыкания к «уменьшенному времени взгляда» и отвыканию, отмечаемому как повышенный взгляд, когда воспринималось что-то другое, кроме «ва». Таким образом, еще до того, как младенцы научатся говорить, они демонстрируют те же результаты, что и взрослые, в которых они полагаются на использование визуальной информации для распознавания языка.
Тем не менее, дети с аутизмом испытывают большие трудности с проявлением эффекта Макгерка так же легко, как дети из контрольной группы, из-за их нарушенной способности понимать и обращать внимание на визуальные компоненты лица. Это указывает на принципиальные различия в обработке аудиовизуальной речи, которые могут способствовать их затруднению с языком и коммуникацией.
Наконец, пациенты с поражениями левого полушария – стороны, обычно преобладающей для понимания и изучения языка – часто используют визуальные черты лица для помощи во время логопедической терапии. Интересно, что при тестировании на эффект Макгурка они чаще сообщали о том, что слышали стоматологические звуки по сравнению с контрольной группой. Такое восприятие, вероятно, связано с их более высокой концентрацией на визуальной информации.
Вы только что посмотрели видео JoVE об эффекте Макгерка. Теперь вы должны знать, как проводить эту аудиовизуальную иллюзию и соотносить фонемы со звукопроизводством. Кроме того, вы также должны лучше понимать взаимодействие между зрением и слухом, а также то, как они могут быть затронуты в процессе развития и взрослой жизни.
Спасибо за просмотр!
View the full transcript and gain access to JoVE Science Education videos
Q1: What is the McGurk Effect and how does it demonstrate audiovisual perception?
The McGurk Effect is a perceptual illusion arising from a mismatch between sound and visual cues during speech perception. When you watch someone mouth one word while hearing a different word played simultaneously, your brain integrates the conflicting information and you perceive a third sound entirely. For example, watching 'gain' mouthed while hearing 'bane' typically results in hearing 'Dane.' This demonstrates that vision and hearing work together to interpret spoken language.
Q2: Why does the brain perceive a different phoneme when visual and auditory information conflict?
The brain resolves conflicting visual and auditory phonemes by computing a compromise based on points of articulation—where the speaker places an obstruction in airflow. When you see /g/ (palatal, back of mouth) but hear /b/ (labial, lips), your brain concludes the sound must lie between these positions, resulting in /d/ (dental, tongue on teeth). This integration mechanism reflects how perspectives on sensation and perception reveal the brain's reliance on visual information to disambiguate ambiguity in spoken language.
Q3: How can you conduct a McGurk Effect experiment with basic equipment?
Record four 10-second video clips of yourself repeating different words at one word per second. Mute one video on a computer monitor while playing audio from a different word on a hidden smartphone behind it. Ask participants what they heard. For example, play muted 'gain' video with 'bane' audio, or muted 'can' video with 'pan' audio. Participants typically report hearing the compromise phoneme rather than either the visual or auditory input alone.
Q4: What do infants reveal about audiovisual speech processing using the McGurk Effect?
Infants as young as five months old show the McGurk Effect using habituation-of-looking-time paradigms. Researchers repeatedly present infants with matched audiovisual syllables like 'va,' then introduce mismatched phonemes. Infants display habituation through reduced looking times, then dishabituation with increased looking when perceiving something different. This demonstrates that even pre-linguistic infants rely on visual information for language discrimination, similar to adults.
Q5: How does autism affect the McGurk Effect and audiovisual speech processing?
Children with autism show greater difficulty exhibiting the McGurk Effect compared to controls due to impaired ability to understand and attend to visual facial components. This indicates fundamental differences in processing audiovisual speech, which may contribute to their difficulty with language and communication. The reduced reliance on visual cues during speech perception suggests altered integration of sensory information in autism spectrum disorder.
Q6: Why do patients with left hemisphere lesions show stronger McGurk Effects during speech therapy?
Patients with left hemisphere lesions—the side typically dominant for language understanding and learning—often report hearing dental sounds more frequently than controls when tested on the McGurk Effect. This occurs because these patients rely more heavily on visual facial features to compensate for impaired auditory language processing during speech therapy. Their heightened focus on visual information results in stronger perception of the compromise phoneme.
Q7: What role does face-to-face interaction play in language perception?
Face-to-face interaction provides critical visual information about mouth and tongue movements that clarifies spoken language. The mouth can often supply better visual signals than speech supplies auditory signals, especially in close, unobstructed views. The human brain favors visual input to disambiguate inherent ambiguity in spoken language. This reliance on visual cues explains why understanding someone talking out of sight is more difficult than face-to-face communication.