I. Analizy podsystemów
1. Podsystem oddechowy/ Oddychanie podczas mowy
Podsystem oddechowy jest oceniany przy użyciu systemu aerodynamiki fonacyjnej (Phonatory Aerodynamic System, PAS). System ten umożliwia jednoczesny zapis ciśnienia w jamie ustnej, przepływu powietrza oraz akustyki mowy (listę sprzętu i producentów przedstawiono w Tabeli 1). Do rejestracji niezbędna jest jednorazowa maska na twarz oraz jednorazowa rurka do pomiaru ciśnienia. Przed rozpoczęciem rejestracji kanały przepływu i ciśnienia są kalibrowane zgodnie ze specyfikacją producenta.
- Pojemność życiowa (VC) to maksymalna objętość powietrza wydychana po maksymalnym wdechu. VC jest oceniana przy użyciu jednorazowej maski twarzowej podłączonej do pneumotachografu.
- Do rejestracji wybierany jest protokół PAS „Vital Capacity”.
- Uczestnik otrzymuje instrukcję, aby wziąć możliwie najgłębszy wdech, a następnie maksymalnie wydychać powietrze do maski; czynność tę powtarza się trzykrotnie.
- Maksymalna objętość wydechowa jest wyznaczana za pomocą oprogramowania PAS.
- Ciśnienie podgłośniowe (Ps) to ciśnienie powietrza dostępne w płucach do produkcji spółgłosek „ciśnieniowych”. Ps jest oceniane pośrednio poprzez pomiar ciśnienia szczytowego w jamie ustnej podczas produkcji ciągu sylab2,3.
- Do rejestracji wybierany jest protokół PAS „Voicing Efficiency”.
- Aby zapisać ciśnienie w jamie ustnej podczas artykulacji /pa/, rurkę czujnika ciśnienia umieszcza się w jamie ustnej na powierzchni języka.
- Przejścia nosowe zostają zamknięte za pomocą klipsa do nosa, aby wyeliminować potencjalny wyciek powietrza przez nos.
- Uczestnik otrzymuje instrukcję, aby wziąć wdech o objętości około dwukrotnie większej niż normalnie i wypowiedzieć /pa/ do maski twarzowej. Sylaba /pa/ jest powtarzana siedem razy na jednym wydechu, przy zachowaniu stałej wysokości dźwięku i głośności. Tempo utrzymuje się na poziomie 1,5 sylaby na sekundę.
- Ciśnienie szczytowe w jamie ustnej jest mierzone dla pięciu (środkowych) powtórzeń /pa/. Wyciąga się średnią z tych pięciu produkcji, aby reprezentowała Ps podczas mowy.
- Ponieważ Ps współzmienia się z poziomem ciśnienia akustycznego (SPL)4,5, dla każdej sylaby zbierany jest również parametr SPL. Jest on następnie wykorzystywany jako współzmienna podczas analiz.
- Oddychanie mowy jest oceniane podczas mowy ciągłej, gdy uczestnicy czytają standardowy akapit składający się z 60 słów (Załącznik 1), opracowany specjalnie w celu dokładnej, automatycznej detekcji granic pauz6.
- Do rejestracji wybierany jest protokół PAS „Maximum Phonation”.
- Sygnał przepływu powietrza jest zbierany przy użyciu jednorazowej maski dopasowanej do twarzy.
- Uczestnik otrzymuje instrukcję, aby przeczytać akapit w normalnym, komfortowym tempie i głośności mówienia.
- Wykresy przepływu powietrza są eksportowane do specjalistycznego programu Speech-Pause Analysis (SPA)7 stworzonego w środowisku Matlab. W programie tym identyfikuje się pauzy w mowie ciągłej. Oprogramowanie oblicza, między innymi, procentowy czas pauz, który jest miarą czasu spędzonego na pauzach podczas czytania fragmentu tekstu.
2. Podsystem fonacyjny
Podsystem fonacyjny jest oceniany za pomocą nagrań głosu przy użyciu wysokiej jakości sprzętu do rejestracji akustycznej (Tabela 1).
- Mikrofon umieszcza się w odległości około 15 cm od ust.
- Stosuje się zacisk do nosa, aby wyeliminować potencjalny wpływ niedomykalności welonosegardzielnej na jakość fonacji.
- Uczestnika prosi się o wykonanie "maksymalnej fonacji". Otrzymuje on instrukcję, aby wziąć maksymalną ilość powietrza, a następnie fonować dźwięk /a/ przy normalnej wysokości i głośności tak długo, jak to możliwe. Zadanie to jest ćwiczone co najmniej raz przed nagraniem. Podkreśla się znaczenie włożenia maksymalnego wysiłku.
- Czas trwania maksymalnej fonacji mierzy się w sekundach na podstawie przebiegu fali akustycznej.
- Zdigitalizowany przebieg fali akustycznej jest ładowany do oprogramowania Multidimensional Voice Profile (MDVP) w celu analizy. Dla środkowych pięciu sekund przedziału fonacyjnego wyznacza się miary tendencji centralnej i zmienności częstotliwości podstawowej (F0), stosunek szumu do harmonicznej (NHR) oraz procentowy jitter, a także inne parametry.
3. Podsystem rezonatorów
Podsystem rezonansowy ocenia się za pomocą nasometru. Urządzenie to składa się z zestawu nagłownego z płytą przegrodową, która jest umieszczana pod nosem i oddziela jamę ustną od jamy nosowej. Po przeciwnych stronach płyty zamontowano dwa mikrofony wykrywające sygnały akustyczne z jamy ustnej i nosowej.
- Urządzenie jest kalibrowane przed każdym pomiarem.
- Nagłówek jest umieszczany na głowie tak, aby płyta deflektora spoczywała nad górną wargą i była ustawiona równolegle do podłoża.
- Uczestnika prosi się o trzykrotne powtórzenie jednego zdania „nosowego” (np. „Mama made some lemon jam”) oraz jednego zdania „nienosowego” (np. „Buy Bobby a puppy”) przy habitualnej prędkości i głośności mówienia.
- Zmierzone natężenia dźwiękowe części dźwięcznej sygnałów akustycznych jam ustnej i nosowej są przeliczane na wskaźnik nasalance, który definiuje się jako stosunek energii akustycznej nosowej do sumy energii akustycznej nosowej i ustnej, wyrażony w procentach. Wskaźnik nasalance odzwierciedla względną proporcję energii akustycznej nosowej do ustnej w strumieniu mowy8.
- Oprogramowanie Nasometer oblicza liczne statystyki opisowe na podstawie przebiegu fali nasalance.
- Dystans nasalance, otrzymywany poprzez odjęcie średniej wartości nasalance obliczonej dla zdań ustnych (BBP) od średniej wartości nasalance dla zdań nosowych (MMJ)9, może być również stosowany jako wskaźnik zaburzeń velofaryngealnych.
4. Podsystem artykulacyjny: Twarz
Ruchy twarzy (warg i żuchwy) są rejestrowane w 3D przy użyciu wysokorozdzielczego optycznego systemu analizy ruchu10. Podczerwone kamery wideo rejestrują położenie 15 markerów refleksyjnych, które są przymocowane do głowy i twarzy każdego uczestnika w określonych punktach anatomicznych. Sygnał akustyczny mowy jest rejestrowany jednocześnie z kinematyką mowy.
- Przed rozpoczęciem pomiarów system jest kalibrowany zgodnie ze specyfikacją producenta.
- Za pomocą opaski na głowę do czoła uczestnika mocuje się cztery markery. Markery mocuje się również do lewej i prawej brwi, grzbietu i czubka nosa, czerwieni górnej i dolnej wargi, lewego i prawego kącika ust oraz w trzech różnych miejscach na brodzie. Jest to typowy układ markerów stosowany w tym protokole, jednak system ten pozwala na wykorzystanie nieograniczonej liczby markerów.
- Uczestnika prosi się o odczytanie zdań i fraz (patrz Tabela 2) z habitualną prędkością i głośnością mówienia.
- Rejestrowany jest plik w stanie spoczynku („rest”), który służy w postprocesingu do normalizacji różnic w rozmieszczeniu markerów między sesjami oraz do ponownego odniesienia danych do spójnego, anatomicznego układu współrzędnych, jeśli jest to konieczne.
- Podczas postprocesingu ruchy markerów twarzy są sprawdzane pod kątem błędów śledzenia, a następnie korygowane względem ruchu głowy poprzez odjęcie zarówno komponentów translacyjnych, jak i rotacyjnych ruchu głowy.
- Dane są ładowane do SMASH, programu opartego na środowisku Matlab, opracowanego w naszym laboratorium. W programie SMASH dane są filtrowane i analizowane. Szczytowa prędkość ruchu jest wyznaczana z każdego przebiegu i służy jako główny wskaźnik funkcji artykulacyjnej żuchwy i warg. Prędkość 3D jest obliczana w programie SMASH jako pochodna pierwszego rzędu historii czasu odległości euklidesowej każdego artykulatora.
5. Podsystem artykulacyjny: Język
Śledzenie języka odbywa się przy użyciu elektromagnetycznego urządzenia śledzącego (WAVE), które rejestruje pozycję i rotację czujników przymocowanych do języka. W przeciwieństwie do optycznego śledzenia ruchu, stosowanego do rejestracji zewnętrznych struktur twarzy, technologia elektromagnetyczna umożliwia dokładne śledzenie ruchów języka podczas mowy11. System wykorzystuje kombinację czujników o 5 i 6 stopniach swobody (5DOF i 6DOF) do rejestracji ruchów artykulacyjnych w skalibrowanej objętości (30 x 30 x 30 cm). Dane dotyczące ruchu oraz dane akustyczne są pozyskiwane jednocześnie.
- Do artykulatorów przytwierdzono dwa czujniki za pomocą kleju dentystycznego (PeriAcryl Periodontal Adhesive). Jeden czujnik referencyjny przymocowano do nasady nosa w celu rejestracji ruchów głowy. Jeden mały czujnik 5DOF (pomiary lokalizacji 3D i kątowe 2D) przymocowano do języka w linii środkowej, około 2 cm za koniuszkiem języka.
- Aby uzyskać ruchy języka niezależne od leżącej u podstawy żuchwy, każdemu uczestnikowi założono gotowy blok zgryzowy o grubości 5 mm. Blok zgryzowy wykonano z nietoksycznej masy kondensacyjnej (Henry Schein).
- Blok zgryzowy umieszczono między trzonowcami po jednej stronie jamy ustnej. Sznurek przymocowany do bloku zgryzowego zabezpieczono na twarzy uczestnika, aby zapobiec połknięciu bloku.
- Uczestnika poproszono o przeczytanie zdań i fraz (patrz Tabela 2).
- Ruchy języka rejestrowano w odniesieniu do pozycji głowy.
- Po akwizycji dane przekazano do programu SMASH, gdzie poddano je filtrowaniu dolnoprzepustowemu, analizie na podstawie śladu ruchu pionowego i wykorzystano do obliczenia prędkości 3D. Średnią i maksymalną prędkość ruchu podczas każdej wypowiedzi podano jako wskaźnik zmian w tym artykulatorze związanych z chorobą.
II. Ocena na poziomie systemowym
Oprócz zmiennych na poziomie podsystemów, mierzy się zrozumiałość mowy oraz tempo mówienia. Pomiary te są istotne, ponieważ stanowią one obecnie kliniczne „standardy celowe” charakteryzujące sprawność mowy bulbarnej. Dostarczają one informacji o funkcjonalnym stanie całego systemu produkcji mowy i pozwalają określić stopień nasilenia zaburzeń mowy. Pomiary te są przeprowadzane przy użyciu testu zrozumiałości zdań (SIT)12.
- Przed rozpoczęciem nagrywania oprogramowanie SIT generuje losową listę 10 zdań o rosnącej długości (od 5 do 15 słów).
- Mikrofon zostaje umieszczony na głowie, w odległości około 15 cm od ust.
- Uczestnika prosi się o przeczytanie listy w naturalnym tempie i głośności mówienia. Zdania są rejestrowane cyfrowo z częstotliwością 44.1k i rozdzielczością 16 bit).
- Kilku przeszkolonych sędziów, nieznanych uczestnikowi, dokonuje transkrypcji ortograficznej zdań i mierzy ich czas trwania.
- Oprogramowanie SIT automatycznie oblicza zrozumiałość mowy, która jest raportowana jako procent słów poprawnie transkrybowanych w stosunku do całkowitej liczby wypowiedzianych słów. Tempo mówienia jest również raportowane jako liczba słów przeczytanych na minutę.
| Podsystem | Sprzęt / Oprogramowanie | Sygnał | Ustawienia akwizycji |
| Oddechowy | Phonatory Aerodynamic System (PAS), KayPENTAX, Lincoln Park, NJ, USA | Akustyczny, ciśnienia i przepływu | Częstotliwość próbkowania=200 Hz, filtr dolnoprzepustowy=30Hz |
| Fonacyjny | Kompaktowy rejestrator flash (np. PMD660),
Mikrofon profesjonalnej jakości,
Pomiar poziomu dźwięku (SPL meter), Extech Instruments
Oprogramowanie: MDVP, KAYPentax | Akustyczny | Częstotliwość próbkowania=44.01 kHz, 16 bit liniowy PCM |
| Rezonansowy | Nazometr, Model 6400, KAYPentax | Akustyczny | Częstotliwość próbkowania=11025 Hz |
| Artykulacyjny: Twarz | Eagle Digital System, Motion Analysis Corp. | Kinematyczny i akustyczny | Częstotliwość próbkowania=120Hz, filtr dolnoprzepustowy=10Hz |
| Artykulacyjny: Język | WAVE, Northern Digital Inc, Canada | Kinematyczny i akustyczny | Częstotliwość próbkowania=100Hz, filtr dolnoprzepustowy=20Hz |
Tabela 1: Instrumentacja i ustawienia akwizycji dla zbierania danych z podsystemów
| Poziom | Zadanie | Pomiary | Referencje i normy |
| Oddechowy | VC | Maksymalna objętość wydechowa płuc | 13 |
| /pa/ x 7 | Ciśnienie podgłośniowe | 2, 3 |
| Przejście bambusowe | % Czasu pauzy | 6, 7, 14 |
| Fonatoryjny | Maksymalna fonacja /a/ | Maksymalny czas trwania fonacji, średnia F0, jitter, SNR | 15, 16, 17, 3 |
| Rezonatoryjny | Mama made some lemon jam; Buy Bobby a puppy | Nasalans | 18, 19 |
| Artykulacyjny: Twarz | Buy Bobby a puppy; Powtórz _ ponownie (bat, tide, keep, tool) | Prędkość ruchu | 20, 21 |
| Artykulacyjny: Język | /ta/ x 5, Powtórz słowo doily |
| Poziom systemowy | SIT, Zdania | Zrozumiałość mowy i tempo mówienia | 12 |
Tabela 2: Pomiary uzyskane dla każdego podsystemu i zadania
Dodatek 1: Pasaż bambusa
Ściany z bambusa stają się bardzo popularne. Są wytrzymałe, łatwe w montażu i estetyczne. Stanowią doskonałe tło i budują nastrój w ogrodach japońskich. Bambus jest trawą i należy do jednych z najszybciej rosnących traw na świecie. W Azji uprawia się wiele odmian bambusa, choć występuje on również w Ameryce. W zeszłym roku kupiliśmy nowy dom i pracowaliśmy nad ogrodami kwiatowymi. Za kilka dni ukończymy budowę ściany z bambusa w jednym z naszych ogrodów. Projekt ten sprawił nam wiele radości.