Sztuczna inteligencja może znaleźć w naszym głosie znacznie więcej informacji niż tylko wiek. Naukowcy opracowali tzw. speech clock, czyli „zegar mowy”, który analizuje setki cech głosu i sposobu wypowiadania się, a następnie szacuje wiek osoby na podstawie samego nagrania. Badanie objęło 2928 hiszpańskojęzycznych uczestników z Argentyny, Chile, Kolumbii, Meksyku i Peru.
Najciekawszy nie jest jednak sam przewidywany wiek. Badacze obliczyli także speech age gap, czyli różnicę między rzeczywistym wiekiem człowieka a wiekiem oszacowanym przez model na podstawie mowy. Większa dodatnia różnica — gdy głos i sposób mówienia wyglądały dla algorytmu na „starsze” niż wynikałoby to z metryki — wiązała się między innymi z gorszymi wynikami poznawczymi oraz innymi wskaźnikami starzenia organizmu i mózgu.
Nie oznacza to jednak, że czterominutowe nagranie głosu pozwala dziś wykryć chorobę Alzheimera. Badanie miało charakter przede wszystkim przekrojowy i pokazuje korelacje, a nie gotowy test diagnostyczny. Zanim podobne narzędzie trafi do medycyny, potrzebne będą badania prowadzone przez lata, walidacja w innych językach i sprawdzenie systemu w bardziej naturalnych warunkach.
Najważniejsze informacje:
- Badanie objęło 2928 hiszpańskojęzycznych osób.
- Uczestnicy pochodzili z Argentyny, Chile, Kolumbii, Meksyku i Peru.
- W grupie znalazły się osoby zdrowe oraz pacjenci z łagodnymi zaburzeniami poznawczymi, chorobą Alzheimera i otępieniem czołowo-skroniowym.
- Algorytmy analizowały ponad 700 cech akustycznych i językowych.
- Pod uwagę brano m.in. wysokość głosu, tempo i rytm mowy, słownictwo oraz ekspresję emocjonalną.
- Model szacował wiek osoby na podstawie mowy.
- Różnicę między wiekiem rzeczywistym i przewidywanym nazwano speech age gap – SAG.
- Dodatni SAG oznaczał, że profil mowy wyglądał na starszy niż wiek metrykalny uczestnika.
- Większy speech age gap wiązał się z niektórymi wskaźnikami funkcji poznawczych, starzenia mózgu i wieku epigenetycznego.
- U osób z chorobą Alzheimera SAG był również powiązany z poziomem p-tau217.
- Narzędzie nie jest obecnie testem diagnostycznym Alzheimera ani demencji.
- Model został przebadany na języku hiszpańskim i nie można automatycznie przenosić jego wyników na język polski.
Speech clock analizuje ponad 700 cech głosu i sposobu mówienia
Pomysł jest pozornie prosty. Uczestnik mówi, algorytm analizuje nagranie, a następnie próbuje przewidzieć jego wiek. W rzeczywistości model nie skupia się jednak na jednej charakterystycznej cesze, takiej jak niski głos czy wolniejsze tempo. Łączy setki drobnych sygnałów akustycznych i językowych, które razem tworzą znacznie bardziej złożony profil.
Badacze wykorzystali ponad 700 parametrów. Wśród nich znalazły się wysokość i charakterystyka głosu, tempo wypowiedzi, sposób budowania zdań, używane słownictwo oraz informacje związane z ekspresją emocjonalną. Część tych elementów zmienia się naturalnie wraz z wiekiem, inne mogą zależeć od kondycji poznawczej i funkcjonowania układu nerwowego.
Do przetwarzania tak dużej liczby parametrów wykorzystano metody uczenia nadzorowanego. Model otrzymywał dane z nagrań wraz z informacją o rzeczywistym wieku uczestników i uczył się znajdować kombinacje cech najlepiej przewidujące wiek.
Według badaczy już kilka minut mowy może zawierać wystarczająco dużo informacji, aby wychwycić część tych wzorców. To właśnie niski koszt pozyskania danych jest jednym z powodów, dla których speech clock wzbudza tak duże zainteresowanie.
Speech age gap pokazuje różnicę między wiekiem a profilem mowy
Samo odgadnięcie wieku nie byłoby jeszcze szczególnie interesujące. Znacznie ważniejszym elementem badania okazała się różnica między wiekiem rzeczywistym i tym, który przewidywała sztuczna inteligencja.
Naukowcy nazwali ją speech age gap, w skrócie SAG. Jeśli osoba miała 60 lat, a na podstawie jej sposobu mówienia model szacował profil charakterystyczny dla wieku wyższego, pojawiała się dodatnia luka wieku mowy. Ujemny wynik oznaczał z kolei profil wyglądający dla algorytmu na młodszy.
I właśnie tutaj pojawiły się najciekawsze zależności. Zdrowi uczestnicy mieli przeciętnie profile mowy bliższe swojemu rzeczywistemu wiekowi, natomiast osoby z zaburzeniami poznawczymi częściej wypadały jako starsze, niż wskazywała metryka.
Nie należy jednak interpretować SAG jak wyniku ciśnienia czy poziomu glukozy. Jest to statystyczny wskaźnik powstały na podstawie wielu cech i odnoszący się do populacji badanej przez naukowców. Wyższy wynik może być interesującym sygnałem badawczym, ale nie mówi samodzielnie, że konkretna osoba choruje albo że jej organizm „zestarzał się” o określoną liczbę lat.
AI znalazła związki między mową a funkcjonowaniem poznawczym
W badaniu uczestniczyły zarówno zdrowe osoby, jak i pacjenci z łagodnymi zaburzeniami poznawczymi, chorobą Alzheimera oraz różnymi postaciami otępienia czołowo-skroniowego. Dzięki temu naukowcy mogli sprawdzić, czy różnice wychwytywane przez model odpowiadają również zmianom obserwowanym w innych badaniach.
Speech age gap różnicował grupy kliniczne. Profile osób z zaburzeniami poznawczymi były przeciętnie oceniane jako starsze niż profile zdrowych uczestników. Różnice były widoczne również pomiędzy wybranymi typami otępienia, szczególnie w odmianach chorób silnie wpływających na mowę i język.
Nie jest to szczególnie zaskakujące z punktu widzenia neurologii. Mówienie wymaga jednoczesnej pracy wielu systemów: pamięci, uwagi, planowania, przetwarzania języka, kontroli motorycznej i oddechu. Zmiany neurologiczne mogą więc pojawiać się w sposobie mówienia znacznie subtelniej, niż jesteśmy w stanie wychwycić podczas zwykłej rozmowy.
To jeden z przykładów szerszego trendu, w którym sztuczna inteligencja w medycynie szuka wzorców niewidocznych bezpośrednio dla człowieka, ale możliwych do znalezienia po przeanalizowaniu tysięcy parametrów jednocześnie.
Głos był powiązany także ze starzeniem mózgu i epigenetyką
Badacze nie zatrzymali się na testach poznawczych. Speech age gap porównywano również z innymi sposobami oceny starzenia organizmu, w tym tzw. zegarami mózgowymi i epigenetycznymi.
W części badanych grup starszy profil mowy był powiązany z obrazem starszego biologicznie mózgu. Zależności występowały przy wskaźnikach obliczanych na podstawie strukturalnych i funkcjonalnych danych o mózgu. Autorzy znaleźli również związki między SAG a wybranymi zegarami epigenetycznymi, czyli metodami wykorzystującymi zmiany molekularne do szacowania biologicznego wieku organizmu.
To istotne, ponieważ oba typy pomiarów wymagają znacznie bardziej skomplikowanych danych niż zwykłe nagranie głosu. Rezonans magnetyczny czy analizy epigenetyczne są kosztowne i wymagają specjalistycznego zaplecza. Nagranie mowy można natomiast wykonać praktycznie wszędzie.
Nie oznacza to oczywiście, że mikrofon może zastąpić rezonans czy badania laboratoryjne. Wyniki sugerują natomiast, że część informacji związanych ze starzeniem może pozostawiać mierzalny ślad również w sposobie, w jaki człowiek mówi. Właśnie ta możliwość jest dla naukowców najbardziej interesująca.
W chorobie Alzheimera pojawił się związek z p-tau217
Jednym z bardziej interesujących wyników było powiązanie speech age gap z p-tau217 u osób z chorobą Alzheimera. To fosforylowana forma białka tau wykorzystywana w badaniach nad zmianami charakterystycznymi dla tej choroby.
U uczestników z Alzheimerem większa luka wieku mowy wiązała się z poziomem tego biomarkera. Nie oznacza to jednak, że analiza głosu może zastąpić badanie krwi albo inne metody stosowane przy diagnostyce.
Znaczenie wyniku jest inne: dwie zupełnie różne klasy danych — sposób mówienia i biomarker biologiczny — wykazywały mierzalną zależność w tej samej grupie pacjentów. To wspiera hipotezę, że zmiany zachodzące w mózgu mogą oddziaływać na mowę na tyle mocno, aby algorytm był w stanie je częściowo wychwycić.
W przyszłości podobne rozwiązania mogłyby znaleźć zastosowanie jako tanie narzędzia przesiewowe wskazujące, kto powinien zostać skierowany na dokładniejsze badania. To jednak dopiero potencjalny kierunek. Autorzy nie przedstawiają speech clock jako narzędzia pozwalającego diagnozować Alzheimera z nagrania głosu.
Cztery minuty nagrania zamiast kosztownego badania?
To właśnie dostępność może okazać się największą zaletą tej technologii. Analiza głosu nie wymaga rezonansu, pobrania krwi ani wizyty w wyspecjalizowanym centrum diagnostycznym. Potrzebne jest przede wszystkim odpowiedniej jakości nagranie i algorytm zdolny je przeanalizować.
Dla badaczy szczególnie istotne było przeprowadzenie projektu w pięciu krajach Ameryki Łacińskiej. Populacje z tego regionu są nadal znacznie słabiej reprezentowane w dużych badaniach nad demencją niż mieszkańcy Stanów Zjednoczonych czy Europy Zachodniej.
Jeżeli podobna metoda okaże się wiarygodna w kolejnych badaniach, mogłaby ułatwić prowadzenie badań przesiewowych i monitorowanie dużych populacji. Nagrania można zbierać znacznie taniej i częściej niż obrazy MRI czy dane molekularne.
To dobrze pokazuje, dlaczego zastosowanie AI w analizie danych medycznych budzi tak duże zainteresowanie. Największa wartość nie zawsze polega na zastąpieniu lekarza. Czasami ważniejsze jest stworzenie prostego narzędzia, które pozwala wcześniej wskazać osoby wymagające dokładniejszej diagnostyki.
Czy AI może już wykryć demencję na podstawie głosu? Nie
Przy takim badaniu bardzo łatwo pójść o krok za daleko. Speech clock nie jest obecnie testem na demencję, Alzheimera ani biologiczny wiek człowieka. Badacze wyraźnie podkreślają, że wyniki wymagają dalszej walidacji.
Jednym z najważniejszych ograniczeń jest przekrojowy charakter projektu. Naukowcy analizowali uczestników w określonym momencie, dlatego nie mogą jeszcze stwierdzić, że osoba z „starszym” profilem mowy ma większe ryzyko rozwoju choroby za pięć czy dziesięć lat.
Do tego potrzebne są badania podłużne, w których te same osoby są obserwowane przez długi czas. Dopiero wtedy będzie można sprawdzić, czy speech age gap rzeczywiście przewiduje przyszłe pogorszenie funkcji poznawczych.
Potrzebna jest również walidacja w innych językach i kulturach oraz podczas bardziej naturalnych rozmów. Sposób mówienia zależy przecież nie tylko od wieku i zdrowia, ale również od języka, miejsca pochodzenia, wykształcenia oraz kontekstu rozmowy. Model kliniczny musi potrafić odróżnić te elementy od zmian rzeczywiście związanych ze zdrowiem.
Czy speech clock mógłby działać także po polsku?
Na podstawie obecnego badania nie można tego założyć. Model powstał na nagraniach hiszpańskojęzycznych uczestników z pięciu krajów Ameryki Łacińskiej, a język jest jednym z głównych elementów analizowanych przez system.
Polski ma inną fonetykę, rytm, strukturę gramatyczną i słownictwo. Różnice pojawiają się nawet pomiędzy odmianami tego samego języka, więc bez osobnego treningu i walidacji algorytm nie powinien być stosowany do polskich nagrań jako narzędzie medyczne.
Nie oznacza to, że sama metoda jest ograniczona do hiszpańskiego. Wręcz przeciwnie — jej zaletą jest to, że podobne modele można potencjalnie budować dla kolejnych populacji. Trzeba jednak zebrać odpowiednie nagrania i dane kliniczne, a następnie sprawdzić, czy wykrywane zależności utrzymują się także w innych warunkach.
Najciekawszym scenariuszem byłoby stworzenie wielu lokalnych wersji speech clock, uwzględniających język i cechy danej populacji. Dopiero wtedy analiza głosu mogłaby stać się naprawdę skalowalnym narzędziem wykorzystywanym w badaniach nad starzeniem na całym świecie.
AI ocenia tempo starzenia na podstawie głosu – podsumowanie i wnioski
Badanie pokazuje, że kilka minut mowy może zawierać zaskakująco dużo informacji o procesach związanych ze starzeniem. Model analizujący ponad 700 cech potrafił oszacować wiek uczestników, a różnica między tym wynikiem i wiekiem rzeczywistym była powiązana z funkcjonowaniem poznawczym, wybranymi wskaźnikami starzenia mózgu, epigenetyką oraz biomarkerami.
Największy potencjał speech clock wynika z prostoty. Głos można nagrać szybko, tanio i praktycznie wszędzie. Jeśli wyniki zostaną potwierdzone w kolejnych badaniach, taka analiza mogłaby kiedyś uzupełniać znacznie droższe narzędzia wykorzystywane do oceny zdrowia mózgu.
Jednocześnie granica między interesującym biomarkerem badawczym a rzeczywistym testem klinicznym jest tutaj bardzo wyraźna. Speech age gap pokazuje korelacje. Nie pozwala dziś z nagrania przewidzieć, kto zachoruje na demencję ani określić dokładnego „wieku biologicznego” konkretnego człowieka.
Najbliższe lata pokażą, czy zależności utrzymają się w badaniach podłużnych, innych językach i większych populacjach. Jeśli tak się stanie, zwykła rozmowa może dostarczać medycynie informacji, których do tej pory szukano przede wszystkim w rezonansie, testach poznawczych i danych laboratoryjnych.
Źródła: Science Advances, Nature, Trinity College Dublin. Opracowanie własne.
Dziękujemy za przeczytanie artykułu na Techoteka.pl.
Codziennie publikujemy najważniejsze informacje z Polski i ze świata dotyczące technologii, sztucznej inteligencji, nowych rozwiązań cyfrowych oraz trendów technologicznych, które kształtują przyszłość.
Obserwuj nas na Facebooku, aby być na bieżąco z najważniejszymi wydarzeniami ze świata technologii.



