Master's Thesis

Prediction of brain structural characteristics from speech using acoustic-linguistic biomarkers

Final Thesis 2.71 MB Appendix 211.63 kB

Author of thesis: Ing. Veronika Vengerová

Acad. year: 2025/2026

Supervisor: Ing. Daniel Kováč, Ph.D.

Reviewer: prof. Ing. Jiří Mekyska, Ph.D.

Abstract:

In the past few decades, the number of people diagnosed with neurodegenerative diseases has increased. If digital biomarkers and machine learning algorithms could be used to predict structural brain characteristics, it would significantly reduce the strain on patients. In this thesis, the feasibility of using speech biomarkers to predict the cortical thickness of brain regions is investigated. Acoustic and linguistic features are extracted from recordings of spontaneous speech and their transcriptions. Disvoice library with additional changes was used to extract acoustic features. For linguistic features, the Part-of-speech tagging from the stanza toolkit was used. For the non-interpretable features, the semantic vectors were extracted from different layers of the BERT and CzeGPT-2 models. Three types of models were tested: models trained on interpretable features only, models trained on non-interpretable features only, and models trained on both interpretable and non-interpretable features using early or late fusion. Neural networks, linear regression, and XGBoost were the architectures tested in this thesis. To evaluate the best models, Stratified K-Fold cross-validation was used. After the initial results, the best-performing models were then tested using Leave-one-out cross-validation on five brain regions. Among the evaluated regions, the models achieved the best results when predicting the insula in both the left and right hemispheres. The best results for the early fusion model were achieved using an XGBoost regressor trained on selected principal component analysis-derived features from the 12th layer of the CzeGPT-2 model, interpretable biomarkers, and demographic features including age, education, and gender. This model achieved a mean percentage error (MAPE) of 0.0403, R-squared (R2) of 0.1105, and estimation error rate (EER) of 0.1188. For late fusion, the models did not outperform those trained only on interpretable features. The best results were achieved by a model trained using a selection of interpretable features, age, and education, with MAPE of 0.0383, R2 of 0.1444, and EER of 0.0991.

Keywords:

MCI, interpretable features, speech biomarkers, semantic vectors, fusion, cortical thickness, regression

Date of defence

16.06.2026

Result of the defence

Defended (thesis was successfully defended)

znamkaAznamka

Grading

A

Process of defence

Studentka prezentovala výsledky své práce a komise byla seznámena s posudky. Ing. Jakubíček, Ph.D. položil otázku: Jaká byla vstupní data analýzy? Jakou výpočetní infrastrukturu jste využívala? Jak dlouho trvala inference jednoho záznamu? Jaké hyperparametry jste optimalizovala? Optimalizovala jste i učící parametry modelů? Jaký je primární závěr vaší práce? Jaký přínos by mohl být pro pacienta? Neinterpretovatelné příznaky jsou často lepší než interpretovatelné, proč je to zde naopak? Ing. Lázňovský, Ph.D. položil otázku: Zvažovala jste využití optimalizačního nástroje? Využila jste výsledky z Optuny? Lze výsledky vztáhnout přímo ke konkrétní diagnóze? Studentka obhájila diplomovou práci a odpověděla na otázky členů komise a oponenta.

Language of thesis

English

Faculty

Department

Study programme

Bioengineering (MPC-BIO)

Composition of Committee

prof. Ing. Martin Augustynek, Ph.D. (předseda)
Ing. Roman Jakubíček, Ph.D. (místopředseda)
Ing. Martin Králík (člen)
Ing. Jakub Lázňovský, Ph.D. (člen)
Ing. Petra Nemčeková (člen)

Supervisor’s report
Ing. Daniel Kováč, Ph.D.

Práce je zpracována na velmi dobré odborné úrovni a je logicky strukturovaná. Studentka prokázala schopnost rychle se v problematice zorientovat a samostatně navrhnout řešení. Během zpracování pracovala velmi aktivně, pravidelně konzultovala a přicházela s vlastními nápady. Stanovené cíle práce považuji za splněné v plném rozsahu.

Velmi pozitivně hodnotím praktickou část, kde studentka samostatně navrhla a implementovala celý postup od přípravy dat přes návrh a extrakci vlastních akustických a lingvistických parametrů a tvorbu neinterpretovatelných reprezentací až po návrh, trénování a vyhodnocení regresních modelů. Oceňuji porovnání více přístupů, zahrnutí časné i pozdní fúze a také sestavení vlastní architektury neuronové sítě. Výsledky jsou prezentovány přehledně a doplněny diskusí včetně identifikace limitací, což zvyšuje důvěryhodnost práce i její využitelnost jako základu pro další navazující výzkum.

Rozsah textové části práce odpovídá doporučenému rozmezí, přičemž vyšší celkový rozsah je dán zejména přítomností bibliografie a příloh. Formální zpracování je na dobré úrovni, nicméně jazyková a stylistická úroveň anglického textu je místy slabší a některé formulace by bylo vhodné zpřesnit a sjednotit. Práci s literaturou hodnotím jako velmi dobrou, rešerše je dostatečně široká a vhodně navazuje na zvolenou metodiku i interpretaci výsledků. Výsledky práce jsou využitelné, zejména jako reprodukovatelný základ a referenční srovnání přístupů pro další rozšíření a validaci.

Celkově práci hodnotím výborně (97 bodů, A). Points proposed by supervisor: 97

Grade proposed by supervisor: A

Diplomová práce se věnuje aktuálnímu a dosud poměrně málo adresovanému tématu predikce strukturálních charakteristik mozku z řeči pomocí akusticko-lingvistických biomarkerů. Studentka naplnila všechny cíle zadání a odvedla velmi rozsáhlou a odborně kvalitní práci, která zahrnovala přípravu datasetu, extrakci interpretovatelných i neinterpretovatelných příznaků, statistickou analýzu i návrh a evaluaci pokročilých modelů strojového učení. Rozsah práce je adekvátní diplomové práci a studentka hojně pracovala se zahraniční odbornou literaturou. Pozitivně hodnotím také skutečnost, že práce řeší problematiku s potenciálně významným dopadem v neurologii, protože získávání spolehlivých diagnóz prodromálních fází neurodegenerativních onemocnění je obecně velmi obtížné a současným trendem je proto využívání objektivních dat z MRI pro trénování predikčních modelů. Slabší stránkou práce je formální a jazyková úroveň technické zprávy. V textu se objevuje větší množství jazykových nepřesností a stylistických chyb v angličtině, drobné typografické nedostatky (např. umístění názvů tabulek pod tabulkami) a přiložené zdrojové kódy nejsou vždy dostatečně popsány. I přes uvedené výhrady považuji práci za velmi kvalitní. Topics for thesis defence:
  1. Ve výsledcích se jako nejlépe predikovatelné oblasti ukázala insula. Jak si tento výsledek klinicky interpretujete?
  2. V práci používáte early i late fusion. Ve kterých situacích by podle Vás mohl být jeden z těchto přístupů vhodnější než druhý?
Points proposed by reviewer: 91

Grade proposed by reviewer: A

Responsibility: Mgr. et Mgr. Hana Odstrčilová