Přístupnostní navigace
E-application
Search Search Close
Master's Thesis
Author of thesis: Ing. Michal Luner
Acad. year: 2025/2026
Supervisor: Ing. Jan Brukner
Reviewer: Ing. Igor Szőke, Ph.D.
This thesis aims to develop an automated pipeline for the collection and processing of speech data for training text-to-speech (TTS) systems, specifically focusing on the Czech language, where high-quality datasets are scarce. This work is based on data obtained from Czech YouTube channels. The methodology was as follows: raw audio data was acquired, segmented, and subsequently cleaned within a multi-stage filtering pipeline. The quality of the segments was evaluated using Automatic Speech Recognition (ASR) confidence scores, the DNSMOS metric for assessing acoustic quality, and Language Identification (LID). By processing over 25,000 hours of raw audio recordings through the developed pipeline, a final corpus of approximately 9,746 hours was created. The results prove that the pipeline can effectively filter data to create a robust, multi-speaker dataset that surpasses existing publicly available corpora in scale. The contribution of this thesis is primarily the automated system for dataset creation and filtering, which can be easily adjusted for tasks on different data or applied to other underrepresented languages, as well as several TTS systems trained on both reference datasets and the datasets created by the pipeline.
text-to-speech, speech synthesis, speech corpus creation, data filtering, automatic speech recognition, neural networks
Date of defence
25.06.2026
Result of the defence
Defended (thesis was successfully defended)
Grading
A
Process of defence
Student nejprve prezentoval výsledky, kterých dosáhl v rámci své práce. Komise se poté seznámila s hodnocením vedoucího a posudkem oponenta práce. Student následně odpověděl na otázky oponenta a na další otázky přítomných. Komise se na základě posudku oponenta, hodnocení vedoucího, přednesené prezentace a odpovědí studenta na položené otázky rozhodla práci hodnotit stupněm A.
Topics for thesis defence
Language of thesis
English
Faculty
Fakulta informačních technologií
Department
Department of Computer Graphics and Multimedia
Study programme
Information Technology and Artificial Intelligence (MITAI)
Specialization
Sound, Speech and Natural Language Processing (NSPE)
Composition of Committee
prof. Dr. Ing. Jan Černocký (předseda) prof. Ing. Hynek Heřmanský, Dr. Eng. (místopředseda) prof. RNDr. Alexandr Meduna, CSc. (člen) Ing. Michal Hradiš, Ph.D. (člen) Ing. František Grézl, Ph.D. (člen) Ing. Martin Fajčík, Ph.D. (člen)
Supervisor’s reportIng. Jan Brukner
S prací Michala jsem byl naprosto spokojený, a to ve všech ohledech, od studování literatury až po dosažené výsledky. Oceňuji především jeho samostatnost a připravenost na konzultacích, kde jsme probírali spíše interpretaci dosažených výsledků než směřování další práce. Celkově proto hodnotím práci stupněm A.
Práce se zabývá zpracováním velkého množství surových audio dat pro následné trénování systému pro syntézu hlasu v češtině, které je také součástí práce. Vzhledem k šíři práce hodnotím zadání jako mírně obtížnější. Dosažené výsledky jsou naprosto uspokojivé v obou částech, jak zpracování dat, tak ve kvalitě natrénovaných systémů.
Práce byla dokončena s velkým předstihem před termínem odevzdání, což umožnilo její definitivní obsah i formu v klidu a dostatečně prokonzultovat.
Práce byla prezentována na studentské konferenci Excel@FIT.Zároveň jsou zveřejněny i natrénované modely pro syntézu hlasu v češtině i dataset samotný, který je, pokud je mi známo, největším datasetem pro danou úlohu v češtině. Zveřejněné výstupy mají potenciál sloužit jako užitečný základ pro další výzkum v oblasti české syntézy řeči.
Student si sám dohledával a studoval aktuální zdroje. Případné konkrétní nejasnosti aktivně konzultoval.
Student byl během řešení velmi aktivní. Na pravidelné konzultace byl vždy perfektně připravený.
Grade proposed by supervisor: A
Reviewer’s reportIng. Igor Szőke, Ph.D.
Celkově se jedná o velmi nadprůměrnou práci, které se široce věnuje syntéze řeči. Studentovi se podařilo vytvořit čistící proces a demonstroval, že takto vyčištěná "divoká" data z YouTube lze použít pro syntézu řeči a dostat velmi dobré výsledky. Negativně hodnotí drobnosti v textu a chybějící hlubší analýzu zdroje chyb. To však nejsou zásadní nedostatky.
Evaluation level: assignment fulfilled
Evaluation level: is within the usual extent
Prezentační úroveň práce je na velmi dobré úrovni. Text dobře popisuje odvedenou práci. Z pohledu méně zkušeného čtenáře by bylo vhodné v sekci vysvětlující modely syntézy vkládat do textu více schémat a příkladů. Takto to je hutné shrnutí vědeckých článků a čtenář se může snadno ztratit. Dále bych doporučil dávat obrázky blíže k textu, odkud jsou odkazovány. 2 obrázky utekly o několik stran a to opět stěžuje čtenáři orientaci v textu.
Práce je psána dobrou angličtinou. Typograficky je bez prohřešků. V textu se vyskytuje jen pár drobných chyb (neexistující reference a překlep).
Práce je bohatě citována a je vidět, že má student o tématu přehled. Cizí práce je vhodně odlišena jak v textu, tak ve zdrojových kódech.
Student implementovat vlastní proces pro čištění dat tak, aby byla vhodná pro trénování modelů syntézy řeči. Jednotlivé moduly dobře otestoval a vyhodnotil jejich přínos. Drobné výhrady mám k umístění modulu automatického rozpoznávače řeči, který by mohl být ve zpracování použit dříve a některé další kroky by to pak zjednodušilo. Dále mě chybí hlubší analýza vyhodnocení WER metriky na vygenerované řeči. 4-5% je podle mého názoru hodně a zasloužilo by si podrobnou analýzu o zdroji těchto chyb. V rámci práce vznikly velmi dobré modely pro syntézu češtiny, nástroj a trénovací dataset.
Výsledky jsou v praxi využitelné a pravděpodobně budou použity dále ve výzkumné skupině zpracování řeči.
Evaluation level: moderately difficult assignment
Jedná se průměrně obtížné téma, které dává studentovi dostatečnou volnost pro případná rozšíření.
Grade proposed by reviewer: A
Responsibility: Mgr. et Mgr. Hana Odstrčilová