Master's Thesis

Automation of Data Collection for Text to Speech Training

Final Thesis 11.02 MB

Author of thesis: Ing. Michal Luner

Acad. year: 2025/2026

Supervisor: Ing. Jan Brukner

Reviewer: Ing. Igor Szőke, Ph.D.

Abstract:

This thesis aims to develop an automated pipeline for the collection and processing of speech data for training text-to-speech (TTS) systems, specifically focusing on the Czech language, where high-quality datasets are scarce. This work is based on data obtained from Czech YouTube channels. The methodology was as follows: raw audio data was acquired, segmented, and subsequently cleaned within a multi-stage filtering pipeline. The quality of the segments was evaluated using Automatic Speech Recognition (ASR) confidence scores, the DNSMOS metric for assessing acoustic quality, and Language Identification (LID). By processing over 25,000 hours of raw audio recordings through the developed pipeline, a final corpus of approximately 9,746 hours was created. The results prove that the pipeline can effectively filter data to create a robust, multi-speaker dataset that surpasses existing publicly available corpora in scale. The contribution of this thesis is primarily the automated system for dataset creation and filtering, which can be easily adjusted for tasks on different data or applied to other underrepresented languages, as well as several TTS systems trained on both reference datasets and the datasets created by the pipeline.

Keywords:

text-to-speech, speech synthesis, speech corpus creation, data filtering, automatic speech recognition, neural networks

Date of defence

25.06.2026

Result of the defence

Defended (thesis was successfully defended)

znamkaAznamka

Grading

A

Process of defence

Student nejprve prezentoval výsledky, kterých dosáhl v rámci své práce. Komise se poté seznámila s hodnocením vedoucího a posudkem oponenta práce. Student následně odpověděl na otázky oponenta a na další otázky přítomných. Komise se na základě posudku oponenta, hodnocení vedoucího, přednesené prezentace a odpovědí studenta na položené otázky rozhodla práci hodnotit stupněm A.

Topics for thesis defence

  1. Odkud pochází chybovost WER výsledných modelů? Udělejte ještě rychlou analýzu a ukažte zdroj chyb.
  2. Je Vámi upravený dataset čeština?

Language of thesis

English

Faculty

Department

Study programme

Information Technology and Artificial Intelligence (MITAI)

Specialization

Sound, Speech and Natural Language Processing (NSPE)

Composition of Committee

prof. Dr. Ing. Jan Černocký (předseda)
prof. Ing. Hynek Heřmanský, Dr. Eng. (místopředseda)
prof. RNDr. Alexandr Meduna, CSc. (člen)
Ing. Michal Hradiš, Ph.D. (člen)
Ing. František Grézl, Ph.D. (člen)
Ing. Martin Fajčík, Ph.D. (člen)

Supervisor’s report
Ing. Jan Brukner

S prací Michala jsem byl naprosto spokojený, a to ve všech ohledech, od studování literatury až po dosažené výsledky. Oceňuji především jeho samostatnost a připravenost na konzultacích, kde jsme probírali spíše interpretaci dosažených výsledků než směřování další práce. Celkově proto hodnotím práci stupněm A.

Evaluation criteria Verbal classification
Information about assignment

Práce se zabývá zpracováním velkého množství surových audio dat pro následné trénování systému pro syntézu hlasu v češtině, které je také součástí práce. Vzhledem k šíři práce hodnotím zadání jako mírně obtížnější. Dosažené výsledky jsou naprosto uspokojivé v obou částech, jak zpracování dat, tak ve kvalitě natrénovaných systémů.

Activity during solution, consultations, communication

Práce byla dokončena s velkým předstihem před termínem odevzdání, což umožnilo její definitivní obsah i formu v klidu a dostatečně prokonzultovat.

Publication activity, awards

Práce byla prezentována na studentské konferenci Excel@FIT.
Zároveň jsou zveřejněny i natrénované modely pro syntézu hlasu v češtině i dataset samotný, který je, pokud je mi známo, největším datasetem pro danou úlohu v češtině. 
Zveřejněné výstupy mají potenciál sloužit jako užitečný základ pro další výzkum v oblasti české syntézy řeči.

Work with literature

Student si sám dohledával a studoval aktuální zdroje. Případné konkrétní nejasnosti aktivně konzultoval. 

Activity during solution, consultations, communication

Student byl během řešení velmi aktivní. Na pravidelné konzultace byl vždy perfektně připravený. 

Points proposed by supervisor: 95

Grade proposed by supervisor: A

Reviewer’s report
Ing. Igor Szőke, Ph.D.

Celkově se jedná o velmi nadprůměrnou práci, které se široce věnuje syntéze řeči. Studentovi se podařilo vytvořit čistící proces a demonstroval, že takto vyčištěná "divoká" data z YouTube lze použít pro syntézu řeči a dostat velmi dobré výsledky. Negativně hodnotí drobnosti v textu a chybějící hlubší analýzu zdroje chyb. To však nejsou zásadní nedostatky.

Evaluation criteria Verbal classification Points Max. points
The extent to which the requirements of the assignment have been met

Evaluation level: assignment fulfilled

Extent of the technical report

Evaluation level: is within the usual extent

Presentation level of the technical report

Prezentační úroveň práce je na velmi dobré úrovni. Text dobře popisuje odvedenou práci. Z pohledu méně zkušeného čtenáře by bylo vhodné v sekci vysvětlující modely syntézy vkládat do textu více schémat a příkladů. Takto to je hutné shrnutí vědeckých článků a čtenář se může snadno ztratit. Dále bych doporučil dávat obrázky blíže k textu, odkud jsou odkazovány. 2 obrázky utekly o několik stran a to opět stěžuje čtenáři orientaci v textu.

92 100
Formal preparation of a technical report

Práce je psána dobrou angličtinou. Typograficky je bez prohřešků. V textu se vyskytuje jen pár drobných chyb (neexistující reference a překlep).

95 100
Work with literature

Práce je bohatě citována a je vidět, že má student o tématu přehled. Cizí práce je vhodně odlišena jak v textu, tak ve zdrojových kódech.

95 100
Realisation output

Student implementovat vlastní proces pro čištění dat tak, aby byla vhodná pro trénování modelů syntézy řeči. Jednotlivé moduly dobře otestoval a vyhodnotil jejich přínos. Drobné výhrady mám k umístění modulu automatického rozpoznávače řeči, který by mohl být ve zpracování použit dříve a některé další kroky by to pak zjednodušilo. Dále mě chybí hlubší analýza vyhodnocení WER metriky na vygenerované řeči. 4-5% je podle mého názoru hodně a zasloužilo by si podrobnou analýzu o zdroji těchto chyb. V rámci práce vznikly velmi dobré modely pro syntézu češtiny, nástroj a trénovací dataset.

87 100
Usability of results

Výsledky jsou v praxi využitelné a pravděpodobně budou použity dále ve výzkumné skupině zpracování řeči.

The difficulty of the assignment

Evaluation level: moderately difficult assignment

Jedná se průměrně obtížné téma, které dává studentovi dostatečnou volnost pro případná rozšíření.

Topics for thesis defence:
  1. Odkud pochází chybovost WER výsledných modelů? Udělejte ještě rychlou analýzu a ukažte zdroj chyb.
Points proposed by reviewer: 91

Grade proposed by reviewer: A

Responsibility: Mgr. et Mgr. Hana Odstrčilová