Přístupnostní navigace
E-application
Search Search Close
Bachelor's Thesis
Author of thesis: Bc. Adrián Perniš
Acad. year: 2025/2026
Supervisor: Ing. Jaroslav Rozman, Ph.D.
Reviewer: doc. Ing. František Zbořil, Ph.D.
This bachelor's thesis focuses on the comparison of large language models and traditional semantic analysis libraries for processing historical parish records. The aim of the thesis was to design and implement a~system capable of processing OCR-generated text from historical parish books and automatically extracting genealogical data suitable for storage in the DEMoS database system
parish books, semantic analysis, natural language processing, NLP, large language models, LLM, ChatGPT, OCR, named entity recognition, NER, genealogical data, DEMoS, information extraction
Date of defence
15.06.2026
Result of the defence
Defended (thesis was successfully defended)
Grading
D
Process of defence
Student nejprve prezentoval výsledky, kterých dosáhl v rámci své práce. Komise se poté seznámila s hodnocením vedoucího a posudkem oponenta práce. Student následně odpověděl na otázky oponenta a na další otázky přítomných. Komise se na základě posudku oponenta, hodnocení vedoucího, přednesené prezentace a odpovědí studenta na položené otázky rozhodla práci hodnotit stupněm D.
Topics for thesis defence
Language of thesis
Slovak
Faculty
Fakulta informačních technologií
Department
Department of Intelligent Systems
Study programme
Information Technology (BIT)
Composition of Committee
prof. Ing. Adam Herout, Ph.D. (předseda) doc. Mgr. Adam Rogalewicz, Ph.D. (místopředseda) Ing. Vladimír Bartík, Ph.D. (člen) Ing. Michal Hradiš, Ph.D. (člen) Ing. Josef Strnadel, Ph.D. (člen)
Supervisor’s reportIng. Jaroslav Rozman, Ph.D.
Podle studentovy prezentace je práce fuknční, ale z mého pohledu by potřebovala větší otestování a hlavně zakomponování do systému DEMoS, což se zatím nestalo. Z těchto důvodů hodnotím stupněm C, ale na spodní hranici.
Cílem práce bylo vytvořit systém pro analýzu textu v matrikách a automatické přiřazení extrahovaných slov (jmen, povolání, nemocí, atd.) do odpovídajících tabulek v databázi. Jedná se o pokračování práce z minulého roku. S výsledkem jsem spokojen.
Studentovi byla poskytnuta základní literatura, zbytek si aktivně obstarával sám.
Student byl aktivní spíše podprůměrně.
Finální verze práce konzultována v podstatě nebyla.
-
Grade proposed by supervisor: C
Reviewer’s reportdoc. Ing. František Zbořil, Ph.D.
Při hodnocení jsem vycházel jednak z kvality textové části, která je průměrná, jednak z kvality aplikace, jež mohla být zpracována lépe. Zásadní výtku mám však k chybějícímu popisu toho, jak byl výsledek propojen se systémem DEMoS. Pokud student u obhajoby prokáže, že i tento bod zadání byl splněn, navrhuji hodnocení stupněm D.
Evaluation level: moderately difficult assignment
Zadání bakalářské práce považuji za průměrně obtížné. Úkolem studenta bylo využít existující nástroje k sémantickému zpracování matričních záznamů, propojit výsledné řešení se systémem DEMoS a následně provést vyhodnocení úspěšnosti celého procesu.
Výhrady mám ke struktuře a logickému členění kapitol. Druhá kapitola se věnuje teoretickému rozboru, kde autor kombinuje historický kontext matrik, systém DEMoS, velké jazykové modely a zpracování přirozeného jazyka. Hierarchie podkapitol by ale měla být logičtější. Témata jako LLM a fine-tuning jsou uvedeny jako samostatné podkapitoly první úrovně, ačkoliv by bylo vhodnější zařadit je jako podkapitoly nižší úrovně pod obecnější technologický základ. Metodologicky nesprávné je také řazení, kdy autor představuje konkrétní komerční API dříve než samotný obecný princip velkých jazykových modelů. Další výhrady mám k popisu vlastní práce studenta, který je příliš obecný. Z textu sice plyne, že s využitím různých jazykových modelů a nástrojů zpracovával data z OCR, ale chybí konkrétní specifikace vstupního i výstupního datového formátu a také popis toho, jak se výsledky předávají do systému DEMoS. Zásadní nedostatek spatřuji ve vyhodnocení výsledků. Evaluace využívá metriky Precision, Recall a F1, ale v textu chybí vysvětlení, jak byly v tomto kontextu konkrétně aplikovány. Tyto metriky se primárně používají u binární klasifikace a z práce není jasné, jakým způsobem se posuzovala shoda výsledné komplexní struktury matričního záznamu vůči ground truth. Další výtky směřuji k chybějícímu vysvětlení některých metod. Například Jaro-Winklerova metrika by si zasloužila bližší představení a totéž platí pro definici pravidel při sémantické analýze. Tato pravidla jsou v práci spíše šablonou pro předpokládanou strukturu záznamu a čtenář musí jejich přesný význam z uvedeného kódu pouze domýšlet.
Text je psán slovensky a je na dobré jazykové úrovni, bez zjevných prohřešků. Určité nedostatky však vidím v grafické prezentaci. Některé převzaté obrázky (konkrétně 2.4 až 2.7) jsou sice vizuálně výrazné, ale pro účely odborného textu tohoto typu by byla vhodnější střídmější forma. Stejně tak vkládání zdrojového kódu přímo do textu za účelem popisu pravidel nebo datového modelu (například na straně 32) nepovažuji za nejvhodnější způsob prezentace; tyto koncepty by bylo lepší popsat schématem nebo strukturovaným textem.
Realizační výstup měl podle zadání umožnit zpracování záznamů získaných OCR metodou z matričních knih a sémanticky strukturovaná data předat do systému DEMoS. V sučasném stavu však aplikace, jak se zdá, umožňuje pouze vyhodnocení přesnosti zpracování. Proto hodnotím tento bod jako podprůměrný.
Výsledky práce mají praktické využití. Student ukázal, jak si současné jazykové modely a nástroje sémantické analýzy dokážou poradit se záznamy z historických matrik. Pokud budou tyto postupy integrovány do systému DEMoS, mohou pomoci s automatickým zpracováním matričních záznamů.
Evaluation level: assignment fulfilled with major reservations
Zadání nylo ve své podstatě splněno. Použití více prostředků, jak jazykových modelů, tak systémů pro sémantickou analýzu, je v pořádku. V zadání je však explicitně uvedeno, že by systém měl být zakomponován do systému DEMoS, o čemž v textu není žádná zmínka. Předpokládám, že vzniklé struktury nejsou příliš obtížně přenositelné do tohoto systému, ale tento krok měl student v práci jasně uvést a popsat.
Evaluation level: is within the usual extent
Student v práci uvádí celkem 22 zdrojů. Ty jsou zvoleny vhodně k tématu a v textu řádně citovány. Nezjistil jsem žádné prohřešky proti citační etice. Vlastní přínos studenta je v práci patrný a zřetelně oddělený od teoretické části.
Grade proposed by reviewer: D
Responsibility: Mgr. et Mgr. Hana Odstrčilová