Přístupnostní navigace
E-application
Search Search Close
Bachelor's Thesis
Author of thesis: Nikoleta Skypalová
Acad. year: 2025/2026
Supervisor: Ing. Vojtěch Staněk
Reviewer: Ing. Anton Firc, Ph.D.
This thesis designs a parametric spam filter for academic environments that can be adapted to the specific needs of different institutions. The work begins by examining the problem and characteristics of academic spam, and by briefly reviewing filtering approaches based on content, metadata, and machine learning. A dataset of 500 academic spam emails was collected, anonymized, and manually labeled with a risk factor, a type label, and a topic label, and is provided alongside the thesis. Building on this, a multi-stage filtering pipeline was designed and implemented, combining a sender blocklist, a rule-based classifier, binary spam and ham classification, academic versus generic spam classification, and multiclass type and topic classification. The filter routes emails to designated folders based on institution-configurable routing, allowing institutions to define which types and topics of academic email are considered relevant. On the training test split, the spam and ham classifier achieved a precision of 0.97 and a recall of 0.92 with an AUC of 0.996, type classification reached a macro F1 of 0.96, and the academic versus generic spam classifier achieved perfect separation. The full filter pipeline was further evaluated on a test set of 86 emails.
email spam, academic spam, academic emails, spam filtering, machine learning, Naive Bayes, support vector machine (SVM), TF-IDF, parametric filter, text classification, email classification, dataset
Date of defence
18.06.2026
Result of the defence
Defended (thesis was successfully defended)
Grading
C
Process of defence
Studentka nejprve prezentovala výsledky, kterých dosáhla v rámci své práce. Komise se poté seznámila s hodnocením vedoucího a posudkem oponenta práce. Studentka následně odpověděla na otázky oponenta a na další otázky přítomných. Komise se na základě posudku oponenta, hodnocení vedoucího, přednesené prezentace a odpovědí studentky na položené otázky rozhodla práci hodnotit stupněm C.
Topics for thesis defence
Language of thesis
English
Faculty
Fakulta informačních technologií
Department
Department of Intelligent Systems
Study programme
Information Technology (BIT)
Composition of Committee
doc. Ing. Petr Matoušek, Ph.D., M.A. (předseda) doc. Ing. Michal Bidlo, Ph.D. (místopředseda) Ing. Radek Kočí, Ph.D. (člen) Ing. Jan Pluskal, Ph.D. (člen) Ing. František Grézl, Ph.D. (člen)
Supervisor’s reportIng. Vojtěch Staněk
Studentka odvedla velké množství výzkumné i praktické práce jak při návrhu samotného filtru, tak při sbírání a vytváření datové sady. Práce je kvalitní, nadprůměrně zpracovaná a přináší prakticky použitelný výstup v podobě parametrizovatelného filtru pro akademické e-maily. Oceňuji vysokou použitelnost výsledků a poctivé experimentální vyhodnocení včetně diskuse omezení. Kvalita práce je na vysoké úrovni a příjemně se čte. Pozitivně hodnotím zpracování v angličtině. Z těchto důvodů, vytvoření datové sady nad rámec zadání i kvalitu zpracování hodnotím práci stupněm A - výborně a navrhuji práci na některé z možných ocenění.
Jedná se o bakalářskou práci s výzkumným přesahem. Cílem bylo vytvořit personalizovaný spam filtr pro výzkumné a akademické instituce a efektivně filtrovat nevyžádané e-maily. Jedná se o zatím nezkoumanou oblast, proto zadání hodnotím jako obtížnější, neboť vyžadovalo samostatnou výzkumnou činnost v oblastech přesahujících bakalářské studium. Práce splnila všechny body zadání v dobré kvalitě. Nad rámec zadání byla vytvořena anonymizovaná datová sada akademického spamu, která byla následně využita pro návrh a vyhodnocení filtru. Výsledné řešení kombinuje blokování odesílatelů, klasifikaci podle pravidel, strojové učení a konfigurovatelné směrování zpráv podle parametrizovaných potřeb instituce. Dosažené výsledky považuji za velmi dobré; akademický spam byl v testovací sadě detekován velmi přesvědčivě, slabší výsledky se projevily zejména u generického spamu, což je v práci korektně diskutováno.
Studentka pracovala s relevantní odbornou literaturou z oblasti filtrování spamu a metod strojového učení, a to včetně úzké oblasti zahlcení akademickým spamem. Práce vhodně propojuje obecné poznatky o různých přístupech k filtrování spamu s užším a neobvyklým problémem akademického e-mailového spamu.
Studentka k řešení přistupovala aktivně, svoje pokroky vždy dostatečně konzultovala. Velmi oceňuji samostatnost při práci. Do řešení studentka přinášela vlastní nápady a aktivně řešila problémy, na které při řešení narazila, což ve výsledku vedlo k vytvoření nové datové sady nad rámec zadání.
Práce byla vypracována průběžně, její obsah byl dostatečně konzultován, při dokončování byla aktivita vyšší. Definitivní obsah práce byl zaslán k připomínkování v nepříliš velkém předstihu, avšak mé připomínky byly včas zapracovány.
Výsledky práce poslouží jako základ pro budoucí vědeckou publikaci. Vytvořená anonymizovaná datová sada bude spolu s publikací zveřejněna k volnému využití akademickým institucím s potenciálem budoucího rozšíření. Vytvořený filtr můžou akademické instituce včetně FIT VUT v podstatě ihned začít využívat.
Grade proposed by supervisor: A
Reviewer’s reportIng. Anton Firc, Ph.D.
Práce představuje solidní bakalářskou práci s vlastním datasetem a rozumně navrženými experimenty. Studentka odvedla značné množství práce při sběru reálných e-mailů od osob z akademického prostředí, jejich zpracování, analýze a následném experimentálním vyhodnocení. Tento vlastní dataset považuji za hlavní přínos práce a zároveň za část, která přesahuje pouhé splnění základních požadavků zadání.
Na druhou stranu práce obsahuje několik slabších míst, zejména v metodologii anotace datasetu, v diskusi reprezentativnosti dat a v prezentaci výsledků. Výsledky experimentů proto není možné interpretovat zcela bez výhrad. Přesto je metodologický přístup k experimentům většinou dobře zdůvodněný, studentka vhodně pracuje s metrikami, provádí preliminary experimenty, testuje generalizaci a uvědomuje si hlavní limitace svého řešení.
Celkově práci hodnotím jako nadprůměrnou. Přestože vidím více směrů, kde by bylo možné práci zlepšit po metodické i prezentační stránce, oceňuji zejména úsilí spojené se sběrem a zpracováním vlastního datasetu a rozumně provedenou experimentální část. Práci hodnotím stupněm B (82 bodů).
Evaluation level: moderately difficult assignment
Zadání hodnotím jako průměrně obtížné. Studentka se musela seznámit s problematikou spamových e-mailů v akademickém prostředí, navrhnout vhodný dataset a následně realizovat klasifikační systém pro detekci a kategorizaci akademického spamu. Součástí práce bylo také vytvoření vlastního crowdsourced datasetu, což představovalo významnou část práce a současně přineslo řadu praktických omezení.
Práce je psaná v anglickém jazyce, což hodnotím pozitivně. Text je celkově čtivý, používá správnou úroveň abstrakce a velmi dobře vysvětluje related work i motivaci jednotlivých kroků. Oceňuji také kvalitně zpracovanou sekci představující použité metriky v sekci 3.1.
Abstrakt je ale podle mě příliš generický. Formulace typu „práce začíná zkoumáním problému“ čtenáři příliš neřeknou a například zmínka o testování na 86 e-mailech bez dalšího kontextu nepůsobí příliš informativně. Rozšíření abstraktu o konkrétnější výsledky nebo přínosy by práci prospělo.
Introduction je poměrně stručný a prakticky bez referencí. Přestože jde spíše o sumarizační část, očekával bych obsáhlejší uvedení do problematiky a lepší zasazení práce do širšího kontextu.
Background část je naopak zpracována velmi dobře. Informace jsou prezentovány systematicky, jednotlivé části na sebe logicky navazují a text se dobře čte. Škoda jen, že v teoretické části prakticky chybí obrázky nebo diagramy vizualizující diskutované koncepty. Větší množství textu by podobné ilustrace pomohly zpřehlednit.
Výsledková část je místy prezentována poměrně nepřehledně. Například Table 5.4 se čte obtížně a čtenář se ve výsledcích místy ztrácí. Celkově by prezentaci výsledků prospěla větší míra sumarizace a vizualizace.
Formální úprava práce je celkově v pořádku a nemám k ní zásadní připomínky. Negativně vnímám především nekonzistentní řazení citací, například ve formátu [29,20,19], což působí rušivě.
Hlavním přínosem realizační části je vytvoření vlastního datasetu akademického spamu, jeho analýza a následné experimentální ověření několika klasifikačních úloh. Oceňuji, že dataset nebyl pouze převzat z existujících zdrojů, ale vznikl sběrem reálných e-mailů od osob z akademického prostředí. To představuje nezanedbatelné množství práce a zároveň zvyšuje relevanci řešeného problému.
Metodologie tvorby datasetu má však několik slabších míst. Hodnocení e-mailů a jejich kategorizace jsou do značné míry subjektivní a založené na posouzení jedinou osobou. Samotná metodologie anotace navíc není dostatečně popsána — není zcela jasné, jak hodnocení probíhalo, podle jakých pravidel byly e-maily označovány ani proč anotaci prováděla externí osoba místo očekávaných příjemců podobných zpráv. To omezuje interpretovatelnost výsledků.
Pozitivně hodnotím analýzu datasetu a preliminary experimenty, ve kterých probíhá výběr modelů a ověřování, zda postačuje trénování na generickém spamu. Práce vhodně používá metriky a oceňuji také testování generalizace mimo tréninková data. Celkově je experimentální část rozumně navržena a většina rozhodnutí je dobře zdůvodněna.
Některá rozhodnutí by ale zasloužila detailnější diskusi. Například borderline samples jsou klasifikovány výrazně hůře než ostatní třídy, což je vzhledem k jejich malému zastoupení v datasetu očekávatelné. Studentka tento problém identifikuje, ale místo snahy o jeho řešení se rozhoduje tyto případy prakticky ignorovat. Podobně bych byl opatrný při určování topic/domény pouze na základě generických klíčových slov jako „department“ nebo „university“.
Pozitivně hodnotím, že si studentka uvědomuje většinu limitací svého přístupu a explicitně je v práci diskutuje. Celkově proto realizační část považuji za solidní: má jasné metodické slabiny, ale zároveň obsahuje vlastní dataset, rozumné experimenty a prakticky použitelný výstup.
Výsledky práce jsou potenciálně využitelné v akademickém prostředí, zejména jako základ pro filtrování akademického spamu nebo tvorbu specializovaných datasetů. Největším přínosem práce jsou právě vytvořený dataset a návrh metodologie jeho zpracování.
Současně je ale potřeba vzít v úvahu omezenou velikost datasetu a subjektivitu anotace, které limitují zobecnitelnost dosažených výsledků.
Evaluation level: assignment fulfilled
Zadání bylo splněno v požadovaném rozsahu. Hlavním přínosem práce je vytvoření vlastního datasetu akademického spamu, jeho analýza a návrh několika klasifikátorů pro rozlišení spam/ham zpráv, tematické kategorizace a rozlišení akademického a generického spamu. Zbytek systému představuje spíše jednodušší routování a následné nakládání se zprávami, což ale odpovídá rozsahu bakalářské práce.
Pozitivně hodnotím také parametrizaci systému, která zvyšuje jeho použitelnost v různých scénářích nasazení.
Evaluation level: is within the usual extent
Technická zpráva obsahuje přibližně 47 vysázených stran, což odpovídá běžnému rozsahu bakalářské práce.
Práce využívá převážně odborné publikace a relevantní zdroje. Citace jsou v background sekcích používány správně a literatura odpovídá tématu práce.
Současně mi ale chybí detailnější diskuse existujících datasetů spamových e-mailů. Práce sice uvádí, že neexistují datasety specificky zaměřené na akademický spam, ale zcela chybí rozbor běžně používaných spam datasetů a jejich vlastností. Očekával bych alespoň základní analýzu relevantních datasetů a následné převzetí vhodných postupů nebo struktur při návrhu vlastního datasetu.
Grade proposed by reviewer: B
Responsibility: Mgr. et Mgr. Hana Odstrčilová