Bachelor's Thesis

Parametric Spam Filter for Academic Emails with Review Support

Final Thesis 2.36 MB

Author of thesis: Nikoleta Skypalová

Acad. year: 2025/2026

Supervisor: Ing. Vojtěch Staněk

Reviewer: Ing. Anton Firc, Ph.D.

Abstract:

This thesis designs a parametric spam filter for academic environments that can be adapted to the specific needs of different institutions. The work begins by examining the problem and characteristics of academic spam, and by briefly reviewing filtering approaches based on content, metadata, and machine learning. A dataset of 500 academic spam emails was collected, anonymized, and manually labeled with a risk factor, a type label, and a topic label, and is provided alongside the thesis. Building on this, a multi-stage filtering pipeline was designed and implemented, combining a sender blocklist, a rule-based classifier, binary spam and ham classification, academic versus generic spam classification, and multiclass type and topic classification. The filter routes emails to designated folders based on institution-configurable routing, allowing institutions to define which types and topics of academic email are considered relevant. On the training test split, the spam and ham classifier achieved a precision of 0.97 and a recall of 0.92 with an AUC of 0.996, type classification reached a macro F1 of 0.96, and the academic versus generic spam classifier achieved perfect separation. The full filter pipeline was further evaluated on a test set of 86 emails.

Keywords:

email spam, academic spam, academic emails, spam filtering, machine learning, Naive Bayes, support vector machine (SVM), TF-IDF, parametric filter, text classification, email classification, dataset

Date of defence

18.06.2026

Result of the defence

Defended (thesis was successfully defended)

znamkaCznamka

Grading

C

Process of defence

Studentka nejprve prezentovala výsledky, kterých dosáhla v rámci své práce. Komise se poté seznámila s hodnocením vedoucího a posudkem oponenta práce. Studentka následně odpověděla na otázky oponenta a na další otázky přítomných. Komise se na základě posudku oponenta, hodnocení vedoucího, přednesené prezentace a odpovědí studentky na položené otázky rozhodla práci hodnotit stupněm C.

Topics for thesis defence

  1. Jaké existující datasety spamových e-mailů považujete za nejrelevantnější vzhledem k Vašemu datasetu a jaké jsou mezi nimi hlavní rozdíly a společné vlastnosti?
  2. Z kolika různých zdrojů nebo uživatelů byly crowdsourced e-maily získány a nakolik dataset reprezentuje reálný akademický spam?
  3. Jakým způsobem probíhala anotace datasetu a proč byl zvolen pouze jeden anotátor? Uvažovala jste například využití více anotátorů nebo consensus anotace?
  4. Jaký rozhodovací práh používají Vaše binární klasifikátory a proč byl zvolen právě tento? Uvažovala jste o kalibraci rozhodovacích práhů (thresholdů) například na základě ROC křivek?
  5. Jaké prvky z e-mailu extrahujete jako vstup vašeho klasifikátoru? Porovnávala jste vaši metodu s klasickými filtry spamu?

Language of thesis

English

Faculty

Department

Study programme

Information Technology (BIT)

Composition of Committee

doc. Ing. Petr Matoušek, Ph.D., M.A. (předseda)
doc. Ing. Michal Bidlo, Ph.D. (místopředseda)
Ing. Radek Kočí, Ph.D. (člen)
Ing. Jan Pluskal, Ph.D. (člen)
Ing. František Grézl, Ph.D. (člen)

Supervisor’s report
Ing. Vojtěch Staněk

Studentka odvedla velké množství výzkumné i praktické práce jak při návrhu samotného filtru, tak při sbírání a vytváření datové sady. Práce je kvalitní, nadprůměrně zpracovaná a přináší prakticky použitelný výstup v podobě parametrizovatelného filtru pro akademické e-maily. Oceňuji vysokou použitelnost výsledků a poctivé experimentální vyhodnocení včetně diskuse omezení. Kvalita práce je na vysoké úrovni a příjemně se čte. Pozitivně hodnotím zpracování v angličtině. Z těchto důvodů, vytvoření datové sady nad rámec zadání i kvalitu zpracování hodnotím práci stupněm A - výborně a navrhuji práci na některé z možných ocenění.

Evaluation criteria Verbal classification
Information about assignment

Jedná se o bakalářskou práci s výzkumným přesahem. Cílem bylo vytvořit personalizovaný spam filtr pro výzkumné a akademické instituce a efektivně filtrovat nevyžádané e-maily. Jedná se o zatím nezkoumanou oblast, proto zadání hodnotím jako obtížnější, neboť vyžadovalo samostatnou výzkumnou činnost v oblastech přesahujících bakalářské studium. Práce splnila všechny body zadání v dobré kvalitě. Nad rámec zadání byla vytvořena anonymizovaná datová sada akademického spamu, která byla následně využita pro návrh a vyhodnocení filtru. Výsledné řešení kombinuje blokování odesílatelů, klasifikaci podle pravidel, strojové učení a konfigurovatelné směrování zpráv podle parametrizovaných potřeb instituce. Dosažené výsledky považuji za velmi dobré; akademický spam byl v testovací sadě detekován velmi přesvědčivě, slabší výsledky se projevily zejména u generického spamu, což je v práci korektně diskutováno.

Work with literature

Studentka pracovala s relevantní odbornou literaturou z oblasti filtrování spamu a metod strojového učení, a to včetně úzké oblasti zahlcení akademickým spamem. Práce vhodně propojuje obecné poznatky o různých přístupech k filtrování spamu s užším a neobvyklým problémem akademického e-mailového spamu.

Activity during solution, consultations, communication

Studentka k řešení přistupovala aktivně, svoje pokroky vždy dostatečně konzultovala. Velmi oceňuji samostatnost při práci. Do řešení studentka přinášela vlastní nápady a aktivně řešila problémy, na které při řešení narazila, což ve výsledku vedlo k vytvoření nové datové sady nad rámec zadání.

Activity during completion

Práce byla vypracována průběžně, její obsah byl dostatečně konzultován, při dokončování byla aktivita vyšší. Definitivní obsah práce byl zaslán k připomínkování v nepříliš velkém předstihu, avšak mé připomínky byly včas zapracovány.

Publication activity, awards

Výsledky práce poslouží jako základ pro budoucí vědeckou publikaci. Vytvořená anonymizovaná datová sada bude spolu s publikací zveřejněna k volnému využití akademickým institucím s potenciálem budoucího rozšíření. Vytvořený filtr můžou akademické instituce včetně FIT VUT v podstatě ihned začít využívat.

Points proposed by supervisor: 95

Grade proposed by supervisor: A

Reviewer’s report
Ing. Anton Firc, Ph.D.

Práce představuje solidní bakalářskou práci s vlastním datasetem a rozumně navrženými experimenty. Studentka odvedla značné množství práce při sběru reálných e-mailů od osob z akademického prostředí, jejich zpracování, analýze a následném experimentálním vyhodnocení. Tento vlastní dataset považuji za hlavní přínos práce a zároveň za část, která přesahuje pouhé splnění základních požadavků zadání.


Na druhou stranu práce obsahuje několik slabších míst, zejména v metodologii anotace datasetu, v diskusi reprezentativnosti dat a v prezentaci výsledků. Výsledky experimentů proto není možné interpretovat zcela bez výhrad. Přesto je metodologický přístup k experimentům většinou dobře zdůvodněný, studentka vhodně pracuje s metrikami, provádí preliminary experimenty, testuje generalizaci a uvědomuje si hlavní limitace svého řešení.


Celkově práci hodnotím jako nadprůměrnou. Přestože vidím více směrů, kde by bylo možné práci zlepšit po metodické i prezentační stránce, oceňuji zejména úsilí spojené se sběrem a zpracováním vlastního datasetu a rozumně provedenou experimentální část. Práci hodnotím stupněm B (82 bodů).

Evaluation criteria Verbal classification Points
The difficulty of the assignment

Evaluation level: moderately difficult assignment

Zadání hodnotím jako průměrně obtížné. Studentka se musela seznámit s problematikou spamových e-mailů v akademickém prostředí, navrhnout vhodný dataset a následně realizovat klasifikační systém pro detekci a kategorizaci akademického spamu. Součástí práce bylo také vytvoření vlastního crowdsourced datasetu, což představovalo významnou část práce a současně přineslo řadu praktických omezení.

Presentation level of the technical report

Práce je psaná v anglickém jazyce, což hodnotím pozitivně. Text je celkově čtivý, používá správnou úroveň abstrakce a velmi dobře vysvětluje related work i motivaci jednotlivých kroků. Oceňuji také kvalitně zpracovanou sekci představující použité metriky v sekci 3.1.

Abstrakt je ale podle mě příliš generický. Formulace typu „práce začíná zkoumáním problému“ čtenáři příliš neřeknou a například zmínka o testování na 86 e-mailech bez dalšího kontextu nepůsobí příliš informativně. Rozšíření abstraktu o konkrétnější výsledky nebo přínosy by práci prospělo.

Introduction je poměrně stručný a prakticky bez referencí. Přestože jde spíše o sumarizační část, očekával bych obsáhlejší uvedení do problematiky a lepší zasazení práce do širšího kontextu.

Background část je naopak zpracována velmi dobře. Informace jsou prezentovány systematicky, jednotlivé části na sebe logicky navazují a text se dobře čte. Škoda jen, že v teoretické části prakticky chybí obrázky nebo diagramy vizualizující diskutované koncepty. Větší množství textu by podobné ilustrace pomohly zpřehlednit.

Výsledková část je místy prezentována poměrně nepřehledně. Například Table 5.4 se čte obtížně a čtenář se ve výsledcích místy ztrácí. Celkově by prezentaci výsledků prospěla větší míra sumarizace a vizualizace.

75
Formal preparation of a technical report

Formální úprava práce je celkově v pořádku a nemám k ní zásadní připomínky. Negativně vnímám především nekonzistentní řazení citací, například ve formátu [29,20,19], což působí rušivě.

85
Realisation output

Hlavním přínosem realizační části je vytvoření vlastního datasetu akademického spamu, jeho analýza a následné experimentální ověření několika klasifikačních úloh. Oceňuji, že dataset nebyl pouze převzat z existujících zdrojů, ale vznikl sběrem reálných e-mailů od osob z akademického prostředí. To představuje nezanedbatelné množství práce a zároveň zvyšuje relevanci řešeného problému.

Metodologie tvorby datasetu má však několik slabších míst. Hodnocení e-mailů a jejich kategorizace jsou do značné míry subjektivní a založené na posouzení jedinou osobou. Samotná metodologie anotace navíc není dostatečně popsána — není zcela jasné, jak hodnocení probíhalo, podle jakých pravidel byly e-maily označovány ani proč anotaci prováděla externí osoba místo očekávaných příjemců podobných zpráv. To omezuje interpretovatelnost výsledků.

Pozitivně hodnotím analýzu datasetu a preliminary experimenty, ve kterých probíhá výběr modelů a ověřování, zda postačuje trénování na generickém spamu. Práce vhodně používá metriky a oceňuji také testování generalizace mimo tréninková data. Celkově je experimentální část rozumně navržena a většina rozhodnutí je dobře zdůvodněna.

Některá rozhodnutí by ale zasloužila detailnější diskusi. Například borderline samples jsou klasifikovány výrazně hůře než ostatní třídy, což je vzhledem k jejich malému zastoupení v datasetu očekávatelné. Studentka tento problém identifikuje, ale místo snahy o jeho řešení se rozhoduje tyto případy prakticky ignorovat. Podobně bych byl opatrný při určování topic/domény pouze na základě generických klíčových slov jako „department“ nebo „university“.

Pozitivně hodnotím, že si studentka uvědomuje většinu limitací svého přístupu a explicitně je v práci diskutuje. Celkově proto realizační část považuji za solidní: má jasné metodické slabiny, ale zároveň obsahuje vlastní dataset, rozumné experimenty a prakticky použitelný výstup.

75
Usability of results

Výsledky práce jsou potenciálně využitelné v akademickém prostředí, zejména jako základ pro filtrování akademického spamu nebo tvorbu specializovaných datasetů. Největším přínosem práce jsou právě vytvořený dataset a návrh metodologie jeho zpracování.

Současně je ale potřeba vzít v úvahu omezenou velikost datasetu a subjektivitu anotace, které limitují zobecnitelnost dosažených výsledků.

The extent to which the requirements of the assignment have been met

Evaluation level: assignment fulfilled

Zadání bylo splněno v požadovaném rozsahu. Hlavním přínosem práce je vytvoření vlastního datasetu akademického spamu, jeho analýza a návrh několika klasifikátorů pro rozlišení spam/ham zpráv, tematické kategorizace a rozlišení akademického a generického spamu. Zbytek systému představuje spíše jednodušší routování a následné nakládání se zprávami, což ale odpovídá rozsahu bakalářské práce.

Pozitivně hodnotím také parametrizaci systému, která zvyšuje jeho použitelnost v různých scénářích nasazení.

Extent of the technical report

Evaluation level: is within the usual extent

Technická zpráva obsahuje přibližně 47 vysázených stran, což odpovídá běžnému rozsahu bakalářské práce.

Work with literature

Práce využívá převážně odborné publikace a relevantní zdroje. Citace jsou v background sekcích používány správně a literatura odpovídá tématu práce.

Současně mi ale chybí detailnější diskuse existujících datasetů spamových e-mailů. Práce sice uvádí, že neexistují datasety specificky zaměřené na akademický spam, ale zcela chybí rozbor běžně používaných spam datasetů a jejich vlastností. Očekával bych alespoň základní analýzu relevantních datasetů a následné převzetí vhodných postupů nebo struktur při návrhu vlastního datasetu.

75
Topics for thesis defence:
  1. Jaké existující datasety spamových e-mailů považujete za nejrelevantnější vzhledem k Vašemu datasetu a jaké jsou mezi nimi hlavní rozdíly a společné vlastnosti?
  2. Jaký rozhodovací práh používají Vaše binární klasifikátory a proč byl zvolen právě tento? Uvažovala jste o kalibraci rozhodovacích práhů (thresholdů) například na základě ROC křivek?
  3. Z kolika různých zdrojů nebo uživatelů byly crowdsourced e-maily získány a nakolik dataset reprezentuje reálný akademický spam?
  4. Jakým způsobem probíhala anotace datasetu a proč byl zvolen pouze jeden anotátor? Uvažovala jste například využití více anotátorů nebo consensus anotace?
Points proposed by reviewer: 82

Grade proposed by reviewer: B

Responsibility: Mgr. et Mgr. Hana Odstrčilová