Bachelor's Thesis

Detection and Mitigation of Data Poisoning in Machine Learning Classifiers

Final Thesis 1.62 MB

Author of thesis: Bc. Petr Špác

Acad. year: 2025/2026

Supervisor: Ing. Anton Firc, Ph.D.

Reviewer: Ing. Jakub Reš

Abstract:

This work addresses the vulnerability of the Support Vector Machine (SVM) to data poisoning in the context of malware classification. The goal of the thesis was to analyze these attacks and propose a suitable defense. The work focuses on cleansing training data of malicious samples and provides the design and implementation of the L2-RONI filtering method. The proposed method is experimentally evaluated on the Drebin-215 and LAMDA datasets against three attacks: random label flipping, furthest-first flipping, and backdoor. The results demonstrate that L2-RONI successfully combines the speed of the L2 method with the accuracy of the RONI algorithm, thereby accelerating the cleansing process and maintaining high resilience against the furthest-first attack, even at a higher poisoning rate.

Keywords:

Data poisoning, classification, malware, SVM, sanitation, adversarial machine learning, mitigation, detection, Python, label flipping, backdoor, computer security

Date of defence

18.06.2026

Result of the defence

Defended (thesis was successfully defended)

znamkaCznamka

Grading

C

Process of defence

Student nejprve prezentoval výsledky, kterých dosáhl v rámci své práce. Komise se poté seznámila s hodnocením vedoucího a posudkem oponenta práce. Student následně odpověděl na otázky oponenta a na další otázky přítomných. Komise se na základě posudku oponenta, hodnocení vedoucího, přednesené prezentace a odpovědí studenta na položené otázky rozhodla práci hodnotit stupněm C.

Topics for thesis defence

  1. Měřil jste při útoku typu backdoor i jiné metriky než accuracy, které by lépe vystihovaly, zda byl model úspěšně otráven?
  2. Proč jste zvolil právě lineární SVM? Jaký si myslíte, že může mít tato volba vliv na úspěšnost útoků a obran?
  3. Jak jste vybíral indexy vzorků, které používáte jako cíle pro útok typu backdoor?
  4. Proč jste vybral právě oblast malware detekce? Jak by se změnila Vámi navržená metodika pro jiné datové sady, případně jiné modely strojového učení?
  5. Proč jste detekci a mitigaci otravy dat neimplementoval jako dvě samostatné funkce?
  6. Jaké datové sady jste použil pro testování vašeho systému? Jaké byly jejich vlastnosti a jejich velikost?

Language of thesis

English

Faculty

Department

Study programme

Information Technology (BIT)

Composition of Committee

doc. Ing. Petr Matoušek, Ph.D., M.A. (předseda)
doc. Ing. Michal Bidlo, Ph.D. (místopředseda)
Ing. Radek Kočí, Ph.D. (člen)
Ing. Jan Pluskal, Ph.D. (člen)
Ing. František Grézl, Ph.D. (člen)

Supervisor’s report
Ing. Anton Firc, Ph.D.

Jedná se o pěkně zpracovanou práci na náročnější a aktuální téma. Student se práci průběžně věnoval, vynaložil potřebné úsilí pro pochopení řešeného problému a samostatně nalezl vhodné řešení. Práce vyžadovala nejen implementaci obranných mechanismů, ale také pochopení a demonstraci útoků, proti nimž byla obrana navrhována. S ohledem na náročnější povahu zadání považuji výsledek práce za velmi dobrý a jsem s ním spokojen. Celkově práci hodnotím stupněm B (88b).

Evaluation criteria Verbal classification
Information about assignment

Zadání práce hodnotím jako náročnější, neboť se věnovalo pokročilejším aspektům bezpečnosti modelů umělé inteligence a možnostem jejich ochrany. Řešení vyžadovalo pochopení problematiky otravy dat, trénování klasifikátorů a návrhu obranného mechanismu proti tomuto typu útoků. Přestože výsledná obrana vychází z kombinace již existujících přístupů, prokazuje dostatečné porozumění tématu a schopnost samostatně řešit obdobné bezpečnostní problémy. Z mého pohledu vykonaná práce naplňuje požadavky zadání.

Work with literature

Student samostatně vyhledával relevantní literaturu a vhodně ji využíval při řešení práce. Prokázal schopnost orientovat se v odborných zdrojích souvisejících s řešenou problematikou.

Activity during solution, consultations, communication

Student práci pravidelně konzultoval, na konzultace chodil vždy připravený a průběžně zapracovával poskytnutou zpětnou vazbu. Jeho přístup během řešení hodnotím jako aktivní a samostatný.

Activity during completion

Práce byla dokončena s dostatečným předstihem a její obsah byl před finálním odevzdáním konzultován. K procesu dokončování nemám zásadní připomínky.

Publication activity, awards

Publikační činnost ani ocenění související s touto prací mi nejsou známy.

Points proposed by supervisor: 88

Grade proposed by supervisor: B

Reviewer’s report
Ing. Jakub Reš

Autor zpracoval zadání s drobnými kvalitativními nedostatky, ovšem v dostatečné míře pro bakalářskou práci. Tyto nedostatky jsou typicky vědeckého charakteru a vzhledem k obtížnosti zadání je nevnímám jako příliš vlivné na celkové hodnocení.


Práci bych hodnotil známou C (78 b.), bohužel ale vzhledem k chybějícímu odůvodnění odklonu od bodů 3 a 4 zadání navrhuji snížit celkové hodnocení na D (68 b.).

Evaluation criteria Verbal classification Points
The difficulty of the assignment

Evaluation level: more difficult assignment

Zadání hodnotím jako obtížnější, jelikož řeší aktuální výzkumný problém v oblasti bezpečnosti AI a cílí na vytvoření nové obranné metodiky.

Presentation level of the technical report

Logická struktura práce je přiměřená, nicméně ocenil bych trochu více vypovídající názvy kapitol. Orientace v rejstříku na začátku práce bez znalosti obsahu kapitol je poněkud náročná.

Dále v některých částech práce nevím, zda se jedná o vlastní přínos autora nebo o existující znalost. Například Threat Model (sekce 3.1) je součástí teoretické části, ale působí jako vlastní přínos. Dále pak kapitola 4 začíná teoretickým shrnutím existujících metod obrany proti model poisoning útoku, ale v druhé půlce přechází na implementaci a následně na návrh. Tento postup popisu je netypický a působí zmateně. Ocenil bych rozdělení existujících obranných metod a vlastního návrhu a implementace do dvou kapitol. Poslední sekce této kapitoly, reprezentující vlastní návrh, je značně kratší než ostatní sekce a postrádá důležité detaily.

Co se týče kapitoly s experimenty, mám několik připomínek. V sekci 5.2 mi chybí zdůvodnění spousty rozhodnutí autora, např. výběr SVM architektury a parametrů a následné vyřazení dvou útoků na základě volby této architektury a datových sad. Rád bych v práci viděl hlubší analýzu vlivu architektury na tyto útoky a zdůvodnění nejen jejich vyřazení, ale i volby samotných parametrů SVM. Dále zde není dostatečně popsáno, jak autor vybíral podmnožinu datových sad, proč vybral zrovna 11 000 / 2 022 vzorků a jak bylo vybráno rozdělení podmnožiny datové sady na train/test/validation. Samotné počty nestačí, je nutné popsat, jak a proč byly množiny takto vybrány. V kapitole o experimentech mi taktéž chybí popis použití útoků a nastavení obranných metod – toto vše je uvedeno až v kapitole s výsledky a taktéž by bylo vhodné tento popis rozepsat (například jak autor vybíral vzorky pro backdoor útok, nebo jaké prahy a proč autor vybral pro L2 metodu).

Kapitola s výsledky by mohla vedle grafů obsahovat i tabulky s konkrétními čísly. Zároveň zde prakticky není diskutován vliv kombinace obranných metod (autorův přínos) na časovou optimalizaci. Toto byl jeden z hlavních argumentů jejich propojení. Jediné konkrétní časové informace se vyskytují v nadpisech grafů.

Spousta připomínek v této části je ovšem s ohledem na náročnost zadání  očekávaná a jejich důkladné zapracování by dalece přesahovalo rámec bakalářské práce.

70
Formal preparation of a technical report

Po typografické stránce nemám vážné výhrady. Občas se v práci vyskytují inkonzistence referencí kapitol, sekcí, a rovnic.

Jazyková stránka práce je taktéž ucházející. Výjimkou jsou občasné neakademické výrazy.

85
Realisation output

Softwarové řešení práce obsahuje README s postupem replikace v prostředí kontejnerizačního softwaru Docker. Soubory obsahují hlavičky pro identifikaci autora. Dokumentace je formou docstrings i komentářů v dostatečné míře.

Co se týče experimentů, očekával bych robustnější přístup při volbě modelu a práce s datovými sadami.

80
Usability of results

Výsledky práce jsou dobrým prvním pozorováním, nicméně k použití v praxi či publikaci je zapotřebí dalšího rozpracování.

Technický výstup je čistě pro replikaci výsledků. K jeho dalšímu využití je zapotřebí úprav.

The extent to which the requirements of the assignment have been met

Evaluation level: assignment fulfilled with minor reservations

Body 3 a 4 zadání nebyly zcela splněny. Autor práce se nevěnuje detekci, ale pouze mitigaci otravy dat. Dopady chybějící detekce jsme se studentem diskutovali během prezentace práce oponentovi. Odklonění od zadání bych vzhledem k náročnosti nepovažoval za problematické, pokud by autor tuto skutečnost zdůvodnil ve své práci.

Extent of the technical report

Evaluation level: meets the minimum requirements only

Podle nástroje https://app.fit.vut.cz/theses-checker/ je rozsah zprávy 46,55 ns a splňuje tak minimální rozsah pro bakalářské práce. Některé části práce by nicméně bylo vhodné více rozvést.

Work with literature

Práce má celkem 24 citací, které jsou relevantní k tématu. Autor čerpal převážně ze starších zdrojů. Vzhledem k výzkumné povaze zadání bylo by vhodné uvést více současného výzkumu v této oblasti.

85
Topics for thesis defence:
  1. Proč jste zvolil právě lineární SVM? Jaký si myslíte, že může mít tato volba vliv na úspěšnost útoků a obran?
  2. Měřil jste při útoku typu backdoor i jiné metriky než accuracy, které by lépe vystihovaly, zda byl model úspěšně otráven?
  3. Jak jste vybíral indexy vzorků, které používáte jako cíle pro útok typu backdoor?
  4. Proč jste vybral právě oblast malware detekce? Jak by se změnila Vámi navržená metodika pro jiné datové sady, případně jiné modely strojového učení?
Points proposed by reviewer: 68

Grade proposed by reviewer: D

Responsibility: Mgr. et Mgr. Hana Odstrčilová