Přístupnostní navigace
E-application
Search Search Close
Bachelor's Thesis
Author of thesis: Bc. Kristián Grečnár
Acad. year: 2025/2026
Supervisor: Ing. Anton Firc, Ph.D.
Reviewer: Ing. Jakub Reš
Prompt injection attacks represent a growing security threat to applications based on large language models (LLMs). Despite their simplicity, these attacks can significantly influence model behavior and potentially lead to the disclosure of sensitive information or unintended system actions. As LLMs are increasingly integrated into real-world systems, understanding and mitigating these risks becomes essential. This thesis examines the nature and impact of prompt injection attacks through both theoretical analysis and practical experimentation. Based on these insights, a series of controlled attacks is performed on a custom LLM-based application to evaluate the susceptibility of different language models. The results demonstrate that prompt injection attacks can be highly effective and that current defense mechanisms may not provide sufficient protection. Additionally, differences in robustness across models are observed. The findings highlight the need for improved security strategies and contribute to a deeper understanding of prompt injection risks in modern AI systems.
prompt injection, large language models, adversarial inputs, security vulnerabilities, dual-LLM pattern, input filtering, output filtering
Date of defence
17.06.2026
Result of the defence
Defended (thesis was successfully defended)
Grading
D
Process of defence
Student nejprve prezentoval výsledky, kterých dosáhl v rámci své práce. Komise se poté seznámila s hodnocením vedoucího a posudkem oponenta práce. Student následně odpověděl na otázky oponenta a na další otázky přítomných. Komise se na základě posudku oponenta, hodnocení vedoucího, přednesené prezentace a odpovědí studenta na položené otázky rozhodla práci hodnotit stupněm D.
Topics for thesis defence
Language of thesis
English
Faculty
Fakulta informačních technologií
Department
Department of Intelligent Systems
Study programme
Information Technology (BIT)
Composition of Committee
prof. Ing. Martin Čadík, Ph.D. (předseda) doc. Ing. Ondřej Ryšavý, Ph.D. (místopředseda) Ing. Marcela Zachariášová, Ph.D. (člen) Ing. Tomáš Goldmann, Ph.D. (člen) Ing. Vojtěch Havlena, Ph.D. (člen)
Supervisor’s reportIng. Anton Firc, Ph.D.
Jedná se o pěkně zpracovanou práci na komplikovanější a aktuální téma. Student samostatně zvládl všechny části řešení v uspokojivé až velmi dobré podobě a prokázal, že je schopen porozumět komplexnějším tématům v oblasti bezpečnosti umělé inteligence. Oceňuji zejména schopnost navrhovat, implementovat a vyhodnocovat obranné metody pro systémy využívající velké jazykové modely. Celkově práci hodnotím stupněm B (88b).
Zadání práce hodnotím jako náročnější, protože vyžadovalo pochopení komplexnějších témat nad rámec běžného bakalářského studia. Student se musel seznámit s oblastí umělé inteligence a strojového učení, bezpečností modelů umělé inteligence, útoky na tyto modely i možnostmi jejich obrany, zejména v kontextu útoků typu prompt injection. Součástí zadání byly návrh a implementace vlastní aplikace využívající velké jazykové modely, následná bezpečnostní analýza, demonstrace útoků a hledání vhodných obranných mechanismů. Práce vyžadovala také nastudování současných systémů a praktickou práci s nimi. Student očekávaný rámec zadání naplnil.
Student si relevantní literaturu a další studijní materiály vyhledával samostatně. Získané zdroje vhodně využil při řešení práce a prokázal schopnost orientovat se v aktuální problematice.
Student práci pravidelně konzultoval, na konzultace chodil připravený a průběžně zpracovával poskytnutou zpětnou vazbu. Jeho přístup během řešení hodnotím jako aktivní a samostatný.
Práce byla dokončena s dostatečným předstihem a její finální verze byla konzultována s vedoucím. K průběhu dokončování nemám zásadní připomínky.
Publikační činnost ani ocenění související s touto prací mi nejsou známy.
Grade proposed by supervisor: B
Reviewer’s reportIng. Jakub Reš
Celkové zpracování zadání je na standardní úrovni bakalářské práce, bohužel formální stránka technické zprávy silně zaostává.
Doporučuji tedy hodnotit práci známkou D (68 b.)
Evaluation level: moderately difficult assignment
Zadání tématem i rozsahem hodnotím jako průměrné.
Celkovou strukturu práce hodnotím jako průměrnou. Vzhledem k technické povaze zadání jsou texty kapitol v očekávaném rozsahu.
Teoretickou část práce bych ocenil detailnější se zaměřením na řešenou problematiku. Kapitola 2 je příliš obecná a čtenáři tak nedá dostatek informací pro důkladné pochopení následujících částí. Například sekce 2.1.1 popisuje System prompt u LLM, ale pro jakékoliv detaily mimo existenci System a User promptu odkazuje na jiný článek. Čtenář tudíž musí stěžejní hledat v dalších zdrojích. Další podobný náznak popisu, jak v principu funguje prompt injection útoku, je v sekce 2.2.1, ale opět na příliš vysoké úrovni bez dostatečného zanoření do technického detailu.
Návrh aplikace postrádá konkrétní detaily. Návrh je často popisován velice povrchně, neobsahuje žádné příklady rozhraní (popis a zdůvodnění designu CLI ani wireframy GUI).
Figury 5.3 a 5.5 jsou velmi nevhodné pro prezentaci modelu útočníka. Samy o sobě nenesou mnoho informací oproti předcházejícímu textu.
V experimentální části práce se často objevují bloky textu, která často působí rušivě a zmatečně. Bylo by vhodné je umístit do příloh a odkazovat se na ně v průběhu hlavního textu.
Dále je zde až příliš vágně popsáno, jaké typy a útoků, a proč právě tyto, autor vybral. Očekával bych detailnější popis, které útoky a jak autor použil, obzvláště pak ve scénáři, kde útočník zná cílový LLM a může tak předem připravit mnohem efektivnější způsob získání citlivých dat než triviální slovní žádosti.
Práce obsahuje až příliš formálních nedostatků. Jedná se o časté překlepy nejen v textu (vlaue, apprach, apod.), ale i v názvu sekce (Lever dividing místo Level dividing).
Mimo to je práce velmi nekonzistentní s referencemi figur i sekcí (malá velká písmena na začátku reference) a velmi časté je i špatné nebo chybějící označení (Graph 5.4 - str. 26, graph 5.10 - str. 38, document (6.6) - str. 46, "to be highly effective (6.7)" - str. 47).
Dále práce obsahuje četné nevhodné formátování bloků, primárně přetékání na další strany (strany 23/24, 25/26, 32/33, 34/35, 35/36, 41/42, 42/43, 46/47). V některých těchto případech dokonce na přelomu stran předchází Figure pokračování bloku (strany 41/42, 42/43, 46/47)
Práce taktéž obsahuje několik nevhodných referencí pozicí (např. strana 40 - "Figure of this security apprach is below (6.2)", přičemž následuje Figure 6.1)
Technické řešení bylo živě prezentováno funkční i v plně lokálních podmínkách. Zdrojové soubory obsahují hlavičky s jasnou identifikací autora a základním popisem souboru.
V hlavičkách taktéž autor přiznává využití AI při tvorbě kódu, nicméně generované části nejsou jasně označeny.
Kód taktéž místy postrádá dokumentaci pro zlepšení přehlednosti.
Výstup práce má vysoký potenciál k využití v edukačním prostředí, nicméně pro tento účel by byla zapotřebí lehce rozšířit.
Pro vědecké účely by mohla sloužit jako základ nástroje pro manuální experimenty, ale taktéž by bylo zapotřebí mnoha úprav.
Evaluation level: assignment fulfilled
Ke splnění zadání nemám výhrady.
Evaluation level: is within the usual extent
Dle nástroje https://app.fit.vut.cz/theses-checker/ má práce rozsah přibližně 66 ns a je tak v obvyklém rozmezí.
Práce obsahuje 23 citací relevantních k tématu.
Velké množství textu v teoretické části obsahuje opakující se citace téhož zdroje. O takto rozvinutého výzkumného směru bych očekával větší rozmanitost.
Grade proposed by reviewer: D
Responsibility: Mgr. et Mgr. Hana Odstrčilová