Bachelor's Thesis

Computer as an Intelligent Partner in the Word-Association Game Codenames

Final Thesis 2.11 MB Appendix 7.84 MB

Author of thesis: Bc. Tomáš Boudný

Acad. year: 2025/2026

Supervisor: doc. RNDr. Pavel Smrž, Ph.D.

Reviewer: Ing. Martin Dočekal

Abstract:

This bachelor thesis focuses on enhancing an existing agent for the game Codenames across three distinct areas. The first part analyzes the replacement of static embeddings (FastText) with contextual representations from Sentence BERT. The second and pivotal part of the work introduces an adaptive agent utilizing the Bayesian Rational Speech Acts (RSA) framework for real-time estimation of a teammate’s reasoning rationality. The third part explores the integration of Large Language Models (LLMs) for clue generation. Experimental results demonstrate that Bayesian adaptation effectively reduces the risk of selecting the assassin (assassin rate) and decreases the number of turns required to win. Conversely, testing the SBERT model revealed that, for the specific requirements of Codenames, it offers no improvement over the FastText model.

Keywords:

Codenames, bayesian adaptation, Rational Speech Acts (RSA), large language models (LLM), Gemini, Sentence-BERT (SBERT), natural language processing, theory of mind

Date of defence

16.06.2026

Result of the defence

Defended (thesis was successfully defended)

znamkaEznamka

Grading

E

Process of defence

Student nejprve prezentoval výsledky, kterých dosáhl v rámci své práce. Komise se poté seznámila s hodnocením vedoucího a posudkem oponenta práce. Student následně odpověděl na otázky oponenta a na další otázky přítomných. Komise se na základě posudku oponenta, hodnocení vedoucího, přednesené prezentace a odpovědí studenta na položené otázky rozhodla práci hodnotit stupněm E.

Topics for thesis defence

  1. Ve své práci odhadujete racionalitu hráče. Vzhledem k tomu, že průměrná hra trvá relativně nízký počet tahů, jak rychle dokáže váš model správně klasifikovat úroveň spoluhráče? Nepovažoval byste za přínosné vyhodnotit, kolik kroků agent průměrně potřebuje, než rozpozná, s jak zkušeným hráčem hraje?
  2. Jakým vzorcem se řídí snižování a zvyšování důvěry?
  3. Jak se rozlišuje mezi hráčem začátečníkem a pokročilým?
  4. Můžete podrobně popsat použitý algoritmus pro výběr nápověd?

Language of thesis

Czech

Faculty

Department

Study programme

Information Technology (BIT)

Composition of Committee

doc. Ing. Lukáš Burget, Ph.D. (předseda)
doc. Mgr. Adam Rogalewicz, Ph.D. (místopředseda)
Ing. Libor Polčák, Ph.D. (člen)
Ing. Michal Hradiš, Ph.D. (člen)
Ing. Martin Žádník, Ph.D. (člen)

Supervisor’s report
doc. RNDr. Pavel Smrž, Ph.D.

Tomáši Boudnému se v rámci bakalářské práce podařilo implementovat nově navrženou strategii hry a vyhodnotit ji v sérii experimentů. Na druhé straně slabší byla jeho aktivita směrem ke zlepšení současných modelů pro hledání slovních asociací, a ne zcela dotaženo zůstalo i úsilí o vyhodnocení a porovnání současných velkých jazykových modelů pro účely generování a vysvětlování asociačních vztahů mezi slovy, případně ve vícejazyčných kontextech. Z hlediska průběhu a výstupů hodnotím práci stupněm D - uspokojivě. 

Evaluation criteria Verbal classification
Information about assignment

Zadání navazovalo na sérii předchozích absolventských prací v této oblasti, mělo se soustředit na zlepšení a aktualizaci dosavadních modelů pro generování možných nápověd a strategií jejich výběru při znalosti informací z průběhu dané hry, případně předchozích her se stejným týmem. Student se věnoval především druhé oblasti a vypracoval solidní řešení, které v simulovaných hrách dosahuje dobrého hodnocení.

Work with literature

Práce s literaturou měla spíše slabší úroveň, student pracoval s omezenou množinou zdrojů a například studijní prameny pro oblast vytváření moderních modelů pro asociační vztahy, či destilace slovních modelů na základě velkých kontextových jazykových modelů zanedbal.

Activity during solution, consultations, communication

Aktivita během řešení nebyla soustavná, nicméně v letním semestru a, zejména, několik týdnů před termínem odevzdávání, se výrazně zvýšila, takže se podařilo dotáhnout domluvené experimenty a úspěšně popsat vytvořené dílo.

Activity during completion

Práce byla dokončena s určitým předstihem, měl jsem možnost revidovat předběžnou podobu některých částí technické zprávy, moje připomínky byly uspokojivě zohledněny. Definitivní podobu textu jsem však již neměl možnost vidět.

Publication activity, awards

-

Points proposed by supervisor: 65

Grade proposed by supervisor: D

Reviewer’s report
Ing. Martin Dočekal

Autor implementoval novou metodu pro hraní hry Krycí jména a experimentálně potvrdil její nadřazenost ve hrách s lidskými hráči oproti předchozímu existujícímu řešení. Práce bohužel obsahuje několik výše zmíněných nedostatků, které zhoršují její čitelnost a celkovou srozumitelnost. Za největší problém pokládám chybějící experimentální data (absence testování LLM agenta, které je avizováno v závěru) a nedokládání podkladů k některým tvrzením.

Evaluation criteria Verbal classification Points
The difficulty of the assignment

Evaluation level: moderately difficult assignment

Presentation level of the technical report

Jednotlivé kapitoly na sebe logicky navazují, ale některé pasáže by si zasloužily detailnější popis zvolených metod. Občas se v textu nacházejí nevhodně zvolené formulace a nepodložená tvrzení. Na straně 22 autor například uvádí, že Varianta 3 efektivně potlačuje halucinace, avšak pro toto tvrzení chybí zdroj či experimentální ověření. Bylo by vhodné doplnit popis hlavní smyčky algoritmu (např. formou pseudokódu), aby byla zřejmá návaznost jednotlivých kroků. Naopak text obsahuje zbytečně detailní popis nestěžejní části kódu věnované formátování (strana 24).

60
Formal preparation of a technical report

Po jazykové stránce jsem nezaznamenal větší obtíže, až na občasné krkolomnější formulace. Z typografického hlediska se však v práci vyskytují nedostatky: text obsahuje dlouhé prázdné mezery (např. na straně 13) a rovnice nejsou číslovány. Co se týče ilustrací, diagramy (např. obrázek 3.1) by bylo vhodnější vložit ve vektorovém formátu, ačkoliv je jejich rozlišení stále dostatečné. Zřetelně nízké rozlišení však mají obrázky 4.1 a 4.2.

70
Realisation output

Za hlavní realizační výstup považuji implementaci popsaných strategií, rozšíření existujícího uživatelského rozhraní a experimenty s vybranými strategiemi. Hlavní zkoumaný přístup je založen na modelu racionální komunikace. Je experimentálně doloženo, že hlavní agent, využívající tuto strategii při hraní s lidskými hráči, dosahuje lepších výsledků než při použití původní metody, která staví primárně na podobnosti vektorových reprezentací.

Experimentální část je bohužel hůře čitelná vlivem nedostatečného popisu některých zkoumaných parametrů (např. parametr „šum“ v tabulce 5.4). Dále se zde vyskytují nepodložená tvrzení. Na straně 31 autor uvádí, že daný rozdíl není statisticky významný, ale není zřejmé, zda byl příslušný statistický test opravdu proveden. V kapitole navíc zcela chybějí experimenty s využitím LLM pro hlavního agenta, přestože závěr práce je formulován tak, jako by tento experiment proběhl a byl vyhodnocen.

65
Usability of results

Výsledky experimentů mohou sloužit jako podklad pro budoucí práce. Implementovanou metodu lze reálně využít pro hraní hry Krycí jména.

The extent to which the requirements of the assignment have been met

Evaluation level: assignment fulfilled only partially with minor reservations

Došlo k odklonu od požadavku na jazykovou nezávislost, pravděpodobně za účelem většího soustředění se na 3. bod zadání.

Extent of the technical report

Evaluation level: meets the minimum requirements only

Práce má 47 normostran, čímž splňuje minimální požadavky.

Work with literature

Práce obsahuje několik citačních nedostatků. Pro uváděné přístupy či modely často chybí zdroj. V textu se také objevují tvrzení, která nejsou podložena citací ani příslušným experimentem (jak je již zmíněno v hodnocení prezentační úrovně).

65
Topics for thesis defence:
  1. Ve své práci odhadujete racionalitu hráče. Vzhledem k tomu, že průměrná hra trvá relativně nízký počet tahů, jak rychle dokáže váš model správně klasifikovat úroveň spoluhráče? Nepovažoval byste za přínosné vyhodnotit, kolik kroků agent průměrně potřebuje, než rozpozná, s jak zkušeným hráčem hraje?
Points proposed by reviewer: 65

Grade proposed by reviewer: D

Responsibility: Mgr. et Mgr. Hana Odstrčilová