Využití Multimodálních Velkých Jazykových Modelu pro analýzu fotografií
| Název práce: | Using Multimodal Large Language Models for Photo Analysis |
|---|---|
| Autor(ka) práce: | Bubnov, Mykhailo |
| Typ práce: | Bachelor thesis |
| Vedoucí práce: | Kliegr, Tomáš |
| Oponenti práce: | Pavlíček, Luboš |
| Jazyk práce: | English |
| Abstrakt: | This thesis investigates the potential of multimodal large language models to be used as a tool for the official automated passport photo classification, an area where high accuracy is demanded. The publicly available MMLLM (Multi-Modal Large Language Model) LLaVa v1.6 Vicuna 13B model was used and adapted using different tactics. The primary objective was to create a model that could classify passport-style photographs according to criteria defined by an international standard. A manually curated dataset was created to serve both as a proof-of-concept and as training material for fine-tuning. In the process of fine-tuning, the learning rate and the number of epochs were systematically varied to achieve the best possible result. The fine-tuned model achieved both F1 and AUC of 0.77. These results demonstrate measurable improvements over the base model. Further improvements are suggested through enhanced dataset diversity and more granular supervision. |
| Klíčová slova: | Multimodal models; Fine-tuning; LLaVA; Photo classification; Document photos; QLoRA |
| Název práce: | Využití Multimodálních Velkých Jazykových Modelu pro analýzu fotografií |
|---|---|
| Autor(ka) práce: | Bubnov, Mykhailo |
| Typ práce: | Bakalářská práce |
| Vedoucí práce: | Kliegr, Tomáš |
| Oponenti práce: | Pavlíček, Luboš |
| Jazyk práce: | English |
| Abstrakt: | Tato bakalářská práce zkoumá potenciál multimodálních velkých jazykových modelů jako nástrojů pro oficiální automatizovanou klasifikaci pasových fotografií, kde se vyžaduje vysoká přesnost. Byl použit veřejně dostupný multimodální model LLaVa v1.6 Vicuna 13B a byl upraven pomocí různých přístupů. Hlavním cílem bylo vytvořit model, který dokáže klasifikovat pasové fotografie podle kritérií definovaných mezinárodní normou. Byla ručně sestavena datová sada na trénování a testování modelu. Během procesu fine-tuningu byly systematicky manipulované hodnoty rychlosti učení a počtu epoch pro dosažení co nejlepšího výsledku. Finálně vyladěný model dosáhl hodnot F1 a AUC rovných 0,77. Tyto výsledky ukazují patrné zlepšení oproti výchozímu modelu, další vylepšení lze dosáhnout zvýšením rozmanitosti datové sady a granularity dohledu nad učením. |
| Klíčová slova: | Multimodální modely; LLaVA; Klasifikace fotografií; Fotografie dokumentů; Fine-tuning; QLoRA |
Informace o studiu
| Studijní program / obor: | Aplikovaná informatika |
|---|---|
| Typ studijního programu: | Bakalářský studijní program |
| Přidělovaná hodnost: | Bc. |
| Instituce přidělující hodnost: | Vysoká škola ekonomická v Praze |
| Fakulta: | Fakulta informatiky a statistiky |
| Katedra: | Katedra informačního a znalostního inženýrství |
Informace o odevzdání a obhajobě
| Datum zadání práce: | 12. 2. 2025 |
|---|---|
| Datum podání práce: | 26. 6. 2025 |
| Datum obhajoby: | 25. 8. 2025 |
| Identifikátor v systému InSIS: | https://insis.vse.cz/zp/91370/podrobnosti |