Využití Multimodálních Velkých Jazykových Modelu pro analýzu fotografií

Název práce: Using Multimodal Large Language Models for Photo Analysis
Autor(ka) práce: Bubnov, Mykhailo
Typ práce: Bachelor thesis
Vedoucí práce: Kliegr, Tomáš
Oponenti práce: Pavlíček, Luboš
Jazyk práce: English
Abstrakt:
This thesis investigates the potential of multimodal large language models to be used as a tool for the official automated passport photo classification, an area where high accuracy is demanded. The publicly available MMLLM (Multi-Modal Large Language Model) LLaVa v1.6 Vicuna 13B model was used and adapted using different tactics. The primary objective was to create a model that could classify passport-style photographs according to criteria defined by an international standard. A manually curated dataset was created to serve both as a proof-of-concept and as training material for fine-tuning. In the process of fine-tuning, the learning rate and the number of epochs were systematically varied to achieve the best possible result. The fine-tuned model achieved both F1 and AUC of 0.77. These results demonstrate measurable improvements over the base model. Further improvements are suggested through enhanced dataset diversity and more granular supervision.
Klíčová slova: Multimodal models; Fine-tuning; LLaVA; Photo classification; Document photos; QLoRA
Název práce: Využití Multimodálních Velkých Jazykových Modelu pro analýzu fotografií
Autor(ka) práce: Bubnov, Mykhailo
Typ práce: Bakalářská práce
Vedoucí práce: Kliegr, Tomáš
Oponenti práce: Pavlíček, Luboš
Jazyk práce: English
Abstrakt:
Tato bakalářská práce zkoumá potenciál multimodálních velkých jazykových modelů jako nástrojů pro oficiální automatizovanou klasifikaci pasových fotografií, kde se vyžaduje vysoká přesnost. Byl použit veřejně dostupný multimodální model LLaVa v1.6 Vicuna 13B a byl upraven pomocí různých přístupů. Hlavním cílem bylo vytvořit model, který dokáže klasifikovat pasové fotografie podle kritérií definovaných mezinárodní normou. Byla ručně sestavena datová sada na trénování a testování modelu. Během procesu fine-tuningu byly systematicky manipulované hodnoty rychlosti učení a počtu epoch pro dosažení co nejlepšího výsledku. Finálně vyladěný model dosáhl hodnot F1 a AUC rovných 0,77. Tyto výsledky ukazují patrné zlepšení oproti výchozímu modelu, další vylepšení lze dosáhnout zvýšením rozmanitosti datové sady a granularity dohledu nad učením.
Klíčová slova: Multimodální modely; LLaVA; Klasifikace fotografií; Fotografie dokumentů; Fine-tuning; QLoRA

Informace o studiu

Studijní program / obor: Aplikovaná informatika
Typ studijního programu: Bakalářský studijní program
Přidělovaná hodnost: Bc.
Instituce přidělující hodnost: Vysoká škola ekonomická v Praze
Fakulta: Fakulta informatiky a statistiky
Katedra: Katedra informačního a znalostního inženýrství

Informace o odevzdání a obhajobě

Datum zadání práce: 12. 2. 2025
Datum podání práce: 26. 6. 2025
Datum obhajoby: 25. 8. 2025
Identifikátor v systému InSIS: https://insis.vse.cz/zp/91370/podrobnosti

Soubory ke stažení

    Poslední aktualizace: