Klasifikace videa na základě popisů generovaných velkými jazykovými modely
| Název práce: | Klasifikace videa na základě popisů generovaných velkými jazykovými modely |
|---|---|
| Autor(ka) práce: | Koval, Matěj |
| Typ práce: | Bakalářská práce |
| Vedoucí práce: | Kliegr, Tomáš |
| Oponenti práce: | Hrudková, Kateřina |
| Jazyk práce: | Česky |
| Abstrakt: | Cílem bakalářské práce je navrhnout a implementovat vysvětlitelný přístup ke klasifikaci videí pomocí popisů generovaných multimodálními velkými jazykovými modely. Byl vytvořen webový systém Media Feature Lab (React + Flask), který v pětifázové pipeline automaticky navrhuje a extrahuje textové atributy z videa pomocí LLM a trénuje nad nimi model RuleKit produkující srozumitelná pravidla. Pipeline byla ověřena na datasetu MediaEval Predicting Video Memorability a doplňkově na medicínském datasetu pro detekci zánětu plic. Na datasetu Movie Memorability se nepodařilo prokázat statisticky významné zlepšení oproti referenčním baseline modelům; hlavním přínosem je demonstrace realizovatelnosti celého end-to-end procesu a interpretovatelnost výstupů. |
| Klíčová slova: | RuleKit; video memorability; vysvětlitelná AI; velké jazykové modely; multimodální LLM; MediaEval |
| Název práce: | Video classification based on descriptions generated by large language models |
|---|---|
| Autor(ka) práce: | Koval, Matěj |
| Typ práce: | Bachelor thesis |
| Vedoucí práce: | Kliegr, Tomáš |
| Oponenti práce: | Hrudková, Kateřina |
| Jazyk práce: | Česky |
| Abstrakt: | The goal of the thesis is to design and implement an explainable approach to video classification using descriptions generated by multimodal large language models. A web system Media Feature Lab (React + Flask) was developed, which in a five-phase pipeline automatically proposes and extracts textual attributes from videos via LLM and trains a RuleKit model that produces human-interpretable rules. The pipeline was validated on the MediaEval Predicting Video Memorability dataset and additionally on a medical dataset for pneumonia detection. On the Movie Memorability dataset, no statistically significant improvement over reference baselinemodelswasdemonstrated;themaincontributionistheproof-of-conceptdemonstration of the complete end-to-end process and the interpretability of its outputs. |
| Klíčová slova: | large language models; multimodal LLM; explainable AI; RuleKit; video memorability; MediaEval |
Informace o studiu
| Studijní program / obor: | Aplikovaná informatika |
|---|---|
| Typ studijního programu: | Bakalářský studijní program |
| Přidělovaná hodnost: | Bc. |
| Instituce přidělující hodnost: | Vysoká škola ekonomická v Praze |
| Fakulta: | Fakulta informatiky a statistiky |
| Katedra: | Katedra informačního a znalostního inženýrství |
Informace o odevzdání a obhajobě
| Datum zadání práce: | 2. 10. 2025 |
|---|---|
| Datum podání práce: | 11. 5. 2026 |
| Datum obhajoby: | 19. 6. 2026 |
| Identifikátor v systému InSIS: | https://insis.vse.cz/zp/93792/podrobnosti |