Komplexní hodnocení systémů pro získávání znalostí a generování odpovědí s využitím umělé inteligence v podnikovém prostředí

Název práce: An End-to-End Evaluation of AI-Powered Knowledge Retrieval and Response Generation at Enterprise scale
Autor(ka) práce: Bezvoda, Marek
Typ práce: Diploma thesis
Vedoucí práce: Chudán, David
Oponenti práce: Dudáš, Marek
Jazyk práce: English
Abstrakt:
As organizations grow, so does the amount of company data they produce. As a result, the ability to retrieve accurate information from this accumulated knowledge has become a key part of how organizations function. While keyword-based searching will continue to be useful for the retrieval of basic information, working with natural-language queries requires more robust methods of retrieval. Large Language Models (LLMs) address this issue by effectively generating human-like outputs. These outputs can be considered valid means of retrieval; however, they are not backed by a source of the information and can therefore be hallucinations. The Retrieval-Augmented Generation (RAG) paradigm was created to directly address these concerns regarding retrieval. The main driver of this technology is the mechanism of grounding generated answers in retrieved enterprise content. This thesis evaluates five architecturally different enterprise RAG systems which were tested against real business data at Škoda Auto. These systems are the internal Škoda Smart Search, the managed cloud platforms Google Vertex AI Search and Microsoft Azure AI Search, the self-hosted open-source engine RAGFlow, and a custom Neo4j GraphRAG pipeline. The systems span proprietary, managed, open-source, and graph-augmented, and are compared on a shared Czech question set with fixed reference answers. The evaluation is done in two phases, the baseline and aligned phase, and is implemented through a notebook-based pipeline. The baseline phase measures each system in its initial configuration, while the aligned phase addresses differences in used models/prompts to isolate the effect of individual architectures. The systems are evaluated by the following metrics: answer quality measured by ROUGE-L and an LLM-as-a-judge score, response latency, cost, integration effort, and scalability. The quantitative comparison is extended by a structured interview with the enterprise stakeholder responsible for internal AI implementations at Škoda Auto. The findings show that no single system dominates across all dimensions. Škoda Smart Search achieved the strongest lexical answer quality via ROUGE-L but also the highest latency. The Neo4j GraphRAG pipeline achieved the highest semantic judge score while maintaining low latency. Vertex AI Search and RAGFlow both improved their scores once configuration was aligned. The baseline setup substantially underestimated the capabilities of configuration-sensitive systems like Vertex AI Search and RAGFlow. The Stakeholder interview confirmed that system selection in practice is a project-dependent balancing act, meaning that data sovereignty, dataset update frequency, and existing infrastructure investment can outweigh raw quality scores. Overall results show that a valid enterprise RAG evaluation requires a dedicated setup phase and a multi-dimensional framework, since architecture, configuration, and organisational constraints determine which system is the right choice.
Klíčová slova: Retrieval-augmented generation; Large language models; RAG; Škoda Auto; GraphRAG; Knowledge retrieval; RAG evaluation
Název práce: Komplexní hodnocení systémů pro získávání znalostí a generování odpovědí s využitím umělé inteligence v podnikovém prostředí
Autor(ka) práce: Bezvoda, Marek
Typ práce: Diplomová práce
Vedoucí práce: Chudán, David
Oponenti práce: Dudáš, Marek
Jazyk práce: English
Abstrakt:
S růstem organizací roste i objem firemních dat, která produkují. V důsledku toho se schopnost získávat přesné informace z těchto nahromaděných znalostí stala klíčovou součástí fungování organizací. Zatímco vyhledávání založené na klíčových slovech bude i nadále užitečné pro získávání základních informací, práce s dotazy v přirozeném jazyce vyžaduje robustnější metody vyhledávání. Velké jazykové modely (LLM) tento problém řeší tím, že efektivně generují výstupy podobné lidským. Tyto výstupy lze považovat za platné prostředky vyhledávání; nejsou však podloženy zdrojem informací, a mohou tedy být halucinacemi. Koncept Retrieval-Augmented Generation (RAG) vznikl právě proto, aby tyto obavy ohledně vyhledávání přímo řešil. Hlavním hnacím motorem této technologie je mechanismus ukotvení generovaných odpovědí v získaném podnikovém obsahu. Tato práce hodnotí pět architektonicky odlišných podnikových RAG systémů, které byly testovány na reálných obchodních datech ve firmě Škoda Auto. Těmito systémy jsou interní Škoda Smart Search, spravované cloudové platformy Google Vertex AI Search a Microsoft Azure AI Search, self-hostovaný open-source engine RAGFlow a vlastní implementace Neo4j GraphRAG. Systémy pokrývají proprietární, cloudové, open-source a grafově rozšířené přístupy a jsou porovnávány na společné sadě českých otázek s pevně danými referenčními odpověďmi. Hodnocení probíhá ve dvou fázích, základní a sladěné, a je implementováno prostřednictvím evaluační pipeline založené na Jupyter noteboocích. Základní fáze měří každý systém v jeho výchozí konfiguraci, zatímco sladěná fáze řeší rozdíly v použitých modelech/promptech s cílem izolovat vliv jednotlivých architektur. Systémy jsou hodnoceny podle následujících metrik: kvalita odpovědi měřená pomocí ROUGE-L a skóre LLM-as-a-judge, latence odpovědi, náklady, náročnost integrace a škálovatelnost. Kvantitativní srovnání je rozšířeno o strukturovaný rozhovor s podnikovým stakeholderem odpovědným za interní implementace AI ve Škoda Auto. Zjištění ukazují, že žádný jednotlivý systém nedominuje napříč všemi dimenzemi. Škoda Smart Search dosáhl nejsilnější lexikální kvality odpovědí prostřednictvím ROUGE-L, ale také nejvyšší latence. Pipeline Neo4j GraphRAG dosáhla nejvyššího sémantického skóre LLM-as-a-judge při zachování nízké latence. Vertex AI Search i RAGFlow zlepšily svá skóre poté, co byla konfigurace sladěna. Základní nastavení podstatně podhodnotilo schopnosti systémů citlivých na konfiguraci, jako jsou Vertex AI Search a RAGFlow. Rozhovor se stakeholderem potvrdil, že výběr systému je v praxi vyvažováním závislým na projektu, což znamená, že datová suverenita, frekvence aktualizace datové sady a stávající investice do infrastruktury mohou převážit nad samotnými skóre kvality. Celkové výsledky ukazují, že validní evaluace podnikových RAG systémů vyžaduje dedikovanou přípravnou fázi a vícedimenzionální rámec, protože architektura, konfigurace a organizační omezení určují, který systém je tou správnou volbou.
Klíčová slova: Retrieval-augmented generation; Velké jazykové modely; RAG; Škoda Auto; GraphRAG; Evaluace RAG; Získávání znalostí

Informace o studiu

Studijní program / obor: Aplikovaná datová analytika a umělá inteligence/Datová analytika v marketingu a e-commerce
Typ studijního programu: Magisterský studijní program
Přidělovaná hodnost: Ing.
Instituce přidělující hodnost: Vysoká škola ekonomická v Praze
Fakulta: Fakulta informatiky a statistiky
Katedra: Katedra informačního a znalostního inženýrství

Informace o odevzdání a obhajobě

Datum zadání práce: 12. 12. 2025
Datum podání práce: 24. 6. 2026
Datum obhajoby: 2026

Soubory ke stažení

Soubory budou k dispozici až po obhajobě práce.

    Poslední aktualizace: