Možnosti testování moderního stacku pro kvalitu dat a strojové učení
| Název práce: | Testing possibilities of a modern stack for data quality and machine learning |
|---|---|
| Autor(ka) práce: | Jadviščoková, Šárka |
| Typ práce: | Diploma thesis |
| Vedoucí práce: | Máša, Petr |
| Oponenti práce: | Maryška, Miloš |
| Jazyk práce: | English |
| Abstrakt: | This thesis investigates the design, implementation, and evaluation of an automated data processing architecture in which data quality validation is tightly integrated into a machine learning pipeline. The work addresses a challenge from current data-driven systems: machine learning models often rely on datasets that may contain inconsistencies or violations of domain rules, because traditional pipelines enforce systematic quality controls before model training is not automatically implemented. A modular framework was developed using Docker for reproducible environments to address this gap and software such as Apache Airflow for orchestration, Great Expectations for data validation, and PostgreSQL for storage and tracking of experimental outputs were used. The system incorporates adaptive logic capable of detecting data quality issues and triggering remediation steps automatically. During the research, set of corruption scenarios was created – including missing values, outliers, categorical errors, and conjoined multi-type corruptions so the quantification of how different data defects influence both data quality metrics and model performance was possible. Random Forest and Logistic Regression models were evaluated on corrupted and remediated datasets to measure degradation and recovery effects. The results demonstrate that while machine learning performance is relatively robust to moderate corruption, data validation metrics reveal substantial structural distortions that models fail to expose. The integrated approach provides a more reliable and transparent workflow, ensuring that machine learning is trained only on validated. The thesis concludes by outlining the strengths, limitations, and practical applicability of the proposed architecture. |
| Klíčová slova: | Machine Learning; Data Quality; Great Expectations |
| Název práce: | Možnosti testování moderního stacku pro kvalitu dat a strojové učení |
|---|---|
| Autor(ka) práce: | Jadviščoková, Šárka |
| Typ práce: | Diplomová práce |
| Vedoucí práce: | Máša, Petr |
| Oponenti práce: | Maryška, Miloš |
| Jazyk práce: | English |
| Abstrakt: | Tato práce se zabývá návrhem, implementací a vyhodnocením automatizované architektury pro zpracování dat, ve které je kontrola kvality dat úzce integrována do procesu strojového učení. Řeší zásadní problém moderních datově řízených systémů: modely strojového učení často pracují s daty, která mohou obsahovat nekonzistence nebo porušení doménových pravidel, zatímco tradiční pipeline obvykle neprovádějí systematické kontroly kvality před trénováním modelu. Za tímto účelem byl navržen modulární rámec využívající Docker pro reprodukovatelnost prostředí, Apache Airflow pro orchestraci, Great Expectations pro validaci dat a PostgreSQL pro ukládání a sledování výsledků. Systém obsahuje adaptivní logiku schopnou detekovat problémy s kvalitou dat a automaticky spouštět nápravná opatření. V rámci výzkumu byla vytvořena sada korupčních scénářů – chybějící hodnoty, odlehlé hodnoty, kategorické chyby a kombinované vícetypové poškození – umožňující kvantifikovat, jak různé defekty ovlivňují metriky kvality i výkon modelů. Modely Random Forest a Logistická Regrese byly testovány na zkorumpovaných i opravených datových sadách s cílem změřit jejich degradaci a následnou obnovu. Výsledky ukazují, že i když výkon modelů zůstává vůči mírné korupci relativně robustní, validační metriky odhalují významné strukturální změny, které modely samy nedokážou identifikovat. Integrovaný přístup tak poskytuje spolehlivější a transparentnější workflow a zajišťuje, že strojové učení je trénováno pouze na validních a doménově konzistentních datech. Práce uzavírá shrnutím hlavních přínosů, omezení a praktické využitelnosti navržené architektury |
| Klíčová slova: | Strojové Učení; Datová Kvalita; Great Expectations |
Informace o studiu
| Studijní program / obor: | Data a analytika pro business |
|---|---|
| Typ studijního programu: | Magisterský studijní program |
| Přidělovaná hodnost: | Ing. |
| Instituce přidělující hodnost: | Vysoká škola ekonomická v Praze |
| Fakulta: | Fakulta informatiky a statistiky |
| Katedra: | Katedra informačního a znalostního inženýrství |
Informace o odevzdání a obhajobě
| Datum zadání práce: | 18. 11. 2025 |
|---|---|
| Datum podání práce: | 1. 12. 2025 |
| Datum obhajoby: | 22. 1. 2026 |
| Identifikátor v systému InSIS: | https://insis.vse.cz/zp/88324/podrobnosti |