Porovnání Klasifikačních Metod Strojového Učení Pomocí Monte Carlo Simulací

Název práce: Porovnání Klasifikačních Metod Strojového Učení Pomocí Monte Carlo Simulací
Autor(ka) práce: Tomsa, Kryštof
Typ práce: Bakalářská práce
Vedoucí práce: Konopásek, Martin
Oponenti práce: Formánek, Tomáš
Jazyk práce: Česky
Abstrakt:
Ačkoliv jsou srovnání klasifikačních metod v odborné literatuře poměrně častá, často mají omezený pohled, ať už z hlediska vybraných metod, metrik nebo datových souborů. Tato práce se snaží vydat nekonvenčním směrem využitím simulační studie s Monte Carlo simulacemi. Je vytvořeno celkem osm scénářů pro generování datových souborů s různým nastavením počtu pozorování. Pro každé nastavení je vytvořeno 500 datových souborů. Nejprve jsou vyhodnoceny odhady logistické regrese z hlediska zkreslení a nekonzistentnosti a následně je logistická regrese porovnána s XGBoost, náhodnými lesy, umělými neuronovými sítěmi a logistickou regresí s weight of evidence transformací prediktorů pomocí 7 zvolených metrik. Z výsledků vyplývá, že ke zkreslení odhadů koeficientů dochází za přítomnosti definované časové závislosti, normální distribuce šumu, endogenity a nelinearity, přičemž velké zkreslení je pozorováno v malých datových souborech. Pokud jde o porovnání modelů, tak největší rozdíly v prediktivní síle modelů jsou způsobeny inkluzí (ne)linearity v procesu generování dat a velikostí vygenerovaného datového souboru. Pro malé datové soubory a pro velké soubory za přítomnosti linearity vychází z výsledků nejlépe logistická regrese, v ostatních případech jsou to většinou umělé neuronové sítě.
Klíčová slova: konzistentnost; porovnání modelů; zkreslení; strojové učení; logistická regrese; simulační studie
Název práce: Comparison of Machine Learning Classification Methods Using Monte Carlo Simulations
Autor(ka) práce: Tomsa, Kryštof
Typ práce: Bachelor thesis
Vedoucí práce: Konopásek, Martin
Oponenti práce: Formánek, Tomáš
Jazyk práce: Česky
Abstrakt:
Although comparisons of classification methods are quite common in the literature, they often have a limited perspective, whether in terms of the selected methods, metrics, or datasets. This work tries to go in an unconventional direction by using a simulation study with Monte Carlo simulations. A total of eight scenarios are created for generating datasets with different settings for the number of observations. 500 datasets are created for each setting. First, the logistic regression estimates are evaluated in terms of bias and inconsistency and then the logistic regression is compared with XGBoost, random forests, artificial neural networks, and logistic regression with weight of evidence transformation of predictors using 7 selected metrics. The results show that the bias of coefficient estimates occurs in the presence of defined time dependence, normal distribution of noise, endogeneity, and nonlinearity, with large bias observed in small datasets. When it comes to comparing models, the biggest differences in predictive power of models are caused by the inclusion of (non)linearity in the data generation process and the size of the generated dataset. For small datasets and for large datasets in the presence of linearity, logistic regression performs the best, in other cases artificial neural networks perform the best.
Klíčová slova: logistic regression; machine learning; model comparison; consistency; simulation study; bias

Informace o studiu

Studijní program / obor: Data Analytics
Typ studijního programu: Bakalářský studijní program
Přidělovaná hodnost: Bc.
Instituce přidělující hodnost: Vysoká škola ekonomická v Praze
Fakulta: Fakulta informatiky a statistiky
Katedra: Katedra ekonometrie

Informace o odevzdání a obhajobě

Datum zadání práce: 8. 2. 2025
Datum podání práce: 7. 12. 2025
Datum obhajoby: 29. 1. 2026
Identifikátor v systému InSIS: https://insis.vse.cz/zp/91320/podrobnosti

Soubory ke stažení

    Poslední aktualizace: