Porovnání Klasifikačních Metod Strojového Učení Pomocí Monte Carlo Simulací
| Název práce: | Porovnání Klasifikačních Metod Strojového Učení Pomocí Monte Carlo Simulací |
|---|---|
| Autor(ka) práce: | Tomsa, Kryštof |
| Typ práce: | Bakalářská práce |
| Vedoucí práce: | Konopásek, Martin |
| Oponenti práce: | Formánek, Tomáš |
| Jazyk práce: | Česky |
| Abstrakt: | Ačkoliv jsou srovnání klasifikačních metod v odborné literatuře poměrně častá, často mají omezený pohled, ať už z hlediska vybraných metod, metrik nebo datových souborů. Tato práce se snaží vydat nekonvenčním směrem využitím simulační studie s Monte Carlo simulacemi. Je vytvořeno celkem osm scénářů pro generování datových souborů s různým nastavením počtu pozorování. Pro každé nastavení je vytvořeno 500 datových souborů. Nejprve jsou vyhodnoceny odhady logistické regrese z hlediska zkreslení a nekonzistentnosti a následně je logistická regrese porovnána s XGBoost, náhodnými lesy, umělými neuronovými sítěmi a logistickou regresí s weight of evidence transformací prediktorů pomocí 7 zvolených metrik. Z výsledků vyplývá, že ke zkreslení odhadů koeficientů dochází za přítomnosti definované časové závislosti, normální distribuce šumu, endogenity a nelinearity, přičemž velké zkreslení je pozorováno v malých datových souborech. Pokud jde o porovnání modelů, tak největší rozdíly v prediktivní síle modelů jsou způsobeny inkluzí (ne)linearity v procesu generování dat a velikostí vygenerovaného datového souboru. Pro malé datové soubory a pro velké soubory za přítomnosti linearity vychází z výsledků nejlépe logistická regrese, v ostatních případech jsou to většinou umělé neuronové sítě. |
| Klíčová slova: | konzistentnost; porovnání modelů; zkreslení; strojové učení; logistická regrese; simulační studie |
| Název práce: | Comparison of Machine Learning Classification Methods Using Monte Carlo Simulations |
|---|---|
| Autor(ka) práce: | Tomsa, Kryštof |
| Typ práce: | Bachelor thesis |
| Vedoucí práce: | Konopásek, Martin |
| Oponenti práce: | Formánek, Tomáš |
| Jazyk práce: | Česky |
| Abstrakt: | Although comparisons of classification methods are quite common in the literature, they often have a limited perspective, whether in terms of the selected methods, metrics, or datasets. This work tries to go in an unconventional direction by using a simulation study with Monte Carlo simulations. A total of eight scenarios are created for generating datasets with different settings for the number of observations. 500 datasets are created for each setting. First, the logistic regression estimates are evaluated in terms of bias and inconsistency and then the logistic regression is compared with XGBoost, random forests, artificial neural networks, and logistic regression with weight of evidence transformation of predictors using 7 selected metrics. The results show that the bias of coefficient estimates occurs in the presence of defined time dependence, normal distribution of noise, endogeneity, and nonlinearity, with large bias observed in small datasets. When it comes to comparing models, the biggest differences in predictive power of models are caused by the inclusion of (non)linearity in the data generation process and the size of the generated dataset. For small datasets and for large datasets in the presence of linearity, logistic regression performs the best, in other cases artificial neural networks perform the best. |
| Klíčová slova: | logistic regression; machine learning; model comparison; consistency; simulation study; bias |
Informace o studiu
| Studijní program / obor: | Data Analytics |
|---|---|
| Typ studijního programu: | Bakalářský studijní program |
| Přidělovaná hodnost: | Bc. |
| Instituce přidělující hodnost: | Vysoká škola ekonomická v Praze |
| Fakulta: | Fakulta informatiky a statistiky |
| Katedra: | Katedra ekonometrie |
Informace o odevzdání a obhajobě
| Datum zadání práce: | 8. 2. 2025 |
|---|---|
| Datum podání práce: | 7. 12. 2025 |
| Datum obhajoby: | 29. 1. 2026 |
| Identifikátor v systému InSIS: | https://insis.vse.cz/zp/91320/podrobnosti |