Srovnání metod důležitosti rysů pro mikrobiologická data
| Název práce: | Comparison of feature importance methods for a microbiological data |
|---|---|
| Autor(ka) práce: | Havelka, Marek |
| Typ práce: | Bachelor thesis |
| Vedoucí práce: | Máša, Petr |
| Oponenti práce: | Zamazal, Ondřej |
| Jazyk práce: | English |
| Abstrakt: | This bachelor thesis focuses on the comparison of feature importance methods on microbiological data. The aim of the work is to compare the accuracy of the prediction model on a given dataset when manipulating the data according to the selected feature importance methods. Specifically, the SHAP and ARA methods are considered. The theoretical part of the thesis contains definitions of terms and description of the two selected feature importance methods. The methodological part describes how the research of the given issue was carried out, contains a general description of the methods used and their practical application in the practical part of the work. The practical part is implemented in the form of data processing using the Python language in Jupyter Notebook. These tools are used to measure the accuracy of the Catboost prediction model in adjusting the dataset according to importance using the SHAP and ARA methods, as well as factor analysis or Principal Component Analysis. |
| Klíčová slova: | Feature importance method; prediction model; data |
| Název práce: | Srovnání metod důležitosti rysů pro mikrobiologická data |
|---|---|
| Autor(ka) práce: | Havelka, Marek |
| Typ práce: | Bakalářská práce |
| Vedoucí práce: | Máša, Petr |
| Oponenti práce: | Zamazal, Ondřej |
| Jazyk práce: | English |
| Abstrakt: | Tato bakalářská práce se zaměřuje na porovnání metod významnosti rysů na mikrobiologických datech. Cílem práce je porovnat přesnost predikčního modelu na daném souboru dat při manipulaci s daty podle zvolených metod významnosti rysů. Konkrétně jsou uvažovány metody SHAP a ARA. Teoretická část práce obsahuje definice pojmů a popis obou vybraných metod významnosti příznaků. Metodologická část popisuje, jak probíhal výzkum dané problematiky, obsahuje obecný popis použitých metod a jejich praktickou aplikaci v praktické části práce. Praktická část je realizována formou zpracování dat pomocí jazyka Python v Jupyter Notebooku. Tyto nástroje slouží k měření přesnosti predikčního modelu Catboost při úpravě datového souboru podle důležitosti pomocí metod SHAP a ARA a také faktorové analýzy nebo analýzy hlavních komponent. |
| Klíčová slova: | predikční model; metoda významnosti rysů; data |
Informace o studiu
| Studijní program / obor: | Aplikovaná informatika |
|---|---|
| Typ studijního programu: | Bakalářský studijní program |
| Přidělovaná hodnost: | Bc. |
| Instituce přidělující hodnost: | Vysoká škola ekonomická v Praze |
| Fakulta: | Fakulta informatiky a statistiky |
| Katedra: | Katedra informačního a znalostního inženýrství |
Informace o odevzdání a obhajobě
| Datum zadání práce: | 8. 11. 2024 |
|---|---|
| Datum podání práce: | 10. 5. 2025 |
| Datum obhajoby: | 16. 6. 2025 |
| Identifikátor v systému InSIS: | https://insis.vse.cz/zp/90289/podrobnosti |