Detection of Data Exfiltration in Enterprise Network Traffic
| Název práce: | A Unified Deep Neural Network Model for Enterprise Data Exfiltration Detection |
|---|---|
| Autor(ka) práce: | Kinsht, Elizaveta |
| Typ práce: | Bachelor thesis |
| Vedoucí práce: | Zimmermann, Pavel |
| Oponenti práce: | Daňková, Nicol |
| Jazyk práce: | English |
| Abstrakt: | Enterprise data exfiltration is a cross-sector problem that existing signature-based Data Leak Prevention and Detection (DLPD) systems address only partially. Rule engines are accurate on known cleartext content but miss novel encodings, encrypted channels, and behaviours that blend into legitimate enterprise traffic. The academic literature on machine-learning-based detection has produced many specialised detectors for individual exfiltration vectors (DNS tunnels, timing channels, side channels) but very few unified models that cover the full spectrum of MITRE ATT&CK TA0010 techniques in a single pass. This thesis evaluates whether a single packet-level sequence model can close that gap. Three classifiers are trained under matched capacity on two disjoint controlled lab captures produced by Firm A: a vanilla unidirectional LSTM baseline, a Hierarchical-Attention bidirectional GRU (HAGRU, Liu and Liu, 2021), and a Time-aware Historical-attention LSTM (TH-LSTM, Xie et al., 2024). The captures contain fifteen MITRE-mapped exfiltration scenarios and are encoded as a 31-dimensional protocol-agnostic packet-level feature vector consumed through stride-1 sliding windows of length 30. The baseline LSTM reaches 0.9945 PR-AUC on the held-out capture. At matched capacity, TH-LSTM leads the baseline on threshold-dependent metrics (F1, MCC) and wins per-technique PR-AUC on 13 of 15 phases; HAGRU does not outperform the baseline. The contribution is a quantified coverage comparison against a deployed signature DLPD and a failure-mode decomposition rather than a production-ready detector. |
| Klíčová slova: | sequence models; data exfiltration; network traffic classification; LSTM; deep learning |
| Název práce: | Detection of Data Exfiltration in Enterprise Network Traffic |
|---|---|
| Autor(ka) práce: | Kinsht, Elizaveta |
| Typ práce: | Bakalářská práce |
| Vedoucí práce: | Zimmermann, Pavel |
| Oponenti práce: | Daňková, Nicol |
| Jazyk práce: | English |
| Abstrakt: | Exfiltrace podnikových dat je problém napříč sektory, který stávající systémy pro prevenci a detekci úniku dat (DLPD) založené na signaturách řeší pouze částečně. Pravidlové systémy jsou přesné při detekci známého, čitelného obsahu, ale selhávají při detekci nových kódování, šifrovaných kanálů a chování, jež splývají s legitimním podnikovým provozem. Akademická literatura zabývající se detekcí pomocí strojového učení nabízí mnoho specializovaných detektorů pro jednotlivé vektory exfiltrace (DNS tunely, časové kanály, postranní kanály), ale jen velmi málo sjednocených modelů, které pokrývají celé spektrum technik MITRE ATT&CK TA0010 najednou. Tato práce hodnotí, zda jediný sekvenční model na úrovni paketů může tuto mezeru překlenout. Tři klasifikátory jsou natrénovány při shodné kapacitě na dvou disjunktních sadách laboratorních záznamů získaných Firmou A: základní jednosměrný LSTM, hierarchický model s pozorností a obousměrným GRU (HAGRU, Liu a Liu, 2021) a LSTM s časovou a historickou pozorností (TH-LSTM, Xie a kol., 2024). Zachycená data obsahují patnáct scénářů exfiltrace namapovaných dle MITRE a jsou kódována jako 31-rozměrný vektor vlastností paketů nezávislých na protokolu, vstupující do modelu v klouzavých oknech délky 30 se skokem 1. Základní LSTM dosáhl hodnoty PR-AUC 0,9945 na vyčleněné sadě. Při shodné kapacitě vede TH-LSTM nad základním modelem v metrikách závislých na prahu (F1, MCC) a dosahuje nejlepšího PR-AUC ve 13 z 15 fází; model HAGRU nepřekonává základní model. Přínosem práce je kvantifikované srovnání pokrytí proti nasazenému signaturnímu DLPD a analýza selhávajících režimů, nikoliv detektor připravený k produkčnímu nasazení. |
| Klíčová slova: | sekvenční modely; klasifikace síťového provozu; LSTM; hluboké učení; exfiltrace dat |
Informace o studiu
| Studijní program / obor: | Data Analytics |
|---|---|
| Typ studijního programu: | Bakalářský studijní program |
| Přidělovaná hodnost: | Bc. |
| Instituce přidělující hodnost: | Vysoká škola ekonomická v Praze |
| Fakulta: | Fakulta informatiky a statistiky |
| Katedra: | Katedra informačních technologií |
Informace o odevzdání a obhajobě
| Datum zadání práce: | 3. 1. 2026 |
|---|---|
| Datum podání práce: | 15. 5. 2026 |
| Datum obhajoby: | 17. 6. 2026 |
| Identifikátor v systému InSIS: | https://insis.vse.cz/zp/96370/podrobnosti |