ZACHYCENÍ FOKÁLNÍCH VÍCEROZMĚRNÝCH ÚDAJŮ V LIDSKÝCH A STROJOVÝCH SOUHRNECH FAKT-CHECKŮ
| Název práce: | Capture of focal multidimensional data in human and LLM-based fact-check summaries |
|---|---|
| Autor(ka) práce: | Macák, Matouš |
| Typ práce: | Bachelor thesis |
| Vedoucí práce: | Svátek, Vojtěch |
| Oponenti práce: | Chudán, David |
| Jazyk práce: | English |
| Abstrakt: | In the contemporary information landscape, marked by a surge in data and the rise of "post-information age" challenges, fact-checking journalism has become essential to combat the spread of disinformation by contextualizing public claims. As the volume of fact-checking articles grows, effective summarization is crucial to make these detailed analyses accessible. However, this presents a significant problem: both human and automated summaries risk omitting critical, multidimensional data—such as time, location, and methodology—thereby undermining the factual grounding and value of the summary. This thesis addresses this challenge by first defining "focal multidimensional data" within fact-checking articles. It then develops a novel suite of custom metrics designed to measure the capture of this data, including Data Point Coverage, Dimensional Completeness, and Weighted Data Point Coverage. This framework was applied to a curated dataset of 14 climate-related fact-checks from PolitiFact and their corresponding summaries generated by the gpt-4o-mini large language model (LLM). Our findings indicate that while LLM-generated summaries achieve high semantic coherence (0.86 BERTScore F1), they fail to preserve the underlying evidence, capturing only 37% of the most critical, weighted data points. The analysis further reveals that while dimensions like subject and source are well-preserved, summaries frequently omit the precise quantitative value and, most critically, the temporal context of the data. This study concludes that standard summarization metrics are insufficient for evaluating content in high-stakes, factual domains. The significant gap between semantic fluency and factual integrity highlights the urgent need for dimension-aware evaluation and the development of summarization models explicitly optimized to preserve the dimensional context that underpins factual claims. |
| Klíčová slova: | Summarization; Fact-Checking; Evaluation Metrics; Multidimensional Data |
| Název práce: | ZACHYCENÍ FOKÁLNÍCH VÍCEROZMĚRNÝCH ÚDAJŮ V LIDSKÝCH A STROJOVÝCH SOUHRNECH FAKT-CHECKŮ |
|---|---|
| Autor(ka) práce: | Macák, Matouš |
| Typ práce: | Bakalářská práce |
| Vedoucí práce: | Svátek, Vojtěch |
| Oponenti práce: | Chudán, David |
| Jazyk práce: | English |
| Abstrakt: | V současném informačním prostředí, které se vyznačuje prudkým nárůstem dat a vzestupem výzev „post informačního věku“, se stalo ověřování faktů v žurnalistice zásadní pro boj proti šíření dezinformací prostřednictvím kontextualizace veřejných tvrzení. S rostoucím objemem článků ověřujících fakta je pro zpřístupnění těchto podrobných analýz zásadní efektivní sumarizace. To však představuje významný problém: jak u lidských, tak u automatizovaných shrnutí hrozí, že budou vynechány kritické, vícerozměrné údaje - například čas, místo a metodika -, čímž se podkopává faktická podloženost a hodnota shrnutí. Tato práce se zabývá tímto problémem tím, že nejprve definuje „stěžejní vícerozměrné údaje“ v rámci článků ověřujících fakta. Poté vyvíjí nový soubor vlastních metrik určených k měření zachycení těchto údajů, včetně pokrytí datových bodů, úplnosti dimenzí a váženého pokrytí datových bodů. Tento rámec byl aplikován na kurátorovanou sadu dat 14 faktů souvisejících s klimatem z PolitiFact a jejich odpovídající shrnutí vygenerovaná pomocí velkého jazykového modelu (LLM) gpt-4o-mini. Naše zjištění ukazují, že souhrny vytvořené pomocí LLM sice dosahují vysoké sémantické koherence (0,86 BERTScore F1), ale nedokážou zachovat základní důkazy a zachycují pouze 37 % nejkritičtějších, vážených datových bodů. Analýza dále ukazuje, že zatímco dimenze jako předmět a zdroj jsou dobře zachovány, souhrny často opomíjejí přesnou kvantitativní hodnotu a, což je nejkritičtější, časový kontext dat. Tato studie dochází k závěru, že standardní metriky sumarizace jsou pro hodnocení obsahu ve faktografických doménách s vysokou mírou závažnosti nedostatečné. Značný rozdíl mezi sémantickou plynulostí a faktickou integritou zdůrazňuje naléhavou potřebu hodnocení zohledňujícího dimenze a vývoje sumarizačních modelů explicitně optimalizovaných pro zachování dimenzionálního kontextu, který je základem faktických tvrzení. |
| Klíčová slova: | Metriky hodnocení; Fact-Checking; Sumarizace ; Vícerozměrná data |
Informace o studiu
| Studijní program / obor: | Data Analytics |
|---|---|
| Typ studijního programu: | Bakalářský studijní program |
| Přidělovaná hodnost: | Bc. |
| Instituce přidělující hodnost: | Vysoká škola ekonomická v Praze |
| Fakulta: | Fakulta informatiky a statistiky |
| Katedra: | Katedra informačního a znalostního inženýrství |
Informace o odevzdání a obhajobě
| Datum zadání práce: | 22. 3. 2025 |
|---|---|
| Datum podání práce: | 26. 6. 2025 |
| Datum obhajoby: | 21. 8. 2025 |
| Identifikátor v systému InSIS: | https://insis.vse.cz/zp/91995/podrobnosti |