ZACHYCENÍ FOKÁLNÍCH VÍCEROZMĚRNÝCH ÚDAJŮ V LIDSKÝCH A STROJOVÝCH SOUHRNECH FAKT-CHECKŮ

Název práce: Capture of focal multidimensional data in human and LLM-based fact-check summaries
Autor(ka) práce: Macák, Matouš
Typ práce: Bachelor thesis
Vedoucí práce: Svátek, Vojtěch
Oponenti práce: Chudán, David
Jazyk práce: English
Abstrakt:
In the contemporary information landscape, marked by a surge in data and the rise of "post-information age" challenges, fact-checking journalism has become essential to combat the spread of disinformation by contextualizing public claims. As the volume of fact-checking articles grows, effective summarization is crucial to make these detailed analyses accessible. However, this presents a significant problem: both human and automated summaries risk omitting critical, multidimensional data—such as time, location, and methodology—thereby undermining the factual grounding and value of the summary. This thesis addresses this challenge by first defining "focal multidimensional data" within fact-checking articles. It then develops a novel suite of custom metrics designed to measure the capture of this data, including Data Point Coverage, Dimensional Completeness, and Weighted Data Point Coverage. This framework was applied to a curated dataset of 14 climate-related fact-checks from PolitiFact and their corresponding summaries generated by the gpt-4o-mini large language model (LLM). Our findings indicate that while LLM-generated summaries achieve high semantic coherence (0.86 BERTScore F1), they fail to preserve the underlying evidence, capturing only 37% of the most critical, weighted data points. The analysis further reveals that while dimensions like subject and source are well-preserved, summaries frequently omit the precise quantitative value and, most critically, the temporal context of the data. This study concludes that standard summarization metrics are insufficient for evaluating content in high-stakes, factual domains. The significant gap between semantic fluency and factual integrity highlights the urgent need for dimension-aware evaluation and the development of summarization models explicitly optimized to preserve the dimensional context that underpins factual claims.
Klíčová slova: Summarization; Fact-Checking; Evaluation Metrics; Multidimensional Data
Název práce: ZACHYCENÍ FOKÁLNÍCH VÍCEROZMĚRNÝCH ÚDAJŮ V LIDSKÝCH A STROJOVÝCH SOUHRNECH FAKT-CHECKŮ
Autor(ka) práce: Macák, Matouš
Typ práce: Bakalářská práce
Vedoucí práce: Svátek, Vojtěch
Oponenti práce: Chudán, David
Jazyk práce: English
Abstrakt:
V současném informačním prostředí, které se vyznačuje prudkým nárůstem dat a vzestupem výzev „post informačního věku“, se stalo ověřování faktů v žurnalistice zásadní pro boj proti šíření dezinformací prostřednictvím kontextualizace veřejných tvrzení. S rostoucím objemem článků ověřujících fakta je pro zpřístupnění těchto podrobných analýz zásadní efektivní sumarizace. To však představuje významný problém: jak u lidských, tak u automatizovaných shrnutí hrozí, že budou vynechány kritické, vícerozměrné údaje - například čas, místo a metodika -, čímž se podkopává faktická podloženost a hodnota shrnutí. Tato práce se zabývá tímto problémem tím, že nejprve definuje „stěžejní vícerozměrné údaje“ v rámci článků ověřujících fakta. Poté vyvíjí nový soubor vlastních metrik určených k měření zachycení těchto údajů, včetně pokrytí datových bodů, úplnosti dimenzí a váženého pokrytí datových bodů. Tento rámec byl aplikován na kurátorovanou sadu dat 14 faktů souvisejících s klimatem z PolitiFact a jejich odpovídající shrnutí vygenerovaná pomocí velkého jazykového modelu (LLM) gpt-4o-mini. Naše zjištění ukazují, že souhrny vytvořené pomocí LLM sice dosahují vysoké sémantické koherence (0,86 BERTScore F1), ale nedokážou zachovat základní důkazy a zachycují pouze 37 % nejkritičtějších, vážených datových bodů. Analýza dále ukazuje, že zatímco dimenze jako předmět a zdroj jsou dobře zachovány, souhrny často opomíjejí přesnou kvantitativní hodnotu a, což je nejkritičtější, časový kontext dat. Tato studie dochází k závěru, že standardní metriky sumarizace jsou pro hodnocení obsahu ve faktografických doménách s vysokou mírou závažnosti nedostatečné. Značný rozdíl mezi sémantickou plynulostí a faktickou integritou zdůrazňuje naléhavou potřebu hodnocení zohledňujícího dimenze a vývoje sumarizačních modelů explicitně optimalizovaných pro zachování dimenzionálního kontextu, který je základem faktických tvrzení.
Klíčová slova: Metriky hodnocení; Fact-Checking; Sumarizace ; Vícerozměrná data

Informace o studiu

Studijní program / obor: Data Analytics
Typ studijního programu: Bakalářský studijní program
Přidělovaná hodnost: Bc.
Instituce přidělující hodnost: Vysoká škola ekonomická v Praze
Fakulta: Fakulta informatiky a statistiky
Katedra: Katedra informačního a znalostního inženýrství

Informace o odevzdání a obhajobě

Datum zadání práce: 22. 3. 2025
Datum podání práce: 26. 6. 2025
Datum obhajoby: 21. 8. 2025
Identifikátor v systému InSIS: https://insis.vse.cz/zp/91995/podrobnosti

Soubory ke stažení

    Poslední aktualizace: