Skip to content

Latest commit

Β 

History

20 Commits

Folders and files

NameName
Last commit message
Last commit date
Β 
Β 
Β 
Β 
Β 
Β 
Β 
Β 
Β 
Β 
Β 
Β 
Β 
Β 

Repository files navigation

πŸ“° Multimodal Fake News Datasets

A research-oriented collection of multimodal fake news / misinformation / rumor / disinformation / fact-checking / out-of-context / media manipulation / AI-generated news datasets.

Datasets Core Related Last checked

This collection supports research on Multimodal Fake News Detection (MFND/MMD) and related topics. It brings together papers, official repositories, dataset access links, and structured metadataβ€”including task, modality, language, domain, label type, and data originβ€”to make dataset discovery and comparison faster.


✨ Highlights

  • πŸ“š Currently includes 33 datasets / benchmarks: 21 core datasets + 12 closely related datasets.
  • πŸ•°οΈ Covers classic datasets such as Fakeddit, FakeNewsNet, Weibo, Weibo21, MuMiN, and FakeSV.
  • πŸš€ Continuously includes recent datasets and benchmarks such as ROM, MDSM, FineFake, AMG, MMFakeBench, MFND, MM-Health, VLDBench, DriftBench, DeceptionDecoded, ReMMDBench, and FakeVE.
  • 🌍 Covers different settings including multi-domain, multilingual, social context, external evidence / knowledge, fine-grained labels, multi-image, audio-video, and generative AI.
  • 🧩 Distinguishes between real-world data, curated real-world data, out-of-context construction, synthetic manipulation, mixed real + synthetic data, and GenAI-diversified data.
  • πŸ—‚οΈ catalog/datasets.yaml stores the structured metadata, while datasets/datasets.csv can be directly used for statistical analysis.

πŸ—ΊοΈ Start Here

If you want to… Start with…
Compare the main fake-news datasets Core dataset catalog
Filter candidates by research capability Dataset feature comparison
Explore adjacent fact-checking and manipulation benchmarks Closely related benchmarks
Choose data for a specific research question Dataset recommendations
Reuse the catalog programmatically catalog/datasets.yaml and datasets/datasets.csv

Reading tip: Use the core catalog for datasets whose primary task is misinformation detection. Use the related catalog when studying a neighboring task such as out-of-context detection, fact-checking, or media-manipulation localization.


🧭 Quick Navigation


πŸ“š Core Multimodal Fake News Datasets

The following datasets directly support fake news, misinformation, rumor, disinformation, fine-grained attribution, or short-video fake-news detection.

Link legend: πŸ“„ paper Β· πŸ’» official repository or project page Β· πŸ“¦ dataset access To keep the table readable on GitHub, access details and more complete metadata are stored in datasets/datasets.csv and catalog/datasets.yaml.

Dataset Year Language Main Setting Modalities Labels / Task Scale
DeceptionDecoded
πŸ“„ πŸ’» πŸ“¦
2026 Β· ICLR EN Creator intent / deception intent T+I+R Intent-centric multi-task / misleading intent detection 12,000
DriftBench
πŸ“„ πŸ’» πŸ“¦
2026 Β· AAAI EN GenAI robustness T+I+E Truth verification + 6 diversification categories 16,000
FakeVE
πŸ“„ πŸ’» πŸ“¦
2026 Β· IP&M EN Video fake news V+A+T Explainable fake-news video detection 2,672
FineFake
πŸ“„ πŸ’» πŸ“¦
2026 Β· Information Fusion EN Fine-grained / multi-domain T+I+S+M+K Binary + 6-way fine-grained 16,909
ReMMDBench
πŸ“„ πŸ’» πŸ“¦
2026 Multilingual Multilingual / multi-image / evidence verification T+MI+E 5-way veracity + 8 distortion labels 500
VLDBench
πŸ“„ πŸ’» πŸ“¦
2026 Β· Information Fusion EN Multi-category disinformation T+I 13 benchmark-specific categories β‰ˆ62K
AMG
πŸ“„ πŸ’» πŸ“¦
2025 Β· AAAI ZH Fine-grained fake-news attribution T+I 6-way classification / attribution 4,922
MFND
πŸ“„ πŸ’» πŸ“¦
2025 Β· IJCAI EN Multimodal manipulation T+I 11 manipulation types + localization β€”
MM-Health
πŸ“„ πŸ’» πŸ“¦
2025 Β· EMNLP Findings EN Health misinformation / AI generation T+I Reliability + originality + fine-grained labels 34,746
MMFakeBench
πŸ“„ πŸ’» πŸ“¦
2025 Β· ICLR EN Mixed-source misinformation T+I Binary + 3 coarse classes + 12 subtypes 11,000
FakeTT
πŸ“„ πŸ’» πŸ“¦
2024 Β· ACM MM EN Short-video fake news V+A+T Binary classification 1,991
MΒ³A
πŸ“„ πŸ’» πŸ“¦
2024 Β· CVIU Global Multimedia authenticity T+I+A+V Fine-grained / multi-task β€”
FakeSV
πŸ“„ πŸ’» πŸ“¦
2023 Β· AAAI ZH Short-video fake news V+A+T+S+M Binary + debunking information 5,538
MRΒ²
πŸ“„ πŸ’» πŸ“¦
2023 Β· SIGIR EN / ZH Retrieval-augmented rumor detection T+I+S+M+E 3-way classification 14,700
MuMiN
πŸ“„ πŸ’» πŸ“¦
2022 Β· SIGIR 41 languages Multilingual misinformation T+I+S+M+G Binary classification 12,914 claims
CHECKED
πŸ“„ πŸ’» πŸ“¦
2021 Β· SNAM ZH COVID-19 / health T+I+S+M Binary classification 2,104
Weibo21
πŸ“„ πŸ’» πŸ“¦
2021 Β· CIKM ZH Multi-domain fake news T+I+M Binary classification 9,128
Fakeddit
πŸ“„ πŸ’» πŸ“¦
2020 Β· LREC EN Social media T+I+S+M 2 / 3 / 6-way classification 1,063,106
MM-COVID
πŸ“„ πŸ’» πŸ“¦
2020 Β· IEEE BigData 6 languages COVID-19 / cross-lingual T+S+M Binary classification 11,173
FakeNewsNet
πŸ“„ πŸ’» πŸ“¦
2018 EN News + social propagation T+I+S+M Binary classification β€”
Weibo Multimodal Rumor Dataset
πŸ“„ πŸ’» πŸ“¦
2017 Β· ACM MM ZH Weibo rumor detection T+I+S+M Binary classification 9,528

βœ… Dataset Feature Comparison

This table provides a quick overview of the major differences among the core datasets. βœ… indicates that the feature is an important part of the dataset or an explicitly supported research setting, while β€” means it is not a primary feature.

Dataset Multi-domain Multilingual Social Context External Evidence / Knowledge Fine-grained Labels Generated / Synthetic Data Audio-Video / Multi-image
DeceptionDecoded β€” β€” β€” βœ… βœ… βœ… β€”
DriftBench βœ… β€” β€” βœ… βœ… βœ… β€”
FakeVE βœ… β€” β€” β€” βœ… β€” βœ…
FineFake βœ… β€” βœ… βœ… βœ… β€” β€”
ReMMDBench βœ… βœ… β€” βœ… βœ… β€” βœ…
VLDBench βœ… β€” β€” β€” βœ… β€” β€”
AMG βœ… β€” β€” β€” βœ… β€” β€”
MFND β€” β€” β€” β€” βœ… βœ… β€”
MM-Health β€” β€” β€” β€” βœ… βœ… β€”
MMFakeBench βœ… β€” β€” β€” βœ… βœ… β€”
FakeTT βœ… β€” β€” β€” β€” β€” βœ…
MΒ³A βœ… β€” β€” β€” βœ… βœ… βœ…
FakeSV β€” β€” βœ… β€” β€” β€” βœ…
MRΒ² βœ… βœ… βœ… βœ… βœ… β€” β€”
MuMiN βœ… βœ… βœ… βœ… β€” β€” β€”
CHECKED β€” β€” βœ… β€” β€” β€” β€”
Weibo21 βœ… β€” β€” β€” β€” β€” β€”
Fakeddit β€” β€” βœ… β€” βœ… β€” β€”
MM-COVID β€” βœ… βœ… β€” β€” β€” β€”
FakeNewsNet βœ… β€” βœ… β€” β€” β€” β€”
Weibo Multimodal Rumor β€” β€” βœ… β€” β€” β€” β€”

Note: This table is intended as a quick overview and does not replace the complete dataset definitions in the original papers. Some datasets support multiple tasks; more detailed metadata is available in catalog/datasets.yaml.


πŸ”— Closely Related Benchmarks

The following datasets are highly relevant to multimodal fake-news research but mainly focus on adjacent tasks, such as out-of-context detection, fact-checking, media-manipulation localization, or AI-generated-content detection.

Dataset Year Main Focus Modalities Labels / Task Scale
ROM
πŸ“„ πŸ’» πŸ“¦
2026 Β· ACL Reasoning-enhanced multimodal manipulation T+I+FR Detection + manipulation grounding + forensic reasoning 704,456
MDSM
πŸ“„ πŸ’» πŸ“¦
2026 Β· CVPR MLLM-driven semantic-aligned manipulation T+I Detection + 5 manipulation types + image grounding 441,423
MiRAGeNews
πŸ“„ πŸ’» πŸ“¦
2024 Β· EMNLP Findings AI-generated news T+I Real vs AI-generated 15,000
VERITE
πŸ“„ πŸ’» πŸ“¦
2024 Β· IJMIR Out-of-context misinformation T+I 3-way classification 1,000
COSMOS
πŸ“„ πŸ’» πŸ“¦
2023 Β· AAAI OOC detection T+I Binary classification 204,458 images
DGM⁴
πŸ“„ πŸ’» πŸ“¦
2023 Β· CVPR Multimodal media manipulation T+I Detection + manipulation-type classification + image/text grounding 230,000
FACTIFY 2
πŸ“„ πŸ’» πŸ“¦
2023 Multimodal fact-checking T+I+E 5-way classification 50,000
MOCHEG
πŸ“„ πŸ’» πŸ“¦
2023 Β· SIGIR Fact-checking + explanation T+I+E Verification + explanation generation β€”
FACTIFY
πŸ“„ πŸ’» πŸ“¦
2022 Multimodal fact-checking T+I+E 3-way classification 50,000
NewsCLIPpings
πŸ“„ πŸ’» πŸ“¦
2021 Β· EMNLP OOC image-text mismatch T+I Binary classification 988,283
VisualNews
πŸ“„ πŸ’» πŸ“¦
2021 Β· EMNLP Real news image-caption corpus T+I+M News image captioning / image-text source corpus 1,080,595 images
NYTimes800k
πŸ“„ πŸ’» πŸ“¦
2020 Β· CVPR Real NYT image-caption corpus T+I+M News image captioning / image-text source corpus 792,971 images

πŸ“Š Visual Summary

These figures summarize the full catalog and complement, rather than replace, the dataset-level metadata above.

πŸ“… Datasets by Publication Year

Datasets by year

🧩 Modality Coverage

Modality coverage

πŸ“š Core / Related Distribution

Catalog scope

πŸ” Research Category Distribution

Research categories


🎯 How to Choose a Dataset

Use this table as a first-pass shortlist, then verify licensing, access requirements, and task definitions on each dataset's official page.

Research Direction Recommended Datasets
πŸ–ΌοΈ Classic image-text fake news detection Fakeddit, Weibo, Weibo21
🌐 Social propagation / social context FakeNewsNet, MuMiN, CHECKED, MR²
πŸ”¬ Fine-grained fake type / attribution FineFake, AMG, MMFakeBench, MFND
🧭 Multi-domain generalization FineFake, Weibo21, M³A, VLDBench
🧩 Out-of-context image-text misinformation COSMOS, NewsCLIPpings, VERITE
πŸ› οΈ Image/text manipulation detection and grounding ROM, MDSM, DGM⁴, MFND
πŸ“° Real news image-text source corpora / news captioning VisualNews, NYTimes800k
πŸ”Ž External evidence / retrieval-augmented verification MRΒ², MOCHEG, FACTIFY, FineFake, ReMMDBench
πŸ€– Robustness in the GenAI era MMFakeBench, MM-Health, VLDBench, DriftBench, DeceptionDecoded
✨ AI-generated multimodal news MiRAGeNews, MM-Health
🎬 Short-video fake news FakeSV, FakeTT, FakeVE
🌍 Multilingual / cross-lingual MM-COVID, MuMiN, MR², ReMMDBench
πŸ–ΌοΈπŸ–ΌοΈ Multi-image verification ReMMDBench

πŸ”€ Modality Legend

Abbreviation Meaning Abbreviation Meaning
T Text I Image
MI Multiple Images V Video
A Audio S Social Context
M Metadata E External Evidence
K External Knowledge G Knowledge Graph
R Reference Article FR Forensic Rationale

🧱 Dataset Scope

πŸ“Œ Core

Datasets directly designed for multimodal fake news / misinformation / rumor / disinformation detection, including:

  • Image-text fake news detection
  • Multi-domain / multilingual detection
  • Fine-grained fake type and attribution
  • Social-context modeling
  • Short-video fake news detection
  • Fake-news detection and robustness evaluation in GenAI settings

πŸ”— Related

Datasets that are highly relevant to multimodal fake news research but mainly target adjacent tasks, such as:

  • Out-of-Context (OOC) detection
  • Multimodal fact-checking
  • Media manipulation detection and localization
  • AI-generated news detection
  • Evidence retrieval and explanation generation

Separating these two groups makes it easier to distinguish their research objectives and evaluation settings.


⚠️ Data Origin

The way "fake" or misleading content is created varies substantially across datasets. This distinction is important when comparing model performance.

Type Description
real_world Naturally occurring misinformation from news websites, social media, or short-video platforms
real_world_curated Real-world samples that are selected, curated, or manually verified for benchmark construction
synthetic_pairing Real images, captions, or text are recombined to create out-of-context samples
synthetic_manipulation Images or text are modified through controlled manipulation
mixed_real_and_synthetic Combines real-world data with generated or manipulated samples
genai_diversified Uses generative AI to rewrite, diversify, or regenerate news content

When comparing results across datasets, consider data origin, task definition, label granularity, and modality settings rather than accuracy alone.


πŸ“ Repository Structure

.
β”œβ”€β”€ README.md
β”œβ”€β”€ CONTRIBUTING.md
β”œβ”€β”€ CITATION.cff
β”œβ”€β”€ requirements.txt
β”œβ”€β”€ catalog/
β”‚   └── datasets.yaml
β”œβ”€β”€ datasets/
β”‚   └── datasets.csv
β”œβ”€β”€ analysis/
β”‚   β”œβ”€β”€ summary.json
β”‚   β”œβ”€β”€ datasets_by_year.png
β”‚   β”œβ”€β”€ modalities.png
β”‚   β”œβ”€β”€ scope.png
β”‚   └── categories.png
β”œβ”€β”€ docs/
β”‚   β”œβ”€β”€ METADATA_SCHEMA.md
β”‚   └── SOURCES.md
└── scripts/
    └── build_assets.py

πŸ“Ž Dataset Link Policy

This repository is mainly used to collect and summarize dataset papers, official repositories, and dataset access links. Original dataset files are not re-uploaded or redistributed here.

For download procedures, application requirements, and usage restrictions, please refer to the official page of each dataset.


⭐ Acknowledgement

If this collection is useful for your research, a Star ⭐ is greatly appreciated.

About

A collection and analysis of multimodal fake news datasets across languages, domains, platforms, and modalities.

Topics

Resources

Stars

59 stars

Watchers

0 watching

Forks

Releases

Packages

Contributors

Languages