HuggingFace镜像/CommunityForensics-DeepfakeDet-ViT
模型介绍
文件和版本
分析

通知:2026年7月22日

  • 再次开放访问。友善提醒所有用户请遵守MIT许可证。应同时注明原始项目(见底部)和本仓库的出处。除此之外,您可以随意使用该模型。

在4,803个生成器的270万样本上训练(详见训练数据)

模型发表于《Community Forensics: Using Thousands of Generators to Train Fake Image Detectors》(https://huggingface.co/papers/2411.04125)。

作为OpenSight的一部分上传以进行社区验证——OpenSight是一个即将推出的用于自适应深度伪造检测的开源框架。

Project OpenSight Hugging Face Spaces即将上线,将包含评估 playground,并最终推出排行榜。预览:

image/png

模型详情

模型描述

Vision Transformer (ViT)模型在迄今为止最大的数据集上训练,用于法证应用中的AI生成图像检测。

  • 开发者: 密歇根大学 Jeongsoo Park 与 Andrew Owens
  • 模型类型: Vision Transformer (ViT-Small)
  • 许可证: MIT(与[2411.04125v1.pdf]中引用的CreativeML OpenRAIL-M兼容)
  • 微调基础模型: timm/vit_small_patch16_384.augreg_in21k_ft_in1k
  • HF适配: Borderless 为 Hugging Face 推理兼容性进行了适配。

Hugging Face Space 将很快开源,展示多种超快速推理的运行方式。请务必关注我们以获取更新,因为我们将在未来几周内发布一系列项目。

链接

  • 仓库: JeongsooP/Community-Forensics
  • 论文: arXiv:2411.04125
  • 项目页面: https://jespark.net/projects/2024/community_forensics

训练详情

训练数据

  • 来自15+个生成器、4600+个模型的270万张图像
  • 图像总大小超过1.15TB

训练超参数

  • 框架: PyTorch 2.0
  • 精度: bf16混合精度
  • 优化器: AdamW(学习率=5e-5)
  • 轮次: 10
  • 批大小: 32

评估

未经验证的测试结果

  • 未经验证的原因是我们目前缺乏资源来评估超过1.4T的大型数据集。
指标数值
准确率97.2%
F1分数0.968
AUC-ROC0.992
误报率2.1%

image/png

重采样和精炼数据集

  • 即将推出™

引用

BibTeX格式:

@misc{park2024communityforensics,
    title={Community Forensics: Using Thousands of Generators to Train Fake Image Detectors}, 
    author={Jeongsoo Park and Andrew Owens},
    year={2024},
    eprint={2411.04125},
    archivePrefix={arXiv},
    primaryClass={cs.CV},
    url={https://arxiv.org/abs/2411.04125}, 
}