数据集和数据生成
检测AI生成文本(AIGT)的主要方法包括水印、统计和风格分析,以及使用预训练语言模型(LMs)。水印检测需要了解水印提取算法,而其他方法则需要数据集来学习区分AIGT与人类撰写的文本的模式。理想情况下,数据集应使用与检测目标相符的AI模型生成,并尽可能接近现实环境。
数据集概述
数据集统计信息
- 大多数可用数据集为英语,其次为多语言(包括英语和其他语言),其中中文占比最大,其次是阿拉伯语。
- 错误信息是最常见的文本领域,新闻、学术写作和论文等领域也较为受欢迎。
- 数据集大小分布广泛,样本数量少于5万个的数据集占多数,但也有相当一部分“大型”数据集(10万至50万个样本之间)。
- 大多数数据集是生成出于研究目的,而非从在线来源收集。
数据集生成方式
- 常见的生成方式包括:从父数据集或基准数据集开始,人工生成相应的AI生成文本。
- 某些生成方法还包括更具体的样式提示,例如模仿特定新闻网站的写作风格。
- 其他方法包括人工文本的AI改写以及协作生成的人工与AI文本。
按领域划分的数据集
问答
- HC3:包含平行的人工编写和AI生成的答案,涵盖医学、金融、通用维基百科和Reddit等领域。
- OpenOrca:一个正在进行的大型数据集,包含人工编写和AI生成的答案,涵盖多个领域。
新闻
- TuringBench:包含由19个语言模型生成的20万篇新闻文章,使用1万篇人类撰写的新闻文章标题作为提示。
- MULTITUDE:包含11种语言的人工撰写和AI生成的文本,由八种不同的最先进的语言模型生成。
- GROVER FakeNews 和 RealNews:由GROVER模型生成的“真实”和“假”新闻。
- CT2:包含由15种不同的大型语言模型生成的150,000篇AI生成的文章。
- OUTFOX:包含由学生撰写的和由AI生成的作文回应。
- ArguGPT:包含由AI生成的文章,提示来自教育材料,以及“分布外”数据集。
随笔
- OUTFOX:包含由学生撰写的和由AI生成的作文回应。
- ArguGPT:包含由AI生成的文章,提示来自教育材料,以及“分布外”数据集。
学术出版物
- tum - nlp / IDMGSP:包含人工撰写和AI生成的科学论文。
- GPABench:包含2,380,000个样本,但目前尚未上线。
- 作弊:包含由ChatGPT撰写的科学摘要,以及人工撰写的摘要。
网站和社交媒体
- OpenGPTText:包含由ChatGPT生成的Reddit帖子重写版本。
- TweepFake:包含“真实” AI 生成和人工生成的Twitter数据。
- GPT - wiki - intro:包含平行的人工编写和GPT-3生成的维基百科文章简介。
多域
- M4:一个多语言、多领域和多生成器模型的数据集,包含7种语言,涵盖多个领域和生成模型。
- HC-Var:包含来自四个领域的ChatGPT生成文本和人工撰写的文本。
- Ghostbuster 数据集:包含人类编写、ChatGPT生成和Claude生成的文本示例。
- MGTBench:在Ghostbuster数据集的基础上增加了额外的生成模型。
- SnifferBench:旨在进行作者归属任务,包含人类和生成模型来源的平行数据。
- SeqXGPT-Bench:将 SniferBench 数据集适应于混合人类-人工智能文档中句子级别检测的任务。
- HC3-SI:专注于需要语义不变性的任务,如总结、翻译和改写。
- MIXSET:专注于检测人类与 AI 合作的挑战性任务。
错误信息
- Spitale、Biller-安多诺和德国尼2023年发布的真假推特:包含真实或虚假信息的推特文本。
- GossipCop++ 和 PolitiFact++:扩展了Fake-NewsNet数据集,包含真实和虚假的人工撰写和AI生成的文本。
- 车慧和费拉拉2024年发布的与COVID-19相关的AI生成推特:包含与COVID-19相关的错误信息的AI生成推特。
- 克里斯、麦肯和布兰戴奇2022年发布的AI生成新闻:包含由不同规模的GPT-2模型生成的英文新闻文章。
- 周等2023年发布的AI生成新闻和社会媒体内容:包含由人类撰写和AI生成的假新闻。
- LLMFake:包含使用各种提示策略自动生成的英语虚假信息文本。
- ODQA:基于NQ-1500数据集构建的开放领域问答数据集。
- F3:包含真实和虚构的人工撰写的以及AI生成的英语新闻文章和社会媒体帖子。
- PropaNEWS:包含自动生成的英语假新闻。
- 江等2023年发布的人工撰写和AI生成的假新闻:包含人工撰写的和AI修改的假新闻文章。
- 胡等2023年发布的AI生成的错误信息解释:包含由GPT-3.5生成的解释,用于证明给定的人撰写的文章的真实性或谬误性。
讨论
- 为特定应用生成新数据集是完全可行的,但需要考虑生态有效性,即生成的数据能够高度准确地模仿将在实际环境中观察到的真实AIGT数据。
- 推荐使用M4数据集,因为它包含多种语言、多个领域和生成器,包括最新的大型语言模型(LLMs)如GPT-4。
- 检测混合的人工智能和人类作者情况需要在训练数据中包含这类示例。
- 未来研究需要解决静态、非交互式生成场景的局限性,并关注对话式AI代理在对话或对话场景中检测AIGT的需求。
- 需要关注AI生成的虚假信息特定领域,并解决数据集生成的任务始终需要追赶新的生成模型的发布的问题。