AI 生成文本检测器与 AI 生成图像检测器解决的是截然不同的问题。一份稿件可能通过了基于文本的 AI 筛查,却仍然包含伪造的图表。分析语言模式的工具没有任何机制来评估像素级的图像数据。只筛查 AI 撰写文本的研究人员,其诚信工作流程中可能仍存在一个重要缺口。
AI 生成的科学图像已经进入发表环节
这并非假想的风险。2024 年初,《Frontiers in Cell and Developmental Biology》上发表的一篇论文包含 AI 生成的大鼠解剖图像,图中的解剖标注毫无意义。这些图表通过了同行评议并已发表,之后该论文才被出版商撤稿。这一案例表明,AI 生成的科学图表可能逼真到足以通过编辑和审稿人的审查。
图像完整性问题的整体状况提供了重要背景。图像完整性专家报告称,投稿的生命科学稿件中有 20% 至 35% 在投稿阶段的编辑筛查中因图像相关问题而被标记。并非每个被标记的案例都反映了故意的不当行为。图表制作和数据处理中的错误也可能产生类似的模式,因此筛查的目的是呈现问题供人工审查,而不是归咎责任。即使不考虑 AI 生成的图表,图像相关问题也早已是投稿阶段公认的挑战。
AI 生成图表为这一现有问题增添了新的维度。正如《Nature》所报道,生成式人工智能工具如今能够生成逼真的虚假科学图表,难以与真实的显微图像、组织学图像及其他成像模态区分。这些工具很容易获取,而且这一威胁被公认为是系统性的,而非个别现象。
为什么文本检测工具无法发现 AI 生成图像?
AI 文本检测器(例如用于筛查 ChatGPT 或 Claude 输出内容的检测器)通过分析语言模式来工作:词元(token)概率、句子结构、风格一致性以及用词上的统计规律。这些方法对其预期用途是有效的,但它们完全在语言领域内运作,无法评估图像文件中的像素数据、纹理模式或结构异常。
这并不是某一家供应商的局限,而是问题与工具之间的结构性错配。AI 文本检测器在检查稿件 PDF 时,会处理书面内容,完全跳过图表,至多提取其中嵌入的文本标签。它无法评估一张显微图像究竟是由真实仪器拍摄的,还是由扩散模型生成的。
这一区别具有实际意义。目前,许多机构层面的诚信筛查工作流程侧重于文本相似度和 AI 撰写文本检测。这些都是有价值的检查。但通过这些检查的稿件,仍可能包含筛查流程中任何环节都未评估过的 AI 生成图表。在完成基于文本的检查后便认为稿件已经过全面筛查的研究人员,可能并未意识到这一缺口。
STM 界已经认识到这一问题。当前全行业的诚信工具在很大程度上侧重于文本,包括检测 AI 生成的无意义文本和抄袭。在大多数筛查平台中,针对图像的 AI 检测仍未得到充分覆盖,由此形成的盲区同时影响着研究人员和出版商。
为什么通用 AI 图像检测器难以胜任科学图表检测
一些研究人员可能会想,面向消费者的 AI 图像检测器(用于识别 AI 生成的照片、艺术作品或社交媒体内容的工具)能否弥补这一缺口。答案是否定的,原因很具体:这些工具是基于照片和艺术类图像训练的,而这些图像与科学图表几乎没有相似之处。
基于人像、风景和数字插画训练的检测器,学会的是识别这些领域特有的伪影。它没有接触过共聚焦显微图像、Western blot(蛋白质印迹)、FACS 数据图、组织学切片或细胞培养板图像的视觉模式。科学图像类型有其自身的纹理、噪声特征、分辨率特性和结构惯例。生成模型合成的 Western blot 所留下的伪影,与合成照片所留下的伪影并不相同。
要有效检测 AI 生成的科学图像,需要基于多种成像模态的真实科研图像开展领域专属训练。这包括:
| 图像类型 | 领域专属训练为何重要 |
|---|---|
| 显微图像(共聚焦、电子、光学显微镜) | 独特的噪声模式、分辨率特性和结构特征与照片类图像不同 |
| Western blot 与凝胶图像 | 条带模式、背景梯度和泳道结构需要专门的模式识别 |
| 组织学图像 | 组织结构、染色模式和细胞形态具有领域特有的视觉特征 |
| 细胞培养板图像 | 集落分布、孔位模式和生长特征与任何消费类图像类型都不同 |
| 医学影像 | 特定模态的伪影(CT、MRI、PET)需要基于临床影像数据进行训练 |
| 动物成像 | 活体荧光成像、生物发光成像和解剖成像具有独特的视觉特性 |
Proofig 的AI 生成图像检测涵盖上述所有科学图像类型,可识别由主流生成模型创建的图像。该平台会随着新模型的出现持续更新,因为检测挑战会随着每一代新的图像合成工具而不断演变。
针对图像的 AI 检测实际分析什么?
在不披露专有技术细节的前提下,让研究人员了解其总体方法是有益的。针对科学图表的图像专属 AI 检测,会分析生成模型特有的像素级伪影、纹理不一致和结构模式。这些模式因图像类型而异,这也正是领域专属训练之所以重要的原因。
例如,生成模型在合成组织学图像时,可能会在组织纹理中引入细微的规律性,这与真实染色切片中的自然变异不同。伪造的 Western blot 可能呈现出条带边缘或背景噪声分布,在统计上与真实凝胶电泳结果不一致。这些信号对基于文本的工具而言是不可见的,通用图像检测器也无法可靠识别。
至关重要的是,检测需要基于大量真实科学图像进行训练。Proofig 的平台已在数十万张真实图像上完成验证,涵盖主要科学图像类型。正是这一训练基础,使系统能够以科学出版所要求的特异性区分真实图表与合成图表。
仅依赖文本筛查的实际风险
对于准备投稿的研究人员来说,这种实际风险是切实存在的。一份稿件可能通过了基于文本的 AI 筛查和文本相似度检查,随后却在期刊的图像完整性审查过程中被标记。许多知名期刊如今都会筛查投稿图表的诚信问题,包括 AI 生成内容。《Science》系列期刊采用 Proofig,正是为了在发表前检测被改动和存在问题的图像。
如果在投稿后检测出 AI 生成图表,后果从要求修改到直接拒稿不等。如果在发表后才被检测出,后果将升级为更正或撤稿,给相关研究人员带来重大的经济和声誉影响。《Nature》曾报道研究人员在撤回论文时承受的巨大个人与职业压力,即使根本原因是无心之失。
值得强调的是,AI 生成图像可能通过多种途径进入稿件。合作者可能使用了 AI 辅助工具,却没有意识到其输出不可用于发表。团队成员可能生成了一幅占位图表,却忘记替换。学生可能并不完全清楚哪些 AI 辅助工作流程是可接受的。投稿前筛查有助于在这些疑似问题成为期刊的问题之前将其呈现出来,供人工审查。
AI 生成图像检测工具应具备哪些特点
评估投稿前图像筛查工具的研究人员应考虑以下标准:
- 科学图像覆盖。该工具是否专门覆盖您所在领域使用的图像类型(显微图像、Western blot、组织学图像、医学影像、细胞培养板图像、动物成像)?
- 领域专属训练。该工具是否基于真实科学图像训练,而非通用摄影或艺术作品?
- 模型时效性。随着新的生成式人工智能模型发布,该工具是否会更新其检测能力?
- 以人工审查为定位。该工具是标记疑似问题供您审查,还是自动给出结论?目标是支持而非取代您的判断。
- 低误报率。标记过多正常图像的工具会浪费您的时间,并削弱信任。请选择已在大规模真实科学图像数据集上完成验证、并在显微图像和 Western blot 上表现出低假阳性率的工具。Proofig 已在涵盖多种成像模态的数十万张真实科学图像上完成验证,并针对每种图像类型采用不同的检测逻辑,以保持较低的误报率。
- 更广泛的诚信覆盖。同时筛查图像重复、图像篡改和图像抄袭的工具,能够应对全方位的图像完整性风险,而不仅仅是 AI 生成内容。
在投稿前弥补缺口
如果您当前的投稿前工作流程包含文本相似度筛查和 AI 撰写文本检测,却不包含针对图像的 AI 检测,那么就存在缺口。弥补这一缺口是一项保护性措施,而不是出于怀疑的应对。这与研究人员在投稿前核对参考文献、核实数据和校对文稿的逻辑相同。Proofig 的图像完整性平台在提供图像重复、图像篡改和图像抄袭筛查的同时,也提供 AI 生成图像检测,覆盖文本工具在设计之初就从未针对的图像特有风险。