Proofig AIは画像の信頼性チェックの先へ:原稿全体をレビューするOctymのご紹介 →

研究における​AI生成画像の​検出:​テキストの​検出だけでは​不十分な​理由

Abstract illustration of scientific integrity with microscopy patterns and molecular visuals in cool tones.

AI生成テキストの検出ツールとAI生成画像の検出ツールは、根本的に異なる問題を解決するものです。原稿がテキストベースのAIスクリーニングを通過しても、架空の図が含まれている可能性があります。言語パターンを解析するツールには、ピクセルレベルの画像データを評価する仕組みがありません。AIが書いたテキストだけをスクリーニングしている研究者は、信頼性チェックのワークフローに重要なギャップが残っているかもしれません。

AI生成の科学画像は、すでに出版にまで至っている

これは仮定の話ではありません。2024年初め、Frontiers in Cell and Developmental Biology誌に掲載された論文に、意味をなさない解剖学的ラベルが付いた、AI生成のラットの解剖図が含まれていました。これらの図は査読を通過して出版され、その後、論文は出版社によって撤回されました。この事例は、AI生成の科学図が、編集者や査読者の精査をすり抜けるほど本物らしく見えうることを示しました。

画像の信頼性の問題をより広く見渡すと、重要な背景が見えてきます。画像の信頼性の専門家は、投稿段階での編集上のスクリーニングにおいて、投稿されたライフサイエンス分野の原稿の20〜35%が画像に関する問題を指摘されていると報告しています。指摘されたケースのすべてが意図的な不正行為によるものではありません。図の作成やデータの取り扱いにおけるミスでも似たパターンが生じうるため、スクリーニングは責任を追及するためではなく、問題を提示して人によるレビューにつなげるためのものです。AI生成の図が問題になる以前から、画像関連の問題は投稿段階におけるよく知られた課題となっています。

AI生成の図は、この既存の問題に新たな側面を加えています。Nature誌が報じているように、生成AIツールは今や、実際の顕微鏡画像や組織像などのモダリティと見分けるのが難しい、本物らしく見える不正な科学図を作成できるようになっています。こうしたツールは広く利用可能で、その脅威は個別の事例にとどまらず、システム全体に及ぶものと認識されています。

テキスト検出ツールでは、なぜAI生成画像を見つけられないのか?

ChatGPTやClaudeの出力をスクリーニングするツールなど、AIテキストの検出ツールは、トークンの確率、文の構造、文体の均一さ、語の選び方における統計的な規則性といった言語パターンを解析することで機能します。こうした手法は、本来の目的に対しては有効です。しかし、それらはすべて言語の領域で動作します。画像ファイルのピクセルデータ、テクスチャのパターン、構造上の異常を評価する能力はありません。

これは特定のベンダーの限界ではありません。問題とツールとの構造的なミスマッチです。原稿のPDFを調べるAIテキスト検出ツールは、書かれた内容を処理し、図はまったく対象にしないか、せいぜい埋め込まれたテキストラベルを抽出する程度です。顕微鏡画像が実際の装置で撮影されたものなのか、拡散モデルで生成されたものなのかを評価することはできません。

この違いは実務上重要です。現在、機関レベルの信頼性スクリーニングのワークフローの多くは、テキストの類似性とAIが書いたテキストの検出に重点を置いています。これらは価値のあるチェックです。しかし、こうしたチェックを通過した原稿にも、スクリーニングのパイプラインのどこでも評価されていないAI生成の図が含まれている可能性があります。テキストベースのチェックを終えた時点で原稿が完全にスクリーニングされたと考えている研究者は、このギャップに気づいていないかもしれません。

STMコミュニティもこの問題を認識しています。業界全体で使われている現在の信頼性ツールは、AIが生成した意味をなさないテキストや盗用の検出を含め、テキストに大きく重点を置いてきました。画像に特化したAI検出は、大半のスクリーニングプラットフォームで十分に提供されておらず、研究者と出版社の双方に影響する死角を生んでいます。

汎用のAI画像検出ツールが科学論文の図に不十分な理由

AIが生成した写真、アートワーク、ソーシャルメディアのコンテンツを識別するために設計された一般消費者向けのAI画像検出ツールで、このギャップを埋められるのではないかと考える研究者もいるかもしれません。それはできません。理由ははっきりしています。こうしたツールは、科学論文の図とはほとんど似ていない、写真や芸術作品のような画像タイプで訓練されているからです。

ポートレート、風景、デジタルイラストで訓練された検出ツールは、それらの領域に特有のアーティファクトを認識するように学習しています。共焦点顕微鏡画像、ウェスタンブロット、FACSのプロット、組織標本のスライド、細胞培養プレートの画像に見られる視覚的なパターンは学習していません。科学画像のタイプには、それぞれ固有のテクスチャ、ノイズの特性、解像度の特性、構造上の慣例があります。合成のウェスタンブロットを生成するモデルが残すアーティファクトは、合成の写真を生成するモデルが残すものとは異なります。

AI生成の科学画像を効果的に検出するには、複数のモダリティにわたる実際の研究画像を使った、領域に特化した訓練が必要です。対象には次のものが含まれます。

画像タイプ 領域特化型の訓練が重要な理由
顕微鏡画像(共焦点・電子・光学顕微鏡) 固有のノイズパターン、解像度の特性、構造上の特徴が、写真画像とは異なります
ウェスタンブロット・ゲル画像 バンドのパターン、背景のグラデーション、レーンの構造には、専門的なパターン認識が必要です
組織像 組織構造、染色パターン、細胞形態には、領域に特有の視覚的な特徴があります
細胞培養プレート コロニーの分布、ウェルのパターン、増殖の特性は、一般消費者向けのどの画像タイプとも異なります
医用画像 モダリティ特有のアーティファクト(CT、MRI、PET)には、臨床画像データでの訓練が必要です
動物イメージング in vivo蛍光イメージング、生物発光イメージング、解剖学的イメージングには、それぞれ異なる視覚的な特性があります

ProofigのAI生成画像の検出は、これらすべての科学画像タイプに対応しており、広く使われている主要な画像生成モデルで作成された画像を識別します。検出の課題は画像合成ツールの世代が新しくなるたびに変化するため、プラットフォームは新しいモデルの登場に合わせて継続的に更新されています。

画像に特化したAI検出は、実際に何を解析するのか?

独自の技術的な詳細は明かせませんが、研究者にとって大まかなアプローチを理解しておくことは有益です。科学論文の図を対象とした画像特化型のAI検出では、生成モデルに特有のピクセルレベルのアーティファクト、テクスチャの不整合、構造上のパターンを解析します。こうしたパターンは画像タイプによって異なるため、領域に特化した訓練が重要になります。

たとえば、合成の組織画像を生成するモデルは、実際の染色切片に見られる自然なばらつきとは異なる、組織のテクスチャにおける微妙な規則性を生じさせることがあります。架空のウェスタンブロットでは、バンドの縁や背景ノイズの分布が、実際のゲル電気泳動の結果と統計的に整合しないことがあります。こうしたシグナルは、テキストベースのツールでは捉えられず、汎用の画像検出ツールでも確実には捉えられません。

重要なのは、検出には大量の実際の科学画像による訓練が必要だということです。Proofigのプラットフォームは、主要な科学画像のタイプにわたって数十万点の実画像で検証されています。この訓練の基盤があるからこそ、システムは学術出版が求める特異度で、本物の図と合成の図を見分けることができます。

テキストのスクリーニングだけに頼ることの実務上のリスク

投稿に向けて原稿を準備している研究者にとって、実務上のリスクは具体的です。テキストベースのAIスクリーニングやテキストの類似性チェックを通過した原稿が、その後、学術誌の画像の信頼性レビューのプロセスで指摘を受けることがあります。現在、多くの有力学術誌が、AI生成コンテンツを含め、投稿された図に信頼性の問題がないかをスクリーニングしています。Science誌とその姉妹誌がProofigを導入したのも、出版前に加工された画像や問題のある画像を検出するためです。

投稿後にAI生成の図が検出された場合、その結果は修正の依頼からデスクリジェクトまでさまざまです。出版後に検出された場合は訂正や撤回にまで発展し、関わった研究者には金銭面や評判への大きな影響が及びます。根本的な原因が誠実なミスであっても、論文を撤回する研究者が直面する個人としての、そしてキャリア上の深刻なストレスについては、Nature誌も報じています。

強調しておきたいのは、AI生成画像はさまざまな経路で原稿に入り込みうるということです。共同研究者が、出力が出版に適さないことに気づかないままAI支援ツールを使うかもしれません。チームメンバーが仮の図を生成し、差し替えるのを忘れるかもしれません。学生が、どのようなAI支援のワークフローが許容されるのかを十分に理解していないかもしれません。投稿前のスクリーニングは、こうした疑いのある問題が学術誌側の問題になる前に提示し、人によるレビューにつなげるのに役立ちます。

AI生成画像の検出ツールで確認すべきポイント

投稿前の画像スクリーニングのためのツールを評価する研究者は、次の基準を検討してください。

  • 科学画像への対応。ご自身の分野で使われる画像タイプ(顕微鏡画像、ウェスタンブロット、組織像、医用画像、細胞培養プレート、動物イメージング)に具体的に対応していますか?
  • 領域に特化した訓練。一般的な写真やアートワークではなく、実際の科学画像で訓練されていますか?
  • モデルへの追従。新しい生成AIモデルのリリースに合わせて、検出機能を更新していますか?
  • 人によるレビューを前提とした設計。自動的に判定を下すのではなく、ご自身で確認できるように疑いのある問題を指摘するツールですか?目的は、ご自身の判断を支援することであり、それに取って代わることではありません。
  • 低い誤検出率。問題のない画像を多く指摘しすぎるツールは、時間を無駄にし、信頼を損ないます。実際の科学画像の大規模なデータセットで検証され、顕微鏡画像やウェスタンブロットで低い偽陽性率を示しているツールを選びましょう。Proofigは、さまざまなモダリティにわたる数十万点の実際の科学画像で検証されており、画像タイプごとに異なる検出ロジックを用いて誤検出率を低く抑えています。
  • より幅広い信頼性チェック。画像の重複、改変、盗用もスクリーニングできるツールであれば、AI生成コンテンツだけでなく、画像の信頼性に関わるリスク全般に対応できます。

投稿前にギャップを埋める

現在の投稿前のワークフローに、テキストの類似性スクリーニングとAIが書いたテキストの検出は含まれていても、画像に特化したAI検出が含まれていないのであれば、そこにはギャップがあります。それを埋めることは、疑いへの対応ではなく、身を守るための一歩です。研究者が投稿前に参考文献を確認し、データを検証し、校正を行うのと同じ考え方です。Proofigの画像信頼性プラットフォームは、重複、改変、盗用のスクリーニングとあわせてAI生成画像の検出を提供し、テキストツールがそもそも対象として設計されていない、画像に特有のリスクをカバーします。

関連記事