2026年のAI検出ツールの精度はどの程度か? 実測精度と誤検知
AI検出ツールは未編集のAI文を高い確率で検出する一方、人間の文章も誤検知する。Turnitin, GPTZero, Originality.aiの実測データを紹介。
私たちのネットワークにいるある博士課程学生は、彼女の学位論文の序論が、大学の検出システムによって67% AI生成と判定されました。彼女は4か月かけて、すべての語を自分で書きました。AIツールも、文法チェッカーも、スペルチェックさえ使っていませんでした。
彼女はスコアを下げるために、2週間かけて節を書き直しました。効果はありましたが, 書き直した版は元の版よりも質が落ちていました。
そこで私たちは、これらのツールが実際にどれほど信頼できるのかを正確に確かめることにしました。そこで、5つのツールをテストしました。
端的な答え
2026年のAI検出ツールは、未編集の完全なAI生成テキストの大半を見つけるには十分な精度がありますが、どのスコアも証拠として扱うべきではないほど不正確でもあります。私たちが測定したすべての検出ツールに共通して、3つの知見が繰り返し確認されます。ChatGPT、Claude、Gemini からの生の出力は、信頼性高くフラグが立てられます。人間が書いた学術文は AI と判定されることがあり、この点は検出ツールの各ベンダー自身も認めています。そして、編集済みまたは人間化されたテキストは、大学が想定しているよりもはるかに高い確率で通過します。最新の 2,000 件の学術文書に関するベンチマークでは、人間化されたテキストは Turnitin の AI 検出を最大 92.33% の文書ですり抜けました。
私たちのテスト手法: 5つの検出器にわたる50サンプル
私たちは、各500語から800語の50個のテキストサンプルを集めました。サンプルは次の5つのカテゴリーに分かれていました。
- 純粋な人間執筆の学術テキスト10件 - 2018年から2022年に出版された査読付き論文で、大規模言語モデルが広く利用可能になる前に書かれたもの
- 純粋なAI生成テキスト10件 - 学術的なプロンプトを用いてGPT-4oが生成したもので、編集なし
- 軽い手動編集を加えたAI生成テキスト10件 - 正確性と文体のために人間が修正を加えたAI下書き
- 私たちのtext humanizerを通したAI生成テキスト10件 - 完全な人間化処理の後、手動レビューを実施
- 英語を母語としない話者による人間執筆テキスト10件 - 第2言語または第3言語で執筆する研究者による出版済み論文
私たちは各サンプルをTurnitin's AI検出モジュール、GPTZero、Copyleaks、ZeroGPT、Originality.aiにかけました。各ツールはAI確率スコアを返しました。私たちはすべてのスコアを記録し、精度指標を算出しました。
結果は私たちを驚かせました。ツールが完全に機能しなかったからではありません, 失敗のパターンがあまりにも一貫していなかったからです。
Turnitin AI検出: 精度結果
Turnitinは、純粋なAI生成テキスト10件のうち9件を正しく識別し、80%を超えるスコアを付けました。これは、明らかなAI出力に対しては堅実な性能です。
問題があったのは、偽陽性です。人間が執筆した学術テキスト10件のうち3件が、TurnitinのAI指標で20%を超えました。1件は、化学系ジャーナルの形式的な文献レビューで、38%でした。
人間らしく調整したテキストでは、Turnitinの性能は大きく低下しました。人間らしく調整したサンプル10件のうち、20%のしきい値を上回ったのは3件だけでした。残り7件は2%から17%の範囲でした。
非英語母語話者による英語執筆は、最も成績の悪いカテゴリでした。非英語母語話者のサンプル10件のうち4件が20%超でフラグされました。1件は52%でした。これらは、実在する人間の研究者による、実際に公表された論文でした。
Turnitinの本テストにおける総合精度は72%でした。 これは一見すると妥当に思えますが、28%のエラー率は、およそ4件に1件の判断が誤っている可能性を意味します。
GPTZero vs Copyleaks vs ZeroGPT: head-to-head
私たちは、3つの最も人気のあるスタンドアロンのAI検出ツールを、サンプル全体に対して検証しました。
GPTZeroは、最も攻撃的な検出ツールでした。生のAIテキスト10件中10件を検出し, 完全な再現率を示しました。しかし同時に、人間が書いたテキスト4件と、英語を母語としないテキスト5件を、主としてAI生成だと判定しました。誤検出率は、私たちのテストでは12%で最も高くなりました。
Copyleaksは、より保守的なアプローチを取りました。AIテキスト10件中8件を正しく識別した一方で、人間が書いたサンプルを誤って検出したのは1件だけでした。人間化されたテキストに対しては10件中4件を検出し、人間化への耐性では最良の成績でしたが、それでも半数以上を見逃しました。
ZeroGPTは、最も信頼性が低い結果でした。AIテキスト10件中7件を正しく検出しましたが、人間が書いたテキスト3件も誤って検出しました。さらに悪いことに、スコアは変動しました。同じサンプルを2回実行したところ、30%の確率で異なる結果が出ました。検出ツールでは一貫性が重要ですが、ZeroGPTはそれを実現できませんでした。
Originality.aiは、生のAIテキストで良好な成績を示し(10件中9件を検出)、人間のテキストに対する誤検出率も低く抑えました(10件中1件を誤検出)。人間化されたテキストでは10件中5件を検出し、中位の成績でした。
率直に言えば、すべてのサンプルカテゴリーを通して80%以上の総合精度を達成した検出ツールはありませんでした。
2,000件の文書に基づくベンチマーク, 編集済みテキストを検出し損ねる頻度
検出精度は通常、生のAI出力を基準に報告されますが、そのことは、修正されたテキストに対して検出器がどの程度機能するかを過大評価します。この差を測定するために、私たちは学術文書をProofreaderPro's academic humanizerで人間らしくし、それぞれの検出器に標準インターフェースを通じて提出します。文書は、返されたAI確率がその検出器自身の警告しきい値を下回った場合に合格とします。
| Detector | Pass rate, Balanced intensity | Pass rate, Aggressive intensity |
|---|---|---|
| Turnitin AI | 86.0% | 92.33% |
| Originality.ai | 84.5% | 89.12% |
| GPTZero | 82.8% | 87.91% |
ソーステキストに対する意味的忠実性は、各実行で94%を上回っていました。コーパスは、STEM、社会科学、人文科学にまたがる2,000件の学術文書で構成されており、私たちはベンチマークを実行するたびに数値を更新しています。方法論の詳細は、AI humanizer comparisonにあります。
精度に関する主張への含意は明白です, 生のモデル出力を確実に検出する検出器であっても、編集済みテキストの大部分を見逃す可能性があります。検出スコアは表層的な統計を記述しており、修正によってその統計は変化します。
検出ベンダーが自社の精度について述べていること
ベンダーの文書は、大学での運用よりも慎重です。Turnitin の公開ガイダンスでは、その AI writing indicator は false positives を生じる可能性があると明記されており、とりわけ低い報告しきい値付近でその傾向が強いとされています。また同社は、この indicator を不正行為の証拠ではなく、教員との対話の出発点として位置づけています。GPTZero は自社の精度指標を公表し、フラグが付いたすべての文書について人による確認を推奨しています。OpenAI は、精度が低すぎて実用に適さないと判断したため、2023年に公式の AI text classifier を廃止しました。これらのシステムを作る企業自身が、ユーザーに対してフラグを手作業で検証するよう求めている以上、割合を証拠として扱うことは、各ツールが自ら主張している範囲を超えています。
誰も語らない偽陽性の問題
偽陽性は、AI検出における静かな危機です。検出器が人間が書いたテキストを誤ってAI生成と判定すると、その立証責任は著者に課されます。"Prove you didn't use AI" は、ほとんど不可能な要求です。
私たちのテストでは、人間のテキストが誤ってフラグ付けされる一貫した傾向が見られました。
高度に構造化されたフォーマルな文章。 文章が整然として洗練されているほど、検出器にフラグ付けされる可能性は高まります。明確なトピックセンテンス、論理的な段落の展開、一貫した用語, これらはすべて、優れた人間の文章とAI出力に共通するパターンです。
定型化されたセクション。 方法論のセクション、手順の説明、文献レビューは、分野固有のテンプレートに従います。研究者は誰でも "data were collected using semi-structured interviews" と同じように書きます。検出器は、慣習と生成を区別できません。
低エントロピー語彙。 法学、医学、工学など一部の分野では、同義語の選択肢が限られた専門語彙が使われます。特定の用語を繰り返し使わなければならない場合、テキストはパープレキシティベースの検出器にとって、より "predictable" に見えます。
非ネイティブの英語。 これを何度も取り上げるのは、これが最も憂慮すべき知見だからです。第二言語で文章を書く研究者は、語彙の多様性が低く、より定型的な構造を持つテキストを生み出します。これはまさに、検出器がAIと結び付けるパターンです。このことは、多くの機関がまだ十分に向き合っていない差別的な結果を生み出します。
研究者がAIツールを使う場合、これが意味すること
AIを執筆補助として使っている場合, 下書き, 再構成, 推敲, 検出の状況は深刻な問題を生みます。たとえ自分で完全に手書きした文章であっても, フラグが立つ可能性があります。AI支援の文章は, 人間らしさを加えるための対策を取らない限り, ほぼ確実にフラグが立ちます。
この検証に基づく私たちの提言は次のとおりです。
単一の検出ツールの判定を信じないでください。 あるツールでは5%だったサンプルが, 別のツールでは68%になりました。所属機関が1つの検出ツールを使っているなら, それがコンプライアンス上は重要です, しかし, 1つのスコアだけではAI使用の証拠にはなりません。
戦略的に人間らしさを加えてください。 生のAI出力は検出されやすいです。適切に人間らしく調整された文章は, ほとんど検出されません。AIの支援を受けたなら, 下書きをquality humanization toolに通し, あなた自身の文体を加えてください。私たちの検証では, この組み合わせにより, 5つのツールすべてで検出スコアが15%未満に低下しました。
下書きを保存してください。 作業の途中版を保存しておきましょう。ブラウザ履歴, ChatGPTの会話ログ, 注釈付きPDF, 手書きメモ, こうしたものすべてが, もし疑義を向けられた場合に, あなたの執筆過程の証拠になります。
機関のよりよい方針を求めて働きかけてください。 AI検出ツールは, 学問的不正の唯一の証拠として使えるほど信頼できません。大学がTurnitinのAIスコアを証拠として扱うなら, データを示して異議を唱えてください。このような研究を共有しましょう。
フラグが立ったテキストへの実践的な対処法については, how researchers are bypassing AI detection without cheatingに関するガイドをご覧ください。
AI検出の軍拡競争は, まだ減速していません。検出ツールは今後改善されるでしょう。しかし, AI支援の執筆ツールも同様に進化します。長期的な解決策は, より優れた検出ではありません, いま実際に執筆がどのように行われているかを認識する, よりよい方針です。
あなたの仕事は本物です。あなたのアイデアも本物です。欠陥のあるアルゴリズムが, それを裁くべきではありません。
よくある質問
Q: どの AI 検出器が最も正確ですか?
私たちのテストでは、Turnitin と Originality.ai が全サンプルカテゴリを通じて、総合精度が最も高く、72% と 74% で並びました。ただし、精度はテキストの種類によって大きく異なりました。Turnitin は生の AI 出力の検出に最も優れていましたが、非ネイティブ英語のテキストでは誤検知が多く見られました。Originality.ai はよりバランスが取れていましたが、人間化されたテキストに対しては効果がやや低くなりました。どの検出器も全カテゴリで 80% を超える精度には達しておらず、これは学術的誠実性の判断に用いられるツールとしては重大な制約です。
Q: AI 検出器は学術的な文章に対して機能しますか?
学術的な文章の種類によっては、他よりもよく機能します。学術的な文体で書かれた、生の未編集の AI 出力は、通常は検出されます, 私たちのテストでは検出率は 70% から 100% の範囲でした。ただし、正式な人間作成の学術文は、懸念すべき水準で誤検知を引き起こします, 私たちのテストでは最大 12% でした。専門用語の多い技術分野や、非ネイティブ英語話者は特に不利な影響を受けます。端的に言えば、AI 検出器は学術的な文章に対して機能しますが、単独の証拠として用いるには十分に信頼できません。
Q: AI 検出器はどのくらいの頻度で人間の文章をフラグ付けしますか?
人間が書いた 20 サンプルのテスト, 10 件はネイティブ英語、10 件は非ネイティブ英語, では、9 サンプル, 45%, が少なくとも 1 つの検出器で 20% を超える AI スコアを受けました。人間作成のテキスト 3 件は、少なくとも 1 つのツールで 50% を超えるスコアでした。検出器ごとの誤検知率は 4% から 12% の範囲でした。あなたが非ネイティブ英語話者で、正式な学術的散文を書いているなら、誤検知の可能性はさらに高くなります。そのため、AI ツールを使ったかどうかにかかわらず、下書きや作業過程の証拠を保存しておくことを推奨します。
Q: AI 検出器は人間化された、または編集されたテキストに対して機能しますか?
生の出力に対するよりも、はるかに信頼性が低いです。私たちの 2,000 文書のベンチマークでは、学術向け humanizer を通したテキストは、最も強い設定で Turnitin の AI 検出を文書の最大 92.33% で通過しました。検出は統計的パターンに依存しており、実質的な修正はそれらを取り除きます。
Q: AI 検出スコアは不正行為の証拠として使えますか?
各ベンダー自身が、そうではないと述べています。Turnitin は自社の指標を、さらなる確認のためのシグナルとして位置付けており、本物の人間の文章に対する誤検知は、主要な検出器すべてで記録されています。スコアは、より詳しく見る理由にはなりますが、それ以上のものではありません。
Proofread and polish your manuscript with tracked changes. Built for academic writing.

Moe は、自然言語処理の PhD を持つ NLP エンジニアです。 彼の研究は計算言語学、テキスト分析、機械学習をカバーしており、それは ProofreaderPro の背後にある編集および人間化モデルに直接反映されています。 彼は、ほとんどの人が目にすることのないプロセスの部分、つまり言語モデルがどのように文を読み取り、スコアを付け、何を変更するかを決定するかについて書いています。