GPTZeroは正確ですか?独立テストで分かったこと(2026)
GPTZeroは正確ですか?AI文をうまく検出しますが、独立テストでは人間の文章の6%から18%を誤ってAI扱いします。データと、指摘された場合に取るべき対応を確認してください。
GPTZeroはChatGPTやその他のAIツールで書かれた文章の検出が得意ですが、人間の文章を誤って判断してしまうことがよくあります。同社は検出器の精度は約99%だと主張しています。独立テストでは、テストによって異なりますが、人間の文章の6%から18%をAIだと誤ってラベル付けしていることが分かりました。私たちは自分たちで5つのAI検出器をテストし、GPTZeroはAIテキスト10件すべてを検出しました。そのうえで、他の4つの検出器よりも多くの人間の文章にフラグを立てました。
では、GPTZeroのスコアは有用な最初の確認材料になりますが、それだけで最終判断を下すべきではありません。GPTZeroもこれに同意しています。同社自身のFAQでは、結果を誰かを罰するために使ったり最終判断として扱ったりしてはいけないと述べています。以下では、GPTZeroの主張、独立テストで分かったこと、GPTZeroが失敗するポイント、そしてGPTZeroでフラグが立った後に取るべき手順を順に説明します。
GPTZeroとは何ですか?
GPTZeroは2023年1月に登場したAI検出器です。文章を貼り付けるかファイルをアップロードすると、それがAIによって書かれた可能性を教えてくれます。GPTZeroは利用者が1,700万人以上で、主に教員と学生だと述べています。現在は、Grammarlyの開発元であるSuperhumanの一部になっています。

各スキャンでは、入力テキストを3つのグループのいずれかに分類します。人間が書いた、AIが書いた、または両方が混在、です。GPTZeroはAIだと思った文も強調表示し、結果への確信度も示します。無料で最大10,000文字までスキャンできます。有料のPremiumプランは月30万語をカバーし、Advanced Scanとパラフレーズ検出を追加します。
GPTZeroは当初、perplexityとburstinessの2つの指標から始めました。perplexityは語の選択がどれくらい予測可能か、burstinessは1文と次の文の文の長さがどれくらい変化するかを表します。現在のGPTZeroは自社の深層学習モデルを使っており、数百の要因を見ていると説明しています。perplexityとburstinessは、AI検出器が今も主に使う2つのシグナルです。これらは、AI 検出におけるパープレキシティとは何ですか? (そしてあなたの論文にフラグが立てられた理由)とAIライティングにおけるBurstinessとは何か。人間らしく聞こえるかを左右する指標の投稿で詳しく説明しています。さらに、文章表現の多様さを確認するために無料のperplexity Checkerも試せます。
GPTZeroが精度について述べていること
GPTZeroはFAQや技術ページにいくつかの精度に関する数値を掲載しています。以下は、2026年10月時点で同社が主張していた内容です。
| GPTZeroが測定したもの | GPTZeroの数値 |
|---|---|
| 総合精度:AI文と人間の文の検出 | 99% |
| AI文の検出:公的ベンチマークRAID | 95.7% |
| RAIDにおいて誤ってフラグが立てられた人間の文 | 1% |
| 人間とAIが混在する文書での精度 | 96.5% |
| 非ネイティブライターによるTOEFL課題における誤検出 | 1.1% |
| 「highly confident」結果のエラー率 | 1%未満 |
これらの数値の多くはGPTZero自身のテストに基づいています。RAIDの結果は、GPTZeroが報告したとおり、外部ベンチマークによるものです。
GPTZeroは自身の限界についても明確にしています。FAQでは、どの検出器も100%正確ではなく、結果は長い文章のほうがより良くなり、モデルは英語の散文で最も効果が出ると述べています。また、スコアは会話を始めるきっかけにするべきであり、最終判断として扱うべきではないとも書かれています。これは良い助言であり、教員や編集者がGPTZeroのレポートを提示してきた場合にも意識しておく価値があります。
独立したテストで判明したこと
独立した研究者は、GPTZeroが報告している内容よりも多くの誤りを見つけました。主に人間による文章で、使用された文章の種類によって、テストではGPTZeroの誤検知率は6%から18%の範囲に収まっていました。最高値では、人間の文章としてAIだとラベル付けされたものはほぼ5件に1件です。
2023年の国際教育インテグリティ学会誌(International Journal for Educational Integrity)の研究では、GPTZeroやTurnitinを含む14のAI検出ツールをテストしました。いずれも精度が80%を超えることはありませんでした。著者らは、これらのツールはAIを使ったことの証拠として用いるには正確さと信頼性が十分ではないと結論づけました。
英語が第二言語の人ほど誤検知されやすくなります。 2023年の研究では、非母語話者の英語によるエッセイに対して7つのAI検出器をテストし、その約61%がAIだと判定されました。母語話者のエッセイで同じ結果になったのは約5%にとどまります。これは、検出器が予測可能な書き方を手がかりにするためで、より単純な英語ほど予測しやすいからです。
GPTZeroは、この研究で使われた7つの検出器の一つでした。GPTZeroは、この問題への対応を2022年から行ってきたと述べており、現在はTOEFLのエッセイのうち1.1%を誤ってフラグ付けしているとしています。この数値は自社のテストによるものです。より広い問題については、AI検出器が非母語話者を誤って特定する理由で詳しく解説しています。
編集されたAIテキストも、検出器の弱点の一つです。シカゴ大学ブース・スクール・オブ・ビジネスの2025年の研究では、主要な検出器が素のAIテキストを90%以上検出したことが分かりました。同じ文章をAI humanizerに通すと、その大半は半分未満しか検出されませんでした。GPTZeroには、Paraphraser Shieldという機能があり、パラフレーズされて改変されたAIテキストを検出するとしています。
AIで磨いた研究要旨に関する2025年の研究
PeerJ Computer Scienceの2025年の研究では、GPTZero、ZeroGPT、DetectGPTを研究要旨に対してテストしました。最初のテストでは、検出器は、人間が書いた要旨と、ChatGPT o1やGemini 2.0 Proが書いた要旨を見分ける必要がありました。GPTZeroはここで非常に良い成績を収めました。97.22%の精度で、人間の要旨を1つも誤ってフラグ付けしませんでした。
2つ目のテストは、多くの研究者がAIをどう使っているかにより近いものです。著者は、人間が書いた要旨を用意し、同じAIモデルに「読みやすくなるように」書き換えさせました。その後、GPTZeroは、非母語話者の英語著者が磨いた要旨に、より高いAIスコアを付けました。非母語話者ではAI確率の中央値が22.5%であるのに対し、母語話者では9.5%でした。
この研究では、GPTZeroが磨いた要旨を「完全にAIが書いたもの」として扱う頻度も測定しました。その割合は、非母語話者では25%、母語話者では11%でした。さらに、磨きに使うモデルも影響しました。Geminiで改善した要旨の平均GPTZeroスコアは55.5%である一方、ChatGPTで改善した要旨の平均は19.8%でした。
英語が第二言語の方で、要旨を整える目的でAIを使う場合、GPTZeroがそれをフラグ付けする可能性が高くなります。同じ種類の編集をする母語話者は、フラグ付けされにくくなります。AIによる編集の前にあなたが書いた内容を示せるように、元の下書きを残しておきましょう。
私たちのテスト:GPTZeroと他4つの検出器
長さ500から800ワードの文章を合計50本用意し、5つの検出器に通しました。そのうち10本はGPT-4oで書かれ、編集は一切行っていません。残り10本は、ChatGPTがリリースされる前の2018年から2022年に出版されたジャーナル記事です。残りの30本は、非母語話者の英語著者による、編集されたAI下書き、AI humanizerを通したAI下書き、そして公開済みの論文です。最初の2つのグループの結果は以下のとおりです。
| 検出器 | AI文書としてフラグ付けされた数(10件中) | 人間の論文として誤ってフラグ付けされた数(10件中) |
|---|---|---|
| GPTZero | 10 | 4 |
| Turnitin | 9 | 3 |
| Originality.ai | 9 | 1 |
| Copyleaks | 8 | 1 |
| ZeroGPT | 7 | 3 |
GPTZeroは5つのうち最も厳格でした。1つもAI文を見逃しませんでしたが、最も人間らしい文章まで誤ってフラグを立てました。非ネイティブの筆者による10本の論文のうち5本も、ほぼAIとしてフラグを立てました。Originality.aiとCopyleaksは人間による記事をはるかに少なくしか見つけられず、AIのテキストを1本か2本見落としました。すべての検出器にはこのトレードオフがあります。AIテキストをより多くフラグ付けする検出器は、その分、人間のテキストも一緒に多くフラグ付けしがちです。
調査結果の全体は、2026年のAI検出ツールの精度はどの程度か? 実測精度と誤検知でご覧いただけます。ZeroGPTの精度、CopyleaksがAIを検出できるか、Winston AIのテスト結果も確認しました。
AI支援の下書きを自分の言葉で書き直す
当社のacademic humanizerは、引用、専門用語、数値を同じに保ちながらAIスコアを下げるように設計されています。
ProofreaderPro.aiの無料トライアルGPTZeroが間違えるポイント
GPTZeroの誤りには、いくつかの明確なパターンがあります。あなたの文章がそれらのどれかに当てはまる場合、高いスコアは誤検知である可能性が高くなります。
フォーマルな学術執筆
学術的な文章は、決まった定型句、文の長さの安定、そして語の選び方への注意を使います。これらはGPTZeroがAIにつながると関連付ける同じパターンです。そのため、ChatGPTの前から何年も前に書かれたにもかかわらず、私たちのテストでは10本のジャーナル論文のうち4本がフラグを立てられました。方法セクションや先行研究レビューのように固定された構造に従っている場合、検出器にはより予測しやすく見えます。
短い文章
GPTZeroは、長い文章のほうが結果が良いと言っています。また、ドキュメント全体のほうが、1つの段落や1文よりも、より正確な結果が出るともしています。短い文章だと、モデルが扱える情報がはるかに少なくなります。1段落だけを確認する場合は、そのスコアをおおよその見立てとして扱ってください。
混在して編集した下書き
今日の文章の多くは混在しています。あなた自身が主張を書いて、AIツールで文法を直したり、いくつかの行を書き換えたりすることがあるでしょう。GPTZeroはこれに対して「混在」の結果を出し、混在したドキュメントで96.5%の精度だと言っています。ただし、混在の結果は「どれくらいAIを使ったのか」や「何のために使ったのか」を教えてくれないため、判断が難しくなります。
英語以外の言語
GPTZeroは5つの言語を完全にサポートしています。英語、ドイツ語、ポルトガル語、フランス語、スペイン語です。ほかの言語のテキストもスキャンできますが、GPTZeroは結果が最も強いのは英語の文章だと言っています。ギリシャ語、インドネシア語など、このリスト以外の言語で書く場合、結果は検証が十分ではありません。
GPTZeroの結果の読み方
GPTZeroの結果は3つの要素から成ります。1つ目は分類です。人間、AI、混在のいずれかで、それぞれの割合がパーセンテージとして示されます。2つ目は信頼度で、GPTZeroは「不確か」「中程度に確からしい」「高い確からしさ」とラベル付けします。3つ目は文の強調表示で、モデルがAIだと考えた文が示されます。
信頼度に最も注意してください。GPTZeroは「高い確からしさ」の結果における誤り率が1%未満だと言っています。「不確か」な結果は、モデルが判断できないという意味なので、あなたに不利な材料として数えないほうがよいです。「中程度に確からしい」結果は、その間に位置します。
強調された文は、まずどこを見るべきかを教えてくれます。GPTZeroがあなたの定義、手順(方法)のステップ、あるいは他の研究の要約を強調しているなら、それらは学術執筆の中でも最も固定されたパターンに従う部分です。有料プランでは、Advanced Scanによって、結果に最も大きく影響したセクションも表示されます。
GPTZeroはTurnitinより正確ですか?
私たちのテストでは、両者はかなり近い結果でした。GPTZeroは10本のAIテキストすべてと、人間による記事4本をフラグ付けしました。TurnitinはAIテキスト9本と人間の記事3本をフラグ付けしました。さらにTurnitinは、非ネイティブの筆者による10本の論文のうち4本をフラグ付けしました。これはGPTZeroより1本少ない結果です。
両者は、結果の見せ方や、誰が利用できるかの点でより違いがあります:
- TurnitinはAIスコアを1%から19%の範囲では隠し、代わりにアスタリスクを表示します。false positivesがその範囲でより多いからだとしています。GPTZeroは、低いものも含めてすべてのテキストにスコアを表示します。
- 両社とも、誤って人をAI使用者として特定しないために、検出器はある程度のAIテキストを見逃すように設定していると言っています。
- Turnitinを実行できるのは学校と出版社のみです。学生がTurnitinのスコアを見るのは、通常は教員が共有したときだけです。GPTZeroは誰でも利用できます。
そのためGPTZeroは、提出する前に自分の文章を確認する選択肢になります。ただし、そのスコアが学校のTurnitinレポートと一致しない可能性がある点に注意してください。Turnitinの詳細は、許容できるTurnitinスコアとは とhumanizer de IAをTurnitinは検出できるのか をご覧ください。
GPTZeroがあなたの文章をフラグした場合にどうするか
これらの手順は、あなたがすべての単語を書いた場合でも、下書きの一部にAIを使った場合でも有効です。授業のレポート、論文の章、学術誌の投稿にも適用できます。
- ハイライトされた文を確認してください。 GPTZeroがAIだと考えている文はどれかをチェックします。それが定義や方法の説明のように最もかしこまった表現である場合、false positivesでよく見られるパターンです。
- 執筆プロセスの証拠を集めてください。 Google DocsまたはWordのバージョン履歴、メモ、アウトライン、以前の下書きなどが、文章がどのように書かれたかを示します。この種の証拠が重要な理由をプロセスこそ新しい証拠で説明しています。
- 教員または指導者に相談してください。 下書きを持参し、落ち着いて話してください。GPTZero自身のFAQに、結果を最終判断とすべきではないと書かれている点を指摘できます。正式に主張する必要がある場合は、誤ったAI検出フラグへの異議申し立て と、この異議申し立てレターのテンプレートをご利用ください。
- AIで下書きした箇所を見直してください。 文章の一部にAIを使った場合は、その部分を自分の言葉で書き直します。自分の例やデータを追加してください。GPTZeroスコアを下げる方法では、この手順を段階的に説明しています。学校がAI使用の開示を求めているかどうかも確認しましょう。
当社のacademic humanizerはステップ4をサポートします。下書きを修正する際にAIスコアを下げるよう設計されており、引用、専門用語、数値はそのまま維持します。2,000件の学術文書を対象としたベンチマークでは、Balanced設定で修正された文の82.8%がGPTZeroで低いスコアになりました。
よくある質問
Q: GPTZeroは信頼できますか?
素のAIテキストでは信頼性が高い一方、人が書いた文章では信頼性が大幅に下がります。独立したテストでは、人が書いた文章の6%から18%を誤ってフラグしたことが分かっています。GPTZeroのスコアは、下書きやメモと並ぶ一つの情報として使ってください。
Q: GPTZeroはTurnitinより優れていますか?
テストでは両者はかなり近い結果でした。GPTZeroはAIテキスト10件すべてと人間の文書10件中4件をフラグしました。一方、TurnitinはAIテキスト9件と人間の文書3件をフラグしました。主な違いはアクセスで、GPTZeroは誰でも使えますが、Turnitinを実行できるのは学校と出版社のみです。
Q: TurnitinはGPTZeroを使っていますか?
いいえ。Turnitinには独自のAIライティング検出器があり、GPTZeroは別の会社です。GPTZeroは現在、Grammarlyの運営元であるSuperhumanの一部です。同じ文章のGPTZeroスコアとTurnitinスコアは異なる場合があります。
Q: GPTZeroはChatGPT、Claude、Geminiを検出できますか?
はい。GPTZeroはChatGPT、GPT-5、Claude、Gemini、Llama、DeepSeek、そしてそれらを基に作られたツールの文章を検出するとしています。新しいAIモデルがリリースされるたびに、学習データを更新します。
Q: GPTZeroはパラフレーズ済みまたはhumanizerした文章を検出できますか?
GPTZeroは、Paraphraser Shieldがパラフレーズ済みの文章を検出し、AIによる文章の隠蔽に使われる一部のツールで行われる文字の置換も検知すると述べています。結果は独立した検証によって異なります。2025年のChicago Boothの調査では、主要な検出ツールの多くがhumanizerしたAI文章のうち半数未満しかフラグを立てないことが分かりました。
Q: 非ネイティブの英語話者にとってGPTZeroは正確ですか?
問題があります。2023年の調査では、7つの検出ツール(その中にGPTZeroも含まれます)が、非ネイティブの英語エッセイの約61%をAIと判定しました。GPTZeroは、その後、自社テストに基づきTOEFLの英文に対する誤検知率を1.1%まで下げたと述べています。
Q: GPTZeroは無料ですか?
はい。短い文章であれば無料で使えます。最大10,000文字まで無料でスキャンできます。有料のPremiumプランは月30万語、Professionalプランは月50万語を対象にしています。
Q: GPTZeroはどの言語に対応していますか?
GPTZeroは英語、ドイツ語、ポルトガル語、フランス語、スペイン語を完全にサポートしています。ほかの言語もスキャンできますが、結果が最も強いのは英語の文章だと言っています。
Q: GPTZeroは信頼できますか?
はい。GPTZeroは実在の企業で、2023年1月にサービスを開始し、3,500以上の大学が利用していると述べています。ただし、信頼できることと正確であることは別の問題です。人間の文章に対しても誤りを起こすことがある、広く使われているツールです。
引用、専門用語、そして意味を保持しながら、AI支援で作成した下書きを自然な学術文へ修正します。

Dana は ProofreaderPro のコンテンツ クリエイターで、毎日のブログと執筆活動を行っています。 彼女はオンライン編集プラットフォームがどのように機能するかについて記事を書き、毎日顧客メッセージを処理しており、その満足度スコアは 5 つ星です。