QuillBotのAI検出器 vs パラフレーズ(言い換え)・humanizer後の文章
QuillBotのAI検出器は、素のAI文や言い換えAI文ではほぼ完璧に近い精度ですが、2025年の研究では、その文章がhumanizerにかけられると精度が58%に低下したことが判明しました。
QuillBotのAI検出器は、素のAI文や言い換えAI文を見分ける点でほぼ完璧です。しかし、2025年の独立した研究によると、その文章がhumanizerにかけられると精度は58%まで下がります。QuillBotは、人気のあるAIパラフレーザーの1つも提供しているため、自社の検出器は他のツールが生み出すまさにその種の言い換え文に対応しなければなりません。
本記事では、QuillBotがスキャン結果をどのようにラベル付けするのか、2025年の研究でパラフレーズ文やhumanizer後の文章について何が分かったのか、そしてQuillBot自身が自社の精度について何を主張しているのかを解説します。さらに、無料版とPremiumの制限、ならびに検出器がTurnitinとどのように関係するのかも取り上げます。
QuillBotの検出器は文章をどうラベル付けするか
QuillBotのスキャンでは、0%から100%のスコアが返されます。また、3つのラベルのうちいずれかが返されます。AI-generated、human-written、AI-refinedです。QuillBotは、ある人が書き始めた文章をAIツールがその後に編集またはパラフレーズした場合に、AI-refinedラベルを使います。これは、モデルが最初から書いた文章とは異なります。QuillBotは、自社のどのツールが最初にその文章に触れたかにかかわらず、同じ3つのラベルを適用します。

実際には、3つのラベルは3つのよくある状況に対応します。手を加えずにそのまま貼り付けたChatGPTやDeepSeekの回答は、通常AI-generatedと判定されます。文法だけ直した人間の下書きは、文の構造に触れないタイプの編集だからこそ、human-writtenのままになりやすいです。paraphraserで言い換えられた人間の下書き、またはhumanizerによって書き直された文章が、QuillBotがAI-refinedラベルを用意したケースです。
フラグが立った各文の横に、予測可能な語り口や不自然に整ったリズムのような短い理由が表示される説明カードが出ます。予測可能な語り口と文のリズムという2つのシグナルは、混雑度(perplexity)やバースト性(burstiness)と一致しており、AI検出器がその名義を変えて使っている指標です。当社のAI検出における混雑度(perplexity)についての解説では、その仕組みをより詳しく説明しています。
QuillBotは、信頼できるスコアには少なくとも80語を推奨しています。精度は300語以上のときが最も高いと言っています。文脈から切り離した1段落のような短い抜粋は、全文がある場合よりもモデルが扱える情報が大幅に少なくなります。QuillBotは、1つのかたまりとしてではなく文ごとにチェックするため、AI-refinedの段落が1つだけ入った長文のレポートでも、全体が必ずしもAI-generatedとしてスコアされるわけではありません。
これらのラベルはいずれも恒久的なものではありません。QuillBotはリビジョン後に同じ文章を再スキャンできますし、文面が変わればラベルがカテゴリ間で移動することもあります。単一スキャンのスコアは、その時点の1つのバージョンを表すものです。文章がどのように書かれたのかまでは示しません。
サイト運営者やブログ運営者は、公開ページに対してQuillBotの証明書と検証バッジを申請することもできます。これは、そのページが人間が書いたものだと示すための方法です。この機能はメインのスキャン用ボックスとは別で、ライブページ上で著作者性の証拠を示したい出版社向けを想定しています。
2025年の研究:DeepSeek、パラフレーズ、humanizer後の文章に対するQuillBot
Hulayyil AlshammariとPraveen Raoによる2025年の研究は、arXivに掲載され、DeepSeek-v3のテキストに対して6種類のAI検出器をテストしました。6種類は、AI Text Classifier、Content Detector AI、Copyleaks、QuillBot、GPT-2、GPTZeroです。研究者らはまず、LLM時代以前の人間が書いた質問と回答のペア49組から始め、その同じ質問に対応するDeepSeek-v3の回答49個を生成しました。さらに、AIの回答を言い換え、そしてAI humanizerで人間らしく整えることで196件を追加し、6つの検出器を全データセットに対して採点しました。
DeepSeek-v3は、多くの一般向け検出器が調整されているモデルより新しいため、この研究が役に立つ理由の一つです。ChatGPT-styleの出力を中心に作られて学習された検出器は、別のモデルが同じように書いた文章を、自動的に同じ基準でうまく扱えるとは限りません。大規模言語モデルが存在する前に書かれた実際の人間の回答から始めている点も、人間の例そのものがAIの影響を受けていない可能性を排除します。
| 条件(DeepSeek-v3テキスト) | 研究におけるQuillBotの結果 |
|---|---|
| 編集していないオリジナル | ほぼ完全 |
| 言い換え(Paraphrased) | ほぼ完全 |
| AI humanizer(Humanized) | 58%の正確性 |
QuillBotとCopyleaksはいずれも、オリジナルおよび言い換えられたDeepSeekのテキストでほぼ完全でした。つまり、それらのツールは対象となったサンプルのごく一部しか取りこぼしていません。AI Text ClassifierやGPT-2を含む他のツールは、同じサンプルに対して結果が一貫しないものでした。6つすべての検出器で、精度に最も大きく影響したのはテキストをAI humanizerで人間らしくしたことです。その結果、Copyleaksは71%まで低下し、QuillBotは58%まで、GPTZeroは52%まで下がりました。
この研究のテキストセットは、検出器のベンチマークとしては規模が控えめです。つまり、元の人間の回答49件、編集していないDeepSeek-v3の回答49件、そしてそれらのAI回答を言い換え、AI humanizerで人間らしく整えて作った追加196件です。6つの検出器にまたがって明確な傾向を示すには十分ですが、より大きいセットであれば割合をより正確に示せます。論文では、専用の検出モデルではなく、few-shotの例とchain-of-thought promptingを用いてDeepSeek自体を検出器としてもテストしています。この部分はDeepSeekの分類能力そのものについてのもので、QuillBotの結果は含まれていません。
AIの下書きを言い換えて、それだけに頼っている人にとって、この研究は参考になるデータです。このテストでは、言い換えによってQuillBotの精度は低下しませんでした。単に語順や文の構造を入れ替えるだけでは、結果を変えるには不十分でした。精度をQuillBotで下げたのはテキストをAI humanizerで人間らしく整えるという変更だけであり、それでもQuillBotはAI humanizer済みのサンプルの大半を検出していました。
学生にとってこの結果で役立つのは、「言い換え」と「書き換え(rewriting)」の違いです。言い換え(paraphraser)は、単語と文の順序の一部を変えます。一方、あなた自身の理解にもとづいて書き換える(rewriting)と、主張、例、構成が変わり、これが「下書きが自分のものになる」理由です。
QuillBotが精度について述べていること
QuillBotは、複数の大規模言語モデルをカバーする独立ベンチマークであるRAIDにおいて、検出率99%だと挙げています。RAIDで何をテストしているのかは、RAIDのリーダーボードで1位に入っているGrammarlyのAI検出器に関する私たちの記事で説明しています。
QuillBotのFAQでは、より多くの誤りが起きると見込む2つの条件を挙げています。学術的な定義、法的な文面、構造化されたテンプレートのような定型的な文章は、誤検知(false positive)を引き起こしやすいとされます。また、大きく言い換えられた、または軽度にAIで編集された文章は、どの検出器にとっても判別が難しくなります。さらにQuillBotは、AI検出器が100%の精度に到達することはないため、結果は1つのシグナルとして扱うべきだとも述べています。
上記の2025年の調査は、多くの検出器が当初チューニングしていなかった新しいモデルであるDeepSeek-v3について、独立したデータポイントを追加しています。
QuillBotのhumanizerページでは、同社がAIライティングのツール群全体をどのように位置づけているかに関する関連ポイントが述べられています。humanizerは下書きを改善するためのものであり、利用者には所属機関または雇用主の方針に従ってAI利用を開示することを求めています。この考え方は、同じアカウント内の検出器にも当てはまります。
文言と構成をそのまま言い換える
当社の学術用 humanizer は、文のリズムや構成だけでなく語彙の選び方も調整します。さらに、引用、専門用語、数値はそのまま保持されます。
ProofreaderPro.ai を無料で試す無料版とPremiumの違い
| 機能 | 無料 | Premium |
|---|---|---|
| 1回のスキャンあたりの語数上限 | 最大1,200語 | 語数制限なし |
| 毎日のスキャン回数 | 最大6回 | 無制限 |
| 解説カード | 無料で1枚 | 本文全体を対象に無制限 |
| 料金 | US$0 | 年払いの場合、月US$4.17 |
QuillBotの無料AI Detectorは、各スキャンを1,200語までに制限し、さらに1日6回までのスキャンが可能で、解説カードはスキャンごとに1枚です。Premiumは両方の制限を解除し、1つだけでなく、フラグが立った各文に対して完全な解説を追加します。残りのQuillBotのツールも同じ価格に含まれ、年払いの場合は月US$4.17です。
1つの短い課題を確認するだけなら、無料枠の上限に到達することはまずないでしょう。1回のスキャンでダブルスペース換算で約4ページ分をカバーできるためです。6,000語の文献レビューを1,200語ずつの区切りで確認する場合、無料プランでは5回のスキャンで済み、1日に6回までという上限の範囲内です。より長いディスsertationの章を、1回の着席で複数回確認するような場合に、1日の上限に最も到達しやすくなります。Premiumでは、レポート全文のコピーをダウンロードすることもできます。これは、最終の割合だけでなく、解説の詳細を上司や編集者に見せたいときに役立ちます。
QuillBotの検出器とTurnitin
QuillBotのAI DetectorとTurnitinは別々の2つのツールであり、それぞれ別の会社によって作られています。また、片方のスコアがもう片方のスコアを予測するものではありません。TurnitinはAIライティング検出を学校、大学、出版社にライセンスしているため、多くの学生がTurnitinの結果を見るのは、指導者を通してのみです。私たちのTurnitinスコアのガイドでは、Turnitinが自社のAIと類似度の数値をどのように表示しているかを説明しています。
2025年8月に、TurnitinはAI bypasser detectionと呼ぶ機能を追加しました。これは、humanizerまたは強力な言い換え(paraphraser)を経たテキストを対象にしたモデル群です。この機能は現在英語のみを対象としています。QuillBot Humanizer代替ガイドでは、今回の更新がQuillBot自身のhumanizerにとって何を意味するのかを詳しく説明します。
2つのツールの実務上の差は、Turnitin対応のコースに提出する人にとって特に重要です。QuillBotのスコアがたとえ安心できるものであっても、TurnitinのAIライティングレポートが低いスコアを表示するかどうかは何も示しません。両者は異なる学習データと異なるしきい値で動作します。
上記のDeepSeekの調査にも同様の分かれ方が示されています。言い換え(paraphrasing)だけではQuillBotまたはCopyleaksの精度は下がりませんでしたが、humanizingは精度に影響しました。Turnitinの2025年の更新は、このギャップを狙い撃ちしています。つまり、検出器が測定できる構造的なパターンをまだ保持したまま、読み方が変わる程度に言い換えたテキストです。
コースでTurnitinを使用している場合は、QuillBotのスキャンを自分の下書きのチェックとして扱い、結果をメモと一緒に保管してください。後になって指導者がTurnitinの結果に疑問を持った場合、スコアのどちらよりも、下書きとメモのほうがより確かな根拠になります。これはプロセスは新しい証拠で説明しています。
Scribbrの無料AI Detectorは、QuillBot自身の技術を使って動作します。Scribbrの検出器ページでは、スキャンがquillbot.scribbr.com(Scribbrのサイト向けに用意されたQuillBotのサブドメイン)から、QuillBotパートナーのスクリプト経由で読み込まれます。ScribbrのAI検出器を確認するでは、これがScribbr自身の結果にとって何を意味するのかを解説しています。
AI の下書きをパラフレーズして、それだけを根拠に検討を進めているなら、上記の研究はもう一度見直す価値があります。自分のメモ、独自の例、自分自身の構成に基づいて内容を書き換えることで、パラフレーズだけを行う人とは異なり、文章そのものに与える影響が大きくなります。まずはツールを並べて比較したい場合は、学術執筆のための QuillBot 代替 と ProofreaderPro.ai と QuillBot の比較 の両方で、QuillBot が学術ドラフトのどこに適しているかを解説しています。どちらのルートを選んでも、QuillBot のガイダンスは引き続き適用されます。コースまたは雇用先のポリシーに従って AI 支援を開示し、検出器のスコアが何を示していてもそれを優先してください。学術用 humanizer は、語彙の選び方だけでなく文の構造も変えることで AI チェックのスコアを低くするよう設計されており、引用、専門用語、数値はそのまま維持されます。
よくある質問
Q: QuillBot の AI 検出器は、自身のパラフレ―ザーを検出できますか?
はい。パラフレーズされた文だけの場合は可能です。Alshammari と Rao による 2025 年の研究では、QuillBot の検出器が、パラフレ―ザーを通した DeepSeek-v3 のテキストに対してほぼ完璧な精度を示しました。同じテキストを humanize することはより大きな課題で、その研究では QuillBot の精度が 58% まで下がりました。
Q: QuillBot の AI 検出器は DeepSeek のテキストに有効ですか?
はい。同じ 2025 年の研究で、QuillBot を DeepSeek-v3 の出力に対して特に検証し、原文およびパラフレーズ版のいずれでもほぼ完璧な結果となり、その試験での Copyleaks の性能と一致しました。
Q: QuillBot の「AI-refined」とはどういう意味ですか?
それは、モデルからの完全な新規生成ではなく、本人の文章を下書きとして作成し、その後 AI ツールで編集またはパラフレーズした文章に付けられる QuillBot のラベルです。QuillBot は文を 1 文ずつ評価するため、AI-refined の段落が 1 つあるだけで、文書全体が AI 生成結果になるわけではありません。
Q: 無料で確認できる単語数はどれくらいですか?
スキャンは 1 回あたり最大 1,200 words、1 日あたり最大 6 回までで、QuillBot の無料プランではこの上限があります。Premium では両方の制限が US$4.17/月(年払い請求)で解除されます。
Q: 検出器目的だけで QuillBot Premium は価値がありますか?
どれくらいの頻度でスキャンするか、また文書がどれくらいの長さかによります。Premium は 1,200-word の上限と、1 日あたり 6 回までという上限を解除し、フラグが立ったすべての文について、1 つだけの説明ではなく各文の詳しい解説を追加します。そのほかの QuillBot のツールも、同じ価格で利用できます。
Q: Turnitin は QuillBot のパラフレーズを検出できますか?
多くの場合、はい。Turnitin は 2024 年 7 月に AI パラフレーズ専用の検出を追加し、2025 年 8 月に humanizer または大規模なパラフレーズを通したテキストを対象とした AI バイパス層を追加しました。QuillBot の humanizer 代替 のガイドでは全体像を説明しています。
Q: QuillBot の検出器は他の言語でも動作しますか?
はい。QuillBot は AI 検出器が英語、スペイン語、フランス語、ポルトガル語を含む 20 以上の言語に対応していると述べています。一方で AI humanizer は対応言語が少なく、スペイン語、ドイツ語、フランス語、ポルトガル語、そして英語の 4 つの方言です。
Q: QuillBot の検出器は Scribbr のものと同じですか?
概ね同じです。Scribbr の AI 検出器ページは、quillbot.scribbr.com という QuillBot のサブドメインからスキャンを読み込み、ページ内に埋め込まれた QuillBot パートナーのスクリプト経由で表示されます。Scribbr の AI 検出器を確認する では、同じツールから得られる結果を Scribbr がどのように提示しているかを解説しています。
引用、用語、意味をそのままにして、AI 支援による学術ドラフトを書き直す

Dana は ProofreaderPro のコンテンツ クリエイターで、毎日のブログと執筆活動を行っています。 彼女はオンライン編集プラットフォームがどのように機能するかについて記事を書き、毎日顧客メッセージを処理しており、その満足度スコアは 5 つ星です。