Grammarly AI Detector: 그 #1 RAID 순위가 의미하는 것
Grammarly의 AI 감지기는 공개된 벤치마크 RAID에서 #1로 순위가 매겨져 있습니다. RAID 테스트가 무엇인지, 해당 순위가 글(에세이)에 어떤 의미가 있는지, 그리고 Grammarly가 AI humanizer를 어떻게 연결하는지 확인해 보세요.
Grammarly의 AI detector는 편집되지 않은 일반적인 AI 텍스트를 식별하는 데 정확하다고 말합니다. Grammarly는 99% 정확도에 도달하며 RAID에서 품질 기준으로 #1을 기록한다고 안내합니다. 이런 순위는 동일한 큰 고정 글 샘플 세트에서의 성능을 반영합니다. 다만 이는 본인 글, 해당 분야의 어휘, 여러 차례 수정한 초안에 대해 특정 점수를 보장하는 것은 아닙니다.
Grammarly의 AI detector가 확인하는 항목
Grammarly의 AI detector는 grammarly.com에서 사용할 수 있는 무료 스캔 도구입니다. 텍스트를 붙여넣거나 파일을 업로드한 뒤 AI용 스캔(Scan)을 클릭하면 됩니다. 도구는 글에서 AI가 생성된 것으로 보이는 비율을 백분율 점수로 반환하며, 두 가지 범주로 나눕니다. "Resembles AI text"와 "No AI text patterns found"입니다. 전체 백분율은 문서에서 "Resembles AI text" 범주에 해당하는 비율입니다. 어떤 사용자는 이 도구를 "Grammarly AI checker"라고 검색하기도 하는데, 이는 동일하게 무료로 제공되는 감지기입니다.

해당 감지기는 Grammarly의 글쓰기 제품군 안에서 제공되는 한 가지 도구로, 문법 checker, 표절 checker, AI humanizer 옆에 위치합니다. Grammarly는 Grammarly 자체에서 생성된 AI 텍스트뿐 아니라 ChatGPT, Gemini, Claude 같은 도구에서 생성된 텍스트도 식별한다고 말합니다.
Grammarly Pro는 AI Detector 에이전트를 추가하는데, 이는 단일 점수보다 한 단계 더 나아갑니다. AI로 생성된 것으로 보이는 특정 구절을 표시하고, 왜 해당 문구가 그렇게 보이는지 설명하며, Grammarly의 AI Rewriter를 통해 같은 구절을 한 번의 클릭으로 다시 작성하는 옵션을 제공합니다.
또한 Grammarly는 감지기가 사람의 글을 잘못 표시하지 않도록 설계되었다고 말하며, 새로운 AI 모델이 출시될 때마다 자사 모델이 지속적으로 업데이트된다고 설명합니다. Grammarly는 연구 논문, 보고서, 기사, 학교 과제 등 여러 종류의 글에 대해, 제출 전에 반드시 점검해 볼 수 있는 도구로 이 감지기를 마케팅합니다.
RAID가 무엇인지, 그리고 Grammarly의 #1 순위가 의미하는 것
RAID는 학술 벤치마크이며 Grammarly가 이를 직접 만든 것은 아닙니다. 기초 논문은 연구자 Liam Dugan과 공동 연구자들이 주도했으며 2024년 Association for Computational Linguistics(연례 ACL) 컨퍼런스에서 발표되었습니다. 초록은 핵심 포인트를 직접적으로 밝힙니다. 많은 상용 및 오픈 소스 감지기들은 99% 정확도 또는 그 이상을 주장하지만, 어려운 데이터셋으로 테스트되는 경우는 매우 드뭅니다.
RAID 데이터셋은 설계상 대규모로 구성되어 있습니다.
| RAID 논문에서 테스트한 항목 | 세부 사항 |
|---|---|
| 데이터셋의 생성(Generations) | 6백만 건 이상 |
| 포함된 글쓰기 모델 | 11 |
| 글쓰기 도메인 | 8 |
| 적대적 공격(Adversarial attacks) | 11 |
| 디코딩 전략(Decoding strategies) | 4 |
| 평가된 감지기(Detectors) | 12개(오픈 소스 8개, 클로즈드 소스 4개) |
해당 12개 탐지기 전반에서 논문 저자들은 일관된 취약점을 확인했습니다. 현재 탐지기들은 적대적 공격, 샘플링 전략 변경, 반복 패널티, 그리고 학습 시에는 보지 못한 생성형 모델에 의해 쉽게 속는다는 점이 드러났습니다. 저자들은 전체 데이터셋을 공개하고, 그 후 다른 탐지기 회사들도 이에 맞서 테스트할 수 있도록 실행용 리더보드를 함께 공개했습니다.
그 공개 리더보드가 RAID를 ‘검증 가능한’ 순위로 만드는 요소 가운데 하나입니다. 다른 연구자와 탐지기 회사들은 동일한 데이터셋을 각자의 도구로 실행하고 결과를 비교할 수 있습니다. 이는 어떤 단일 회사가 외부에서 확인할 방법 없이 보고하는 정확도 수치와는 다릅니다.
논문 저자들은 평가를 ‘도메인 외(out-of-domain) 및 적대적(adversarial) 강건성’의 시험이라고 설명합니다. 쉽게 말해, 탐지기가 자신이 학습한 것과 비슷한 텍스트에서 얼마나 잘 작동하는지만 본 것이 아닙니다. 또한 각 탐지기가 기대하도록 만들어지지 않았을 수 있는 도메인, 모델, 공격 상황에서의 성능도 함께 점검했습니다.
Grammarly의 자체 블로그는 해당 리더보드에서 Grammarly가 품질 기준 1위를 차지했다고 말합니다. 그 글은 RAID를 670,000건 이상의 텍스트를 대상으로 한 테스트로 설명하며, 다양한 글쓰기 스타일, AI 모델, 그리고 탐지기를 속이려는 시도까지 포함한다고 합니다. Grammarly의 블로그는 더 나아가, 어떤 AI 탐지기도 100% 정확하지 않다고 분명히 밝힙니다. 그조차도 자사의 최고 순위 탐지기입니다.
리더보드 순위는 한 번 측정된, 하나로 공유되고 고정된 텍스트 세트에 대한 상대 점수입니다. 이 리더보드는 그 데이터셋에서 탐지기가 어떤 성과를 냈는지를 알려줍니다.
같은 탐지기가 사용자의 에세이에서는 어떤 점수를 받을지까지 예측해 주지는 않습니다. 사용자의 에세이는 분야별 고유 어휘와 사용자의 글쓰기 습관을 가지고 있으며, 여러 차례의 수정 과정을 거쳤을 수도 있습니다. RAID의 데이터셋은 그런 패턴을 통제된 방식으로 점검하도록 설계되었습니다. RAID는 특정 개인의 실제 에세이를 그대로 재현하도록 만든 것이 아니며, 아무리 크고 유명한 벤치마크 결과라도 제출 전에 사용자의 초안을 직접 확인하는 행위를 대신하지 못합니다.
Grammarly의 자체 AI 기능과 AI 점수
Grammarly의 AI 탐지기는 다른 회사의 AI 도구에서 만든 텍스트만 확인하는 것이 아닙니다. Grammarly의 자체 페이지는 Grammarly에서 생성된 AI 문장뿐 아니라 ChatGPT, Gemini, Claude 같은 도구로 만든 텍스트에서도 AI 생성 텍스트를 식별한다고 밝힙니다. 이 문장은 드래프트 작성 중 Grammarly의 자체 AI 기능을 사용한다면 특히 중요합니다.
Grammarly의 요금제 페이지에는 기능이 서로 다른 항목으로 나열되어 있습니다. 문법 및 맞춤법 교정은 ‘실수 없이 쓰기(Write without mistakes)’ 아래에 있으며, 생성형 기능은 ‘AI 프롬프트로 텍스트 생성(Generate text with AI prompts)’ 아래에 나열됩니다. 이 생성형 기능은 요금제에 따라 제공량이 다릅니다. 이는 서로 다른 두 종류의 도움입니다. 오타나 잘못 배치된 쉼표를 고치는 것은 새로운 문장을 만들어 내지 않지만, Grammarly에게 문단을 작성하거나 다시 쓰도록 요청하는 것은 새로운 문장 생성으로 이어질 수 있습니다.
Grammarly의 AI Rewriter를 많이 쓰거나 생성형 프롬프트를 적극적으로 활용하는 경우가, 드래프트에서 AI 점수로 나타날 수 있는 부분입니다. 특히 본인 글을 편집하는 대신 전체 문장이나 문단을 생성할 때 그렇습니다. 문법과 맞춤법 교정만 사용하는 학생은 Grammarly에서 새로운 텍스트를 생성하는 기능을 사용한 것이 아닙니다. 그런 사용만으로는 Grammarly 자체 탐지기에서 경고 신호가 발생할 가능성이 높지 않습니다. 다만 학술 글쓰기의 경우, 저희는 학술 작업을 위한 Grammarly의 AI humanizer를 검토하면서 Grammarly의 생성형 기능이 인용문과 기술 용어 주변에서 얼마나 잘 버티는지 살펴봅니다. 연구 논문이나 학위논문을 위해 Grammarly를 다른 도구들과 비교해 보고 있다면, 저희의 ProofreaderPro.ai와 Grammarly 비교도 그 관점을 함께 다룹니다.
제출하기 전에 초안을 확인하세요
저희 academic humanizer는 여러분의 고유한 글의 톤으로 높은 AI 점수를 낮추도록 설계되었으며, 인용문, 기술 용어, 숫자는 손대지 않습니다.
ProofreaderPro.ai 무료를 사용해 보세요저자성: 사용자가 어떻게 썼는지에 대한 기록
Grammarly의 Authorship 기능은 AI 탐지기와 별도로 제공되며, 단일 점수라기보다 ‘작성 이력 기록’에 더 가깝습니다. 문서를 작성하는 동안 추적하고 각 구간을 분류합니다. 사용자가 직접 입력한 내용, 온라인 출처에서 가져온 내용, 그리고 AI로 생성된 내용입니다. Authorship은 Grammarly의 표절 검사기와 인용 생성기와 동일한 제품군의 일부입니다. 표시된 AI 점수가 글에 대해 Grammarly가 남길 수 있는 기록의 전부는 아닙니다.
지도교수나 편집자가 글에서 AI 점수에 의문을 제기한다면, Authorship은 본인이 직접 설명하는 것 이상으로 보여줄 수 있는 자료를 제공합니다. 내 원고 초안과 버전 기록을 보관하는 것과 같은 취지입니다. 이 접근 방식은 프로세스는 새로운 ‘증거’다에서 다룹니다. 글이 어떻게 발전해 왔는지에 대한 기록은 단 하나의 백분율보다 설득력이 더 큽니다. 만약 표기가 공식 분쟁으로 이어진다면, 가짜 AI 탐지 플래그에 이의를 제기하기에 다음 단계가 안내되어 있습니다.
Grammarly가 탐지기와 humanizer를 연결하는 방식
Grammarly의 AI detector와 AI humanizer는 Grammarly 제품군에서 각각 별개의 도구이며, 각자 독립된 페이지와 FAQ가 있습니다. 탐지기는 AI 및 사람 텍스트 샘플을 기반으로 학습된 모델이라고 설명됩니다. humanizer는 Grammarly의 언어학자와 엔지니어가 구축한 도구라고 설명됩니다. AI 텍스트를 미리 정해진 네 가지 음성 중 하나로 다시 쓰거나, 글쓰기 샘플로 사용자가 만든 맞춤 음성을 사용할 수 있습니다.
두 페이지는 ‘Go beyond’ 섹션 아래에서 서로를 연결합니다. Grammarly의 Authorship 기능은 문서의 어떤 부분이 입력되었는지, 온라인에서 출처가 가져왔는지, 또는 AI로 생성되었는지를 보여 주어 이들을 하나로 묶어 줍니다. Grammarly의 humanizer FAQ는 이 도구가 AI 탐지기를 우회하는 데 도움이 되는지에 대해 직접 묻고, Grammarly의 답은 그런 용도로 만들어진 것이 아니라는 것입니다. humanizer를 AI 보조 작성이 더 명확하고 자연스럽게 들리도록 만드는 방법이라고 설명합니다.
Grammarly와 GPTZero
Grammarly와 GPTZero는 동일한 모회사를 공유합니다. Grammarly의 사이트 바닥글에는 GPTZero가 Superhuman과 함께 ‘Company’ 항목 아래에 나열되어 있으며, GPTZero의 자체 사이트는 Grammarly를 소유한 것과 마찬가지로 Grammarly도 포함한 Superhuman 패밀리의 일부라고 설명합니다. 다만 어떤 회사도 탐지기 페이지에서 두 도구가 동일한 탐지 모델을 공유한다고 말하지 않으므로, 공동 소유가 점수 일치를 의미하지는 않습니다.
실제로 같은 에세이에 대해 Grammarly 점수와 GPTZero 점수가 서로 다를 수 있습니다. 두 회사가 탐지기를 각각 운영하고 업데이트하기 때문입니다. 한 초안을 두 도구에서 모두 확인해 보고, 각 도구가 표시한 구간을 비교해 보세요. 표시된 구간은 두 개의 백분율보다 초안에 대해 더 많은 정보를 알려줍니다. 우리는 우리의 GPTZero 리뷰에서 GPTZero가 제시한 자체 수치, 즉 자체 정확도 주장까지 검토했습니다.
무료 vs Pro
Grammarly의 AI detector 스캔은 grammarly.com에서 무료입니다. 텍스트를 붙여 넣거나 업로드한 뒤 ‘AI용으로 스캔(Scan for AI)’을 클릭하면 백분율 점수를 확인할 수 있습니다. Grammarly Pro는 한 달 US$12이며 AI Detector 에이전트를 해제하고, 구간 단위 플래그와 AI Rewriter를 통한 한 번 클릭 다시쓰기 기능을 제공합니다. Grammarly Enterprise는 더 큰 조직을 대상으로 하며, 표시된 가격 대신 Contact Sales 가격 모델을 사용합니다.
| 플랜 | 가격 | AI 탐지 |
|---|---|---|
| 무료 | 한 달 US$0 | grammarly.com에서 AI용으로 스캔(Scan for AI) |
| Pro | 한 달 US$12 | AI Detector 에이전트, 구간 단위 플래그, AI Rewriter, 7일 무료 체험 |
Grammarly의 AI 프롬프트 허용량도 요금제에 따라 달라집니다. Free에서는 월 100개, Pro에서는 월 2,000개, Enterprise에서는 무제한 허용량이 적용됩니다. 이 한도는 Grammarly의 생성 기능에 적용되며, 어떤 요금제에서도 제한이 명시되지 않은 탐지 스캔 자체에는 적용되지 않습니다. 연구용 글쓰기에 Grammarly의 무료 요금제가 무엇을 빠뜨리는지 더 자세히 보려면 학술 글쓰기를 위한 Grammarly 무료 대안에 대한 저희 리뷰를 확인하세요.
높은 벤치마크 순위는 유용한 정보이지만, 여러분의 에세이에 대한 약속은 아닙니다. AI 도움을 받아 수정한 초안이 여전히 높은 점수를 받는다면, 저희 academic humanizer는 그 점수를 낮추도록 설계되었습니다. 이 도구는 여러분의 고유한 글의 톤을 유지하며, 인용문, 기술 용어, 숫자는 건드리지 않습니다.
자주 묻는 질문
Q: Grammarly의 AI humanizer는 AI 탐지기와 같은 엔진을 사용하나요?
Grammarly는 두 도구를 별개의 도구로 설명하며, 각각에 대해 별도의 페이지와 작동 방식에 대한 설명이 있다고 밝힙니다. 탐지기는 사람과 AI 텍스트 샘플을 바탕으로 학습된 모델이라고 설명되고, humanizer는 Grammarly의 언어학자와 엔지니어가 만든 도구라고 설명됩니다. 어느 페이지도 두 도구가 같은 모델을 공유한다고 말하지 않습니다.
Q: Grammarly의 humanizer는 탐지기와 함께 작동하도록 설계되었나요?
네. Grammarly의 humanizer FAQ는 이 도구가 사람들이 AI 탐지기를 우회하도록 돕기 위한 것이 아니라고 말합니다. 또한 humanizer를 탐지기와, Grammarly의 인용 및 Authorship 기능과 함께 사용하는 것을 권장하여 AI 사용이 투명하게 드러나도록 합니다.
Q: Grammarly는 humanizer와 탐지기를 짝을 이루는 워크플로로 마케팅하나요?
네. 두 페이지 모두 "Go beyond" 섹션 아래에서 서로를 연결합니다. Grammarly의 Authorship 기능은 문서에서 입력된 부분, 온라인에서 가져온 출처, AI로 생성된 부분이 무엇인지 보여줌으로써 이 둘을 하나로 묶어 줍니다.
Q: Grammarly를 사용하면 제 글이 AI처럼 보이나요?
그럴 수 있습니다. Grammarly의 생성 기능에 크게 의존하면 그렇게 될 수 있습니다. Grammarly의 탐지기는 ChatGPT, Gemini, Claude에서 생성된 출력도 동일한 방식으로 식별합니다. 문법과 맞춤법 교정은 이 신호에 포함되지 않습니다. AI Rewriter로 생성했거나 AI로 크게 다시 쓴 텍스트는 신호에 포함됩니다.
Q: Grammarly AI 검사기는 무료인가요?
네. grammarly.com의 스캐닝 도구는 무료입니다. 텍스트를 붙여넣거나 업로드하면 퍼센트 점수를 받을 수 있습니다. 문장 단위 플래그와 원클릭 리라이트가 포함된 AI Detector 에이전트는 Grammarly Pro 구독이 필요하며, 비용은 월 US$12입니다.
Q: Winston AI는 Grammarly의 AI 탐지기와 어떻게 비교되나요?
Winston AI는 99.98% 정확도를 주장하며, Grammarly의 99% 주장보다 약간 더 높습니다. 외부 테스트 결과에 따르면 Winston의 실제 정확도는 약 75%에서 83%에 가깝다고 하며, 이는 Winston AI 탐지기 정확도의 분석에 근거합니다. Grammarly는 내부 테스트와 RAID 순위의 조합을 바탕으로 자체 수치를 제시합니다.
Q: Grammarly는 GPTZero와 연결되어 있나요?
네. 소유 관계를 통해 연결되어 있습니다. Grammarly의 사이트에는 Superhuman 옆에 GPTZero가 회사 푸터에 표시되어 있고, GPTZero의 자체 사이트도 Grammarly를 소유한 동일한 Superhuman 계열의 일부라고 설명합니다. Grammarly는 자사 탐지기가 GPTZero의 기술을 사용한다고 말하지는 않습니다.
Q: Grammarly의 RAID 순위는 무엇을 측정하나요?
Grammarly의 탐지기가 RAID가 공개한 데이터셋에서 얼마나 성과를 보였는지, RAID가 평가한 다른 탐지기들 대비로 측정합니다. Grammarly의 자체 블로그는 해당 데이터셋을 다양한 글쓰기 스타일과 AI 모델을 포함해 670,000건이 넘는 텍스트로 구성되어 있으며, 탐지기를 속이기 위한 의도적인 시도도 포함되어 있다고 설명합니다. RAID의 기반이 된 학술 논문은 공개 리더보드를 뒷받침하는 탐지기 테스트에 사용된, 600만 건이 넘는 생성 결과로 구성된 더 큰 데이터셋을 설명합니다. RAID의 순위는 그 데이터셋 밖의 어떤 단일 에세이에 대해 동일한 탐지기가 어떻게 성과를 내는지를 측정하지는 않습니다.
AI를 보조해 작성한 초안을 자신의 목소리로 다시 쓰고, 인용과 기술 용어, 수치 등은 사용자가 원래 작성한 그대로 두세요.

Dana는 ProofreaderPro의 콘텐츠 제작자로서 매일 블로그를 운영하고 글쓰기 작업을 진행합니다. 그녀는 온라인 편집 플랫폼의 작동 방식에 대한 기사를 작성하고 매일 고객 메시지를 처리하며 이에 대한 만족도 점수는 별 5개입니다.