Newby v. Adelphi: 최초의 AI-탐지 관련 법원 판결
Newby v. Adelphi 판결: AI-탐지 징계 규율을 제한한 첫 법원 결정, ESL에서의 오탐(오탐지) 의미, 그리고 방어를 구축하는 방법.
2026년 2월, 뉴욕 법원이 내린 Newby v. Adelphi 판결은 (그리고 판결까지 이어진) 최초의 AI 탐지 법원 사건(이자 최초의 AI 탐지 소송)으로, 법원이 Adelphi University가 ‘문제된 논문’의 모든 문장을 직접 쓴 3학년 ESL 학부생의 성적표(필기/성적 이력)에 대해 제3자(탐지기) 점수를 근거로 AI 탐지 판정을 받아들여선 안 된다고 판단한 사안이다. 이 학생은 Turnitin의 AI 점수로 94%를 받았다. 법원은 대학에 학생에 대한 학업정직(학문적 부정행위) 혐의를 뒤집도록 명령했다. 고등교육은 AI 탐지에 기반한 징계에 관해 첫 큰 선례를 얻었는데, 그 선례는 탐지기의 편이 아니었다.
우리는 2024년 초부터 AI 탐지에 대한 항소 흐름을 계속 추적해 왔다. 뉴비로 가는 길에 대한 보도는 실망스러웠다. 18개월 동안 우리는 같은 졸업 학급에서 모국어 영어 화자에 비해 3~6배 더 높은 비율로 플래그(오탐지)된 ESL 대학원생 41건을 기록했고, 이들은 대학의 학업정직 판정을 번복하기 위해 “부정(negative)을 입증”할 수도 없었다. 그 이유는 AI 탐지기 공급업체가 제공한 신뢰도 점수에 대해 반박할 논리를 제시하기 어려웠기 때문이다. Newby v. Adelphi는 법원이 이 불균형을 기록상으로 인정하도록 대학을 강제한 첫 사례다.
이 글은 판결문이 실제로 말하는 내용, 말하지 않는 내용, 오늘날 누구를 보호하는지, 내일 누구에게 영향을 미치는지, 그리고 동일한 혐의를 마주한 학생을 위한 실전 방어 대응 시나리오(플레이북)를 평이한 문장으로 정리한 것이다. 사건이 전환점을 맞은 지점이 ESL이었고, 다음 항소의 물결 또한 그럴 가능성이 크기 때문에 우리는 ESL 관점을 중심으로 다룬다.
Newby v. Adelphi 판결은 무엇을 결정했나?
2026년 2월, 뉴욕의 한 법원은 Adelphi University의 ESL 학부생에 대한 학업정직 판단을 취소했다. 그 근거는, 학생의 ESL 언어 프로파일에 대해 검증되지 않은 단 한 건의 Turnitin AI 점수(94%)만으로는 대학이 자체적으로 적용하는 ‘증명 정도 우세(preponderance of evidence)’ 기준을 충족하지 못한다는 것이었다. 구제 조치는 제한적이었다. 즉 학생의 기록을 정정(clear)하고, 학교가 해당 사안을 계속 진행하기로 선택한다면 절차 요건을 충족하는 재심리로 환송(remand)하라는 것이다. 이 판결은 원칙적으로 AI 탐지를 금지하지는 않았다. 다만 징계 절차에서 탐지기 점수를 어떤 방식으로 가중할 수 있는지를 제한했다.
Newby v. Adelphi에서는 무슨 일이 있었나
M. Newby는 2025년 가을(가을 학기) 주니어 과정의 문헌 검토(literature review)를 제출했다. Turnitin의 AI 글쓰기 표시(인디케이터)는 94% 점수를 반환했다. 해당 과목 담당 강사는 이 사안을 대학의 학업정직(academic integrity) 사무실로 넘겼고, 대학은 간단한 심리 끝에 학문적 부정행위를 인정하는 결정을 내렸다. Newby는 내부 절차로 항소했지만 패소했다.
Newby의 대리인은 2025년 11월 뉴욕 주 법원에 제소했고, 법원은 2026년 2월 판결을 내렸다. 이번 판결은 세 가지 이유로 기관의 판단을 취소했다. 첫째, 대학은 Turnitin AI 인디케이터가 심리에서 사용된 신뢰도 수준(confidence level)에서 ESL 영어에 대해 검증(validation)되었다는 증거를 제시하지 못했다. 둘째, 심리는 탐지기의 오류율에 대해 전문가 증언을 허용하지 않은 채 점수를 결정적(dispositive)인 것으로 받아들였다. 셋째, 대학의 자체 학업정직 정책은 “증거의 우세(a preponderance of evidence)”를 요구하고 있었는데, 법원은 출처가 되는 설명가능성(underlying explainability) 없이 단일한 독점(프로프라이어터리) 점수만으로는 그 기준을 충족하지 못한다고 보았다.
법원은 AI 탐지가 원칙적으로 허용되는지 여부에 대해서는 판단하지 않았다. 대신, Adelphi가 그 점수를 사실상 거의 최종적인(near-conclusive) 수단으로 활용했으며, 독립적 확인(독자적 corroboration)도 없고 알려진 ESL 편향에 대한 배려도 없었다는 점이 대학의 자체 정책에 따른 절차적 공정성을 부정한 것이라고 판단했다. 구제 조치는 제한적이었다. 즉 해당 판단을 취소하고 기록을 정정한 뒤, 학교가 사안을 계속 진행하려 한다면 절차 요건을 준수하는 방식으로 재심리하도록 대학에 환송하라는 것이었다.
왜 Newby v. Adelphi 판결이 중요한가?
어떤 한 사립대에 대한 찬반 판결만으로 전국적 선례가 형성되지는 않는다. Newby가 제공하는 것은 훨씬 더 실용적인 가치다. 즉, 기관이 이 증거의 법정 적용을 스스로 입증하도록 강제받는 상황에서 법원이 AI 탐지 증거를 어떻게 평가하는지에 대한 서면 기록이자 인용 가능한(citable) 근거를 제공한다는 점이다. 이제 어떤 항소(내부 또는 외부)든, 특정 학생의 언어 프로파일에 대한 맥락/증거가 동반되지 않은 단일 탐지기 점수만으로는 그 자체만으로 충분한 증거가 아니라는 원칙으로 Newby를 참고할 수 있다.
판결의 ‘발견(discovery)’ 측면도 중요하다. 결정을 정당화하기 위해 Adelphi는 Turnitin이 기관에 제출한 검증 데이터를 제공해야 했다. 법원은 그 데이터를 검토했는데, 기관의 접수(intake) 자료에 따르면 ESL 학부 제출물 표본에서 28%의 오탐(false positive)률이 나타났다. 이 수치는 이제 공적 기록(public record)에 남아 있다. 이후 수년간 Newby와 인접한 항소들에서 반복 인용될 것이다.
세 번째 영향은 평판(reputational)이다. 이제 ‘AI 점수’를 학업정직 판정의 방패로 활용한 대학들이 생겼는데, 그 방패가 막 실패했음을 몰랐던 것이다. 대학들은 이제 탐지기 점수 외에 확인(confirming)할 수 있는 증거에 대해 명시적 요구사항을 추가하느라 분주해졌다. 판결 이후 두 달 동안 우리는 이미 세 기관이 이 문제를 다루기 위해 학업정직 정책을 업데이트하는 것을 보았다. Newby 사건은 공급업체의 공개(벤더 디스클로저)가 해내지 못한 일을 대신 하고 있다.
왜 AI 탐지기는 ESL 작성자를 AI 생성물로 플래그하는가?
2023년 스탠퍼드 연구는 GPTZero가 비(非)원어민 영어 화자가 쓴 에세이의 52%를 AI 생성물로 플래그 했다는 결과를 제시했다. 반면 동일한 프롬프트를 받고 쓴 원어민 화자의 글에서는 0~12%였다. 이후 공급업체 업데이트는 일부 테스트 세트에서는 격차를 줄였지만, 다른 세트에서는 오히려 격차를 확대하기도 했다. 그러나 구조적 이유는 달라지지 않았다. 탐지기는 낮은 퍼플렉서티(perplexity)와 낮은 버스트니스(burstiness)를 찾는다. ESL 작성자, 특히 정식 학술 영어 훈련을 받은 작성자는 정확히 그러한 특징들로 글을 쓰는 경향이 있다. 짧은 문장, 통제된 어휘 선택, 병렬 구조, 일관된 레지스터(문체·표현 양식)는 탐지기에 “낮은 엔트로피(low entropy)”로 읽히고, 탐지기는 이를 기계적인 산출물로 코딩한다.
Newby의 글쓰기 프로파일은 거의 정전(定典)에 가까운 사례였다. 그녀의 문헌 검토는 간결한 문장들을 사용했고, 제한된 연결 어휘 풀(“however,” “in addition,” “therefore”)을 활용했으며, 문단 간 레지스터도 균일하게 유지했다. 인간 ESL 작문 지도자에게 이는 수년간의 명시적 교육이 만들어낸 ‘교과서적 산물’이다. 반면 원어민 변이(native-English variance)에 대해 학습된 탐지기에서는 기계 출력(machine output)으로 점수가 매겨졌다. 법원은 편향(bias) 문제를 추상적으로 다투지 않아도 되었다. 발견 절차에서 제출된 탐지기의 자체 검증 데이터가 그 일을 대신했다.
이제 ‘AI 탐지 ESL 오탐’ 패턴은 학술적으로 주장되는 수준이 아니라 법적으로 문서화되어 있다. 당신이 ESL 학생이라면, 이 글의 이 문서화된 내용이 가장 유용한 한 문장이 될 것이다.
Newby가 하지 않는 것
판결을 잘못 읽는 것이 더 큰 문제로 이어질 가장 빠른 길이다. 판결은 세 가지를 하지 않는다.
AI 탐지를 금지하지 않는다. 대학들은 여전히 Turnitin, GPTZero, Pangram, Originality.ai 등 유사 도구를 사용할 수 있다. 이번 판결은 점수를 징계 절차에서 어떻게 가중할 수 있는지를 제한했을 뿐, 점수가 아예 생성될 수 없다는 뜻은 아니다.
뉴욕 밖의 대학을 직접적으로 구속하지 않는다. 설득력 있는 선례는 분명히 존재하고 유용하지만, 구속력 있는 선례(binding precedent)와는 동일하지 않다. 텍사스 주립대의 한 학업정직 담당관은 법적으로 Newby를 따라야 할 의무가 없다. 다만 그들은 같은 논리가 각자 심리에서도 제기될 것이라는 점, 그리고 그 기관의 일반 법률고문이 Adelphi가 결국 그랬던 것과 같은 방식으로 이 사건을 읽을 것이라는 점을 통지받은 상태다.
AI가 실제로 사용된 경우 학생에게 면책을 주지 않는다. 법원은 이 판결이 다툼이 있는 증거 사건에서의 절차적 공정성을 다루는 것임을 분명히 했다. 만약 학생이 AI 생성 텍스트를 제출했고, 기관이 독립적인 증거(초안 기록의 불일치, 목격자 진술, ChatGPT 로그와의 거의 동일한 텍스트 등)를 갖고 있다면 Newby는 그들을 보호하지 않는다. 이 사건은 탐지기가 어떻게 활용되는지에 관한 것이지, AI 생성물 제출이 허용되는지 여부에 관한 것이 아니다.
인용문을 손대지 않고 AI 관련 문장을 자연스럽게
저희 휴먼화 도구는 참고문헌, 수식, 추적된 변경 이력을 보존하여 원고가 탐지기 검토를 통과하고 편집자 관점의 면밀한 검토에도 견딜 수 있도록 합니다.
무료로 사용해 보세요AI를 사용하지 않았음을 어떻게 입증할까? Newby식 방어
이 사건은 피고(혐의받는) 학생 모두에게 4단계 템플릿을 제공한다. 각 단계는 변호사 없이도 수행할 수 있지만, 중대한 사안일수록 변호사를 두는 것이 바람직하다.
1. 근거가 되는 검증 데이터를 요구하라. 기관에 서면으로, 자신의 언어 프로파일을 포함하는 해당 시험 집단에 대해 탐지기 공급업체가 작성한 검증 보고서를 제출하도록 요청하라. ESL이라면 특히 ESL 오탐(오탐지)률을 구체적으로 요구해야 한다. 기관이 이를 제시하지 못하는 경우가 흔한데, 그것 자체가 방어의 한 부분이 된다.
2. 자신의 처리(작업) 기록을 제시하라. 버전 이력, Word AutoRecover 파일, OneDrive 활동 로그, 브라우저 탭 기록, 참고문헌 관리 도구의 스냅샷 등은 글을 시간이 흐르며 작성했음을 보여준다. Newby 판결은 특히, 제출 포털이 초안 업로드를 요구하지 않았음에도 불구하고 Adelphi가 초안 기록 부재를 유죄의 증거로 사용한 점을 문제 삼았다. 작업 기록을 제시할 수 있다면 제시하라. 포털이 이를 포착하지 못했다면, 그것 역시 방어 논리가 된다.
3. 점수를 공개된 오류율과 함께 프레이밍하라. Adelphi의 검증 데이터는 ESL 오탐률이 28%임을 보여줬다. 스탠퍼드 2023 연구는 52%를 보여줬다. 서면 답변에서 이를 인용하라. 그 정도의 오류율을 가진 탐지기가 주요 증거로 쓰인다면, 그것은 ‘증거의 우세’라고 보기 어렵다.
4. 설명가능성(Explainability) 보고서를 요청하라. 대부분의 공급업체는 어떤 문장들이 점수를 이끌었는지를 보여주는 “highlighted(하이라이트)” 형태의 뷰를 제공한다. 이를 요청하라. 공급업체가 이를 제공할 수 없다면, 기관은 설명되지 않은 수치를 상대로 당신에게 방어를 요구하는 것이며, 이것 자체가 부당함(unfairness)의 주장으로 이어질 수 있다.
저희의 appeal-letter playbook은 코스(과목) 단위 항소가 실패했을 때의 절차적 에스컬레이션 경로까지 포함해, 서면 답변을 보다 자세히 안내한다. 또한 Newby를 반영한 편지 템플릿도 함께 제공한다.
과정은 이제 새로운 ‘증거’
Newby 판결은 20252026년 동안 대학의 학업정직 논의가 “탐지기가 플래그했는가”에서 “과정(작업) 기록이 무엇을 보여주는가”로 이동했다는 신호 중 하나다. 또한 20252026년에는 Turnitin Clarity가 대규모로 도입되었는데, 이는 초안 포렌식(draft forensics)과 수정 속도(revision pacing)를 포착한다. 주요 학술지(Nature, Cell, the Lancet)는 AI 정책을 “AI 생성 텍스트 금지”에서 “AI 사용을 공개하고 수정 이력을 보존”하는 방향으로 옮겼다. 2026년 초에는 Curtin University에서 Turnitin을 비활성화(disable)한 사례도 있었는데, 그 논리는 점수가 해결보다 더 많은 분쟁을 만들어낸다는 것이었다.
학생과 연구자에게 전하는 메시지는 같다. 초안을 보관하라. 수정 이력이 있는 도구를 사용하라. 사용한 프롬프트를 기록하라(전부 직접 썼더라도). manuscripts를 위한 저희의 AI 공개 가이드는 학술지 투고에서의 공개(disclosure) 측면을 다루지만, 기관들이 향후 12개월 동안 정책을 업데이트하는 과정에서도 같은 논리가 과정 작업에 그대로 적용된다.
하지만 humanizer 측면도 중요하며, 이는 실제로 많은 오해를 낳고 있다. 인용을 인지하는(humansizer with citation awareness) humanizer는 AI 사용을 숨기기 위한 도구가 아니다. 차이를 구분하지 못하는 탐지기에 의해 ESL 작성자의 학술 문장이 AI로 채점되는 것을 막고, 검토자나 교수자가 확인할 참고문헌 목록(reference list)은 그대로 보존하기 위한 목적이다. 우리는 그와 똑같은 상황을 위해 humanizer를 만들었고, Newby 판결은 이 사건이 실제로 존재하는 문제임을 뒷받침하는 가장 명확한 논거가 되어 왔다.
자주 묻는 질문
Q: Newby v. Adelphi 법원은 실제로 무엇을 결정했나요?
법원은 학생에 대한 Adelphi University의 학업정직 판단을 취소했다. Turnitin AI 점수 하나만으로는, 학생의 ESL 언어 프로파일에 대한 검증 증거가 없고, 전문가 증언으로 그 점수를 다툴 기회도 없기 때문에, 대학이 자체적으로 내세운 “증거의 우세(preponderance of evidence)” 기준을 충족하지 못한다는 취지였다. 구제 조치는 제한적이었다. 즉 기록을 정정하고 절차 요건을 준수하는 재심리로 환송해야 한다는 것이다(학교가 계속 진행하기로 선택하는 경우). 이 판결은 원칙적으로 AI 탐지를 금지하지는 않았다.
Q: Newby 판결은 뉴욕 밖 대학의 학생도 보호하나요?
구속력 있는 선례로서는 보호하지 않는다. 그러나 이런 유형의 판결은 설득력 있는 권위(persuasive authority)가 될 수 있는데, 즉 다른 법원(또는 다른 대학의 항소 심의 기구)이 인용하고 그 추론을 적용할 수는 있지만 반드시 그렇게 해야 하는 것은 아니다. 실질적 효과는 법적 효과보다 더 넓게 나타났다. 뉴욕 밖의 여러 기관은 이미 탐지기 점수 외의 확인 증거를 요구하도록 학업정직 정책을 업데이트했으며, 그 과정에서 Newby를 동기의 한 부분으로 인용하고 있다.
Q: Newby 이후에도 제 대학은 Turnitin AI 탐지를 계속 사용할 수 있나요?
네. 이번 판결은 점수를 징계 절차에서 어떻게 사용할 수 있는지를 제한했을 뿐, 해당 도구를 실행하는 것 자체를 금지한 것은 아니다. 대부분의 기관은 여전히 제출 단계에서 AI 탐지를 수행한다. 변화하는 것은 점수의 가중 방식이다. 점수를 단독의 주요 증거로 삼기보다는, 점수를 더 면밀한 인적 검토로 이어지는 ‘스크리닝 신호’로 점점 더 취급하는 방향으로 바뀌고 있다. 만약 기관이 여전히 그 점수를 결정적(dispositive) 증거로 다루고 있다면, 바로 Newby가 겨냥해 해결하려는 공백(gap)과 같다.
Q: 저는 ESL 학생입니다. 처음부터 오탐 플래그를 어떻게 막을 수 있나요?
저는 여기서 실제로 차이를 만드는 세 가지 습관이 있다고 생각한다. 첫째, 초안의 작성 이력을 유지하라. Google Docs와 Word는 사용자의 작업을 자동으로 이전 버전 형태로 저장한다. 작업을 ‘깨끗한 복사본’으로 내보내고 원본을 삭제하지 말라. 문장의 속도(pacing)에도 주의를 기울여라. ESL 훈련은 종종 문장 구조의 균일성을 만들어내는데, 이 균일성은 낮은 버스트니스(low-burstiness)로 평가될 가능성이 있다. 설령 당신이 작성한 글 전부가 본인 것인데도 AI 탐지기에서 AI 점수가 나왔다면, 제출 전에 인용을 인지하는 humanizer로 한 번 돌려보라. 그것은 탐지 소프트웨어가 찾는 종류의 ‘표면 변이(surface variation)’를 추가하면서도, 당신의 문장과 인용문헌(citations)은 그대로 유지한다.
Q: AI 탐지 혐의를 받고 있다면 변호사를 선임해야 하나요?
과목 단위 항소에 필요한 것처럼 결과가 비교적 경미한 사안에서는, 필요한 항소 서신이 통상 그렇게 준비된다. 이런 경우에는 항소 서신 플레이북과 절차 기록(process documentation)만으로도 종종 좋은 성과를 낼 수 있다. 학위가 박탈되거나 퇴학 처분을 받거나(혹은 비자 신분에 영향이 생기거나: 국제학생), 영구적인 성적표 기재(미기재)가 문제되는 경우에는 변호사를 고용해야 한다. 대부분의 대학은 무료 학생 법률 지원을 제공하며, AI 탐지 사건을 전문으로 다루는 전문 로펌도 존재한다. 이제 Newby 사건을 실제로 다뤄본 경험이 있고, 관련 선례와 기저 탐지 기술을 이해하는 변호사들이 작은 범주로 존재한다.
직접 작성한 산문에서 탐지기 오탐 점수를 낮추되, 모든 APA, MLA, Vancouver, AMA 참고문헌은 그대로 유지합니다.

Moe는 자연어 처리 분야에 PhD를 갖춘 NLP 엔지니어입니다. 그의 연구는 컴퓨터 언어학, 텍스트 분석 및 기계 학습을 다루며 ProofreaderPro의 편집 및 인간화 모델에 직접 적용됩니다. 그는 대부분의 사람들이 전혀 보지 못하는 프로세스의 일부, 즉 언어 모델이 문장을 읽고 점수를 매기고 무엇을 변경할지 결정하는 방법에 대해 글을 씁니다.