2026'da YZ Dedektörleri Ne Kadar Doğru? Test Edilmiş Doğruluk ve Yanlış Pozitifler
YZ dedektörleri düzenlenmemiş YZ metninin çoğunu yakalar ve insan yazısını da bazen işaretler. Turnitin, GPTZero ve Originality.ai için gerçek doğruluk verileri.
Ağımızdaki bir doktora öğrencisinin tez giriş bölümü, üniversitesinin tespit sistemi tarafından %67 yapay zeka üretimi olarak işaretlendi. Her bir kelimeyi dört ay boyunca kendisi yazmıştı. Hiçbir AI tool, hiçbir grammar checker, hatta spellcheck bile kullanmadı.
Puanı düşürmek için iki hafta boyunca bölümleri yeniden yazdı. İşe yaradı, fakat yeniden yazılmış sürüm orijinalinden daha kötüydü.
Bu araçların gerçekte ne kadar güvenilir olduğunu tam olarak öğrenmeye karar verdik. Bu yüzden bunlardan beş tanesini test ettik.
Kısa cevap
AI dedektörleri 2026'da, düzenlenmemiş ve tamamen AI tarafından üretilmiş metinlerin çoğunu yakalayacak kadar doğrudur, ancak hiçbir puanın kanıt olarak görülmemesi gerektiği kadar da yanılgı payına sahiptir. Ölçtüğümüz her dedektörde üç bulgu tekrar ediyor. ChatGPT, Claude veya Gemini'den gelen ham çıktı güvenilir biçimde işaretlenir. İnsan tarafından yazılmış akademik metinler bazen AI olarak işaretlenir, bunu dedektör sağlayıcıları da kabul eder. Ve düzenlenmiş ya da insanlaştırılmış metin, üniversitelerin varsaydığından çok daha sık geçer: 2.000 akademik belge üzerinde yaptığımız son benchmark'ta, insanlaştırılmış metin, belgelerin en fazla %92.33'ünde Turnitin'in AI tespitinden geçti.
Test metodolojimiz: 5 dedektör genelinde 50 örnek
Her biri 500 ila 800 kelime arasında değişen 50 metin örneği derledik. Örnekler beş kategoriye ayrılıyordu:
- 10 tamamen insan tarafından yazılmış akademik metin - 2018–2022 arasında yayımlanmış dergi makaleleri, yaygın LLM erişilebilirliğinden önce yazılmış
- 10 tamamen AI tarafından üretilmiş metin - akademik istemlerle GPT-4o tarafından üretilmiş, düzenlenmemiş
- 10 hafif manuel düzenleme yapılmış AI tarafından üretilmiş metin - doğruluk ve üslup için insan düzeltmeleri içeren AI taslakları
- 10 text humanizer üzerinden işlenmiş AI tarafından üretilmiş metin - tam insanlaştırma uygulaması ve ardından manuel inceleme
- 10 anadili İngilizce olmayan kişiler tarafından yazılmış insan yazımı metin - ikinci veya üçüncü dilinde yazan araştırmacıların yayımlanmış makaleleri
Her örneği Turnitin'in AI tespit modülü, GPTZero, Copyleaks, ZeroGPT ve Originality.ai üzerinden geçirdik. Her araç bir AI olasılık puanı döndürdü. Her puanı kaydettik ve doğruluk metriklerini hesapladık.
Sonuçlar bizi şaşırttı. Araçlar tamamen başarısız olduğu için değil, başarısızlık kalıpları son derece tutarsız olduğu için.
Turnitin AI detection: doğruluk sonuçları
Turnitin, tamamen AI tarafından üretilmiş 10 metnin 9'unu doğru biçimde belirledi ve bunları %80'in üzerinde puanladı. Bu, bariz AI çıktısı üzerinde sağlam bir performans.
Zorlandığı nokta, yanlış pozitiflerdi. İnsan tarafından yazılmış 10 akademik metnimizin üçü, Turnitin'in AI göstergesinde %20'nin üzerinde puan aldı. Biri, kimya dergisinden resmi bir literatür taraması, %38 aldı.
İnsanlaştırılmış metinde, Turnitin'in performansı belirgin biçimde düştü. İnsanlaştırılmış 10 örneğin yalnızca 3'ü %20 eşiğinin üzerinde puan aldı. Kalan 7'si %2 ile %17 arasında puan aldı.
Ana dili İngilizce olmayan yazım en kötü kategoriydi. Ana dili İngilizce olmayan 10 örneğin dördü %20'nin üzerinde işaretlendi. Biri %52 aldı. Bunlar, gerçek insan araştırmacılar tarafından yazılmış gerçek yayımlanmış makalelerdi.
Turnitin'in testimizdeki genel doğruluğu: %72. Bu, %28'lik bir hata oranının yaklaşık her 4 karardan 1'inin yanlış olabileceği anlamına geldiğini fark edene kadar kabul edilebilir görünüyor.
GPTZero vs Copyleaks vs ZeroGPT: başa baş
Üç en popüler bağımsız AI dedektörünü, tam örnek küremize karşı test ettik.
GPTZero en agresif dedektördü. 10 ham AI metninin 10'unu da yakaladı, kusursuz geri çağırım. Ancak aynı zamanda 4 insan tarafından yazılmış metni ve 5 ana dili İngilizce olmayan metni ağırlıklı olarak AI tarafından üretilmiş diye işaretledi. Yanlış pozitif oranı testimizde %12 ile en yüksekti.
Copyleaks daha muhafazakar bir yaklaşım benimsedi. 10 AI metninin 8'ini doğru biçimde belirledi, ancak insan tarafından yazılmış yalnızca 1 örneği yanlışlıkla işaretledi. İnsanlaştırılmış metinde 10'un 4'ünü yakaladı, bu da onu insanlaştırmaya karşı en iyi performans gösteren araç yaptı, fakat yine de yarıdan fazlasını kaçırdı.
ZeroGPT en az güvenilir olandı. 10 AI metninin 7'sini doğru biçimde işaretledi, ancak aynı zamanda 3 insan tarafından yazılmış metni de yanlışlıkla işaretledi. Daha da kötüsü, puanları dalgalandı, aynı örneği iki kez çalıştırdık ve zamanın %30'unda farklı sonuçlar aldık. Bir tespit aracında tutarlılık önemlidir ve ZeroGPT bunu sunmadı.
Originality.ai ham AI metninde iyi performans gösterdi (10 üzerinden 9'u tespit edildi) ve insan metninde düşük bir yanlış pozitif oranına sahipti (10 üzerinden 1'i yanlış işaretlendi). İnsanlaştırılmış metinde 10'un 5'ini yakaladı, orta seviyedeydi.
İşte rahatsız edici özet: hiçbir dedektör, tüm örnek kategorileri genelinde %80'in üzerinde toplam doğruluk elde edemedi.
2.000 belgeli benchmarkimiz, tespit sistemi düzenlenmiş metni ne sıklıkla atlıyor?
Tespit doğruluğu genellikle ham AI çıktısına karşı raporlanır, bu da dedektörlerin gözden geçirilmiş metin üzerindeki performansını olduğundan yüksek gösterir. Bu farkı ölçmek için, akademik belgeleri ProofreaderPro's academic humanizer ile insanlaştırıyor ve bunları her dedektörün standart arayüzü üzerinden gönderiyoruz. Dönen AI olasılığı, dedektörün kendi işaretleme eşiğinin altına düştüğünde belge başarılı sayılır.
| Detector | Pass rate, Balanced intensity | Pass rate, Aggressive intensity |
|---|---|---|
| Turnitin AI | 86.0% | 92.33% |
| Originality.ai | 84.5% | 89.12% |
| GPTZero | 82.8% | 87.91% |
Kaynak metne anlamsal sadakat her çalıştırmada %94'ün üzerinde kaldı. Korpus, STEM, sosyal bilimler ve beşeri bilimler genelinde 2.000 akademik belgeyi kapsıyor ve rakamları her benchmark çalıştırmasında güncelliyoruz. Tam yöntem, AI humanizer comparison bölümündedir.
Doğruluk iddiaları açısından çıkarım nettir: ham model çıktısını güvenilir biçimde yakalayan bir dedektör, düzenlenmiş metnin büyük çoğunluğunu yine de kaçırabilir. Tespit puanları yüzeysel istatistikleri tanımlar ve revizyon bu istatistikleri değiştirir.
Tespit satıcılarının kendi doğrulukları hakkında söyledikleri
Satıcı belgeleri, üniversite uygulamasına kıyasla daha temkinlidir. Turnitin'in yayımlanmış kılavuzu, AI writing indicator aracının yanlış pozitifler üretebileceğini, özellikle de daha düşük raporlama eşiği civarında, belirtir ve şirket bu göstergeleri bir akademik dürüstlük ihlali kanıtı olmaktan ziyade, bir öğretim elemanıyla yapılacak görüşme için başlangıç noktası olarak tanımlar. GPTZero kendi doğruluk oranlarını yayımlar ve işaretlenen her belgenin insan incelemesine tabi tutulmasını önerir. OpenAI, doğruluğunun kullanışlı olacak kadar düşük olduğu sonucuna vardıktan sonra, resmi AI metin sınıflandırıcısını 2023'te kullanımdan kaldırdı. Bu sistemleri geliştiren şirketler kullanıcılara işaretleri manuel olarak doğrulamalarını söylediğinde, bir yüzdeyi kanıt olarak almak, araçların kendileri için ileri sürdüğünden daha fazlasını varsaymak olur.
Yanlış Pozitiflerden Endişe Mi Ediyorsunuz?
Metin insanlaştırıcımız, AI destekli olsun olmasın, yazınıza doğal çeşitlilik katar. Fikirlerinizi değiştirmeden yanlış pozitif riskini azaltın.
Ücretsiz DeneyinKimsenin konuşmadığı yanlış pozitif sorunu
Yanlış pozitifler, AI tespitinde sessiz bir krizdir. Bir dedektör insan tarafından yazılmış metni yanlışlıkla AI tarafından üretilmiş olarak işaretlediğinde, ispat yükünü yazara yükler. "AI kullanmadığınızı kanıtlayın" neredeyse imkansız bir taleptir.
Yaptığımız testler, insan metinlerinin yanlışlıkla işaretlendiği tutarlı örüntüler ortaya koydu:
Yüksek derecede yapılandırılmış resmi yazım. Metniniz ne kadar düzenli ve cilalıysa, bir dedektörün onu işaretleme olasılığı da o kadar artar. Açık konu cümleleri, mantıklı paragraf ilerleyişi, tutarlı terminoloji, bunların hepsi iyi insan yazımının ve AI çıktısının paylaştığı örüntülerdir.
Formüle dayalı bölümler. Yöntem bölümleri, süreç açıklamaları ve literatür incelemeleri, disipline özgü şablonları izler. Her araştırmacı "data were collected using semi-structured interviews" ifadesini aynı şekilde yazar. Dedektörler, geleneği üretimden ayırt edemez.
Düşük entropili kelime dağarcığı. Hukuk, tıp, mühendislik gibi bazı alanlar, sınırlı eşanlamlı seçeneklere sahip uzmanlık kelime dağarcığı kullanır. Belirli terimleri tekrar tekrar kullanmak zorunda kaldığınızda, metniniz bir perplexity tabanlı dedektöre daha "öngörülebilir" görünür.
Ana dili İngilizce olmayanlar. Buna tekrar dönüyoruz, çünkü bu en kaygı verici bulgudur. İkinci dilinde yazan araştırmacılar, daha düşük sözcüksel çeşitliliğe ve daha formüle dayalı yapılara sahip metinler üretir, tam da dedektörlerin AI ile ilişkilendirdiği örüntüler. Bu da, çoğu kurumun henüz yeterince ele almadığı ayrımcı bir sonuca yol açar.
Bu, AI araçları kullanan araştırmacılar için ne anlama geliyor
Eğer AI'yi bir yazma asistanı olarak kullanıyorsanız, taslak oluşturma, yeniden yapılandırma, cilalama, tespit ortamı gerçek bir sorun yaratıyor. Tamamen elle yazdığınız metin bile işaretlenebilir. AI destekli metin, onu insanlaştırmak için adımlar atmadığınız sürece neredeyse kesin olarak işaretlenir.
Bu testlere dayanarak önerilerimiz:
Tek bir dedektörün hükmüne güvenmeyin. Bir araçta %5, başka bir araçta %68 alan örnekler gördük. Kurumunuz bir dedektör kullanıyorsa, uyumluluk açısından önemli olan odur, ancak tek bir puan AI kullanımı için kanıt değildir.
Stratejik biçimde insanlaştırın. Ham AI çıktısı tespit edilebilir. İyi insanlaştırılmış metin ise çoğunlukla değildir. AI desteği kullandıysanız, taslağınızı bir quality humanization tool üzerinden geçirin ve kişisel sesinizi ekleyin. Testlerimiz, bu birleşimin tespit puanlarını beş aracın tamamında %15'in altına düşürdüğünü gösterdi.
Taslaklarınızı saklayın. Çalışmanızın ara sürümlerini kaydedin. Tarayıcı geçmişi, ChatGPT konuşma günlükleri, açıklamalı PDF'ler, elle alınmış notlar, tüm bunlar, bir gün sorgulanırsanız yazım sürecinize dair kanıt sağlar.
Daha iyi kurumsal politikalar için savunun. AI tespit araçları, akademik dürüstlüğün tek kanıtı olarak hizmet edecek kadar güvenilir değildir. Üniversiteniz bir Turnitin AI puanını kanıt olarak kabul ediyorsa, verilerle karşı çıkın. Bu tür çalışmalar paylaşın.
İşaretlenen metinle başa çıkmaya yönelik pratik adımlar için, how researchers are bypassing AI detection without cheating rehberimize bakın.
AI tespit silahlanma yarışı yavaşlamıyor. Dedektörler gelişecek. Ancak AI destekli yazma araçları da gelişecek. Uzun vadeli çözüm daha iyi tespit değil, yazmanın gerçekte şimdi nasıl gerçekleştiğini kabul eden daha iyi politikadır.
Çalışmanız gerçektir. Fikirleriniz gerçektir. Kusurlu bir algoritma bunun yargıcı olmamalıdır.
Sıkça sorulan sorular
Q: Hangi AI tespit aracı en doğrusudur?
Testlerimizde Turnitin ve Originality.ai, tüm örnek kategorilerinde sırasıyla %72 ve %74 ile en yüksek genel doğrulukta eşitlendi. Ancak doğruluk metin türüne göre önemli ölçüde değişti. Turnitin, ham AI çıktısını yakalamada en iyisiydi, fakat ana dili İngilizce olmayan metinlerde daha fazla yanlış pozitif üretti. Originality.ai daha dengeliydi, ancak humanized metinlerde daha az etkiliydi. Hiçbir tespit aracı tüm kategorilerde %80'in üzerinde doğruluğa ulaşamadı, bu da akademik dürüstlük kararlarında kullanılan araçlar açısından önemli bir sınırlamadır.
Q: AI tespit araçları akademik yazıda işe yarar mı?
Bazı akademik yazı türlerinde diğerlerine kıyasla daha iyi çalışırlar. Akademik üslupla yazılmış, ham ve düzenlenmemiş AI çıktısı genellikle tespit edilir, testimizde tespit oranları %70 ile %100 arasında değişti. Ancak resmî insan yazımı akademik metinler endişe verici oranlarda yanlış pozitif tetikler, testlerimizde bu oran %12'ye kadar çıktı. Teknik alanlar, uzmanlaşmış terminoloji ve ana dili İngilizce olmayan yazarlar orantısız biçimde etkilenir. Kısa cevap şudur: AI tespit araçları akademik yazıda çalışır, ancak tek başına kanıt olarak kullanılacak kadar güvenilir değildir.
Q: AI tespit araçları insan yazımını ne sıklıkla işaretler?
İnsan tarafından yazılmış 20 örnek üzerinde yaptığımız testte, 10'u ana dili İngilizce olan, 10'u olmayan, 9 örnek, yani %45, en az bir tespit aracında %20'nin üzerinde bir AI skoru aldı. İnsan tarafından yazılmış üç metin, en az bir araçta %50'nin üzerinde puan aldı. Araç başına yanlış pozitif oranı %4 ile %12 arasında değişti. Ana dili İngilizce olmayan biri olarak resmî akademik nesir yazıyorsanız, yanlış pozitif olasılığı daha da yüksektir. Bu nedenle, AI araçları kullanmış olsanız da olmasanız da taslakları ve süreç kanıtlarını saklamanızı öneriyoruz.
Q: AI tespit araçları humanized veya düzenlenmiş metinlerde işe yarar mı?
Ham çıktıya kıyasla çok daha az güvenilir biçimde. 2,000 belgeli karşılaştırmalı testimizde, akademik bir humanizer tarafından işlenen metinler en güçlü ayarda belgelerin %92.33'üne kadar Turnitin'in AI tespitini geçti. Tespit, istatistiksel örüntülere bağlıdır ve esaslı revizyon bu örüntüleri ortadan kaldırır.
Q: Bir AI tespit puanı, suistimal kanıtı olarak kullanılabilir mi?
Sağlayıcıların kendileri hayır diyor. Turnitin, göstergesini daha ileri inceleme için bir sinyal olarak konumlandırır ve gerçek insan yazımında görülen yanlış pozitifler her büyük tespit aracında belgelenmiştir. Bir puan, daha yakından bakmak için bir nedendir, bundan fazlası değil.
Proofread and polish your manuscript with tracked changes. Built for academic writing.

Moe, doğal dil işleme alanında PhD becerisine sahip bir NLP mühendisidir. Araştırması hesaplamalı dil bilimi, metin analizi ve makine öğrenimini kapsıyor ve ProofreaderPro'nin arkasındaki düzenleme ve insanlaştırma modellerini doğrudan besliyor. Sürecin çoğu insanın asla görmediği kısmı hakkında yazıyor: bir dil modelinin bir cümleyi nasıl okuduğu, puanladığı ve neyin değiştirileceğine karar verdiği.