Seberapa Akurat Detektor AI pada 2026? Akurasi Teruji dan Positif Palsu
Detektor AI menangkap sebagian besar teks AI tanpa suntingan, tetapi masih menandai tulisan manusia. Data akurasi Turnitin, GPTZero, dan Originality.ai.
Seorang mahasiswa PhD di jaringan kami mendapat penandaan pada bagian pendahuluan tesisnya sebagai 67% dihasilkan AI oleh sistem deteksi universitasnya. Ia menulis setiap kata sendiri selama empat bulan. Tidak ada alat AI, tidak ada pemeriksa tata bahasa, bahkan pemeriksa ejaan pun tidak.
Ia menghabiskan dua minggu untuk menulis ulang bagian-bagian tertentu demi menurunkan skor. Hasilnya berhasil, tetapi versi yang ditulis ulang lebih buruk daripada versi aslinya.
Kami memutuskan untuk mencari tahu seberapa andal sebenarnya alat-alat ini. Jadi, kami menguji lima di antaranya.
Jawaban singkat
Detektor AI pada 2026 cukup akurat untuk menangkap sebagian besar teks yang sepenuhnya dihasilkan AI tanpa penyuntingan, dan juga cukup tidak akurat sehingga tidak ada skor yang boleh dianggap sebagai bukti. Tiga temuan berulang pada setiap detektor yang telah kami ukur. Output mentah dari ChatGPT, Claude, atau Gemini terdeteksi dengan andal. Penulisan akademik manusia terkadang ditandai sebagai AI, yang diakui sendiri oleh para vendor detektor. Dan teks yang sudah diedit atau dipermanusi jauh lebih sering lolos daripada yang diasumsikan universitas: dalam benchmark terbaru kami pada 2.000 dokumen akademik, teks yang dipermanusi lolos dari deteksi AI Turnitin pada hingga 92.33% dokumen.
Metodologi pengujian kami: 50 sampel di 5 detektor
Kami menyusun 50 sampel teks, masing-masing antara 500 dan 800 kata. Sampel-sampel tersebut terbagi ke dalam lima kategori:
- 10 teks akademik murni yang ditulis manusia - artikel jurnal yang diterbitkan dari 2018–2022, ditulis sebelum ketersediaan LLM secara luas
- 10 teks yang sepenuhnya dihasilkan AI - dibuat oleh GPT-4o dengan prompt akademik, tanpa penyuntingan
- 10 teks yang dihasilkan AI dengan penyuntingan manual ringan - draf AI dengan koreksi manusia untuk akurasi dan gaya
- 10 teks yang dihasilkan AI yang diproses melalui text humanizer kami - proses humanisasi penuh ditambah peninjauan manual
- 10 teks yang ditulis manusia oleh penutur bahasa Inggris non-asli - makalah yang diterbitkan oleh peneliti yang menulis dalam bahasa kedua atau ketiga mereka
Kami menjalankan setiap sampel melalui modul deteksi AI Turnitin, GPTZero, Copyleaks, ZeroGPT, dan Originality.ai. Setiap alat menghasilkan skor probabilitas AI. Kami mencatat setiap skor dan menghitung metrik akurasi.
Hasilnya mengejutkan kami. Bukan karena alat-alat tersebut gagal sepenuhnya, melainkan karena pola kegagalannya sangat tidak konsisten.
Deteksi AI Turnitin: hasil akurasi
Turnitin berhasil mengidentifikasi dengan benar 9 dari 10 teks yang sepenuhnya dihasilkan AI, dengan skor di atas 80%. Itu adalah kinerja yang solid untuk keluaran AI yang jelas.
Di mana Turnitin kesulitan, false positives. Tiga dari 10 teks akademik yang ditulis manusia memperoleh skor di atas 20% pada indikator AI Turnitin. Satu, sebuah tinjauan pustaka formal dari jurnal kimia, memperoleh 38%.
Pada teks yang dibuat agar tampak lebih manusiawi, kinerja Turnitin turun secara signifikan. Hanya 3 dari 10 sampel humanized yang memperoleh skor di atas ambang 20%. 7 sisanya memperoleh skor antara 2% dan 17%.
Tulisan bahasa Inggris non-native adalah kategori terburuk. Empat dari 10 sampel non-native ditandai di atas 20%. Satu memperoleh 52%. Ini adalah makalah yang benar-benar diterbitkan, ditulis oleh peneliti manusia yang nyata.
Akurasi keseluruhan Turnitin dalam pengujian kami: 72%. Itu terdengar dapat diterima sampai Anda menyadari bahwa tingkat kesalahan 28% berarti kira-kira 1 dari 4 penilaian bisa keliru.
GPTZero vs Copyleaks vs ZeroGPT: head-to-head
Kami menguji tiga pendeteksi AI standalone paling populer terhadap seluruh set sampel kami.
GPTZero adalah pendeteksi yang paling agresif. Alat ini menangkap 10 dari 10 teks AI mentah - recall sempurna. Namun, alat ini juga menandai 4 teks yang ditulis manusia dan 5 teks bahasa Inggris non-penutur asli sebagai terutama dihasilkan oleh AI. Tingkat positive false-nya adalah yang tertinggi dalam pengujian kami, yaitu 12%.
Copyleaks mengambil pendekatan yang lebih konservatif. Alat ini mengidentifikasi dengan benar 8 dari 10 teks AI, tetapi hanya salah menandai 1 sampel yang ditulis manusia. Pada teks yang telah dihumanisasi, alat ini menangkap 4 dari 10 - menjadikannya yang terbaik dalam menghadapi humanisasi, tetapi tetap melewatkan lebih dari separuh.
ZeroGPT adalah yang paling tidak andal. Alat ini menandai dengan benar 7 dari 10 teks AI, tetapi juga keliru menandai 3 teks yang ditulis manusia. Lebih buruk lagi, skornya berfluktuasi - kami menjalankan sampel yang sama dua kali dan mendapatkan hasil yang berbeda 30% dari waktunya. Konsistensi penting dalam alat deteksi, dan ZeroGPT tidak memberikannya.
Originality.ai berkinerja baik pada teks AI mentah (9/10 terdeteksi) dan memiliki tingkat false positive yang rendah pada teks manusia (1/10 salah ditandai). Pada teks yang telah dihumanisasi, alat ini menangkap 5 dari 10 - posisi tengah.
Berikut ringkasan yang kurang menyenangkan: tidak ada pendeteksi yang mencapai akurasi keseluruhan di atas 80% di seluruh kategori sampel.
Benchmark 2.000 dokumen kami: seberapa sering deteksi gagal menangkap teks yang telah diedit
Akurasi deteksi biasanya dilaporkan terhadap keluaran AI mentah, yang melebih-lebihkan kinerja detektor pada teks yang telah direvisi. Untuk mengukur kesenjangannya, kami menghumanisasi dokumen akademik dengan humanizer akademik ProofreaderPro dan mengirimkannya ke setiap detektor melalui antarmuka standarnya. Sebuah dokumen dinyatakan lolos ketika probabilitas AI yang dikembalikan berada di bawah ambang penandaan milik detektor tersebut.
| Detector | Pass rate, Balanced intensity | Pass rate, Aggressive intensity |
|---|---|---|
| Turnitin AI | 86.0% | 92.33% |
| Originality.ai | 84.5% | 89.12% |
| GPTZero | 82.8% | 87.91% |
Kesetiaan semantik terhadap teks sumber tetap di atas 94% pada setiap putaran. Korpus ini mencakup 2.000 dokumen akademik di bidang STEM, ilmu sosial, dan humaniora, dan kami memperbarui angka-angka ini pada setiap run benchmark. Metodologi lengkapnya ada di perbandingan humanizer AI kami.
Implikasinya terhadap klaim akurasi sangat langsung: sebuah detektor yang andal menangkap keluaran model mentah tetap dapat melewatkan sebagian besar teks yang telah diedit. Skor deteksi menggambarkan statistik permukaan, dan revisi mengubah statistik tersebut.
Apa yang dikatakan vendor deteksi tentang akurasi mereka sendiri
Dokumentasi vendor lebih berhati-hati daripada praktik universitas. Pedoman yang dipublikasikan Turnitin menyatakan bahwa indikator penulisan AI-nya dapat menghasilkan false positive, terutama di sekitar ambang pelaporan yang lebih rendah, dan perusahaan itu menggambarkan indikator tersebut sebagai titik awal untuk percakapan dengan dosen, bukan sebagai bukti pelanggaran. GPTZero memublikasikan angka akurasinya sendiri dan merekomendasikan peninjauan manusia terhadap setiap dokumen yang ditandai. OpenAI menghentikan classifier teks AI resminya pada 2023 setelah menyimpulkan bahwa akurasinya terlalu rendah untuk bermanfaat. Ketika perusahaan yang membangun sistem-sistem ini memberi tahu pengguna untuk memverifikasi tanda secara manual, memperlakukan suatu persentase sebagai bukti melampaui apa yang mereka klaim tentang alat mereka sendiri.
Khawatir Tentang False Positives?
Humanizer teks kami menambahkan variasi alami pada tulisan Anda, baik dibantu AI maupun tidak. Kurangi risiko false positive tanpa mengubah ide Anda.
Coba GratisMasalah false positive yang jarang dibicarakan orang
False positive adalah krisis sunyi dalam deteksi AI. Ketika sebuah detektor keliru menandai teks yang ditulis manusia sebagai dihasilkan AI, beban pembuktian jatuh pada penulis. "Buktikan bahwa Anda tidak menggunakan AI" adalah tuntutan yang hampir mustahil.
Pengujian kami menemukan pola yang konsisten ketika teks manusia salah ditandai:
Tulisan formal yang sangat terstruktur. Semakin terorganisasi dan rapi prosa Anda, semakin besar kemungkinan sebuah detektor akan menandainya. Kalimat topik yang jelas, perkembangan paragraf yang logis, terminologi yang konsisten, semuanya merupakan pola yang dibagikan oleh tulisan manusia yang baik dan keluaran AI.
Bagian yang formulaik. Bagian metode, deskripsi prosedural, dan tinjauan pustaka mengikuti templat khusus disiplin ilmu. Setiap peneliti menulis "data were collected using semi-structured interviews" dengan cara yang sama. Detektor tidak dapat membedakan konvensi dari generasi.
Kosakata ber-entropy rendah. Beberapa bidang, hukum, kedokteran, teknik, menggunakan kosakata khusus dengan pilihan sinonim yang terbatas. Ketika Anda harus menggunakan istilah tertentu berulang kali, teks Anda tampak lebih "dapat diprediksi" bagi detektor berbasis perplexity.
Bahasa Inggris non-penutur asli. Kami terus kembali ke poin ini karena ini adalah temuan yang paling mengkhawatirkan. Peneliti yang menulis dalam bahasa kedua menghasilkan teks dengan keragaman leksikal yang lebih rendah dan struktur yang lebih formulaik, tepat seperti pola yang diasosiasikan detektor dengan AI. Hal ini menciptakan hasil yang diskriminatif yang belum ditangani oleh sebagian besar institusi.
Apa artinya ini bagi peneliti yang menggunakan alat AI
Jika Anda menggunakan AI sebagai asisten penulisan, menyusun draf, menyusun ulang, memoles, lanskap deteksi menciptakan masalah yang nyata. Bahkan teks yang Anda tulis sepenuhnya dengan tangan pun bisa terdeteksi. Teks yang dibantu AI hampir pasti akan terdeteksi kecuali Anda mengambil langkah untuk membuatnya lebih manusiawi.
Rekomendasi kami berdasarkan pengujian ini:
Jangan percaya pada satu putusan detektor saja. Kami melihat sampel yang mendapat skor 5% pada satu alat dan 68% pada alat lain. Jika institusi Anda menggunakan satu detektor, itulah yang penting untuk kepatuhan, tetapi satu skor saja bukan bukti penggunaan AI.
Buatlah lebih manusiawi secara strategis. Keluaran AI mentah dapat terdeteksi. Teks yang sudah dimanusiakan dengan baik umumnya tidak. Jika Anda menggunakan bantuan AI, jalankan draf Anda melalui quality humanization tool dan tambahkan suara pribadi Anda. Pengujian kami menunjukkan kombinasi ini menurunkan skor deteksi menjadi di bawah 15% di kelima alat.
Simpan draf Anda. Simpan versi perantara dari pekerjaan Anda. Riwayat browser, log percakapan ChatGPT, PDF yang dianotasi, catatan tulisan tangan, semua ini menyediakan bukti proses penulisan Anda jika Anda pernah dipertanyakan.
Dukung kebijakan institusional yang lebih baik. Alat deteksi AI tidak cukup andal untuk menjadi satu-satunya bukti pelanggaran akademik. Jika universitas Anda memperlakukan skor AI Turnitin sebagai bukti, lawan, dengan data. Bagikan studi seperti ini.
Untuk langkah-langkah praktis dalam menangani teks yang ditandai, lihat panduan kami tentang how researchers are bypassing AI detection without cheating.
Perlombaan senjata deteksi AI tidak melambat. Detektor akan meningkat. Namun alat penulisan berbantuan AI juga akan meningkat. Solusi jangka panjang bukanlah deteksi yang lebih baik, melainkan kebijakan yang lebih baik yang mengakui bagaimana penulisan benar-benar terjadi sekarang.
Pekerjaan Anda nyata. Ide-ide Anda nyata. Algoritma yang cacat seharusnya tidak menjadi hakim atas itu.
Pertanyaan yang sering diajukan
Q: AI detector mana yang paling akurat?
Dalam pengujian kami, Turnitin dan Originality.ai memperoleh hasil seri untuk akurasi keseluruhan tertinggi pada 72% dan 74% masing-masing di seluruh kategori sampel. Namun, akurasi sangat bervariasi menurut jenis teks. Turnitin paling baik dalam mendeteksi output AI mentah tetapi memiliki lebih banyak false positive pada teks berbahasa Inggris dari penutur non-asli. Originality.ai lebih seimbang tetapi kurang efektif pada teks yang sudah dihumanisasi. Tidak ada satu pun detector yang mencapai akurasi di atas 80% di semua kategori, yang merupakan keterbatasan signifikan bagi alat yang digunakan untuk membuat keputusan integritas akademik.
Q: Apakah AI detector bekerja pada penulisan akademik?
Mereka bekerja lebih baik pada beberapa jenis penulisan akademik daripada yang lain. Output AI mentah yang belum diedit dalam gaya akademik biasanya terdeteksi, tingkat deteksinya berkisar dari 70% hingga 100% dalam pengujian kami. Namun, teks akademik formal yang ditulis manusia memicu false positive pada tingkat yang mengkhawatirkan, hingga 12% dalam pengujian kami. Bidang teknis dengan kosakata khusus dan penulis berbahasa Inggris non-asli terdampak secara tidak proporsional. Jawaban singkatnya adalah: AI detector bekerja pada penulisan akademik, tetapi tidak cukup andal untuk dijadikan bukti tunggal.
Q: Seberapa sering AI detector menandai tulisan manusia?
Dalam pengujian kami terhadap 20 sampel tulisan manusia (10 penutur asli bahasa Inggris, 10 non-asli), 9 sampel, 45%, memperoleh skor AI di atas 20% pada setidaknya satu detector. Tiga teks yang ditulis manusia memperoleh skor di atas 50% pada setidaknya satu alat. Tingkat false positive per detector berkisar dari 4% hingga 12%. Jika Anda adalah penutur non-asli bahasa Inggris yang menulis prosa akademik formal, peluang false positive bahkan lebih tinggi. Inilah sebabnya kami merekomendasikan untuk menyimpan draf dan bukti proses terlepas dari apakah Anda menggunakan alat AI.
Q: Apakah AI detector bekerja pada teks yang telah dihumanisasi atau diedit?
Jauh kurang andal dibandingkan pada output mentah. Dalam benchmark 2,000 dokumen kami, teks yang diproses oleh academic humanizer lolos dari deteksi AI Turnitin pada hingga 92.33% dokumen pada pengaturan terkuat. Deteksi bergantung pada pola statistik, dan revisi substantif menghapus pola tersebut.
Q: Dapatkah skor deteksi AI digunakan sebagai bukti pelanggaran?
Para vendor sendiri mengatakan tidak. Turnitin memposisikan indikatornya sebagai sinyal untuk peninjauan lebih lanjut, dan false positive pada tulisan manusia yang asli terdokumentasi di seluruh detector utama. Sebuah skor adalah alasan untuk meneliti lebih dekat, dan tidak lebih dari itu.
Proofread and polish your manuscript with tracked changes. Built for academic writing.

Moe adalah seorang insinyur NLP dengan PhD dalam pemrosesan bahasa alami. Penelitiannya mencakup linguistik komputasi, analisis teks, dan pembelajaran mesin, dan dimasukkan langsung ke dalam model pengeditan dan humanisasi di balik ProofreaderPro. Dia menulis tentang bagian dari proses yang kebanyakan orang tidak pernah lihat: bagaimana model bahasa membaca sebuah kalimat, menilainya, dan memutuskan apa yang akan diubah.