Sejauh Mana Ketepatan Pengesan AI pada 2026? Ketepatan Teruji dan Positif Palsu
Pengesan AI mengesan kebanyakan teks AI tanpa suntingan dan masih menanda tulisan manusia. Data ketepatan sebenar untuk Turnitin, GPTZero dan Originality.ai.
Seorang pelajar PhD dalam rangkaian kami telah ditandakan oleh sistem pengesanan universiti sebagai 67% dijana AI dalam pengenalan tesisnya. Dia menulis setiap perkataan sendiri selama empat bulan. Tiada alat AI, tiada pemeriksa tatabahasa, malah tiada semakan ejaan.
Dia menghabiskan dua minggu menulis semula bahagian-bahagian tertentu untuk menurunkan skor. Ia berjaya, tetapi versi yang ditulis semula lebih buruk daripada yang asal.
Kami memutuskan untuk mengetahui dengan tepat sejauh mana kebolehpercayaan alat-alat ini sebenarnya. Jadi kami menguji lima daripadanya.
Jawapan ringkas
Pengesan AI pada 2026 cukup tepat untuk mengesan kebanyakan teks yang dijana AI sepenuhnya tanpa suntingan, dan pada masa yang sama cukup tidak tepat sehingga tiada skor yang patut dianggap sebagai bukti. Tiga penemuan berulang di semua pengesan yang kami ukur. Output mentah daripada ChatGPT, Claude, atau Gemini ditandai dengan boleh dipercayai. Penulisan akademik manusia kadangkala ditandai sebagai AI, dan perkara ini turut diakui oleh vendor pengesan itu sendiri. Dan teks yang disunting atau dihumanisasikan melepasi pengesanan dengan lebih kerap daripada yang disangka oleh universiti, dalam penanda aras terkini kami terhadap 2,000 dokumen akademik, teks yang dihumanisasikan melepasi pengesanan AI Turnitin pada sehingga 92.33% dokumen.
Metodologi ujian kami: 50 sampel merentasi 5 pengesan
Kami menyusun 50 sampel teks, setiap satu antara 500 dan 800 patah perkataan. Sampel-sampel ini terbahagi kepada lima kategori:
- 10 teks akademik yang ditulis sepenuhnya oleh manusia - artikel jurnal yang diterbitkan dari 2018–2022, ditulis sebelum ketersediaan LLM yang meluas
- 10 teks yang dijana sepenuhnya oleh AI - dihasilkan oleh GPT-4o dengan prompt akademik, tanpa pengeditan
- 10 teks yang dijana oleh AI dengan pengeditan manual ringan - draf AI dengan pembetulan manusia untuk ketepatan dan suara
- 10 teks yang dijana oleh AI yang diproses melalui text humanizer kami - proses humanisasi penuh serta semakan manual
- 10 teks yang ditulis oleh manusia bukan penutur jati bahasa Inggeris - makalah yang diterbitkan oleh penyelidik yang menulis dalam bahasa kedua atau ketiga mereka
Kami menjalankan setiap sampel melalui modul pengesanan AI Turnitin, GPTZero, Copyleaks, ZeroGPT, dan Originality.ai. Setiap alat mengembalikan skor kebarangkalian AI. Kami merekodkan setiap skor dan mengira metrik ketepatan.
Keputusan-keputusannya mengejutkan kami. Bukan kerana alat-alat itu gagal sepenuhnya, tetapi kerana corak kegagalannya sangat tidak konsisten.
Pengesanan AI Turnitin: keputusan ketepatan
Turnitin mengenal pasti dengan betul 9 daripada 10 teks yang dijana sepenuhnya oleh AI, dengan skor melebihi 80%. Itu merupakan prestasi yang kukuh untuk output AI yang jelas.
Tempat ia menghadapi kesukaran: positif palsu. Tiga daripada 10 teks akademik yang ditulis manusia memperoleh skor melebihi 20% pada penunjuk AI Turnitin. Satu, sebuah ulasan literatur formal daripada jurnal kimia, memperoleh 38%.
Bagi teks yang telah dihumanisasikan, prestasi Turnitin menurun dengan ketara. Hanya 3 daripada 10 sampel humanized memperoleh skor melebihi ambang 20%. Baki 7 memperoleh antara 2% dan 17%.
Penulisan Bahasa Inggeris oleh bukan penutur asli ialah kategori yang paling lemah. Empat daripada 10 sampel bukan penutur asli ditandai melebihi 20%. Satu memperoleh 52%. Ini ialah kertas kerja yang benar-benar diterbitkan oleh penyelidik manusia yang sebenar.
Ketepatan keseluruhan Turnitin dalam ujian kami: 72%. Itu kedengaran boleh diterima sehingga anda sedar kadar ralat 28% bermaksud kira-kira 1 dalam 4 penghakiman boleh tersilap.
GPTZero vs Copyleaks vs ZeroGPT: head-to-head
Kami menguji tiga pengesan AI kendiri yang paling popular terhadap keseluruhan set sampel kami.
GPTZero ialah pengesan yang paling agresif. Ia mengesan 10 daripada 10 teks AI mentah - recall sempurna. Tetapi ia juga menandakan 4 teks yang ditulis oleh manusia dan 5 teks bukan penutur asli bahasa Inggeris sebagai kebanyakannya dijana AI. Kadar positif palsunya adalah yang tertinggi dalam ujian kami pada 12%.
Copyleaks mengambil pendekatan yang lebih konservatif. Ia mengenal pasti dengan betul 8 daripada 10 teks AI tetapi hanya menandakan 1 sampel yang ditulis oleh manusia secara tidak tepat. Pada teks yang dihumanisasi, ia mengesan 4 daripada 10 - menjadikannya pelaku terbaik terhadap humanisasi, tetapi masih terlepas lebih daripada separuh.
ZeroGPT ialah yang paling tidak boleh dipercayai. Ia menandakan 7 daripada 10 teks AI dengan betul tetapi juga tersilap menandakan 3 teks yang ditulis oleh manusia. Lebih teruk lagi, skor-skoornya berfluktuasi - kami menjalankan sampel yang sama dua kali dan mendapat hasil yang berbeza 30% daripada masa. Konsistensi penting dalam alat pengesanan, dan ZeroGPT gagal memberikannya.
Originality.ai menunjukkan prestasi yang baik pada teks AI mentah (9/10 dikesan) dan mempunyai kadar positif palsu yang rendah pada teks manusia (1/10 tersalah tanda). Pada teks yang dihumanisasi, ia mengesan 5 daripada 10 - berada di pertengahan kumpulan.
Berikut ialah ringkasan yang tidak menyenangkan: tiada pengesan mencapai ketepatan keseluruhan melebihi 80% merentas semua kategori sampel.
Penanda aras 2,000 dokumen kami: seberapa kerap pengesanan terlepas teks yang telah disunting
Ketepatan pengesanan biasanya dilaporkan terhadap output AI mentah, yang melebih-lebihkan prestasi pengesan pada teks yang telah disemak semula. Untuk mengukur jurang ini, kami memanusiakan dokumen akademik dengan humanizer akademik ProofreaderPro dan menyerahkannya kepada setiap pengesan melalui antara muka standardnya. Sesuatu dokumen lulus apabila kebarangkalian AI yang dikembalikan berada di bawah ambang penandaan pengesan itu sendiri.
| Detector | Pass rate, Balanced intensity | Pass rate, Aggressive intensity |
|---|---|---|
| Turnitin AI | 86.0% | 92.33% |
| Originality.ai | 84.5% | 89.12% |
| GPTZero | 82.8% | 87.91% |
Kesetiaan semantik terhadap teks sumber kekal melebihi 94% pada setiap larian. Korpus ini merangkumi 2,000 dokumen akademik merentasi STEM, sains sosial, dan bidang kemanusiaan, dan kami mengemas kini angka-angka ini dengan setiap larian penanda aras. Metodologi penuh terdapat dalam perbandingan AI humanizer kami.
Implikasinya terhadap dakwaan ketepatan adalah langsung, pengesan yang boleh dipercayai dalam menangkap output model mentah masih boleh terlepas sebahagian besar teks yang telah disunting. Skor pengesanan menerangkan statistik permukaan, dan semakan semula mengubah statistik tersebut.
Apa yang dikatakan vendor pengesanan tentang ketepatan mereka sendiri
Dokumentasi vendor lebih berhati-hati daripada amalan universiti. Panduan yang diterbitkan oleh Turnitin menyatakan bahawa penunjuk penulisan AI mereka boleh menghasilkan positif palsu, terutamanya sekitar ambang pelaporan yang lebih rendah, dan syarikat itu menggambarkan penunjuk tersebut sebagai titik permulaan untuk perbualan dengan pengajar, bukannya bukti salah laku. GPTZero menerbitkan angka ketepatan tersendiri dan mengesyorkan semakan manusia terhadap setiap dokumen yang dibenderakan. OpenAI telah menamatkan pengelas teks AI rasminya pada 2023 selepas menyimpulkan bahawa ketepatannya terlalu rendah untuk berguna. Apabila syarikat yang membina sistem ini memberitahu pengguna supaya mengesahkan penanda secara manual, menganggap sesuatu peratusan sebagai bukti melampaui apa yang didakwa oleh alat tersebut tentang dirinya sendiri.
Bimbang Tentang Positif Palsu?
Pemanusia teks kami menambah variasi semula jadi pada penulisan anda, sama ada dibantu AI atau tidak. Kurangkan risiko positif palsu tanpa mengubah idea anda.
Cuba Secara PercumaMasalah positif palsu yang tiada siapa bincangkan
Positif palsu ialah krisis senyap dalam pengesanan AI. Apabila pengesan tersilap menandakan teks yang ditulis oleh manusia sebagai dijana AI, beban pembuktian diletakkan pada penulis. "Buktikan anda tidak menggunakan AI" ialah tuntutan yang hampir mustahil.
Ujian kami mendapati pola yang konsisten apabila teks manusia tersilap ditandakan:
Penulisan formal yang sangat berstruktur. Semakin tersusun dan kemas prosa anda, semakin besar kemungkinan pengesan akan menandakannya. Ayat topik yang jelas, perkembangan perenggan yang logik, terminologi yang konsisten, semua ini ialah pola yang dikongsi oleh penulisan manusia yang baik dan output AI.
Bahagian yang formulaik. Bahagian kaedah, huraian prosedur, dan ulasan literatur mengikut templat khusus disiplin. Setiap penyelidik menulis "data were collected using semi-structured interviews" dengan cara yang sama. Pengesan tidak dapat membezakan konvensyen daripada penjanaan.
Perbendaharaan kata berentropi rendah. Sesetengah bidang, seperti undang-undang, perubatan, kejuruteraan, menggunakan perbendaharaan kata khusus dengan pilihan sinonim yang terhad. Apabila anda perlu menggunakan istilah tertentu berulang kali, teks anda kelihatan lebih "predictable" kepada pengesan berasaskan perplexity.
Bahasa Inggeris bukan penutur asli. Kami terus kembali kepada perkara ini kerana inilah dapatan yang paling membimbangkan. Penyelidik yang menulis dalam bahasa kedua menghasilkan teks dengan kepelbagaian leksikal yang lebih rendah dan struktur yang lebih formulaik, tepat sekali pola yang dikaitkan oleh pengesan dengan AI. Ini mewujudkan hasil yang bersifat diskriminatif, dan kebanyakan institusi belum benar-benar menanganinya.
Apa maknanya ini untuk penyelidik yang menggunakan alat AI
Jika anda menggunakan AI sebagai pembantu penulisan, sama ada untuk menyusun draf, menyusun semula, atau memurnikan, landskap pengesanan mewujudkan masalah yang sebenar. Malah teks yang anda tulis sepenuhnya dengan tangan pun mungkin dibenderakan. Teks yang dibantu AI hampir pasti akan dibenderakan melainkan anda mengambil langkah untuk memanusiakannya.
Cadangan kami berdasarkan ujian ini:
Jangan percayai keputusan mana-mana satu pengesan sahaja. Kami melihat sampel yang mendapat 5% pada satu alat dan 68% pada alat lain. Jika institusi anda menggunakan satu pengesan, itulah yang penting untuk pematuhan, tetapi satu skor sahaja bukan bukti penggunaan AI.
Manusiakan secara strategik. Output mentah AI boleh dikesan. Teks yang dimanusiakan dengan baik kebanyakannya tidak. Jika anda menggunakan bantuan AI, jalankan draf anda melalui quality humanization tool dan tambahkan suara peribadi anda. Ujian kami menunjukkan gabungan ini mengurangkan skor pengesanan kepada bawah 15% merentasi semua lima alat.
Simpan draf anda. Simpan versi pertengahan hasil kerja anda. Sejarah penyemak imbas, log perbualan ChatGPT, PDF beranotasi, nota tulisan tangan, semua ini menyediakan bukti proses penulisan anda jika anda pernah dipersoalkan.
Utarakan dasar institusi yang lebih baik. Alat pengesanan AI tidak cukup dipercayai untuk berfungsi sebagai satu-satunya bukti salah laku akademik. Jika universiti anda menganggap skor AI Turnitin sebagai bukti, bantah, dengan data. Kongsikan kajian seperti ini.
Untuk langkah praktikal dalam mengendalikan teks yang dibenderakan, lihat panduan kami tentang how researchers are bypassing AI detection without cheating.
Perlumbaan senjata pengesanan AI tidak menunjukkan tanda melambat. Pengesan akan bertambah baik. Tetapi alat penulisan berbantukan AI juga akan bertambah baik. Penyelesaian jangka panjang bukanlah pengesanan yang lebih baik, tetapi dasar yang lebih baik yang mengakui bagaimana penulisan sebenarnya berlaku sekarang.
Kerja anda adalah nyata. Idea anda adalah nyata. Algoritma yang cacat tidak sepatutnya menjadi penilai untuk itu.
Soalan lazim
Q: Which AI detector is most accurate?
Dalam ujian kami, Turnitin dan Originality.ai terikat untuk ketepatan keseluruhan tertinggi pada 72% dan 74% masing-masing merentasi semua kategori sampel. Walau bagaimanapun, ketepatan berbeza dengan ketara mengikut jenis teks. Turnitin paling baik dalam mengesan output AI mentah tetapi mempunyai lebih banyak positif palsu pada teks Bahasa Inggeris bukan penutur asli. Originality.ai lebih seimbang tetapi kurang berkesan pada teks yang telah dihumanisasikan. Tiada satu pun pengesan mencapai ketepatan melebihi 80% merentasi semua kategori, yang merupakan batasan besar bagi alat yang digunakan untuk membuat keputusan integriti akademik.
Q: Do AI detectors work on academic writing?
Ia berfungsi lebih baik pada sesetengah jenis penulisan akademik berbanding yang lain. Output AI mentah yang belum disunting dalam gaya akademik biasanya dapat dikesan - kadar pengesanan berada antara 70% hingga 100% dalam ujian kami. Tetapi teks akademik formal yang ditulis oleh manusia mencetuskan positif palsu pada kadar yang membimbangkan - sehingga 12% dalam ujian kami. Bidang teknikal dengan kosa kata khusus dan penulis Bahasa Inggeris bukan penutur asli terjejas secara tidak seimbang. Jawapan ringkasnya ialah: pengesan AI berfungsi pada penulisan akademik, tetapi tidak cukup boleh dipercayai untuk dijadikan bukti tunggal.
Q: How often do AI detectors flag human writing?
Dalam ujian kami terhadap 20 sampel yang ditulis oleh manusia (10 penutur asli Bahasa Inggeris, 10 bukan penutur asli), 9 sampel - 45% - menerima skor AI melebihi 20% pada sekurang-kurangnya satu pengesan. Tiga teks yang ditulis oleh manusia memperoleh skor melebihi 50% pada sekurang-kurangnya satu alat. Kadar positif palsu bagi setiap pengesan berada antara 4% hingga 12%. Jika anda seorang penutur Bahasa Inggeris bukan penutur asli yang menulis prosa akademik formal, kebarangkalian positif palsu adalah lebih tinggi. Inilah sebabnya kami mengesyorkan agar draf dan bukti proses disimpan tanpa mengira sama ada anda menggunakan alat AI.
Q: Do AI detectors work on humanized or edited text?
Jauh kurang boleh dipercayai berbanding pada output mentah. Dalam penanda aras 2,000 dokumen kami, teks yang diproses oleh humanizer akademik melepasi pengesanan AI Turnitin pada sehingga 92.33% dokumen pada tetapan paling kuat. Pengesanan bergantung pada corak statistik, dan semakan substantif menghapuskannya.
Q: Can an AI detection score be used as proof of misconduct?
Pembekal sendiri mengatakan tidak. Turnitin menggambarkan penunjuknya sebagai isyarat untuk semakan lanjut, dan positif palsu pada penulisan manusia yang sebenar didokumenkan merentasi setiap pengesan utama. Skor hanyalah alasan untuk meneliti dengan lebih dekat, dan bukan lebih daripada itu.
Proofread and polish your manuscript with tracked changes. Built for academic writing.

Moe ialah seorang jurutera NLP dengan PhD dalam pemprosesan bahasa semula jadi. Penyelidikan beliau meliputi linguistik pengiraan, analisis teks dan pembelajaran mesin, dan ia disalurkan terus ke dalam model penyuntingan dan kemanusiaan di belakang ProofreaderPro. Dia menulis tentang bahagian proses yang tidak pernah dilihat oleh kebanyakan orang: bagaimana model bahasa membaca ayat, menjaringkannya dan memutuskan perkara yang perlu diubah.