Quanto sono accurati i rilevatori di IA nel 2026? Accuratezza testata e falsi positivi
I rilevatori di IA intercettano gran parte del testo non modificato e possono segnalare anche testi umani. Dati su Turnitin, GPTZero e Originality.ai.
Una dottoranda della nostra rete ha visto la sua introduzione di tesi segnalata come generata al 67% dall'AI dal sistema di rilevamento della sua universita. Ha scritto ogni parola da sola, nell'arco di quattro mesi. Nessun strumento di AI, nessun correttore grammaticale, nemmeno il controllo ortografico.
Ha trascorso due settimane a riscrivere sezioni per abbassare il punteggio. Ha funzionato, ma la versione riscritta era peggiore dell'originale.
Abbiamo deciso di scoprire esattamente quanto siano affidabili questi strumenti. Quindi ne abbiamo testati cinque.
La risposta rapida
I detector AI nel 2026 sono abbastanza accurati da individuare la maggior parte del testo non modificato, interamente generato dall'AI, e abbastanza imprecisi da non poter considerare alcun punteggio come prova. Tre risultati si ripetono in ogni detector che abbiamo misurato. L'output grezzo di ChatGPT, Claude o Gemini viene segnalato in modo affidabile. La scrittura accademica umana viene talvolta segnalata come AI, cosa che gli stessi fornitori dei detector riconoscono. E il testo modificato o umanizzato supera il controllo molto più spesso di quanto le università presumano: nel nostro ultimo benchmark su 2.000 documenti accademici, il testo umanizzato ha superato il rilevamento AI di Turnitin in fino al 92.33% dei documenti.
La nostra metodologia di test: 50 campioni su 5 detector
Abbiamo assemblato 50 campioni di testo, ciascuno compreso tra 500 e 800 parole. I campioni rientravano in cinque categorie:
- 10 testi accademici scritti interamente da esseri umani - articoli pubblicati su riviste dal 2018–2022, scritti prima della diffusione su larga scala della disponibilita di LLM
- 10 testi interamente generati da AI - prodotti da GPT-4o con prompt accademici, senza modifiche
- 10 testi generati da AI con lieve editing manuale - bozze AI con correzioni umane per accuratezza e stile
- 10 testi generati da AI elaborati tramite il nostro text humanizer - passaggio completo di umanizzazione piu revisione manuale
- 10 testi scritti da esseri umani non madrelingua inglese - articoli pubblicati da ricercatori che scrivono nella loro seconda o terza lingua
Abbiamo eseguito ogni campione attraverso il modulo di rilevamento AI di Turnitin, GPTZero, Copyleaks, ZeroGPT e Originality.ai. Ogni strumento ha restituito un punteggio di probabilita di AI. Abbiamo registrato ogni punteggio e calcolato le metriche di accuratezza.
I risultati ci hanno sorpreso. Non perche gli strumenti abbiano fallito completamente, ma perche i modelli di errore erano incoerenti in modo sorprendente.
Rilevamento AI di Turnitin: risultati di accuratezza
Turnitin ha identificato correttamente 9 testi su 10 interamente generati da AI, assegnando loro un punteggio superiore all'80%. Si tratta di una prestazione solida per output AI evidenti.
Dove ha mostrato criticita: i falsi positivi. Tre dei nostri 10 testi accademici scritti da esseri umani hanno ottenuto un punteggio superiore al 20% nell'indicatore AI di Turnitin. Uno, una rassegna della letteratura formale tratta da una rivista di chimica, ha raggiunto il 38%.
Nei testi resi piu umani, la prestazione di Turnitin e calata in modo significativo. Solo 3 dei 10 campioni umanizzati hanno superato la soglia del 20%. I restanti 7 si sono collocati tra il 2% e il 17%.
La scrittura in inglese da parte di non madrelingua e stata la categoria peggiore. Quattro dei 10 campioni non nativi hanno superato il 20% di segnalazione. Uno ha ottenuto il 52%. Si trattava di articoli pubblicati realmente, scritti da ricercatori umani reali.
L'accuratezza complessiva di Turnitin nel nostro test e stata del 72%. Sembra accettabile finche non si considera che un tasso di errore del 28% significa che circa 1 giudizio su 4 potrebbe essere sbagliato.
GPTZero vs Copyleaks vs ZeroGPT: testa a testa
Abbiamo testato i tre detector AI standalone più popolari sul nostro set completo di campioni.
GPTZero è stato il detector più aggressivo. Ha individuato 10 testi AI grezzi su 10, un richiamo perfetto. Ma ha anche segnalato erroneamente 4 testi scritti da esseri umani e 5 testi in inglese di non madrelingua come prevalentemente generati dall'AI. Il suo tasso di falsi positivi è stato il più alto del nostro test, al 12%.
Copyleaks ha adottato un approccio più conservativo. Ha identificato correttamente 8 testi AI su 10, ma ha segnalato erroneamente solo 1 campione scritto da esseri umani. Sul testo umanizzato, ne ha individuati 4 su 10, risultando il migliore contro l'umanizzazione, ma mancando comunque più della metà.
ZeroGPT è stato il meno affidabile. Ha segnalato correttamente 7 testi AI su 10, ma ha anche segnalato erroneamente 3 testi scritti da esseri umani. Peggio ancora, i suoi punteggi oscillavano, abbiamo eseguito lo stesso campione due volte e ottenuto risultati diversi nel 30% dei casi. La coerenza conta in uno strumento di rilevazione, e ZeroGPT non l'ha garantita.
Originality.ai ha ottenuto buoni risultati sul testo AI grezzo (9/10 rilevati) e ha mostrato un basso tasso di falsi positivi sul testo umano (1/10 segnalato erroneamente). Sul testo umanizzato, ne ha individuati 5 su 10, posizionandosi a metà del gruppo.
Ecco il riepilogo scomodo: nessun detector ha raggiunto oltre l'80% di accuratezza complessiva su tutte le categorie di campioni.
Il nostro benchmark di 2.000 documenti: quanto spesso il rilevamento manca il testo modificato
L'accuratezza del rilevamento viene di solito riportata rispetto all'output grezzo dell'AI, il che sovrastima le prestazioni dei detector sul testo che è stato revisionato. Per misurare il divario, umanizziamo documenti accademici con ProofreaderPro's academic humanizer e li sottoponiamo a ciascun detector tramite la sua interfaccia standard. Un documento supera la prova quando la probabilita AI restituita si colloca al di sotto della soglia di segnalazione del detector.
| Detector | Tasso di superamento, intensita bilanciata | Tasso di superamento, intensita aggressiva |
|---|---|---|
| Turnitin AI | 86.0% | 92.33% |
| Originality.ai | 84.5% | 89.12% |
| GPTZero | 82.8% | 87.91% |
La fedelta semantica al testo di origine e rimasta sopra il 94% in ciascuna esecuzione. Il corpus comprende 2.000 documenti accademici provenienti da STEM, dalle scienze sociali e dalle discipline umanistiche, e aggiorniamo i dati a ogni esecuzione del benchmark. La metodologia completa e nella nostra AI humanizer comparison.
La implicazione per le affermazioni di accuratezza e diretta: un detector che intercetta in modo affidabile l'output grezzo del modello puo comunque mancare la grande maggioranza del testo modificato. I punteggi di rilevamento descrivono statistiche di superficie, e la revisione modifica tali statistiche.
Preoccupato per i falsi positivi?
Il nostro text humanizer aggiunge una variabilità naturale alla tua scrittura, sia che sia stata assistita dall'AI o meno. Riduci il rischio di falsi positivi senza cambiare le tue idee.
Provalo gratisCosa dicono i fornitori di rilevamento sulla propria accuratezza
La documentazione dei fornitori è più prudente della pratica universitaria. Le linee guida pubblicate da Turnitin affermano che il suo indicatore di scrittura AI può produrre falsi positivi, in particolare in prossimità della sua soglia di segnalazione più bassa, e l'azienda descrive l'indicatore come punto di partenza per una conversazione con il docente, non come prova di scorrettezza. GPTZero pubblica le proprie metriche di accuratezza e raccomanda una revisione umana di ogni documento segnalato. OpenAI ha ritirato il suo classificatore ufficiale di testi AI nel 2023 dopo aver concluso che la sua accuratezza era troppo bassa per essere utile. Quando le aziende che costruiscono questi sistemi dicono agli utenti di verificare manualmente le segnalazioni, trattare una percentuale come prova va oltre quanto gli strumenti dichiarano di per sé.
Il problema dei falsi positivi di cui nessuno parla
I falsi positivi sono la crisi silenziosa del rilevamento dell'AI. Quando un detector segnala erroneamente un testo scritto da una persona come generato dall'AI, sposta sull'autore l'onere della prova. "Dimostra di non aver usato l'AI" è una richiesta quasi impossibile.
I nostri test hanno rilevato schemi costanti in cui testi umani venivano segnalati erroneamente:
Scrittura formale altamente strutturata. Più la tua prosa è organizzata e rifinita, più è probabile che un detector la segnali. Frasi tematiche chiare, progressione logica dei paragrafi, terminologia coerente, tutti questi sono schemi condivisi dalla buona scrittura umana e dall'output dell'AI.
Sezioni formulari. Le sezioni sui metodi, le descrizioni procedurali e le rassegne della letteratura seguono modelli specifici della disciplina. Ogni ricercatore scrive "data were collected using semi-structured interviews" allo stesso modo. I detector non riescono a distinguere la convenzione dalla generazione.
Vocabolario a bassa entropia. Alcuni ambiti, diritto, medicina, ingegneria, usano un lessico specializzato con opzioni di sinonimia limitate. Quando devi usare termini specifici in modo ripetuto, il tuo testo appare più "prevedibile" a un detector basato sulla perplexity.
Inglese non madrelingua. Torniamo sempre su questo punto perché è il risultato più preoccupante. I ricercatori che scrivono nella loro seconda lingua producono testi con minore diversità lessicale e strutture più formulari, esattamente gli schemi che i detector associano all'AI. Questo crea un esito discriminatorio con cui la maggior parte delle istituzioni non ha ancora fatto i conti.
Cosa significa questo per i ricercatori che usano strumenti di AI
Se stai usando l'AI come assistente alla scrittura - per redigere, ristrutturare, rifinire - il panorama del rilevamento crea un problema reale. Anche un testo scritto interamente a mano potrebbe risultare segnalato. Un testo assistito dall'AI quasi certamente verrà segnalato, a meno che tu non prenda misure per umanizzarlo.
Le nostre raccomandazioni basate su questo test:
Non fidarti del verdetto di un singolo rilevatore. Abbiamo visto campioni che ottenevano il 5% su uno strumento e il 68% su un altro. Se la tua istituzione usa un solo rilevatore, è quello che conta ai fini della conformità, ma un singolo punteggio non è una prova dell'uso di AI.
Umanizza in modo strategico. Un output grezzo dell'AI è rilevabile. Un testo ben umanizzato, per lo più, non lo è. Se hai usato l'assistenza dell'AI, passa la tua bozza attraverso un quality humanization tool e aggiungi la tua voce personale. Il nostro test ha mostrato che questa combinazione ha ridotto i punteggi di rilevamento sotto il 15% in tutti e cinque gli strumenti.
Conserva le tue bozze. Salva le versioni intermedie del tuo lavoro. La cronologia del browser, i log delle conversazioni di ChatGPT, i PDF annotati, gli appunti scritti a mano, tutto questo fornisce evidenza del tuo processo di scrittura, nel caso in cui ti venisse mai chiesto chiarimento.
Sostieni politiche istituzionali migliori. Gli strumenti di rilevamento dell'AI non sono sufficientemente affidabili da costituire l'unica prova di disonestà accademica. Se la tua università considera un punteggio AI di Turnitin come prova, opponiti, con i dati. Condividi studi come questo.
Per passaggi pratici su come gestire un testo segnalato, consulta la nostra guida su how researchers are bypassing AI detection without cheating.
La corsa agli armamenti del rilevamento dell'AI non si sta rallentando. I rilevatori miglioreranno. Ma miglioreranno anche gli strumenti di scrittura assistita dall'AI. La soluzione a lungo termine non è un rilevamento migliore, è una politica migliore che riconosca come la scrittura avviene davvero oggi.
Il tuo lavoro è reale. Le tue idee sono reali. Un algoritmo imperfetto non dovrebbe esserne il giudice.
Domande frequenti
Q: Which AI detector is most accurate?
Nei nostri test, Turnitin e Originality.ai hanno ottenuto a pari merito la massima accuratezza complessiva, con il 72% e il 74% rispettivamente in tutte le categorie di campioni. Tuttavia, l'accuratezza variava in modo significativo in base al tipo di testo. Turnitin era il migliore nell'individuare il testo AI grezzo, ma produceva più falsi positivi sui testi in inglese di autori non madrelingua. Originality.ai era più equilibrato, ma meno efficace sui testi umanizzati. Nessun singolo rilevatore ha superato l'80% di accuratezza in tutte le categorie, il che rappresenta un limite significativo per strumenti usati per prendere decisioni sull'integrità accademica.
Q: Do AI detectors work on academic writing?
Funzionano meglio su alcuni tipi di scrittura accademica rispetto ad altri. Il testo AI grezzo, non modificato, in stile accademico viene di solito individuato, i tassi di rilevamento nel nostro test variavano dal 70% al 100%. Ma il testo accademico formale scritto da esseri umani attiva falsi positivi a tassi preoccupanti, fino al 12% nei nostri test. I campi tecnici con vocabolario specialistico e gli autori non madrelingua inglesi sono colpiti in modo sproporzionato. La risposta breve è: i rilevatori AI funzionano sulla scrittura accademica, ma non in modo sufficientemente affidabile da costituire una prova autonoma.
Q: How often do AI detectors flag human writing?
Nel nostro test di 20 campioni scritti da esseri umani (10 in inglese madrelingua, 10 non madrelingua), 9 campioni, il 45%, hanno ricevuto un punteggio AI superiore al 20% su almeno un rilevatore. Tre testi scritti da esseri umani hanno ottenuto oltre il 50% su almeno uno strumento. Il tasso di falsi positivi per rilevatore variava dal 4% al 12%. Se siete autori non madrelingua inglese e scrivete prosa accademica formale, la probabilità di un falso positivo è ancora più alta. Per questo raccomandiamo di conservare bozze ed evidenze del processo, indipendentemente dal fatto che abbiate usato strumenti AI.
Q: Do AI detectors work on humanized or edited text?
Molto meno affidabilmente che sul testo grezzo. Nel nostro benchmark di 2,000 documenti, il testo elaborato da un humanizer accademico ha superato il rilevamento AI di Turnitin fino al 92.33% dei documenti con l'impostazione più rigorosa. Il rilevamento dipende da schemi statistici, e una revisione sostanziale li elimina.
Q: Can an AI detection score be used as proof of misconduct?
Gli stessi fornitori dicono di no. Turnitin presenta il proprio indicatore come un segnale per un'ulteriore revisione, e i falsi positivi su scrittura autenticamente umana sono documentati in tutti i principali rilevatori. Un punteggio è un motivo per approfondire, e nient'altro.
Correggi e rifinisci il tuo manoscritto con le modifiche tracciate. Progettato per la scrittura accademica.

Moe è un ingegnere NLP con un PhD nell'elaborazione del linguaggio naturale. La sua ricerca copre la linguistica computazionale, l'analisi del testo e l'apprendimento automatico e ha alimentato direttamente i modelli di editing e umanizzazione dietro ProofreaderPro. Scrive della parte del processo che la maggior parte delle persone non vede mai: come un modello linguistico legge una frase, le assegna un punteggio e decide cosa cambiare.