Quao precisos sao os detectores de IA em 2026? Precisao testada e falsos positivos
Detectores de IA captam a maioria dos textos sem edicao e ainda sinalizam escrita humana. Dados reais de Turnitin, GPTZero e Originality.ai.
Uma estudante de doutorado da nossa rede teve a introdução da sua tese assinalada como 67% gerada por IA pelo sistema de deteção da sua universidade. Ela escreveu cada palavra sozinha ao longo de quatro meses. Sem ferramentas de IA, sem verificadores gramaticais, nem sequer correção ortográfica.
Ela passou duas semanas a reescrever secções para baixar a pontuação. Funcionou, mas a versão reescrita ficou pior do que a original.
Decidimos descobrir exatamente quão fiáveis estas ferramentas são na realidade. Por isso, testámos cinco delas.
A resposta rápida
Os detectores de IA em 2026 são suficientemente precisos para identificar a maior parte do texto totalmente gerado por IA sem edição, e ao mesmo tempo imprecisos a ponto de nenhuma pontuação dever ser tratada como prova. Três conclusões se repetem em todos os detectores que medimos. A produção bruta do ChatGPT, Claude ou Gemini é sinalizada de forma confiável. A escrita acadêmica humana às vezes é sinalizada como IA, algo que os próprios fornecedores dos detectores reconhecem. E o texto editado ou humanizado passa com muito mais frequência do que as universidades presumem: em nosso benchmark mais recente com 2.000 documentos acadêmicos, o texto humanizado contornou a detecção de IA do Turnitin em até 92.33% dos documentos.
Nossa metodologia de teste: 50 amostras em 5 detectores
Reunimos 50 amostras de texto, cada uma com entre 500 e 800 palavras. As amostras foram distribuídas em cinco categorias:
- 10 textos acadêmicos inteiramente escritos por humanos - artigos de periódicos publicados de 2018 a 2022, escritos antes da ampla disponibilidade de LLMs
- 10 textos inteiramente gerados por IA - produzidos pelo GPT-4o com prompts acadêmicos, sem edição
- 10 textos gerados por IA com edição manual leve - rascunhos de IA com correções humanas para precisão e estilo
- 10 textos gerados por IA processados por meio do nosso text humanizer - passagem completa de humanização mais revisão manual
- 10 textos escritos por humanos, mas por falantes não nativos de inglês - artigos publicados por pesquisadores escrevendo em sua segunda ou terceira língua
Executamos cada amostra no módulo de detecção de IA do Turnitin, GPTZero, Copyleaks, ZeroGPT e Originality.ai. Cada ferramenta retornou uma pontuação de probabilidade de IA. Registramos todas as pontuações e calculamos métricas de precisão.
Os resultados nos surpreenderam. Não porque as ferramentas tivessem falhado completamente, mas porque os padrões de falha eram extremamente inconsistentes.
Detecção de IA do Turnitin: resultados de precisão
O Turnitin identificou corretamente 9 de 10 textos gerados exclusivamente por IA, atribuindo-lhes mais de 80%. Isso é um desempenho sólido em conteúdo de IA óbvio.
Onde ele teve dificuldade: falsos positivos. Três dos nossos 10 textos acadêmicos escritos por humanos obtiveram mais de 20% no indicador de IA do Turnitin. Um, uma revisão formal da literatura de um periódico de química, obteve 38%.
Em texto humanizado, o desempenho do Turnitin caiu significativamente. Apenas 3 de 10 amostras humanizadas obtiveram pontuação acima do limite de 20%. As 7 restantes ficaram entre 2% e 17%.
A escrita em inglês por falantes não nativos foi a pior categoria. Quatro de 10 amostras de falantes não nativos foram sinalizadas acima de 20%. Uma obteve 52%. Eram artigos publicados de verdade por pesquisadores humanos de verdade.
A precisão geral do Turnitin em nosso teste foi de 72%. Isso parece aceitável até você perceber que uma taxa de erro de 28% significa que aproximadamente 1 em cada 4 julgamentos pode estar errado.
GPTZero vs Copyleaks vs ZeroGPT: head-to-head
Testamos os três detectores de IA independentes mais populares contra o nosso conjunto completo de amostras.
GPTZero foi o detector mais agressivo. Identificou 10 de 10 textos brutos gerados por IA, com recall perfeito. Mas também assinalou 4 textos escritos por humanos e 5 textos em inglês de falantes não nativos como predominantemente gerados por IA. Sua taxa de falso positivo foi a mais alta no nosso teste, em 12%.
Copyleaks adotou uma abordagem mais conservadora. Identificou corretamente 8 de 10 textos de IA, mas assinalou incorretamente apenas 1 amostra escrita por humanos. Em texto humanizado, identificou 4 de 10, o que o torna o melhor desempenho contra a humanização, mas ainda com mais da metade sem detecção.
ZeroGPT foi o menos confiável. Assinalou corretamente 7 de 10 textos de IA, mas também assinalou incorretamente 3 textos escritos por humanos. Pior ainda, suas pontuações oscilavam, executamos a mesma amostra duas vezes e obtivemos resultados diferentes em 30% das vezes. Consistência é importante em uma ferramenta de detecção, e o ZeroGPT não a entregou.
Originality.ai teve bom desempenho em texto bruto gerado por IA (9/10 detectados) e apresentou uma baixa taxa de falso positivo em texto humano (1/10 assinalado incorretamente). Em texto humanizado, identificou 5 de 10, ficando no meio do grupo.
Aqui está o resumo incômodo: nenhum detector alcançou mais de 80% de precisão geral em todas as categorias de amostras.
Nosso benchmark de 2.000 documentos: com que frequência a detecção deixa passar texto editado
A precisão da detecção costuma ser relatada em relação à saída bruta de IA, o que superestima o desempenho dos detectores em texto que foi revisado. Para medir essa lacuna, humanizamos documentos acadêmicos com ProofreaderPro's academic humanizer e os submetemos a cada detector por meio de sua interface padrão. Um documento é aprovado quando a probabilidade de IA retornada fica abaixo do próprio limiar de sinalização do detector.
| Detector | Taxa de aprovação, intensidade equilibrada | Taxa de aprovação, intensidade agressiva |
|---|---|---|
| Turnitin AI | 86.0% | 92.33% |
| Originality.ai | 84.5% | 89.12% |
| GPTZero | 82.8% | 87.91% |
A fidelidade semântica ao texto-fonte permaneceu acima de 94% em cada execução. O corpus abrange 2.000 documentos acadêmicos em STEM, nas ciências sociais e nas humanidades, e atualizamos os valores a cada rodada do benchmark. A metodologia completa está em nossa AI humanizer comparison.
A implicação para as alegações de precisão é direta: um detector que identifica de forma confiável a saída bruta de um modelo ainda pode deixar passar a grande maioria do texto editado. As pontuações de detecção descrevem estatísticas de superfície, e a revisão altera essas estatísticas.
Preocupado com falsos positivos?
Nosso humanizador de texto acrescenta variação natural à sua escrita, com ou sem assistência de IA. Reduza o risco de falsos positivos sem alterar suas ideias.
Experimente GratuitamenteO que os fornecedores de detecção dizem sobre sua própria precisão
A documentação dos fornecedores é mais cautelosa do que a prática universitária. A orientação publicada pela Turnitin afirma que seu indicador de escrita com IA pode produzir falsos positivos, especialmente em torno de seu limiar de relatório mais baixo, e a empresa descreve o indicador como o ponto de partida para uma conversa com o instrutor, e não como evidência de má conduta. A GPTZero publica suas próprias métricas de precisão e recomenda revisão humana de todo documento sinalizado. A OpenAI aposentou seu classificador oficial de texto com IA em 2023 depois de concluir que sua precisão era baixa demais para ser útil. Quando as empresas que constroem esses sistemas dizem aos usuários para verificar manualmente as sinalizações, tratar uma porcentagem como prova vai além do que as próprias ferramentas afirmam sobre si mesmas.
O problema dos falsos positivos de que ninguém fala
Os falsos positivos são a crise silenciosa na detecção por IA. Quando um detector sinaliza incorretamente um texto escrito por humanos como gerado por IA, ele transfere para o autor o ônus da prova. "Prove que você não usou IA" é uma exigência quase impossível.
Nossos testes identificaram padrões consistentes em que textos humanos foram sinalizados falsamente:
Escrita formal altamente estruturada. Quanto mais organizado e polido for o seu texto, maior a probabilidade de um detector o sinalizar. Frases-tópico claras, progressão lógica dos parágrafos, terminologia consistente, todos esses são padrões compartilhados por uma boa escrita humana e pela produção de IA.
Seções formulaicas. Seções de métodos, descrições de procedimentos e revisões de literatura seguem modelos específicos da disciplina. Todo pesquisador escreve "data were collected using semi-structured interviews" da mesma maneira. Os detectores não conseguem distinguir convenção de geração.
Vocabulário de baixa entropia. Algumas áreas, direito, medicina, engenharia, usam vocabulário especializado com opções limitadas de sinônimos. Quando você precisa empregar termos específicos repetidamente, seu texto parece mais "previsível" para um detector baseado em perplexidade.
Inglês não nativo. Voltamos a este ponto porque é o achado mais preocupante. Pesquisadores que escrevem em sua segunda língua produzem textos com menor diversidade lexical e estruturas mais formulaicas, exatamente os padrões que os detectores associam à IA. Isso cria um resultado discriminatório que a maioria das instituições ainda não enfrentou.
O que isto significa para investigadores que utilizam ferramentas de IA
Se está a usar IA como assistente de escrita, a redigir, reestruturar, polir, o panorama da deteção cria um problema real. Mesmo texto que tenha escrito inteiramente à mão pode ser assinalado. Texto assistido por IA quase certamente será assinalado, a menos que tome medidas para o humanizar.
As nossas recomendações com base neste teste:
Não confie no veredicto de um único detetor. Vimos amostras que obtiveram 5% numa ferramenta e 68% noutra. Se a sua instituição usa um detetor, esse é o que importa para efeitos de conformidade, mas uma única pontuação não é prova de uso de IA.
Humanize de forma estratégica. A produção bruta de IA é detetável. Texto bem humanizado, na maior parte, não é. Se utilizou assistência de IA, faça passar o seu rascunho por uma ferramenta de humanização de qualidade e acrescente a sua voz pessoal. O nosso teste mostrou que esta combinação reduziu as pontuações de deteção para menos de 15% em todas as cinco ferramentas.
Guarde os seus rascunhos. Guarde versões intermédias do seu trabalho. O histórico do navegador, os registos de conversas do ChatGPT, PDFs anotados, notas manuscritas, tudo isto fornece prova do seu processo de escrita, caso alguma vez seja questionado.
Defenda políticas institucionais melhores. As ferramentas de deteção de IA não são suficientemente fiáveis para servirem como única prova de desonestidade académica. Se a sua universidade tratar uma pontuação de IA do Turnitin como prova, conteste, com dados. Partilhe estudos como este.
Para passos práticos sobre como lidar com texto assinalado, veja o nosso guia sobre como investigadores estão a contornar a deteção de IA sem trapacear.
A corrida armamentista da deteção de IA não está a abrandar. Os detetores vão melhorar. Mas as ferramentas de escrita assistida por IA também vão melhorar. A solução a longo prazo não é uma melhor deteção, é uma política melhor que reconheça como a escrita realmente acontece agora.
O seu trabalho é real. As suas ideias são reais. Um algoritmo defeituoso não deveria ser o juiz disso.
Perguntas frequentes
Q: Which AI detector is most accurate?
Nos nossos testes, Turnitin e Originality.ai empataram na maior precisão global, com 72% e 74%, respetivamente, em todas as categorias de amostra. No entanto, a precisão variou significativamente consoante o tipo de texto. Turnitin foi o melhor a detetar saída bruta de AI, mas apresentou mais falsos positivos em texto em inglês de falantes não nativos. Originality.ai foi mais equilibrado, mas menos eficaz em texto humanizado. Nenhum detetor atingiu mais de 80% de precisão em todas as categorias, o que constitui uma limitação significativa para ferramentas usadas para tomar decisões sobre integridade académica.
Q: Do AI detectors work on academic writing?
Funcionam melhor em alguns tipos de escrita académica do que noutros. A saída bruta de AI, sem edição, em estilo académico, costuma ser detetada, as taxas de deteção variaram entre 70% e 100% no nosso teste. Mas textos académicos formais escritos por humanos geram falsos positivos a taxas preocupantes, até 12% nos nossos testes. Áreas técnicas com vocabulário especializado e autores em inglês não nativo são desproporcionalmente afetadas. A resposta curta é: os detetores de AI funcionam em escrita académica, mas não de forma suficientemente fiável para servirem como prova autónoma.
Q: How often do AI detectors flag human writing?
No nosso teste de 20 amostras escritas por humanos, 10 em inglês nativo, 10 em inglês não nativo, 9 amostras, 45%, receberam uma pontuação de AI acima de 20% em pelo menos um detetor. Três textos escritos por humanos obtiveram mais de 50% em pelo menos uma ferramenta. A taxa de falsos positivos por detetor variou entre 4% e 12%. Se é um falante não nativo de inglês a escrever prosa académica formal, a probabilidade de um falso positivo é ainda maior. É por isso que recomendamos guardar rascunhos e provas do processo, independentemente de ter usado ferramentas de AI.
Q: Do AI detectors work on humanized or edited text?
Muito menos de forma fiável do que na saída bruta. No nosso benchmark de 2,000 documentos, o texto processado por um humanizer académico passou na deteção de AI do Turnitin em até 92.33% dos documentos na configuração mais forte. A deteção depende de padrões estatísticos, e uma revisão substantiva remove-os.
Q: Can an AI detection score be used as proof of misconduct?
Os próprios fornecedores dizem que não. Turnitin enquadra o seu indicador como um sinal para análise adicional, e falsos positivos em escrita humana genuína estão documentados em todos os principais detetores. Uma pontuação é um motivo para investigar mais de perto, e nada mais.
Proofread and polish your manuscript with tracked changes. Built for academic writing.

Moe é um engenheiro NLP com PhD em processamento de linguagem natural. Sua pesquisa cobre linguística computacional, análise de texto e aprendizado de máquina, e alimentou diretamente os modelos de edição e humanização por trás do ProofreaderPro. Ele escreve sobre a parte do processo que a maioria das pessoas nunca vê: como um modelo de linguagem lê uma frase, pontua-a e decide o que mudar.