¿Qué tan precisos son los detectores de IA en 2026? Precisión y falsos positivos probados
Los detectores de IA detectan gran parte del texto sin editar y también pueden marcar texto humano. Datos reales de Turnitin, GPTZero y Originality.ai.
A una estudiante de doctorado de nuestra red le marcaron la introducción de su tesis como generada en un 67% por IA en el sistema de detección de su universidad. Escribió cada palabra ella misma durante cuatro meses. Sin herramientas de IA, sin correctores gramaticales, ni siquiera corrector ortográfico.
Pasó dos semanas reescribiendo secciones para bajar la puntuación. Funcionó, pero la versión reescrita era peor que la original.
Decidimos averiguar exactamente cuán fiables son realmente estas herramientas. Así que probamos cinco de ellas.
La respuesta rápida
Los detectores de IA en 2026 son lo bastante precisos para detectar la mayor parte del texto totalmente generado por IA y sin editar, y lo bastante imprecisos como para que ninguna puntuación deba considerarse prueba. Tres hallazgos se repiten en todos los detectores que hemos medido. La salida sin procesar de ChatGPT, Claude o Gemini se marca de forma fiable. La escritura académica humana a veces se marca como IA, algo que los propios proveedores de detectores reconocen. Y el texto editado o humanizado pasa con mucha más frecuencia de lo que las universidades suponen: en nuestro último benchmark sobre 2,000 documentos académicos, el texto humanizado superó la detección de IA de Turnitin en hasta el 92.33% de los documentos.
Nuestra metodología de prueba: 50 muestras en 5 detectores
Reunimos 50 muestras de texto, cada una de entre 500 y 800 palabras. Las muestras se dividieron en cinco categorías:
- 10 textos académicos puramente escritos por humanos - artículos de revistas publicados entre 2018 y 2022, escritos antes de la disponibilidad generalizada de LLM
- 10 textos puramente generados por IA - producidos por GPT-4o con indicaciones académicas, sin edición
- 10 textos generados por IA con edición manual ligera - borradores de IA con correcciones humanas para precisión y tono
- 10 textos generados por IA procesados a través de nuestro text humanizer - pasada completa de humanización más revisión manual
- 10 textos escritos por humanos no nativos de inglés - artículos publicados por investigadores que escriben en su segunda o tercera lengua
Ejecutamos cada muestra a través del módulo de detección de IA de Turnitin, GPTZero, Copyleaks, ZeroGPT y Originality.ai. Cada herramienta devolvió una puntuación de probabilidad de IA. Registramos todas las puntuaciones y calculamos métricas de precisión.
Los resultados nos sorprendieron. No porque las herramientas fallaran por completo, sino porque los patrones de fallo fueron extraordinariamente incoherentes.
Detección de IA de Turnitin: resultados de precisión
Turnitin identificó correctamente 9 de cada 10 textos generados puramente por IA, calificándolos por encima del 80%. Eso supone un rendimiento sólido frente a contenido de IA evidente.
Donde tuvo dificultades fue en los falsos positivos. Tres de nuestros 10 textos académicos escritos por humanos obtuvieron más del 20% en el indicador de IA de Turnitin. Uno, una revisión formal de la literatura de una revista de química, obtuvo un 38%.
En el texto humanizado, el rendimiento de Turnitin cayó de forma significativa. Solo 3 de cada 10 muestras humanizadas superaron el umbral del 20%. Las 7 restantes obtuvieron entre el 2% y el 17%.
La escritura en inglés de hablantes no nativos fue la categoría más problemática. Cuatro de cada 10 muestras de hablantes no nativos fueron marcadas por encima del 20%. Una obtuvo un 52%. Se trataba de artículos reales publicados por investigadores humanos reales.
La precisión global de Turnitin en nuestra prueba fue del 72%. Eso parece aceptable hasta que se advierte que una tasa de error del 28% significa que aproximadamente 1 de cada 4 juicios podría ser incorrecto.
GPTZero vs Copyleaks vs ZeroGPT: enfrentamiento directo
Probamos los tres detectores de IA independientes más populares frente a nuestro conjunto completo de muestras.
GPTZero fue el detector más agresivo. Detectó 10 de 10 textos de IA sin procesar, un recuerdo perfecto. Pero también marcó 4 textos escritos por humanos y 5 textos en inglés de hablantes no nativos como predominantemente generados por IA. Su tasa de falsos positivos fue la más alta de nuestra prueba, con un 12%.
Copyleaks adoptó un enfoque más conservador. Identificó correctamente 8 de 10 textos de IA, pero solo marcó incorrectamente 1 muestra escrita por humanos. En el texto humanizado, detectó 4 de 10, lo que lo convierte en el mejor rendimiento frente a la humanización, aunque seguía pasando por alto más de la mitad.
ZeroGPT fue el menos fiable. Marcó correctamente 7 de 10 textos de IA, pero también señaló por error 3 textos escritos por humanos. Peor aún, sus puntuaciones fluctuaban, ejecutamos la misma muestra dos veces y obtuvimos resultados distintos el 30% de las veces. La coherencia importa en una herramienta de detección, y ZeroGPT no la ofreció.
Originality.ai obtuvo buenos resultados con texto de IA sin procesar (9/10 detectados) y tuvo una baja tasa de falsos positivos en texto humano (1/10 marcado incorrectamente). En el texto humanizado, detectó 5 de 10, en la mitad de la tabla.
Aquí va el resumen incómodo: ningún detector logró más del 80% de precisión global en todas las categorías de muestras.
Nuestro benchmark de 2,000 documentos: con qué frecuencia la detección pasa por alto texto editado
La precisión de la detección suele informarse frente a la salida bruta de la IA, lo que exagera el rendimiento de los detectores en texto que ha sido revisado. Para medir la brecha, humanizamos documentos académicos con ProofreaderPro's academic humanizer y los enviamos a cada detector a través de su interfaz estándar. Un documento aprueba cuando la probabilidad de IA devuelta se sitúa por debajo del umbral de marcado del propio detector.
| Detector | Tasa de aprobación, intensidad equilibrada | Tasa de aprobación, intensidad agresiva |
|---|---|---|
| Turnitin AI | 86.0% | 92.33% |
| Originality.ai | 84.5% | 89.12% |
| GPTZero | 82.8% | 87.91% |
La fidelidad semántica al texto fuente se mantuvo por encima de 94% en cada ejecución. El corpus abarca 2,000 documentos académicos de STEM, las ciencias sociales y las humanidades, y actualizamos las cifras con cada ejecución del benchmark. La metodología completa está en nuestra AI humanizer comparison.
La implicación para las afirmaciones de precisión es directa: un detector que detecta de forma fiable la salida bruta del modelo puede seguir sin detectar la gran mayoría del texto editado. Las puntuaciones de detección describen estadísticas de superficie, y la revisión cambia esas estadísticas.
Lo que dicen los proveedores de detección sobre su propia precisión
La documentación de los proveedores es más cautelosa que la práctica universitaria. La guía publicada por Turnitin afirma que su indicador de escritura con IA puede producir falsos positivos, especialmente en torno a su umbral de informe más bajo, y la empresa describe el indicador como el punto de partida para una conversación con el instructor, no como prueba de mala conducta. GPTZero publica sus propias cifras de precisión y recomienda una revisión humana de cada documento señalado. OpenAI retiró su clasificador oficial de texto con IA en 2023 tras concluir que su precisión era demasiado baja para resultar útil. Cuando las empresas que construyen estos sistemas dicen a los usuarios que verifiquen manualmente las alertas, tratar un porcentaje como prueba va más allá de lo que las herramientas afirman de sí mismas.
¿Te preocupan los falsos positivos?
Nuestro humanizador de texto añade variación natural a tu escritura, con o sin asistencia de IA. Reduce el riesgo de falsos positivos sin cambiar tus ideas.
Pruébalo gratisEl problema de los falsos positivos del que nadie habla
Los falsos positivos son la crisis silenciosa en la detección de IA. Cuando un detector señala incorrectamente como generado por IA un texto escrito por una persona, traslada la carga de la prueba al autor. "Demuestra que no usaste IA" es una exigencia casi imposible.
Nuestras pruebas encontraron patrones consistentes en los que textos humanos fueron marcados falsamente:
Redacción formal altamente estructurada. Cuanto más organizado y pulido sea tu texto, más probable es que un detector lo señale. Las frases temáticas claras, la progresión lógica de los párrafos y la terminología coherente, todos estos son patrones compartidos por la buena escritura humana y la producción de IA.
Secciones formulísticas. Las secciones de métodos, las descripciones de procedimientos y las revisiones de la literatura siguen plantillas específicas de cada disciplina. Todo investigador escribe "data were collected using semi-structured interviews" de la misma manera. Los detectores no pueden distinguir la convención de la generación.
Vocabulario de baja entropía. Algunos campos, como el derecho, la medicina y la ingeniería, usan vocabulario especializado con opciones limitadas de sinónimos. Cuando debes usar términos específicos de forma repetida, tu texto parece más "predecible" para un detector basado en perplejidad.
Inglés no nativo. Volvemos a esto porque es el hallazgo más preocupante. Los investigadores que escriben en su segunda lengua producen textos con menor diversidad léxica y estructuras más formulísticas, exactamente los patrones que los detectores asocian con la IA. Esto genera un resultado discriminatorio que la mayoría de las instituciones no ha abordado.
Lo que esto significa para investigadores que usan herramientas de AI
Si estás usando AI como asistente de escritura, redactando, reestructurando, puliendo, el panorama de la detección crea un problema real. Incluso un texto que escribiste completamente a mano podría ser señalado. El texto asistido por AI casi con toda seguridad será señalado, a menos que tomes medidas para humanizarlo.
Nuestras recomendaciones basadas en esta prueba:
No confíes en el veredicto de un solo detector. Vimos muestras que obtuvieron un 5% en una herramienta y un 68% en otra. Si tu institución usa un detector, ese es el que importa para el cumplimiento, pero una sola puntuación no es evidencia de uso de AI.
Humaniza estratégicamente. El resultado bruto de AI es detectable. El texto bien humanizado, en su mayor parte, no lo es. Si usaste asistencia de AI, pasa tu borrador por una quality humanization tool y añade tu voz personal. Nuestra prueba mostró que esta combinación redujo las puntuaciones de detección a menos del 15% en las cinco herramientas.
Conserva tus borradores. Guarda las versiones intermedias de tu trabajo. El historial del navegador, los registros de conversación de ChatGPT, los PDF anotados, las notas manuscritas, todo esto proporciona evidencia de tu proceso de escritura si alguna vez se cuestiona.
Aboga por mejores políticas institucionales. Las herramientas de detección de AI no son lo suficientemente fiables como para servir como única evidencia de deshonestidad académica. Si tu universidad trata una puntuación de AI de Turnitin como prueba, objeta, con datos. Comparte estudios como este.
Para pasos prácticos sobre cómo manejar texto señalado, consulta nuestra guía sobre how researchers are bypassing AI detection without cheating.
La carrera armamentística de la detección de AI no se está desacelerando. Los detectores mejorarán. Pero también lo harán las herramientas de escritura asistida por AI. La solución a largo plazo no es una mejor detección, es una mejor política que reconozca cómo ocurre realmente la escritura ahora.
Tu trabajo es real. Tus ideas son reales. Un algoritmo defectuoso no debería ser quien lo juzgue.
Preguntas frecuentes
P: ¿Cuál es el detector de IA más preciso?
En nuestras pruebas, Turnitin y Originality.ai empataron en la mayor precisión global con un 72% y un 74% respectivamente en todas las categorías de muestras. Sin embargo, la precisión varió significativamente según el tipo de texto. Turnitin fue el mejor detectando salida bruta de IA, pero tuvo más falsos positivos en texto en inglés de hablantes no nativos. Originality.ai fue más equilibrado, pero menos eficaz con texto humanizado. Ningún detector alcanzó más del 80% de precisión en todas las categorías, lo cual es una limitación importante para herramientas que se utilizan para tomar decisiones sobre integridad académica.
P: ¿Funcionan los detectores de IA en la escritura académica?
Funcionan mejor en algunos tipos de escritura académica que en otros. La salida bruta de IA sin editar en estilo académico suele ser detectada, las tasas de detección oscilaron entre el 70% y el 100% en nuestra prueba. Pero el texto académico formal escrito por personas desencadena falsos positivos a tasas preocupantes, hasta un 12% en nuestras pruebas. Los campos técnicos con vocabulario especializado y los autores no nativos de inglés se ven desproporcionadamente afectados. La respuesta breve es: los detectores de IA funcionan en la escritura académica, pero no con la suficiente fiabilidad como para servir como prueba independiente.
P: ¿Con qué frecuencia los detectores de IA marcan escritura humana?
En nuestra prueba de 20 muestras escritas por personas, 10 en inglés nativo, 10 en inglés no nativo, 9 muestras, el 45%, recibieron una puntuación de IA superior al 20% en al menos un detector. Tres textos escritos por personas obtuvieron una puntuación superior al 50% en al menos una herramienta. La tasa de falsos positivos por detector osciló entre el 4% y el 12%. Si eres una persona no nativa de inglés que escribe prosa académica formal, las probabilidades de un falso positivo son aún mayores. Por eso recomendamos conservar borradores y pruebas del proceso independientemente de si utilizaste herramientas de IA.
P: ¿Funcionan los detectores de IA en texto humanizado o editado?
Mucho menos fiable que en la salida bruta. En nuestro benchmark de 2,000 documentos, el texto procesado por un humanizador académico superó la detección de IA de Turnitin en hasta el 92.33% de los documentos con la configuración más fuerte. La detección depende de patrones estadísticos, y una revisión sustantiva los elimina.
P: ¿Puede usarse una puntuación de detección de IA como prueba de mala conducta?
Los propios proveedores dicen que no. Turnitin presenta su indicador como una señal para una revisión adicional, y los falsos positivos en escritura humana auténtica están documentados en todos los principales detectores. Una puntuación es un motivo para mirar más de cerca, y nada más.
Proofread and polish your manuscript with tracked changes. Built for academic writing.

Moe es un ingeniero NLP con un PhD en procesamiento del lenguaje natural. Su investigación cubre lingüística computacional, análisis de texto y aprendizaje automático, y alimentó directamente los modelos de edición y humanización detrás de ProofreaderPro. Escribe sobre la parte del proceso que la mayoría de la gente nunca ve: cómo un modelo de lenguaje lee una oración, la califica y decide qué cambiar.