Mennyire pontosak az AI-detektorok 2026-ban? Tesztelt pontosság és hamis pozitívok
Az AI-detektorok a legtöbb szerkesztetlen AI-szöveget felismerik, de továbbra is emberi írást is jelezhetnek. Valós adatok Turnitin, GPTZero és Originality.ai esetén.
Egy hálózatunkban lévő PhD-hallgató értekezésének bevezetését az egyetemének detektáló rendszere 67%-ban mesterséges intelligencia által generáltnak jelölte. Azt írta, hogy minden szót maga írt meg négy hónap alatt. Semmilyen AI-eszközt, sem nyelvtani ellenőrzőt, sőt még helyesírás-ellenőrzőt sem használt.
Két hetet töltött a szakaszok átírásával, hogy csökkentse az eredményt. Sikerült, de az átírt változat rosszabb lett, mint az eredeti.
Úgy döntöttünk, kiderítjük, mennyire megbízhatóak valójában ezek az eszközök. Ezért ötöt leteszteltünk.
A rövid válasz
Az AI-detektorok 2026-ban elég pontosak ahhoz, hogy a legtöbb szerkesztetlen, teljes egészében AI által generált szöveget kiszűrjék, ugyanakkor elég pontatlanok ahhoz, hogy egyik pontszámot se lehessen bizonyítékként kezelni. Három megállapítás ismétlődik minden általunk mért detektor esetében. A ChatGPT, Claude vagy Gemini nyers kimenetét megbízhatóan megjelölik. Az emberi akadémiai írást néha AI-ként jelölik meg, amit maguk a detektorokat fejlesztő vállalatok is elismernek. A szerkesztett vagy humanizált szöveg pedig jóval gyakrabban átmegy a vizsgálaton, mint ahogyan az egyetemek feltételezik: a legutóbbi, 2,000 akadémiai dokumentumon végzett benchmarkunkban a humanizált szöveg a dokumentumok akár 92.33%-ánál átment a Turnitin AI-detekcióján.
Tesztmódszertanunk: 50 minta 5 detektoron keresztül
50 szövegmintát állítottunk össze, mindegyik 500 és 800 szó közötti terjedelemben. A minták öt kategóriába tartoztak:
- 10 tisztán ember által írt tudományos szöveg - 2018–2022 között publikált folyóiratcikkek, még az LLM-ek széles körű elérhetősége előtt írva
- 10 tisztán AI által generált szöveg - GPT-4o által készítve tudományos promptokkal, szerkesztés nélkül
- 10 AI által generált szöveg enyhe kézi szerkesztéssel - AI-vázlatok emberi javításokkal a pontosság és a stílus érdekében
- 10 AI által generált szöveg, amelyet a text humanizer segítségével dolgoztunk fel - teljes humanizálási folyamat, majd kézi ellenőrzés
- 10 ember által írt szöveg, nem anyanyelvi angol beszélőktől - olyan kutatók publikált dolgozatai, akik a második vagy harmadik nyelvükön írnak
Minden mintát lefuttattunk a Turnitin AI-érzékelő modulján, a GPTZero-n, a Copyleaks-en, a ZeroGPT-n és az Originality.ai-on. Mindegyik eszköz egy AI-valószínűségi pontszámot adott vissza. Rögzítettük az összes pontszámot, és kiszámítottuk a pontossági mutatókat.
Az eredmények megleptek bennünket. Nem azért, mert az eszközök teljesen kudarcot vallottak, hanem mert a hibázási mintázatok rendkívül következetlenek voltak.
Turnitin AI észlelés: pontossági eredmények
A Turnitin helyesen azonosította a 10 tisztán AI által generált szövegből 9-et, és mindegyikre 80% fölötti értéket adott. Ez szilárd teljesítmény a nyilvánvaló AI-kimenetek esetében.
Ahol elmaradt: a téves pozitív találatoknál. A 10 ember által írt tudományos szöveg közül három a Turnitin AI-mutatóján 20% fölé került. Az egyik, egy kémiai folyóiratból származó formális irodalmi áttekintés, 38%-ot ért el.
Az emberivé tett szövegek esetében a Turnitin teljesítménye jelentősen visszaesett. A 10 emberivé tett minta közül csak 3 érte el a 20%-os küszöb fölötti értéket. A fennmaradó 7 2% és 17% között mozgott.
A nem anyanyelvi angol nyelvű írások bizonyultak a legrosszabb kategóriának. A 10 nem anyanyelvi minta közül 4-et 20% fölött jelölt meg. Egy 52%-ot kapott. Ezek valódi, publikált tanulmányok voltak, valódi emberi kutatóktól.
A Turnitin összesített pontossága a tesztünkben: 72%. Ez elfogadhatónak hangzik, amíg nem vesszük figyelembe, hogy egy 28%-os hibaarány nagyjából azt jelenti, hogy minden 4. döntésből 1 téves lehet.
GPTZero vs Copyleaks vs ZeroGPT: fej-fej mellett
A három legnépszerűbb önálló AI-detektort teljes mintakészletünkön teszteltük.
GPTZero volt a legagresszívebb detektor. A 10-ből 10 nyers AI szöveget elkapott, tökéletes recall. Ugyanakkor 4 ember által írt szöveget és 5 nem anyanyelvi angol szöveget is túlnyomórészt AI által generáltnak jelölt. A hamis pozitív aránya volt a legmagasabb a tesztünkben, 12%.
Copyleaks visszafogottabb megközelítést alkalmazott. Helyesen azonosított 10-ből 8 AI szöveget, de csupán 1 ember által írt mintát jelölt tévesen. Humanizált szövegen 10-ből 4-et talált el, ez a legjobb teljesítmény a humanizálás elleni teszten, de így is több mint a felét kihagyta.
ZeroGPT volt a legkevésbé megbízható. 10-ből 7 AI szöveget jelölt helyesen, de emellett 3 ember által írt szöveget is tévesen megjelölt. Ami még rosszabb, a pontszámai ingadoztak, ugyanazt a mintát kétszer futtattuk, és az esetek 30%-ában eltérő eredményt kaptunk. A konzisztencia számít egy detektáló eszköznél, és a ZeroGPT ezt nem biztosította.
Originality.ai jól teljesített nyers AI szövegen (9/10 detected), és alacsony volt a hamis pozitív aránya emberi szövegen (1/10 incorrectly flagged). Humanizált szövegen 10-ből 5-öt talált el, ez a mezőny közepe.
Itt a kellemetlen összegzés: egyetlen detektor sem érte el a 80% feletti összesített pontosságot az összes mintakategóriában.
2 000 dokumentumos benchmarkünk: milyen gyakran nem veszik észre a detektorok a szerkesztett szöveget
Az észlelési pontosságot rendszerint a nyers AI-kimenethez viszonyítva jelentik, ami túlbecsüli, hogyan teljesítenek a detektorok a már átdolgozott szövegen. A különbség mérésére az akadémiai dokumentumokat ProofreaderPro's academic humanizer segítségével humanizáljuk, majd a szokásos felületükön keresztül beküldjük őket az egyes detektorokhoz. Egy dokumentum akkor megy át, ha a visszaadott AI-valószínűség a detektor saját jelölési küszöbe alá esik.
| Detector | Pass rate, Balanced intensity | Pass rate, Aggressive intensity |
|---|---|---|
| Turnitin AI | 86.0% | 92.33% |
| Originality.ai | 84.5% | 89.12% |
| GPTZero | 82.8% | 87.91% |
A forrásszöveg szemantikai hűsége minden futás során 94% felett maradt. A korpusz 2 000 akadémiai dokumentumot fed le a STEM, a társadalomtudományok és a bölcsészettudományok területéről, és az értékeket minden benchmarkfuttatásnál frissítjük. A teljes módszertan az AI humanizer comparison oldalon található.
A pontossági állításokra gyakorolt következmény közvetlen: egy detektor, amely megbízhatóan felismeri a nyers modellkimenetet, a szerkesztett szöveg túlnyomó többségét akkor is elmulaszthatja. Az észlelési pontszámok a felszíni statisztikákat írják le, és a szerkesztés ezeket a statisztikákat megváltoztatja.
Mit mondanak az észlelési szolgáltatók a saját pontosságukról
A szolgáltatói dokumentáció óvatosabb, mint az egyetemi gyakorlat. Turnitin közzétett útmutatása szerint az AI írásjelzője téves pozitív találatokat produkálhat, különösen az alacsonyabb jelentési küszöb környékén, és a vállalat az indikátort inkább egy oktatóval folytatott beszélgetés kiindulópontjaként írja le, nem pedig a szabálytalanság bizonyítékaként. A GPTZero közzéteszi a saját pontossági adatait, és minden megjelölt dokumentum emberi ellenőrzését javasolja. OpenAI 2023-ban megszüntette a hivatalos AI szövegosztályozóját, miután arra a következtetésre jutott, hogy a pontossága túl alacsony ahhoz, hogy hasznos legyen. Amikor az ezeket a rendszereket építő vállalatok azt mondják a felhasználóknak, hogy a jelzéseket manuálisan ellenőrizzék, egy százalékot bizonyítékként kezelni túlmutat azon, amit az eszközök magukról állítanak.
Aggódsz a hamis pozitív eredmények miatt?
A szövegemberesítő eszközünk természetes változatosságot ad az írásodhoz, akár AI-asszisztált, akár nem. Csökkentsd a hamis pozitív kockázatát anélkül, hogy megváltoztatnád az ötleteidet.
Try It FreeA hamis pozitív probléma, amiről senki sem beszél
A hamis pozitív eredmények jelentik az AI-észlelés csendes válságát. Amikor egy detektor tévesen AI által generáltnak jelöl meg egy ember által írt szöveget, a bizonyítás terhét az írót terheli. A "Bizonyítsd be, hogy nem használtál AI-t" szinte teljesíthetetlen követelés.
A tesztelésünk olyan következetes mintázatokat tárt fel, amelyekben emberi szövegek tévesen kaptak jelölést:
Magasan strukturált, formális írás. Minél rendezettebb és kidolgozottabb a prózád, annál nagyobb az esélye, hogy egy detektor megjelöli. A világos témamondatok, a logikus bekezdésfelépítés, az egységes terminológia, mind olyan mintázatok, amelyek a jó emberi írásra és az AI-kimenetre egyaránt jellemzők.
Sablonszerű részek. A módszertani részek, az eljárásleírások és az irodalmi áttekintések a diszciplínára jellemző sablonokat követik. Minden kutató ugyanúgy írja, hogy "data were collected using semi-structured interviews". A detektorok nem tudják megkülönböztetni a konvenciót a generálástól.
Alacsony entrópiájú szókészlet. Egyes területek, mint a jog, az orvostudomány vagy a mérnöki tudományok, speciális szókincset használnak, kevés szinonimalehetőséggel. Amikor bizonyos terminusokat ismételten kell használnod, a szöveged egy perplexitáson alapuló detektor számára kiszámíthatóbbnak tűnik.
Nem anyanyelvi angol. Ezt azért emeljük ki újra és újra, mert ez a legaggasztóbb eredmény. A második nyelvükön író kutatók alacsonyabb lexikai változatosságú és sablonosabb szerkezetű szöveget hoznak létre, pontosan azokat a mintázatokat, amelyeket a detektorok az AI-hoz társítanak. Ez olyan diszkriminatív kimenetet hoz létre, amellyel a legtöbb intézmény még nem nézett szembe.
Mit jelent ez az AI eszközöket használó kutatók számára
Ha AI-t használsz írási asszisztensként, vázlatkészítéshez, átszerkesztéshez, csiszoláshoz, az észlelési környezet valódi problémát teremt. Még az is megjelölésre kerülhet, amit teljes egészében kézzel írtál. Az AI-segítséggel készült szöveg szinte bizonyosan megjelölésre kerül, hacsak nem teszel lépéseket annak humanizálására.
Az alábbi ajánlásaink erre a tesztelésre épülnek:
Ne bízz egyetlen detektor ítéletében. Olyan mintákat is láttunk, amelyek az egyik eszközön 5%-ot, egy másikon 68%-ot értek el. Ha az intézményed egy detektort használ, akkor megfelelőségi szempontból az a fontos, de egyetlen pontszám önmagában nem bizonyítja az AI-használatot.
Humanizálj stratégiailag. A nyers AI-kimenet észlelhető. A jól humanizált szöveg többnyire nem az. Ha AI-segítséget használtál, futtasd át a vázlatodat egy quality humanization tool eszközön, és add hozzá a saját hangodat. A tesztelésünk azt mutatta, hogy ez a kombináció mind az öt eszköz esetében 15% alá csökkentette az észlelési pontszámokat.
Őrizd meg a vázlataidat. Mentsd el a munkád köztes verzióit. A böngészési előzmények, a ChatGPT beszélgetési naplók, a jegyzetekkel ellátott PDF-ek, a kézzel írt feljegyzések, mindez bizonyítékot szolgáltat az írási folyamataidról, ha valaha megkérdőjeleznék azt.
Szorgalmazz jobb intézményi szabályzatot. Az AI-észlelő eszközök nem elég megbízhatók ahhoz, hogy önmagukban az akadémiai tisztességtelenség bizonyítékai legyenek. Ha az egyetemed egy Turnitin AI pontszámot bizonyítékként kezel, állj ellen, adatokkal. Oszd meg az ehhez hasonló tanulmányokat.
A megjelölt szöveg kezelésének gyakorlati lépéseihez lásd útmutatónkat arról, how researchers are bypassing AI detection without cheating.
Az AI-észlelési fegyverkezési verseny nem lassul. A detektorok fejlődni fognak. De az AI-segítséggel végzett írási eszközök is. A hosszú távú megoldás nem a jobb észlelés, hanem a jobb szabályozás, amely figyelembe veszi, hogyan is történik valójában az írás ma.
A munkád valós. Az ötleteid valósak. Egy hibás algoritmusnak nem szabadna erről ítélkeznie.
Gyakran feltett kérdések
K: Melyik AI detektor a legpontosabb?
A tesztjeinkben a Turnitin és az Originality.ai holtversenyben érte el a legmagasabb összesített pontosságot, rendre 72% és 74%-kal az összes mintakategóriában. A pontosság azonban jelentősen eltért a szövegtípustól függően. A Turnitin volt a legjobb a nyers AI kimenet felismerésében, de több fals pozitív eredményt adott nem anyanyelvi angol szövegeknél. Az Originality.ai kiegyensúlyozottabb volt, de kevésbé hatékonynak bizonyult a humanizált szövegeknél. Egyetlen detektor sem ért el 80% feletti pontosságot minden kategóriában, ami jelentős korlát azoknál az eszközöknél, amelyeket akadémiai integritással kapcsolatos döntések meghozatalára használnak.
K: Működnek az AI detektorok az akadémiai írásban?
Egyes akadémiai írástípusoknál jobban működnek, mint másoknál. A nyers, szerkesztetlen AI kimenetet akadémiai stílusban általában felismerik - a felismerési arány a tesztünkben 70% és 100% között mozgott. A formális, ember által írt akadémiai szöveg azonban aggasztó arányban vált ki fals pozitív eredményt - a tesztjeinkben akár 12%-ot is elérve. A szakterminológiát használó műszaki területek és a nem anyanyelvi angolul írók aránytalanul nagy mértékben érintettek. A rövid válasz ez: az AI detektorok működnek az akadémiai íráson, de nem elég megbízhatóan ahhoz, hogy önálló bizonyítékként szolgáljanak.
K: Milyen gyakran jelölik meg az AI detektorok az emberi írást?
A 20 ember által írt mintán végzett tesztünkben (10 anyanyelvi angol, 10 nem anyanyelvi) 9 minta, azaz 45%, legalább egy detektoron 20% feletti AI pontszámot kapott. Három ember által írt szöveg legalább egy eszközön 50% fölötti eredményt ért el. A detektoronkénti fals pozitív arány 4% és 12% között mozgott. Ha Ön nem anyanyelvi angolul ír formális akadémiai prózát, a fals pozitív eredmény esélye még magasabb. Ezért javasoljuk, hogy őrizze meg a vázlatokat és a folyamatot alátámasztó bizonyítékokat, függetlenül attól, használt-e AI eszközöket.
K: Működnek az AI detektorok humanizált vagy szerkesztett szövegen?
Jelentősen kevésbé megbízhatóan, mint a nyers kimeneten. A 2,000 dokumentumos benchmarkunkban az akadémiai humanizerrel feldolgozott szöveg a legerősebb beállításon a dokumentumok akár 92.33%-ánál átjutott a Turnitin AI felismerésén. A felismerés statisztikai mintázatokon alapul, és az érdemi átdolgozás ezeket eltávolítja.
K: Használható-e egy AI felismerési pontszám a visszaélés bizonyítékaként?
Maguk a szolgáltatók is azt mondják, hogy nem. A Turnitin ezt az indikátort további vizsgálatot kiváltó jelzésként értelmezi, és a valódi emberi íráson megjelenő fals pozitív eredményeket minden nagyobb detektor esetében dokumentálták. A pontszám egy ok arra, hogy alaposabban utánanézzenek, és nem több.
Proofread and polish your manuscript with tracked changes. Built for academic writing.

Moe egy NLP mérnök PhD-vel a természetes nyelvi feldolgozásban. Kutatásai kiterjednek a számítógépes nyelvészetre, a szövegelemzésre és a gépi tanulásra, és közvetlenül beépültek a ProofreaderPro mögötti szerkesztési és humanizálási modellekbe. A folyamat azon részéről ír, amelyet a legtöbb ember soha nem lát: hogyan olvas fel egy nyelvi modell egy mondatot, pontozza azt, és hogyan dönti el, min változtasson.