Pangram KI-Detektor im Test (2026): Genauigkeit und Fehlalarme
Ist der KI-Detektor von Pangram genau? Er behauptet 99%+ Genauigkeit und eine Fehlalarmrate von 1 zu 10.000. Sehen Sie, was unabhängige Studien herausfanden, und wie er sich im Vergleich schlägt.
Pangram ist ein KI-Detektor von Pangram Labs, und das Unternehmen sagt, dass er mehr als 99% genau ist. Außerdem behauptet es, menschliche Texte fälschlicherweise in etwa 1 von 10.000 Fällen zu markieren. Pangram verweist auf externe Studien der University of Chicago und der University of Maryland, die laut Angabe ähnliche Ergebnisse gefunden haben.
Im Folgenden gehen wir durch die eigenen Angaben von Pangram zu Genauigkeit und Fehlalarmrate sowie durch das, was unabhängige Studien fanden. Danach behandeln wir, wie Pangram KI-Text erkennt, wie es sich mit GPTZero, Copyleaks und Turnitin vergleicht, und schließlich Preisgestaltung und Sprachunterstützung.
Was Pangram macht
Pangram ist ein KI-Erkennungstool, das für Schulen, Verlage, Anwaltskanzleien und andere Organisationen entwickelt wurde, die unterscheiden müssen, ob ein Text von einem Menschen oder von KI verfasst bzw. unterstützt wurde. Sie fügen Text ein oder laden eine Datei hoch. Pangram gibt eine Vorhersage für Mensch, KI-Generiert oder KI-Assisted, plus einen Score aus, wie viel des Dokuments in jede Kategorie fällt.

Pangram Labs wurde 2023 in Brooklyn, New York, gegründet. Die Gründer arbeiteten vor dem Start des Unternehmens an KI-Forschung bei Tesla und Google. Die Produktlinie umfasst inzwischen einen Plagiatschecker, der mit dem KI-Detektor gebündelt ist, einen KI-Bilddetektor sowie eine Browser-Erweiterung. Außerdem integriert es sich in Gmail, Google Docs und Lernmanagementsysteme wie Canvas, Moodle, Google Classroom und Brightspace. Zusätzlich ist auch eine API verfügbar, damit Entwickler KI-Erkennung in ihre eigenen Anwendungen einbauen können.
Das neueste Modell von Pangram, Pangram 4, benötigt mindestens 50 Wörter als Eingabe und funktioniert am besten mit vollständigen Sätzen. Kurze Antworten und Stichpunkte bieten ihm weniger Material. Jedes Ergebnis enthält für jeden Abschnitt ein Konfidenzniveau, nämlich Hoch, Mittel oder Niedrig, sowie hervorgehobene Bereiche, die markieren, welche Sätze das Modell als KI-Generiert, KI-Assisted oder Mensch kennzeichnet.
Eine Kategorie KI-Assisted bedeutet, dass Pangram glaubt, KI habe einen Teil des Schreibens bearbeitet oder poliert, nachdem eine Person begonnen hatte. Wenn Sie ein Grammatikwerkzeug oder einen KI-Umformulierer für Teile Ihres Textes genutzt haben, kann diese Kategorie auch dann erscheinen, wenn die Ideen und die Struktur weiterhin von Ihnen stammen. Prüfen Sie, was Ihre Schule oder Ihr Arbeitgeber für KI-Bearbeitungstools erlaubt, bevor Sie die Kategorie als Problem einstufen.
Was Pangram über seine Genauigkeit behauptet
In den FAQ von Pangram heißt es, dass der Detektor zu über 99% genau ist, mit einer Fehlalarmrate von etwa 1 zu 10.000. Es sagt, diese Zahl werde über öffentliche Datensätze berechnet, die Dutzende Millionen Dokumente enthalten. Außerdem benchmarkt Pangram sein Modell gegen 26 KI-Systeme und berichtet 99,7% Genauigkeit für diese KI-generierten Stichproben als Gesamtheit, wobei nach jeder großen Modellveröffentlichung erneut getestet wird.
Pangram veröffentlicht außerdem Genauigkeitswerte für einzelne Modelle:
| KI-Modell | Von Pangram angegebene Genauigkeit | Getestet |
|---|---|---|
| Claude Opus 5 | 99.8% | Juli 2026 |
| GPT-5.6 | 99.6% | Juli 2026 |
| Gemini 3 | 99.5% | Juli 2026 |
| Grok 4.3 | 99.4% | Juli 2026 |
Dies sind die eigenen Kennzahlen von Pangram, gemessen in den eigenen Testsets. Die Modellkarte von Pangram 4 zerlegt die Zahlen weiter. Bei 519.993 englischen KI-generierten Stichproben von 26 Modellen verfehlte Pangram 4 0,34% von ihnen, nahe an der 99,7% genannten Kernzahl. Die Modellkarte listet außerdem eine 1,24%ige Fehlalarmrate auf einem mehrsprachigen Datensatz mit 18 Sprachen, daher erkennt Pangram KI-Text außerhalb von Englisch etwas weniger zuverlässig.
Fehlalarmrate von Pangram, nach Domäne und Sprache
Die FAQ von Pangram nennt eine einzige allgemeine Fehlalarmrate von 1 zu 10.000. Die Modellkarte von Pangram 4 berichtet eine konkretere Zahl. Aus 1.000.000 englischen Dokumenten aus dem FineWeb-Datensatz hatte Pangram 4 41 Fehlalarme, also 0,0041%, nahe an 1 zu 24.000. In einem mehrsprachigen Datensatz mit 996.273 Dokumenten über 104 Sprachen hatte es 14 Fehlalarme, also 0,0014%.
Die Rate verändert sich je nach Domäne. In der Modellkarte von Pangram sind diese Fehlalarmraten aufgeführt:
| Domäne | Fehlalarmrate |
|---|---|
| Akademisches Schreiben (Englisch) | 0.019% |
| Nachrichten (mehrsprachig) | 0.003% |
| Kreatives Schreiben, langform | 0.000% |
| Biomedizinische Forschungsarbeiten | 0.002% |
| How-to-Artikel (mehrsprachig) | 0.016% |
| Filmskripte | 0.010% |
| Lyrik | 0.078% |
| Rezepte | 0.049% |
Für akademisches Schreiben auf Englisch nennt die Modellkarte von Pangram eine Fehlalarmrate von 0,019%, also etwa 1 zu 5.000 Dokumenten. Das ist höher als die Gesamtzahl und die wichtigste Größe für Studierende und Forschende. Seriöse akademische Prosa folgt festen Mustern, und formelhafte Texte sind der Bereich, in dem die eigenen Daten von Pangram mehr Fehlalarme zeigen.
In seinem Blogbeitrag zu Fehlalarmen sagt Pangram, dass die Rate bei kurzen Texten steigt, die nicht in vollständigen Sätzen verfasst sind, oder bei stark formelhaftem Text, etwa bei Rezepten und Lyrik. Außerdem sagt Pangram, dass die Rate bei langen, originellen Prosatexten wie Essays, Rezensionen und Berichten niedrig bleibt, weil diese Textart dem Modell mehr Material zum Arbeiten gibt.
Auch die Sprache verändert die Rate. Die Modellkarte von Pangram nennt offizielle Unterstützung für 24 Sprachen: Englisch, Spanisch, Französisch, Portugiesisch, Arabisch, Chinesisch, Japanisch, Koreanisch, Russisch, Türkisch, Ungarisch, Deutsch, Niederländisch, Schwedisch, Rumänisch, Ukrainisch, Polnisch, Italienisch, Tschechisch, Griechisch, Hindi, Persisch, Urdu und Vietnamesisch. Die gemessene Fehlalarmrate reicht von 0,0000% in Sprachen wie Arabisch, Chinesisch und Japanisch bis zu 0,0078% in Portugiesisch und 0,0361% in Ukrainisch. All das liegt jedoch weiterhin deutlich unter 1 zu 1.000. Pangram sagt außerdem, dass es sich auch auf Sprachen außerhalb dieser Liste verallgemeinern kann, und lädt zu Anfragen ein, um eine neue Sprache bewerten zu lassen.
Pangram veröffentlicht zudem Vergleiche mit anderen Detektoren. Bei Produktbewertungen aus der Forschung der University of Chicago berichtet es Fehlalarmraten von 0,5% für sich selbst, 1,7% für Originality.ai und 2,4% für GPTZero. Das sind die Zahlen von Pangram, aus dessen eigenem Blog.
Außerhalb von Studien, die Pangram anführt
Eine 2025 University of Chicago Booth Studie fand, dass führende KI-Detektoren mehr als 90% von ungefiltertem KI-Text markierten. Die meisten markierten weniger als die Hälfte, sobald der Text durch einen KI-Humanizer lief. Pangram war einer von vier getesteten Detektoren, zusammen mit GPTZero, Originality.ai und dem Open-Source-Detektor RoBERTa. Pangram sagt, dass es das einzige war, das seine Fehlalarmrate unter 0,5% hielt, während es weiterhin KI-Text erkannte.
Pangram nennt außerdem eine Studie der Vrije Universiteit Brussel aus Juni 2026. Dort wurden Pangram, GPTZero, Turnitin und Copyleaks an 160 akademischen Arbeiten von nicht-muttersprachlichen Englischsprechern getestet, aufgeteilt in menschlich verfasst, KI-generiert, gemischt und humanisiert. Pangram sagt, dass keines der vier Tools die in dieser Studie menschlich verfassten Arbeiten markierte.
Eine Studie aus 2025: Pangram im Vergleich zu erfahrenen menschlichen Leserinnen und Lesern
Eine 2025er Studie von Jenna Russell, Marzena Karpinska und Mohit Iyyer wurde auf der ACL 2025 veröffentlicht. Sie untersuchte, ob Personen, die häufig KI-Schreibwerkzeuge nutzen, KI-generierten Text genauso gut erkennen können wie automatische Detektoren. Fünf Gutachter, die angaben, LLMs für ihr eigenes Schreiben häufig zu verwenden, lasen 300 englischsprachige Sachartikel ohne Fiktion. Das Set mischte von Menschen geschriebene Texte mit Texten von GPT-4o, Claude und o1-Pro, darunter auch einige Artikel, die durch einen KI-Humanizer verarbeitet wurden. Die Mehrheitsentscheidung dieser fünf Gutachter klassifizierte nur 1 von 300 Artikeln falsch.
Die Studie verglich dieses Panel anschließend mit fünf automatischen Detektoren: Pangram, GPTZero, Binoculars, Fast-DetectGPT und RADAR. Die Forschenden führten zwei Pangram-Modelle aus, seinen Baseldetektor sowie ein separates Modell namens Pangram Humanizers, das darauf trainiert ist, Text zu erkennen, der durch einen KI-Humanizer läuft. Pangram Humanizers war der einzige Detektor, der das Expertenpanel traf, mit einer durchschnittlichen True-Positive-Rate von 99,3% und einer False-Positive-Rate von 2,7% über das gesamte Testset. Das Basismodell von Pangram erreichte eine durchschnittliche True-Positive-Rate von 98,0% bei einer False-Positive-Rate von 2% im selben Test.
Eine False-Positive-Rate von 2,7% ist höher als die Angabe von Pangram von 1 zu 10.000 aus eigenen Auswertungen. Dieser Test nutzte ein deutlich kleineres Set von Artikeln, 300 statt der Millionen, die Pangram an anderer Stelle nennt. Die Studie wertete Pangram außerdem nur mit seinen Labels Human und AI-Generated aus, ohne ihm eine Gutschrift für sein neutrales Label „Possibly AI“ zu geben. Pangram und GPTZero stellten den Forschenden API-Credits bereit, um den Test durchzuführen.
Den KI-verdächtigen Teil in Ihrer eigenen Stimme umschreiben
Unser KI-Humanizer für akademisches Schreiben schreibt KI-gestützte Abschnitte um, während Zitate, Fachbegriffe und Zahlen exakt so erhalten bleiben, wie Sie sie geschrieben haben.
ProofreaderPro.ai kostenlos testenWie Pangram KI-Schreiben erkennt
Pangram sagt, es nutze weder Perplexity noch Burstiness, also genau die beiden Signale, auf die die meisten älteren KI-Detektoren setzen. Perplexity misst, wie vorhersagbar jedes Wort für ein Sprachmodell ist, und Burstiness misst, wie stark sich diese Vorhersagbarkeit über ein Dokument hinweg verändert. Wir erklären beides in unserem eigenen Beitrag über Perplexity in der KI-Erkennung.
Pangram argumentiert, dass Perplexity-basierte Detektoren bei jedem Text fehlgreifen, den ein Sprachmodell während des Trainings auswendig gelernt hat, einschließlich der Declaration of Independence und großer Teile von Wikipedia. Modelle lernen, auswendig gelernten Text mit sehr niedriger Perplexity vorherzusagen, unabhängig davon, wer ihn geschrieben hat. Pangram sagt zudem, dass Perplexity-basierte Verfahren bei nicht muttersprachlichem Englisch eine höhere False-Positive-Rate haben, da auch einfachere Satzstrukturen stärker vorhersagbar sind. Wir greifen dieses False-Positive-Muster für nicht muttersprachliche Englischschreibende in einem Beitrag auf, der andere Detektoren betrachtet.
Stattdessen trainiert Pangram ein Deep-Learning-Modell direkt auf großen Mengen menschlicher und KI-texte. Es nutzt dabei eine Methode, die es Hard Negative Mining nennt, um menschliche Texte zu finden, die zufällig dem KI-Ausgabestil ähneln. Pangram verarbeitet vollständige Dokumente auf Ebene der Tokens. Es labelt jeden Abschnitt mit Human, AI-Assisted oder AI-Generated, plus einer kontinuierlichen Bewertung dafür, wie stark der Abschnitt wie KI-Text wirkt. Pangram sagt, dass sich das Modell verbessert, wenn es mit mehr Daten trainiert wird.
Pangram vs GPTZero, Copyleaks und Turnitin
Pangram, GPTZero und Copyleaks sind für alle zugänglich, die sich anmelden. Turnitin funktioniert nur über ein Schul- oder Verlagskonto, und eine einzelne Person, die einen Test ablegt, sieht typischerweise nur dann einen Turnitin-Score, wenn ein Dozent ihn weitergibt.
| Detektor | Zugriff | Eigenes Falsch-Positiv-Statement des Anbieters | Kostenloses Kontingent |
|---|---|---|---|
| Pangram | Offene Anmeldung | Etwa 1 zu 10.000 insgesamt | 2.000 Wörter pro Tag |
| GPTZero | Offene Anmeldung | Etwa 1% | 10.000 Zeichen pro Scan |
| Copyleaks | Offene Anmeldung | Etwa 0,2% | Begrenzte kostenlose Scans |
| Turnitin | Nur Schulen und Verlage | 0,51% bei akademischem Schreiben | Nicht für Einzelpersonen verfügbar |
Wir haben jeden dieser Detektoren jeweils separat behandelt: siehe Ist GPTZero genau, Erkennt Copyleaks KI und Kann Turnitin humanisierten KI-Text erkennen. Die Werte zu Fehlalarmen in der Tabelle sind jeweils eigene Angaben des jeweiligen Unternehmens, wie Pangram und die anderen Anbieter diese nennen.
Pangram ist ein eigenständiger Detektor. Grammarly und Scribbr bieten KI-Erkennung als Teil ihrer Schreibwerkzeuge an, und wir haben jeweils separat Grammarlys KI-Detektor sowie Scribbrs KI-Detektor betrachtet.
Preis und Grenzen des kostenlosen Plans
Der kostenlose Plan von Pangram erfordert keine Zahlungsmethode. Er umfasst 2.000 Wortscans pro Tag und 3 Bild-Detektion-Scans pro Tag. Dazu gehört auch das Hochladen von Dateien mit OCR, die Browser-Erweiterung, die Integration in Google Docs sowie der API-Zugriff, in mehr als 20 Sprachen.
| Plan | Preis | Was es hinzufügt |
|---|---|---|
| Kostenlos | US$0 pro Monat | 2.000 Wörter pro Tag, 3 Bildscans pro Tag |
| Einzeln | US$20 pro Monat, jährlich abgerechnet | 300.000 Wörter pro Monat, 100 Bildscans pro Monat, Plagiatserkennung, Gmail-Integration |
| Professional | US$65 pro Monat, jährlich abgerechnet | Das Fünffache an Wörtern und Bildscans des Einzeln-Plans, plus US$200 monatliche API-Credits |
Der Einzeln-Plan hat einen 7-tägigen kostenlosen Test, bevor die monatliche Gebühr von US$20 startet, und die jährliche Abrechnung spart US$60 pro Jahr gegenüber dem Monatsmodell. Der Professional-Plan wird sofort mit US$65 abgerechnet, nicht erst nach einem Test. Außerdem sparen Sie bei jährlicher Abrechnung US$240 pro Jahr. Pangram listet zudem separate Business-Preise für Teams, die nach Auswahl des Tabs Business auf der Preisseite angezeigt werden.
Wer nutzt Pangram
Schulen und Universitäten sind Pangrams größte Kundengruppe. Seine LMS-Integrationen verbinden sich direkt mit Canvas, Moodle, Google Classroom und Brightspace. Eine Lehrkraft kann ein Pangram-Ergebnis neben der Abgabe einer Schülerin oder eines Schülers sehen, ohne die Plattform zu verlassen, die sie ohnehin bereits zum Benoten nutzt.
Verlage, Kanzleien und HR-Teams nutzen Pangram aus unterschiedlichen Gründen: um eingereichte Manuskripte zu prüfen, Dokumente in einem Fall zu sichten oder Bewerbungsunterlagen vorzuselektieren. Die API ermöglicht es jeder dieser Organisationen, Pangrams Erkennung in die eigenen internen Tools zu integrieren. Die Gmail- und Google-Docs-Integrationen erlauben es einer Person, Text zu prüfen, ohne den Posteingang oder das Dokument zu verlassen.
Für Studierende bedeutet das in der Regel: Eine Pangram-Bewertung erscheint in demselben Dashboard, das Ihre Lehrkraft bereits für Noten und Feedback nutzt. Es handelt sich nicht um einen separaten Bericht, den Sie selbst anfordern. Wenn Ihre Schule Pangram über ein LMS bereitstellt, fragen Sie Ihre Lehrkraft oder Fachbereich nach, welche Punktzahl als Anlass zur Sorge gilt und was als Nächstes passiert.
Wenn ein Pangram-Ergebnis Ihre Formulierungen als auffällig markiert, zählt eine Dokumentation Ihres eigenen Entwurfsprozesses mehr als die reine Debatte um die Punktzahl. Darauf gehen wir in getrennten Beiträgen ein: den Nachweis für Ihren Entwurfsprozess aufbauen und die Schritte für eine formale Beschwerde.
Wenn KI dabei geholfen hat, einen Teil Ihrer Arbeit zu erstellen, schreibt unser KI-Humanizer diesen Abschnitt in Ihrer eigenen Stimme um. Zitate, Fachbegriffe und Zahlen bleiben exakt so, wie Sie sie geschrieben haben, und das Tool ist darauf ausgelegt, KI-Scores in genau den Abschnitten zu senken, die es bearbeitet.
Häufig gestellte Fragen
Q: Ist Pangram genau?
Pangram sagt, es sei zu über 99% genau, und es verweist auf externe Studien mit ähnlichen Ergebnissen. Das eigene Model Card zeigt eine geringere Genauigkeit für Texte unter 50 Wörtern und für einige Sprachen, die nicht Englisch sind.
Q: Wie hoch ist die Fehlalarmrate von Pangram?
Das Pangram-FAQ nennt eine Gesamtrate von etwa 1 zu 10.000. Die Modellkarte Pangram 4 berichtet mit 0,0041% eine spezifischere Kennzahl, das entspricht etwa 1 zu 24.000, gemessen anhand von 1.000.000 englischen Dokumenten. Die Rate variiert je nach Fachgebiet und Sprache.
Q: Wie schneidet Pangram im Vergleich zu GPTZero ab?
Pangram gibt an, dass die falsch-positiv-Rate bei etwa 1 zu 10.000 liegt, und GPTZero nennt etwa 1% im RAID-Benchmark. Beide bieten kostenlose Pläne und eine offene Registrierung. Wir decken GPTZeros eigene Zahlen in unserem GPTZero-Genauigkeitscheck ab.
Q: Wie schneidet Pangram im Vergleich zu Turnitin ab?
Turnitin funktioniert nur über ein Schul- oder Verlag-Konto, während sich jeder direkt bei Pangram anmelden kann. Pangram nennt eine falsch-positiv-Rate von 0,51% für wissenschaftliches Schreiben aus dem eigenen Whitepaper von Turnitin und berichtet für sich selbst eine niedrigere Rate.
Q: Wie schneidet Pangram im Vergleich zu Copyleaks ab?
Copyleaks nennt eine falsch-positiv-Rate von etwa 0,2%, und Pangram berichtet für sich selbst eine niedrigere Rate. Beide bieten kostenlose Scans an, und wir behandeln Copyleaks in Erkennt Copyleaks KI? Genauigkeit und was Sie tun können.
Q: Wie erkennt Pangram KI-geschriebenen Text?
Pangram nutzt ein Deep-Learning-Modell, das auf menschlichen und KI-generierten Texten trainiert wurde. Es verwendet weder Perplexity noch Burstiness, also Messgrößen, auf die viele ältere Detektoren setzen. Pangram kennzeichnet jedes Dokumentsegment als Human, AI-Assisted oder AI-Generated und gibt eine Konfidenzstufe für das Ergebnis an.
Q: Ist der KI-Detektor von Pangram kostenlos in der Nutzung?
Ja, der Free-Plan benötigt keine Zahlungsmethode und umfasst 2.000 Wörter Text-Scanning pro Tag sowie 3 Bild-Scans. Bezahlte Pläne starten bei US$20 pro Monat, jährlich abgerechnet, für 300.000 Wörter pro Monat und Plagiatserkennung.
Q: Erkennt Pangram Text, der über einen humanizer läuft?
Pangram sagt, dass es das tut, und verweist als Beleg auf die Studie von 2025 Chicago Booth. Da sich Detektoren und KI-Humanizer beide häufig aktualisieren, können die Ergebnisse für humanisierten Text sich mit der Zeit ändern.
Q: Was hat die Studie der University of Maryland über Pangram herausgefunden?
Eine Studie der University of Maryland aus dem Jahr 2025 ergab, dass der humanizer-aware Modellansatz von Pangram, Pangram Humanizers, der einzige automatische Detektor war, der mit einer Gruppe aus fünf Expertinnen und Experten aus der Human-Reading-Panel-Analyse mithalten konnte. Beide erreichten eine durchschnittliche echte-positiv-Rate von 99,3% über 300 Testartikel. Die falsch-positiv-Rate von Pangram in diesem speziellen Test lag bei 2,7%, also deutlich über der 1-zu-10.000-Rate, die es aus eigenen größeren Auswertungen berichtet.
Q: Wer steckt hinter Pangram?
Pangram Labs ist das Unternehmen hinter Pangram, gegründet 2023 in Brooklyn, New York von ehemaligen KI-Forschenden von Tesla und Google. Das Unternehmen verkauft außerdem einen Plagiats-Checker, einen KI-Bilddetektor sowie API-Zugriff zusätzlich zu seinem Textdetektor.
Überarbeitet KI-assistierte akademische Entwürfe in Ihrer eigenen Stimme und lässt dabei Zitate, Fachbegriffe und Zahlen exakt so, wie Sie sie geschrieben haben.

Dana ist Content-Erstellerin bei ProofreaderPro, wo sie den täglichen Blog- und Schreibbetrieb leitet. Sie schreibt die Artikel über die Funktionsweise der Online-Bearbeitungsplattform und bearbeitet täglich Kundennachrichten, was ihr eine Zufriedenheitsbewertung von fünf Sternen einbringt.