Zum Inhalt springen

Sind KI-Detektoren zuverlässig?

Aktualisiert am · 6 Min. Lesezeit · vom HidenGPT-Team

Nein, jedenfalls nicht als Beweis: KI-Detektoren schätzen, wie vorhersehbar ein Text formuliert ist, und können Texte von Menschen als KI einstufen und KI-Texte übersehen. In einem Test von 14 Werkzeugen unter Leitung der HTW Berlin erreichte keines 80 % Genauigkeit, und die Universität Potsdam schreibt in ihrer Handreichung, Detektoren lieferten keine rechtssicheren Beweise.

Seit dem 6. Oktober 2026 prüft Turnitin auch deutsche Texte auf KI, allerdings nur bei Hochschulen, die das Originality-Paket lizenziert und die KI-Erkennung eingeschaltet haben. Wirst du verdächtigt, zählt dein Arbeitsprozess mehr als jeder Wert: Versionsverlauf, Notizen, Entwürfe.

Was Studien, Anbieter und eine Hochschule über KI-Detektoren sagen (alle Quellen gelesen am 10. Oktober 2026)
QuelleWas untersucht oder gesagt wurdeErgebnis
Weber-Wulff u. a., HTW Berlin und sechs weitere Hochschulen (2023)14 Werkzeuge, darunter Turnitin, mit englischen TesttextenKeines erreichte 80 % Genauigkeit, nur 5 kamen über 70 %; Fehler in beide Richtungen
Dieselbe Studie, übersetzte TexteVon Menschen auf Deutsch und in sechs weiteren Sprachen geschrieben, mit DeepL oder Google Translate ins Englische übersetztDie Genauigkeit sank laut den Autoren um 20 % gegenüber englischen Originaltexten
Liang u. a., Stanford (2023)7 Detektoren, 91 TOEFL-Aufsätze von Menschen, deren Erstsprache nicht Englisch istIm Schnitt 61 % fälschlich als KI eingestuft; 89 der 91 Aufsätze von mindestens einem Detektor
OpenAI (2023)Eigener Klassifikator für KI-TexteErkannte 26 % der KI-Texte und markierte 9 % der menschlichen; am 20. Juli 2023 wegen geringer Genauigkeit eingestellt
Turnitin, Hilfeseiten (2026)Eigener KI-BerichtKann Texte falsch zuordnen, soll nicht alleinige Grundlage für Maßnahmen sein; Werte von 1 bis 19 % erscheinen nur als Sternchen
Universität Potsdam, Handreichung KI und Prüfungen (März 2026)Umgang mit TäuschungsverdachtDetektoren nicht zuverlässig, keine rechtssicheren Beweise; die Beweislast liegt bei den Prüfenden

Wie ein KI-Detektor zu seinem Wert kommt

Kein Detektor weiß, wer einen Text getippt hat. Manche Werkzeuge messen, wie wahrscheinlich jedes Wort nach den vorherigen ist, denn Sprachmodelle wählen gern das wahrscheinliche Wort. Andere sind Klassifikatoren, die an Beispielen mit der Aufschrift Mensch oder KI trainiert wurden und neue Texte nach Ähnlichkeit einordnen.

Heraus kommt in beiden Fällen eine Schätzung. Was die Zahl bedeutet, unterscheidet sich je nach Werkzeug: Turnitin zum Beispiel zeigt einen Gesamtanteil des Textes, der KI-generiert sein könnte, und hebt die betroffenen Abschnitte hervor. Das beschreibt, wie sehr ein Text dem ähnelt, was das Werkzeug als KI gelernt hat. Wer ihn geschrieben hat, sagt es nicht.

Was die Studien zeigen

Die gründlichste Untersuchung mit deutscher Beteiligung leitete Debora Weber-Wulff von der HTW Berlin, zusammen mit Forschenden aus fünf weiteren Ländern; erschienen ist sie 2023 im International Journal for Educational Integrity. Getestet wurden 12 frei verfügbare Werkzeuge und die kommerziellen Systeme Turnitin und PlagiarismCheck. Die Testtexte waren englisch: selbst geschriebene, ins Englische übersetzte, von ChatGPT erzeugte, von Hand nachbearbeitete und maschinell umformulierte. Ergebnis: Kein Werkzeug erreichte 80 % Genauigkeit, nur fünf kamen über 70 %. Die Autoren nennen die Werkzeuge weder genau noch zuverlässig und halten sie als Beweis für ein Fehlverhalten für ungeeignet. Nachbearbeitung und Umformulierung verschlechterten die Erkennung deutlich, und Texte, die Menschen in ihrer Sprache geschrieben und maschinell übersetzt hatten, wurden schlechter als menschlich erkannt.

Eine Stanford-Studie von Liang und Kollegen, ebenfalls 2023 erschienen, ließ sieben Detektoren 91 TOEFL-Aufsätze prüfen, geschrieben von Menschen mit einer anderen Erstsprache als Englisch. Im Schnitt stuften die Detektoren 61 % davon als KI ein, 18 Aufsätze sogar alle sieben. Die Aufsätze, die alle sieben markierten, hatten eine vorhersehbarere Wortwahl.

Zwei Einschränkungen gehören dazu. Beide Studien prüften englische Texte, und die HTW-Studie arbeitete mit einem ChatGPT-Modell vom Februar 2023; wie heutige Versionen abschneiden, zeigen sie nicht. Die Grundgrenze bleibt aber: Ein Detektor schätzt aus dem Wortlaut allein.

Turnitin und deutsche Texte

Am 6. Oktober 2026 hat Turnitin die KI-Erkennung für Deutsch, Türkisch und Niederländisch freigegeben. Sie läuft bei Kunden, die Turnitin Originality lizenziert und die KI-Erkennung in ihrem Konto eingeschaltet haben, sowie bei iThenticate 2.0 mit lizenzierter KI-Erkennung. Das Werkzeug erkennt die Sprache einer Einreichung und wählt das passende Modell; Texte in nicht unterstützten Sprachen prüft es nicht auf KI. Ob deine Hochschule diese Lizenz hat, erfährst du bei den Lehrenden oder im Prüfungsamt.

Turnitin selbst ist vorsichtig. Auf seiner Hilfeseite zum KI-Bericht steht, das Modell könne Texte von Menschen, KI-Texte und KI-umformulierte Texte falsch zuordnen und solle nicht die alleinige Grundlage für Maßnahmen gegen Studierende sein. Fehlalarme kämen bei Werten zwischen 0 und 19 % häufiger vor, deshalb zeigt der Bericht Werte von 1 bis 19 % nicht als Zahl, sondern als Sternchen. Geprüft werden nur Texte mit mindestens 300 Wörtern Fließtext und höchstens 30.000 Wörtern.

Ein Widerspruch, den du kennen solltest: Dieselbe Hilfeseite nennt als unterstützte Sprachen am 10. Oktober 2026 noch Englisch, Spanisch, Japanisch und Arabisch. Wir haben uns an die neuere Ankündigung gehalten.

Was an deutschen Hochschulen zählt

Die Universität Potsdam hat im März 2026 eine Handreichung zu KI und Prüfungen veröffentlicht. Darin steht, dass die Beweislast für einen Täuschungsversuch bei den Prüfenden liegt und dass KI-Detektoren nicht zuverlässig sind und keine rechtssicheren Beweise liefern, weil sie nur eine statistische Wahrscheinlichkeit bewerten. Als Indizien nennt die Handreichung andere Dinge: erfundene Quellen, Stilbrüche innerhalb einer Arbeit, Texte, die eloquent klingen, aber vage bleiben, und fehlende Bezüge zu aktuellen Debatten oder zum Seminar. Bei einem begründeten Verdacht empfiehlt sie ein zeitnahes Klärungsgespräch über Inhalte, Quellen und den eigenen Schreibprozess.

Andere Hochschulen regeln das in ihren eigenen Ordnungen und Merkblättern. Im Merkblatt der Arbeits- und Wirtschaftssoziologie in Bielefeld etwa zählt der Einsatz von KI-Software als Täuschung, wenn er nicht mit der Prüferin oder dem Prüfer abgesprochen ist; ist er abgesprochen, müssen Software und Prompts angegeben werden. Lies deshalb deine Eigenständigkeitserklärung, bevor du überhaupt ein KI-Werkzeug öffnest.

Was du tun kannst

Schreib in einem Programm mit Versionsverlauf, etwa Google Docs oder Word mit Speicherort OneDrive, und lösch den Verlauf nicht. Heb Notizen, Gliederung und die gelesene Literatur auf. Kenn deine Argumentation gut genug, um sie im Gespräch zu erklären, denn genau danach fragt ein Klärungsgespräch.

Markiert ein Detektor eine Arbeit, die du selbst geschrieben hast, sichere die markierte Fassung, sammle deinen Verlauf und sprich ruhig mit den Lehrenden. Einen selbst geschriebenen Text umzuformulieren, nur um einen niedrigeren Wert zu bekommen, beweist nichts und macht ihn oft schlechter.

Ein Hinweis zu Werkzeugen: HidenGPT verspricht nichts zu irgendeinem Detektor, und der Natürlichkeitswert seines Rotstifts ist ein redaktioneller Wert für Lesbarkeit, kein Detektor.

Häufige Fehler

  • Einen Detektorwert als Beweis nehmen: Er ist ein Anlass, genauer hinzusehen und zu reden, mehr nicht; so sieht es auch die Handreichung der Universität Potsdam.
  • So lange Detektoren ausprobieren, bis einer das gewünschte Ergebnis zeigt: Sie widersprechen sich, und das sagt nichts über deinen Text.
  • Die markierte Arbeit vor dem Gespräch umschreiben: Zeig zuerst das Original und seinen Verlauf.
  • Einen niedrigen Wert als Freispruch lesen: Detektoren übersehen KI-Texte genauso, wie sie menschliche markieren.
  • Einen eigenen deutschen Text maschinell übersetzen und unverändert abgeben: In der HTW-Studie wurden solche Übersetzungen schlechter als menschlich erkannt; überarbeite sie in deinen eigenen Worten.
  • Turnitins Prozentzahl für den Anteil halten, den du mit KI geschrieben hast: Sie ist eine Schätzung des Werkzeugs, keine Messung.

Fragen

Welcher KI-Detektor ist zuverlässig?

Keiner, wenn zuverlässig heißt, dass ein Ergebnis als Beweis taugt. Im Test unter Leitung der HTW Berlin schnitt Turnitin unter 14 Werkzeugen am besten ab, blieb aber wie alle anderen unter 80 % Genauigkeit; wie neuere Versionen abschneiden, zeigt diese Studie nicht.

Erkennt Turnitin KI in deutschen Texten?

Seit dem 6. Oktober 2026 ja, aber nur bei Hochschulen mit Turnitin Originality und eingeschalteter KI-Erkennung. Turnitin schreibt selbst, dass sein Modell falschliegen kann und nicht die alleinige Grundlage für Maßnahmen sein soll.

Können KI-Detektoren falschliegen?

Ja, in beide Richtungen. Sie können Texte von Menschen als KI einstufen und KI-Texte als menschlich, und verschiedene Detektoren können denselben Text unterschiedlich bewerten.

Kann mir die Hochschule mit einem Detektor eine Täuschung nachweisen?

Ein Detektorwert allein reicht dafür zum Beispiel nach der Handreichung der Universität Potsdam nicht: Die Beweislast liegt bei den Prüfenden, und Detektoren liefern keine rechtssicheren Beweise. Was an deiner Hochschule gilt, steht in deiner Prüfungsordnung.

Warum wird mein selbst geschriebener Text als KI markiert?

Meist, weil Teile davon vorhersehbar formuliert sind: feste Gliederung, Übergänge aus dem Lehrbuch, gleich gebaute Sätze. Auch Texte in einer Zweitsprache und maschinell übersetzte Texte schnitten in Studien schlechter ab.

Was mache ich, wenn ein Detektor meine Hausarbeit markiert?

Sichere die markierte Fassung und deinen Versionsverlauf, sammle Notizen und Entwürfe und sprich ruhig mit den Lehrenden. Frag, was markiert wurde und wie deine Hochschule mit Detektorwerten umgeht.

Sind bezahlte KI-Detektoren besser als kostenlose?

Der Preis hebt die Grundgrenze nicht auf. In der HTW-Studie blieben auch die beiden kommerziellen Systeme unter 80 % Genauigkeit, und PlagiarismCheck landete im binären Vergleich auf Platz 13 von 14.

Was bedeutet das Sternchen im Turnitin-Bericht?

Es steht für einen Wert zwischen 1 und 19 %. Turnitin schreibt, dass Fehlalarme in diesem Bereich häufiger vorkommen, und zeigt die Zahl deshalb nicht an.

Quellen

  1. Weber-Wulff u. a. (2023): Testing of Detection Tools for AI-Generated Text, arXiv-Fassung (Zeitschrift: International Journal for Educational Integrity 19, 26) (geprüft am 10. Oktober 2026)
  2. Liang, Yuksekgonul, Mao, Wu und Zou (2023): GPT detectors are biased against non-native English writers, arXiv-Fassung (Zeitschrift: Patterns 4(7)) (geprüft am 10. Oktober 2026)
  3. OpenAI: New AI classifier for indicating AI-written text (mit Hinweis zur Einstellung am 20. Juli 2023) (geprüft am 10. Oktober 2026)
  4. Turnitin Guides: Turnitin product updates (6. Oktober 2026: KI-Erkennung für Türkisch, Deutsch, Niederländisch) (geprüft am 10. Oktober 2026)
  5. Turnitin Guides: Using the AI Writing Report (geprüft am 10. Oktober 2026)
  6. Universität Potsdam, ZfQ: Handreichung KI und Prüfungen an der Universität Potsdam (Stand 25. März 2026) (geprüft am 10. Oktober 2026)
  7. Universität Bielefeld, AB 10 Arbeits- und Wirtschaftssoziologie: Merkblatt für Hausarbeiten (geprüft am 10. Oktober 2026)