Warum steigt beim Paraphrasieren Ihr Turnitin AI-Score?

Den Similarity-Wert drücken und die AI-Erkennung umgehen – das zieht in zwei entgegengesetzte Richtungen. Die Wörter, die ein Umschreib-Tool wählt, um Treffer zu vermeiden, sind dieselben häufigen Wörter, auf die auch KI-Generatoren zurückgreifen. Und genau diese Verteilung erkennt der Detector.

HumanPen-Team

· 10 Min. Lesezeit

Die kurze Antwort

Paraphrasier-Tools sind darauf gebaut, Ihren Similarity Score zu senken. Das tun sie, indem sie Ihre Wörter durch andere Wörter mit gleicher Bedeutung ersetzen. Diese Ersatzwörter sind häufig genutzte Ausdrücke – genau die Art Sprache, die auch KI-Generatoren standardmäßig verwenden. Turnitins Detector liest Wortwahrscheinlichkeitsmuster. Wenn Ihr umgeschriebener Text näher an dieser Verteilung liegt, steigt der AI-Prozentsatz. Das ist kein Bug. Es ist der Mechanismus, der so funktioniert, wie er designed wurde – nur auf ein anderes Ziel gerichtet als das, das Sie im Sinn hatten.

Similarity Score und AI-Percentage sind, um es mit Turnitins eigenen Worten zu sagen, "completely independent and do not influence each other" (völlig unabhängig und beeinflussen sich nicht gegenseitig). Sie messen Unterschiedliches, sie werden von unterschiedlichen Prozessen berechnet und nichts, was Sie bei dem einen tun, hilft automatisch auch beim anderen. Wenn sie in entgegengesetzte Richtungen ziehen, kann das Paraphrasier-Tool, das Sie für das erste Problem genutzt haben, Sie geradewegs ins zweite hineinlaufen lassen.

Zwei Scores, zwei Ziele, ein Dokument

Turnitin sagt das ganz offen in seinen detection FAQs: "The Similarity score and the AI writing detection percentage are completely independent and do not influence each other." (Der Similarity Score und der AI Writing Detection-Prozentsatz sind völlig unabhängig und beeinflussen sich nicht gegenseitig.) Der Similarity Score sagt Ihnen, wie viel Ihres Texts mit anderen Texten in der Datenbank übereinstimmt. Der AI-Percentage sagt Ihnen, wie viel Ihres Texts maschinell geschrieben wirkt. Das sind nicht zwei Ansichten derselben Sache.

Ein Paraphrasier-Tool ist auf das erste Ziel ausgelegt. Es nimmt einen Satz, der mit etwas in der Datenbank matcht, und schreibt ihn so um, dass er nicht mehr matcht. Das senkt Ihren Similarity Score. Aber das Tool erreicht das, indem es Ihre ursprünglichen Wortwahlen durch Alternativen ersetzt. Und diese Alternativen kommen aus den häufigsten, wahrscheinlichsten Ausdrücken für jede Bedeutung. Ihre ursprüngliche Formulierung war vielleicht eigenwillig. Der Ersatz ist per Design das Gegenteil davon.

Der AI-Percentage meanwhile wird komplett anders berechnet. Wir haben in was KI-Detektoren messen nachgezeichnet, wie diese Berechnung funktioniert, und die Kurzfassung ist: Der Detector zerlegt Ihren Text in überlappende Segmente, gibt jedem einen Wahrscheinlichkeitswert und fasst diese zu einer Dokument-Gesamtzahl zusammen. Die Wörter, die das Paraphrasier-Tool gewählt hat, sind jetzt die, die bewertet werden. Wenn diese Wörter sich im hochwahrscheinlichen Bereich ballen, steigt die Zahl.

Was der Detector tatsächlich liest

Leute sagen oft, Turnitins Detector messe "Perplexity" und "Burstiness". Ganz stimmt das nicht. In Turnitins FAQ heißt es: "Our model is not explicitly programmed to evaluate specific signals such as 'burstiness', 'perplexity,' or other individual metrics sometimes referenced in public discussions." (Unser Model ist nicht explizit darauf programmiert, spezifische Signale wie 'Burstiness', 'Perplexity' oder andere einzelne Metriken auszuwerten, auf die in öffentlichen Diskussionen manchmal Bezug genommen wird.) Der nächste Satz im selben Abschnitt lautet: "Instead, it learns statistical patterns from our training data." (Stattdessen lernt es statistische Muster aus unseren Trainingsdaten.)

Aber dieselbe FAQ-Seite sagt an anderer Stelle: "Our classifiers are trained to detect these differences in word probability and are adept at the particular word probability sequences of human writers." (Unsere Klassifikatoren sind darauf trainiert, diese Unterschiede in Wortwahrscheinlichkeit zu erkennen und kennen sich mit den bestimmten Wortwahrscheinlichkeits-Sequenzen menschlicher Schreiber aus.) Das Model berechnet also keinen Perplexity-Score und nennt ihn so. Es liest, um es mit seinen eigenen Worten zu sagen, Wortwahrscheinlichkeit. Perplexity ist ein Maß für Wortwahrscheinlichkeit. Der Unterschied ist wichtig, weil das erste Zitat, allein genommen, so klingt, als würde der Detector Wortwahrscheinlichkeit komplett ignorieren. Tut er nicht. Warum Detektoren nicht übereinstimmen zeigt, wie verschiedene Tools beim selben Text zu verschiedenen Zahlen kommen – und Wortwahrscheinlichkeitsmodellierung steht im Zentrum davon.

Fürs Paraphrasieren heißt das konkret: Ihr ursprünglicher Satz hatte ein Wortwahrscheinlichkeitsprofil, geprägt von Ihrem eigenen Vokabular, Ihren Gewohnheiten, den spezifischen Dingen, die Sie gelesen haben, bevor Sie geschrieben haben. Die paraphrasierte Version hat ein Profil, geprägt von dem, was das Tool ausgewählt hat. Und das Tool wählt aus der Mitte der Verteilung, nicht von den Rändern. Der Detector, der auf Wortwahrscheinlichkeit trainiert ist, sieht den umgeschriebenen Satz als näher an seinem Modell für maschinelle Outputs. Nicht weil Sie KI genutzt haben, sondern weil die statistische Fußspur eines paraphrasierten Satzes eher danach aussieht.

Genau das Profil, das Turnitin als False Positive benennt

Hier wird's ungemütlich. Turnitins FAQ listet die Textarten auf, die tendenziell False Positives produzieren, und die Beschreibung liest sich wie ein Datenblatt für das, was ein Paraphrasier-Tool liefert:

"Sometimes false positives (incorrectly flagging human-written text as AI-generated), can include content without a lot of structural variation, text that literally repeats itself, or text that has been paraphrased without developing new ideas." (Manchmal können False Positives – also fälschlich als KI-generiert markierter menschengeschriebener Text – Inhalte ohne große strukturelle Variation umfassen, Text, der sich wortwörtlich wiederholt, oder Text, der paraphrasiert wurde, ohne neue Ideen zu entwickeln.)

Der Satz direkt danach ist der wichtigste: "If our indicator shows a higher amount of AI writing in such text, we advise you to take that into consideration when looking at the percentage indicated." (Wenn unser Indikator in solchem Text einen höheren Anteil an KI-Schreibweise anzeigt, raten wir Ihnen, dies bei der Betrachtung des angegebenen Prozentsatzes zu berücksichtigen.) Turnitin sagt Instructorn damit, hohe AI-Scores bei Texten, die diesem Profil entsprechen, niedriger zu gewichten.

Ein Paraphrasier-Tool entwickelt per Definition keine neuen Ideen. Es nimmt Ihre vorhandenen Ideen und formuliert sie um. Es reduziert auch tendenziell die strukturelle Variation, weil es den Stil über das Dokument hinweg glättet, statt neue Satzformen einzuführen. Das Tool versucht nicht, Ihren Text variantenreicher zu machen. Es versucht, ihn weniger matchend zu machen. Diese beiden Ziele decken sich nicht, und das zweite schiebt den Text genau in das Profil, von dem Turnitin sagt, es sei anfällig für False Positives.

Wir sind tiefer eingestiegen, warum poliertes Schreiben Detector triggert, und der Mechanismus dort ist derselbe wie hier. Glättung ist ein statistisches Signal.

Wie der Detector geneigt ist

Turnitin sagt, es würde lieber KI-Text verpassen als menschliches Schreiben fälschlich flaggen. Die FAQ sagt: "In order to maintain this low rate of 1% for false positives, there is a chance that we might miss some AI written text in a document. We're comfortable with that since we do not want to incorrectly highlight human-written text as AI-written." (Um diese niedrige Rate von 1% für False Positives aufrechtzuerhalten, besteht die Chance, dass wir etwas KI-geschriebenen Text in einem Dokument übersehen. Damit sind wir einverstanden, da wir menschengeschriebenen Text nicht fälschlicherweise als KI-geschrieben markieren wollen.)

Diese Neigung ist real, und sie ist der Grund, warum ein vollständig menschlich geschriebenes Dokument eine niedrige Wahrscheinlichkeit hat, geflaggt zu werden. Aber sie schützt paraphrasierten Text nicht so, wie Leute annehmen. Die 1%-False-Positive-Rate gilt für Text, der nicht dem False-Positive-Profil entspricht. Text, der dem Profil entspricht – die Art, die Turnitin selbst im obigen Zitat beschreibt –, ist nicht der Text, gegen den die 1%-Zahl gemessen wurde. Der Detector ist allgemein auf Vorsicht eingestellt, aber die Merkmale, auf die er triggert, sind dieselben, die ein Paraphrasier-Tool einbaut.

Wenn Ihr Text von einem KI-gesteuerten Tool paraphrasiert wurde, gibt es einen separaten Weg. Turnitin sagt, es "can also identify instances where AI-generated text may have been modified by AI paraphraser or bypasser (also called humanizers) tools to evade detection" (kann auch Fälle identifizieren, in denen KI-generierter Text durch KI-Paraphrasierer oder Bypasser-Tools – auch Humanizer genannt – modifiziert wurde, um der Erkennung zu entgehen). Das ist kein False Positive. Das ist ein True Positive auf einem anderen Signal, und der Detector hat eine benannte Capability dafür. Mit KI umformuliert und trotzdem markiert geht durch, was passiert, wenn das Tool, das Sie genutzt haben, selbst ein KI-Model war, das das Umschreiben übernommen hat.

Nicht alle Paraphrasier-Tools machen dasselbe

Es gibt einen bedeutenden Unterschied zwischen einem Grammar-Checker, der Rechtschreibung korrigiert, und einem generativen Tool, das Ihre Sätze umschreibt. Turnitin zieht diese Linie explizit. Über Grammarly sagt die FAQ: "Based on tests we conducted on human-written documents with no AI-generated content in them, in most cases, changes made by Grammarly (free & premium) and/or other grammar-checking tools were not flagged as AI-written by our detector." (Basierend auf Tests, die wir an menschlich geschriebenen Dokumenten ohne KI-generierte Inhalte durchgeführt haben, wurden in den meisten Fällen von Grammarly – kostenlos & Premium – und/oder anderen Grammar-Checking-Tools vorgenommene Änderungen nicht als KI-geschrieben von unserem Detector geflaggt.) Das Schlüsselqualifikator ist "in most cases". Die Ausnahme ist nicht absolut.

Und die FAQ fährt fort: "Please note that this excludes content generated by Grammarly's generative AI-powered features, including draft generation, paraphrasing, summarizing, and other features. Content produced using these features will likely be flagged as AI-generated by our detector." (Bitte beachten Sie, dass dies Inhalte ausschließt, die von Grammarlys generativen KI-gestützten Funktionen erstellt wurden, einschließlich Entwurfsgenerierung, Paraphrasierung, Zusammenfassung und andere Funktionen. Inhalte, die mit diesen Funktionen erstellt werden, werden wahrscheinlich von unserem Detector als KI-generiert geflaggt.) Rechtschreib- und Zeichensetzungskorrekturen sind eine Kategorie. Paraphrasieren und Umschreiben sind eine andere. In der zweiten Kategorie steigt der AI-Score.

Turnitin veröffentlicht keine Liste, welche Paraphraser- und Bypasser-Tools es getestet und getestet hat. Die FAQ sagt: "However, to safeguard the integrity of our solution and its effectiveness in maintaining academic honesty, we're unable to disclose the names of these tools." (Um jedoch die Integrität unserer Lösung und ihre Wirksamkeit bei der Wahrung akademischer Ehrlichkeit zu schützen, können wir die Namen dieser Tools nicht offenlegen.) Also kann niemand außerhalb von Turnitin sagen, welche spezifischen Tools erkannt werden und welche nicht. Jede Behauptung, ein bestimmtes Tool "schlägt" den Detector, ist eine Behauptung, die niemand gegen Turnitins eigene Tests verifizieren kann. Wir stellen diese Behauptung nicht auf und empfehlen nicht, irgendjemandem zu vertrauen, der das tut.

Was den AI-Percentage tatsächlich senkt

Der AI-Percentage sinkt, wenn das Wortwahrscheinlichkeitsprofil Ihres Texts sich von der Verteilung wegbewegt, die der Detector mit maschinellen Outputs verbindet. Das passiert, wenn Sie Vokabular, Satzstrukturen und Ideen einbringen, die ein Generator allein nicht gewählt hätte. Paraphrasieren ohne neue Ideen hinzuzufügen macht das Gegenteil. Es bewegt das Profil zur Mitte hin.

Wenn Sie Ihren Text schon durch ein Paraphrasier-Tool gejagt haben und der AI-Score gestiegen ist, ist es kein Plan, dieselbe Operation zu wiederholen und auf eine andere Zahl zu hoffen. Schreiben Sie die markierten Passagen mit Ihren eigenen Wörtern, Ihren eigenen Satzformen und idealerweise Ihrer eigenen zusätzlichen Analyse oder eigenen Beispielen neu. Das ist auch die Fassung, für die Sie sich hinterher erklären können, falls jemand fragt, wie die Passage entstanden ist.

Die praktische Version davon, mit dem Report vor sich, finden Sie in einen Turnitin AI Writing Report lesen. Der Report zeigt Ihnen, welche Segmente geflaggt sind, und das sind die Segmente, bei denen Ihre Wortwahlen aufhören müssen, der Durchschnitt zu sein, und anfangen müssen, Ihre zu sein.

Wo die Linie liegt

HumanPen ist ein Document Rewriter, und die hier relevante Designentscheidung betrifft, was umgeschrieben wird und was nicht. Sie können das Dokument zusammen mit seinem AI Writing Report hochladen und nur die Passagen, die der Report geflaggt hat, werden umgeschrieben. Der Rest des Dokuments bleibt so, wie Sie ihn geschrieben haben.

Der Grund, warum das für diesen Artikel wichtig ist: Eine Complete-Document-Paraphrasier-Runde ist das Worst-Case-Szenario für den oben beschriebenen Mechanismus. Sie schreibt alles um, auch Passagen, die nicht geflaggt waren, und tut das, indem sie alle zur hochfrequenten Mitte hin bewegt. Ein Scoped Rewrite berührt nur die Segmente, die der Detector schon geflaggt hat, und tut das mit dem Ziel, ihr Wortwahrscheinlichkeitsprofil zu verschieben, statt sie weiter zu glätten.

Billing zählt nur die tatsächlich umgeschriebenen Wörter. Wenn ein späterer Report noch Passagen flaggt, können diese kostenlos nachlaufen. Wir sagen Ihnen nicht, was der nächste Report sagen wird, weil das niemand kann. Aber der Mechanismus ist der Mechanismus, und ein Scoped Rewrite arbeitet damit, nicht dagegen.

Häufig gestellte Fragen

Steigt der AI-Score beim Paraphrasieren immer? Nicht immer, aber oft genug, dass das Muster einen Namen hat. Turnitin listet "text that has been paraphrased without developing new ideas" (Text, der paraphrasiert wurde, ohne neue Ideen zu entwickeln) unter den Profilen auf, die anfällig für False Positives sind. Worauf dieses Profil abstellt, ist, ob neue Analyse hinzugefügt wurde, nicht welche Editieroperationen die Sätze produziert haben. Text, der innerhalb derselben Ideen bleibt, behält ein Wortwahrscheinlichkeitsprofil, das der Detector darauf trainiert ist, mit KI-Outputs zu assoziieren. Ob Ihr spezifischer Score steigt, hängt davon ab, wie Ihr Originaltext aussah und was das Tool dafür eingesetzt hat.

Ich habe Grammarly genutzt, um Rechtschreibung zu korrigieren. Hebt das meinen AI-Score an? Turnitin sagt, dass in den meisten Fällen von Grammarly und anderen Grammar-Checking-Tools vorgenommene Änderungen "were not flagged as AI-written by our detector" (nicht als KI-geschrieben von unserem Detector geflaggt wurden). Das Qualifikator "in most cases" leistet Arbeit in diesem Satz. Wenn Sie Grammarlys generative Features wie Paraphrasieren, Zusammenfassen oder Draft-Generierung genutzt haben, sagt die FAQ, dass solche Inhalte "will likely be flagged as AI-generated" (wahrscheinlich als KI-generiert geflaggt werden).

Warum geht mein Similarity Score runter, aber mein AI-Score rauf? Weil sie Unterschiedliches messen. Turnitin sagt, die zwei Scores seien "completely independent and do not influence each other" (völlig unabhängig und beeinflussen sich nicht gegenseitig). Paraphrasieren senkt Similarity, indem es matchenden Text entfernt. Die Ersatzwörter können den AI-Score heben, weil sie tendenziell häufig genutzte Ausdrücke sind und der Detector Wortwahrscheinlichkeitsmuster liest, die mit denen von KI-generiertem Text überlappen.

Kann ich einfach das Paraphrasier-Tool nochmal laufen lassen, um den AI-Score zu fixieren? Niemand kann Ihnen sagen, was im nächsten Bericht stehen wird; jede Antwort, die Ihnen eine Zahl verspricht, ist geraten. In Ihrer Hand liegt, ob die markierten Passagen am Ende in Ihrem Wortschatz, Ihren Satzformen und Ihren eigenen Gedanken stehen – und ob Sie hinterher erklären könnten, wie sie so zustande kamen.

Erkennt Turnitin, welches Paraphrasier-Tool ich genutzt habe? Turnitin sagt, es sei "trained and tested to detect leading paraphraser and bypasser tools" (trainiert und getestet, um führende Paraphrasierer- und Bypasser-Tools zu erkennen), legt aber nicht offen, welche. Die FAQ sagt, das Teilen einer Liste "would make it easier for students to evade our system" (würde es Studierenden leichter machen, unserem System zu entgehen). Niemand außerhalb von Turnitin kann verifizieren, ob ein spezifisches Tool auf dieser Liste steht.

WEITERLESEN