Turnitin은 퍼플렉서티와 버스티니스를 사용해 AI를 감지할까요?
Turnitin은 퍼플렉서티 점수나 버스티니스 점수를 계산하지 않습니다. 그러나 이 분류기는 단어 확률 패턴을 학습합니다. 이 두 가지 사실은 서로 모순되지 않으며, 그 사이의 간격이 바로 AI 탐지를 피하려는 조언 대부분이 어긋나는 지점입니다.
HumanPen 팀
· 11분
짧은 답
Turnitin의 모델은 "버스티니스"나 "퍼플렉서티"를 개별 지표로 평가하도록 명시적으로 프로그래밍되어 있지 않습니다. 이 모델은 훈련 데이터에서 통계적 패턴을 학습하는 트랜스포머 기반 분류기이며, 여기에는 단어 확률의 패턴도 포함됩니다. 따라서 Turnitin이 이름 있는 두 점수를 확인하고 그 값이 잘못된 범위에 들어가면 글에 표시를 남긴다는 널리 퍼진 주장은 메커니즘에 관해서는 틀렸습니다. 다만 AI 텍스트와 사람의 텍스트를 가르는 것이 단어 확률이라는 근본적인 직관 자체가 완전히 빗나간 것은 아닙니다.
이 정정이 중요한 이유는, 잘못된 메커니즘 위에 세워진 조언이 특정한 방식으로 실패하기 때문입니다. Turnitin이 퍼플렉서티 수치를 계산한다고 믿으면 그 수치를 움직이려 하게 됩니다. 실제로는 겹치는 세그먼트 전반에 걸쳐 학습된 단어 확률 패턴으로 텍스트를 분류하는 것이라면, 표면적인 지표 하나를 움직인다고 해서 분류기가 보는 것이 달라질지 어떨지는 알 수 없습니다. 우리는 AI 탐지기가 무엇을 측정하는지에 대해 일반적으로 다룬 적이 있으며, 이 글에서는 하나의 탐지기와 사람들이 가장 많이 언급하는 두 지표로 범위를 좁힙니다.
Turnitin이 자기 말로 실제로 밝히고 있는 것
Turnitin의 AI 작성 탐지 기능 FAQ에는 직접적인 부인이 담겨 있습니다. 사람들이 계속 인용하는 문장과, 바로 뒤에 있지만 계속 빠뜨리는 문장은 다음과 같습니다.
"Our model is not explicitly programmed to evaluate specific signals such as "burstiness," "perplexity," or other individual metrics sometimes referenced in public discussions." (저희 모델은 "버스티니스"나 "퍼플렉서티", 또는 공개적인 논의에서 간혹 언급되는 다른 개별 지표를 평가하도록 명시적으로 프로그래밍되어 있지 않습니다.) "Instead, it learns statistical patterns from our training data." (대신, 저희 훈련 데이터에서 통계적 패턴을 학습합니다.)
같은 문단은 이렇게 이어집니다. "As a result, its outputs are generated by many learned patterns working together rather than by a small set of transparent, human-readable rules. For that reason, individual predictions may not always be explainable in simple feature-by-feature terms." (결과적으로, 그 출력은 소수의 투명하고 사람이 읽을 수 있는 규칙이 아니라 함께 작동하는 여러 학습된 패턴에 의해 생성됩니다. 이러한 이유로 개별 예측이 항상 특성 하나하나의 단순한 용어로 설명될 수 있는 것은 아닙니다.)
이 네 문장을 함께 읽으면 그 부인에는 정확한 형태가 있습니다. Turnitin이 말하는 바는 이렇습니다. 버스티니스 수치를 계산하는 모듈도 없고, 퍼플렉서티 수치를 계산하는 모듈도 없으며, 그 두 수치를 임계값에 넣지도 않는다는 것입니다. 이는 특정 아키텍처에 대한 부인입니다. 단어 확률이 관여한다는 사실 자체를 부인하는 것은 아닙니다.
같은 FAQ 페이지는 분류기가 단어 확률로 훈련되었다고도 말합니다
단순한 부인을 더 복잡한 것으로 바꾸는 문장이 같은 페이지에 있습니다. 모델이 어떤 매개변수나 신호를 고려하는지에 대한 질문 아래에서, Turnitin은 이렇게 적고 있습니다.
"Our classifiers are trained to detect these differences in word probability and are adept at the particular word probability sequences of human writers." (저희 분류기는 단어 확률에서 이러한 차이를 감지하도록 훈련되었으며, 사람 글쓴이의 고유한 단어 확률 순서에 능숙합니다.)
즉, 모델이 퍼플렉서티를 평가하도록 프로그래밍되어 있지 않다고 말하는 바로 그 FAQ가, 분류기는 단어 확률의 차이를 감지하도록 훈련되었다고도 말합니다. 이 두 진술은 모순되지 않지만, 어느 하나도 잘못 읽지 않으려면 둘을 동시에 붙잡고 있어야 합니다.
퍼플렉서티라는 개념은 언어 모델 아래에서 단어의 나열이 얼마나 예측 가능한지를 재는 척도입니다. 언어 모델은 단어에 확률을 부여하고, 퍼플렉서티는 각 단계에서 실제로 등장한 다음 단어에 모델이 얼마나 놀랐는지를 요약합니다. 퍼플렉서티가 낮다는 것은 모델이 그 텍스트를 예측 가능하다고 보았다는 뜻입니다. 높다는 것은 그 반대입니다. AI가 생성한 텍스트의 퍼플렉서티가 낮은 경향이 있는 이유는, 언어 모델이 자신의 확률 분포에서 표본을 추출해 텍스트를 만들기 때문에 출력이 모델이 이미 그럴듯하다고 판단한 확률의 띠 안에 들어가기 때문입니다.
이것이 두 사실을 잇는 고리입니다. Turnitin은 퍼플렉서티 점수를 계산해 임계값과 대조하지 않습니다. 그러나 그 분류기는 단어 확률 패턴으로 훈련되어 있고, 퍼플렉서티는 단어 확률을 요약하는 한 가지 방법입니다. 부인의 대상은 메커니즘이며, 신호가 아닙니다.
실질적인 차이는 이렇습니다. 퍼플렉서티를 이름 있는 지표로 계산하는 시스템이라면 목표가 분명합니다. 퍼플렉서티 수치를 낮추면 표시될 가능성도 낮아집니다. 그러나 더 큰 분류기의 일부로 단어 확률 패턴을 학습하는 시스템은 그런 분명한 목표를 주지 않습니다. 분류기가 여러 학습된 패턴을 결합하기 때문에 결과는 추적할 수 있는 단일 점수로 환원되지 않습니다. 우리는 Turnitin AI 작성 보고서를 읽는 방법을 살펴봤는데, 그 보고서에 나오는 숫자는 하나의 백분율입니다. 그리고 그 백분율은 세그먼트 수준의 여러 판정을 집계한 것이며, 퍼플렉서티 게이지의 눈금을 읽은 것이 아닙니다.
세그먼트는 어떻게 작동하며, 왜 그것이 그림을 바꾸는가
모델이 제출물을 어떻게 처리하는지에 대한 Turnitin의 공개 설명은 같은 FAQ 페이지에 있습니다.
"When a paper is submitted to Turnitin, sentences from the submission are extracted and segmented into overlapping sections for prediction analysis. Each segment is classified by the AI detection model and given a value between 0 and 1, denoting the probability of the text being likely human or AI-generated. Each qualifying sentence within these segments inherits the segment's score. Since segments overlap, some sentences may have multiple scores, which are then pooled into a single score. These sentence scores are further aggregated and used to compute the overall document AI writing score." (논문이 Turnitin에 제출되면, 제출물에서 문장이 추출되어 예측 분석을 위해 겹치는 구역으로 나뉩니다. 각 세그먼트는 AI 탐지 모델에 의해 분류되고 0에서 1 사이의 값을 받으며, 이는 그 텍스트가 사람이 썼을지 AI가 생성했을지의 확률을 나타냅니다. 이 세그먼트 안의 자격이 되는 각 문장은 세그먼트의 점수를 물려받습니다. 세그먼트가 겹치기 때문에 여러 점수를 갖는 문장도 있으며, 이 점수들은 하나의 점수로 합쳐집니다. 이 문장 점수들은 다시 집계되어 문서 전체의 AI 작성 점수를 계산하는 데 사용됩니다.)
즉 처리 과정은 이렇습니다. 문장을 추출하고, 겹치는 세그먼트로 자르며, 각 세그먼트를 0에서 1까지의 척도로 분류하고, 자격이 되는 문장이 자신을 덮는 세그먼트의 점수를 물려받게 한 뒤, 겹치는 점수를 합치고, 모든 것을 보고서에 표시되는 문서 백분율로 집계합니다.
겹침이 바로 단순한 지표 이야기를 깨뜨리는 부분입니다. 한 세그먼트의 경계 근처에 있는 문장은 다음 세그먼트 안에도 있으므로 양쪽에서 점수를 받습니다. 이 점수들이 합쳐지면, 어떤 문장에 실리는 값은 그 이웃에 실린 값에 부분적으로 좌우됩니다. 예측 가능성을 낮추려고 다시 쓴 문장이라도, 그 옆 문장까지 함께 덮는 세그먼트에서 높은 점수를 물려받을 수 있습니다. 그 이웃 문장이 분류기가 AI 텍스트와 연관 지어 학습한 패턴을 지니고 있다면 더욱 그렇습니다.
이것이 탐지기들이 왜 의견을 달리하는지 같은 문서에서 결과가 이렇게 자주 갈리는지를 설명합니다. 서로 다른 데이터로 훈련되고, 서로 다른 경계에서 세그먼트를 나누며, 서로 다른 방식으로 점수를 합치는 두 분류기는 같은 텍스트에 대해 서로 다른 점수를 냅니다. 둘 다 같은 근본적인 단어 확률 패턴에 반응하고 있더라도 그렇습니다. 이 불일치는 참된 퍼플렉서티 값 주변의 노이즈가 아닙니다. 서로 다른 두 학습된 분류기가 서로 다른 두 집계를 만들어 내는 것입니다.
이 구분이 무엇을 해야 하는지를 바꾸는 이유
Turnitin이 퍼플렉서티 점수를 계산한다면 전략은 간단했을 것입니다. 텍스트의 퍼플렉서티를 측정하고, 수치가 움직일 때까지 다시 쓴 뒤, 다시 제출하면 됩니다. "퍼플렉서티를 낮춘다"고 주장하는 도구들이 바로 이 작업 흐름을 팔고 있으며, 그 마케팅 문구가 Turnitin의 메커니즘에 대한 혼란의 대부분을 만들어 냅니다.
그러나 Turnitin이 하는 일이 단어 확률 패턴을 다른 많은 패턴과 함께 학습한 모델로 세그먼트를 분류하는 것이라면, 그 전략은 성립하지 않습니다. 움직일 수치가 없습니다. 있는 것은 겹치는 창을 따라 합쳐진, 문서 전체에 걸친 학습된 특성의 전반적 분포에 반응하는 분류기 출력뿐입니다. 어떤 문단을 따로 보았을 때 덜 예측 가능하게 만드는 재작성이 그것을 덮는 합쳐진 점수를 바꿀지 어떨지는 알 수 없습니다. 분류기가 읽는 것은 문장이 아니라 세그먼트이고, 그 세그먼트에는 양옆에 있는 내용까지 포함되기 때문입니다.
두 번째 결과가 있습니다. 같은 FAQ 페이지는 모델이 살펴보는 대상을 자격 있는 텍스트로 정의합니다.
"This qualifying text includes only prose sentences, meaning that we only analyze blocks of text that are written in standard grammatical sentences and do not include other types of writing such as lists, bullet points (short non-sentence structures), or other non-sentence structures." (이 자격 있는 텍스트에는 산문 문장만 포함됩니다. 즉, 표준적인 문법적 문장으로 쓰인 텍스트 덩어리만 분석하며, 목록이나 불릿 포인트(짧은 비문장 구조), 그 밖의 비문장 구조 같은 다른 형태의 글은 포함하지 않습니다.)
다음 문장은 이렇습니다. "This percentage is not necessarily the percentage of the entire submission." (이 백분율이 반드시 제출물 전체의 백분율인 것은 아닙니다.) 목록, 불릿 포인트, 그 밖의 비문장 구조는 분석 대상에서 벗어납니다. 따라서 패턴을 끊기 위해 산문을 불릿 포인트로 바꾸는 재작성은 퍼플렉서티 점수를 낮추는 것이 아닙니다. 그것은 텍스트를 아예 점수가 매겨지는 대상에서 빼내는 일이며, 백분율은 남아 있는 자격 있는 산문을 기준으로 계산됩니다. 이는 성격이 다른 작업이고 위험의 성격도 다릅니다. 자신이 둘 중 무엇을 하고 있는지 이해해 둘 가치가 있습니다.
이 통설은 어디에서 왔고, 왜 남아 있는가
버스티니스와 퍼플렉서티 이야기는 우연이 아닙니다. AI 텍스트 탐지에 대한 초기 학술 연구에서 비롯되었는데, 연구자들은 실험용 분류기의 특성으로 실제로 이 두 지표를 사용했고, AI 텍스트와 사람 텍스트의 분포 차이가 이 두 축을 따라 측정 가능하고 직관적이었습니다. 사람 글쓴이는 언어 모델보다 문장 길이를 더 크게 바꾸고, 단어 선택도 모델보다 덜 예측 가능합니다. 버스티니스는 앞쪽을, 퍼플렉서티는 뒤쪽을 포착했습니다.
이 이야기가 남아 있는 이유는 설명하기 쉽고, 분명한 행동을 제시하기 때문입니다. 문장 길이를 다양하게 하고, 덜 예측 가능한 단어를 고르라는 것입니다. 둘 다 합리적인 일입니다. 문제는 Turnitin이 그 두 이름 있는 지표를 계산해 탐지기를 만들지 않는다고 분명히 밝히고 있다는 점입니다. 즉 분명한 행동이 탐지기가 실제로 하는 일에 대한 잘못된 설명에 붙어 있는 셈입니다. 탐지기가 진화하면, 그리고 Turnitin의 탐지기는 2023년 이후 여러 차례 진화했는데, 그 행동은 시스템 안의 그 무엇과도 맞지 않게 됩니다. 그럼에도 조언이 계속 돌아다니는 것은 이야기가 단순하고, 그 출처인 원래 연구가 실제로 존재했기 때문입니다.
퍼플렉서티와 버스티니스를 이름 있는 지표로 겨냥해 만든 휴머나이저 도구들이 시간이 지날수록 효과를 잃는 경향이 있는 것도 같은 이유입니다. 그 도구들이 겨냥해 설계된 탐지기는 애초에 Turnitin이 설명하는 탐지기와 꼭 같지 않았고, Turnitin의 모델이 거듭될수록 도구가 겨냥하는 것과 분류기가 실제로 읽는 것 사이의 간격은 더 벌어집니다.
우리가 여기서 얻은 것
HumanPen 도구는 문서 재작성 도구이며, 여기서 관련된 설계 결정은 이름 있는 지표를 움직이려 하지 않는다는 점입니다. 우리는 AI 작성 보고서가 표시한 문단을 다시 쓰며, 보고서 아래에 있다고 추정되는 수치를 건드리는 방식이 아니라 그 문단의 실제 언어를 바꾸는 방식으로 작업합니다.
그 이유는 이 글 내내 짚어 온 것입니다. 분류기가 겹치는 세그먼트 전반에서 단어 확률 패턴을 읽는다면, 그 출력을 바꾸는 것은 대시보드의 수치를 움직이는 것이 아니라 그 세그먼트 안의 언어를 바꾸는 것입니다. 퍼플렉서티를 얼마나 낮췄다고 알려 주는 도구는 자기가 계산한 수치를 말하는 것이며, Turnitin이 계산한 수치를 말하는 것이 아닙니다. Turnitin이 만들어 내는 수치는 보고서의 백분율 하나뿐이고, 그 백분율은 세그먼트 수준 판정의 집계이며 퍼플렉서티 게이지의 눈금을 읽은 것이 아닙니다.
요금은 실제로 다시 작성된 단어에만 부과됩니다. 다시 쓴 텍스트에 대한 새 보고서에 여전히 표시된 부분이 남아 있으면, 그 보고서를 가져와 아직 표시되는 문단만 무료로 다시 실행하실 수 있습니다.
저희가 말씀드리지 않는 것은 다음 보고서에 무엇이 적힐지입니다. 저희 페이지에는 이 도구가 필요한 언어만 다시 쓰면서 의미, 구조, 용어, 인용, 레이아웃, 스타일을 보존하는 것을 목표로 한다고 적혀 있고, 이어서 복잡한 문서는 내려받은 뒤 검토하라고 되어 있습니다. 그 두 부분 모두 진심입니다.
자주 묻는 질문
Turnitin은 퍼플렉서티를 확인할까요? 이름 있는 지표로는 확인하지 않습니다. Turnitin의 FAQ는 자사 모델이 "not explicitly programmed to evaluate specific signals such as 'burstiness,' 'perplexity,' or other individual metrics sometimes referenced in public discussions," ("버스티니스"나 "퍼플렉서티", 또는 공개적인 논의에서 간혹 언급되는 다른 개별 지표를 평가하도록 명시적으로 프로그래밍되어 있지 않으며,) 라고 말하고, "it learns statistical patterns from our training data." (저희 훈련 데이터에서 통계적 패턴을 학습합니다.) 라고 덧붙입니다. 같은 페이지는 자사 분류기가 "trained to detect these differences in word probability," (단어 확률에서 이러한 차이를 감지하도록 훈련되었으며,) 라고도 말합니다. 그리고 퍼플렉서티는 단어 확률의 척도입니다. 즉 신호는 존재하지만, 독립된 점수로 계산되지는 않습니다.
Turnitin은 버스티니스를 확인할까요? 답은 같습니다. 문장 길이와 구조의 변화를 뜻하는 버스티니스는 Turnitin 모델의 이름 있는 지표가 아닙니다. 분류기가 훈련 과정에서 문장 변화와 관련된 패턴을 학습할 수는 있지만, 버스티니스 수치를 계산해 임계값과 대조하는 모듈은 없습니다.
그렇다면 통설이 완전히 틀린 것일까요? 완전히 틀린 것은 아닙니다. 그 바닥에 깔린 직관, 즉 AI 텍스트가 단어 선택과 문장 구조에서 사람의 텍스트보다 예측 가능하다는 직관은 방향이 옳습니다. 틀린 것은 Turnitin이 이름 있는 두 점수를 계산하고 그것을 근거로 글에 표시를 남긴다는 주장입니다. Turnitin은 그렇게 하지 않는다고 말하며, 대신 설명하는 메커니즘, 즉 겹치는 세그먼트를 읽는 트랜스포머 분류기는 약점도 다른 별개의 아키텍처입니다.
Turnitin이 그 지표들을 쓰지 않는다면, 무엇을 쓸까요? 텍스트의 겹치는 세그먼트를 읽고, 각 세그먼트에 AI가 생성했을 확률을 부여하며, 겹치는 창을 따라 그 점수들을 합치고, 문서 수준의 백분율로 집계하는 트랜스포머 기반 분류기입니다. 이 분류기는 사람 텍스트와 AI 텍스트의 단어 확률 패턴으로 훈련됩니다. 세그먼트 수준의 작동 방식은 AI 탐지기가 무엇을 측정하는지에서 더 자세히 다뤘습니다.
퍼플렉서티를 낮춘다고 주장하는 도구가 때때로 먹히는 이유는 무엇일까요? 계산된 퍼플렉서티 점수를 낮추는 언어 변화, 즉 덜 예측 가능한 단어를 쓰고 구조를 바꾸는 일은 단어 확률 분류기가 보는 것을 움직일 수 있는 변화이기도 하기 때문입니다. 그 도구는 엉뚱한 지표를 겨냥하지만, 그 과정에서 일부 편집이 우연히 옳은 신호를 바꾸는 것입니다. 이 어긋남은 시간이 지나면서 드러납니다. 분류기가 거듭될수록 도구의 목표 지표와 분류기의 실제 판정 경계 사이의 상관관계가 흐려지고, 도구는 자신을 전혀 바꾸지 않았는데도 효과를 잃습니다.
그렇다면 글을 덜 예측 가능하게 만들려는 노력을 멈춰야 할까요? 목표는 옳고 지표는 옳지 않다는 뜻입니다. 구조가 다양하고 흔한 패턴에 빠지지 않는 글은 분류기가 AI와 비슷하다고 학습한 것과 일치할 가능성이 낮습니다. 오류는 자신이 눈금이 있는 이름 있는 점수를 움직이고 있다고 생각하는 데 있습니다. 실제로 하고 있는 것은 분류기가 겹치는 창을 따라 읽는 언어를 바꾸는 일이며, 그것은 가치 있는 일이지만 통설이 말하는 것과는 다릅니다.
계속 읽기