에세이 구조가 Turnitin AI 점수에 미치는 영향
에세이를 어떻게 구성하느냐에 따라 AI 점수가 달라질 수 있습니다. Turnitin의 FAQ는 구조적 변화가 거의 없는 글, 말 그대로 반복되는 글, 새로운 생각 없이 바꿔 쓴 글을 오탐지가 발생하기 쉬운 사례로 꼽습니다. 2023년 릴리스 노트에는 문서의 첫 문장과 마지막 문장이 잘못 표시될 가능성이 더 높다는 패턴이 적혀 있습니다. 다음은 문서에 실제로 적혀 있는 내용입니다.
HumanPen 팀
· 5분
짧게 답하면
에세이 구조가 Turnitin AI 점수에 영향을 줄 수 있는 이유는, FAQ가 오탐지를 만들어내는 구조적 특징을 분명히 열거하고 있기 때문입니다. 여기에는 "content without a lot of structural variation, text that literally repeats itself, or text that has been paraphrased without developing new ideas." (구조적 변화가 거의 없는 내용, 말 그대로 반복되는 글, 또는 새로운 생각을 전개하지 않고 바꿔 쓴 글)이 포함됩니다. FAQ는 교수자에게 그러한 글에 대해서는 "take that into consideration when looking at the percentage indicated" (표시된 비율을 볼 때 이 점을 함께 고려하라는 것)을 권고합니다. 2023년 5월 릴리스 노트에도 문서의 첫 문장과 마지막 문장에서 오탐지 발생률이 더 높았던 패턴이 적혀 있는데, 그 원인은 대개 "introduction or conclusion content written in a generic way." (상투적으로 작성된 서론이나 결론의 내용)이었습니다. 탐지 로직은 이를 줄이기 위해 변경되었지만, 상투적인 서론과 결론이라는 근본적인 구조 패턴은 남아 있습니다. 문장의 리듬이 고르거나 표현이 반복되거나 서론과 결론이 틀에 박힌 형태라면, 내용이 전부 본인의 것이라 하더라도 이러한 특징이 점수를 높이는 데 작용할 수 있습니다.
구조적 변화와 오탐지
FAQ는 오탐지를 잘 만들어내는 특정한 글의 특징을 다음과 같이 짚습니다.
"Sometimes false positives (incorrectly flagging human-written text as AI-generated), can include content without a lot of structural variation, text that literally repeats itself, or text that has been paraphrased without developing new ideas." (때때로 오탐지(사람이 쓴 글을 AI 생성 글로 잘못 표시하는 것)에는 구조적 변화가 거의 없는 내용, 말 그대로 반복되는 글, 또는 새로운 생각을 전개하지 않고 바꿔 쓴 글이 포함될 수 있습니다.)
다음 문장입니다. "If our indicator shows a higher amount of AI writing in such text, we advise you to take that into consideration when looking at the percentage indicated." (그러한 글에서 AI 작성 비율이 더 높게 나타난다면, 표시된 비율을 볼 때 이 점을 함께 고려하실 것을 권합니다.)
이는 FAQ 자체도 사람이 쓴 글의 특정한 구조 패턴이 더 높은 AI 점수를 유발할 수 있음을 인정한다는 뜻입니다. 모든 단락이 같은 구조를 따르고, 문장의 길이와 리듬이 비슷하며, 강조를 위해 핵심 표현이 반복되는 에세이는 이런 오탐지 유형에 들어맞을 수 있습니다. 공식 지침은 그러한 글에 대해서는 비율을 확정적인 것으로 다루지 말라고 합니다. AI 탐지기가 잘 쓴 에세이를 표시하는 이유는 같은 관찰을 글의 질이라는 측면에서 본 것입니다.
모델이 글을 평가하는 방식
탐지 모델은 대상이 되는 산문을 겹치는 구간으로 나누어 처리합니다.
"When a paper is submitted to Turnitin, sentences from the submission are extracted and segmented into overlapping sections for prediction analysis. Each segment is classified by the AI detection model and given a value between 0 and 1, denoting the probability of the text being likely human or AI-generated." (논문이 Turnitin에 제출되면 제출물에서 문장이 추출되어 예측 분석을 위해 겹치는 구간으로 분할됩니다. 각 구간은 AI 탐지 모델이 분류하고 0과 1 사이의 값을 받으며, 이는 해당 글이 사람이 쓴 것일 확률 또는 AI가 생성한 것일 확률을 나타냅니다.)
모델은 burstiness나 perplexity라는 이름의 지표를 평가하도록 만들어져 있지 않습니다. "Our model is not explicitly programmed to evaluate specific signals such as 'burstiness,' 'perplexity,' or other individual metrics sometimes referenced in public discussions." (당사 모델은 'burstiness', 'perplexity', 또는 공개적인 논의에서 간혹 언급되는 다른 개별 지표 같은 특정 신호를 평가하도록 명시적으로 프로그래밍되어 있지 않습니다.) 다음 문장입니다. "Instead, it learns statistical patterns from our training data." (대신, 학습 데이터에서 통계적 패턴을 학습합니다.) 같은 FAQ는 이렇게도 밝힙니다. "Our classifiers are trained to detect these differences in word probability and are adept at the particular word probability sequences of human writers." (당사 분류기는 단어 확률의 이러한 차이를 감지하도록 학습되어 있으며, 사람이 쓴 글에 나타나는 특유의 단어 확률 배열에 능합니다.) 즉 모델은 표면적인 지표가 아니라 단어 확률 패턴을 평가하지만, 문장 구조가 고르다면 모델이 AI 생성 글과 연관 짓는 패턴이 만들어질 수 있습니다. AI 탐지기가 perplexity와 burstiness 외에 무엇을 보는지에 더 자세한 설명이 있습니다.
서론과 결론
2023년 5월 릴리스 노트에는 출시 이후 관찰된 패턴이 적혀 있습니다.
"Since launch, we have observed a higher incidence of false positive detection in the first few or last few sentences of a document. Many times these sentences consist of introduction or conclusion content written in a generic way." (출시 이후, 문서의 처음 몇 문장이나 마지막 몇 문장에서 오탐지가 더 자주 발생하는 것을 확인했습니다. 이러한 문장은 상당수가 상투적으로 작성된 서론이나 결론의 내용으로 이루어져 있습니다.)
다음 문장입니다. "As a result, we have changed our detection logic to help reduce these false positives." (그 결과, 당사는 이러한 오탐지를 줄이기 위해 탐지 로직을 변경했습니다.)
이는 2023년의 개선이었으며 현재의 결함이 아닙니다. 해당 위치의 오탐지를 줄이도록 탐지 로직이 업데이트되었습니다. 그렇지만 근본적인 패턴은 남아 있습니다. 서론과 결론은 AI 출력물과 닮을 수 있는 상투적이고 틀에 박힌 표현을 쓰기 쉽습니다. 에세이를 폭넓은 주장으로 시작해 핵심 내용을 되풀이하는 요약으로 마무리한다면, 그 부분은 본문 단락보다 여전히 오탐지에 취약할 수 있습니다.
짧은 에세이와 전부 아니면 전무한 예측
FAQ는 짧은 문서가 탐지 모델에서 어떻게 작동하는지 설명합니다.
"In shorter documents where there are only a few hundred words, the prediction will be mostly 'all or nothing' because we're predicting on a single segment without the opportunity to overlap." (단어가 몇 백 개뿐인 짧은 문서에서는 겹칠 기회 없이 단일 구간에 대해 예측하기 때문에, 예측은 대체로 'all or nothing' (전부 아니면 전무)이 됩니다.)
다음 문장입니다. "This means that some text that is a mix of AI-generated and original content could be flagged as entirely AI-generated." (이는 AI가 생성한 내용과 원본 내용이 섞인 글의 일부가 전적으로 AI가 생성한 것으로 표시될 수 있음을 의미합니다.)
짧은 에세이가 이 문제를 겪는 이유는 모델이 평가할 구간이 적기 때문입니다. 개별 예측 오차를 완화해 줄 겹치는 구간이 없으면 점수는 이분법적으로 됩니다. 구조가 균일한 서론을 갖춘 500단어 분량의 에세이는 실제로 섞여 있는 사람의 글과 AI 글의 비율을 반영하지 못하는 극단적인 점수를 받을 수 있습니다.
비율이 유일한 근거는 아닙니다
FAQ는 점수를 확정적인 것으로 다루어서는 안 된다고 강조합니다.
"Hence, we must emphasize that the percentage on the AI writing indicator should not be used as the sole basis for action or a definitive grading measure by instructors." (그러므로 AI 작성 지표의 비율은 조치를 위한 유일한 근거로, 또는 교수자의 확정적인 채점 기준으로 사용되어서는 안 된다는 점을 반드시 강조합니다.)
이 점은 에세이 구조와도 관련이 있습니다. 구조가 균일한 글은 점수를 부풀릴 수 있기 때문입니다. 에세이가 FAQ에 설명된 오탐지 취약 특징에 해당한다면, 비율이 실제 AI 관여도를 과장할 수 있습니다. 문서 자체의 지침도 점수를 단독 판정이 아니라 다른 근거와 함께 살펴보라고 합니다. 그래도 글의 구성을 바꿀지는 별개의 판단입니다. 표시를 피하려고 글쓰기 방식을 바꿔야 할까.
독자에게 주는 의미
지금까지 살펴본 내용을 정리하면 다음과 같습니다.
- FAQ는 구조적 변화가 적음, 말 그대로의 반복, 새로운 생각 없는 바꿔 쓰기를 오탐지를 부르는 특징으로 꼽습니다.
- 교수자에게는 그러한 글의 비율을 "take into consideration" (함께 고려)하도록 권고합니다.
- 2023년 릴리스 노트는 첫 문장과 마지막 문장에 집중된 오탐지를 설명했으며, 대개 상투적인 서론이나 결론의 내용이었습니다.
- 탐지 로직은 이를 줄이도록 업데이트되었지만 구조적 패턴은 남아 있습니다.
- 짧은 에세이는 단일 구간 평가 때문에 전부 아니면 전무한 예측을 받습니다.
- FAQ는 비율을 조치를 위한 유일한 근거로 사용해서는 안 된다고 말합니다.
Turnitin AI 보고서를 받고 표시된 부분을 손질하고 싶다면 보고서를 가져와 작업하십시오. 대상이 되는 부분은 무료로 다시 실행할 수 있습니다.
계속 읽기