짧은 문서에서 Turnitin AI 점수는 얼마나 정확할까요?

글이 몇백 단어에 불과하다면, Turnitin AI 점수는 긴 에세이에서와는 다르게 작동합니다. Turnitin 자체도 짧은 문서에서는 검토 대상이 단일 세그먼트 하나뿐이라 예측이 대체로 "all or nothing" (전부 아니면 전무)이 된다고 밝힙니다. 300단어 미만에서는 점수 자체가 나오지 않습니다. 파일 요건이 그 하한선을 정하고 있습니다. 이 글에서는 공식 입장과, 혼합된 내용이 왜 전부 AI 생성으로 보일 수 있는지, 그리고 짧은 문서의 점수를 과잉 반응 없이 읽는 법을 살펴봅니다.

HumanPen 팀

· 4분

짧은 제출물에 대해 Turnitin이 밝힌 내용

짧은 문서에 대한 Turnitin 자체의 표현은 분명합니다. "In shorter documents where there are only a few hundred words, the prediction will be mostly 'all or nothing' because we're predicting on a single segment without the opportunity to overlap." (수백 단어뿐인 짧은 문서에서는 겹칠 기회 없이 단일 세그먼트를 대상으로 예측하기 때문에, 예측은 대체로 'all or nothing', 즉 전부 아니면 전무가 됩니다.)

이 문장은 Turnitin의 AI 작성 탐지 FAQ에서 나온 것입니다. 텍스트가 충분하지 않을 때 예측이 어떻게 되는지를 설명합니다. 모델은 애매하게 물러서지 않고 하나로 결론을 내립니다. 짧은 글은 문장 단위가 아니라 전체로서 판단되는 경향이 있습니다.

이 점이 중요한 이유는, AI 점수에 대해 사람들이 전제하는 대부분이 긴 에세이에서 비롯되었기 때문입니다. 문서가 길면 탐지기는 여러 세그먼트에 걸쳐 작동하고, 비율은 혼합 상태를 반영할 수 있습니다. 문서가 짧으면 그러한 미묘한 차이가 들어갈 자리가 거의 없습니다.

왜 전부 아니면 전무로 나오는가

이유는 작동 방식에 있습니다. Turnitin은 이렇게 설명합니다. "sentences from the submission are extracted and segmented into overlapping sections for prediction analysis. Each segment is classified by the AI detection model and given a value between 0 and 1, denoting the probability of the text being likely human or AI-generated." (제출물의 문장은 추출되어 예측 분석을 위해 서로 겹치는 세그먼트로 나뉩니다. 각 세그먼트는 AI 탐지 모델에 의해 분류되고, 해당 텍스트가 사람이 쓴 것인지 AI가 쓴 것인지의 확률을 나타내는 0에서 1 사이의 값을 받습니다.)

긴 글에서는 이렇게 겹치는 세그먼트 덕분에 모델이 같은 문장을 여러 각도에서 살펴볼 기회를 많이 얻습니다. 문장 점수는 모인 뒤 문서 점수로 집계되며, 그 과정에서 결과가 완만해집니다. 이 집계는 Turnitin AI 탐지가 무엇을 확인하고 점수가 어떻게 만들어지는지에서 설명한 것과 같습니다.

몇백 단어뿐이라면 사실상 세그먼트가 하나입니다. 겹침도 없고, 여러 관점을 모을 수도 없습니다. 문서 점수는 한 번의 분류 결과를 그대로 물려받기 때문에, 예측은 그 중간 어딘가가 아니라 "전부" 또는 "전무"에 가깝게 나옵니다.

혼합된 내용이 전부 AI 생성으로 채점될 수 있습니다

그 결과는 Turnitin의 다음 문장에 분명히 적혀 있습니다. "This means that some text that is a mix of AI-generated and original content could be flagged as entirely AI-generated." (즉, AI가 생성한 내용과 직접 쓴 내용이 섞인 텍스트의 일부가 전부 AI 생성으로 표시될 수 있다는 뜻입니다.)

따라서 짧은 글에서는, 대부분 직접 쓴 페이지에 AI가 만든 문단이 하나 섞여 있어도 전체가 AI가 쓴 것처럼 채점될 수 있습니다. 모델에는 둘을 구분할 만큼 충분한 세그먼트가 없습니다. 문서의 모든 부분이 생성되었다고 말하는 것이 아니라, 예측이 하나의 판단으로 수렴해 버렸다고 말하는 것입니다. Turnitin AI 점수가 100%여도 사람이 쓴 글일 수 있는 경로 가운데 하나가 바로 이것입니다.

그래서 실제 AI 텍스트 비율이 같은 짧은 글 두 편이 전혀 다르게 보일 수 있습니다. 점수는 문서 중 얼마가 AI에 의한 것인지를 정밀하게 재는 수치가 아닙니다. 제한된 자료를 바탕으로 한 예측일 뿐입니다.

300단어 미만에서는 읽을 점수가 없습니다

여기서 사람들이 자주 인용하는 문장이 하나 있는데, 어디에서 나온 것인지가 중요합니다. Turnitin은 2023년 12월 15일 자 릴리스 노트에서 이렇게 적었습니다. "our accuracy increases with a little more text so submissions that contain less than 300 words may result in an AI writing score that is likely less accurate." (텍스트가 조금 더 많아지면 정확도가 높아지므로, 300단어 미만의 제출물은 정확도가 떨어질 가능성이 있는 AI 작성 점수가 나올 수 있습니다.) 이 노트의 제목은 "AI writing detection processing bug fix,"(AI 작성 탐지 처리 버그 수정)이고, 그 문장 위의 단락에는 "This issue has now been resolved," (이 문제는 이제 해결되었습니다)라고 적혀 있습니다. 버그란 300단어 미만 제출물이 아예 처리되고 있었다는 것이었습니다. 이 문장이 설명하는 것은 2023년 12월 6일부터 15일 사이에 생성된 보고서입니다.

그래서 오늘날 이 문장을 그대로 적용하기는 어렵습니다. 버그가 수정된 지금, 산문이 300단어 미만인 제출물에 정확도가 떨어지는 점수가 부여되지는 않습니다. 점수 자체가 부여되지 않습니다. 현재 파일 요건은 파일이 "must have at least 300 words of prose text in a long-form writing format," (장문 형식의 산문 텍스트가 최소 300단어는 있어야 함)이라고 규정합니다. 따라서 그 하한선 아래에서 신뢰할 수 없는 비율을 각오하고 계시다면, 실제로 보시게 되는 것은 AI Writing Report가 없다는 결과입니다. 제출물의 어디까지가 텍스트로 인정되는지는 별개의 문제로, Turnitin AI 탐지에서 인정되는 텍스트란 무엇인지에서 다룹니다.

매우 짧은 제출물을 보고 계시다면, 보고서의 숫자는 측정값이 아니라 대략적인 지표로 다루셔야 합니다.

짧은 문서의 점수를 읽는 법

AI 점수를 읽는 사람을 위한 Turnitin의 안내는 문서가 길든 짧든 동일합니다. "the percentage on the AI writing indicator should not be used as the sole basis for action or a definitive grading measure by instructors." (AI 작성 지표의 비율은 조치를 취하는 유일한 근거나, 교수자가 사용하는 확정적인 채점 기준으로 쓰여서는 안 됩니다.)

짧은 문서에서는 이 점이 더욱 중요합니다. 점수가 전부 아니면 전무인 데다 정확도도 낮기 때문입니다. 짧은 문서 점수에 강하게 대응하는 것은, 대략적인 예측을 측정된 사실처럼 다루는 셈입니다. Turnitin은 또한 점수가 "is not meant to provide definitive answers in isolation," (단독으로 확정적인 답을 제공하기 위한 것이 아님)라고 밝히며, 이를 읽는 사람은 그 숫자를 학생과 그 과제에 대한 개인적인 이해와 균형 있게 고려해야 한다고 합니다. 교수자용 페이지는 한발 더 나아가 AI 비율이 높을 때 교수자가 하도록 안내받는 일을 제시합니다.

실질적인 해석은 간단합니다. 짧은 글에서 점수가 낮다면 확인해 볼 만합니다. 점수가 높을 때도 마찬가지로, 누군가 그것을 글 전체에 대한 판결로 다루기 전에 확인해 볼 만합니다.

계속 읽기