Turnitin AI 탐지에서 "분석 대상 텍스트"란 무엇인가요? 자세한 설명
Turnitin이 AI 작성 비율을 알려줄 때, 그 숫자가 제출물 전체를 대상으로 하는 것은 아닙니다. 모델이 분석하는 것은 "분석 대상 텍스트", 즉 표준적인 문법으로 쓰인 산문 문장뿐입니다. 목록, 불릿 포인트, 문장 형태가 아닌 구조는 제외됩니다. 비율과 강조 표시된 부분이 어긋나 보이는 이유가 여기에 있습니다. 무엇이 대상이고 무엇이 아닌지, 그리고 왜 중요한지 문서의 설명을 정리했습니다.
HumanPen 팀
· 5분
"분석 대상 텍스트"의 의미
Turnitin의 AI 탐지 모델은 문서의 모든 단어를 분석하지는 않습니다. 모델이 다루는 것은 "분석 대상 텍스트"라고 하는 텍스트의 일부입니다. 문서에는 이 점이 분명히 나와 있습니다.
"This qualifying text includes only prose sentences, meaning that we only analyze blocks of text that are written in standard grammatical sentences and do not include other types of writing such as lists, bullet points (short non-sentence structures), or other non-sentence structures." (이 분석 대상 텍스트에는 산문 문장만 포함됩니다. 즉, 표준적인 문법의 문장으로 쓰인 텍스트 블록만 분석하며, 목록, 불릿 포인트(문장이 아닌 짧은 구조) 또는 문장이 아닌 기타 구조는 포함하지 않습니다.)
즉 모델이 찾는 것은 산문, 곧 표준적인 문법의 문장으로 정리된 텍스트 블록입니다. 이 기준에 미치지 못하는 것은 분석에서 빠집니다. 불릿 포인트, 번호를 매긴 목록, 완전한 문장이 아닌 표의 머리글, 그 밖의 산문이 아닌 구조는 AI 탐지 범위에서 제외됩니다.
모델 자체의 문서도 이 한계를 인정합니다. "The model does not reliably detect AI-generated text in the form of non-prose, or code, nor does it detect short-form/unconventional writing such as bullet points (short non-sentence structures)." (이 모델은 산문이 아닌 형태나 코드에 담긴 AI 생성 텍스트를 안정적으로 탐지하지 못하며, 불릿 포인트(문장이 아닌 짧은 구조)처럼 짧거나 관습에서 벗어난 형태의 글도 탐지하지 못합니다.)
목록이 많고 산문이 적은 문서에서는 AI 탐지 모델이 다룰 재료가 줄어들고, 보고되는 점수는 산문 부분만 반영합니다. 하한선도 있습니다. 파일 요건에서는 리포트가 아예 생성되기 전에 최소 300단어의 산문을 요구하는데, 이 부분은 Turnitin이 학위논문 전체를 검사할 수 있는지에서 다룹니다.
비율과 강조 표시의 차이
Turnitin AI 탐지 리포트에서 가장 혼란스러운 부분 가운데 하나는 비율과 강조 표시된 부분이 서로 다른 이야기를 하는 것처럼 보인다는 점입니다. 문서는 그 이유를 설명합니다.
"This means that a document containing several different writing types would result in a disparity between the percentage and the highlights." (이는 여러 가지 다른 유형의 글이 섞인 문서에서는 비율과 강조 표시 사이에 차이가 생긴다는 뜻입니다.)
"This percentage is not necessarily the percentage of the entire submission." (이 비율이 반드시 제출물 전체에 대한 비율인 것은 아닙니다.)
문서의 50%가 산문이고 50%가 불릿 포인트인데, AI 탐지 모델이 산문의 40%를 AI 생성으로 표시했다면 리포트에는 AI 점수 40%로 나타날 수 있습니다. 그러나 그 40%는 분석 대상인 산문에 대한 비율이며 문서 전체에 대한 비율이 아닙니다. 이 점을 모르고 리포트를 읽는 분은 제출물 전체의 40%가 AI 생성이라고 생각하실 수 있지만, 문서 전체에서 실제로 차지하는 비중은 그보다 낮습니다.
이 차이는 버그가 아닙니다. 모델의 범위에서 비롯된 결과입니다. 이를 이해하면 리포트를 정확하게 읽으실 수 있으며, Turnitin AI 작성 리포트를 읽는 방법에서 나머지 부분도 짚어 줍니다.
모델은 텍스트를 어떻게 처리할까요
분석 대상 텍스트가 왜 중요한지 이해하려면 모델이 그것으로 무엇을 하는지 알아두시면 도움이 됩니다. 문서는 그 방식을 이렇게 설명합니다.
"When a paper is submitted to Turnitin, sentences from the submission are extracted and segmented into overlapping sections for prediction analysis. Each segment is classified by the AI detection model and given a value between 0 and 1, denoting the probability of the text being likely human or AI-generated." (논문이 Turnitin에 제출되면 제출물에서 문장이 추출되어 예측 분석을 위해 서로 겹치는 구간으로 나뉩니다. 각 구간은 AI 탐지 모델이 분류하고, 그 텍스트를 사람이 썼을지 AI가 생성했을지를 나타내는 0에서 1 사이의 값을 받습니다.)
모델은 문장을 추출해 서로 겹치는 구간으로 나누고 각 구간을 분류합니다. 각 구간에는 0에서 1 사이의 확률 점수가 부여됩니다. 이 과정을 거치는 것은 분석 대상인 산문 문장뿐입니다. 산문이 아닌 내용은 나누어지지도, 점수를 받지도 않습니다. 모델이 그것을 분석 가능한 텍스트로 취급하지 않기 때문입니다.
그래서 "분석 대상 텍스트"의 범위가 비율이 무엇을 뜻하는지를 직접 결정합니다. 점수는 구간 단위의 확률 점수를 모은 것이며, 그 집계에 포함되는 것은 분석 대상인 산문 문장뿐입니다.
표는 포함, 참고문헌은 제외
특정한 두 가지 콘텐츠 유형에는 각자의 규칙이 있습니다.
표: "We are now able to process long-form prose text in tables." (이제 표 안의 긴 산문 텍스트를 처리할 수 있습니다.) 즉 표의 셀 안에 표준적인 문법의 문장으로 쓰인 산문이 있으면 이제 분석 대상 텍스트에 포함됩니다. 표가 있는 기존 제출물은 다시 제출해 재처리하세요. 표 안에 의미 있는 산문이 있고 이 업데이트 이전에 제출된 문서라면, 다시 제출하기 전까지는 AI 점수에 표의 내용이 반영되지 않을 수 있습니다.
참고문헌: "We have fixed a bug that was occasionally highlighting AI writing within references listed in a bibliography. Bibliographies are now excluded when processing the AI writing report." (참고문헌 목록에 실린 참고문헌 안의 AI 작성 부분이 간혹 강조 표시되던 버그를 수정했습니다. AI 작성 리포트를 처리할 때 참고문헌은 이제 제외됩니다.) 강조 표시된 참고문헌 부분이 있는 기존 제출물은 다시 제출해 재처리하세요. 이전 리포트에서 참고문헌 목록 안이 지적되었다면 그것은 버그였으며, 다시 제출하면 그 부분은 분석에서 제외됩니다. Turnitin이 내 참고문헌과 인용을 지적하는 이유에서는 유사도 쪽에서 제외 범위가 어디까지인지 다룹니다.
이 두 규칙은 분석 대상 텍스트의 정의가 고정되어 있지 않다는 뜻입니다. 표 안의 산문을 포함하고 참고문헌을 제외하도록 다듬어졌는데, 이것이 텍스트를 바꾸지 않아도 재제출 시 Turnitin AI 점수가 달라질 수 있는 이유 가운데 하나입니다.
분석 대상 산문에서의 오탐
분석 대상인 산문 안에서도 어떤 종류의 글은 오탐이 더 잘 일어납니다. 문서는 구체적인 패턴을 짚어 줍니다.
"Sometimes false positives (incorrectly flagging human-written text as AI-generated), can include content without a lot of structural variation, text that literally repeats itself, or text that has been paraphrased without developing new ideas." (간혹 오탐(사람이 쓴 텍스트를 잘못해 AI 생성으로 표시하는 것)에는 구조적 변화가 거의 없는 내용, 말 그대로 반복되는 텍스트, 새로운 생각을 전개하지 않고 바꿔 쓴 텍스트가 포함될 수 있습니다.)
"If our indicator shows a higher amount of AI writing in such text, we advise you to take that into consideration when looking at the percentage indicated." (이런 텍스트에서 AI 작성 비율이 높게 나타난다면, 표시된 비율을 보실 때 그 점을 고려하시기를 권합니다.)
즉 산문이 구조적으로 단조롭거나, 같은 표현을 반복하거나, 새로운 아이디어를 더하지 않고 바꿔 쓴 것이라면, 사람이 쓰셨더라도 모델이 AI 생성으로 표시할 수 있습니다. 이는 분석 대상 텍스트 필터의 실패가 아니라, AI 탐지기가 무엇을 측정하는지가 훈련된 그대로 작동한 결과입니다. 분석 대상이 되는 산문 안에 있는 별개의 문제입니다.
이것이 여러분에게 뜻하는 것
자신의 Turnitin AI 리포트가 왜 이런 모습인지 이해하고 싶으시다면, 요약은 다음과 같습니다.
- 산문 문장만 대상입니다. 목록, 불릿 포인트, 문장 형태가 아닌 구조는 분석에서 제외됩니다. 모델은 표준적인 문법의 문장에 집중합니다.
- 비율은 분석 대상 산문만 다룹니다. 제출물 전체에 대한 비율이 아닙니다. 그래서 숫자와 강조 표시 사이에 차이가 생깁니다.
- 표 안의 산문도 이제 처리됩니다. 표 안의 긴 산문은 분석 대상 텍스트로 취급됩니다. 표가 있는 기존 제출물은 다시 제출해 재처리하세요.
- 참고문헌은 제외됩니다. 참고문헌을 지적하던 버그가 수정되었습니다. 강조 표시된 참고문헌 부분이 있는 기존 제출물은 다시 제출해 재처리하세요.
- 오탐을 조심하세요. 구조적으로 평평하거나 반복적이거나 바꿔 쓴 산문은 지적될 가능성이 더 큽니다. 비율을 읽으실 때 이 점을 고려하세요.
조건을 충족하는 부분은 무료로 다시 실행하실 수 있습니다.
계속 읽기