성찰 보고서가 AI로 표시될까요? Turnitin의 오탐지를 풀어 봅니다
성찰 보고서는 개인의 목소리와 정형화된 구조가 만나는 지점에 있습니다. Turnitin 자체 문서에는 오탐지를 유발하는 텍스트 유형이 설명되어 있는데, 성찰 보고서는 그 설명 가운데 여러 가지에 해당합니다. 분량이 짧은 성찰 보고서는 전부 아니면 전무 식의 점수 문제까지 겪습니다. 이 글에서는 문서가 실제로 무엇이라고 말하는지, 그리고 그 점수를 어떻게 다루면 좋을지를 다룹니다.
HumanPen 팀
· 5분
성찰 보고서가 의심을 받는 이유
성찰 보고서는 학생에게 자신의 경험을 쓰게 하지만, 구조는 반복되기 쉽습니다. 경험을 소개하고, 일어난 일을 서술하고, 깨달음을 정리합니다. 성찰이라는 형식 탓에 문장 패턴은 학생이 달라도 서로 비슷해집니다. Turnitin 문서에는 오탐지를 만들어내는 텍스트 유형이 이렇게 나와 있습니다:
"Sometimes false positives (incorrectly flagging human-written text as AI-generated), can include content without a lot of structural variation, text that literally repeats itself, or text that has been paraphrased without developing new ideas." (때때로 오탐지, 즉 사람이 쓴 텍스트를 AI 생성으로 잘못 표시하는 경우에는 구조적 변화가 거의 없는 내용, 말 그대로 반복되는 텍스트, 또는 새로운 생각으로 발전시키지 않고 바꿔 쓴 텍스트가 포함될 수 있습니다.)
다음 문장입니다: "If our indicator shows a higher amount of AI writing in such text, we advise you to take that into consideration when looking at the percentage indicated." (이런 텍스트에서 AI 작성 비중이 더 높게 나타난다면, 제시된 퍼센트를 확인하실 때 그 점을 고려하시기를 권합니다.)
성찰 보고서에는 이 세 가지 특징이 모두 나타나는 경우가 많습니다. 성찰이라는 형식이 예측 가능한 흐름을 따르기 때문에 구조적 변화가 적습니다. 성장과 도전, 배움을 설명하는 어휘가 학생마다 비슷하기 때문에 표현이 반복됩니다. 강의 자료의 내용을 새로운 논거로 발전시키지는 않은 채 바꿔 쓰는 일도 있습니다. 이것이 그 텍스트가 AI로 생성되었다는 뜻은 아닙니다. Turnitin 스스로 오탐지를 일으킬 수 있다고 밝힌 텍스트의 유형에 이 글이 들어맞는다는 뜻이며, 이는 AI 탐지기가 무엇을 측정하는지를 알고 나면 훨씬 잘 보입니다.
탐지기가 여러분의 텍스트를 처리하는 방식
성찰 보고서가 높은 점수를 받는 이유를 이해하려면 탐지기가 어떻게 작동하는지 살펴봐야 합니다:
"When a paper is submitted to Turnitin, sentences from the submission are extracted and segmented into overlapping sections for prediction analysis. Each segment is classified by the AI detection model and given a value between 0 and 1, denoting the probability of the text being likely human or AI-generated. Each qualifying sentence within these segments inherits the segment's score. Since segments overlap, some sentences may have multiple scores, which are then pooled into a single score. These sentence scores are further aggregated and used to compute the overall document AI writing score." (논문이 Turnitin에 제출되면 제출물에서 문장이 추출되어 예측 분석을 위해 서로 겹치는 구간으로 분할됩니다. 각 구간은 AI 탐지 모델이 분류하고 0과 1 사이의 값을 부여받으며, 이 값은 해당 텍스트가 사람이 쓴 것인지 AI가 생성한 것인지의 확률을 나타냅니다. 이 구간에 속한 각 적격 문장은 구간의 점수를 물려받습니다. 구간이 겹치기 때문에 어떤 문장은 여러 개의 점수를 가질 수 있고, 이 점수들은 하나로 합쳐집니다. 이 문장 점수들은 다시 집계되어 문서 전체의 AI 작성 점수를 계산하는 데 사용됩니다.)
각 문장은 확률 점수를 받습니다. 이 점수들은 합쳐지고 집계되어 문서 단위의 단일 퍼센트가 됩니다. 문장 패턴이 처음부터 끝까지 고르게 비슷한 성찰 보고서는 모든 구간에서 높은 점수를 받을 수 있고, 그 점수들이 누적되어 전체 퍼센트가 높아집니다.
탐지기가 실제로 분석하는 대상
탐지기는 제출물의 모든 단어를 처리하지 않습니다. 적격 텍스트만 처리합니다:
"The model does not reliably detect AI-generated text in the form of non-prose, or code, nor does it detect short-form/unconventional writing such as bullet points (short non-sentence structures)." (이 모델은 산문이 아닌 형태나 코드 형태의 AI 생성 텍스트를 안정적으로 탐지하지 못하며, 글머리 기호(문장이 아닌 짧은 구조)와 같은 짧거나 비표준적인 글쓰기도 탐지하지 못합니다.)
다음 문장입니다: "This means that a document containing several different writing types would result in a disparity between the percentage and the highlights." (이는 여러 가지 글쓰기 유형이 섞인 문서에서는 퍼센트와 강조 표시 사이에 차이가 생길 수 있다는 뜻입니다.)
같은 문서는 무엇이 여기에 해당하는지도 분명히 밝힙니다:
"This qualifying text includes only prose sentences, meaning that we only analyze blocks of text that are written in standard grammatical sentences and do not include other types of writing such as lists, bullet points (short non-sentence structures), or other non-sentence structures." (이 적격 텍스트에는 산문 문장만 포함됩니다. 즉, 표준적인 문법을 갖춘 문장으로 쓰인 텍스트 블록만 분석하며, 목록이나 글머리 기호(문장이 아닌 짧은 구조), 그 밖에 문장이 아닌 구조와 같은 다른 유형의 글쓰기는 포함하지 않습니다.)
다음 문장입니다: "This percentage is not necessarily the percentage of the entire submission." (이 퍼센트가 반드시 제출물 전체의 퍼센트인 것은 아닙니다.)
성찰 보고서는 대부분이 산문 문장이므로 적격 텍스트가 문서의 거의 전부를 차지합니다. 따라서 차이 문제는 형식이 섞인 문서에서보다 덜 걱정해도 됩니다. 여러분이 보시는 퍼센트는 실제로 분석된 산문의 퍼센트에 가깝습니다.
짧은 문서의 문제
성찰 보고서는 분량이 짧은 경우가 많습니다. 500단어짜리 성찰문은 흔하며, 문서는 바로 이 상황을 두고 경고합니다:
"In shorter documents where there are only a few hundred words, the prediction will be mostly 'all or nothing' because we're predicting on a single segment without the opportunity to overlap." (불과 수백 단어뿐인 짧은 문서에서는 예측이 대체로 전부 아니면 전무로 나옵니다. 겹칠 기회 없이 단일 구간만을 두고 예측하기 때문입니다.)
다음 문장입니다: "This means that some text that is a mix of AI-generated and original content could be flagged as entirely AI-generated." (이는 AI 생성 내용과 직접 쓴 내용이 섞인 일부 텍스트가 전부 AI 생성으로 표시될 수 있다는 뜻입니다.)
짧은 성찰 보고서에서는 탐지기가 점수를 매길 구간이 하나뿐일 수 있습니다. 예측을 부드럽게 만들어 줄 겹침이 없습니다. 그 단일 구간이 높은 점수를 받으면 보고서 전체가 표시됩니다. 일부는 직접 쓰고 일부는 초안 작성의 도움을 받은 문서가 100% AI 생성으로 보고될 수 있으며, 이는 Turnitin이 여러분의 과제를 100% AI라고 말하는 이유로 이어지는 경로 가운데 하나입니다. 분량이 짧으면 긴 문서가 누리는 평균화 효과가 사라집니다.
점수를 유일한 근거로 삼지 마십시오
Turnitin 문서는 점수를 어떻게 사용해야 하고 어떻게 사용하지 말아야 하는지를 분명히 밝힙니다:
"Our AI writing detection model may not always be accurate (it may misidentify human-written, AI-generated, and AI-paraphrased text), so it should not be used as the sole basis for adverse actions against a student." (당사의 AI 작성 탐지 모델이 항상 정확한 것은 아닙니다. 사람이 쓴 텍스트, AI가 생성한 텍스트, AI가 바꿔 쓴 텍스트를 잘못 판별할 수 있으므로, 학생에게 불리한 조치의 유일한 근거로 사용되어서는 안 됩니다.)
다음 문장입니다: "It takes further scrutiny and human judgment in conjunction with an organization's application of its specific academic policies to determine whether academic misconduct has occurred." (학업 부정행위가 있었는지를 판단하려면 추가적인 검토와 사람의 판단이 필요하며, 기관이 자체 학업 정책을 적용하는 과정과 함께 이루어져야 합니다.)
별도의 Turnitin 자료도 같은 입장을 분명히 합니다:
"It is not meant to provide definitive answers in isolation. More important than any tool is the educator who sees the score and makes decisions balancing this information with their personal knowledge of their students, their work, and institutional policy." (이 점수는 단독으로 확정적인 답을 내려 주기 위한 것이 아닙니다. 어떤 도구보다 중요한 것은 점수를 보고, 이 정보를 학생과 학생의 과제, 그리고 기관 정책에 대한 개인적인 이해와 균형 있게 저울질하여 판단하는 교육자입니다.)
다음 문장입니다: "When educators look at the AI writing score and utilize it as a single data point rather than a definitive response, then it is being used as intended." (교육자가 AI 작성 점수를 확정적인 답이 아닌 하나의 데이터 포인트로 보고 활용할 때, 이 점수는 의도된 대로 사용되고 있습니다.)
성찰 보고서가 높은 AI 점수를 받았다면, 그 점수는 하나의 데이터 포인트입니다. 증거가 아닙니다. 문서에는 모델이 텍스트를 잘못 판별할 수 있다고 나와 있고, 기관 정책과 함께 사람의 판단을 요구합니다. 그 점수에 대해 해명해야 하는 사람이 여러분이라면, 표시되었지만 직접 쓴 글에서 그 답변을 어떻게 준비하는지 다룹니다.
이것이 여러분에게 의미하는 바
지금까지 살펴본 내용을 정리하면 다음과 같습니다:
- 성찰 보고서는 Turnitin 문서에 설명된 오탐지 패턴 여러 가지에 해당합니다. 구조적 변화가 적고, 표현이 반복되며, 생각을 새로운 논거로 발전시키지 않은 채 바꿔 쓴 형태입니다.
- Turnitin은 이렇게 권고합니다: "If our indicator shows a higher amount of AI writing in such text, we advise you to take that into consideration when looking at the percentage indicated." (이런 텍스트에서 AI 작성 비중이 더 높게 나타난다면, 제시된 퍼센트를 확인하실 때 그 점을 고려하시기를 권합니다.)
- 탐지기는 텍스트를 구간으로 나누고 각 구간에 점수를 매깁니다. 짧은 보고서는 구간이 하나뿐일 수 있어서, 전부 아니면 전무의 결과가 나옵니다.
- 분량이 짧은 성찰 보고서(수백 단어)는 이분법적 점수를 받을 위험이 가장 큽니다.
- 점수는 불리한 조치의 유일한 근거로 사용되어서는 안 됩니다. 사람의 판단이 필요한 하나의 데이터 포인트입니다.
성찰 보고서에 대한 Turnitin AI 리포트를 받았고 표시된 문단을 다듬고 싶으시다면, 리포트를 가져와 작업하십시오. 조건에 맞는 문단은 무료로 다시 실행할 수 있습니다.
계속 읽기