AI 탐지를 피하려고 일부러 글을 망치는 학생들. 결과는 정반대입니다.
r/Professors에 올라온 Reddit 스레드가 690개의 추천을 받으며 하나의 확산 추세를 보여 줍니다. 학생들이 AI 탐지기를 피하려고 자기 글의 수준을 스스로 떨어뜨리고 있다는 것입니다. 아이러니한 점은 이 전략이 그들이 의도한 것과 정반대의 결과를 낼 수 있다는 것입니다.
HumanPen 팀
· 6분
짧게 답하면: 글을 못 쓰게 만들수록 오탐 패턴에 딱 들어맞습니다
최근 Reddit 커뮤니티 r/Professors에 올라온 글이 690개의 추천을 받았고, 그 글에서 시작된 논의는 저희가 우려하는 흐름을 그대로 드러냅니다. 학생들은 AI 탐지 도구에 걸리지 않으려고 일부러 글을 더 못 쓰고 있습니다. 어휘를 단순하게 만들고, 문장을 짧게 하고, 에세이에서 구조를 걷어내고 있습니다.
아이러니는 분명합니다. Turnitin의 자체 문서에 따르면 AI가 쓴 글이라고 잘못 표시되기 쉬운 글은 구조적 변화가 적고, 반복이 있고, 새로운 생각 없이 바꿔 쓴 글이라고 합니다. 다시 말해 학생들이 “AI처럼 보이지 않으려고” 택하는 문체가 바로 탐지기가 어렵다고 스스로 밝힌 문체입니다. 글을 못 쓰게 만든다고 탐지를 피할 수 있는 것은 아닙니다. 오히려 잘못 표시되는 글의 특징에 자기 글을 맞춰 넣는 셈이 됩니다. 같은 질문을 넓게 다룬 AI 플래그를 피하려고 글쓰기 방식을 바꿔야 할지도 같은 이유로 같은 답에 이릅니다.
오탐에 대해 Turnitin이 밝힌 내용
Turnitin의 AI 작성 탐지 FAQ 페이지는 이 도구가 어디에서 오탐을 내는지에 대해 드물게 솔직하게 서술합니다. 문서는 이렇게 밝힙니다. “Sometimes false positives (incorrectly flagging human-written text as AI-generated), can include content without a lot of structural variation, text that literally repeats itself, or text that has been paraphrased without developing new ideas.” (간혹 오탐, 즉 사람이 쓴 글을 AI가 생성한 글로 잘못 표시하는 일은 구조적 변화가 거의 없는 내용, 말 그대로 자기를 반복하는 글, 또는 새로운 생각을 전개하지 않고 바꿔 쓴 글에서도 일어날 수 있습니다.) 다음 문장은 이렇게 덧붙입니다. “If our indicator shows a higher amount of AI writing in such text, we advise you to take that into consideration when looking at the percentage indicated.” (그러한 글에서 AI 작성 비중이 높게 나타난다면, 표시된 백분율을 보실 때 그 점을 함께 고려하시기를 권합니다.) (출처)
두 문장을 함께 읽으면 문제가 분명해집니다. 오탐을 부르는 특징은 학생들이 글을 일부러 단순하게 만들 때 스스로 집어넣는 특징과 같습니다. 구조적 변화가 줄어드는 경우? 그것은 문장 패턴을 평평하게 만들 때 일어나는 일입니다. 글이 자기를 반복하는 경우? 그것은 다양한 표현을 피할 때 일어나는 일입니다. 새로운 생각 없이 바꿔 쓰는 경우? 그것은 단순하게 유지하려고 분석을 걷어낼 때 일어나는 일입니다.
이 전략은 스스로 발목을 잡습니다. AI 플래그를 피하려고 글을 못 쓰게 만드는 학생은 오탐 패턴에서 멀어지는 것이 아니라 오히려 그쪽으로 다가가고 있습니다.
모델은 학생들이 생각하는 것과 다릅니다
학생들 사이에는 AI 탐지기가 “복잡한” 글이나 “잘 다듬어진” 글을 표시한다는 가정이 널리 퍼져 있습니다. 논리는 이렇습니다. AI가 세련되게 쓰니, 덜 세련되게 쓰면 탐지를 피할 수 있을 것이라는 것입니다. 이 가정은 Turnitin이 자사 모델에 대해 실제로 밝힌 내용 앞에서는 성립하지 않습니다.
Turnitin의 FAQ는 이렇게 밝힙니다. “Our model is not explicitly programmed to evaluate specific signals such as 'burstiness,' 'perplexity,' or other individual metrics sometimes referenced in public discussions.” (저희 모델은 'burstiness,' 'perplexity,' 또는 공개 논의에서 간혹 언급되는 다른 개별 지표 같은 특정 신호를 평가하도록 명시적으로 프로그래밍되어 있지 않습니다.) 다음 문장은 이렇게 설명합니다. “Instead, it learns statistical patterns from our training data.” (대신 학습 데이터에서 통계적 패턴을 학습합니다.) (출처)
이는 중요한 내용이지만, 모델이 단어 확률을 무시한다는 뜻은 아닙니다. 같은 페이지에서 Turnitin은 이렇게 밝힙니다. “Our classifiers are trained to detect these differences in word probability and are adept at the particular word probability sequences of human writers.” (저희 분류기는 단어 확률에서 이러한 차이를 감지하도록 학습되어 있으며, 사람이 쓴 글에 나타나는 특유의 단어 확률 배열에 익숙합니다.) (출처)
이 두 진술을 함께 놓으면 그림이 달라집니다. 모델은 “복잡한 단어는 AI다” 같은 단순한 검사를 하는 것이 아닙니다. 학습 데이터에서 통계적 패턴을 학습하고, 단어 확률의 차이에 맞춰 특별히 훈련되어 있습니다. 어휘를 일부러 단순하게 만들거나 문장 구조를 평평하게 만든다고 패턴 인식을 속일 수 있는 것은 아닙니다. 자기 글의 패턴이 달라질 뿐이며, 그것이 반드시 유리한 방향인 것도 아닙니다.
글의 질과 AI 점수의 관계는 “단순하면 사람, 복잡하면 AI”라는 도식보다 복잡합니다. 이 관계를 이용해 보려고 글을 못 쓰게 만드는 학생은 문서가 뒷받침하지 않는 탐지 모델을 전제로 삼고 있습니다. AI 탐지기가 perplexity와 burstiness 말고 무엇을 측정하는지에서 이 모델들이 실제로 무엇에 반응하는지 더 자세히 살펴봅니다.
문서는 이미 학생을 보호하고 있습니다
이런 논의에서 거의 언급되지 않는 것이 있습니다. Turnitin의 자체 문서는 AI 점수를 판결처럼 다루어서는 안 된다고 밝힙니다. AI 플래그 때문에 당황하는 학생은 공급업체 스스로 신중한 취급을 권하고 있다는 사실을 모르실 수 있습니다.
AI Writing Report 안내서는 이렇게 밝힙니다. “Our AI writing detection model may not always be accurate (it may misidentify human-written, AI-generated, and AI-paraphrased text), so it should not be used as the sole basis for adverse actions against a student.” (저희 AI 작성 탐지 모델이 항상 정확한 것은 아닐 수 있습니다. 사람이 쓴 글, AI가 생성한 글, AI가 바꿔 쓴 글을 잘못 판별할 수 있으므로, 학생에게 불리한 조치의 유일한 근거로 사용되어서는 안 됩니다.) 다음 문장은 이렇게 이어집니다. “It takes further scrutiny and human judgment in conjunction with an organization's application of its specific academic policies to determine whether academic misconduct has occurred.” (학업 부정행위가 있었는지 판단하려면 조직이 자체 학업 정책을 적용하는 것과 함께 추가적인 검토와 사람의 판단이 필요합니다.) (출처)
교육자를 위한 별도 안내서도 같은 관점을 강화합니다. “It is not meant to provide definitive answers in isolation. More important than any tool is the educator who sees the score and makes decisions balancing this information with their personal knowledge of their students, their work, and institutional policy.” (이 도구는 단독으로 확정적인 답을 제공하기 위한 것이 아닙니다. 어떤 도구보다 중요한 것은 점수를 보고, 이 정보를 자신의 학생과 그 과제, 그리고 기관 정책에 대한 개인적인 이해와 함께 저울질하여 판단을 내리는 교육자입니다.) 다음 문장은 이렇게 덧붙입니다. “When educators look at the AI writing score and utilize it as a single data point rather than a definitive response, then it is being used as intended.” (교육자가 AI 작성 점수를 확정적인 답이 아니라 하나의 데이터 포인트로 활용할 때, 그것은 의도된 대로 사용되고 있는 것입니다.) (출처)
점수는 여러 판단 재료 중 하나이며 판결이 아닙니다. 공급업체가 애초에 불리한 조치의 유일한 근거가 되어서는 안 된다고 밝힌 도구로부터 스스로를 지키기 위해 학생들이 글의 수준을 떨어뜨릴 필요는 없습니다.
글을 못 쓰게 만드는 것의 실제 비용
이 전략의 피해는 AI 점수에 그치지 않습니다. 학생들이 글을 일부러 단순하게 만들면 성적이 떨어집니다. 구조적 변화가 없고 분석이 없고 어휘의 폭도 없는 에세이는 더 약한 에세이입니다. 교수는 AI 점수가 아니라 질로 성적을 매깁니다. 그리고 주의 깊게 읽는 사람에게 일부러 수준을 낮춘 에세이는 더 약한 결과물로 읽힙니다.
게다가 피해는 시간이 갈수록 커집니다. 글쓰기는 연습을 통해 늘어가는 기술입니다. 글을 못 쓰도록 스스로를 훈련시키는 학생은 잘못된 기술을 연습하고 있는 셈입니다. 자기 문장을 평평하게 만들고, 복잡함을 피하고, 생각을 전개하지 않은 채 반복되는 글을 만드는 일에 익숙해집니다. 이 습관은 이후의 과제, 취업 지원서, 직장에서의 소통으로까지 이어집니다.
저울질해 보십시오. 한쪽에는 작동하지 않는 전략이 있습니다. 탐지기의 작동 방식을 오해한 데서 출발했고, 문서가 판결이 아니라고 밝힌 점수를 피하려고 쓰입니다. 다른 쪽에는 낮아진 성적, 쇠퇴하는 글쓰기 능력, 그리고 과제를 제출한 뒤에도 오래 남는 습관이 있습니다. 글을 못 쓰게 만드는 데 드는 비용은 분명히 존재합니다. 얻을 수 있는 것은 존재하지 않습니다.
대신 무엇을 해야 하는지
AI 탐지가 걱정되는 학생이라면 자기 파괴보다 문서가 제시하는 틀을 따르는 편이 낫습니다. 가장 좋은 글을 쓰십시오. AI 점수는 확정적인 답이 아니라 하나의 데이터 포인트라는 점을 이해하십시오. Turnitin의 자체 지침이 그 점수를 불리한 조치의 유일한 근거로 삼아서는 안 된다고 밝히고 있다는 사실을 알아 두십시오. 오탐이 걱정되신다면 담당 교수에게 말씀드리십시오. 직접 썼는데 플래그가 붙은 경우에서 그 대화를 준비하는 방법을 다룹니다. 문서는 이 상황을 예상하고 있었고, 바로 그 때문에 사람의 판단을 넣어 두었습니다.
AI 탐지를 피하려고 글을 못 쓰게 만드는 흐름은 탐지기가 무엇에 반응하고 점수가 무엇을 뜻하는지에 대한 오해에서 비롯됩니다. 문서는 그 전략을 뒷받침하지 않습니다. 모델은 학생들이 가정하는 방식으로 작동하지 않습니다. 그리고 점수는 애초에 판결로 만들어진 것이 아니었습니다. 글을 못 쓰게 만드는 일은 필요하지 않은 보호와, 오히려 역효과를 낼 가능성이 높은 전략을 위해 성적과 실력을 희생하는 일입니다.
계속 읽기