Turnitin은 Mistral AI 텍스트를 탐지할까요? 문서가 실제로 말하는 것

Mistral은 Turnitin이 탐지할 수 있는 모델 목록에 올라 있습니다. 하지만 탐지는 단순한 예-아니요 판정이 아닙니다. 아래에서는 시스템이 텍스트를 어떻게 처리하는지, 무엇을 놓칠 수 있는지, 그리고 모델이 업데이트되면 어떤 일이 벌어지는지를 문서가 실제로 어떻게 말하고 있는지 정리했습니다.

HumanPen 팀

· 5분

Mistral은 공개된 모델 목록에 올라 있습니다

Turnitin은 AI 작성 탐지 모델이 그 결과물을 식별할 수 있는 모델 목록을 공개해 두고 있습니다. 이 목록에는 GPT, Gemini, Claude, LLaMA, Mistral, Deepseek, Nova, Grok, o1-mini와 함께 이러한 LLM을 기반으로 한 도구도 포함됩니다. LLaMA가 Mistral 옆에 놓인 것도 같은 이유에서입니다. 둘 다 가중치가 공개된 모델이며, Turnitin이 LLaMA를 탐지하는지에서도 같은 방식으로 읽습니다. 표현은 분명합니다. 영어 제출물에 대한 Turnitin의 AI 작성 탐지 모델은 이러한 모델의 콘텐츠를 탐지할 수 있다는 것입니다.

문서에는 또한 이렇게 적혀 있습니다. "We will continue to expand our detection capabilities to other models in the future." (앞으로도 다른 모델로 탐지 기능을 계속 확장해 나갈 것이라는 뜻입니다.) 다시 말해 이 목록은 고정된 것이 아닙니다. 새로운 모델이 나오고 그 결과물을 인식하도록 탐지 시스템이 업데이트되면서 목록도 함께 커집니다.

Mistral만 놓고 보면 "Turnitin이 이를 탐지하는가"라는 질문의 답은 '예'이며, 목록에 올라 있습니다. 하지만 실제로 "탐지"가 무엇을 뜻하는지는 훨씬 미묘한 과정을 거칩니다.

탐지는 실제로 어떻게 작동하는가

문서를 제출할 때 어떤 일이 벌어지는지 이해하면, 결과가 왜 그렇게 나오는지를 설명하는 데 도움이 됩니다. Turnitin이 설명하는 작동 방식은 다음과 같습니다.

"When a paper is submitted to Turnitin, sentences from the submission are extracted and segmented into overlapping sections for prediction analysis. Each segment is classified by the AI detection model and given a value between 0 and 1, denoting the probability of the text being likely human or AI-generated. Each qualifying sentence within these segments inherits the segment's score. Since segments overlap, some sentences may have multiple scores, which are then pooled into a single score. These sentence scores are further aggregated and used to compute the overall document AI writing score." (논문이 Turnitin에 제출되면 제출물에서 문장이 추출되어 예측 분석을 위해 서로 겹치는 구간으로 분할됩니다. 각 구간은 AI 탐지 모델이 분류하고 0에서 1 사이의 값을 부여받는데, 이는 해당 텍스트가 사람이 썼을지 AI가 생성했을지의 확률을 나타냅니다. 이 구간 안에서 조건을 충족하는 각 문장은 구간의 점수를 물려받습니다. 구간이 겹치기 때문에 여러 점수를 갖는 문장도 있고, 그 점수들은 하나의 점수로 합쳐집니다. 이 문장 점수들은 다시 집계되어 문서 전체의 AI 작성 점수를 계산하는 데 사용됩니다.)

이 시스템은 결정적인 특징 하나만을 찾는 것이 아닙니다. 텍스트를 구간으로 나누고 각 구간에 AI 가능성 점수를 매긴 뒤, 겹치는 문장의 점수를 모아 문서 수준의 단일 비율로 집계합니다.

문서는 모델이 하지 않는 일에 대해서도 분명히 밝힙니다. burstiness나 perplexity처럼 이름이 붙은 지표에 의존하지 않는다는 것인데, 이 부정은 Turnitin이 AI 탐지에 perplexity와 burstiness를 사용하는지에서 자세히 풀어봅니다. "Our model is not explicitly programmed to evaluate specific signals such as 'burstiness,' 'perplexity,' or other individual metrics sometimes referenced in public discussions." (저희 모델은 공개 토론에서 간혹 언급되는 'burstiness,' 'perplexity,' 등의 개별 지표를 명시적으로 평가하도록 프로그래밍되지는 않았다는 뜻입니다.) 대신 모델은 학습 데이터에서 통계적 패턴을 학습합니다. 분류기는 단어 확률의 차이를 감지하도록 학습되며, 사람이 쓴 글에 나타나는 특유의 단어 확률 배열에 능합니다.

이는 탐지가 결정론적이지 않고 확률적이라는 뜻입니다. 점수는 텍스트가 AI가 만든 패턴과 얼마나 닮았는지에 대한 모델의 확신을 반영하며, 이분법적인 단정이 아닙니다.

탐지기가 놓칠 수 있는 것

탐지 가능 모델 목록에 올라 있다고 해서 AI가 만든 모든 문장이 걸러지는 것은 아닙니다. Turnitin은 오탐을 낮게 유지하는 것을 우선하며, 그 절충에는 반대편에 비용이 따릅니다.

"In order to maintain this low rate of 1% for false positives, there is a chance that we might miss some AI written text in a document. We're comfortable with that since we do not want to incorrectly highlight human-written text as AI-written. For example, if we identify that 50% of a document is likely written by an AI tool, it could contain as much as 65% AI writing." (이처럼 1%의 낮은 오탐률을 유지하기 위해, 문서 안의 AI 작성 텍스트 일부를 놓칠 가능성이 있습니다. 저희는 그것을 감수합니다. 사람이 쓴 텍스트를 AI가 쓴 것으로 잘못 표시하고 싶지 않기 때문입니다. 예를 들어 문서의 50%가 AI 도구로 작성된 것으로 판단했다면, 실제로는 최대 65%의 AI 작성 분량이 포함되어 있을 수 있습니다.)

따라서 Mistral이 생성한 텍스트가 포함된 문서는 실제 AI 비율보다 낮은 점수를 받을 수 있습니다. 탐지기가 50%를 AI 작성으로 판정해도 실제 비율은 65%에 더 가까울 수 있습니다. 이는 설계된 결과입니다. 시스템이 사람의 텍스트를 표시하지 않는 쪽으로 기울어 있기 때문에, 일부 AI 텍스트는 표시되지 않은 채 통과합니다.

이 격차는 AI 콘텐츠가 포함되어 있다는 것을 알고 있는 문서가 왜 예상보다 낮은 점수를 받았는지 이해하려 할 때 중요합니다. 그 1% 목표의 산술은 1% 오탐률이 의미하는 것에서 자세히 다룹니다.

탐지 성능은 시간이 지나며 달라집니다

오늘 Mistral 텍스트를 탐지하는 모델이 다음 달에 돌아가는 모델과 반드시 같은 것은 아닙니다. Turnitin의 문서도 이를 인정합니다.

"As we iterate and develop our model further to better detect newer LLMs, it is likely that our detection capabilities will also change, affecting the AI percentage.. However, for a submitted document, the AI percentage will change only if it's re-submitted again to be processed." (더 새로운 LLM을 더 잘 탐지하도록 모델을 반복 개선해 나감에 따라 탐지 성능도 바뀔 가능성이 크며, 이는 AI 비율에도 영향을 미칩니다. 다만 이미 제출된 문서의 경우, 다시 제출해 처리하지 않는 한 AI 비율은 변하지 않습니다.)

여기서 실질적인 시사점이 두 가지 나옵니다. 첫째, 모델이 업데이트된 뒤 같은 문서를 다시 제출하면 다른 점수를 받을 수 있다는 것입니다. 그래서 두 점수를 비교하는 것보다 두 리포트를 비교하는 것이 낫습니다. 둘째, 한 번 처리된 문서의 점수는 시스템을 다시 거치지 않는 한 고정된 상태로 남습니다. 시간을 두고 점수를 비교한다면, 그 차이는 문서 자체의 변경이 아니라 모델 업데이트를 반영한 것일 수 있습니다.

"Mistral 탐지"가 실제로 의미하는 것

Mistral은 하나의 고정된 제품이 아니라 모델 제품군입니다. Mistral 모델 위에 구축된 도구나 Mistral을 미세 조정한 버전도 Turnitin의 "tools based on these LLMs"(이러한 LLM을 기반으로 한 도구)라는 표현에 포함됩니다. 탐지 모델은 리포트에서 Mistral을 이름으로 특정하지 않습니다. 통계적 패턴을 바탕으로 문서 수준의 AI 작성 점수 하나를 산출할 뿐이며, 개별 모델별로 나누어 보여주지 않습니다.

즉 리포트에 "30% Mistral, 10% GPT"라고 적히지는 않습니다. 대신 "40% AI 생성"과 같은 집계 점수가 표시됩니다. 모델 목록이 알려주는 것은 탐지기가 인식하도록 학습된 모델 계열이지, 어떤 문단을 어떤 모델이 썼는지가 아닙니다. 리포트가 실제로 무엇을 보여주는지는 Turnitin AI Writing Report 읽는 법에서 다룹니다.

이것이 의미하는 것

Mistral이 생성한 텍스트를 다루고 있고 Turnitin이 이를 어떻게 처리할지 알아야 한다면, 요약은 다음과 같습니다.

  • 예, Mistral은 탐지 대상입니다. 공개된 모델 목록에 올라 있고, Mistral 기반 도구도 포함됩니다.
  • 탐지는 확률적입니다. 시스템은 텍스트를 구간으로 나누고 각 구간에 AI 가능성 점수를 매긴 뒤 하나의 비율로 집계합니다. burstiness나 perplexity는 사용하지 않습니다.
  • 일부 AI 텍스트는 놓칩니다. AI 작성 비율이 20%를 넘는 문서에서 오탐을 1% 미만으로 유지하기 위해, 탐지기가 실제 AI 비율을 적게 집계할 수 있습니다.
  • 점수는 달라질 수 있습니다. 모델이 업데이트되고 문서가 다시 제출되면 점수가 움직일 수 있습니다. 이전 제출에서 받은 점수는 다시 처리될 때까지 고정되어 있습니다.
  • 모델별 분석은 없습니다. 리포트는 집계된 AI 비율을 보여줄 뿐, 모델별 귀속을 알려주지 않습니다.

조건을 충족하는 부분은 무료로 다시 실행할 수 있습니다.

계속 읽기