같은 글인데 탐지기마다 점수가 다른 이유
스탠퍼드 연구에서는 에세이 91편 가운데 89편이 최소 한 개의 탐지기에 걸렸지만, 일곱 개 모두에 걸린 것은 18편뿐이었습니다. 같은 에세이, 같은 날짜인데 도구들은 그중 71편에 대해 서로 다른 결론을 내렸습니다.
HumanPen 팀
· 5분
이 불일치는 측정 가능하고, 그 폭도 큽니다
가장 분명하게 공개된 수치는 비원어민 작성자에 대한 스탠퍼드 연구에서 나왔습니다. 이 연구는 대개 오탐률 수치로 인용되지만, 그 아래에 있는 두 개의 수치를 보시기 바랍니다.
- TOEFL 에세이 91편 중 89편(97.80퍼센트)이 일곱 개 탐지기 가운데 최소 하나에 의해 AI 작성으로 표시되었습니다.
- 91편 중 18편(19.78퍼센트)은 일곱 개 모두에 의해 표시되었습니다.
그러면 71편, 즉 코퍼스의 다섯 편 가운데 네 편에 대해 일곱 개의 이진 판정이 일치하지 않았다는 뜻입니다. 공개된 집계는 분류에 대한 불일치를 보여 주지만, 개별 사례에서 바탕이 되는 점수가 얼마나 벌어져 있었는지까지 알려 주지는 않습니다.
이 에세이들의 경우에는 기관이 어떤 도구를 선택했는지에 따라 표시가 뜨는지 자체가 달라질 수 있었습니다. 이는 제품 의존성의 문제이며, 특정 탐지기가 늘 틀렸다는 증거가 아닙니다.
시점이 중요합니다. 이 연구는 2023년 초의 제품 일곱 개를 포착한 것으로, 이후 모델이나 임계값, 보고서 화면을 바꾼 곳이 여러 군데 있습니다. 현재의 순위표로 쓰면 안 됩니다. 오래 남는 결론은 방법론적인 것입니다. 탐지기 출력은 서로 바꿔 쓸 수 없으므로, 새롭고 통제된 비교 없이는 한 업체의 점수가 다른 업체의 점수를 확인해 주거나 뒤집을 수 없습니다.
같은 업체에서 다시 돌려도 서비스가 조용히 업데이트되었거나, 계정에 활성화된 기능이 다르거나, 문서가 다르게 파싱되었다면 결과가 달라질 수 있습니다. 따라서 재현성을 확보하려면 글을 보관하는 것만으로는 부족합니다. 원본 파일, 보고서, 날짜, 상품 등급, 언어 설정, 그리고 확인할 수 있다면 모델 버전까지 남겨 두세요. 그런 맥락 없이 백분율 하나만 찍은 스크린샷은 나중에 감사하기가 어렵습니다.
왜 서로 다른 결론을 내리는가
하나의 측정값을 각기 다르게 구현한 것이 아니기 때문입니다. 서로 다른 제품입니다.
- 바탕이 되는 모델이 다릅니다. GPT-2를 기준으로 퍼플렉시티를 재는 탐지기와, 목적에 맞춰 학습된 딥러닝 분류기를 돌리는 탐지기는 같은 문장에 서로 다른 질문을 던집니다.
- 시간에 따른 구조 변화가 다릅니다. GPTZero는 2023년 가을에 퍼플렉시티와 버스티니스에서 벗어났습니다. 다른 곳은 그렇지 않았습니다. 업체 간 비교는 부분적으로 방법의 세대 간 비교이기도 합니다.
- 학습 데이터의 분포가 다릅니다. 어떤 글이 평범한 사람의 글로 받아들여지는지는 분류기가 누구의 글을 보았는지에 달려 있습니다. 이것이 ESL 편향이 생기는 메커니즘이며, 그 양상은 업체마다 다릅니다.
- 임계값과 보고 규칙이 다릅니다. Turnitin은 이제 1퍼센트에서 19퍼센트 사이의 수치 점수를 공개하지 않습니다. 다른 곳은 모든 구간에서 수치를 보여 줍니다. 다시 말해 같은 바탕 신호가 여러분이 보기도 전에 다르게 포장될 수 있습니다.
- 단위가 다릅니다. 어떤 백분율은 문서에 대한 신뢰도이고, 다른 백분율은 AI로 표시된 문장의 비율이며, 또 다른 백분율은 채점 대상이 된 본문의 비율일 수 있습니다. 겉보기가 같다고 해서 같은 질문에 답하는 것은 아닙니다.
- 전처리가 다릅니다. 도구에 따라 참고문헌을 잘라 내거나, 불릿 목록을 무시하거나, 문장을 다르게 나누거나, 긴 문서를 잘라 버릴 수 있습니다. 같은 파일을 받은 것처럼 보이면서도 실제로는 다른 텍스트에 점수를 매길 수 있습니다.
길이는 이런 차이를 더 키웁니다. 수백 단어가 필요한 탐지기는 문서 전체의 패턴을 활용할 수 있지만, 한 단락만 받는 브라우저 도구는 국소적인 특징에 의존할 가능성이 큽니다. 언어 지원도 중요합니다. 영어에 맞춰 보정된 모델이 번역된 문단이나 두 언어가 섞인 참고문헌 목록에서도 똑같이 작동하리라고 가정할 수는 없습니다.
백분율이 사용하는 단위는 서로 같지 않습니다
업체들이 스스로 내린 정의를 보면, 단위를 알기 전에는 겉보기가 같은 백분율을 비교할 수 없다는 점이 드러납니다. 2026년 8월 28일 확인:
| 업체와 출력값 | 업체가 설명하는 백분율의 의미 | 업체가 스스로 그은 선 |
|---|---|---|
| Turnitin의 AI Writing Report | 모델이 AI로 생성되었거나, AI로 생성된 뒤 수정되었을 가능성이 높다고 판단한 채점 대상 텍스트의 양입니다. 이는 채점 대상 본문에 대한 비율이며, 신뢰도 점수가 아닙니다. | Turnitin은 모델이 텍스트를 잘못 판별할 수 있으며 불리한 조치의 유일한 근거가 되어서는 안 된다고 밝힙니다. |
| Originality.ai의 AI 탐지 점수 | 분류 확률입니다. 업체의 예시에 따르면 60% Original은 모델이 Original이라는 판정에 60%의 확신을 갖고 있다는 뜻입니다. | 해당 페이지는 이것이 텍스트의 60%가 사람이 쓴 것이고 40%가 AI가 생성한 것이라는 의미는 아니라고 밝히며, 오탐도 발생한다고 말합니다. |
| GPTZero API의 클래스 확률 | 예측된 클래스, 즉 사람·AI·혼합에 붙는 확률입니다. GPTZero는 90%를 유사한 문서에서 탐지기가 90%의 비율로 옳다는 뜻으로 설명합니다. | 이 설명은 유사한 문서와 API가 예측한 클래스에 한정된 것입니다. 제출한 단어의 90%가 AI가 쓴 것이라는 주장이 아닙니다. |
| Winston AI의 Human Score | 콘텐츠가 사람에 의해 만들어졌다는 신뢰도 추정치입니다. 해당 페이지는 80% 사람, 20% AI가 사람의 저작에 대한 80%의 확신을 뜻하며 20%의 AI 비중을 의미하는 것은 아니라고 설명합니다. | Winston은 자사의 판정에 강제력이 없으며, 예측 지도가 사람이 쓴 텍스트를 강조 표시할 수도 있다고 밝힙니다. |
즉 Turnitin은 문서 가운데 채점 대상이 되는 부분집합의 비율을 보고하는 반면, 나머지 세 사례는 클래스 라벨에 대한 신뢰도를 보고합니다. 같은 기호인 퍼센트가 서로 다른 수학적 일을 하고 있는 것입니다. 한 업체의 수치를 다른 업체의 척도로 바꾸는 것은 두 번째 의견이 아니라, 질문 자체를 바꾸는 일입니다.
한 업체가 서로 다른 두 개의 백분율을 내놓을 수도 있습니다
두 회사를 비교하지 않아도 GPTZero의 공개 페이지만으로 단위 문제가 드러납니다. API 문서와 웹 탐지기 페이지는 모두 퍼센트 기호를 붙인 서로 다른 두 출력값을 설명합니다. 2026년 8월 28일 확인:
| GPTZero의 화면과 필드 | 업체가 직접 쓴 정확한 표현 | 그 표현이 뒷받침하는 단위 |
|---|---|---|
| API의 클래스 확률 | "The class probability corresponding to the predicted class can be interpreted as the chance that the detector is correct in its classification." (예측된 클래스에 대응하는 클래스 확률은 탐지기가 자신의 분류에서 옳을 확률로 해석할 수 있습니다.) | 유사한 문서에서 예측된 문서 클래스가 옳을 확률 |
| 웹 탐지기 결과 | "GPTZero will suggest what percentage of your text is likely to be AI-generated and highlight the specific phrases it has detected." (GPTZero는 여러분의 텍스트 중 AI가 생성했을 가능성이 높은 비율을 제시하고, 탐지한 구체적인 문구를 강조 표시합니다.) | 제출된 텍스트 가운데 AI가 생성했을 가능성이 높다고 설명된 부분의 비율 |
이 둘은 모순이 아니라 별개의 출력 필드일 수 있습니다. 실무적인 원칙은 제품의 어떤 화면의 어떤 필드인지를 밝히는 것입니다. "GPTZero가 30%를 반환했다" 같은 막연한 표현으로는 그 수치가 어떤 양을 뜻하는지 알 수 없습니다.
중국의 두 서비스는 퍼센트 기호를 서로 다른 주장에 사용합니다
같은 단위 불일치가 현재 중국 업체가 직접 쓴 두 개의 설명에도 나타납니다. 아래에 인용한 표현은 2026년 8월 28일에 확인했습니다.
| 서비스와 출력값 | 업체가 직접 쓴 정확한 표현 | 그 표현이 뒷받침하는 내용 | 확인 |
|---|---|---|---|
| CNKI의 학부 논문 AIGC 탐지 서비스 | "检测结果中的AIGC值表示的是文章内容存在AI生成的概率大小" (탐지 결과의 AIGC 값은 글 내용에 AI 생성이 존재할 확률의 크기를 나타낸다는 뜻입니다.) | 글 안에 AI 생성이 존재한다는 확률 형태의 서술이며, 해당 페이지는 이를 단어나 문장의 비율로 정의하지 않습니다 | 2026년 8월 28일 |
| Wanfang Wencha의 AIGC 탐지 | "精准识别论文中疑似AI生成文本占比" (논문에서 AI 생성이 의심되는 텍스트가 차지하는 비율을 정밀하게 식별합니다) | AI가 생성했다고 의심되는 텍스트의 비율 | 2026년 8월 28일 |
이 서술들은 같은 시각적 기호에 서로 다른 양을 붙입니다. 존재 확률과 의심 텍스트의 비율입니다. 한 페이지의 30%는 단위를 먼저 바꾸지 않고는 다른 페이지의 30% 옆에 놓을 수 없으며, 두 페이지 모두 환산 규칙을 공개하지 않습니다.
아예 척도를 거의 내놓지 않는 탐지기도 있습니다
점수를 비교할 때는 골치 아픈 지점이 하나 더 있습니다. 벤치마크에서 어떤 탐지기의 출력값은 0이나 1 부근에 몰리고, 어떤 것은 척도의 더 넓은 구간에 퍼집니다. 그렇다고 바탕 모델에 연속 점수가 없다는 뜻은 아닙니다. 임계값 처리, 반올림, 사용자 화면 때문에 연속 신호가 이진처럼 보일 수 있습니다.
모든 표본에 상용 탐지기 다섯 개를 돌리는 HumanizerBench는 바로 이런 이유로 평균이 아닌 중앙값을 사용합니다. 이진화하는 탐지기가 섞여 있으면 이상치 하나가 평균을 최대 0.25까지 움직이기 때문입니다. 방법론 페이지에 그렇게 적혀 있습니다.
이런 출력값들의 평균을 구하는 것은 수학적으로 가능하지만, 입력값의 단위와 보정이 다르면 그 해석은 불분명합니다. 중앙값은 극단값 하나의 영향력을 줄여 주지만, 실제 정답을 드러내지도 않고 구성 탐지기를 서로 독립적으로 만들지도 않습니다. HumanizerBench는 공개된 제품 벤치마크이며 기관 차원의 검증 연구가 아니므로, 집계 방식의 선택은 그 범위 안에서 읽어야 합니다.
다수결에도 비슷한 한계가 있습니다. 겹치는 코퍼스로 학습된 상관관계가 높은 도구 다섯 개는 독립적인 증인 다섯 명이 아닙니다. 의견 일치는 공유된 사각지대를 반영할 수 있고, 불일치는 단지 기준점이 다른 것일 수 있습니다. 대상 집단에 맞는, 사람이 쓴 텍스트와 생성된 텍스트의 라벨링된 테스트 세트가 없다면 그 표를 저작 확률로 바꿀 원칙적인 방법은 없습니다.
이를 어떻게 받아들여야 할까요
네 가지를 얻을 수 있으며, 그중 어느 것도 작성 기법에 관한 것이 아닙니다.
- 기관의 절차가 진행 중이라면, 실제로 사용되는 보고서를 특정하세요. 다른 업체에 물어보면 그 업체의 판단만 알 수 있습니다. 기관의 도구나 설정, 버전을 재현할 수는 없습니다.
- 여러분을 벗어나게 해 주는 두 번째 의견은 면죄부가 아니며, 여러분을 걸어 주는 의견도 증거가 아닙니다. 둘 다 다른 여러 분류기가 다르게 읽는 텍스트에 대한, 하나의 분류기의 출력값일 뿐입니다.
- 점수가 무엇에 쓰이는지 물어보세요. Turnitin은 자사 모델이 텍스트를 잘못 판별할 수 있으며 불리한 조치의 유일한 근거가 되어서는 안 된다고 밝힙니다. 탐지 결과는 심사에 들어가는 자료이지, 부정행위 판정이 아닙니다.
- 연구 목적으로 도구를 비교한다면 조건을 고정하세요. 같은 버전, 같은 전체 입력, 같은 언어, 같은 날짜, 같은 라벨링된 코퍼스를 사용하고, 표시된 수치뿐 아니라 실패와 제외된 텍스트도 기록하세요.
이의 신청에서 서로 다른 스크린샷은 대개 잡음만 더합니다. 과정 증거, 즉 초안과 메모, 출처 주석, 수정 이력, 그리고 판단을 설명할 수 있는 능력은 또 하나의 불투명한 분류기보다 저작자 문제에 훨씬 직접적으로 답합니다. 교육자에게 이 불일치는 어려운 사건이 닥친 뒤가 아니라 닥치기 전에 교차 확인 절차를 설계해야 하는 이유입니다.
도입 단계라면 어느 업체가 가장 높은 전체 정확도를 보고하는지 묻는 대신, 하위집단과 장르별 오류를 비교하세요. 문서화된 업데이트 정책, 보고서 버전에 대한 감사 추적, 채점 대상 텍스트에 대한 명확한 규칙, 그리고 학생이 의미 있게 답할 수 있는 내보내기 기능을 요구하세요. 기관이 도구가 무엇을 기여하는지 정확히 알고 그것을 뒤집을 수 있는 증거를 정의해 두면, 불일치는 훨씬 덜 위험해집니다.
그 수치가 애초에 무엇을 재고 있는지에 대해서는 AI 탐지기가 실제로 측정하는 것을 참고하세요.
계속 읽기