Turnitin의 문장 단위 오탐 수치 4%: 2023년에 무엇을 뜻했나
Turnitin의 2023년 6월 설명은 문장 단위 수치를 약 4%로 제시했습니다. 문서 단위 1% 미만이라는 목표는 다른 것을 측정합니다. 20%는 탐지 판정 기준이지 논문에 실제 AI 글이 들어 있다는 조건이 아닙니다. 어느 수치도 개별 구절을 누가 썼는지 판정하지 못합니다.
HumanPen 팀
· 5분
4%가 실제로 가리키는 것
Turnitin은 2023년 6월 설명에서 이미 AI 작성으로 표시된 문장 중 약 4%가 사람이 썼을 가능성이 있다고 기술했습니다. 이는 표시된 문장에 대한 통계이지, 현재 보고서의 특정 문장에 대해 보정된 확률이 아닙니다. 사람이 쓴 전체 문장 중 표시될 문장의 비율도 아닙니다.
Turnitin의 최고제품책임자 Annie Chechitelli는 2023년 6월에 다음과 같이 설명했습니다.
"Our sentence-level false positive rate is around 4%. This means that there is a 4% likelihood that a specific sentence highlighted as AI-written might be human-written. The incidence for this is more common in documents that contain a mix of human- and AI-written content, particularly in the transitions between human- and AI-written content." (저희의 문장 단위 오탐률은 약 4%입니다. 즉, AI가 작성한 것으로 표시된 특정 문장이 실제로는 사람이 작성한 것일 확률이 4%라는 뜻입니다. 이러한 발생은 사람이 쓴 콘텐츠와 AI가 쓴 콘텐츠가 섞여 있는 문서에서 더 흔하며, 특히 두 콘텐츠가 이어지는 전환 지점에서 두드러집니다.)
여기서 조건은 문장이 이미 표시되었다는 것입니다. 반면 문서 단위 오탐률은 사람이 쓴 문서가 얼마나 자주 탐지 판정 규칙을 충족하는지 측정합니다. 분모가 다르므로 한 비율을 다른 비율로 환산할 수 없습니다.
문서 단위 수치는 다른 숫자입니다
같은 2023년 6월 글은 문서 단위 수치도 제시합니다.
"Our document false positive rate - incorrectly identifying fully human-written text as AI-generated within a document- is less than 1% for documents with 20% or more AI writing." (저희의 문서 단위 오탐률, 즉 사람이 전부 작성한 텍스트를 AI 생성으로 잘못 판정하는 비율은 AI 작성 탐지 결과가 20% 이상인 문서 판정 조건에서 1% 미만입니다.)
이 문구는 오해하기 쉽습니다. 20%는 탐지기가 보고하는 결과이지, 실제로 존재한다고 알려진 AI 글의 양이 아닙니다. Turnitin의 2024년 8월 백서는 문장 점수 중 20%를 초과하는 비율이 모델 임계값을 넘으면 문서를 판정하는 규칙을 설명합니다. 오탐 시험에는 2019년 이전의 학생 논문을 쓰며, 전부 사람이 쓴 자료라고 명시합니다. 이런 인간 작성 논문이 탐지 기준을 넘는 경우가 여기서 말하는 오탐입니다.
직접 쓴 논문에 대해 이 수치들이 알려 주는 것
문서 단위 오탐 시험에 필요한 것은 바로 전적으로 사람이 쓴 논문입니다. 판정 규칙이 20% 기준을 쓴다고 해서 이런 논문이 시험 대상에서 제외되는 것은 아닙니다.
2023년 글은 잘못 표시된 문장이 혼합 문서에서, 특히 사람의 글과 AI 글이 이어지는 지점에서 더 흔하다고 설명합니다. 더 흔하다는 말은 거기에서만 발생한다는 뜻이 아닙니다. 전적으로 사람이 쓴 글의 잘못된 표시를 배제하지 않습니다.
1% 미만이라는 목표는 공급업체의 시험 조건에서 사람이 쓴 문서가 지정된 탐지 규칙을 충족하는 빈도를 뜻합니다. 이미 표시된 논문이 사람이 쓴 것일 확률이 1% 미만이라는 뜻이 아닙니다. 그렇게 해석하면 측정한 조건을 뒤집게 됩니다.
두 수치 모두 오류 가능성을 설명하는 데 도움이 됩니다. 그러나 어느 것도 특정 구절의 작성자를 알아내지는 못합니다. 비율을 판정으로 삼기보다 표시된 글과 작성 과정을 살펴보세요.
잘못된 표시는 어디에 몰리는가
Turnitin은 잘못 표시된 문장이 어디에 나타나는지에 관한 구체적인 수치를 제시했습니다.
"As explained in my earlier article, there is a correlation between these sentences and their proximity in the document to actual AI writing. 54% of the time, these sentences are located right next to actual AI writing." (앞선 글에서 설명했듯, 이 문장들과 문서 안에서 실제 AI 작성 지점까지의 거리 사이에는 상관관계가 있습니다. 54%의 경우, 이 문장들은 실제 AI 작성 지점 바로 옆에 자리합니다.)
이 문장들은 사람이 썼지만 잘못 표시된 문장을 뜻합니다. 2023년 설명에 따르면 그중 54%가 실제 AI 글 바로 옆에 있었습니다. 이는 관찰된 오류의 집중 현상이지 모든 오탐에 적용되는 규칙이 아닙니다.
이 관찰만으로 논문이 표시된 원인을 진단할 수는 없습니다. 근처에 AI 글이 있음을 증명하지도, AI 글이 없을 때 오류가 생길 가능성을 배제하지도 않습니다. 표시된 구절을 검토의 단서로 활용하세요. 인접 위치 통계만으로 작성자를 판단할 수는 없습니다.
Turnitin이 말하는 표시 읽는 법
같은 글은 표시가 결론이 아니라 출발점이라는 점을 분명히 밝힙니다. 그것도 여러분이 읽어 주길 바라는 대상, 즉 교수자에게 말입니다.
"Consider highlighted sentences as areas of interest because they're predicted to be close to where AI writing is present. But a small percentage of times, the AI model could get it wrong. So, use the information to initiate a conversation, not to draw a conclusion." (표시된 문장은 AI 작성 부분이 있는 곳과 가까울 것으로 예측되므로 관심 영역으로 보십시오. 다만 소수의 경우 AI 모델이 틀릴 수 있습니다. 그러므로 이 정보는 결론을 내리는 데가 아니라 대화를 시작하는 데 사용하십시오.)
이 글은 학생들이 흔히 자신이 평가받는 기준이라고 생각하는 것도 배제합니다. 맞춰야 할 숫자는 없습니다.
"Remember that there is no 'right' or 'target' score with the AI writing indicator, just like with a Similarity Score." (Similarity Score와 마찬가지로 AI 작성 지표에는 '옳은' 점수나 '목표' 점수가 없다는 점을 기억하십시오.)
문장 두 개가 찍힌 보고서를 어떻게 다룰 것인가
위의 어느 것도 여러분이 곤란한 상황인지 알려 주지 않습니다. 공개된 숫자로는 그럴 수 없기 때문입니다. 다만 이것이 주는 것은, 대화를 백분율이 아니라 보고서 자체에 머물게 하는 방법입니다.
- 어느 부분인지 물어보고, 스크린샷이 아니라 보고서를 받으십시오. 표시된 문장 두 개와 문서 단위 숫자는 서로 다른 대상입니다. 위치를 가리킬 수 있는 것은 표시된 부분뿐입니다.
- 어떤 비율을 인용하며 무엇을 측정하는지 물어보세요. 20% 기준은 탐지기의 출력에 관한 것입니다. 문서 단위 오탐률은 사람이 쓴 글에서 측정하며, 이미 표시된 여러분의 특정 논문이 사람이 쓴 것일 확률이 아닙니다.
- Turnitin의 자체 지침을 갖고 가십시오. 그 글은 교수자에게 표시를 결론이 아니라 대화를 시작하는 데 사용하라고 말합니다. 그 문장은 여러분의 보고서를 쥐고 있는 사람에게 보내는 것이며, 위에 한 글자도 빼지 않고 인용해 두었습니다.
- 논문이 어떻게 쓰였는지 보여 주는 자료를 보관하십시오. 초고, 버전 기록, 메모, 읽은 자료 등입니다. 그것이 저작에 대한 증거입니다. 백분율은 증거가 아닙니다.
계속 읽기