Turnitin 위양성율의 진실

Turnitin의 1% 미만 목표는 정해진 탐지 규칙에서 사람이 쓴 문서가 잘못 탐지되는 비율에 관한 것입니다. 20% 기준의 의미, 업체가 설명하는 테스트 방법, 높은 점수와 낮은 점수 모두 작성자를 단정할 수 없는 이유를 살펴봅니다.

HumanPen 팀

· 5분

위양성율에 대한 Turnitin 의 공식 입장

Turnitin 은 공식 문서에서 다음과 같이 명시합니다: "We strive to maximize the effectiveness of our detector while keeping our false positive rate - incorrectly identifying fully human-written text as AI-generated - under 1% for documents with over 20% of AI writing." (탐지기의 효과를 높이면서, 문서의 AI 작성 탐지 결과가 20%를 초과하는 판정 조건에서 전부 사람이 쓴 텍스트를 AI 생성으로 잘못 식별하는 비율을 1% 미만으로 유지하려 한다는 뜻입니다.)

20% 조건은 탐지기의 출력에 관한 것이지, 논문에 실제로 들어 있는 AI 텍스트의 양이 확인됐다는 뜻이 아닙니다. Turnitin의 2024년 8월 백서는 문장 점수 중 20%를 초과하는 수가 모델 임계값을 넘을 때 적용하는 문서 분류 규칙을 설명합니다. 위양성 테스트에는 업체가 전부 사람이 썼다고 설명하는 논문을 사용합니다. 사람이 쓴 논문이 이 탐지 기준을 넘는 오류를 세는 것입니다.

문서 단위 위양성률은 사람이 쓴 문서가 탐지 규칙에 얼마나 자주 해당하는지 나타냅니다. 이미 표시된 논문이 사람이 쓴 것일 확률을 뜻하지는 않습니다. 두 질문은 조건이 반대이며, 테스트 결과만으로 두 번째 질문에 답할 수 없습니다. 높은 점수도 검토가 필요합니다. 100% AI 점수도 휴먼 라이팅일 수 있을까요?를 참고하세요.

70 만 편 이상의 논문 검증

Turnitin의 FAQ는 이 목표를 뒷받침하는 테스트를 다음과 같이 설명합니다: "To bolster our testing framework and diagnose statistical trends of false positives, before every update or new model release, we perform tests on over 700,000 additional academic papers that were written before the release of ChatGPT to further validate our less than 1% false positive rate."(우리는 테스트 프레임워크를 강화하고 위양성의 통계적 추세를 진단하기 위해, 모든 업데이트 또는 새 모델 릴리스 전에 ChatGPT 릴리스 이전에 작성된 70 만 편 이상의 학술 논문을 추가로 테스트하여 1% 미만의 위양성율을 추가 검증합니다.)

이 설명은 큰 테스트 자료의 규모, ChatGPT 출시 이전이라는 논문 작성 시점, 업데이트나 새 모델 출시 전에 테스트한다는 절차를 제시합니다. 매번 새 논문을 수집한다고 하지는 않습니다. 2024년 8월 백서는 별도로 2019년 이전의 스트레스 테스트 자료를 전부 사람이 쓴 것으로 설명합니다.

이 비율을 인용할 때는 탐지 기준과 테스트 자료도 함께 밝혀야 합니다. 자료의 규모나 작성 시점만으로 결과가 모든 분야, 문체, 개별 제출물에 대한 보장이 되지는 않습니다.

낮은 위양성율을 위해 놓치는 것을 감수한다

문서에서 가장 중요한 부분은 1% 목표 자체가 아닙니다. 그 목표를 달성하기 위해 Turnitin 이 명시적으로 감수하는 트레이드오프입니다. 전문은 다음과 같습니다: "In order to maintain this low rate of 1% for false positives, there is a chance that we might miss some AI written text in a document. We're comfortable with that since we do not want to incorrectly highlight human-written text as AI-written. For example, if we identify that 50% of a document is likely written by an AI tool, it could contain as much as 65% AI writing."(우리는 1% 의 낮은 위양성율을 유지하기 위해, 문서의 일부 AI 작성 텍스트를 놓칠 수 있습니다. 우리는 휴먼 라이팅을 AI 작성으로 잘못 표시하지 않는 것을 중요하게 생각하기 때문에 이를 감수합니다. 예를 들어, 문서 내용 중 50%가 AI 도구로 작성됐을 가능성이 있다고 판단되면, 실제로는 65% 까지 AI writing 일 수 있습니다.)

회사는 사람이 쓴 텍스트를 잘못 표시할 위험을 줄이기 위해 일부 AI 텍스트를 놓치는 것을 감수한다고 명시합니다. 이는 설계상의 선택을 설명하지만, 개별 보고서에서 어떤 오류가 발생했는지는 알려주지 않습니다.

50%와 65%의 예는 과소계산이 일어날 수 있음을 보여줍니다. 환산 공식이나 다른 문서의 상한선이 아니며, 모든 오류가 같은 방향이라는 증거도 아닙니다. 같은 문서는 사람이 쓴 텍스트를 AI 생성으로 오인할 수 있다고도 인정합니다.

이 수치를 어떻게 읽어야 할까

조건을 계속 염두에 두면, '위양성율'은 헤드라인 버전보다 더 정밀한 도구가 됩니다. 문서화된 수치가 실제로 무엇을 의미하는지 설명합니다.

첫째, 보고서의 AI 백분율과 실제 작성 주체를 구분하세요. 20% 기준은 탐지 규칙에 속합니다. 전부 사람이 쓴 논문도 이 기준을 넘을 수 있으며, 바로 그 오류가 테스트에서 세려는 위양성입니다.

둘째, AI 텍스트 누락은 설계의 일부입니다. 시스템이 위양성 방지에 조정되어 있기 때문에 일부 AI 내용은 감지되지 않습니다. 낮게 나온 점수가 문서가 완전히 인간이 작성했다는 것을 의미하지는 않습니다. AI 결과가 과소평가되었을 수 있습니다.

셋째, 일부 AI 텍스트를 놓치는 것을 감수한다고 해서 여러분의 경우에 높은 점수가 더 신뢰할 만하다는 뜻은 아닙니다. 인용한 예는 80% 점수의 신뢰도를 수치로 제시하지 않습니다. 표시된 부분과 작성 과정의 증거를 여전히 검토해야 합니다.

낮은 점수는 사람이 썼다는 증거가 아니며, 높은 점수도 학술 부정행위를 입증하지 않습니다. 인용한 설계 설명만으로 여러분의 환경에서 미탐지와 위양성의 발생 빈도를 비교할 수 없습니다. AI 비율이 높을 때 인스트럭터가 취하는 조치를 참고하세요.

플래그가 표시되었을 때 대처법

Turnitin 의 공식 가이드라인은 점수를 더 넓은 의사결정 체계 안에 배치합니다. 문서에 명시된 바와 같습니다: "Our AI writing detection model may not always be accurate (it may misidentify human-written, AI-generated, and AI-paraphrased text), so it should not be used as the sole basis for adverse actions against a student."(우리의 AI writing 탐지 모델은 항상 정확하지 않을 수 있으며 (휴먼 라이팅, AI 생성, AI 문장변환 텍스트를 잘못 식별할 수 있음), 학생에 대한 불이익 조치의 유일한 근거로 사용되어서는 안 됩니다.)

계속해서 다음과 같이 명시합니다: "It takes further scrutiny and human judgment in conjunction with an organization's application of its specific academic policies to determine whether academic misconduct has occurred."(학술 부정행위 발생 여부를 판단하려면 추가 검토와 인간의 판단이 필요하며, 기관의 특정 학술 정책 적용과 함께 이루어져야 합니다.)

이것이 학생과 교육자가 운영해야 하는 체계입니다. 백분율은 하나의 데이터 포인트일 뿐입니다. 최종 판정은 인간이 내리는 결정입니다. 인스트럭터, 학과, 기관이 각자의 학술 정책을 적용하여 결정합니다. Turnitin 은 점수가 단독으로 결정을 내려서는 안 된다고 명시합니다. 회사는 또한 오류 자체를 보고할 수 있는 채널을 운영합니다: Turnitin 에 위양성 보고하는 법.

점수에 이의가 있다면, 문서화된 경로는 숫자를 하나의 데이터 포인트로 간주하고 학술적 맥락을 이해하는 사람 - 인스트럭터에게 제기하는 것입니다. 이는 공식 문서가 명시하는 단계이며, 회사의 Framing 과도 가장 일치합니다. 그렇게 해도 해결되지 않으면, 허위 AI 탐지 플래그에 대한 이의제기 방법과 대학이 인정하는 증거 에 다음 단계가 나와 있습니다.

그 대화를 위해 원본 보고서와 작성 기록을 보관하세요. 이후 문서를 수정하기로 결정한다면 HumanPen의 보고서 기반 작업 흐름은 표시된 부분을 처리합니다. 원래 표시가 옳았는지 판단하는 기능은 아닙니다.

계속 읽기