AI 지원과 AI 생성: Turnitin은 각각을 어떻게 다루는가

Turnitin의 AI 탐지 모델은 최종 제출된 텍스트를 평가합니다. 그것이 어떻게 만들어졌는지는 평가하지 않습니다. 그래서 AI 지원 글쓰기와 AI 생성 글쓰기 사이에는 의미 있는 차이가 생깁니다. Grammarly 같은 도구의 맞춤법 및 문법 교정은 생성형 AI 기능이 만들어낸 텍스트와 다르게 취급됩니다. 선이 어디에 그어져 있는지, 그리고 점수가 무엇을 말해 주고 무엇을 말해 주지 못하는지, 문서의 내용을 정리했습니다.

HumanPen 팀

· 6분

모델이 보는 것은 완성된 결과물입니다

Turnitin의 AI 탐지는 집필 과정을 추적하지 않습니다. 직접 썼는지, 받아쓰기를 했는지, 중간에 도구를 썼는지 모델은 알지 못합니다. 모델이 평가하는 것은 제출한 텍스트입니다.

"When a paper is submitted to Turnitin, sentences from the submission are extracted and segmented into overlapping sections for prediction analysis. Each segment is classified by the AI detection model and given a value between 0 and 1, denoting the probability of the text being likely human or AI-generated." (논문이 Turnitin에 제출되면 제출물의 문장이 추출되어 예측 분석을 위해 겹치는 구간으로 분할됩니다. 각 구간은 AI 탐지 모델에 의해 분류되고 0에서 1 사이의 값을 받으며, 이는 해당 텍스트가 사람이 썼을 가능성 또는 AI가 생성했을 가능성을 나타냅니다.)

모델은 완성된 문서에서 문장을 추출해 구간으로 나누고 각 구간에 점수를 매깁니다. 버전 기록, 편집 시각, 도구 사용 로그에는 접근할 수 없습니다. 바로 그렇기 때문에 그 기록을 직접 보관해 둘 가치가 있으며, 이 점은 AI를 사용하지 않았음을 어떻게 증명하는지에서 다룹니다. 모델은 제출 시점에 페이지에 있는 것으로만 작업합니다.

다시 말해 "도움을 받아 직접 썼다"와 "대신 생성해 준 것이다"의 차이는 모델이 직접 관찰할 수 있는 것이 아닙니다. 모델은 최종 결과물에 나타난 통계적 패턴을 기준으로 텍스트를 분류합니다.

분석 대상의 범위도 구체적으로 정해져 있습니다: "This qualifying text includes only prose sentences, meaning that we only analyze blocks of text that are written in standard grammatical sentences and do not include other types of writing such as lists, bullet points (short non-sentence structures), or other non-sentence structures." (이 대상 텍스트에는 산문 문장만 포함됩니다. 즉, 표준적인 문법적 문장으로 작성된 텍스트 블록만 분석하며, 목록, 불릿 포인트(문장이 아닌 짧은 구조) 또는 그 밖에 문장이 아닌 구조는 포함하지 않습니다.) 그리고 "This percentage is not necessarily the percentage of the entire submission." (이 비율이 반드시 제출물 전체의 비율을 의미하는 것은 아닙니다.)

Grammarly의 맞춤법 및 문법 교정

많은 학생이 맞춤법과 문법을 고치려고 Grammarly나 비슷한 도구를 사용합니다. 문제는 그 교정 때문에 텍스트가 AI 생성으로 표시되는지 여부입니다. Turnitin 문서는 이 점을 직접 다룹니다.

"Our detector is not tuned to target Grammarly-generated spelling, grammar, and punctuation modifications to content but rather, other AI content written by LLMs such as GPT-3.5. Based on tests we conducted on human-written documents with no AI-generated content in them, in most cases, changes made by Grammarly (free & premium) and/or other grammar-checking tools were not flagged as AI-written by our detector." (당사 탐지기는 Grammarly가 만든 맞춤법, 문법, 구두점 수정을 겨냥한 것이 아니라, GPT-3.5와 같은 LLM이 작성한 다른 AI 콘텐츠를 겨냥합니다. AI 생성 콘텐츠가 전혀 없는 사람이 쓴 문서로 실시한 테스트에 따르면, 대부분의 경우 Grammarly(무료 및 프리미엄) 및 기타 문법 검사 도구의 변경 사항은 당사 탐지기에 의해 AI 작성으로 표시되지 않았습니다.)

핵심 문구는 "in most cases." (대부분의 경우)입니다. 탐지기는 맞춤법과 문법 교정을 잡아내도록 조정되어 있지 않습니다. 대부분의 경우, 사람이 쓰고 Grammarly로 정리한 텍스트는 표시되지 않습니다. 이는 Grammarly의 무료 버전과 프리미엄 버전 모두에 적용되며 다른 문법 검사 도구에도 적용됩니다. Turnitin은 Grammarly를 AI 작성으로 탐지하는가에서는 공급업체의 표현을 한 줄씩 짚어 봅니다.

그렇다고 문법 교정을 거친 텍스트가 탐지기에 보이지 않는다는 뜻은 아닙니다. 탐지기가 바로 그런 유형의 수정을 찾아내도록 설계되지 않았다는 뜻입니다. 완성된 산문은 여전히 AI다운 통계적 패턴이 있는지 분석됩니다. 다만 맞춤법과 문법을 위해 Grammarly를 돌리는 행위 자체는 대부분의 경우 그 자체로 표시의 원인이 되지 않습니다.

Grammarly의 생성 기능은 다릅니다

문서는 Grammarly의 교정 기능과 생성 기능 사이에 분명한 선을 긋습니다. 이 예외는 생성형 AI 도구가 만들어낸 콘텐츠까지 확장되지 않습니다.

"Please note that this excludes content generated by Grammarly's generative AI-powered features, including draft generation, paraphrasing, summarizing, and other features. Content produced using these features will likely be flagged as AI-generated by our detector." (이는 Grammarly의 생성형 AI 기능, 즉 초안 생성, 패러프레이징, 요약 및 기타 기능이 만들어낸 콘텐츠는 포함하지 않음을 유의하십시오. 이러한 기능으로 만들어진 콘텐츠는 당사 탐지기에 의해 AI 생성으로 표시될 가능성이 높습니다.)

즉 두 가지 범주가 있습니다. 한쪽에는 맞춤법, 문법, 구두점 교정이 있습니다. 탐지기가 겨냥하지 않으며 대부분의 경우 표시되지 않습니다. 다른 쪽에는 초안 생성, 패러프레이징, 요약 및 기타 생성 기능이 있습니다. 이러한 기능으로 만들어진 콘텐츠는 AI 생성으로 표시될 가능성이 높습니다.

이 구분은 중요합니다. 오타를 고치고 문법을 다듬으려고 Grammarly를 썼다면 탐지기는 그것을 잡아내도록 되어 있지 않습니다. 초안을 생성하거나 문단을 패러프레이징하거나 자료를 요약하려고 Grammarly를 썼다면 그 결과물은 다른 AI 생성 콘텐츠와 동일하게 취급되며 표시될 가능성이 높습니다.

이 선은 브랜드가 아니라 기능이 무엇을 만들어내는지를 기준으로 그어집니다. Grammarly뿐 아니라 어떤 도구의 생성 기능이든 "will likely be flagged" (표시될 가능성이 높음) 쪽에 놓입니다. 어떤 도구의 맞춤법 및 문법 교정이든 "not tuned to target" (겨냥하지 않음) 쪽에 놓입니다. 어느 쪽에 속하는지는 무엇을 밝혀야 하는지도 결정하며, 이 점은 문서를 리라이팅 도구에 통과시키면 밝힐 내용이 달라지는지에서 다룹니다.

사람이 쓴 글도 표시될 때

AI가 전혀 관여하지 않았더라도, 사람이 쓴 산문 중 특정 유형은 오탐을 유발할 수 있습니다. 문서에는 주의해야 할 구체적인 패턴이 나열되어 있습니다.

"Sometimes false positives (incorrectly flagging human-written text as AI-generated), can include content without a lot of structural variation, text that literally repeats itself, or text that has been paraphrased without developing new ideas." (때때로 오탐, 즉 사람이 쓴 텍스트를 AI 생성으로 잘못 표시하는 일은 구조적 변화가 거의 없는 콘텐츠, 문자 그대로 반복되는 텍스트, 또는 새로운 생각을 전개하지 않고 패러프레이징한 텍스트에서 일어날 수 있습니다.)

"If our indicator shows a higher amount of AI writing in such text, we advise you to take that into consideration when looking at the percentage indicated." (그러한 텍스트에서 당사 지표가 AI 작성 비중을 높게 보여 준다면, 표시된 비율을 볼 때 그 점을 고려하실 것을 권합니다.)

따라서 글이 구조적으로 평평하거나 같은 표현을 반복하거나 새로운 생각 없이 패러프레이징한다면, 전적으로 사람이 썼더라도 모델이 표시할 수 있습니다. 이는 AI 지원과의 구분에도 관련이 있습니다. 자기 글을 쓰면서 패러프레이징을 많이 한 학생은 도구 사용과는 전혀 무관한 표시를 받을 수 있기 때문입니다. AI 텍스트를 다른 AI로 패러프레이징했는데도 Turnitin이 표시했다는 같은 현상의 반대쪽 끝에 있는 사례입니다.

점수는 단독 근거가 아닙니다

Turnitin 문서는 AI 탐지 점수를 부정행위의 확정적 증거로 취급해서는 안 된다고 분명히 밝힙니다.

"Our AI writing detection model may not always be accurate (it may misidentify human-written, AI-generated, and AI-paraphrased text), so it should not be used as the sole basis for adverse actions against a student." (당사의 AI 작성 탐지 모델이 항상 정확한 것은 아닙니다(사람이 쓴 텍스트, AI가 생성한 텍스트, AI가 패러프레이징한 텍스트를 잘못 판별할 수 있습니다). 따라서 학생에게 불리한 조치의 단독 근거로 사용되어서는 안 됩니다.)

"It takes further scrutiny and human judgment in conjunction with an organization's application of its specific academic policies to determine whether academic misconduct has occurred." (부정행위가 있었는지를 판단하려면 추가적인 정밀 검토와 사람의 판단, 그리고 기관이 자체 학술 정책을 적용하는 것이 함께 필요합니다.)

점수는 여러 정보 중 하나입니다. 추가적인 정밀 검토와 사람의 판단이 필요하며, 그것은 기관의 구체적인 학술 정책이라는 맥락에서 적용됩니다. 모델은 양방향으로 잘못 판별할 수 있습니다. 사람의 글을 AI로 표시할 수도 있고 AI의 글을 완전히 놓칠 수도 있습니다. 비율을 단독 근거로 취급한다면 문서 스스로의 지침을 무시하는 셈입니다. 표시된 보고서를 들고 있는 사람이 바로 여러분이라면, 표시되었지만 직접 쓴 글에서 채점자에게 어떻게 제시하는지 다룹니다.

여러분에게 어떤 의미인가

Turnitin이 AI 지원 글쓰기와 AI 생성 글쓰기를 어떻게 다루는지 이해하고 싶다면 요약은 다음과 같습니다:

  • 모델은 완성된 텍스트를 봅니다. 집필 과정을 추적하지 않습니다. 제출된 문서의 산문 문장을 구간으로 나누고 점수를 매깁니다.
  • 맞춤법과 문법 교정은 다릅니다. 탐지기는 Grammarly식 맞춤법, 문법, 구두점 교정을 겨냥하도록 조정되어 있지 않습니다. 대부분의 경우 표시되지 않습니다.
  • 생성 기능은 표시될 가능성이 높습니다. Grammarly의 초안 생성, 패러프레이징, 요약 및 기타 생성 기능에서 나온 콘텐츠는 AI 생성으로 취급되며 표시될 가능성이 높습니다.
  • 오탐은 발생합니다. 구조적으로 평평하거나 반복적이거나 패러프레이징된 산문은 AI가 관여하지 않았더라도 표시될 가능성이 더 높습니다.
  • 점수는 단독 근거가 아닙니다. 문서는 학생에게 불리한 조치의 단독 근거로 사용되어서는 안 된다고 말합니다. 사람의 판단과 기관의 정책이 적용됩니다.

조건을 충족하는 부분은 무료로 다시 실행할 수 있습니다.

계속 읽기