논문을 수정했는데 AI 점수가 올랐습니다

이 숫자는 문장 단위 판정을 더해 만들어지는 것이 아닙니다. 따라서 고친 문장과 보조를 맞추게 만드는 장치는 계산 방식 어디에도 없습니다. 계산 과정에서 공개된 세 가지 요소가, 수정이 의도한 대로 작동하는 바로 그 시점에 숫자를 반대 방향으로 밀어 올릴 수 있습니다.

HumanPen 팀

· 10분

짧은 답

두 번째 보고서가 첫 번째보다 높은 수치를 보여도, 그것은 수정을 얼마나 잘했는지를 측정한 결과가 아닙니다. Turnitin이 백분율을 만들어내는 방식 가운데 공개된 세 가지 요소가 각각 따로 그 값을 올릴 수 있습니다. 문장은 서로 겹치는 세그먼트 안에서 평가됩니다. 따라서 한 곳을 고치면 이웃 문장이 무엇과 묶여 평가되는지가 달라지고, 그 영향이 미치는 범위는 정해져 있지 않습니다. 백분율은 대상 산문에 대해서만 계산됩니다. 즉 수정 과정에서 산문이 문서에서 빠져나가면, 표시된 텍스트는 그대로인데 분모가 줄어듭니다. 그리고 눈으로 셀 수 있는 강조 표시와 표지의 숫자는 서로 다른 양이며, 같은 보고서 안에서 반대 방향으로 움직이는 것도 가능합니다.

이 가운데 어느 것도 수정이 잘못되었다거나 글이 나빠졌다고 말하지 않습니다. 다만 보고되는 양이 "백분율"이라는 단어가 흔히 떠올리게 하는 방식대로 움직이지는 않는다고 말할 뿐입니다. 아래에서는 각각의 작동 방식을 그 근거가 되는 문서와 나란히 제시하고, 수정으로 문서가 크게 짧아진 경우에만 작동하는 네 번째 방식을 덧붙인 뒤, 상승이 무엇을 말해 주고 무엇을 말해 주지 않는지 살펴봅니다.

수정한 부분의 영향은 그 자리에 머물지 않습니다

먼저 문장이 어떻게 점수를 받는지부터 살펴보겠습니다. 답은, 문장에는 자기만의 점수가 없다는 것입니다. Turnitin의 FAQ는 이 과정을 한 문단으로 설명합니다.

"When a paper is submitted to Turnitin, sentences from the submission are extracted and segmented into overlapping sections for prediction analysis. Each segment is classified by the AI detection model and given a value between 0 and 1, denoting the probability of the text being likely human or AI-generated. Each qualifying sentence within these segments inherits the segment's score. Since segments overlap, some sentences may have multiple scores, which are then pooled into a single score. These sentence scores are further aggregated and used to compute the overall document AI writing score." (논문이 Turnitin에 제출되면, 제출물에서 문장이 추출되어 예측 분석을 위해 서로 겹치는 구간으로 분할됩니다. 각 구간은 AI 탐지 모델이 분류하고 0에서 1 사이의 값을 부여받으며, 이는 해당 텍스트가 사람이 쓴 것인지 AI가 만든 것인지에 대한 확률을 나타냅니다. 이 구간들 안에 있는 대상 문장은 각각 구간의 점수를 물려받습니다. 구간이 겹치기 때문에 여러 개의 점수를 갖는 문장도 있고, 이 점수들은 하나의 점수로 통합됩니다. 이 문장 점수들은 다시 집계되어 문서 전체의 AI 작성 점수를 계산하는 데 사용됩니다.)

이 가운데 문제의 전부를 짊어진 단어가 둘 있습니다. "overlapping"(겹치는)과 "pooled"(통합된)입니다. 하나의 문장은 두 개 이상의 세그먼트에 걸쳐 있고, 각 세그먼트는 덩어리째 분류됩니다. 따라서 문장이 지닌 점수는 모두 어느 정도는 양옆의 문장이 만들어낸 것입니다.

문장 하나를 다시 쓰면, 손대지 않은 이웃 문장의 점수에 들어가는 입력값까지 바꾼 셈입니다. 일부러 그대로 둔 문단이, 그것을 담고 있는 세그먼트의 내용이 달라졌다는 이유로 강조 표시가 된 채 돌아올 수도 있습니다. 반대의 경우도 일어나지만, 그쪽에 대해서는 아무도 문의하지 않습니다.

세그먼트 경계 자체도 공급업체 쪽 설명에서 움직이는 요소입니다. 문서의 앞부분과 끝부분에서 오탐을 줄이기 위한 작업을 설명한 2023년 5월 24일 자 릴리스 노트에서, Turnitin은 이렇게 덧붙였습니다.

"We also worked on making our segment boundaries detection more precise which could lead in some rare cases to change of boundaries compared with a previous version." (또한 세그먼트 경계 탐지를 더 정밀하게 만드는 작업도 진행했으며, 드문 경우에는 이전 버전과 비교해 경계가 바뀔 수 있습니다.)

이것은 현재의 결함을 설명한 것이 아니라 2023년에 이루어진 개선에 대한 이야기입니다. 그런데도 읽어 볼 만한 이유가 딱 하나 있습니다. 세그먼트 경계가 과정의 일부이고, Turnitin이 그것을 바꾼 적이 있다는 사실을 문서로 남겨 두었다는 점입니다. FAQ는 통합과 집계가 이루어진다는 점도 분명히 밝히고 있습니다. 공개하지 않은 것은 통합 규칙, 임의의 가중치, 그리고 집계 알고리즘입니다. 따라서 어떤 수정이 어떤 이웃을 어느 방향으로 움직일지를 미리 알아낼 방법은 없습니다.

다른 곳을 보고 계시는 동안 분모가 움직일 수 있습니다

두 번째 작동 방식은 분류와는 전혀 관련이 없습니다. 그것은 산수이며, 가장 큰 의외의 결과를 만들어내는 것도 바로 이것입니다.

"This qualifying text includes only prose sentences, meaning that we only analyze blocks of text that are written in standard grammatical sentences and do not include other types of writing such as lists, bullet points (short non-sentence structures), or other non-sentence structures. This percentage is not necessarily the percentage of the entire submission." (이 대상 텍스트에는 산문 문장만 포함됩니다. 즉, 표준적인 문법을 갖춘 문장으로 쓰인 텍스트 블록만 분석하며, 목록이나 불릿 항목(문장 형태가 아닌 짧은 구조) 또는 그 밖의 문장이 아닌 구조와 같은 다른 유형의 글은 포함하지 않습니다. 이 백분율이 반드시 제출물 전체에 대한 백분율인 것은 아닙니다.)

여기에 숫자를 붙여 보겠습니다. 초고에 대상 산문이 6,000단어 있고 그중 1,800단어에 표시가 붙어 돌아왔다고 합시다. 30%입니다. 두 번째 판에서는 표시된 300단어를 다시 써서 표시가 사라지고, 1,500단어가 남습니다. 그런데 같은 작업 중에 지도교수가 논의 부분이 너무 무겁다고 해서, 추가로 2,400단어를 요약 목록과 수치 표로 바꿨다고 합시다. 대상 산문은 이제 3,600단어입니다. 3,600분의 1,500은 42%에 조금 못 미칩니다. 이전보다 표시된 텍스트는 줄고 어디에도 새로 표시된 곳은 없는데도, 점수는 열두 포인트 올랐습니다.

혹시 하셨을지 모르는 변경그 변경이 대상 산문에 미치는 영향
문단 세 개를 요약 목록으로 바꾸셨습니다해당 단어가 분석에서 빠집니다. Turnitin은 불릿 항목과 문장 형태가 아닌 짧은 구조를 분석하지 않는 대상으로 명시하고 있습니다
설명을 표로 옮기셨습니다무엇을 넣었는지에 따라 다릅니다. 2023년 8월 릴리스 노트에는 표 안의 장문 산문도 이제 처리된다고 나와 있습니다. 수치 표는 어느 쪽이든 산문이 아닙니다
참고문헌을 20 개 더 추가하셨습니다아무 일도 일어나지 않습니다. 같은 릴리스 노트에는 AI 작성 보고서를 처리할 때 참고문헌 목록이 제외된다고 나와 있습니다
분량 제한을 맞추려고 표시되지 않은 산문 1,500단어를 줄이셨습니다분모가 줄고 표시된 비중이 올라갑니다. 표시된 텍스트 자체는 전혀 변하지 않습니다

2023년 8월의 이 두 가지 내용은 모두 같은 방식으로 끝납니다. 두 변경 가운데 어느 쪽이든 적용을 받으려면 예전 논문을 다시 제출하라는 것입니다. 따라서 여기서 설명하는 것은 예전 보고서가 어떻게 만들어졌는지가 아니라 지금 보고서가 어떻게 만들어지는지입니다. 그리고 이 표의 어느 것도 조언이 아닙니다. 그중 두 항목은 문서를 읽기 어렵게 만드는 변경을 설명하고 있으며, 논의 절을 요약 목록으로 받아든 평가자는 그것을 알아챕니다. 이 목록을 알아두어야 하는 이유는 진단입니다. 그중 어느 한 항목이 수정 내용에 해당한다면, 그 움직임에는 설명이 붙습니다. 게다가 그 설명은 문장이 어떻게 읽히는지에 대해서는 아무것도 말하지 않습니다. 참고문헌 목록의 경우에는 제대로 얽힌 사정이 따로 있으며, 이는 Turnitin이 내 참고문헌에 표시를 붙인 이유에서 하나씩 풀어 두었습니다.

강조 표시가 줄어드는 것과 숫자가 내려가는 것은 같은 사건이 아닙니다

대부분은 먼저 강조 표시를 확인합니다. 그 목록이 짧아지는 것이 가장 진전처럼 느껴지는 부분이기 때문입니다. Turnitin은 둘이 어긋날 수 있다고 분명히 밝히고 있습니다.

"This means that a document containing several different writing types would result in a disparity between the percentage and the highlights." (즉, 여러 가지 서로 다른 유형의 글을 담은 문서에서는 백분율과 강조 표시 사이에 차이가 생깁니다.)

따라서 지난번보다 강조 표시된 부분은 줄었는데 숫자는 올랐다는 이야기는, 풀어야 할 모순이 아닙니다. 분모가 다른 두 양을 하나로 읽고 있을 뿐입니다. 게다가 20% 기준선 아래에서는 셀 것이 아예 없습니다. Turnitin은 1%에서 19% 사이의 결과에 대해서는 점수와 강조 표시를 모두 공개하지 않습니다. 따라서 강조 표시가 없는 보고서가 표시된 것이 하나도 없는 보고서는 아닙니다. 보고서의 각 부분은 Turnitin AI 작성 보고서 읽는 법에서 하나씩 짚어 보았습니다.

짧은 제출물은 덜 안정적인 제출물입니다

수정이 동시에 축소이기도 했다면 네 번째 작동 방식이 있습니다. 그리고 그것은 특히 짧은 제출물에 적용됩니다.

"In shorter documents where there are only a few hundred words, the prediction will be mostly 'all or nothing' because we're predicting on a single segment without the opportunity to overlap. This means that some text that is a mix of AI-generated and original content could be flagged as entirely AI-generated." (단어가 몇백 개뿐인 짧은 문서에서는 겹칠 기회 없이 단일 세그먼트에 대해 예측하기 때문에, 예측이 대부분 "전부 아니면 전무"가 됩니다. 이는 AI가 만든 내용과 원래 내용이 섞인 텍스트가 전부 AI가 만든 것으로 표시될 수 있다는 뜻입니다.)

긴 문서를 부드럽게 만들어 주는 겹침은 짧은 문서에서는 사용할 수 없습니다. 그리고 Turnitin이 설명하는 실패 방향은 위쪽입니다. 섞인 내용이 전부 AI로 표시되는 경우입니다. 그 아래에는 하한선도 있습니다. 파일 요구 사항에 따르면 보고서가 아예 생성되려면 최소 300단어의 산문이 필요하며, 이 부분은 Turnitin이 학위논문 전체를 검사할 수 있는지에서 다루었습니다. 이 두 가지 사이에서 보면, 분량을 줄인 수정과 산문을 바꾼 수정은 동시에 진행된 두 개의 실험이며, 보고서는 둘을 합쳐 숫자 하나로 돌려줍니다.

상승이 밝혀 주는 것과 밝혀 주지 않는 것

보고서에는 무엇을 바꾸었는지에 대한 기록이 어디에도 없습니다. 그 움직임을 특정한 수정에 돌리는 항목도 없습니다. 따라서 상승은 두 파일에 대한 관찰이며, 그 사이에 이루어진 작업에 대한 판단이 아닙니다.

  • 상승은 수정 때문에 글이 AI처럼 보이게 되었다는 것을 밝혀 주지 않습니다. 위에서 설명한 작동 방식에 따르면, 다시 쓴 모든 문장이 깨끗하게 돌아와도 숫자는 오를 수 있습니다.
  • 상승은 첫 번째 숫자가 신뢰할 만한 것이었다는 것을 밝혀 주지도 않습니다. 두 보고서는 별개의 결과물이며, 어느 쪽도 상대와 다른 이유를 설명하지 않습니다.
  • 상승은 다음 수단이 다시 한 번 쓰기 작업이라는 것을 밝혀 주지도 않습니다. 분모가 움직였다면, 산문을 한 번 더 다듬어도 분자만 바뀝니다.

Turnitin의 FAQ에는 이 대화에 속하는 문장이 하나 더 있습니다. 그리고 그것은 대개 뒷부분이 빠진 채로 인용됩니다.

"Sometimes false positives (incorrectly flagging human-written text as AI-generated), can include content without a lot of structural variation, text that literally repeats itself, or text that has been paraphrased without developing new ideas. If our indicator shows a higher amount of AI writing in such text, we advise you to take that into consideration when looking at the percentage indicated." (때로는 오탐(사람이 쓴 텍스트를 잘못해 AI가 만든 것으로 표시하는 것)에 구조적 변화가 많지 않은 내용, 말 그대로 반복되는 텍스트, 또는 새로운 생각을 전개하지 않고 바꿔 쓴 텍스트가 포함될 수 있습니다. 그러한 텍스트에서 더 많은 양의 AI 작성이 표시된다면, 제시된 백분율을 볼 때 그 점을 고려하시기를 권합니다.)

끝까지 읽으면 그것은 누군가를 향한 고발이 아닙니다. 공급업체가 자사 모델이 잘못 표시할 수 있는 인간의 글쓰기 유형을 지목하고, 보고서를 읽는 사람에게 백분율을 볼 때 그 가능성을 고려하라고 말하는 것입니다. 지도교수가 올라간 숫자를 보고 있다면, 그 주의 문구는 숫자와 같은 페이지에 실려 있습니다. 앞부분을 바탕으로 만든 직접 편집 목록은 도구 없이 AI 텍스트를 사람의 글로 만드는 법에 있고, 총계와 총계를 맞대는 대신 두 보고서를 부분별로 비교하는 방법은 Turnitin 재검사 후에도 계속 표시되는 경우에 있습니다.

보고서 범위의 재작성이 들어맞는 자리

위의 모든 내용은 범위에 관한 논의입니다. 문장 하나를 바꾸면 그 이웃이 무엇과 묶이는지가 달라진다면, 의미 있게 바꿀 수 있는 가장 작은 단위는 문장보다 큽니다. 그리고 마음에 드는 부분은 그대로 두는 편이 좋습니다.

이것이 HumanPen 도구가 공개 보고서 페이지에서 설명하는 범위입니다. DOCX를 Turnitin 또는 iThenticate AI 보고서와 함께 업로드하면, 표시된 부분이 다시 쓸 대상을 정합니다. 나머지는 모두 고정됩니다. 공개된 humanize 페이지에는 청구가 보낸 파일의 크기가 아니라 실제로 다시 쓴 단어 수를 기준으로 이루어진다는 점도 나와 있습니다.

이후 보고서에서도 여전히 일부가 표시된다면, 공개 FAQ에는 표시가 남아 있는 부분에 대한 무료 두 번째 처리가 설명되어 있습니다. 이 서비스 규정은 예측이 아닙니다. 다음 보고서가 어떤 수치를 보여 줄지 말하는 것이 아니며, Turnitin은 수정과 점수 변동 사이의 대응 관계를 공개한 적이 없습니다.

자주 묻는 질문

수정한 뒤에 Turnitin AI 점수가 실제로 오를 수 있습니까? 그럴 수 있으며, 그것은 특이한 일이 아닙니다. 백분율은 문장별 판정을 모아 만드는 것이 아니므로, 고친 문장 수를 따라갈 이유가 없습니다. 겹치는 세그먼트, 달라진 대상 산문의 양, 그리고 짧아진 문서가 각각 따로 그 값을 움직입니다.

숫자가 올라간 것이 수정 때문에 상황이 나빠졌다는 뜻입니까? 그 자체로는 그렇지 않습니다. 보고서에는 무엇을 바꾸었는지에 대한 기록도, 그 움직임을 어떤 수정에 돌리는 내용도 없습니다. 상승은 효과가 있던 수정, 아무 효과가 없던 수정, 그리고 계산 아래에서 구조가 바뀐 문서와 모두 양립합니다.

강조 표시된 문장은 줄었는데 백분율은 더 높습니다. 어느 쪽이 맞습니까? 둘 다 맞습니다. 같은 양을 두 가지 관점에서 본 것이 아니기 때문입니다. Turnitin은 글쓰기 유형이 섞인 문서에서 백분율과 강조 표시 사이에 차이가 생긴다고 말합니다. 백분율은 대상 산문에 대해 계산되는 반면, 강조 표시는 파일 전체에 적용되기 때문입니다.

단어 제한을 맞추려고 본문을 많이 지웠는데 점수가 뛰었습니다. 왜 그렇습니까? 가장 가능성이 높은 것은 분모입니다. 백분율은 대상 산문에 대해 계산됩니다. 따라서 표시되지 않은 산문을 없애면, 표시된 텍스트가 변하지 않아도 표시된 비중이 올라갑니다. 결과가 이제 몇백 단어뿐이라면, Turnitin은 짧은 문서는 대개 전부 아니면 전무로 예측된다고도 말합니다.

논문 전체를 다시 써야 할까요? 그것은 숫자가 부르는 반응이지만, 근거가 뒷받침하는 반응인 경우는 드뭅니다. 얼마나 손댈지 정하기 전에 두 보고서에서 강조 표시가 어디에 있는지 비교해 보시기 바랍니다. 그리고 숫자, 인용문, 정의, 방법 절차처럼 정확한 표현 자체에 의미가 있는 부분은 고정해 두시기 바랍니다.

계속 읽기