Turnitin은 표 안의 텍스트를 읽을까요? 표와 산문 규칙
표 안의 텍스트는 예전에 Turnitin의 AI 탐지기에 보이지 않았습니다. 하지만 달라졌습니다. 지금 무엇이 처리되고 무엇이 여전히 제외되는지, 그리고 백분율과 하이라이트가 왜 자주 어긋나는지 정리했습니다.
HumanPen 팀
· 5분
표를 둘러싼 혼란
데이터 표가 들어 있는 논문을 제출한 뒤 AI 작성 보고서를 한참 들여다보신 적이 있다면, Turnitin이 정확히 무엇을 분석했는지 궁금하셨을 것입니다. 혼란스러운 것도 무리가 아닙니다. 오랫동안 Turnitin의 도움말 문서에는 이렇게 적혀 있었습니다. "The model does not reliably detect AI-generated text in the form of non-prose, such as poetry, scripts, or code, nor does it detect short-form/unconventional writing such as bullet points, tables, or annotated bibliographies." (이 모델은 시, 대본, 코드처럼 산문이 아닌 형태의 AI 생성 텍스트를 안정적으로 탐지하지 못하며, 글머리 기호, 표, 주석이 달린 참고문헌 목록과 같은 짧거나 비정형적인 글도 탐지하지 못합니다.)
이 표현은 표를 시나 대본, 즉 탐지기가 손대지 않는 형식과 같은 범주에 놓았습니다. 학생과 교수자는 이를 표 안의 모든 텍스트가 완전히 무시된다는 뜻으로 받아들였습니다. 합리적인 해석이었지만, 그것이 전부는 아니었습니다.
실제로 Turnitin의 AI 탐지는 자사가 산문 문장이라고 부르는 것만 처리합니다. 문서에서는 이렇게 설명합니다. "This qualifying text includes only prose sentences, meaning that we only analyze blocks of text that are written in standard grammatical sentences and do not include other types of writing such as lists, bullet points (short non-sentence structures), or other non-sentence structures." (이 대상 텍스트에는 산문 문장만 포함됩니다. 즉, 표준적인 문법을 갖춘 문장으로 작성된 텍스트 블록만 분석하며, 목록, 글머리 기호(문장이 아닌 짧은 구조), 그 밖의 비문장 구조는 포함하지 않습니다.) 표가 제외된 것은 표에 대한 특별한 규칙 때문이 아닙니다. 표 내용의 대부분이 애초에 산문에 해당하지 않았기 때문입니다.
표 안에서 Turnitin이 처리할 수 있는 것
Turnitin은 처리 로직을 업데이트했습니다. AI 작성 탐지 모델 페이지(guides.turnitin.com/hc/en-us/articles/28294949544717-AI-writing-detection-model)의 2023년 8월 9일 자 항목에는 이렇게 적혀 있습니다. "We are now able to process long-form prose text in tables." (이제 표 안의 장문 산문 텍스트를 처리할 수 있습니다.) 이는 의미 있는 변화입니다. 표에 표준적인 문법 형식으로 작성된 완전한 문장이 들어 있다면, 그 문장은 이제 AI 탐지 모델의 분석을 받습니다.
핵심 표현은 장문 산문 텍스트입니다. "연구 결과는 변인 X와 변인 Y 사이에 통계적으로 유의한 상관관계가 있으며, p값이 0.01 미만임을 보여준다"라고 적힌 표의 셀은 표준적인 산문 문장입니다. 이 문장은 처리됩니다. 반면 "p < 0.01"이나 "변인 X, 0.85"라고 적힌 셀은 문장이 아닙니다. 그것은 데이터 조각이며, 건너뜁니다.
이 구분이 중요한 이유는 많은 학술 표가 완전한 문장과 짧은 데이터 항목을 섞어 담고 있기 때문입니다. 문장 부분은 분석되고, 데이터 부분은 분석되지 않습니다. 표 전체가 포함되거나 제외된다고 단정하실 수 없습니다. Turnitin은 내용을 블록 단위로 평가하며, 그것이 표 셀 안에 있든 본문에 있든 상관없이 표준적인 문법의 문장을 찾습니다.
같은 항목은 이렇게 안내하기도 합니다. "Resubmit to reprocess existing submissions that contain tables." (표가 포함된 기존 제출물을 다시 처리하려면 재제출하세요.) 이 업데이트 이전에 논문을 제출하셨다면, 그 제출물의 표 산문은 처리되지 않았습니다. 재제출하면 업데이트된 로직이 적용됩니다.
제외되는 것
표 산문 업데이트 이후에도 여러 유형의 콘텐츠는 AI 탐지 분석 범위 밖에 남아 있습니다. 산문만 처리한다는 규칙 때문에 글머리 기호, 문장이 아닌 짧은 구조, 목록은 처리되지 않습니다. 표에 완전한 문장이 아닌 짧은 조각이 들어 있다면, 그 조각은 제외됩니다.
참고문헌 목록도 같은 날 수정되었습니다. 2023년 8월 9일 자 항목에는 이렇게 적혀 있습니다. "We have fixed a bug that was occasionally highlighting AI writing within references listed in a bibliography. Bibliographies are now excluded when processing the AI writing report." (참고문헌 목록에 실린 참고문헌 안의 AI 작성 부분이 간헐적으로 강조 표시되던 오류를 수정했습니다. 이제 AI 작성 보고서를 처리할 때 참고문헌 목록은 제외됩니다.) 이 수정은 참고문헌 항목이 지적되어 오해를 부르는 결과가 나오던 구체적인 문제를 해결한 것입니다. 안내는 분명합니다. "Resubmit to reprocess existing submissions that contain highlighted reference sections." (강조 표시된 참고문헌 섹션이 있는 기존 제출물을 다시 처리하려면 재제출하세요.)
따라서 제외 목록에는 짧은 표 조각, 글머리 기호, 데이터 항목, 그리고 이제는 참고문헌 목록 전체가 포함됩니다. 탐지기는 본문과 표 셀의 산문 문장에 집중하고 나머지는 건너뜁니다. 이는 시스템의 결함이 아닙니다. 탐지 모델이 데이터 형식이나 인용 구조가 아니라 산문으로 학습되었다는 사실에 기반한 설계상의 선택입니다.
백분율과 하이라이트가 일치하지 않는 이유
가장 흔한 혼란 중 하나는 AI 작성 백분율과 보고서에서 강조 표시된 텍스트 사이의 간격입니다. 문서는 이 점을 직접 다룹니다. "This means that a document containing several different writing types would result in a disparity between the percentage and the highlights." (즉, 여러 가지 서로 다른 작성 유형이 담긴 문서는 백분율과 하이라이트 사이에 불일치가 생길 수 있습니다.)
문서에 완전한 문장이 든 표, 짧은 데이터 조각, 글머리 기호, 참고문헌 목록이 함께 들어 있다면, 산문 문장만 분석됩니다. 백분율은 분석된 산문 가운데 모델이 AI 생성으로 분류한 비율을 보여줍니다. 제출물 전체에서 차지하는 비율은 아닙니다. 문서는 이렇게 적고 있습니다. "This percentage is not necessarily the percentage of the entire submission." (이 백분율이 반드시 제출물 전체에 대한 백분율인 것은 아닙니다.)
그래서 AI 작성 점수는 40%인데 강조 표시된 단락은 몇 개뿐인 상황이 생길 수 있습니다. 하이라이트는 어떤 산문 구간이 지적되었는지를 보여줍니다. 백분율은 분석된 산문에서만 계산됩니다. 표 데이터나 참고문헌 항목처럼 제외된 콘텐츠는 하이라이트에 나타나지 않고, 기대하시는 방식으로 백분율 계산에 반영되지도 않습니다.
이 차이를 이해하시면 보고서를 올바르게 읽으실 수 있습니다. 백분율은 지적된 텍스트와 전체 텍스트의 단순한 비율이 아닙니다. 모델이 실제로 처리한 산문을 바탕으로 한 점수이며, 그것은 문서 전체의 일부에 불과할 수 있습니다.
제출하기 전에 확인하실 사항
표가 포함된 문서를 제출하기 전에 그 표의 내용을 검토해 보시기를 권합니다. 표 셀에 완전한 문장이 들어 있다면 그 문장은 AI 탐지기가 분석합니다. 그 문장이 자신의 글을 그대로 담고 있는지 확인하세요. 표의 산문을 작성할 때 AI를 사용하셨다면, 그 산문도 논문의 다른 문장과 마찬가지로 평가됩니다.
참고문헌 목록을 확인하세요. 참고문헌 목록은 이제 AI 작성 분석에서 제외되므로, 참고문헌이 강조 표시된 텍스트로 나타나지 않아야 합니다. 예전 보고서에서 참고문헌이 지적되었다면, 문서를 재제출하면 참고문헌 목록을 제외하는 업데이트된 로직이 적용됩니다.
문서에 여러 유형의 콘텐츠가 섞여 있다면, 백분율과 강조 표시된 부분이 일관되지 않아 보여도 놀라지 마세요. 문서가 설명하듯, 문서에 여러 가지 서로 다른 작성 유형이 담겨 있으면 백분율과 하이라이트의 불일치는 예상된 일입니다. 어떤 구체적인 산문 구간이 지적되었는지는 하이라이트를 통해 파악하시고, 백분율은 제출물 전체가 아니라 분석된 산문에서 나온 점수로 받아들이세요.
이미 Turnitin AI 작성 보고서를 가지고 계시고 그 보고서에서 지적된 부분을 손보고 싶으시다면, 그 보고서를 가져와서 지적된 부분만 다시 쓰실 수 있습니다. 보고서는 소속 기관의 Turnitin 계정에서 나온 것이어야 합니다. 보고서 자체를 저희가 만들어 드리지는 않습니다.
계속 읽기