O que é o "texto elegível" na detecção de IA do Turnitin? Uma explicação detalhada
Quando o Turnitin informa uma porcentagem de escrita por IA, esse número não cobre todo o seu envio. O modelo analisa apenas o "texto elegível", ou seja, frases em prosa com gramática padrão. Listas, marcadores e estruturas que não formam frases ficam de fora. É por isso que a porcentagem e os trechos destacados nem sempre combinam. Veja o que a documentação diz sobre o que conta, o que não conta e por que isso importa.
Equipe HumanPen
· 5 min de leitura
O que significa "texto elegível"
O modelo de detecção de IA do Turnitin não analisa todas as palavras de um documento. Ele atua sobre um subconjunto específico do texto, o chamado "texto elegível". A documentação define isso com clareza.
"This qualifying text includes only prose sentences, meaning that we only analyze blocks of text that are written in standard grammatical sentences and do not include other types of writing such as lists, bullet points (short non-sentence structures), or other non-sentence structures." (Este texto elegível inclui apenas frases em prosa, o que significa que analisamos somente blocos de texto escritos em frases gramaticais padrão e que não incluem outros tipos de escrita, como listas, marcadores (estruturas curtas que não são frases) ou outras estruturas que não são frases.)
O modelo procura prosa: blocos de texto organizados em frases gramaticais padrão. Tudo o que não alcança esse nível fica fora da análise. Marcadores, listas numeradas, títulos de tabela que não são frases completas e outras estruturas sem prosa ficam excluídos do escopo da detecção de IA.
A própria documentação do modelo reconhece essa limitação: "The model does not reliably detect AI-generated text in the form of non-prose, or code, nor does it detect short-form/unconventional writing such as bullet points (short non-sentence structures)." (O modelo não detecta de forma confiável texto gerado por IA na forma de texto que não é prosa ou de código, e também não detecta escrita curta ou fora do padrão, como marcadores (estruturas curtas que não são frases).)
Se um documento tem muitas listas e pouca prosa, o modelo de detecção de IA tem menos material para trabalhar, e a pontuação informada reflete apenas as partes em prosa. Há também um piso: os requisitos de arquivo pedem pelo menos 300 palavras de prosa antes mesmo de um relatório ser gerado, e é justamente aí que entra a questão de o Turnitin poder verificar uma tese inteira.
A diferença entre a porcentagem e os destaques
Um dos pontos mais confusos do relatório de detecção de IA do Turnitin é que a porcentagem e os trechos destacados parecem contar histórias diferentes. A documentação explica por quê.
"This means that a document containing several different writing types would result in a disparity between the percentage and the highlights." (Isso significa que um documento com vários tipos diferentes de escrita resultaria em uma diferença entre a porcentagem e os destaques.)
"This percentage is not necessarily the percentage of the entire submission." (Esta porcentagem não é necessariamente a porcentagem de todo o envio.)
Se o seu documento tem 50% de prosa e 50% de marcadores, e o modelo de detecção de IA sinaliza 40% da prosa como gerada por IA, o relatório pode mostrar uma pontuação de IA de 40%. Mas esses 40% se referem à prosa elegível, e não ao documento inteiro. Quem lê o relatório sem entender isso pode pensar que todo o envio tem 40% de IA, quando a proporção real no documento completo é menor.
Essa diferença não é um bug. É consequência do escopo do modelo. Entendê-la ajuda você a ler o relatório com precisão, e como ler um relatório de escrita com IA do Turnitin percorre o resto da página.
Como o modelo processa o texto
Para entender por que o texto elegível importa, ajuda saber o que o modelo faz com ele. A documentação descreve o mecanismo:
"When a paper is submitted to Turnitin, sentences from the submission are extracted and segmented into overlapping sections for prediction analysis. Each segment is classified by the AI detection model and given a value between 0 and 1, denoting the probability of the text being likely human or AI-generated." (Quando um trabalho é enviado ao Turnitin, as frases do envio são extraídas e segmentadas em seções sobrepostas para análise de predição. Cada segmento é classificado pelo modelo de detecção de IA e recebe um valor entre 0 e 1, que indica a probabilidade de o texto ser humano ou gerado por IA.)
O modelo extrai as frases, divide-as em seções sobrepostas e classifica cada segmento. Cada segmento recebe uma pontuação de probabilidade entre 0 e 1. Por esse processo passam apenas as frases de prosa elegível. O conteúdo que não é prosa nunca é segmentado nem pontuado, porque o modelo não o trata como texto analisável.
É por isso que o escopo do "texto elegível" determina diretamente o que a porcentagem representa. A pontuação é um agregado das pontuações de probabilidade por segmento, e só as frases de prosa elegível fazem parte desse agregado.
Tabelas entram, bibliografias ficam de fora
Dois tipos específicos de conteúdo têm regras próprias.
Tabelas: "We are now able to process long-form prose text in tables." (Agora conseguimos processar texto em prosa de formato longo em tabelas.) A prosa dentro das células de uma tabela, se escrita em frases gramaticais padrão, agora faz parte do texto elegível. Reenvie os trabalhos existentes que contêm tabelas para que sejam processados novamente. Se você tem um documento com prosa relevante em tabelas e ele foi enviado antes desta atualização, a pontuação de IA pode não refletir o conteúdo das tabelas até que você o reenvie.
Bibliografias: "We have fixed a bug that was occasionally highlighting AI writing within references listed in a bibliography. Bibliographies are now excluded when processing the AI writing report." (Corrigimos um bug que ocasionalmente destacava escrita de IA dentro das referências listadas em uma bibliografia. As bibliografias agora são excluídas no processamento do relatório de escrita com IA.) Reenvie os trabalhos existentes que contêm seções de referências destacadas para que sejam processados novamente. Se o seu relatório anterior mostrava texto sinalizado dentro da sua lista de referências, aquilo era um bug, e reenviar fará com que essas seções fiquem fora da análise. Por que o Turnitin está sinalizando as minhas referências e citações mostra até onde chegam as exclusões do lado da similaridade.
Essas duas regras mostram que a definição de texto elegível não é estática. Ela foi refinada para incluir a prosa em tabelas e excluir bibliografias, e esse é um dos motivos pelos quais a sua pontuação de IA no Turnitin pode mudar ao reenviar sem que o texto mude.
Falsos positivos na prosa elegível
Mesmo dentro da prosa elegível, alguns tipos de escrita são mais propensos a falsos positivos. A documentação aponta padrões específicos.
"Sometimes false positives (incorrectly flagging human-written text as AI-generated), can include content without a lot of structural variation, text that literally repeats itself, or text that has been paraphrased without developing new ideas." (Às vezes os falsos positivos (sinalizar incorretamente como gerado por IA um texto escrito por um humano) podem incluir conteúdo com pouca variação estrutural, texto que se repete literalmente ou texto parafraseado sem desenvolver novas ideias.)
"If our indicator shows a higher amount of AI writing in such text, we advise you to take that into consideration when looking at the percentage indicated." (Se o nosso indicador mostrar uma quantidade maior de escrita por IA nesse tipo de texto, recomendamos que você leve isso em consideração ao olhar a porcentagem indicada.)
Portanto, se a sua prosa é estruturalmente monótona, repete as mesmas formulações ou foi parafraseada sem acrescentar ideias novas, o modelo pode sinalizá-la como gerada por IA mesmo tendo sido escrita por você. Isso não é uma falha do filtro de texto elegível, é o que os detectores de IA medem fazendo exatamente aquilo para o qual foi treinado. É um problema separado, dentro da prosa que de fato entra na análise.
O que isso significa para você
Se você está tentando entender por que o seu relatório de IA do Turnitin tem esse resultado, aqui vai o resumo:
- Só frases em prosa contam. Listas, marcadores e estruturas que não formam frases ficam fora da análise. O modelo se concentra em frases gramaticais padrão.
- A porcentagem cobre apenas a prosa elegível. Não é a porcentagem de todo o envio. Isso cria uma diferença entre o número e os destaques.
- A prosa em tabelas agora é processada. O texto em prosa de formato longo em tabelas conta como texto elegível. Reenvie os trabalhos existentes que contêm tabelas para que sejam processados novamente.
- Bibliografias estão excluídas. O bug que sinalizava referências foi corrigido. Reenvie os trabalhos existentes que contêm seções de referências destacadas para que sejam processados novamente.
- Fique atento aos falsos positivos. Prosa estruturalmente plana, repetitiva ou parafraseada tem mais chance de ser sinalizada. Leve isso em conta ao ler a porcentagem.
Os trechos que cumprem os requisitos podem ser processados novamente sem custo.
Continue lendo