Você reescreveu: a similaridade caiu, mas a pontuação de IA subiu. Veja por quê
Reescrever com outras palavras é a primeira coisa que vem à cabeça para baixar a pontuação de similaridade do Turnitin. Muita gente descobre que, depois de parafrasear, a similaridade caiu… mas a pontuação de detecção de escrita por IA subiu. Isso não é uma falha. As duas pontuações medem coisas completamente diferentes, e mudar o texto para consertar um pode empurrar o outro na direção errada.
Equipe HumanPen
· 6 min de leitura
A resposta curta: duas pontuações, dois sistemas, nenhuma conexão
A pontuação de similaridade e a pontuação de detecção de escrita por IA são medições distintas que não se influenciam. O Turnitin diz isso sem rodeios: "The Similarity score and the AI writing detection percentage are completely independent and do not influence each other." (A pontuação de similaridade e a porcentagem de detecção de escrita por IA são completamente independentes e não se influenciam mutuamente.)
Quando você parafraseia para derrubar a porcentagem de similaridade, não existe nenhum mecanismo que puxe a pontuação de IA junto para baixo. Os dois números podem andar em direções opostas, e isso é comum. Parafrasear muda as palavras do seu documento e reduz as correspondências de cadeias de texto no banco de dados de similaridade. Essas mesmas mudanças podem alterar os padrões de probabilidade das palavras de um jeito que torna mais provável o detector de IA marcar o texto. O resultado é exatamente o cenário que muita gente encontra: a similaridade cai, a pontuação de IA sobe.
O que cada sistema realmente procura
Para entender por que isso acontece, é preciso ver o que cada sistema mede. O relatório de similaridade compara o texto que você envia com um banco de dados de conteúdos já existentes. Como explica o Turnitin, "The Similarity score indicates the percentage of matching-text found in the submitted document when compared to Turnitin's comprehensive collection of content for similarity checking." (A pontuação de similaridade indica a porcentagem de texto correspondente encontrada no documento enviado, quando comparado à ampla coleção de conteúdos que o Turnitin usa para a verificação de similaridade.) Parafrasear reduz essas correspondências porque você está mudando justamente as cadeias de texto que o sistema procura.
O detector de escrita por IA faz algo fundamentalmente diferente. Ele não procura texto correspondente: analisa os padrões estatísticos das suas escolhas de palavras. Veja como o Turnitin descreve o processo: "When a paper is submitted to Turnitin, sentences from the submission are extracted and segmented into overlapping sections for prediction analysis. Each segment is classified by the AI detection model and given a value between 0 and 1, denoting the probability of the text being likely human or AI-generated. Each qualifying sentence within these segments inherits the segment's score. Since segments overlap, some sentences may have multiple scores, which are then pooled into a single score. These sentence scores are further aggregated and used to compute the overall document AI writing score." (Quando um trabalho é enviado ao Turnitin, as frases da submissão são extraídas e divididas em seções sobrepostas para a análise de predição. Cada seção é classificada pelo modelo de detecção de IA e recebe um valor entre 0 e 1, que indica a probabilidade de o texto ser humano ou gerado por IA. Cada frase elegível dentro dessas seções herda a pontuação da seção. Como as seções se sobrepõem, algumas frases podem ter várias pontuações, que depois são reunidas em uma só. Essas pontuações por frase são então agregadas e usadas para calcular a pontuação geral de escrita por IA do documento.)
O sistema de similaridade procura cadeias de texto que já existem em outro lugar. O sistema de IA procura padrões de probabilidade no modo como as palavras são escolhidas. Parafrasear muda as cadeias, o que ajuda a similaridade, mas também muda os padrões de probabilidade, o que pode prejudicar a pontuação de IA. São dois alvos diferentes, e acertar um não significa acertar o outro.
A ironia: parafrasear sem ideias novas é um gatilho conhecido de falsos positivos
É aqui que a situação fica especialmente frustrante. A própria documentação do Turnitin cita o parafraseamento entre as características de textos que podem gerar falsos positivos. O texto completo é este: "Sometimes false positives (incorrectly flagging human-written text as AI-generated), can include content without a lot of structural variation, text that literally repeats itself, or text that has been paraphrased without developing new ideas." (Às vezes os falsos positivos, ou seja, marcar como gerado por IA um texto escrito por uma pessoa, podem incluir conteúdo com pouca variação estrutural, texto que se repete literalmente ou texto que foi parafraseado sem desenvolver ideias novas.)
O Turnitin acrescenta em seguida esta recomendação: "If our indicator shows a higher amount of AI writing in such text, we advise you to take that into consideration when looking at the percentage indicated." (Se o nosso indicador mostra uma quantidade maior de escrita por IA nesse tipo de texto, recomendamos que você leve isso em conta ao observar a porcentagem indicada.)
É aqui que está o centro do problema. Quando você parafraseia para baixar a similaridade, a revisão costuma ficar dentro das ideias que já estão na página. É exatamente o tipo de texto "paraphrased without developing new ideas" (parafraseado sem desenvolver ideias novas) que o Turnitin aponta como propenso a falsos positivos. Você não está acrescentando análise nova, nem argumentos novos, nem evidências novas. As ideias continuam as mesmas, a estrutura em geral continua parecida, e agora o texto se encaixa em um perfil que o detector de IA associa a conteúdo gerado por máquina. As mudanças que você fez para escapar das correspondências de similaridade podem ter produzido um texto que, estatisticamente, parece mais com uma saída de IA, e não menos. Por que parafrasear faz a sua pontuação de IA no Turnitin subir percorre o mesmo mecanismo pela outra ponta.
Probabilidade das palavras: por que uma reescrita pode empurrar a pontuação na direção errada
Uma pergunta frequente é se o detector de IA mede coisas como "perplexity" ou "burstiness", termos que circulam nas discussões sobre detecção de IA; tratamos disso à parte em o Turnitin usa perplexity e burstiness. O Turnitin responde diretamente: "Our model is not explicitly programmed to evaluate specific signals such as 'burstiness,' 'perplexity,' or other individual metrics sometimes referenced in public discussions." (Nosso modelo não é programado explicitamente para avaliar sinais específicos como burstiness, perplexity ou outras métricas individuais às vezes citadas em discussões públicas.) Na frase seguinte, eles acrescentam: "Instead, it learns statistical patterns from our training data." (Em vez disso, ele aprende padrões estatísticos a partir dos nossos dados de treinamento.)
Isso não quer dizer que a probabilidade das palavras seja irrelevante. A mesma documentação continua com um esclarecimento decisivo: "Our classifiers are trained to detect these differences in word probability and are adept at the particular word probability sequences of human writers." (Nossos classificadores são treinados para detectar essas diferenças na probabilidade das palavras e conhecem bem as sequências de probabilidade típicas de quem escreve como humano.)
Juntas, essas duas afirmações dizem algo importante. O modelo não calcula a perplexity como uma métrica com nome próprio, mas é treinado com padrões de probabilidade das palavras. Quando uma reescrita cai na opção mais óbvia em cada posição, pode estar escolhendo ali a palavra mais previsível do ponto de vista estatístico. Se o original era uma escolha incomum e o que entrou no lugar é a escolha mais comum, o padrão de probabilidade fica mais previsível, e não menos. Para um classificador treinado em probabilidade de palavras, sequências mais previsíveis podem parecer mais com texto gerado por IA. Esse é o mecanismo por trás do paradoxo: parafrasear deixa o texto menos parecido com as fontes existentes, mas as palavras escolhidas podem deixá-lo mais previsível estatisticamente, que é justamente o oposto do que derruba uma pontuação de IA.
O que isso significa na prática
A conclusão prática é que baixar a similaridade e baixar a pontuação de IA são dois objetivos diferentes. Eles exigem mudanças diferentes no texto, e as mudanças que ajudam um podem prejudicar o outro. Parafrasear sozinho, principalmente numa revisão que fica dentro das ideias já presentes na página, é exatamente o tipo de abordagem que derruba a similaridade e, ao mesmo tempo, pode elevar a pontuação de IA. Essa distância é também aquilo em que as duas categorias de ferramentas realmente diferem.
O relatório de similaridade trata de saber se as suas cadeias de texto coincidem com conteúdos existentes. O relatório de IA trata de saber se os seus padrões de probabilidade das palavras se parecem com texto gerado por máquina. Tentar resolver os dois com a mesma rodada de edição, principalmente uma rodada que fica dentro das ideias já presentes na página, é exatamente onde surge o conflito. Se a sua pontuação de IA subiu depois de você parafrasear por causa da similaridade, a causa provável é que o parafraseamento mudou seu texto de formas que o detector de IA lê como mais previsíveis, além de se encaixar no perfil de falso positivo de "paraphrased without developing new ideas." (parafraseado sem desenvolver ideias novas).
Resumo do que fazer
Veja o que vale levar disso tudo:
- A pontuação de similaridade e a pontuação de IA são medições independentes. Baixar um não baixa o outro.
- O sistema de similaridade procura cadeias de texto correspondentes. O sistema de IA analisa padrões de probabilidade das palavras. São sinais diferentes.
- "Paraphrased without developing new ideas" (parafraseado sem desenvolver ideias novas) é citado expressamente pelo Turnitin como gatilho de falsos positivos. O critério é se surgiu análise nova, e não qual edição produziu a frase.
- O modelo de IA não é programado para burstiness ou perplexity como métricas com nome próprio, mas é treinado com probabilidade de palavras. Uma rodada que cai na opção mais previsível em cada posição pode deixar o texto com cara de mais gerado por máquina.
- Baixar a similaridade e baixar a pontuação de IA são objetivos separados. Parafrasear sozinho pode ajudar um e prejudicar o outro.
Quando os trechos elegíveis podem ser processados novamente sem custo, você tem espaço para iterar, que é exatamente para o que serve importar o relatório do Turnitin. O ponto decisivo é tratar as duas pontuações como problemas separados, que pedem abordagens separadas.
Continue lendo
Os estudantes estão escrevendo pior para escapar da detecção de IA. E isso se volta contra eles.
6 min de leitura
Relatórios de detecçãoMeu professor me acusou de usar IA: o que fazer nos primeiros 5 minutos
6 min de leitura
Relatórios de detecçãoO Turnitin armazena o seu trabalho? O que as perguntas frequentes realmente dizem
5 min de leitura