Como a estrutura do ensaio afeta sua pontuação de IA no Turnitin

A forma como você estrutura o ensaio pode afetar sua pontuação de IA. As perguntas frequentes do Turnitin listam, entre os textos propensos a falsos positivos, aqueles com pouca variação estrutural, os que se repetem literalmente e os parafraseados sem apresentar ideias novas. Uma nota de versão de 2023 descreve um padrão em que a primeira e a última frase de um documento tinham mais probabilidade de serem marcadas por engano. Veja o que a documentação realmente diz.

Equipe HumanPen

· 5 min de leitura

A resposta curta

A estrutura do ensaio pode afetar sua pontuação de IA no Turnitin porque as perguntas frequentes listam explicitamente características estruturais que geram falsos positivos. Entre elas estão "content without a lot of structural variation, text that literally repeats itself, or text that has been paraphrased without developing new ideas." (conteúdo com pouca variação estrutural, texto que se repete literalmente ou texto parafraseado sem desenvolver ideias novas). As perguntas frequentes orientam os professores a "take that into consideration when looking at the percentage indicated" (levar isso em consideração ao observar a porcentagem indicada) nesse tipo de texto. Uma nota de versão de maio de 2023 também descreve um padrão em que a primeira e a última frase de um documento apresentavam maior incidência de falsos positivos, muitas vezes porque consistiam em "introduction or conclusion content written in a generic way." (conteúdo de introdução ou conclusão escrito de forma genérica). A lógica de detecção foi alterada para reduzir isso, mas o padrão estrutural de fundo — introduções e conclusões genéricas — permanece. Se o seu ensaio tem ritmo de frase uniforme, formulações repetitivas ou uma introdução e uma conclusão formulaicas, essas características podem contribuir para uma pontuação mais alta mesmo quando o conteúdo é inteiramente seu.

Variação estrutural e falsos positivos

As perguntas frequentes apontam características específicas do texto que costumam gerar falsos positivos:

"Sometimes false positives (incorrectly flagging human-written text as AI-generated), can include content without a lot of structural variation, text that literally repeats itself, or text that has been paraphrased without developing new ideas." (Às vezes os falsos positivos (marcar incorretamente como gerado por IA um texto escrito por uma pessoa) podem incluir conteúdo com pouca variação estrutural, texto que se repete literalmente ou texto parafraseado sem desenvolver ideias novas.)

A frase seguinte: "If our indicator shows a higher amount of AI writing in such text, we advise you to take that into consideration when looking at the percentage indicated." (Se o nosso indicador mostra uma quantidade maior de escrita com IA nesse tipo de texto, recomendamos que você leve isso em consideração ao observar a porcentagem indicada.)

Isso significa que as próprias perguntas frequentes reconhecem que certos padrões estruturais da escrita humana podem provocar pontuações de IA mais altas. Um ensaio em que todos os parágrafos seguem a mesma estrutura, em que as frases têm comprimento e ritmo parecidos, ou em que expressões-chave se repetem para dar ênfase, pode corresponder a esse perfil de falso positivo. A orientação oficial é não tratar a porcentagem como definitiva nesse tipo de texto. Por que os detectores de IA sinalizam ensaios bem escritos é a mesma observação pelo lado da qualidade.

Como o modelo avalia seu texto

O modelo de detecção processa a prosa elegível dividindo-a em segmentos sobrepostos:

"When a paper is submitted to Turnitin, sentences from the submission are extracted and segmented into overlapping sections for prediction analysis. Each segment is classified by the AI detection model and given a value between 0 and 1, denoting the probability of the text being likely human or AI-generated." (Quando um trabalho é enviado ao Turnitin, as frases do envio são extraídas e divididas em seções sobrepostas para a análise de predição. Cada segmento é classificado pelo modelo de detecção de IA e recebe um valor entre 0 e 1, que indica a probabilidade de o texto ser provavelmente humano ou gerado por IA.)

O modelo não é programado para avaliar burstiness ou perplexity como métricas nomeadas: "Our model is not explicitly programmed to evaluate specific signals such as 'burstiness,' 'perplexity,' or other individual metrics sometimes referenced in public discussions." (Nosso modelo não é programado explicitamente para avaliar sinais específicos como 'burstiness', 'perplexity' ou outras métricas individuais às vezes citadas em discussões públicas.) A frase seguinte: "Instead, it learns statistical patterns from our training data." (Em vez disso, ele aprende padrões estatísticos a partir dos nossos dados de treinamento.) As mesmas perguntas frequentes afirmam ainda: "Our classifiers are trained to detect these differences in word probability and are adept at the particular word probability sequences of human writers." (Nossos classificadores são treinados para detectar essas diferenças na probabilidade das palavras e conhecem bem as sequências de probabilidade de palavras típicas de quem escreve como humano.) Portanto, o modelo avalia padrões de probabilidade das palavras, e não métricas de superfície, mas uma estrutura de frase uniforme ainda pode produzir padrões que o modelo associa a texto gerado por IA. O que os detectores de IA medem além de perplexity e burstiness é a explicação mais longa.

Introduções e conclusões

Uma nota de versão de maio de 2023 descreve um padrão observado desde o lançamento:

"Since launch, we have observed a higher incidence of false positive detection in the first few or last few sentences of a document. Many times these sentences consist of introduction or conclusion content written in a generic way." (Desde o lançamento, observamos maior incidência de falsos positivos nas primeiras ou nas últimas frases de um documento. Muitas vezes essas frases consistem em conteúdo de introdução ou conclusão escrito de forma genérica.)

A frase seguinte: "As a result, we have changed our detection logic to help reduce these false positives." (Como resultado, alteramos nossa lógica de detecção para ajudar a reduzir esses falsos positivos.)

Aquilo foi uma melhoria de 2023, não um defeito atual. A lógica de detecção foi atualizada para reduzir falsos positivos nessas posições. O padrão de fundo, porém, permanece: introduções e conclusões tendem a usar uma linguagem genérica e formulaica que pode se parecer com a saída de uma IA. Se o seu ensaio começa com afirmações amplas e termina com um resumo que repete seus pontos principais, essas seções podem continuar mais vulneráveis a falsos positivos do que os parágrafos do desenvolvimento.

Ensaios curtos e previsões de tudo ou nada

As perguntas frequentes descrevem como documentos curtos se comportam sob o modelo de detecção:

"In shorter documents where there are only a few hundred words, the prediction will be mostly 'all or nothing' because we're predicting on a single segment without the opportunity to overlap." (Em documentos mais curtos, onde há apenas algumas centenas de palavras, a previsão será quase sempre 'all or nothing' (tudo ou nada), porque estamos prevendo com base em um único segmento, sem oportunidade de sobreposição.)

A frase seguinte: "This means that some text that is a mix of AI-generated and original content could be flagged as entirely AI-generated." (Isso significa que parte do texto que mistura conteúdo gerado por IA e conteúdo original pode ser sinalizada como inteiramente gerada por IA.)

Ensaios curtos enfrentam esse problema porque oferecem menos segmentos para o modelo avaliar. Sem segmentos sobrepostos que suavizem erros individuais de previsão, a pontuação se torna binária. Um ensaio de 500 palavras com uma introdução estruturalmente uniforme pode receber uma pontuação extrema que não reflete a mistura real de conteúdo humano e de IA presente nele.

A porcentagem não é a única base

As perguntas frequentes enfatizam que a pontuação não deve ser tratada como definitiva:

"Hence, we must emphasize that the percentage on the AI writing indicator should not be used as the sole basis for action or a definitive grading measure by instructors." (Por isso, precisamos enfatizar que a porcentagem no indicador de escrita com IA não deve ser usada como única base para uma ação nem como medida definitiva de avaliação por parte dos professores.)

Isso importa para a estrutura do ensaio porque uma escrita estruturalmente uniforme pode inflar a pontuação. Se o seu ensaio corresponde às características propensas a falsos positivos descritas nas perguntas frequentes, a porcentagem pode exagerar o conteúdo real de IA. A orientação da própria documentação é considerar a pontuação junto com outras evidências, e não como um veredito isolado. Se você deve mesmo assim reestruturar sua escrita é outra decisão: você deve mudar sua forma de escrever para evitar ser sinalizado.

O que isso significa para você

Para resumir o que vimos:

  • As perguntas frequentes listam pouca variação estrutural, repetição literal e paráfrase sem ideias novas como características propensas a falsos positivos.
  • Os professores são orientados a "take into consideration" (levar em consideração) a porcentagem nesse tipo de texto.
  • Uma nota de versão de 2023 descreveu falsos positivos concentrados na primeira e na última frase, muitas vezes conteúdo genérico de introdução ou conclusão.
  • A lógica de detecção foi atualizada para reduzir isso, mas o padrão estrutural permanece.
  • Ensaios curtos recebem previsões de tudo ou nada por causa da avaliação de um único segmento.
  • As perguntas frequentes dizem que a porcentagem não deve ser usada como única base para agir.

Se você recebeu um relatório de IA do Turnitin e quer tratar das passagens sinalizadas, importe o relatório e trabalhe nelas. As passagens elegíveis podem ser processadas novamente sem custo.

Continue lendo