Por que a Turnitin diz que o seu trabalho é 100% IA

100% não é uma versão mais confiante de 60%. Na explicação que a própria Turnitin dá de como o número é montado, os extremos são exatamente o ponto em que o cálculo tinha menos elementos sobre os quais fazer uma média.

Equipe HumanPen

· 11 min de leitura

Comece por aqui, antes da explicação

Três situações produzem um 100 com muito mais frequência do que a ideia de que cada frase que você escreveu parece ter saído de uma máquina, e você pode confirmá-las ou descartá-las em cerca de dez minutos. Verifique qual número você tem nas mãos: segundo a Turnitin, o indicador de escrita por IA não é visível para os alunos, então uma porcentagem que você mesmo encontrou, dentro da sua própria visualização, é a pontuação de similaridade e não a de IA. Verifique quanta prosa o arquivo contém: a Turnitin diz que, em documentos de apenas algumas centenas de palavras, a previsão é "mostly 'all or nothing'" (na maior parte das vezes "tudo ou nada"), porque é feita sobre um único segmento, sem chance de sobreposição. Verifique do que é o 100: a porcentagem é calculada sobre o texto elegível, e a Turnitin diz que esse número "is not necessarily the percentage of the entire submission" (não é necessariamente a porcentagem de toda a submissão). Só quando as três forem descartadas faz sentido perguntar o que o modelo viu na escrita em si.

As três pedem respostas completamente diferentes, e é por isso que a ordem importa mais do que a explicação. Esta página é sobre como um número extremo é produzido. Não é um roteiro para uma reunião sobre má conduta, e nada aqui prevê o que um relatório futuro vai dizer.

Primeiro, verifique qual 100 você tem nas mãos

A Turnitin é explícita sobre quem pode ver o número de IA. As suas orientações dizem que "only instructors and administrators are able to see the indicator" (apenas instrutores e administradores podem ver o indicador) e, separadamente, que "The AI writing detection indicator and report are not visible to students." (O indicador e o relatório de detecção de escrita por IA não são visíveis para os alunos). A frase logo depois da segunda importa igualmente: "However, with the PDF download feature, instructors can download and share the AI report with students." (No entanto, com o recurso de download em PDF, os instrutores podem baixar e compartilhar o relatório de IA com os alunos). Então os dois caminhos existem. Um PDF que alguém lhe enviou pode muito bem ser o relatório de IA. Uma porcentagem na qual você mesmo clicou, na sua própria visualização da submissão, não é o indicador de IA.

Isso deixa o outro número, e aí o 100 é um valor muito mais comum. Uma pontuação de similaridade de 100% tem um caminho documentado e totalmente inocente: os seus próprios rascunhos anteriores, armazenados por uma tarefa diferente, combinando com a sua versão final quase palavra por palavra. Nós rastreamos como isso acontece, e quando não acontece, em o meu rascunho anterior vai coincidir com a minha nova submissão. Os dois relatórios são análises separadas que podem discordar nas quatro direções, que é o tema de relatório de IA contra relatório de similaridade.

Um 100 do lado da similaridade e um 100 do lado da IA são constatações diferentes, com causas diferentes e respostas diferentes. Passar uma noite inteira no número errado é a forma mais comum de isso acabar mal.

Documentos curtos são avaliados em tudo ou nada

A descrição publicada pela Turnitin do cálculo tem três movimentos: as frases são extraídas e agrupadas em segmentos sobrepostos, cada segmento recebe uma probabilidade entre 0 e 1, e cada frase elegível herda a pontuação de cada segmento em que está. Como os segmentos se sobrepõem, uma frase perto de uma fronteira carrega mais de uma pontuação, que depois é reunida. São essas pontuações reunidas das frases que são agregadas no número do documento. A média é toda a razão pela qual um documento pode voltar com 43 em vez de com uma das pontas.

Agora tire isso. As perguntas frequentes da Turnitin dizem o que acontece quando não há nada sobre o que fazer uma média:

"In shorter documents where there are only a few hundred words, the prediction will be mostly 'all or nothing' because we're predicting on a single segment without the opportunity to overlap. This means that some text that is a mix of AI-generated and original content could be flagged as entirely AI-generated." (Em documentos mais curtos, com apenas algumas centenas de palavras, a previsão será na maior parte das vezes "tudo ou nada", porque estamos prevendo sobre um único segmento, sem oportunidade de sobreposição. Isso significa que um texto que mistura conteúdo gerado por IA e conteúdo original pode ser marcado como inteiramente gerado por IA.)

Leia isso como uma afirmação sobre resolução, não sobre precisão. Em um documento longo, um 100 significaria que um grande número de previsões separadas caiu todo do mesmo lado. Em um documento de algumas centenas de palavras, pode significar uma única previsão, que a interface depois mostra como porcentagem. As duas coisas são exibidas de forma idêntica e não são o mesmo tipo de evidência, e a segunda frase daquela citação diz abertamente que é o conteúdo misto que acaba sendo atingido.

Há um piso por baixo disso. Uma submissão precisa de pelo menos 300 palavras de prosa em formato longo antes mesmo de um relatório de IA ser gerado. Então o arquivo mais curto que pode receber um número é também aquele cujo número se apoia no menor número de observações independentes, e a faixa logo acima do piso é onde esses dois fatos se sobrepõem. Um trabalho reflexivo de 900 palavras, o relatório curto de uma lista de exercícios, um resumo de conferência esticado até atingir a extensão: todos estão na zona que a Turnitin descreve. O que acontece na outra ponta da faixa, quando uma tese excede o que um relatório cobre, nós examinamos em a Turnitin pode verificar uma tese inteira.

100% de quê, exatamente?

A porcentagem não é calculada sobre o seu documento. Ela é calculada sobre o que a Turnitin chama de texto elegível, e a definição é estreita: "This qualifying text includes only prose sentences, meaning that we only analyze blocks of text that are written in standard grammatical sentences and do not include other types of writing such as lists, bullet points (short non-sentence structures), or other non-sentence structures." (Este texto elegível inclui apenas frases de prosa, o que significa que analisamos apenas blocos de texto escritos em frases gramaticalmente padrão e não incluímos outros tipos de escrita como listas, marcadores (estruturas curtas que não são frases) ou outras estruturas que não são frases.) A frase que vem depois é a que você deve guardar: "This percentage is not necessarily the percentage of the entire submission." (Esta porcentagem não é necessariamente a porcentagem de toda a submissão.)

Algumas exclusões são declaradas separadamente. As notas de versão da Turnitin registram que um erro que marcava escrita por IA dentro de bibliografias foi corrigido e que "Bibliographies are now excluded when processing the AI writing report" (As bibliografias agora são excluídas ao processar o relatório de escrita por IA), e em outro lugar que "We are now able to process long-form prose text in tables." (Agora conseguimos processar texto de prosa longo em tabelas). As duas entradas terminam do mesmo jeito, com uma instrução para não assumir que a mudança se aplica ao que você já enviou: reenvie para reprocessar. Assim, uma lista de referências fica fora do cálculo, e parágrafos dentro de uma tabela ficam dentro dele, o que não é a intuição que a maioria das pessoas tem sobre nenhuma das duas coisas.

Faça um arquivo real passar por isso. Um relatório de laboratório de 5.000 palavras com uma tabela de métodos, três listas de protocolo com marcadores, um apêndice e 60 referências pode conter 2.000 palavras elegíveis. Um 100 nesse relatório é uma afirmação sobre aquelas 2.000 palavras. Não é uma afirmação sobre as outras 3.000, que nunca foram avaliadas e que não podem ser defendidas nem atacadas com base no número.

Isso também explica por que um 100 pode conviver com páginas que não têm marcação nenhuma. A Turnitin diz que um documento com vários tipos diferentes de escrita "would result in a disparity between the percentage and the highlights" (resultaria em uma disparidade entre a porcentagem e as marcações). No topo da faixa, essa disparidade parece uma contradição, e é um comportamento esperado.

Contar linhas marcadas e compará-las com a porcentagem não vai resolver isso, porque as duas coisas são calculadas sobre coisas diferentes. Como ler um relatório de escrita por IA da Turnitin examina os outros estados do relatório pela mesma razão.

Quando o documento é longo e mesmo assim volta no topo

Se o arquivo tem 8.000 palavras de prosa contínua, a explicação do segmento único desaparece. Muitas previsões separadas de fato caíram do mesmo lado, e a pergunta passa a ser o que faria um documento inteiro parecer igual ao modelo do começo ao fim. A Turnitin publica uma resposta parcial, na forma das propriedades que diz aparecer em seus próprios falsos positivos:

"Sometimes false positives (incorrectly flagging human-written text as AI-generated), can include content without a lot of structural variation, text that literally repeats itself, or text that has been paraphrased without developing new ideas. If our indicator shows a higher amount of AI writing in such text, we advise you to take that into consideration when looking at the percentage indicated." (Às vezes os falsos positivos (marcar incorretamente texto escrito por um humano como gerado por IA) podem incluir conteúdo sem muita variação estrutural, texto que se repete literalmente, ou texto que foi parafraseado sem desenvolver novas ideias. Se o nosso indicador mostra uma quantidade maior de escrita por IA em um texto assim, recomendamos que você leve isso em consideração ao olhar a porcentagem indicada.)

Aquelas três propriedades são todas propriedades de um documento inteiro, e não de uma frase. Essa é a nossa leitura e não algo que a Turnitin afirma, mas é a parte que se ajusta à forma da pergunta: um trabalho escrito seguindo uma ordem de seções obrigatória, em uma disciplina com uma maneira fixa de formular um parágrafo de métodos, que repete os seus próprios objetivos no resumo, depois na introdução e depois na discussão, tem mais ou menos o mesmo caráter em cada segmento. Não há nenhuma passagem que difira o suficiente das vizinhas para puxar o agregado para baixo. A uniformidade não é um defeito de escrita, e em vários gêneros ela é o requisito, que é exatamente o motivo pelo qual o resultado é difícil de contestar apontando um único parágrafo.

A segunda frase daquela citação é uma instrução do fornecedor a quem está lendo a pontuação, não uma defesa que você constrói. O que de fato mudou decisões é outro assunto, e nós escrevemos sobre isso a partir de casos publicados em marcado, mas foi você quem escreveu. Se uma edição for apropriada e permitida, as propriedades naquela lista são também a coisa mais próxima de uma especificação para fazer isso à mão, que é a abordagem em como humanizar texto de IA sem uma ferramenta.

O que um 100 não resolve

Uma coisa que vale saber antes de você construir qualquer argumento sobre o número estar exagerado: a calibragem publicada vai na direção oposta. A Turnitin diz que "In order to maintain this low rate of 1% for false positives, there is a chance that we might miss some AI written text in a document" (Para manter esta baixa taxa de 1% de falsos positivos, há a chance de que deixemos passar algum texto escrito por IA em um documento), e dá a direção do erro: "if we identify that 50% of a document is likely written by an AI tool, it could contain as much as 65% AI writing." (se identificarmos que 50% de um documento provavelmente foi escrito por uma ferramenta de IA, ele pode conter até 65% de escrita por IA). Seja lá o que mais estiver acontecendo, a ideia de que a ferramenta foi feita para relatar demais não é o projeto que o fornecedor descreve.

Isso não transforma um 100 em uma constatação. A Turnitin declara em três páginas de ajuda separadas que o seu modelo pode identificar mal texto escrito por humanos, gerado por IA e parafraseado por IA, e que não deve ser a única base para uma medida desfavorável a um aluno. E a afirmação de precisão que as pessoas jogam umas nas outras carrega uma ressalva que se perde no caminho, a qual nós desmontamos em o que significa uma taxa de falsos positivos de 1%. Também não existe nenhum limiar publicado a partir do qual um número se torna má conduta, em nenhuma das duas direções: 20% de IA é alto demais cobre por que o 20 na interface é uma regra de exibição e não uma regra sobre você.

Se foi você quem escreveu, reescrever é o primeiro passo errado. Isso muda o objeto em discussão e responde a uma pergunta que ninguém fez.

Onde uma ferramenta de reescrita se encaixa, e onde um 100 a torna inútil

Vale dizer com clareza, mesmo que isso vá contra nós: em 100, aquilo para o que a ferramenta HumanPen normalmente serve não tem nada em que se apoiar. Você envia o documento junto com o relatório da Turnitin ou do iThenticate e apenas os trechos correspondidos pelo relatório são reescritos, com o resto preservado palavra por palavra, e a cobrança conta apenas as palavras efetivamente reescritas. Isso é uma economia real em 30%, onde dois terços do arquivo nunca são tocados nem cobrados. Em 100%, o relatório marcou tudo, então o escopo é o documento inteiro e o custo é uma passada completa. Se você esperava que o relatório reduzisse o trabalho, o 100 é o único número em que ele não faz isso.

Se um novo relatório ainda marcar trechos, os trechos elegíveis podem ser reprocessados sem custo.

Nada disso é uma promessa sobre um resultado de detecção, e nós não vamos fazer uma. Nenhuma ferramenta pode dizer o que uma versão futura do modelo vai produzir sobre um documento que ela não viu, e quem oferece uma pontuação garantida está descrevendo algo que não controla. Há também casos em que a ferramenta é simplesmente o instrumento errado: se a sua posição é que o trabalho é seu, o número não é o objeto a ser consertado.

Perguntas frequentes

100% significa que todas as frases que escrevi foram marcadas? Não. A porcentagem é calculada sobre o texto elegível, que exclui listas, marcadores e outras estruturas que não são frases, e a Turnitin diz que o número não é necessariamente a porcentagem de toda a submissão. Um arquivo com tabelas extensas, listas e uma seção de referências pode mostrar 100% enquanto grandes partes dele nunca foram avaliadas.

O meu ensaio tem só 600 palavras. É essa a explicação? É a primeira coisa a verificar. A própria Turnitin descreve assim: em documentos de algumas centenas de palavras, a previsão é na maior parte das vezes "all or nothing" (tudo ou nada), porque funciona a partir de um único segmento, sem oportunidade de sobreposição, e por isso uma mistura de conteúdo gerado por IA e conteúdo original pode ser marcada como inteiramente gerada por IA.

Vi o número na minha própria visualização da Turnitin. É a pontuação de IA? Quase certamente não. A Turnitin diz que apenas instrutores e administradores podem ver o indicador de IA e que ele não é visível para os alunos, embora os instrutores possam baixar o relatório de IA em PDF e compartilhá-lo. Uma porcentagem à qual você mesmo chegou é a pontuação de similaridade, que tem os seus próprios caminhos comuns até 100.

Alguma ferramenta pode garantir que o próximo relatório será mais baixo? Não, e trate essa afirmação como um sinal de alerta. As versões dos detectores mudam, e ninguém fora do fornecedor pode se comprometer com o resultado de uma versão do modelo que ainda não rodou. O que um serviço de revisão pode definir é escopo e custo, não uma pontuação.

Continue lendo