Revisei meu trabalho e a pontuação de IA subiu

O número não é construído somando veredictos por frase, então nada na forma como ele é produzido faz com que acompanhe as frases que você corrigiu. Três partes publicadas do cálculo podem empurrá-lo na direção contrária enquanto as suas edições fazem exatamente o que você queria que fizessem.

Equipe HumanPen

· 10 min de leitura

A resposta curta

Um segundo relatório com um número maior que o primeiro não mede o quanto você revisou bem. Três partes publicadas de como o Turnitin produz a porcentagem podem movê-la para cima, cada uma por conta própria. As frases são avaliadas dentro de segmentos sobrepostos, então uma edição muda com o que as suas vizinhas são agrupadas, e o efeito não tem raio fixo. A porcentagem é calculada apenas sobre a prosa elegível, então uma revisão que retira prosa do documento reduz o denominador enquanto o texto sinalizado fica parado. E os destaques que você pode contar e o número na capa são grandezas diferentes, que podem se mover em direções opostas no mesmo relatório.

Nada disso diz que a revisão estava errada ou que o texto piorou. Diz que a grandeza informada não se comporta como a palavra "porcentagem" convida você a supor. Abaixo está cada mecanismo ao lado do documento de onde ele vem, mais um quarto que só morde se a revisão também deixou o documento bem mais curto, e depois o que uma alta estabelece e o que não estabelece.

Nada do que você edita fica no lugar

Comece por como uma frase recebe uma pontuação, porque a resposta é que ela não recebe uma própria. As perguntas frequentes do Turnitin descrevem o processo em um único parágrafo:

"When a paper is submitted to Turnitin, sentences from the submission are extracted and segmented into overlapping sections for prediction analysis. Each segment is classified by the AI detection model and given a value between 0 and 1, denoting the probability of the text being likely human or AI-generated. Each qualifying sentence within these segments inherits the segment's score. Since segments overlap, some sentences may have multiple scores, which are then pooled into a single score. These sentence scores are further aggregated and used to compute the overall document AI writing score." (Quando um trabalho é enviado ao Turnitin, as frases do envio são extraídas e segmentadas em seções sobrepostas para a análise de predição. Cada segmento é classificado pelo modelo de detecção de IA e recebe um valor entre 0 e 1, que indica a probabilidade de o texto ser provavelmente humano ou gerado por IA. Cada frase elegível dentro desses segmentos herda a pontuação do segmento. Como os segmentos se sobrepõem, algumas frases podem ter várias pontuações, que depois são agrupadas em uma única pontuação. Essas pontuações de frase são ainda agregadas e usadas para calcular a pontuação geral de escrita com IA do documento.)

Duas palavras ali carregam todo o problema: "overlapping" (sobrepostos) e "pooled" (agrupados). Uma frase está dentro de mais de um segmento, e cada segmento é classificado em bloco. Então cada pontuação que uma frase carrega foi produzida em parte pelas frases ao lado dela.

Reescreva uma frase e você terá mudado um dado de entrada das pontuações das suas vizinhas, tenha você tocado nelas ou não. Um parágrafo que você deixou intocado de propósito pode voltar destacado porque o segmento que o contém agora contém outro texto. O inverso também acontece, e essa é a versão sobre a qual ninguém escreve para perguntar.

Os próprios limites dos segmentos são uma peça móvel no relato do fornecedor. Em uma nota de versão datada de 24 de maio de 2023, que descreve o trabalho feito para reduzir os falsos positivos no começo e no fim dos documentos, o Turnitin acrescentou:

"We also worked on making our segment boundaries detection more precise which could lead in some rare cases to change of boundaries compared with a previous version." (Também trabalhamos para tornar mais precisa a nossa detecção dos limites dos segmentos, o que em alguns casos raros pode levar a uma mudança dos limites em comparação com uma versão anterior.)

Aquilo foi uma melhoria de 2023, não a descrição de uma falha atual, e vale a pena ler por um motivo bem específico: os limites dos segmentos fazem parte do processo, e o Turnitin documentou que os alterou. As perguntas frequentes também deixam explícito que existem o agrupamento e a agregação. O que não publicam é a regra de agrupamento, qualquer ponderação ou o algoritmo de agregação. Não há, portanto, como descobrir de antemão quais vizinhas uma edição vai mover, nem em que direção.

O denominador pode se mover enquanto você olha para outro lado

O segundo mecanismo não tem nada a ver com classificação. É aritmética, e é o que produz as maiores surpresas.

"This qualifying text includes only prose sentences, meaning that we only analyze blocks of text that are written in standard grammatical sentences and do not include other types of writing such as lists, bullet points (short non-sentence structures), or other non-sentence structures. This percentage is not necessarily the percentage of the entire submission." (Este texto elegível inclui apenas frases em prosa, o que significa que analisamos somente blocos de texto escritos em frases gramaticais padrão e não incluímos outros tipos de escrita como listas, marcadores (estruturas curtas sem forma de frase) ou outras estruturas sem forma de frase. Esta porcentagem não é necessariamente a porcentagem de todo o envio.)

Vamos colocar números nisso. Digamos que a primeira versão tinha 6.000 palavras de prosa elegível, das quais 1.800 voltaram sinalizadas: 30%. Para a segunda versão você reescreve 300 palavras sinalizadas e elas deixam de ser sinalizadas, restando 1.500. Na mesma sentada, porque um orientador disse que a discussão estava pesada, você transforma outras 2.400 palavras em um resumo com marcadores e uma tabela de números. A prosa elegível agora é de 3.600 palavras. 1.500 sobre 3.600 é um pouco menos de 42%. A pontuação subiu doze pontos em uma revisão na qual menos texto foi sinalizado do que antes e nada novo foi sinalizado em lugar nenhum.

Uma mudança que você pode ter feitoO que ela faz com a prosa elegível
Transformou três parágrafos em uma lista com marcadoresEssas palavras saem da análise. O Turnitin cita marcadores e outras estruturas curtas sem forma de frase como coisas que não analisa
Moveu uma descrição para uma tabelaDepende do que foi colocado lá. Uma nota de versão de agosto de 2023 diz que a prosa longa em tabelas passou a ser processada; uma tabela de números não é prosa de qualquer forma
Acrescentou mais vinte referênciasNada, absolutamente. A mesma nota de versão diz que as bibliografias são excluídas quando o relatório de escrita com IA é processado
Cortou 1.500 palavras de prosa não sinalizada para cumprir um limiteO denominador cai e a fatia sinalizada sobe, sem nenhuma mudança no texto sinalizado

Aquelas duas linhas de agosto de 2023 terminam do mesmo jeito, pedindo que você reenvie um trabalho antigo antes que qualquer uma das mudanças se aplique a ele; o que descrevem é como um relatório é produzido agora, e não como um antigo foi produzido. E nada da tabela é um conselho. Duas daquelas linhas descrevem como tornar um documento mais difícil de ler, e um avaliador que recebe uma seção de discussão em marcadores percebe. A razão para conhecer a lista é diagnóstica: se uma daquelas linhas descreve a sua revisão, o movimento tem uma explicação que não diz nada sobre como as suas frases soam. O caso da lista de referências tem o seu próprio emaranhado, que desmontamos em por que o Turnitin sinalizou as minhas referências.

Menos destaques e um número menor não são o mesmo acontecimento

A maioria olha primeiro os destaques, porque uma lista mais curta deles é a parte que parece progresso. O Turnitin diz claramente que os dois podem divergir:

"This means that a document containing several different writing types would result in a disparity between the percentage and the highlights." (Isso significa que um documento com vários tipos diferentes de escrita resultaria em uma disparidade entre a porcentagem e os destaques.)

Portanto, dizer "tenho menos passagens destacadas do que na última vez e o número mesmo assim subiu" não é uma contradição que precise ser resolvida. São duas grandezas com denominadores diferentes lidas como se fossem uma só. E abaixo do limite de 20% não há nada para contar: o Turnitin retém tanto a pontuação quanto os destaques para resultados na faixa de 1% a 19%, então um relatório sem destaques não é um relatório sem nada sinalizado. Passamos pelas partes do relatório uma a uma em como ler um relatório de escrita com IA do Turnitin.

Um envio mais curto é um envio menos estável

Se a revisão também foi um corte, existe um quarto mecanismo, e ele vale sobretudo para os envios curtos:

"In shorter documents where there are only a few hundred words, the prediction will be mostly 'all or nothing' because we're predicting on a single segment without the opportunity to overlap. This means that some text that is a mix of AI-generated and original content could be flagged as entirely AI-generated." (Em documentos mais curtos, onde há apenas algumas centenas de palavras, a predição será quase sempre "tudo ou nada", porque estamos prevendo em um único segmento, sem a oportunidade de sobreposição. Isso significa que algum texto que seja uma mistura de conteúdo gerado por IA e conteúdo original pode ser sinalizado como inteiramente gerado por IA.)

A sobreposição que suaviza um documento longo não está disponível em um curto, e o modo de falha que o Turnitin descreve vai para cima: conteúdo misto sinalizado como inteiramente IA. Há também um piso embaixo disso, já que os requisitos de arquivo pedem pelo menos 300 palavras de prosa antes mesmo de um relatório ser gerado, o que abordamos em o Turnitin pode verificar uma tese inteira. Entre as duas coisas, uma revisão que encurtou o texto e uma revisão que mudou a sua prosa são dois experimentos rodados ao mesmo tempo, e o relatório devolve um único número para os dois.

O que uma alta estabelece e o que não estabelece

Nada no relatório registra o que você mudou. Não há nenhum campo que atribua o movimento a uma edição específica. A alta é, portanto, uma observação sobre dois arquivos, e não um julgamento sobre o trabalho feito entre eles.

  • Não estabelece que as suas edições fizeram o texto parecer mais com IA. Sob os mecanismos acima, o número pode subir enquanto todas as frases que você reescreveu voltam limpas.
  • Não estabelece que o primeiro número era o confiável. Os dois relatórios são saídas separadas, e nenhum deles explica por que difere do outro.
  • Não estabelece que outra rodada de reescrita seja o próximo passo. Se o denominador se moveu, mais uma rodada sobre a prosa muda apenas o numerador.

Há também uma frase nas perguntas frequentes do Turnitin que pertence a esta conversa, e que geralmente é citada sem a sua segunda metade:

"Sometimes false positives (incorrectly flagging human-written text as AI-generated), can include content without a lot of structural variation, text that literally repeats itself, or text that has been paraphrased without developing new ideas. If our indicator shows a higher amount of AI writing in such text, we advise you to take that into consideration when looking at the percentage indicated." (Às vezes os falsos positivos (sinalizar incorretamente como gerado por IA um texto escrito por um humano) podem incluir conteúdo sem muita variação estrutural, texto que se repete literalmente ou texto que foi parafraseado sem desenvolver novas ideias. Se o nosso indicador mostrar uma quantidade maior de escrita com IA em tal texto, recomendamos que você leve isso em consideração ao olhar a porcentagem indicada.)

Lida até o fim, não é uma acusação apontada para você. É o fornecedor nomeando tipos de escrita humana que o próprio modelo pode sinalizar incorretamente, e depois dizendo a quem lê o relatório para levar essa possibilidade em consideração ao olhar a porcentagem. Se um orientador está olhando um número que subiu, essa cautela está na mesma página que o número. A lista de edição manual construída sobre a primeira metade está em como humanizar texto de IA sem uma ferramenta, e o método para comparar dois relatórios passagem por passagem em vez de total contra total está em ainda sinalizado após uma nova verificação do Turnitin.

Onde uma reescrita limitada ao relatório se encaixa

Tudo o que está acima é um argumento sobre escopo. Se mudar uma frase muda com o que as suas vizinhas são agrupadas, então a menor coisa que faz sentido mudar é maior do que uma frase, e as passagens com as quais você está satisfeito merecem ficar exatamente como estão.

Esse é o escopo que a ferramenta HumanPen descreve na sua página pública do relatório. Você envia o DOCX com um relatório de IA do Turnitin ou do iThenticate, e as passagens sinalizadas definem o que é reescrito. Todo o resto fica congelado. A página pública de humanizar também informa que a cobrança é feita pelas palavras efetivamente reescritas, e não pelo tamanho do arquivo que você enviou.

Se um relatório posterior ainda sinalizar passagens, as perguntas frequentes públicas descrevem uma segunda rodada gratuita sobre as passagens que continuam sinalizadas. Essa regra de serviço não é uma previsão. Ela não diz o que o próximo relatório vai mostrar, e o Turnitin não publicou nenhum mapeamento entre uma edição e um movimento da pontuação.

Perguntas frequentes

A pontuação de IA do Turnitin pode mesmo subir depois que eu reviso? Pode, e não há nada de estranho nisso. A porcentagem não é montada a partir de veredictos por frase, então não tem motivo para acompanhar o número de frases que você corrigiu. Segmentos sobrepostos, uma quantidade diferente de prosa elegível e um documento mais curto a movem cada um por conta própria.

Um número mais alto significa que as minhas edições pioraram as coisas? Não por si só. O relatório não contém nenhum registro do que você mudou nem atribui o movimento a qualquer edição. Uma alta é compatível com edições que funcionaram, com edições que não fizeram nada e com um documento cuja estrutura mudou por baixo do cálculo.

Tenho menos frases destacadas, mas uma porcentagem maior. Qual dos dois está certo? Os dois, porque não são duas visões da mesma grandeza. O Turnitin diz que um documento que mistura tipos de escrita vai apresentar uma disparidade entre a porcentagem e os destaques, já que a porcentagem é calculada sobre a prosa elegível enquanto os destaques ficam no arquivo inteiro.

Apaguei muito texto para bater o limite de palavras e a pontuação disparou. Por quê? Muito provavelmente o denominador. A porcentagem corre sobre a prosa elegível, então remover prosa não sinalizada eleva a fatia sinalizada sem nenhuma mudança no texto sinalizado. Se o resultado agora tem apenas algumas centenas de palavras, o Turnitin diz também que documentos curtos são previstos quase sempre como tudo ou nada.

Devo simplesmente reescrever o trabalho inteiro? Essa é a resposta que o número convida a dar e raramente é a que as evidências sustentam. Compare onde estão os destaques nos dois relatórios antes de decidir o quanto mexer, e congele tudo aquilo cujo texto exato carrega significado, como números, citações, definições e passos de método.

Continue lendo