O Turnitin lê o texto dentro de tabelas? A regra da prosa em tabelas

O texto de tabelas já foi invisível para o detector de IA do Turnitin. Isso mudou. Explicamos o que agora é processado, o que continua fora e por que a porcentagem e os destaques quase nunca batem.

Equipe HumanPen

· 5 min de leitura

A confusão em torno das tabelas

Se você já entregou um trabalho com tabelas de dados e depois ficou olhando para o relatório de escrita com IA, deve ter se perguntado o que o Turnitin analisou de fato. A confusão é compreensível. Por muito tempo, um artigo de ajuda do Turnitin dizia: "The model does not reliably detect AI-generated text in the form of non-prose, such as poetry, scripts, or code, nor does it detect short-form/unconventional writing such as bullet points, tables, or annotated bibliographies." (O modelo não detecta de forma confiável texto gerado por IA na forma de não prosa, como poesia, roteiros ou código, e também não detecta escrita curta ou não convencional, como marcadores, tabelas ou bibliografias comentadas.)

Essa redação colocava as tabelas na mesma categoria de poesia e roteiros, formatos que o detector não tocava. Estudantes e professores interpretaram isso da seguinte forma: qualquer texto dentro de uma tabela era totalmente ignorado. Era uma leitura razoável, mas não era o quadro completo.

A realidade é que a detecção de IA do Turnitin só processa o que chama de frases em prosa. A documentação explica: "This qualifying text includes only prose sentences, meaning that we only analyze blocks of text that are written in standard grammatical sentences and do not include other types of writing such as lists, bullet points (short non-sentence structures), or other non-sentence structures." (Esse texto elegível inclui apenas frases em prosa, ou seja, analisamos apenas blocos de texto escritos em frases gramaticalmente padrão e que não incluem outros tipos de escrita, como listas, marcadores (estruturas curtas que não são frases) ou outras estruturas que não são frases.) As tabelas não foram excluídas por causa de uma regra especial sobre tabelas: foram excluídas porque a maior parte do conteúdo de uma tabela simplesmente não conta como prosa.

O que o Turnitin consegue processar dentro de tabelas

O Turnitin atualizou a sua lógica de processamento. A entrada de 9 de agosto de 2023 na página modelo de detecção de escrita com IA (guides.turnitin.com/hc/en-us/articles/28294949544717-AI-writing-detection-model) afirma: "We are now able to process long-form prose text in tables." (Agora conseguimos processar texto em prosa de formato longo em tabelas.) É uma mudança importante. Se a sua tabela tiver frases completas escritas em forma gramatical padrão, essas frases agora são analisadas pelo modelo de detecção de IA.

A expressão-chave é "texto em prosa de formato longo". Uma célula que diz "Os resultados indicam uma correlação estatisticamente significativa entre a variável X e a variável Y, com um valor p abaixo de 0.01" é uma frase em prosa comum, e será processada. Uma célula que diz "p < 0.01" ou "Variável X, 0.85" não é uma frase: é um fragmento de dado, e será ignorada.

Essa distinção importa porque muitas tabelas acadêmicas misturam frases completas com entradas curtas de dados. As partes que são frases serão analisadas; os dados não. Você não pode assumir que uma tabela inteira está incluída ou excluída. O Turnitin avalia o conteúdo bloco por bloco, procurando frases gramaticais padrão, independentemente de estarem dentro de uma célula ou no corpo do documento.

Essa mesma entrada também instrui: "Resubmit to reprocess existing submissions that contain tables." (Reenvie para reprocessar os envios existentes que contêm tabelas.) Se você enviou um trabalho antes dessa atualização, a prosa das tabelas naquele envio não foi processada. Reenviar aciona a lógica atualizada.

O que fica de fora

Mesmo com a atualização sobre prosa em tabelas, vários tipos de conteúdo continuam fora da análise de detecção de IA. A regra de "apenas prosa" significa que marcadores, estruturas curtas que não são frases e listas não são processados. Se a sua tabela contém fragmentos curtos em vez de frases completas, esses fragmentos ficam excluídos.

As bibliografias foram corrigidas na mesma data. A entrada de 9 de agosto de 2023 diz: "We have fixed a bug that was occasionally highlighting AI writing within references listed in a bibliography. Bibliographies are now excluded when processing the AI writing report." (Corrigimos um bug que às vezes destacava escrita com IA dentro das referências listadas em uma bibliografia. As bibliografias agora são excluídas no processamento do relatório de escrita com IA.) Essa correção resolveu um problema específico: entradas de referência estavam sendo sinalizadas, o que gerava resultados enganosos. A orientação é clara: "Resubmit to reprocess existing submissions that contain highlighted reference sections." (Reenvie para reprocessar os envios existentes que contêm seções de referências destacadas.)

Portanto, a lista de excluídos inclui fragmentos curtos de tabela, marcadores, entradas de dados e agora também bibliografias inteiras. O detector se concentra nas frases em prosa do corpo do documento e das células, e ignora todo o resto. Isso não é uma falha do sistema: é uma escolha de projeto baseada no fato de o modelo ter sido treinado com prosa, e não com formatos de dados ou estruturas de citação.

Por que a sua porcentagem e os destaques não batem

Uma das fontes de confusão mais comuns é a distância entre a porcentagem de escrita com IA e o texto destacado no relatório. A documentação trata disso diretamente: "This means that a document containing several different writing types would result in a disparity between the percentage and the highlights." (Isso significa que um documento com vários tipos diferentes de escrita resultaria em uma disparidade entre a porcentagem e os destaques.)

Se o seu documento inclui tabelas com frases completas, fragmentos curtos de dados, marcadores e uma bibliografia, apenas as frases em prosa são analisadas. A porcentagem reflete a proporção da prosa analisada que o modelo classificou como gerada por IA; não reflete a proporção de todo o envio. A documentação observa: "This percentage is not necessarily the percentage of the entire submission." (Esta porcentagem não é necessariamente a porcentagem de todo o envio.)

É por isso que você pode ver uma pontuação de escrita com IA de 40% e apenas alguns parágrafos destacados. Os destaques mostram quais segmentos de prosa foram sinalizados. A porcentagem é calculada apenas com base na prosa analisada. O conteúdo excluído, como dados de tabela ou entradas de bibliografia, não aparece nos destaques e não entra no cálculo da porcentagem do modo como você imaginaria.

Entender essa distinção ajuda você a ler o relatório corretamente. A porcentagem não é uma simples proporção entre texto sinalizado e texto total: é uma pontuação baseada na prosa que o modelo realmente processou, que pode ser apenas uma parte do seu documento.

O que verificar antes de enviar

Antes de enviar um documento que contenha tabelas, recomendamos revisar o conteúdo dessas tabelas. Se as suas células contêm frases completas, essas frases serão analisadas pelo detector de IA. Certifique-se de que essas frases reflitam a sua própria escrita. Se você usou IA para redigir alguma prosa de tabela, essa prosa será avaliada como qualquer outra frase do seu trabalho.

Verifique a sua bibliografia. As bibliografias agora estão excluídas da análise de escrita com IA, portanto as referências não devem aparecer como texto destacado. Se você tem um relatório mais antigo em que referências foram sinalizadas, reenviar o documento fará valer a lógica atualizada que exclui bibliografias.

Se o seu documento tem tipos de conteúdo misturados, não estranhe se a porcentagem e as seções destacadas parecerem inconsistentes. Como explica a documentação, é esperado que haja disparidade entre a porcentagem e os destaques quando um documento contém vários tipos diferentes de escrita. Leia os destaques para entender quais segmentos específicos de prosa foram sinalizados e trate a porcentagem como uma pontuação derivada da prosa analisada, e não de todo o envio.

Se você já tem um relatório de escrita com IA do Turnitin e quer trabalhar nos trechos que foram sinalizados, pode importar esse relatório e reescrever só aqueles trechos. O relatório precisa vir da conta Turnitin da sua instituição; nós não emitimos relatórios.

Continue lendo