Por que o mesmo texto recebe uma pontuação diferente em cada detector

No estudo de Stanford, 89 das 91 redações foram marcadas por pelo menos um detector e apenas 18 pelos sete. As mesmas redações, no mesmo dia — as ferramentas discordaram em 71 delas.

Equipe HumanPen

· 5 min de leitura

A discordância é mensurável, e é grande

O número publicado mais claro vem do estudo de Stanford sobre escritores não nativos, que costuma ser citado pela sua taxa de falsos positivos de manchete. Olhe, em vez disso, para os dois números que aparecem abaixo dela.

  • 89 das 91 redações do TOEFL (97,80 por cento) foram marcadas como IA por pelo menos um dos sete detectores.
  • 18 das 91 (19,78 por cento) foram marcadas pelos sete.

Sobram assim 71 redações — quatro de cada cinco no corpus — em que as sete decisões binárias não foram unânimes. As contagens publicadas demonstram discordância quanto à classificação, embora não nos digam quão distantes ficaram as pontuações subjacentes em cada caso.

Para essas redações, a ferramenta escolhida por uma instituição podia decidir se aparecia ou não uma marcação. Isso é um problema de dependência de produto, não uma prova de que um detector específico estivesse sempre errado.

A data importa. O estudo capturou sete produtos no início de 2023 e vários já mudaram de modelo, de limiares ou de interface de relatórios desde então. Ele não deve ser usado como um ranking atual. Seu resultado duradouro é metodológico: as saídas dos detectores não são intercambiáveis, de modo que a pontuação de um fornecedor não pode validar nem cancelar a de outro sem uma comparação nova e controlada.

Mesmo uma nova execução no mesmo fornecedor pode dar resultados diferentes se o serviço foi atualizado em silêncio, se a conta tem outras funções ativadas ou se o documento foi processado de outro modo. A reprodutibilidade exige, portanto, mais do que guardar o texto: mantenha o arquivo original, o relatório, a data, o nível do produto, a configuração de idioma e, se houver, a versão do modelo. Uma captura de tela com apenas uma porcentagem, sem esse contexto, é difícil de auditar depois.

Por que eles discordam

Porque não são implementações de uma única medição. São produtos diferentes.

  • Modelos subjacentes diferentes. Um detector que mede a perplexidade em relação ao GPT-2 e outro que roda um classificador de aprendizado profundo treinado para isso fazem à mesma frase perguntas diferentes.
  • Arquiteturas diferentes ao longo do tempo. O GPTZero abandonou a perplexidade e a burstiness no outono de 2023; outros não. Comparar fornecedores é, em parte, comparar gerações de método.
  • Distribuições de treinamento diferentes. O que conta como escrita humana comum depende de quais textos o classificador viu. É esse o mecanismo por trás do viés contra quem escreve em inglês como segunda língua, e ele varia conforme o fornecedor.
  • Limiares e regras de apresentação diferentes. A Turnitin hoje oculta as pontuações numéricas de 1 a 19 por cento; outras mostram um número em todos os níveis. O mesmo sinal de fundo pode ser apresentado de formas diferentes antes mesmo de você vê-lo.
  • Unidades diferentes. Uma porcentagem pode significar a confiança no documento, outra a proporção de frases rotuladas como IA e outra a proporção de prosa efetivamente considerada. Números que parecem iguais não precisam responder à mesma pergunta.
  • Pré-processamento diferente. As ferramentas podem remover referências, ignorar marcadores de lista, dividir frases de outro modo ou cortar documentos longos. Elas podem, assim, pontuar um texto diferente enquanto parecem receber o mesmo arquivo.

A extensão agrava essas diferenças. Um detector que precisa de várias centenas de palavras pode usar padrões do documento inteiro; uma ferramenta de navegador que aceita um único parágrafo tende a se apoiar em características locais. O idioma também conta: não se pode presumir que um modelo calibrado para o inglês se comporte igual em trechos traduzidos ou numa lista de referências bilíngue.

As porcentagens não usam a mesma unidade

As próprias definições dos fornecedores mostram por que porcentagens aparentemente iguais não podem ser comparadas enquanto você não souber qual é a unidade. Verificado em 28 de agosto de 2026:

Fornecedor e saídaO que o fornecedor diz que a porcentagem significaO limite estabelecido pelo próprio fornecedor
O relatório AI Writing Report da TurnitinA quantidade de texto elegível que o modelo identifica como provavelmente gerado por IA, ou como provavelmente gerado por IA e depois modificado. É uma proporção da prosa elegível, não uma pontuação de confiança.A Turnitin diz que o modelo pode identificar mal um texto e que não deve ser a única base para medidas desfavoráveis.
A pontuação de detecção de IA da Originality.aiUma probabilidade de classificação. No exemplo deles, 60% Original significa que o modelo tem 60% de confiança na previsão “Original”.A página diz ainda que isso não significa que 60% do texto fosse original e 40% gerado por IA, e afirma que falsos positivos ocorrem.
A probabilidade de classe da API do GPTZeroA probabilidade associada à classe prevista: humana, IA ou mista. O GPTZero explica os 90% assim: o detector acerta 90% das vezes em documentos semelhantes.A afirmação vale para documentos semelhantes e para a classe prevista pela API; não é uma alegação de que 90% das palavras enviadas sejam de IA.
O Human Score da Winston AIUma estimativa de confiança de que o conteúdo foi criado por um humano. A página diz que 80% humano e 20% IA significa 80% de confiança na autoria humana, e não uma fatia de 20% de IA.A Winston diz que sua avaliação não tem valor coercitivo e que o mapa de previsões pode destacar texto humano.

A Turnitin informa, portanto, uma proporção de um subconjunto elegível do documento, enquanto os outros três exemplos informam a confiança em torno de um rótulo de classe. O mesmo símbolo, a porcentagem, está fazendo trabalhos matemáticos diferentes. Converter o número de um fornecedor para a escala de outro não é uma segunda opinião: muda a pergunta.

Um único fornecedor pode expor duas porcentagens diferentes

As próprias páginas públicas do GPTZero tornam visível o problema da unidade sem que seja preciso comparar duas empresas. A documentação da API e a página do detector web descrevem duas saídas diferentes, ambas com sinal de porcentagem. Verificado em 28 de agosto de 2026:

Superfície e campo no GPTZeroRedação exata do fornecedorUnidade sustentada por essa redação
Probabilidade de classe na API“The class probability corresponding to the predicted class can be interpreted as the chance that the detector is correct in its classification.” (A probabilidade de classe correspondente à classe prevista pode ser interpretada como a chance de o detector estar correto em sua classificação.)Probabilidade de a classe de documento prevista estar correta em documentos semelhantes
Resultado do detector na web“GPTZero will suggest what percentage of your text is likely to be AI-generated and highlight the specific phrases it has detected.” (O GPTZero indicará qual porcentagem do seu texto provavelmente foi gerada por IA e destacará as frases específicas que detectou.)Proporção do texto enviado descrita como provavelmente gerada por IA

Podem ser campos de saída separados, e não uma contradição. A regra prática é nomear a superfície do produto e o campo. Uma frase solta como “o GPTZero devolveu 30%” não identifica qual grandeza o número representa.

Dois serviços chineses usam o sinal de porcentagem para afirmações diferentes

A mesma divergência de unidade aparece em duas descrições atuais de fornecedores chineses, escritas por eles mesmos. A redação citada abaixo foi verificada em 28 de agosto de 2026.

Serviço e saídaRedação exata do fornecedorO que essa redação sustentaVerificado
Serviço de detecção de AIGC da CNKI para teses de graduação“检测结果中的AIGC值表示的是文章内容存在AI生成的概率大小” (O valor AIGC no resultado da detecção indica o tamanho da probabilidade de o conteúdo do artigo conter geração por IA.)Uma afirmação de tipo probabilístico sobre a presença de geração por IA no artigo; a página não a define como uma proporção de palavras ou frases28 de agosto de 2026
Detecção de AIGC da Wanfang Wencha“精准识别论文中疑似AI生成文本占比” (Identificar com precisão a proporção de texto com suspeita de geração por IA no trabalho)Uma proporção de texto suspeito de ter sido gerado por IA28 de agosto de 2026

Essas afirmações ligam o mesmo símbolo visual a grandezas diferentes: de um lado a probabilidade de presença, de outro a proporção de texto suspeito. Um valor de 30% numa página não pode ser colocado ao lado dos 30% da outra sem antes mudar a unidade, e nenhuma das duas publica uma regra de conversão.

Alguns detectores quase não produzem uma escala

Há mais uma dobra na hora de comparar pontuações. Num benchmark, algumas saídas de detectores se concentram perto de 0 ou de 1, enquanto outras ocupam mais da escala. Isso não significa necessariamente que o modelo subjacente não tenha uma pontuação contínua: limiares, arredondamento e a interface podem fazer um sinal contínuo parecer binário.

O HumanizerBench, que roda cinco detectores comerciais sobre cada amostra, usa a mediana em vez da média exatamente por esse motivo: com detectores que binarizam no conjunto, um único valor atípico move a média em até 0,25. A página de metodologia diz isso abertamente.

Uma média sobre essas saídas é matematicamente possível, mas sua interpretação não é clara quando as entradas usam unidades e calibrações diferentes. A mediana reduz a influência de um valor extremo; não revela a verdade de referência nem torna independentes os detectores que a compõem. O HumanizerBench é um benchmark de produtos publicado, não um estudo de validação institucional, portanto a escolha de agregação deve ser lida nesse escopo.

A votação por maioria tem limitação parecida. Cinco ferramentas correlacionadas, treinadas sobre corpora que se sobrepõem, não são cinco testemunhas independentes. A concordância pode refletir pontos cegos compartilhados, enquanto a discordância pode não refletir mais do que cortes diferentes. Sem conjuntos de teste rotulados, com textos humanos e gerados que correspondam à população-alvo, não há modo rigoroso de transformar os votos numa probabilidade de autoria.

O que fazer com isso

Quatro coisas decorrem daqui, nenhuma delas sobre técnica de escrita.

  • Num processo institucional em andamento, identifique o relatório que está sendo realmente usado. Consultar outro fornecedor diz o que aquele fornecedor pensa; não reproduz a ferramenta, as configurações nem a versão da instituição.
  • Uma segunda opinião que o inocento não é uma absolvição, e uma que o marca não é uma prova. Ambas são a saída de um único classificador sobre um texto cujas propriedades vários outros classificadores leem de outro modo.
  • Pergunte para que a pontuação é usada. A Turnitin declara que seu modelo pode identificar mal um texto e que não deve ser a única base para medidas desfavoráveis. O resultado de um detector é um insumo para a análise, não uma conclusão de má conduta.
  • Se você compara ferramentas para pesquisar, mantenha as condições constantes. Use a mesma versão, a entrada completa, o mesmo idioma, a mesma data e o mesmo corpus rotulado; registre também as falhas e o texto excluído, não apenas o número exibido.

Num recurso, capturas de tela concorrentes costumam só acrescentar ruído. Provas de processo — rascunhos, anotações, anotações de fontes, histórico de revisões e a capacidade de explicar decisões — tratam da autoria bem mais diretamente do que mais um classificador opaco. Para quem ensina, a discordância é um motivo para desenhar um processo de corroboração antes que um caso difícil apareça, e não depois.

Na aquisição, compare o erro por subgrupo e por gênero textual em vez de perguntar qual fornecedor declara a maior acurácia geral. Exija uma política de atualização documentada, um registro de auditoria das versões dos relatórios, regras claras sobre o texto elegível e uma exportação a que os estudantes possam responder de forma significativa. A discordância fica menos perigosa quando a instituição sabe exatamente o que a ferramenta contribui e já definiu quais provas podem se sobrepor a ela.

Para entender o que esse número mede, antes de tudo, veja o que os detectores de IA realmente medem.

Continue lendo