Estudantes Internacionais e Pontuações de IA: O Que Saber Sobre Escrever num Segundo Idioma
Escrever em inglês acadêmico como segundo idioma já é difícil o bastante sem ter de se preocupar com detecção de IA. O FAQ da Turnitin diz que os dados de treinamento incluíram aprendizes de segundo idioma para minimizar o viés. Mas o detector ainda lê padrões de probabilidade de palavras, e certas características de escrita têm maior risco de falsos positivos. Veja o que isso significa para estudantes internacionais.
Equipe HumanPen
· 4 min de leitura
Resumo Rápido
O FAQ da Turnitin diz que os dados de treinamento do modelo "took into account statistically under-represented groups like second-language learners, English users from non-English speaking countries, students at colleges and universities with diverse enrollments, and less common subject areas such as anthropology, geology, sociology, and others to minimize bias when training our model" (levaram em consideração grupos estatisticamente sub-representados, como aprendizes de segundo idioma, usuários de inglês de países não anglófonos, estudantes de faculdades e universidades com matrículas diversificadas e áreas temáticas menos comuns, como antropologia, geologia, sociologia e outras, para minimizar o viés ao treinar nosso modelo). Esta é a afirmação da própria Turnitin, não uma conclusão verificada de forma independente. A inclusão no conjunto de treinamento significa que o modelo foi exposto à escrita em segundo idioma durante o treinamento. Mas o detector ainda opera classificando padrões de probabilidade de palavras em texto em prosa. Se sua escrita acabar compartilhando padrões estatísticos com texto em inglês gerado por IA, o detector pode sinalizá-la, independentemente de o inglês ser ou não seu primeiro idioma. Entender essa lacuna entre a afirmação sobre o treinamento e o mecanismo de detecção é fundamental para responder a uma sinalização.
O Que a Turnitin Afirma Sobre Viés
O FAQ aborda o viés diretamente:
"While creating our sample dataset, we also took into account statistically under-represented groups like second-language learners, English users from non-English speaking countries, students at colleges and universities with diverse enrollments, and less common subject areas such as anthropology, geology, sociology, and others to minimize bias when training our model." (Ao criar nosso conjunto de dados de amostra, também levamos em consideração grupos estatisticamente sub-representados, como aprendizes de segundo idioma, usuários de inglês de países não anglófonos, estudantes de faculdades e universidades com matrículas diversificadas e áreas temáticas menos comuns, como antropologia, geologia, sociologia e outras, para minimizar o viés ao treinar nosso modelo.)
Esta é a afirmação da própria empresa sobre sua metodologia de treinamento. Diz que os dados de treinamento foram projetados para incluir amostras de escrita diversas. Mas não fornece números, resultados de testes ou validação externa dos níveis de viés. A afirmação é que a escrita em segundo idioma foi representada no treinamento. O que a afirmação não diz é que a escrita em segundo idioma está imune a falsos positivos. O modelo foi treinado com dados diversos, mas ainda classifica por padrões de probabilidade de palavras. Por que escritores não nativos de inglês são sinalizados por detectores de IA com mais frequência aborda a pesquisa sobre essa lacuna.
Como o Detector Lê Seu Texto
O pipeline de detecção funciona da mesma maneira, independentemente de quem escreveu o texto:
"When a paper is submitted to Turnitin, sentences from the submission are extracted and segmented into overlapping sections for prediction analysis. Each segment is classified by the AI detection model and given a value between 0 and 1, denoting the probability of the text being likely human or AI-generated. Each qualifying sentence within these segments inherits the segment's score. Since segments overlap, some sentences may have multiple scores, which are then pooled into a single score. These sentence scores are further aggregated and used to compute the overall document AI writing score." (Quando um trabalho é enviado à Turnitin, as frases do envio são extraídas e segmentadas em seções sobrepostas para análise de predição. Cada segmento é classificado pelo modelo de detecção de IA e recebe um valor entre 0 e 1, indicando a probabilidade de o texto ser provavelmente humano ou gerado por IA. Cada frase elegível dentro desses segmentos herda a pontuação do segmento. Como os segmentos se sobrepõem, algumas frases podem ter múltiplas pontuações, que então são agrupadas em uma única pontuação. Essas pontuações por frase são ainda mais agregadas e usadas para calcular a pontuação geral de escrita por IA do documento.)
O detector não conhece seu histórico de idiomas. Não ajusta sua classificação com base em se você é falante nativo ou não nativo de inglês. Lê os recursos estatísticos de suas sequências de palavras e os classifica. Se seus padrões de escrita em inglês, talvez influenciados por instrução formal que enfatiza certas frases e estruturas acadêmicas, acabarem se sobrepondo aos padrões que o modelo associa a texto gerado por IA, a pontuação pode ser mais alta do que você espera.
Falsos Positivos e Escrita em Segundo Idioma
O FAQ lista características de texto propensas a falsos positivos:
"Sometimes false positives (incorrectly flagging human-written text as AI-generated), can include content without a lot of structural variation, text that literally repeats itself, or text that has been paraphrased without developing new ideas." (Às vezes, falsos positivos (sinalização incorreta de texto escrito por humano como gerado por IA) podem incluir conteúdo sem muita variação estrutural, texto que se repete literalmente ou texto que foi parafraseado sem desenvolver novas ideias.)
A frase seguinte: "If our indicator shows a higher amount of AI writing in such text, we advise you to take that into consideration when looking at the percentage indicated." (Se nosso indicador mostrar uma quantidade maior de escrita por IA em tal texto, aconselhamos que você leve isso em consideração ao olhar a porcentagem indicada.)
Algumas dessas características podem ser mais comuns na escrita acadêmica em segundo idioma. Falantes não nativos muitas vezes aprendem inglês por meio de modelos estruturados e frases acadêmicas repetidas, o que pode produzir escrita com menos variação estrutural. Transições como "moreover", "furthermore" e "in addition" são ensinadas como conectores padrão, e seu uso repetido pode produzir o tipo de estrutura uniforme que o FAQ descreve. Isso não significa que a escrita em segundo idioma seja sempre sinalizada. Significa que as características associadas a falsos positivos podem se sobrepor a padrões comuns na escrita em segundo idioma aprendida em contexto instrucional. Se a resposta é escrever de forma diferente, isso já é outra questão: você deve mudar seu jeito de escrever para evitar ser sinalizado.
Você Não Consegue Ver Sua Própria Pontuação
Mais uma coisa que estudantes internacionais devem saber. O FAQ afirma: "only instructors and administrators are able to see the indicator" (somente instrutores e administradores conseguem ver o indicador). Estudantes não podem verificar sua própria pontuação de IA. O FAQ continua: "However, with the PDF download feature, instructors can download and share the AI report with students" (No entanto, com o recurso de download em PDF, os instrutores podem baixar e compartilhar o relatório de IA com os estudantes). Se você está preocupado com sua pontuação, a única maneira de vê-la é pedir ao seu instrutor que compartilhe o relatório em PDF com você. Não dá para rodar a mesma verificação por conta própria através de uma conta de estudante. Depois de ter o PDF, como ler um relatório de escrita por IA do Turnitin é o próximo passo.
O Que Fazer Se Você For Sinalizado
Para resumir o que cobrimos:
- A Turnitin afirma que seus dados de treinamento incluíram aprendizes de segundo idioma para minimizar o viés, mas não fornece números para verificar essa afirmação.
- O detector lê padrões de probabilidade de palavras, independentemente de quem escreveu o texto ou qual idioma a pessoa fala nativamente.
- Características propensas a falsos positivos, como baixa variação estrutural, podem se sobrepor a padrões comuns na escrita acadêmica em segundo idioma.
- Estudantes não conseguem ver sua própria pontuação de IA. Somente instrutores podem, mas podem compartilhar o PDF.
- A pontuação de IA e a pontuação de similaridade são medições independentes.
Se você tiver um relatório do Turnitin mostrando quais trechos foram sinalizados, importe o relatório e trabalhe nesses trechos específicos. Passagens elegíveis podem ser reprocessadas sem custo.
Continue lendo
O que a detecção de IA do Turnitin verifica: como a pontuação é construída
4 min de leitura
Relatórios de detecçãoA Revisão de Literatura Recebeu uma Pontuação Alta de IA? Eis o Porquê
5 min de leitura
Detectores de IAPor Que Instruções de Prompt Não Conseguem Reduzir seu Score de IA de Forma Confiável
4 min de leitura