Cómo comprobar la afirmación de un humanizador de IA de que «conserva tu formato»

Todas las herramientas de esta categoría dicen que conservan tu formato. Casi ninguna dice qué contó. Cuatro preguntas convierten esa frase en algo que puedes comprobar en una tarde.

Equipo de HumanPen

· 9 min de lectura

La respuesta breve

Una afirmación sobre el formato solo se puede comprobar si nombra cuatro cosas: qué elemento, en qué capa del archivo, de cuántos y contado cómo. «Conserva tus citas» no nombra ninguna. «Los encabezados Markdown presentes en la entrada sobrevivieron en 291 de 552 casos» las nombra las cuatro, y puedes estar en desacuerdo.

El resto es la prueba, aplicada al único conjunto de datos abierto que pude encontrar en esta categoría —que resulta estar publicado por un competidor y aun así es lo más comprobable que hay aquí— y después a nuestras propias cifras, lagunas incluidas.

Las cuatro preguntas

PreguntaQué dice una afirmación vagaQué dice una afirmación comprobable
¿Qué elemento?«tu formato»encabezados, fragmentos en negrita, marcadores de cita en el texto, referencias de notas al pie, celdas de tabla, campos de referencia cruzada
¿Qué capa?«documentos»caracteres Markdown en texto plano o estilos y códigos de campo de DOCX. No es la misma prueba
¿De cuántos?«99 %»291 de 552, y aquí está lo que había en la entrada
¿Contado cómo?nadaun script identificado, una regla explícita sobre qué cuenta como supervivencia, un conjunto de datos que otros puedan abrir

La pregunta sobre la capa es la que se salta, y es la que decide si una cifra significa algo para una tesis. Un símbolo # al principio de una línea y un estilo «Título 2» en `word/document.xml` son objetos distintos, con modos de fallo distintos. Una herramienta puede ser perfecta en uno y desastrosa en el otro.

Aplicarlo al único conjunto de datos abierto

Empieza por quién lo publica, porque una afirmación hereda los intereses de quien la hace.

El conjunto de datos que todos citan en esta categoría es HumanizerBench, y su página sobre el proyecto incluye una frase que la mayoría de los benchmarks escondería: "We're operated by WriteHuman, which sells one of the humanizers on this leaderboard." (Nos gestiona WriteHuman, que vende uno de los humanizadores de esta clasificación.) Cada página del sitio termina con la misma confesión en el pie, y WriteHuman ocupa el primer puesto en el ciclo que se cita más abajo. No es, por tanto, un benchmark independiente, y una cita que lo llame así se ha saltado un paso.

Lo que es en cambio es algo más raro: publica los archivos. Cada entrada, cada salida y cada veredicto del detector del ciclo de agosto de 2026 está en un repositorio público bajo licencia CC BY 4.0. Un benchmark dirigido por un competidor que entrega los datos en bruto puede ser comprobado por un desconocido; un resumen de tono neutral sin nada que descargar no puede. Las dos mitades tienen que viajar juntas, y la segunda mitad es la razón por la que las cifras de abajo valen algo.

El ciclo consta de 12 herramientas por 33 muestras, es decir, 396 pruebas completadas. Se cuentan los elementos que estaban presentes en una entrada y volvieron a aparecer en la salida correspondiente:

ElementoSobrevivieronTasa
Encabezados Markdown291 de 55252,7 %
Fragmentos en negrita319 de 79240,3 %

Ahora las cuatro preguntas. Elemento: identificado. Denominador: publicado. Método de recuento: una regla que puedes aplicar tú mismo, porque un encabezado Markdown es una línea que empieza con # y un fragmento en negrita es texto entre dos asteriscos, y la supervivencia está limitada a lo que la entrada realmente tenía, así que ninguna herramienta recibe crédito por inventarse un encabezado que nunca existió. Descarga el ciclo, aplica esa regla y llegarás a estas dos cifras o descubrirás dónde me equivoqué. Capa: caracteres Markdown en texto plano. Todo lo que hay en ese conjunto de datos se pegó en un cuadro y se volvió a copiar; en ningún momento intervino un `.docx`.

Esa última línea no es una crítica al benchmark, que nunca afirmó lo contrario. Es lo que tienes que tener presente cuando un proveedor te la cite.

Aplicarlo a nuestras propias cifras

Las mismas cuatro preguntas, dirigidas a nosotros. Y lo primero que hay que decir es lo que decide cuánto peso merece esto: medimos nuestra propia salida, con archivos que elegimos y con nuestro propio script. Es un proveedor midiéndose a sí mismo.

Tomamos tres pares de antes y después, abrimos cada archivo como zip y recorrimos `word/document.xml`. El número de párrafos volvió idéntico en los tres (345, 403 y 405 respectivamente). Los párrafos con estilo de encabezado sumaron 152 a la entrada y 152 a la salida. La única tabla del corpus no cambió: 7 filas y 14 celdas.

Elemento: párrafos, estilos de encabezado, filas y celdas de tabla. Capa: DOCX. Denominador: indicado. Método de recuento: un script que lee el XML en lugar de preguntar al producto qué hizo.

Y la parte que no puedes comprobar: los archivos son nuestros y no los publicamos, así que nadie fuera de esta empresa puede llegar a 152 volviendo a contar. Es una debilidad real de esa cifra, y prefiero nombrarla antes que maquillarla. Lo que sí se puede trasladar es el procedimiento: los seis pasos de más abajo, aplicados a un documento tuyo en lugar de a uno que elegimos nosotros.

Y ahora las partes que una página de marketing omitiría.

La redacción de un encabezado no está cubierta por esa cifra. En el documento de 46 encabezados, 18 volvieron reformulados con el ajuste equilibrado, aunque conservaban el mismo estilo. Sobrevivir como encabezado y sobrevivir sin cambios son dos afirmaciones distintas, y solo la primera se mide arriba.

Varios elementos nunca se probaron, porque el corpus no contenía ninguno. Buscar en los paquetes los marcadores de un campo de índice, una referencia cruzada y una nota al pie no devuelve nada en los tres archivos. Eso hace que nuestro recuento calle justo sobre los elementos de los que más depende una tesis. «La tabla sobrevivió» es una medición. «Las referencias cruzadas sobreviven» sería una inferencia, y esa distinción deberías aplicarla a la versión de cualquiera, incluida la nuestra.

El truco a vigilar: una cifra sin su columna

Aquí tienes un fallo que detectamos en nuestra propia investigación, y por eso confío más en las cuatro preguntas que en el resumen de nadie.

Un informe interno sobre ese conjunto de datos público incluía una línea que decía que cuatro herramientas concretas habían obtenido un 0 % en supervivencia de encabezados. Al volver a contar con los datos en bruto, la lista era correcta, pero pertenecía a la columna negrita. En encabezados, una de esas cuatro empresas está en el 58,7 %. Si eso hubiera salido así, habríamos publicado un 0 % sobre una empresa cuyos datos públicos dicen lo contrario, y cualquiera podría haberlo demostrado en cinco minutos descargando el mismo archivo.

La cifra era real. Solo se había separado de lo que medía, a un documento de distancia de la fuente.

De ahí sale una quinta pregunta, y es la más barata de hacer: ¿puedo volver desde aquí a los datos en bruto, y quién los produjo? Si la respuesta es un artículo de blog que cita otro artículo de blog, la cifra ya ha viajado más lejos de lo que puede ir con seguridad. Si los datos en bruto están a un clic pero quienes los publicaron venden una herramienta en esa misma tabla, puedes usarlos igual: solo tienes que decir ambas cosas a la vez, siempre.

Haz la prueba tú mismo en media hora

No necesitas un benchmark para comprobar una herramienta que estás valorando. Necesitas un archivo deliberadamente incómodo.

  1. Crea un documento de prueba con una unidad de cada cosa: dos niveles de encabezado, un índice automático, una referencia cruzada a una figura numerada, una nota al pie, una lista numerada, una tabla de dos columnas con un número y una unidad en una celda, una frase citada y tres citas en el texto de tu gestor bibliográfico.
  2. Anota los recuentos antes de subir el archivo. Referencias, notas al pie, filas y celdas de tabla, encabezados, elementos de lista.
  3. Pásalo por la herramienta.
  4. Abre el resultado, selecciona todo y actualiza los campos (Ctrl+A y luego F9). Un campo activo se actualiza delante de ti. Un campo convertido en caracteres normales se ve igual y no hace nada, y esta es la forma de distinguirlos en dos segundos sin abrir el XML.
  5. Vuelve a contar y compara la redacción por separado de la estructura. Un encabezado que sigue siendo un encabezado pero dice algo distinto es un resultado, no un fallo, pero necesitas saber cuál de los dos te ha tocado.
  6. Lee la frase citada y la celda que contiene el número. Esos dos son los lugares donde una reescritura fluida hace el daño que no se ve al hojear.

Media hora de esto te dice más sobre tu propio archivo que cualquier página de comparación de esta categoría, incluida la nuestra. Las páginas de comparación, la nuestra tanto como la de cualquiera, se escriben sobre documentos de otros.

Qué afirmamos y qué no

La herramienta HumanPen es una herramienta de documentos, así que la capa del archivo es la que nos importa, y los recuentos de arriba son lo que hemos medido en ella. Cuatro elementos siguen sin medir por nuestra parte, y se nombran en este artículo en lugar de omitirse.

La parte que es una decisión de diseño y no una medición: nunca se reescribe nada más pequeño que un párrafo completo, y una selección que caiga en medio de uno se amplía a ese párrafo y se te presenta primero para que lo confirmes. Un informe importado puede fijar ese límite en tu lugar. La facturación se calcula a partir de las palabras reescritas, lo cual es un dato de precios y no una afirmación de conservación, y lo menciono aquí solo porque ambas cosas se venden como una sola frase. Nuestras propias preguntas frecuentes siguen terminando con "Review complex documents after download" (Revisa los documentos complejos después de descargarlos), que es la instrucción correcta y no una que pensemos suavizar.

La afirmación es deliberadamente estrecha: menos párrafos modificados significa menos sitios donde algo de esto puede salir mal.

Preguntas frecuentes

¿Existe algún benchmark independiente para esto? Ninguno que yo haya encontrado. Hay un conjunto de datos abierto, HumanizerBench, publicado bajo licencia CC BY 4.0, pero lo gestiona WriteHuman, que vende una de las herramientas que clasifica, así que «independiente» es la palabra equivocada. Es comprobable más que independiente, y esas son propiedades distintas: los archivos en bruto se pueden descargar, que es más de lo que ofrece la mayor parte de esta categoría. Además mide el formato Markdown en texto plano, no nada dentro de un `.docx`. Para la capa del documento no encontré ningún conjunto de datos público, y por eso el archivo de prueba de arriba vale la media hora.

Una herramienta dice tener una tasa de conservación del 99 %. ¿Es bueno? Tal como está escrito, no se puede responder. Pregunta qué elemento, en qué capa del archivo, de cuántos y contado cómo. Una tasa sin denominador y sin elemento identificado no es una medición.

¿Cuál es la comprobación más rápida? Ctrl+A y luego F9 en Word. Separa los campos activos del texto que solo se les parece y tarda dos segundos.

¿Por qué sobreviven los encabezados y las listas de referencias a veces no? Son mecanismos distintos. Un encabezado es un estilo aplicado a un párrafo, y sobrevive a que se reescriban las palabras que contiene. Una lista de referencias es contenido, así que el que cambie depende por completo de si estaba dentro del alcance de la reescritura.

Seguir leyendo