
Que estamos rodeados por texto escrito por una IA ya no sorprende a nadie. Los que queremos leer a personas vamos todo el día con el hacha levantada buscando indicios para comprobar si estamos leyendo a un humano o a un robot, pero aunque eso pueda ser una cuestión ética o de preferencia, hay ámbitos como el educativo en el que hacen falta herramientas buenas que detecten el texto escrito por IA.
Y digo «buenas» porque algunas de las que más fama tienen fallan más que una escopeta de feria calificando como «hecho por IA» textos humanos y viceversa. Un investigador llamado Jochen Madler se ha cansado y ha ideado un sistema que no sólo dice si un texto es IA o no, sino si ese texto está escrito por un humano que simplemente se ha dedicado a parafrasear el resultado que le ha dado la IA.
¿Resultado? Un macro F1 cercano al 98%.
En corto. El estudio se titula ‘SlopShape‘ y, en él, Madler expone que el sistema analizó una serie de textos cuyo modelo nunca había visto y alcanzó el mencionado 98% de éxito a la hora de etiquetar si había sido escrito por una IA o por un humano de principio a fin.
Según el investigador, el sistema no lee el texto y emite el veredicto, sino que un modelo de lenguaje responde para cada post un cuestionario de más de 200 preguntas sobre cómo está montado ese texto. En concreto, analiza el orden en el que se presentan las ideas, si el artículo anuncia su estructura por adelantado, se fija en dónde aparece la tesis, cómo se presentan las fuentes, la orientación práctica del artículo o si el texto termina repitiendo o reformulando la conclusión.
El experimento. Para ponerlo a prueba, reunió 2.250 posts de blogs de 268 empresas de comunicación, todos ellos publicados antes de que se lanzara ChatGPT y recuperados usando Wayback Machine. Luego, pidió a cinco modelos (GPT-5.4, Claude Sonnet 4.6, Gemini 3 Flash, DeepSeek V3.2 y Kimi K2.5 que escribieran su propia versión a partir de un resumen del contenido original.
En total fueron 11.250 versiones generadas por esos modelos, escritas y reescritas de nuevo, para comprobar hasta qué punto su sistema podía identificar cambios desde profundos a menores. El resultado fue que, en las pruebas, obtuvo alrededor de 97-98 de macro F1, una métrica que combina precisión y cobertura para humanos e IA.
Cuando se reescribían los textos varias veces usando la IA, ese macro F1 apenas variaba. Sólo bajó significativamente cuando se cambiaban características de estilo (con una puntuación de 88,1). La conclusión es que la IA deja una huella en la arquitectura del discurso, dando textos previsibles, muy masticados y con conclusiones repetitivas. De hecho, según las pruebas, en un 79% de las ocasiones el sistema podía incluso señalar qué modelo había escrito qué en función de los ‘dejes’ de cada uno de ellos.

Imagen | Jochen Madler
La forma del slop. Y el meollo: lo que da pistas a la herramienta es lo que da título a la investigación, esa «forma del slop». Según Madler, suelen tener estos rasgos:
- Forma muy ordenada, a veces con bullet points iniciales que indican los apartados.
- El título promete exactamente lo que el artículo va a dar, sin aportar contexto tangencial.
- La introducción enseguida presenta la tesis y luego sigue una estructura de «definición, ventajas, pasos, errores y recomendaciones» como si fuera una guía o experto.
- La conclusión termina parafraseando la idea que ya anunciaba en la introducción.
Hay otros factores, como afirmaciones sin fuentes, estadísticas sin contexto o una especie de listas de pros y contras que siempre están equilibradas y que no aportan nada.
PERO. Que que se cumplan estos rasgos no demuestra que un texto lo haya escrito una IA. De hecho, en prensa y antes de ChatGPT, nos encontramos con agencias de comunicación que lanzaban mensajes siguiendo esa estructura tan corporativa. Tiene sentido porque son los textos que han usado para el estudio y también con los que la IA de las diferentes compañías han sido entrenadas (entre tantas y tantas cosas robadas para dicho entrenamiento, claro).
Además, y esto es importante, el estudio se ha hecho con artículos en inglés, por lo que no se puede aplicar a otros idiomas ni a cualquier texto escrito en Internet. La conclusión es que lo característico de las formaciones es la combinación repetida de todos y cada uno de esos factores que pueden hacernos sospechar y, sobre todo, los textos con «mucho texto» y que no sólo no aportan nada, sino que no muestran una progresión de ideas.
Pero bueno, al final, de momento es una investigación más sobre algo que, evidentemente, es un problema. Y es que, en una era en la que cada dos por tres se lanzan más y más modelos de frontera, son necesarias herramientas para distinguir quién ha hecho qué texto. Como curiosidad, he analizado este texto y soy un 70% humano. Y en este otro dice que un 80% cuando es una entrevista. Hay que seguir afinando la herramienta.
Fuente: Tecnologia






