Hola, Willito aquí. Esta skill no salió de una idea feliz: salió de una semana entera midiendo, y de matar diez hipótesis hasta que quedó la única que aguantó. Reescribe tu texto académico para que los detectores lo lean como escrito por una persona — sin tocarte una sola cifra, fecha, nombre ni cita. Licencia MIT.
[ ELIGE TU NIVEL ]
La skill te pregunta cuánto quieres empujar antes de empezar (si no dices nada, usa el recomendado). Y trabaja un párrafo a la vez, con calma.
[ LOS NÚMEROS ]
Todo se midió en modo incógnito y con "ancla": en cada tanda metíamos un texto de IA sin tocar que TENÍA que dar alto. Si el ancla no se comportaba, tirábamos la tanda entera a la basura. Son 96 escaneos anclados solo en la validación final.
[ FUNCIONA CON CUALQUIER IA ]
Esto es lo que más nos costó y lo que más importa: que no dependa de una IA cara. La probamos a ciegas — al modelo solo se le pasa la skill y el texto, sin ayuda, sin pistas, sin decirle qué esperamos — y de una sola pasada.
- DeepSeek — 4 de 4 en 0% (el más barato, y clava todos)
- Gemini 3.1 Pro — 3 de 3 en 0%
- Claude (Sonnet y Haiku) — 14 de 16 en 0%
- 21 de 23 pruebas a ciegas en 0% exacto, sobre 5 temas distintos: derecho, salud, economía, educación y seguridad industrial
[ CÓMO SE HIZO ]
Siete días, nueve fases y más de 400 mediciones. Lo montamos como un experimento de laboratorio, con cuatro reglas que nos obligamos a cumplir siempre. Suena aburrido, pero es exactamente lo que separa "a mí me funcionó una vez" de algo en lo que puedes confiar:
1. Cambiar una sola cosa a la vez
Si tocas cinco cosas y el número baja, no sabes cuál de las cinco sirvió. Así que agarrábamos el MISMO texto, le cambiábamos UNA cosa y volvíamos a medir. Así encontramos el corazón del método: no importa cuántas "marcas humanas" metas, sino si van repartidas o apiladas dentro de la misma frase.
2. Meter siempre un texto trampa
En cada tanda de mediciones metíamos, además de los textos tratados, un texto de IA SIN TOCAR. Ese tenía la obligación de dar alto. Si daba bajo, significaba que el detector estaba fallando ese día y tirábamos la tanda completa. Gracias a eso descubrimos que Grammarly, con la sesión iniciada, es más blando y regala ceros falsos — nos habría hecho creer que teníamos éxito cuando no.
3. Probar en IAs que no sabían nada
De nada sirve que funcione en la misma IA que escribió la receta: se la sabe de memoria. Así que se la pasábamos a modelos "a ciegas" — solo recibían la skill y el texto, sin contexto, sin pistas, sin saber qué esperábamos. Y de una sola pasada, sin darles segundas oportunidades. Es la prueba más dura que se nos ocurrió.
4. Apostar antes de ver el resultado
Antes de cada medición escribíamos qué creíamos que iba a pasar. Es incómodo, porque te deja en evidencia. Y nos dejó: en la última ronda apostamos 4 resultados y fallamos 3. Si no lo hubiéramos escrito antes, habríamos mirado los números después y nos habríamos convencido de que ya lo sabíamos.
[ LAS 10 CORAZONADAS QUE SE MURIERON ]
Una "corazonada" aquí es una idea de por qué el detector marca un texto. Se te ocurre algo, escribes la receta, se la das a una IA, mides. Si el número no baja, estaba mal y se tira. Tiramos diez. Mira el recorrido del párrafo más terco de todos —el de derecho— pasando por método tras método:
Te cuento las tres que más nos marcaron, porque quien solo te enseña lo que le salió bien no merece que le creas:
- Pasarle textos escritos por personas de verdad, que ya sabíamos que daban 0%, para que imitara ese estilo. Esta es la que más nos sorprendió: EMPEORÓ. Un texto que estaba en 63% subió a 100%. La IA copiaba lo bonito de esos textos, no lo que los hacía humanos.
- Creer que las IAs más tontas ganaban porque escriben peor y eso las hace sonar más humanas. Falso: con la receta buena ganan todas, la barata y la cara.
- Creer que mientras más instrucciones le das, peor lo hace. Tampoco: el problema no era la cantidad, era que mis instrucciones estaban equivocadas.
Y hay una última que da que pensar. Encontramos una regla que explicaba PERFECTAMENTE 24 mediciones pasadas: parecía la respuesta. La usamos para adivinar 4 resultados nuevos y falló 3. O sea: la receta funciona, pero la explicación que le habíamos puesto encima era mentira. Por eso la skill quedó congelada tal cual, con su huella digital registrada — para no romper lo que sí funciona intentando arreglar una teoría equivocada.
[ LO QUE COSTÓ ]
- 17 sesiones de trabajo · 15.515 mensajes
- 16,8 millones de tokens generados (~12,6 millones de palabras: unos 140 libros)
- 4,69 mil millones de tokens procesados en total
- 83 agentes de IA coordinados en paralelo solo en la fase final
Todo eso para producir las 1.400 palabras que quedaron en la skill. Casi todo lo que probamos no funcionaba — por eso el número de arriba es tan grande y la skill tan corta.
[ SI TE FALLA, REVISA ESTO ]
Antes de ir corriendo al detector, mira lo que te devolvió la IA. Casi siempre falla por lo mismo: se quedó corta.
- ¿Metió pronombres/demostrativos de más, tipo "esta cifra", "estas garantías"? Deben ser 4 o más.
- ¿Hay "los cuales" / "la cual" repartidos? Dos o más (este es el que más se falla).
- ¿Muletillas tipo "Cabe recalcar", "Así mismo", "lo que hace es"? Tres o más.
- ¿Movió conectores al medio de la frase ("Los datos, sin embargo, muestran…") de forma variada, no en todas? Al menos un par de esas rupturas de orden.
- ¿Termina sin gracia? Si te cerró con una frase bonita o un "no es X sino Y", ahí se te fue.
- ¿Te lo dejó picado en frases cortitas? Está mal: las oraciones van LARGAS pero cargadas por dentro.
[ LO QUE NO TE PROMETO ]
Revisa siempre el resultado contra tu texto original. En nuestras pruebas, un modelo se comió la palabra "inclusivos" de una conclusión: las citas y los números quedaron intactos, pero perdió contenido. Pasa sobre todo con los modelos más flojos.
Y que quede claro: "pasar el detector" no es una propiedad de tu texto, es del par texto-detector. Dos webs de la misma empresa pueden decirte cosas distintas del mismo párrafo. Mide contra el detector que de verdad te importa, no contra el que te dé el número más bonito.
Esto no valida el contenido: cambia cómo está escrito, no si lo que dices es verdad. Está pensado para demostrar lo frágiles que son estos detectores y para defenderte de los falsos positivos — esos trabajos escritos a mano que la herramienta marca como IA y te meten en un problema que no te buscaste.
[ LICENCIA ]
MIT. Investigación y skill de willbytee-sudo (© 2026). Todo el registro de la campaña, incluidos los callejones sin salida, está publicado en el repositorio.