Saltar al contenido
> herramientas / humanizador-willito

Humanizador-willito

escritura principiante ★ DESTACADA NUEVO
Willito por Willito
Ver en GitHub

Instalar como skill

¿Usas un agente con skills (Claude Code, Codex, opencode, Antigravity…)? Pega este comando en tu agente y él la guarda solo.

Instala esta skill descargando EXACTAMENTE este archivo y nada más: https://raw.githubusercontent.com/willbytee-sudo/Humanizador-willito/main/SKILL.md — Ese archivo ES la skill completa (ya trae su frontmatter YAML). Guárdalo tal cual como SKILL.md en la carpeta de skills de tu agente (ubica tú la ruta según el agente que seas). NO leas ni instales el README, ni la página web, ni las descripciones, ni ningún otro archivo del repositorio: solo el contenido de ese SKILL.md, sin resumirlo, editarlo ni recortarlo. Déjala lista y avísame cuando esté.

Queda guardada y luego la llamas escribiendo /humanizador-willito o pidiéndosela por su nombre.

Hola, Willito aquí. Esta skill no salió de una idea feliz: salió de una semana entera midiendo, y de matar diez hipótesis hasta que quedó la única que aguantó. Reescribe tu texto académico para que los detectores lo lean como escrito por una persona — sin tocarte una sola cifra, fecha, nombre ni cita. Licencia MIT.

[ ELIGE TU NIVEL ]

La skill te pregunta cuánto quieres empujar antes de empezar (si no dices nada, usa el recomendado). Y trabaja un párrafo a la vez, con calma.

No te confíes: en los dos niveles es OBLIGATORIO que leas el texto que te devuelve la IA. Esto es una base sólida, no un botón mágico. Si quieres un trabajo 100% a tu gusto, revisa algunas zonas y parafraséalas tú mismo, con tus palabras. Nunca entregues sin haberlo leído.
🟢 Recomendado (por defecto)
cuándoTrabajos donde importa que se lea bien
qué haceDensidad de marcas + "perplejidad" (rompe el orden de la frase de forma aleatoria para que el detector no halle un patrón). Gramática limpia, sin errores.
trade-offApunta de forma conservadora a ~4 de 5 detectores, cuidando que el texto siga sonando serio.
🔥 Extremo (si lo pides)
cuándoCuando solo importa el score
qué haceTodo lo anterior, más bajar el vocabulario "de IA" y diluir la densidad con rodeos y frases de relleno deliberadas.
trade-offEmpuja a los 5 de 5 detectores, pero el texto queda más tosco. Revísalo después.

[ LOS NÚMEROS ]

Todo se midió en modo incógnito y con "ancla": en cada tanda metíamos un texto de IA sin tocar que TENÍA que dar alto. Si el ancla no se comportaba, tirábamos la tanda entera a la basura. Son 96 escaneos anclados solo en la validación final.

Grammarly
cuándoEl que más se usa para revisar trabajos
qué haceControl 74–100% IA → 0% de IA
trade-offMídelo siempre en incógnito. Con la sesión iniciada es más blando y te regala ceros falsos: ese error nos contaminó una campaña entera.
Originality.ai
cuándoEl de las agencias y editoriales. El más duro de todos
qué haceControl 100% IA → 95–100% "Confident That's Original"
trade-offEs el resultado con más peso de la lista: no mide "% IA" sino confianza en que el contenido es original.
ZeroGPT
cuándoGratis y muy usado por profes
qué haceControl 100% IA → 0%, "escrito por un humano"
trade-offSin cuenta, sin límite molesto. Es el más fácil de comprobar tú mismo.
QuillBot + humanizeai.pro
cuándoLos otros dos que revisamos
qué haceQuillBot 0% IA · humanizeai 100% humano
trade-offCinco detectores en total, cada uno con su control de IA cruda dando alto.
El mismo texto, antes y después. Cada detector, medido en incógnito.
IA cruda (sin tocar)con la skill = 0%

[ FUNCIONA CON CUALQUIER IA ]

Esto es lo que más nos costó y lo que más importa: que no dependa de una IA cara. La probamos a ciegas — al modelo solo se le pasa la skill y el texto, sin ayuda, sin pistas, sin decirle qué esperamos — y de una sola pasada.

  • DeepSeek — 4 de 4 en 0% (el más barato, y clava todos)
  • Gemini 3.1 Pro — 3 de 3 en 0%
  • Claude (Sonnet y Haiku) — 14 de 16 en 0%
  • 21 de 23 pruebas a ciegas en 0% exacto, sobre 5 temas distintos: derecho, salud, economía, educación y seguridad industrial
Cada punto es una prueba a ciegas, de una sola pasada. Verde = 0% de IA.
DeepSeek0/4
el más barato
Gemini 3.1 Pro0/3
Google
Claude0/16
Sonnet + Haiku
0/23pruebas a ciegas en 0% exacto
Una de las pruebas se hizo con un texto escrito y medido el mismo día, que no está en la skill y que ningún modelo había visto nunca: 100% de IA → 0% de una pasada. Ahí no hay forma de que se lo supiera de memoria.

[ CÓMO SE HIZO ]

Siete días, nueve fases y más de 400 mediciones. Lo montamos como un experimento de laboratorio, con cuatro reglas que nos obligamos a cumplir siempre. Suena aburrido, pero es exactamente lo que separa "a mí me funcionó una vez" de algo en lo que puedes confiar:

1. Cambiar una sola cosa a la vez

Si tocas cinco cosas y el número baja, no sabes cuál de las cinco sirvió. Así que agarrábamos el MISMO texto, le cambiábamos UNA cosa y volvíamos a medir. Así encontramos el corazón del método: no importa cuántas "marcas humanas" metas, sino si van repartidas o apiladas dentro de la misma frase.

La misma cantidad de "marcas humanas" (los puntos). Lo único que cambia es dónde las pones dentro de las frases.
Repartidasuna marca por frase
100% IA
Apiladas2-3 juntas, y frases limpias
0% IA

2. Meter siempre un texto trampa

En cada tanda de mediciones metíamos, además de los textos tratados, un texto de IA SIN TOCAR. Ese tenía la obligación de dar alto. Si daba bajo, significaba que el detector estaba fallando ese día y tirábamos la tanda completa. Gracias a eso descubrimos que Grammarly, con la sesión iniciada, es más blando y regala ceros falsos — nos habría hecho creer que teníamos éxito cuando no.

3. Probar en IAs que no sabían nada

De nada sirve que funcione en la misma IA que escribió la receta: se la sabe de memoria. Así que se la pasábamos a modelos "a ciegas" — solo recibían la skill y el texto, sin contexto, sin pistas, sin saber qué esperábamos. Y de una sola pasada, sin darles segundas oportunidades. Es la prueba más dura que se nos ocurrió.

4. Apostar antes de ver el resultado

Antes de cada medición escribíamos qué creíamos que iba a pasar. Es incómodo, porque te deja en evidencia. Y nos dejó: en la última ronda apostamos 4 resultados y fallamos 3. Si no lo hubiéramos escrito antes, habríamos mirado los números después y nos habríamos convencido de que ya lo sabíamos.

[ LAS 10 CORAZONADAS QUE SE MURIERON ]

Una "corazonada" aquí es una idea de por qué el detector marca un texto. Se te ocurre algo, escribes la receta, se la das a una IA, mides. Si el número no baja, estaba mal y se tira. Tiramos diez. Mira el recorrido del párrafo más terco de todos —el de derecho— pasando por método tras método:

El párrafo de derecho —abstracto puro, sin datos— resistió todo. El mejor % de IA que logró bajarle cada método:
Enseñarle mi proceso mental
24%
Que se auto-corrija solo
46%
Que actúe como un estudiante
100%
La receta final
¡0%!
Rebotó entre 24% y 100% durante días. La receta final lo dejó en 0% — al primer intento.

Te cuento las tres que más nos marcaron, porque quien solo te enseña lo que le salió bien no merece que le creas:

  • Pasarle textos escritos por personas de verdad, que ya sabíamos que daban 0%, para que imitara ese estilo. Esta es la que más nos sorprendió: EMPEORÓ. Un texto que estaba en 63% subió a 100%. La IA copiaba lo bonito de esos textos, no lo que los hacía humanos.
  • Creer que las IAs más tontas ganaban porque escriben peor y eso las hace sonar más humanas. Falso: con la receta buena ganan todas, la barata y la cara.
  • Creer que mientras más instrucciones le das, peor lo hace. Tampoco: el problema no era la cantidad, era que mis instrucciones estaban equivocadas.
La peor de todas fue mía: durante 21 mediciones seguidas le PROHIBÍ a la IA usar el truco más potente de todos, porque no encajaba con mi teoría de por qué funcionaba. Estuve una semana midiendo mi propio error con mucho cuidado. Bastó una pregunta —"¿y no probaste el método que ya te funcionaba?"— para destaparlo: la receta correcta dio 0% al primer intento en el texto que había resistido todo lo demás.

Y hay una última que da que pensar. Encontramos una regla que explicaba PERFECTAMENTE 24 mediciones pasadas: parecía la respuesta. La usamos para adivinar 4 resultados nuevos y falló 3. O sea: la receta funciona, pero la explicación que le habíamos puesto encima era mentira. Por eso la skill quedó congelada tal cual, con su huella digital registrada — para no romper lo que sí funciona intentando arreglar una teoría equivocada.

[ LO QUE COSTÓ ]

0
palabras escritas y medidas
≈ 140 libros · casi todas descartadas
0 palabras tiradas por cada1 que quedó en la skill
  • 17 sesiones de trabajo · 15.515 mensajes
  • 16,8 millones de tokens generados (~12,6 millones de palabras: unos 140 libros)
  • 4,69 mil millones de tokens procesados en total
  • 83 agentes de IA coordinados en paralelo solo en la fase final

Todo eso para producir las 1.400 palabras que quedaron en la skill. Casi todo lo que probamos no funcionaba — por eso el número de arriba es tan grande y la skill tan corta.

[ SI TE FALLA, REVISA ESTO ]

Antes de ir corriendo al detector, mira lo que te devolvió la IA. Casi siempre falla por lo mismo: se quedó corta.

  • ¿Metió pronombres/demostrativos de más, tipo "esta cifra", "estas garantías"? Deben ser 4 o más.
  • ¿Hay "los cuales" / "la cual" repartidos? Dos o más (este es el que más se falla).
  • ¿Muletillas tipo "Cabe recalcar", "Así mismo", "lo que hace es"? Tres o más.
  • ¿Movió conectores al medio de la frase ("Los datos, sin embargo, muestran…") de forma variada, no en todas? Al menos un par de esas rupturas de orden.
  • ¿Termina sin gracia? Si te cerró con una frase bonita o un "no es X sino Y", ahí se te fue.
  • ¿Te lo dejó picado en frases cortitas? Está mal: las oraciones van LARGAS pero cargadas por dentro.

[ LO QUE NO TE PROMETO ]

Revisa siempre el resultado contra tu texto original. En nuestras pruebas, un modelo se comió la palabra "inclusivos" de una conclusión: las citas y los números quedaron intactos, pero perdió contenido. Pasa sobre todo con los modelos más flojos.

Y que quede claro: "pasar el detector" no es una propiedad de tu texto, es del par texto-detector. Dos webs de la misma empresa pueden decirte cosas distintas del mismo párrafo. Mide contra el detector que de verdad te importa, no contra el que te dé el número más bonito.

Solo te aseguro que funciona en los 5 detectores que probamos: Grammarly, Originality.ai, ZeroGPT, QuillBot y humanizeai.pro. Cualquier otro —GPTZero, Turnitin, Copyleaks, uno nuevo que saquen mañana— puede medir de una forma distinta, así que ahí no te garantizo nada. Si te importa uno que no está en la lista, mídelo tú antes de confiarte.

Esto no valida el contenido: cambia cómo está escrito, no si lo que dices es verdad. Está pensado para demostrar lo frágiles que son estos detectores y para defenderte de los falsos positivos — esos trabajos escritos a mano que la herramienta marca como IA y te meten en un problema que no te buscaste.

[ LICENCIA ]

MIT. Investigación y skill de willbytee-sudo (© 2026). Todo el registro de la campaña, incluidos los callejones sin salida, está publicado en el repositorio.

¿TE SIRVIÓ? COMPÁRTELA_

Y si te trabaste, escríbeme en el grupo o pregúntame en un live.