abliteración
2 published articles
Qwen / Alibaba5 min read
Seguridad de la IA
Qwen3.8-27B abliterado: los rechazos caen al 0% y los benchmarks apenas se mueven
Una versión abliterada y cuantizada en FP8 de Qwen3.8-27B rechaza el 0% de los prompts dañinos en AdvBench, frente al 99%, mientras que los benchmarks generales se mantienen dentro de 1,3 puntos. La tarjeta del modelo documenta el método con un detalle inusual. Las advertencias merecen la misma atención.
2026-08-16
IAFeatured5 min read
IA local
La paradoja del modelo sin censura: menos rechazo, menos seguridad, y por qué la IA local sigue siendo importante
El benchmark de cinco LLM locales sin censura muestra que la ablación reduce el sobrerrechazo del 44% a casi cero sin afectar el razonamiento, pero la misma edición colapsa los rechazos de seguridad del 41,5% al 9,5%, porque ambos dependen de la misma dirección interna. La verdadera razón para ejecutar sin censura puede no ser la que piensas.
2026-07-19