investigación de alineación
2 published articles
Qwen / Alibaba5 min read
Seguridad de la IA
Qwen3.8-27B abliterado: los rechazos caen al 0% y los benchmarks apenas se mueven
Una versión abliterada y cuantizada en FP8 de Qwen3.8-27B rechaza el 0% de los prompts dañinos en AdvBench, frente al 99%, mientras que los benchmarks generales se mantienen dentro de 1,3 puntos. La tarjeta del modelo documenta el método con un detalle inusual. Las advertencias merecen la misma atención.
2026-08-16
LLMs y Modelos4 min read
Investigación en seguridad de IA
Los modelos de IA no pueden dejar de pensar en voz alta. Eso es tanto una buena noticia como una pesadilla para la seguridad.
Claude Sonnet 4.5 puede controlar su cadena de pensamiento solo el 2.7% del tiempo, frente al 61.9% para los resultados finales. La brecha plantea preguntas abiertas sobre la solidez de la monitorización de CoT como mecanismo de seguridad, y nadie sabe por qué existe.
2026-03-09