Cuantización FP8
2 published articles
Qwen / Alibaba5 min read
Seguridad de la IA
Qwen3.8-27B abliterado: los rechazos caen al 0% y los benchmarks apenas se mueven
Una versión abliterada y cuantizada en FP8 de Qwen3.8-27B rechaza el 0% de los prompts dañinos en AdvBench, frente al 99%, mientras que los benchmarks generales se mantienen dentro de 1,3 puntos. La tarjeta del modelo documenta el método con un detalle inusual. Las advertencias merecen la misma atención.
2026-08-16
IA3 min read
Inteligencia artificial
La nueva librería megakernel de Aleph Alpha reduce la latencia de inferencia MoE en un 200%
Alpha-MoE fusiona múltiples operaciones en un solo kernel persistente para lograr ganancias de velocidad de inferencia de hasta el 200% sobre los kernels basados en Triton en vLLM y SGLang, dirigido a modelos MoE de precisión FP8.
2026-07-09