quantification FP8
2 published articles
Qwen / Alibaba5 min read
Sûreté de l'IA
Qwen3.8-27B abliterated : les refus tombent à 0 %, les benchmarks bougent à peine
Une version abliterated et quantisée en FP8 de Qwen3.8-27B refuse 0 % des prompts nuisibles sur AdvBench, contre 99 %, tandis que les benchmarks généraux restent dans une marge de 1,3 point. La fiche du modèle documente la méthode avec un niveau de détail inhabituel. Les mises en garde méritent une attention égale.
2026-08-16
IA3 min read
Intelligence artificielle
La nouvelle bibliothèque megakernel d'Aleph Alpha réduit la latence d'inférence MoE de 200 %
Alpha-MoE fusionne plusieurs opérations en un seul noyau persistant pour obtenir jusqu'à 200 % de gains de vitesse d'inférence par rapport aux noyaux Triton dans vLLM et SGLang, ciblant les modèles MoE en précision FP8.
2026-07-09