recherche sur l'alignement
2 published articles
Qwen / Alibaba5 min read
Sûreté de l'IA
Qwen3.8-27B abliterated : les refus tombent à 0 %, les benchmarks bougent à peine
Une version abliterated et quantisée en FP8 de Qwen3.8-27B refuse 0 % des prompts nuisibles sur AdvBench, contre 99 %, tandis que les benchmarks généraux restent dans une marge de 1,3 point. La fiche du modèle documente la méthode avec un niveau de détail inhabituel. Les mises en garde méritent une attention égale.
2026-08-16
LLM & Modèles4 min read
Recherche sur la sécurité de l'IA
Les modèles d'IA ne peuvent pas s'empêcher de penser à voix haute. C'est à la fois une bonne nouvelle et un cauchemar pour la sécurité.
Claude Sonnet 4.5 ne peut contrôler son raisonnement en chaîne que 2,7 % du temps, contre 61,9 % pour les sorties finales. L'écart soulève des questions ouvertes sur la robustesse de la surveillance par CoT en tant que mécanisme de sécurité, et personne ne sait pourquoi il existe.
2026-03-09