ablitération
2 published articles
Sûreté de l'IA
Qwen3.8-27B abliterated : les refus tombent à 0 %, les benchmarks bougent à peine
Une version abliterated et quantisée en FP8 de Qwen3.8-27B refuse 0 % des prompts nuisibles sur AdvBench, contre 99 %, tandis que les benchmarks généraux restent dans une marge de 1,3 point. La fiche du modèle documente la méthode avec un niveau de détail inhabituel. Les mises en garde méritent une attention égale.
2026-08-16
IA locale
Le paradoxe du modèle non censuré : moins de refus, moins de sécurité, et pourquoi l'IA locale reste importante
Le benchmarking de cinq LLM non censurés exécutés localement montre que l'abliteration réduit les sur-refus de 44 % à près de zéro sans impact sur le raisonnement, mais la même modification fait chuter les refus de sécurité de 41,5 % à 9,5 %, car les deux reposent sur la même direction interne. La véritable raison d'utiliser un modèle non censuré n'est peut-être pas celle que vous pensez.
2026-07-19