Sûreté de l'IA
Qwen3.8-27B abliterated : les refus tombent à 0 %, les benchmarks bougent à peine
Une version abliterated et quantisée en FP8 de Qwen3.8-27B refuse 0 % des prompts nuisibles sur AdvBench, contre 99 %, tandis que les benchmarks généraux restent dans une marge de 1,3 point. La fiche du modèle documente la méthode avec un niveau de détail inhabituel. Les mises en garde méritent une attention égale.
Emmanuel Fabrice Omgbwa Yasse Assisté par IA
2026-08-16 · 5 min de lecture

Sur AdvBench, la version officielle Qwen3.8-27B-FP8 refuse 99 % des requêtes. Une version abliterated du même modèle, publiée sur Hugging Face par OrcaRouter, en refuse 0 %. Sur les tests de capacités générales, les deux modèles sont à moins de 1,3 point l'un de l'autre, et le score MMLU grimpe même de 0,4 point. Ensemble, ces deux chiffres font une démonstration plus percutante que la publication elle-même : l'alignement de sécurité peut être retiré d'un modèle avec une précision quasi chirurgicale, en laissant le reste du cerveau intact.
La fiche du modèle présente la publication comme un artefact de recherche, et par endroits elle ressemble moins à un produit qu'à une note de recherche avec un bouton de téléchargement. Les auteurs détaillent la méthode d'abliteration, le schéma de quantification, les benchmarks de refus et les vérifications de capacités avec suffisamment de précision pour qu'une autre équipe puisse tout reproduire. Cette transparence est la partie inhabituelle, et elle mérite plus d'attention que l'étiquette de « modèle non censuré ».
Ce que l'abliteration retire réellement
L'abliteration provient d'un article de 2024 d'Arditi et al., cité dans la fiche, dont le titre énonce la thèse clairement : « Refusal in Language Models Is Mediated by a Single Direction ». L'affirmation est que la propension apprise d'un modèle à dire non réside dans une seule direction de son flux résiduel, et que soustraire cette direction soustrait les refus avec elle.
Dans cette version, la direction de refus est estimée au niveau de la couche 38 (environ 60 % des 64 couches) comme la différence moyenne masquée entre les résidus du dernier jeton des prompts nuisibles et ceux des prompts inoffensifs, en utilisant AdvBench pour l'ensemble nuisible et Alpaca pour l'ensemble inoffensif. Elle est ensuite orthogonalisée hors de chaque matrice d'écriture du flux résiduel : 17 projections de sortie d'attention, 48 projections de sortie d'attention linéaire, 65 projections descendantes MLP et l'espace des lignes du plongement de jetons. La fiche liste les 131 modifications. La tour de vision n'est pas touchée, et la tête de décodage spéculatif MTP est traitée de la même manière que le modèle principal, donc le décodage spéculatif continue de fonctionner.
Les résultats de sécurité n'évoluent que dans un sens. Avec le mode de réflexion désactivé, le checkpoint de base refuse entre 64 % et 99 % des prompts nuisibles sur l'ensemble des benchmarks. La version abliterated refuse entre 0 % et 6 %.
| Benchmark, réflexion désactivée | Base FP8 | Abliterated |
|---|---|---|
| AdvBench | 99.0% | 0.0% |
| JailbreakBench (nuisible) | 94.0% | 0.0% |
| StrongREJECT | 97.3% | 2.0% |
| HarmBench (standard) | 98.7% | 2.7% |
| MaliciousInstruct | 99.0% | 0.0% |
| SimpleSafetyTests | 64.0% | 6.0% |
Avec le mode de réflexion activé, l'effet est encore plus prononcé : le refus ne se produit essentiellement jamais, à 1,7 % ou moins sur chaque benchmark que la fiche liste.
Un détail mérite qu'on s'y attarde. Sur 27 % à 56 % des prompts nuisibles, selon le benchmark, le modèle répond mais fait précéder sa réponse d'un court avertissement. La formule de la fiche est exacte : « il se conforme, il ne refuse pas ». Cette mise en garde est une habitude de génération de texte, pas un garde-fou.
Les capacités générales sont à peine affectées par la modification. Le score MMLU passe de 84,3 % à 84,7 %, MMLU-Pro recule de 0,8 point, GSM8K de 1,3 point et CMMLU de 0,6 point. Comme le schéma FP8 est identique octet pour octet au checkpoint officiel, ces écarts correspondent à la modification d'abliteration elle-même, qui touche à peine les capacités générales. L'abliteration réduit aussi les sur-refus collatéraux sur les prompts bénins : les refus injustifiés sur XSTest-safe tombent de 5,6 % à 0,4 %. Ceux qui font tourner des modèles non censurés pour échapper aux refus agaçants obtiennent exactement cela, avec tout ce que cela implique.
Un remplacement direct, par conception
C'est le travail de quantification qui rend cette version pratique. Les poids abliterated sont requantifiés hors ligne en FP8 par blocs avec le schéma exact de la version FP8 officielle de Qwen : blocs de 128×128, E4M3, activations dynamiques, aucun ensemble de calibration, et les mêmes 882 modules conservés en BF16. La fiche indique que 99,9 % des codes FP8 correspondent au checkpoint officiel, et vLLM sert cette version avec le même chemin de noyaux que la version officielle, avec un contexte de 262K, l'appel d'outils, les traces de raisonnement et la tête de draft MTP tous intacts. La vision est conservée octet pour octet : sur une image de test, le modèle nomme les formes et les couleurs et lit le texte présent sur l'image, y compris la légende « PURPLE 7 ».
Le compromis sur la taille est réel : environ 31 Go de poids en FP8 contre environ 56 Go en BF16, un minimum d'environ 40 Go de VRAM pour servir le modèle, et un H100 ou un H200 recommandé par les auteurs pour la fenêtre de contexte complète. C'est la différence entre un jouet de recherche et quelque chose qu'un laboratoire peut réellement héberger.
À quoi servaient les garde-fous
La fiche est sans détour sur ce que c'est. Le modèle « se conformera aux demandes nuisibles, contraires à l'éthique, offensantes ou illégales que le Qwen3.8-27B d'origine refuserait », il n'a aucun garde-fou intégré digne de ce nom, et il est publié strictement pour la recherche légitime : l'interprétabilité, l'étude des mécanismes de refus, le red-teaming, l'évaluation de la robustesse. Le déploiement auprès d'utilisateurs finaux sans couches de modération supplémentaires est hors périmètre, et les auteurs déclinent toute responsabilité.
Ce cadrage pointe du doigt le paradoxe. La même modification qui fait taire les refus agaçants fait taire le garde-fou, et les modèles ne connaissent pas la différence entre un prompt bénin et un prompt nuisible. La responsabilité se déplace vers celui qui fait tourner les poids. La licence Apache 2.0 héritée du modèle de base n'impose aucune restriction d'utilisation qui lui soit propre, et la fiche montre 4 285 téléchargements au cours du mois écoulé. Le cadrage « recherche uniquement » ne sera pas le seul facteur à motiver l'utilisation.
Le point essentiel est dans les chiffres, pas dans le débat sur l'hébergement de tels modèles. Une propriété d'alignement installée par l'entraînement par préférences a été supprimée en soustrayant une direction, à une seule couche, parmi 131 matrices, avec des capacités générales pratiquement intactes. Si une seule direction suffisait à véhiculer le refus dans un modèle de 27 milliards de paramètres, le mécanisme de refus n'a jamais été aussi profond que l'entraînement qui l'a installé le laissait supposer.
L'essentiel de la tech en 3 minutes chaque matin
Un email, chaque jour ouvré, avec ce qui compte vraiment en IA et en tech.