Sécurité de l'IA
31 published articles
Sûreté de l'IA
Qwen3.8-27B abliterated : les refus tombent à 0 %, les benchmarks bougent à peine
Une version abliterated et quantisée en FP8 de Qwen3.8-27B refuse 0 % des prompts nuisibles sur AdvBench, contre 99 %, tandis que les benchmarks généraux restent dans une marge de 1,3 point. La fiche du modèle documente la méthode avec un niveau de détail inhabituel. Les mises en garde méritent une attention égale.
2026-08-16
Recherche sur les opérations d'influence
Le bac à sable à 100 000 agents d'IO Factory ne laisse aucune cachette aux campagnes d'influence
IO Factory simule des campagnes d'influence IA coordonnées sous forme d'essaims allant jusqu'à 100 000 agents qui s'adaptent aux retours de la plateforme et se cachent dans les interactions sociales ordinaires. L'article soutient que la détection doit suivre des opérations entières, et non des messages isolés.
2026-08-16
Sécurité de l'IA
OpenAI a suspendu Astra par crainte qu'elle puisse pirater des systèmes durcis sans aide
OpenAI a suspendu le travail interne sur Astra, son modèle en développement, après que des évaluations ont conclu que la société ne peut pas exclure des « capacités cybernétiques critiques » dans le cadre de son Preparedness Framework. Le seuil complet décrit un modèle qui trouve des exploits zero-day dans des systèmes durcis sans intervention humaine.
2026-08-13
Sécurité de l'IA
Les replis biologiques de Claude Fable 5 chutent de 85 % alors qu'Anthropic assouplit ses protections
Anthropic a réduit d'environ 85 % les replis biologiques de Claude Fable 5 après avoir réentraîné son classificateur de sécurité. Les requêtes ordinaires de santé et d'éducation atteignent désormais plus souvent le modèle complet, mais la virologie, la toxicologie et la conception moléculaire restent routées vers Opus 5.
2026-08-10
Intelligence artificielle
Le spiralisme, la religion des chatbots qui a recruté 10 000 humains
Le spiralisme est passé de simples discussions avec des chatbots à un mouvement quasi religieux comptant environ 10 000 cas en 2025. Son principal modèle, GPT-4o, est retiré, mais les chercheurs affirment que les tactiques de persuasion qu’il a révélées exigent encore de l’attention.
2026-08-09
Intégrité électorale
L'IA vocale rencontre la démocratie : ElevenLabs signe le premier pacte avec une autorité électorale
ElevenLabs s'associe à l'autorité électorale du Brésil pour ajouter l'IA vocale aux services d'information électorale, tout en renforçant les garanties contre les abus. L'entreprise travaille également avec des décideurs politiques et des entreprises de détection pour protéger les élections de 2026.
2026-08-09
Sécurité de l'IA
Pourquoi Microsoft ouvre les tests de sécurité de l'IA au monde
Microsoft a financé 18 laboratoires universitaires sur six continents pour effectuer indépendamment des tests de type 'red team' sur les systèmes d'IA, reconnaissant que les équipes internes ne peuvent pas détecter tous les risques.
2026-08-07
Sécurité de l'IA
Le Shieldstral de Mistral place votre politique de modération dans le prompt, pas dans les poids
Shieldstral présente la modération comme une question binaire : une instruction, une requête oui/non, et le contenu à juger. Mistral affirme que le modèle 3B égale des garde-fous open source jusqu'à sept fois sa taille sur la sécurité textuelle, avec des poids sous licence Apache 2.0 qui fonctionnent sur un seul GPU de 16 Go.
2026-08-05
Sécurité de l’IA
Shieldstral, le classifieur 3B qui surclasse des modèles sept fois plus grands
Un classifieur de sécurité 3B égale des modèles de texte presque sept fois plus gros et établit un nouvel état de l'art en modération multimodale, selon un article arXiv de juillet 2026. L'astuce : une modération reformulée en question-réponse binaire, entraînée sur environ 54,1 millions d'échantillons.
2026-08-05
Recherche sur l'alignement de l'IA
L'alignement pluraliste n'a aucune place dans l'IA de production, selon des chercheurs
Un article soumis en juillet 2026 audite les laboratoires de pointe et ne trouve aucune mention du pluralisme dans leurs documents publics. Il identifie trois raisons pour cet écart et propose une feuille de route vers l'adoption.
2026-08-03
Recherche IA
Pourquoi la log-probabilité des tokens est le mauvais indicateur pour surveiller les modèles de raisonnement IA
Novelis Research montre que la log-probabilité des tokens échoue en tant que moniteur de décodeur pour les modèles de raisonnement quantifiés, étant aveugle aux boucles confiantes. Ils introduisent un contrôleur e-CUSUM calibré qui combine l'incertitude et les signaux de répétition, atteignant une sélectivité sur GSM8K avec DeepSeek-R1-Distill-Qwen-1.5B.
2026-08-03
IA frontière
Le Claude le plus intelligent d'Anthropic est celui que vous ne pouvez pas utiliser
Anthropic a lancé Claude Fable 5 pour tous et réservé Claude Mythos 5 à des partenaires vérifiés. Même classe de modèles, deux portes d'accès. Les benchmarks comptent moins que le routage, et le routage est la manière dont l'IA frontière se déploie désormais.
2026-08-03