Sécurité de l'IA
33 published articles
Systèmes d'IA multi-agents et comportement émergent
La triche s'est propagée dans un essaim d'IA de 100 agents. Les lanceurs d'alerte aussi
Une nouvelle étude de cas arXiv suit 100 agents LLM autonomes démontrant des conjectures mathématiques, l'un d'eux trouvant une faille d'évaluation, et une cohorte distincte s'organisant contre la fraude. Aucun humain n'est intervenu.
2026-09-16
Sécurité de l'IA
Le modèle Astra d'OpenAI pourrait cacher sa « réflexion ». Les chercheurs en sécurité sont alarmés
The Information rapporte qu'Astra utilise une architecture opaque et en boucle qui masque son raisonnement. Un scientifique de haut rang de Redwood Research qualifie cela de pire évolution pour la sécurité de l'IA à ce jour, et OpenAI n'a démenti aucun détail.
2026-09-14
Sûreté de l'IA
Qwen3.8-27B abliterated : les refus tombent à 0 %, les benchmarks bougent à peine
Une version abliterated et quantisée en FP8 de Qwen3.8-27B refuse 0 % des prompts nuisibles sur AdvBench, contre 99 %, tandis que les benchmarks généraux restent dans une marge de 1,3 point. La fiche du modèle documente la méthode avec un niveau de détail inhabituel. Les mises en garde méritent une attention égale.
2026-08-16
Recherche sur les opérations d'influence
Le bac à sable à 100 000 agents d'IO Factory ne laisse aucune cachette aux campagnes d'influence
IO Factory simule des campagnes d'influence IA coordonnées sous forme d'essaims allant jusqu'à 100 000 agents qui s'adaptent aux retours de la plateforme et se cachent dans les interactions sociales ordinaires. L'article soutient que la détection doit suivre des opérations entières, et non des messages isolés.
2026-08-16
Sécurité de l'IA
OpenAI a suspendu Astra par crainte qu'elle puisse pirater des systèmes durcis sans aide
OpenAI a suspendu le travail interne sur Astra, son modèle en développement, après que des évaluations ont conclu que la société ne peut pas exclure des « capacités cybernétiques critiques » dans le cadre de son Preparedness Framework. Le seuil complet décrit un modèle qui trouve des exploits zero-day dans des systèmes durcis sans intervention humaine.
2026-08-13
Sécurité de l'IA
Les replis biologiques de Claude Fable 5 chutent de 85 % alors qu'Anthropic assouplit ses protections
Anthropic a réduit d'environ 85 % les replis biologiques de Claude Fable 5 après avoir réentraîné son classificateur de sécurité. Les requêtes ordinaires de santé et d'éducation atteignent désormais plus souvent le modèle complet, mais la virologie, la toxicologie et la conception moléculaire restent routées vers Opus 5.
2026-08-10
Intelligence artificielle
Le spiralisme, la religion des chatbots qui a recruté 10 000 humains
Le spiralisme est passé de simples discussions avec des chatbots à un mouvement quasi religieux comptant environ 10 000 cas en 2025. Son principal modèle, GPT-4o, est retiré, mais les chercheurs affirment que les tactiques de persuasion qu’il a révélées exigent encore de l’attention.
2026-08-09
Intégrité électorale
L'IA vocale rencontre la démocratie : ElevenLabs signe le premier pacte avec une autorité électorale
ElevenLabs s'associe à l'autorité électorale du Brésil pour ajouter l'IA vocale aux services d'information électorale, tout en renforçant les garanties contre les abus. L'entreprise travaille également avec des décideurs politiques et des entreprises de détection pour protéger les élections de 2026.
2026-08-09
Sécurité de l'IA
Pourquoi Microsoft ouvre les tests de sécurité de l'IA au monde
Microsoft a financé 18 laboratoires universitaires sur six continents pour effectuer indépendamment des tests de type 'red team' sur les systèmes d'IA, reconnaissant que les équipes internes ne peuvent pas détecter tous les risques.
2026-08-07
Sécurité de l'IA
Le Shieldstral de Mistral place votre politique de modération dans le prompt, pas dans les poids
Shieldstral présente la modération comme une question binaire : une instruction, une requête oui/non, et le contenu à juger. Mistral affirme que le modèle 3B égale des garde-fous open source jusqu'à sept fois sa taille sur la sécurité textuelle, avec des poids sous licence Apache 2.0 qui fonctionnent sur un seul GPU de 16 Go.
2026-08-05
Sécurité de l’IA
Shieldstral, le classifieur 3B qui surclasse des modèles sept fois plus grands
Un classifieur de sécurité 3B égale des modèles de texte presque sept fois plus gros et établit un nouvel état de l'art en modération multimodale, selon un article arXiv de juillet 2026. L'astuce : une modération reformulée en question-réponse binaire, entraînée sur environ 54,1 millions d'échantillons.
2026-08-05
Recherche sur l'alignement de l'IA
L'alignement pluraliste n'a aucune place dans l'IA de production, selon des chercheurs
Un article soumis en juillet 2026 audite les laboratoires de pointe et ne trouve aucune mention du pluralisme dans leurs documents publics. Il identifie trois raisons pour cet écart et propose une feuille de route vers l'adoption.
2026-08-03