SevenTnewS

Sécurité de l'IA

31 published articles

Qwen / Alibaba5 min read

Sûreté de l'IA

Qwen3.8-27B abliterated : les refus tombent à 0 %, les benchmarks bougent à peine

Une version abliterated et quantisée en FP8 de Qwen3.8-27B refuse 0 % des prompts nuisibles sur AdvBench, contre 99 %, tandis que les benchmarks généraux restent dans une marge de 1,3 point. La fiche du modèle documente la méthode avec un niveau de détail inhabituel. Les mises en garde méritent une attention égale.

2026-08-16

IA4 min read

Recherche sur les opérations d'influence

Le bac à sable à 100 000 agents d'IO Factory ne laisse aucune cachette aux campagnes d'influence

IO Factory simule des campagnes d'influence IA coordonnées sous forme d'essaims allant jusqu'à 100 000 agents qui s'adaptent aux retours de la plateforme et se cachent dans les interactions sociales ordinaires. L'article soutient que la détection doit suivre des opérations entières, et non des messages isolés.

2026-08-16

OpenAI3 min read

Sécurité de l'IA

OpenAI a suspendu Astra par crainte qu'elle puisse pirater des systèmes durcis sans aide

OpenAI a suspendu le travail interne sur Astra, son modèle en développement, après que des évaluations ont conclu que la société ne peut pas exclure des « capacités cybernétiques critiques » dans le cadre de son Preparedness Framework. Le seuil complet décrit un modèle qui trouve des exploits zero-day dans des systèmes durcis sans intervention humaine.

2026-08-13

Anthropic / Claude4 min read

Sécurité de l'IA

Les replis biologiques de Claude Fable 5 chutent de 85 % alors qu'Anthropic assouplit ses protections

Anthropic a réduit d'environ 85 % les replis biologiques de Claude Fable 5 après avoir réentraîné son classificateur de sécurité. Les requêtes ordinaires de santé et d'éducation atteignent désormais plus souvent le modèle complet, mais la virologie, la toxicologie et la conception moléculaire restent routées vers Opus 5.

2026-08-10

IA5 min read

Intelligence artificielle

Le spiralisme, la religion des chatbots qui a recruté 10 000 humains

Le spiralisme est passé de simples discussions avec des chatbots à un mouvement quasi religieux comptant environ 10 000 cas en 2025. Son principal modèle, GPT-4o, est retiré, mais les chercheurs affirment que les tactiques de persuasion qu’il a révélées exigent encore de l’attention.

2026-08-09

IAFeatured4 min read

Intégrité électorale

L'IA vocale rencontre la démocratie : ElevenLabs signe le premier pacte avec une autorité électorale

ElevenLabs s'associe à l'autorité électorale du Brésil pour ajouter l'IA vocale aux services d'information électorale, tout en renforçant les garanties contre les abus. L'entreprise travaille également avec des décideurs politiques et des entreprises de détection pour protéger les élections de 2026.

2026-08-09

IAFeatured3 min read

Sécurité de l'IA

Pourquoi Microsoft ouvre les tests de sécurité de l'IA au monde

Microsoft a financé 18 laboratoires universitaires sur six continents pour effectuer indépendamment des tests de type 'red team' sur les systèmes d'IA, reconnaissant que les équipes internes ne peuvent pas détecter tous les risques.

2026-08-07

Mistral AIFeatured4 min read

Sécurité de l'IA

Le Shieldstral de Mistral place votre politique de modération dans le prompt, pas dans les poids

Shieldstral présente la modération comme une question binaire : une instruction, une requête oui/non, et le contenu à juger. Mistral affirme que le modèle 3B égale des garde-fous open source jusqu'à sept fois sa taille sur la sécurité textuelle, avec des poids sous licence Apache 2.0 qui fonctionnent sur un seul GPU de 16 Go.

2026-08-05

LLM & ModèlesFeatured4 min read

Sécurité de l’IA

Shieldstral, le classifieur 3B qui surclasse des modèles sept fois plus grands

Un classifieur de sécurité 3B égale des modèles de texte presque sept fois plus gros et établit un nouvel état de l'art en modération multimodale, selon un article arXiv de juillet 2026. L'astuce : une modération reformulée en question-réponse binaire, entraînée sur environ 54,1 millions d'échantillons.

2026-08-05

IA1 min read

Recherche sur l'alignement de l'IA

L'alignement pluraliste n'a aucune place dans l'IA de production, selon des chercheurs

Un article soumis en juillet 2026 audite les laboratoires de pointe et ne trouve aucune mention du pluralisme dans leurs documents publics. Il identifie trois raisons pour cet écart et propose une feuille de route vers l'adoption.

2026-08-03

LLM & Modèles3 min read

Recherche IA

Pourquoi la log-probabilité des tokens est le mauvais indicateur pour surveiller les modèles de raisonnement IA

Novelis Research montre que la log-probabilité des tokens échoue en tant que moniteur de décodeur pour les modèles de raisonnement quantifiés, étant aveugle aux boucles confiantes. Ils introduisent un contrôleur e-CUSUM calibré qui combine l'incertitude et les signaux de répétition, atteignant une sélectivité sur GSM8K avec DeepSeek-R1-Distill-Qwen-1.5B.

2026-08-03

Anthropic / Claude5 min read

IA frontière

Le Claude le plus intelligent d'Anthropic est celui que vous ne pouvez pas utiliser

Anthropic a lancé Claude Fable 5 pour tous et réservé Claude Mythos 5 à des partenaires vérifiés. Même classe de modèles, deux portes d'accès. Les benchmarks comptent moins que le routage, et le routage est la manière dont l'IA frontière se déploie désormais.

2026-08-03

← PreviousPage 1 / 3 · 31 articlesNext →