Sécurité de l'IA
31 published articles
Sécurité et capacités de l'IA
Anthropic lance Claude Mythos 5 : un modèle à double usage pour la cybersécurité et la biologie
Le Claude Mythos 5 d'Anthropic est désormais déployé auprès d'un groupe sélectionné d'organisations américaines après la levée des restrictions à l'exportation. Le modèle établit de nouveaux records dans les benchmarks de cybersécurité et de biologie, mais reste strictement limité en raison des risques de double usage.
2026-07-09
Philosophie de l’IA
Non, l’IA n’est pas un esprit rival. C’est une extension du nôtre
S’appuyant sur la phénoménologie de Husserl, des chercheurs soutiennent que les systèmes d’IA sont mieux compris comme des extensions de l’intelligence naturelle, et non comme des esprits autonomes. Cette perspective explique les hallucinations et les échecs de compositionalité tout en déplaçant les débats sur la sécurité des craintes d’une IA rebelle vers une ingénierie et une gouvernance responsables.
2026-07-09
Sécurité de l'IA
L'échelle de sévérité des jailbreaks d'Anthropic, une proposition qui pourrait remodeler la régulation de la sécurité de l'IA
Anthropic propose un système de notation à quatre axes pour la sévérité des jailbreaks de l'IA, allant de «informationnel» à «critique», et détaille les classifieurs qui bloquent les utilisations dangereuses en cybersécurité de Fable 5. Le cadre, développé avec les partenaires de Glasswing, vise à standardiser la façon dont l'industrie et les régulateurs parlent de l'utilisation abusive des modèles.
2026-07-08
Régulation de l'IA
Claude Fable 5 est de retour après la levée des contrôles à l'exportation par les États-Unis. Voici ce qu'Anthropic a modifié
Anthropic redéploie Claude Fable 5 et Mythos 5 après la levée des contrôles à l'exportation par les États-Unis. L'entreprise détaille les mises à jour des garde-fous, un cadre proposé pour évaluer la gravité des jailbreaks, et de nouveaux engagements pour la collaboration gouvernementale en matière de sécurité de l'IA.
2026-07-07
Expansion internationale
Anthropic ouvre un bureau à Séoul et étend ses partenariats dans l'écosystème coréen de l'IA
Anthropic ouvre un bureau à Séoul et annonce des partenariats avec NAVER, Nexon, LG CNS, Hanwha Solutions, Samsung SDS et d'autres. Un protocole d'accord avec le ministère coréen des Sciences et des TIC se concentre sur la sécurité de l'IA et la cybersécurité.
2026-07-07
Intelligence Artificielle
L'IA comme extension de l'intelligence humaine, et non comme remplacement
Les systèmes d'IA modernes sont puissants non pas parce qu'ils reproduisent l'intelligence humaine, mais parce qu'ils étendent des structures déjà présentes dans la cognition et le langage humains. Cette perspective aide à expliquer à la fois les capacités de l'IA et ses limites récurrentes, y compris les hallucinations et les lacunes de compositionnalité, et déplace l'attention de la sécurité de l'IA des récits d'IA rebelle vers une gouvernance au niveau des systèmes et une responsabilité humaine.
2026-07-04
Recherche sur la sécurité de l'IA
Les modèles d'IA ne peuvent pas s'empêcher de penser à voix haute. C'est à la fois une bonne nouvelle et un cauchemar pour la sécurité.
Claude Sonnet 4.5 ne peut contrôler son raisonnement en chaîne que 2,7 % du temps, contre 61,9 % pour les sorties finales. L'écart soulève des questions ouvertes sur la robustesse de la surveillance par CoT en tant que mécanisme de sécurité, et personne ne sait pourquoi il existe.
2026-03-09