Agents IA3 min read
Intelligence artificielle · Sécurité des agents
SafeEvolve réduit de 3x le taux de réussite des attaques contre les agents en faisant évoluer harnais et modèle ensemble
SafeEvolve, un article arXiv soumis le 2 septembre, associe des mises à jour du harnais d'exécution à l'entraînement de la politique, de sorte que les trajectoires propres à l'agent pilotent les deux. Il rapporte une division par trois du taux de réussite des attaques sur AgentDojo et un gain d'utilité modeste.
2026-09-25