Agentes de IA3 min read
Inteligencia artificial · Seguridad de agentes
SafeEvolve reduce 3 veces el éxito de ataque contra agentes al evolucionar conjuntamente el harness y el modelo
SafeEvolve, un artículo de arXiv enviado el 2 de septiembre, combina actualizaciones del harness en tiempo de ejecución con entrenamiento de la política, de modo que las propias trayectorias del agente impulsan a ambos. Reporta una reducción de tres veces en el éxito de ataque en AgentDojo y una modesta ganancia de utilidad.
2026-09-25