SevenTnewS

seguridad de la IA

31 published articles

Anthropic / Claude3 min read

Seguridad y Capacidad de la IA

Anthropic lanza Claude Mythos 5: un modelo de doble uso para ciberseguridad y biología

El Claude Mythos 5 de Anthropic se está implementando en un grupo selecto de organizaciones estadounidenses tras la eliminación de las restricciones de exportación. El modelo establece nuevos máximos en los puntos de referencia de ciberseguridad y biología, pero sigue estrictamente limitado debido a los riesgos de doble uso.

2026-07-09

IAFeatured4 min read

Filosofía de la IA

No, la IA no es una mente rival. Es una extensión de la nuestra

Basándose en la fenomenología de Husserl, los investigadores sostienen que los sistemas de IA se entienden mejor como extensiones de la inteligencia natural, no como mentes autónomas. Esta perspectiva explica las alucinaciones y los fallos composicionales, al tiempo que desplaza los debates sobre seguridad de los temores a una IA rebelde hacia una ingeniería y gobernanza responsables.

2026-07-09

IAFeatured6 min read

Seguridad en IA

La escala de gravedad de jailbreak de Anthropic es una propuesta que podría redefinir la regulación de seguridad en IA

Anthropic propone un sistema de puntuación de cuatro ejes para la gravedad de los jailbreaks de IA, desde 'informativo' hasta 'crítico', y detalla los clasificadores que bloquean usos peligrosos de ciberseguridad de Fable 5. El marco, desarrollado con socios de Glasswing, busca estandarizar cómo la industria y los reguladores hablan sobre el mal uso de los modelos.

2026-07-08

IA3 min read

Regulación de IA

Claude Fable 5 regresa tras el levantamiento de los controles de exportación de EE. UU. Esto es lo que cambió Anthropic

Anthropic despliega nuevamente Claude Fable 5 y Mythos 5 después de que se levantaran los controles de exportación de EE. UU. La compañía detalla actualizaciones de salvaguardas, un marco propuesto para la gravedad de jailbreaks y nuevos compromisos de colaboración gubernamental en seguridad de IA.

2026-07-07

Anthropic / ClaudeFeatured3 min read

Expansión internacional

Anthropic abre oficina en Seúl y expande alianzas en el ecosistema de IA coreano

Anthropic abre una oficina en Seúl y anuncia alianzas con NAVER, Nexon, LG CNS, Hanwha Solutions, Samsung SDS y otros. Un MOU con el Ministerio de Ciencia y TIC de Corea se centra en la seguridad de la IA y la ciberseguridad.

2026-07-07

IA5 min read

Inteligencia Artificial

La IA como una extensión de la inteligencia humana, no un reemplazo

Los sistemas modernos de IA son poderosos no porque repliquen la inteligencia humana, sino porque extienden estructuras ya presentes en la cognición humana y el lenguaje. Esta perspectiva ayuda a explicar tanto las capacidades de la IA como sus límites recurrentes, incluidas las alucinaciones y las brechas de composicionalidad, y desplaza el enfoque de la seguridad de la IA de las narrativas de IA rebelde a la gobernanza a nivel de sistema y la responsabilidad humana.

2026-07-04

LLMs y Modelos4 min read

Investigación en seguridad de IA

Los modelos de IA no pueden dejar de pensar en voz alta. Eso es tanto una buena noticia como una pesadilla para la seguridad.

Claude Sonnet 4.5 puede controlar su cadena de pensamiento solo el 2.7% del tiempo, frente al 61.9% para los resultados finales. La brecha plantea preguntas abiertas sobre la solidez de la monitorización de CoT como mecanismo de seguridad, y nadie sabe por qué existe.

2026-03-09

← PreviousPage 6 / 3 · 31 articlesNext →