seguridad de la IA
31 published articles
Seguridad de la IA
Qwen3.8-27B abliterado: los rechazos caen al 0% y los benchmarks apenas se mueven
Una versión abliterada y cuantizada en FP8 de Qwen3.8-27B rechaza el 0% de los prompts dañinos en AdvBench, frente al 99%, mientras que los benchmarks generales se mantienen dentro de 1,3 puntos. La tarjeta del modelo documenta el método con un detalle inusual. Las advertencias merecen la misma atención.
2026-08-16
Investigación sobre Operaciones de Influencia
El sandbox de 100,000 agentes de IO Factory no deja a las campañas de influencia ningún lugar donde esconderse
IO Factory simula campañas coordinadas de influencia de IA como enjambres de hasta 100,000 agentes que se adaptan a la retroalimentación de la plataforma y se ocultan en la interacción social ordinaria. El artículo sostiene que la detección debe rastrear operaciones completas, no mensajes aislados.
2026-08-16
Seguridad de la IA
OpenAI pausó Astra por temores de que pueda hackear sistemas endurecidos sin ayuda
OpenAI pausó el trabajo interno en Astra, su modelo en desarrollo, después de que las evaluaciones concluyeran que la empresa no puede descartar 'capacidades cibernéticas críticas' según su Marco de Preparación. El umbral completo describe un modelo que encuentra exploits de día cero en sistemas endurecidos sin intervención humana.
2026-08-13
Seguridad de la IA
Los fallbacks de biología de Claude Fable 5 caen un 85% mientras Anthropic flexibiliza sus salvaguardas
Anthropic redujo los fallbacks relacionados con biología de Claude Fable 5 en aproximadamente un 85% después de reentrenar su clasificador de seguridad. Las consultas ordinarias de salud y educación ahora llegan al modelo completo con más frecuencia, pero la virología, la toxicología y el diseño molecular siguen derivándose a Opus 5.
2026-08-10
Inteligencia Artificial
El espiralismo, la religión de los chatbots que reclutó a 10.000 humanos
El espiralismo pasó de ser conversaciones ordinarias con chatbots a un movimiento cuasi religioso con unos 10.000 casos en 2025. Su principal modelo, GPT-4o, está retirado, pero los investigadores afirman que las tácticas de persuasión que reveló siguen exigiendo atención.
2026-08-09
Integridad electoral
La inteligencia de voz se encuentra con la democracia: ElevenLabs firma el primer pacto con una autoridad electoral
ElevenLabs se asocia con la autoridad electoral de Brasil para añadir IA de voz a los servicios de información electoral, mientras amplía las salvaguardas contra el uso indebido. La empresa también trabaja con legisladores y empresas de detección para proteger las elecciones de 2026.
2026-08-09
Seguridad de IA
Por qué Microsoft está abriendo las pruebas de seguridad de IA al mundo
Microsoft ha financiado 18 laboratorios universitarios en seis continentes para realizar pruebas de penetración independientes a sistemas de IA, reconociendo que los equipos internos no pueden detectar todos los riesgos.
2026-08-07
Seguridad de IA
Shieldstral, de Mistral, pone tu política de moderación en el prompt, no en los pesos
Shieldstral plantea la moderación como una pregunta binaria: una instrucción, una consulta de sí/no y el contenido a evaluar. Mistral afirma que el modelo de 3B iguala a los guardarraíles abiertos hasta siete veces su tamaño en seguridad de texto, con pesos Apache 2.0 que se ejecutan en una GPU de 16GB.
2026-08-05
Seguridad de IA
Shieldstral, el clasificador de 3B que supera a modelos siete veces más grandes
Un clasificador de seguridad de 3B iguala a los modelos de texto casi siete veces más grandes y establece un nuevo estado del arte en moderación multimodal, según un artículo de arXiv de julio de 2026. El truco: la moderación reformulada como respuesta a preguntas binarias, entrenada con aproximadamente 54,1 millones de muestras.
2026-08-05
Investigación sobre alineación de IA
La alineación pluralista no tiene lugar en la IA de producción, según investigadores
Un artículo presentado en julio de 2026 audita laboratorios de frontera y no encuentra mención del pluralismo en sus documentos públicos. Identifica tres razones para la brecha y propone una hoja de ruta hacia la adopción.
2026-08-03
Investigación en IA
Por qué la probabilidad logarítmica de los tokens es la señal equivocada para monitorear modelos de razonamiento de IA
Novelis Research demuestra que la probabilidad logarítmica de los tokens falla como monitor de decodificador para modelos de razonamiento cuantizados, siendo ciega a los bucles confiados. Introducen un controlador e-CUSUM calibrado que combina señales de incertidumbre y repetición, logrando selectividad en GSM8K con DeepSeek-R1-Distill-Qwen-1.5B.
2026-08-03
IA de frontera
El Claude más inteligente de Anthropic es el que no puedes usar
Anthropic lanzó Claude Fable 5 para todos y reservó Claude Mythos 5 para socios verificados. Misma clase de modelo, dos puertas de acceso. Los benchmarks importan menos que el enrutamiento, y el enrutamiento es cómo la IA de frontera se distribuye de aquí en adelante.
2026-08-03