SevenTnewS

Seguridad de la IA

Los fallbacks de biología de Claude Fable 5 caen un 85% mientras Anthropic flexibiliza sus salvaguardas

Anthropic redujo los fallbacks relacionados con biología de Claude Fable 5 en aproximadamente un 85% después de reentrenar su clasificador de seguridad. Las consultas ordinarias de salud y educación ahora llegan al modelo completo con más frecuencia, pero la virología, la toxicología y el diseño molecular siguen derivándose a Opus 5.

Emmanuel Fabrice Omgbwa Yasse Asistido por IA

2026-08-10 · 4 min de lectura

Los fallbacks de biología de Claude Fable 5 caen un 85% mientras Anthropic flexibiliza sus salvaguardas

Anthropic ha flexibilizado las salvaguardas de biología en Claude Fable 5, y el cambio se refleja en una cifra: aproximadamente un 85% menos de fallbacks relacionados con biología en las pruebas de la compañía. Un fallback es lo que ocurre cuando una solicitud activa un clasificador de seguridad y se redirige a Opus 5, un modelo capaz pero con menos capacidad biológica. Para las personas que piden a Fable 5 interpretar resultados de laboratorio, explicar síntomas o enseñar biología, esas redirecciones deberían ser ahora poco habituales.

El impulso para ampliar el acceso es deliberado. Anthropic sostiene que la mayor oportunidad de la IA para beneficiar al mundo está en la biología y la medicina, y afirma que está invirtiendo fuertemente en una vía responsable para dar a los biólogos acceso de frontera. La actualización del clasificador es una mitad de ese plan; las vías de acceso de confianza para capacidades de alto riesgo son la otra.

La compañía es directa sobre por qué esto importa más allá de la conveniencia. Sus evaluaciones de capacidades indican que Fable 5 puede superar a expertos en algunas tareas biológicas muy complejas y proporcionar apoyo operativo en otras. Las mismas capacidades, advierte, podrían dar a un actor malintencionado un "impulso significativo" en el desarrollo de un arma biológica, ofreciendo "capacidades que no podrían encontrar en ningún otro lugar".

Por qué las preguntas ordinarias de biología estaban bloqueadas en el lanzamiento

Fable 5 se lanzó con casi todas las consultas de biología bloqueadas. Anthropic consideró que el riesgo de doble uso era demasiado alto para hacer otra cosa, y optó por poner el modelo a disposición de otros dominios mientras su trabajo de seguridad se ponía al día. Fable 5 es el mismo modelo subyacente que el Claude Mythos 5 de doble uso, publicado a través de programas de acceso de confianza con verificación rigurosa, como cubrimos en nuestro informe de lanzamiento. Contener el modelo durante semanas o meses habría retrasado el acceso general por completo.

Gráfico : Reducción esperada en fallbacks totales
Anthropic estima que el reentrenamiento del clasificador reduce los fallbacks totales en un 67% en Claude.ai, 55% en Cowork, 17% en Claude Code y 7% en Claude Platform, según el artículo.

Esa postura tuvo un coste: un alto número de falsos positivos. Los usuarios que hacían preguntas ordinarias de biología eran enviados a un modelo menos capaz. La compañía califica el intercambio de deliberado, porque el coste del mal uso en un dominio de doble uso como la biología podría ser catastrófico.

Los usos beneficiosos y perjudiciales suelen ser difíciles de distinguir en este campo. Investigar un tratamiento puede requerir producir los compuestos peligrosos que causan la enfermedad. Las vacunas vivas exigen cultivar el mismo patógeno que previenen, y el fármaco contra la hipertensión captopril procede de componentes tóxicos del veneno de serpiente que desploman la presión arterial. Los actores que quieren hacer un mal uso del modelo saben cómo explotar esa ambigüedad, haciendo que las tareas peligrosas parezcan investigación ordinaria.

Cómo se reentrenó el clasificador

Las salvaguardas dependen de clasificadores de seguridad, sistemas automatizados más pequeños que detectan cuando se pide a Fable 5 realizar una tarea biológica protegida o producir un resultado nocivo. Cuando un clasificador se activa, la solicitud se redirige a Opus 5. Ajustar estos sistemas significa reducir los falsos positivos sin crear falsos negativos, manteniéndolos resistentes a los jailbreaks.

Durante las últimas semanas, Anthropic reescribió la constitución del clasificador, las reglas que separan el contenido dentro del alcance del que queda fuera, detallando los usos benignos. La reescritura pasó por una revisión de expertos internos y externos. Le siguieron nuevos datos de entrenamiento, el clasificador fue reentrenado y la compañía verificó que sigue activándose ante contenido nocivo y de investigación de doble uso, a la vez que deja pasar más solicitudes benignas.

El reentrenamiento también recorta los fallbacks totales en toda la línea de productos, según las estimaciones de la compañía:

Superficie del productoReducción esperada de los fallbacks totales
Claude.ai67%
Cowork55%
Claude Code17%
Claude Platform7%

El techo que permanece

La publicación de Anthropic cita la Evaluación Anual de Amenazas 2026 de la Comunidad de Inteligencia de EE. UU., que advierte de que los avances en biotecnología, incluida la biología sintética y la edición genómica, "podrían dar lugar a nuevas amenazas biológicas", y señala que varios actores estatales probablemente mantienen programas activos de armas biológicas y químicas ofensivas. Esos programas, añade la publicación, podrían acelerarse con el acceso a las capacidades de la IA de frontera.

Ese cálculo de riesgo explica lo que no ha cambiado. Las solicitudes consideradas de doble uso, incluidas la virología, la toxicología y el diseño molecular, siguen derivándose a Opus 5. Fable 5 aún no es utilizable para la investigación profesional en biología y el desarrollo de fármacos. Anthropic afirma que está comprometida a cerrar esa brecha mediante vías de acceso de confianza para investigadores verificados.

La cifra del 85% es la medición propia de Anthropic de antes de que la actualización llegara a los usuarios. Si el nuevo límite del clasificador se mantiene bajo presión del mundo real es la pregunta abierta; la compañía espera que sigan quedando algunos falsos positivos.

Lo esencial de la tecnología en 3 minutos cada mañana

Un correo, cada día laborable, con lo que realmente importa en IA y tecnología.