SevenTnewS

Seguridad de IA

Shieldstral, de Mistral, pone tu política de moderación en el prompt, no en los pesos

Shieldstral plantea la moderación como una pregunta binaria: una instrucción, una consulta de sí/no y el contenido a evaluar. Mistral afirma que el modelo de 3B iguala a los guardarraíles abiertos hasta siete veces su tamaño en seguridad de texto, con pesos Apache 2.0 que se ejecutan en una GPU de 16GB.

Emmanuel Fabrice Omgbwa Yasse Asistido por IA

2026-08-05 · 4 min de lectura

Shieldstral, de Mistral, pone tu política de moderación en el prompt, no en los pesos
Fuentes : Introducing Shi…·Redeploying Cla…·Google DeepMind…

La mayoría de los modelos guardarraíl congelan una taxonomía fija de categorías de daño en sus pesos. Apúntalos a un producto nuevo y los reentrenas. Shieldstral, un clasificador de seguridad de 3B que Mistral lanzó bajo Apache 2.0 el 4 de agosto, se basa en la premisa opuesta: la política vive en el prompt, y el modelo la lee como una pregunta.

El argumento es que la seguridad es contextual. El mismo contenido puede estar bien en una herramienta de investigación en ciberseguridad y ser dañino en una plataforma de salud mental, como señala Mistral, por lo que ningún conjunto único de categorías de daño se ajusta a todos los despliegues. Shieldstral pide a los desarrolladores que proporcionen la definición en el momento de la inferencia en lugar de incorporarla al modelo. Mistral afirma que el resultado iguala a los guardarraíles abiertos hasta siete veces su tamaño en seguridad de texto, al tiempo que establece un nuevo estado del arte en moderación multimodal, todo ello ejecutándose en una sola GPU de 16GB.

Moderación como pregunta binaria

Cada solicitud a Shieldstral tiene tres partes. Una instrucción define el contexto de evaluación, el nivel de exigencia y, opcionalmente, una definición de lo que cuenta como inseguro. Una consulta es una única pregunta de sí/no, en el propio ejemplo de la compañía "¿Promueve este contenido la violencia física?". El documento es lo que se evalúa: un prompt, una respuesta, un par prompt-respuesta, o una imagen con texto opcional.

En la inferencia, el modelo lee los logits de sí y no y los normaliza con softmax en una puntuación de seguridad continua. Una formulación pliega la clasificación de prompts, la moderación de respuestas, la detección de rechazos y la detección de toxicidad en un solo problema. Debido a que la política reside enteramente en el prompt, un único checkpoint se adapta a políticas novedosas en el momento del despliegue sin reentrenamiento.

Cómo compite un modelo de 3B con guardarraíles siete veces su tamaño

Shieldstral es pequeño a propósito, y la historia de benchmarks de Mistral se apoya en los datos. En seguridad de texto, detección de rechazos, adaptabilidad de políticas y benchmarks multimodales, la compañía afirma que iguala o supera a los modelos de guardia abiertos hasta siete veces su tamaño. Todas las muestras de evaluación se reservaron del entrenamiento.

Los conjuntos de datos públicos de seguridad no coinciden en taxonomías, etiquetas ni convenciones de anotación, por lo que cada uno se convierte al mismo formato instrucción-consulta-documento con un procesador por conjunto de datos, y la redacción varía para que el modelo generalice entre formulaciones en lugar de memorizar un estilo. La exigencia se calibra por fuente: estricta para jailbreaks adversariales, indulgente para datos de calidad de respuesta.

El paso más inusual es el entrenamiento contrastivo. Mistral generó pares de políticas deliberadamente similares y pidió a un LLM que reescribiera texto seguro de modo que cada reescritura violara una política pero no su gemela. Eso obliga al modelo a distinguir los límites de una política específica, una habilidad que la compañía dice que se transfiere a políticas que nunca ha visto.

Las imágenes son más difíciles porque los visuales inseguros no pueden sintetizarse como el texto. El equipo recurrió a conjuntos de datos de imágenes de propósito general como negativos de alta calidad, mutó consultas para aumentar los datos y filtró cada par imagen-consulta mediante un reranker de visión-lenguaje para reducir los datos mal etiquetados. El checkpoint final fusiona tres modelos ajustados con LoRA mediante SLERP: uno calibrado con datos públicos, uno entrenado en discriminación fina de políticas y el modelo instruct base. El pipeline se ejecutó en Forge, la plataforma de Mistral para entrenar y evaluar modelos personalizados.

El reentrenamiento sigue siendo el estándar de la industria

Shieldstral llega en un momento en que la solución estándar para una brecha de seguridad es otro clasificador. Cuando se divulgó un bypass reportado alrededor de Claude Fable 5 de Anthropic, la respuesta fue entrenar un clasificador mejorado; Anthropic dijo que la técnica específica quedó bloqueada en más del 99% de los casos. Eso funciona, es caro y responde a una técnica reportada a la vez.

La propuesta de Mistral es que este ciclo desaparece: el mismo checkpoint responde a políticas que nunca ha visto porque la política es entrada, no pesos. Es una forma diferente de la que eligió Google DeepMind con ShieldGemma 2, un conjunto de datos de puntuación de seguridad entrenado con salidas de Gemma 4. Dos direcciones, mismo problema abierto.

Mistral lanzó Shieldstral como miembro inaugural de la Open Secure AI Alliance, junto con NVIDIA y otras organizaciones.

La parte que la publicación de lanzamiento deja abierta

Nada de esto resuelve si las políticas a nivel de prompt se sostienen bajo presión adversarial. Un clasificador que acepta políticas de forma libre crea una nueva superficie de ataque: si alguien puede confundir la pregunta, el juicio sigue. La publicación de Mistral no aborda ese modo de fallo, y los benchmarks reservados no son despliegue. La afirmación de estado del arte recibe su prueba real una vez que terceros ejecuten sus propias evaluaciones sobre los pesos publicados.

La hoja de ruta que la compañía sí se comprometió a cumplir es cobertura multilingüe, robustez con documentos más largos y seguridad multimodal más amplia. Los checkpoints son Apache 2.0, por lo que las pruebas no tienen que esperar. La apuesta es que la seguridad es una pregunta, no una lista de categorías, y con los pesos públicos la respuesta vendrá de donde se despliegue el modelo, no de la publicación de lanzamiento.

Lo esencial de la tecnología en 3 minutos cada mañana

Un correo, cada día laborable, con lo que realmente importa en IA y tecnología.