SevenTnewS

moderación de contenido

4 published articles

Mistral AIFeatured4 min read

Seguridad de IA

Shieldstral, de Mistral, pone tu política de moderación en el prompt, no en los pesos

Shieldstral plantea la moderación como una pregunta binaria: una instrucción, una consulta de sí/no y el contenido a evaluar. Mistral afirma que el modelo de 3B iguala a los guardarraíles abiertos hasta siete veces su tamaño en seguridad de texto, con pesos Apache 2.0 que se ejecutan en una GPU de 16GB.

2026-08-05

LLMs y ModelosFeatured4 min read

Seguridad de IA

Shieldstral, el clasificador de 3B que supera a modelos siete veces más grandes

Un clasificador de seguridad de 3B iguala a los modelos de texto casi siete veces más grandes y establece un nuevo estado del arte en moderación multimodal, según un artículo de arXiv de julio de 2026. El truco: la moderación reformulada como respuesta a preguntas binarias, entrenada con aproximadamente 54,1 millones de muestras.

2026-08-05

IA3 min read

Informe de Integridad

Stability AI reportó 13 informes de CSAM al NCMEC en su primer informe de transparencia

El informe cubre seguridad de modelos, red teaming, moderación de contenido y colaboración con las fuerzas del orden. Stability AI afirma que no detectó CSAM en sus datos de entrenamiento y realizó pruebas de estrés en todos sus modelos generativos sin encontrar capacidades de CSAM.

2026-07-28

IAFeatured2 min read

Gobernanza de la IA

Los gigantes tecnológicos de China acaban de eliminar millones de relaciones con IA

ByteDance, Tencent y Alibaba están cerrando simultáneamente las funciones de compañero de IA que permitían a millones de usuarios formar vínculos emocionales con personajes virtuales personalizables. La medida, ampliamente vista como una respuesta a las nuevas regulaciones de contenido de IA de China que entrarán en vigor en abril de 2026, ha desencadenado indignación de los usuarios y quejas por perder inversiones emocionales insustituibles.

2026-07-08