moderación de contenido
4 published articles
Seguridad de IA
Shieldstral, de Mistral, pone tu política de moderación en el prompt, no en los pesos
Shieldstral plantea la moderación como una pregunta binaria: una instrucción, una consulta de sí/no y el contenido a evaluar. Mistral afirma que el modelo de 3B iguala a los guardarraíles abiertos hasta siete veces su tamaño en seguridad de texto, con pesos Apache 2.0 que se ejecutan en una GPU de 16GB.
2026-08-05
Seguridad de IA
Shieldstral, el clasificador de 3B que supera a modelos siete veces más grandes
Un clasificador de seguridad de 3B iguala a los modelos de texto casi siete veces más grandes y establece un nuevo estado del arte en moderación multimodal, según un artículo de arXiv de julio de 2026. El truco: la moderación reformulada como respuesta a preguntas binarias, entrenada con aproximadamente 54,1 millones de muestras.
2026-08-05
Informe de Integridad
Stability AI reportó 13 informes de CSAM al NCMEC en su primer informe de transparencia
El informe cubre seguridad de modelos, red teaming, moderación de contenido y colaboración con las fuerzas del orden. Stability AI afirma que no detectó CSAM en sus datos de entrenamiento y realizó pruebas de estrés en todos sus modelos generativos sin encontrar capacidades de CSAM.
2026-07-28
Gobernanza de la IA
Los gigantes tecnológicos de China acaban de eliminar millones de relaciones con IA
ByteDance, Tencent y Alibaba están cerrando simultáneamente las funciones de compañero de IA que permitían a millones de usuarios formar vínculos emocionales con personajes virtuales personalizables. La medida, ampliamente vista como una respuesta a las nuevas regulaciones de contenido de IA de China que entrarán en vigor en abril de 2026, ha desencadenado indignación de los usuarios y quejas por perder inversiones emocionales insustituibles.
2026-07-08