SevenTnewS

Informe de Integridad

Stability AI reportó 13 informes de CSAM al NCMEC en su primer informe de transparencia

El informe cubre seguridad de modelos, red teaming, moderación de contenido y colaboración con las fuerzas del orden. Stability AI afirma que no detectó CSAM en sus datos de entrenamiento y realizó pruebas de estrés en todos sus modelos generativos sin encontrar capacidades de CSAM.

Emmanuel Fabrice Omgbwa Yasse Asistido por IA

2026-07-28 · 3 min de lectura

Stability AI reportó 13 informes de CSAM al NCMEC en su primer informe de transparencia
Fuentes : Stability AI's …·Stability AI Br…·Stability AI an…

Stability AI publicó su primer Informe Anual de Transparencia de Integridad en julio de 2025, cubriendo el período de abril de 2024 a abril de 2025. El documento, publicado en la página de Seguridad Infantil de la empresa, divulga el número de informes de CSAM enviados al NCMEC, las métricas de su programa de red teaming y las salvaguardas integradas en sus modelos de imagen, video, 3D y audio.

La cifra principal es 13 informes al NCMEC. La empresa dice que se pueden haber presentado múltiples informes para el mismo usuario cuando se detectó más de un intento de carga de imagen. No se encontró CSAM en los conjuntos de datos de entrenamiento de la empresa durante el período de informe, ni ninguno de sus modelos de IA generativa exhibió capacidades de generación de CSAM o CSEM después de las pruebas de estrés. El informe también señala que ningún informe de CSAM enviado por usuarios llegó a Stability AI.

Una pila de seguridad en capas

Esquema: Pila de Seguridad de Stability AI
El enfoque de seguridad en capas de Stability AI filtra datos de entrenamiento, previene el mal uso a nivel de modelo/plataforma y hace cumplir las políticas de uso aceptable, resultando en 13 informes de CSAM al NCMEC según su informe de transparencia de julio de 2025.

El enfoque de seguridad de Stability AI se basa en tres capas: filtrar datos de entrenamiento, prevenir el mal uso a nivel de modelo y plataforma, y hacer cumplir su Política de Uso Aceptable. Los datos de entrenamiento provienen de conjuntos de datos abiertos, sitios web públicos, socios externos y datos sintéticos generados por investigadores. La empresa dice que utiliza clasificadores de NSFW internos y de código abierto, además de listas hash de CSAM de la industria de Thorn's Safer y la Fundación Internet Watch, para pre-filtrar sus datos de entrenamiento. No se detectó CSAM.

A nivel de API de plataforma, Stability AI ejecuta filtros y clasificadores de contenido en tiempo real que bloquean entradas y salidas que violan políticas, e integra hash de CSAM de Thorn para detectar y bloquear CSAM conocido. A nivel de modelo, la empresa aplica afinamiento y LoRAs de seguridad informados por red teaming estructurado. El red teaming cubrió el 100% de los modelos de IA generativa de la empresa. La empresa también colaboró con el Equipo de Inteligencia Encubierta Contra la Explotación Sexual Infantil en Línea (OCCIT), una unidad policial del Reino Unido, para probar su modelo Stable Diffusion 3 antes del lanzamiento, y no encontró capacidades de generación de CSAM.

Brechas de procedencia

El informe reconoce que la procedencia del contenido a través de metadatos C2PA se implementa solo para imágenes, video y audio generados por API (el formato wav utilizado para efectos de sonido y riffs de instrumentos, que la empresa dice que no conlleva riesgo de CSEM). Los modelos publicados abiertamente no incluyen etiquetas C2PA. La empresa dice que ha encontrado desafíos con las soluciones de marca de agua no C2PA que degradaron la calidad de la imagen de salida, y continúa explorando enfoques más efectivos.

"La procedencia del contenido no se ha implementado durante el proceso de generación de contenido para nuestros modelos publicados abiertamente. Estas son áreas que requieren más trabajo para fortalecer la procedencia y trazabilidad en todos nuestros sistemas."

Asociaciones y perspectivas futuras

Más allá del informe de transparencia, Stability AI ha estado expandiendo su huella comercial. La empresa lanzó su suite de Image Services en Amazon Bedrock, llevando herramientas como Inpaint, Erase, Remove Background y Style Transfer a la infraestructura de AWS. También anunció una asociación estratégica con Electronic Arts para co-desarrollar modelos de IA generativa y flujos de trabajo para el desarrollo de juegos, comenzando con la aceleración de la creación de materiales PBR y la previsualización de entornos 3D a partir de indicaciones.

El informe de transparencia en sí dice que la empresa está monitoreando los desarrollos regulatorios y planea alinear sus prácticas con los marcos emergentes de IA responsable.

Lo esencial de la tecnología en 3 minutos cada mañana

Un correo, cada día laborable, con lo que realmente importa en IA y tecnología.