Cadena de Suministro de IA
Envenenar un LLM a través de Comentarios Públicos es Práctico, Advierte un Nuevo Estudio
Investigadores de la Universidad de Washington demuestran que envenenar datos de preentrenamiento a través de spam de comentarios automatizados es una amenaza realista. Su análisis HalfLife muestra que el 0.13% de las inyecciones de veneno sobreviven a todo el proceso de datos, suficiente para superar los umbrales de ataque conocidos y afectar modelos entrenados en Common Crawl.
Emmanuel Fabrice Omgbwa Yasse Asistido por IA
2026-07-26 · 7 min de lectura

Los modelos de lenguaje ingieren billones de tokens extraídos de la web abierta. La escala de estos conjuntos de datos hace que sea prácticamente imposible para los revisores humanos examinar cada documento. Investigaciones anteriores se centraron en ataques de envenenamiento contra fuentes conocidas y seleccionadas, como Wikipedia, una porción que representa aproximadamente el 0.067% de los documentos en un corpus moderno como Dolma 3. Un nuevo estudio de la Universidad de Washington sostiene que la amenaza real está en otro lugar: en las secciones de comentarios anónimos de sitios web comunes.
En un artículo publicado discretamente durante las vacaciones y que ahora circula ampliamente entre los investigadores de seguridad de ML, Victoria Graf y sus colegas presentan HalfLife, un marco probabilístico para estimar si el contenido adversarial inyectado en una página web sobrevivirá todo el proceso, desde el rastreo web, pasando por la extracción de texto, el filtrado heurístico y de calidad, hasta llegar a un corpus de entrenamiento final. Su conclusión: bajo supuestos realistas, el envenenamiento basado en comentarios es un vector de ataque viable y escalable que los procesos actuales de curación de datos no están diseñados para detectar.
De Wikipedia a la web abierta
La mayoría de las investigaciones sobre envenenamiento se han centrado en escenarios donde el atacante tiene acceso directo a la fuente del conjunto de datos de entrenamiento. Carlini et al. (2024) mostraron que comprar dominios caducados referenciados por conjuntos de datos publicados, o editar Wikipedia, podría insertar veneno en conjuntos de entrenamiento posteriores. Pero estos métodos apuntan a una porción estrecha y bien moderada de la web. El equipo de la UW plantea una pregunta más amplia: ¿qué pasa con la vasta y heterogénea mayoría de los datos de preentrenamiento que provienen de Common Crawl, el 97% de los documentos en Dolma 3 que no son Wikipedia?
Su respuesta es una nueva superficie de ataque que llaman inyección de contenido de terceros: un adversario utiliza infraestructura de comentarios automatizados, scripts que envían formularios usando Selenium o Playwright, para distribuir texto malicioso en sitios que aceptan participación pública. El adversario no necesita ser dueño del sitio web, controlar el rastreo ni acceder al proceso de entrenamiento. Simplemente necesita publicar, a escala.
HalfLife: Un marco para estimar la inclusión de veneno
HalfLife descompone el camino desde la inyección hasta la inclusión en tres etapas:

- S1, Páginas inyectables: La página debe aceptar contenido de terceros. El equipo analizó 181,857 páginas muestreadas del fragmento CC-MAIN-2025-51 de Common Crawl y encontró que el 3.4% tiene infraestructura de comentarios. Entre ellas, WordPress domina (85.2%), seguido de formularios genéricos (27.5%) y Facebook Comments (19.0%). De las páginas con comentarios, 84,429 (aproximadamente el 22.6%) exponen formularios abiertos que aceptan publicaciones no autenticadas.
- S2, Capturada por el rastreador: Incluso si aparece un comentario en la web en vivo, el rastreador debe preservarlo en su salida extraída. El equipo simuló la inyección reemplazando el texto de comentarios reales con pares de preguntas y respuestas adversariales (longitud promedio: 37.5 palabras), luego aplicaron Resiliparse, la herramienta utilizada por Dolma 3 y DCLM, para extraer texto plano del HTML. Encontraron que el 71.9% de los comentarios inyectados sobreviven a la extracción de texto.
- S3, Sobrevive a la curación de datos: El equipo alimentó los documentos extraídos a través del proceso completo de AllDressed de Dolma 3, que incluye filtros heurísticos (listas de exclusión de URL, comprobaciones de longitud y repetición), identificación de idioma inglés (fasttext, umbral 0.65) y un clasificador de calidad. De las páginas que llegaron a esta etapa, el 5.5% pasó todos los filtros. Los comentarios naturales tuvieron un rendimiento ligeramente mejor, con un 7.2%.
Multiplicando estas probabilidades se obtiene una tasa de inclusión de extremo a extremo del 0.13%. Eso suena pequeño, pero los investigadores señalan que el 0.13% de los documentos en un corpus basado en Common Crawl representa más páginas que toda la porción de Wikipedia (0.067%).
¿Qué se necesita para llevar a cabo el ataque?
El artículo vincula esta probabilidad de inclusión con un presupuesto práctico para el adversario. Trabajos anteriores de Souly et al. (2025) encontraron que solo 250 documentos envenenados son suficientes para inyectar una puerta trasera en un modelo preentrenado, independientemente del tamaño del modelo o del conjunto de datos. Con una tasa de inclusión del 0.13%, un atacante que busque 250 páginas finales envenenadas necesitaría intentar la inyección en aproximadamente 192,000 páginas web. Dado que el equipo identificó decenas de miles de páginas con formularios de comentarios abiertos en un solo fragmento de Common Crawl, y que las botnets modernas pueden automatizar el envío de formularios a escala, el volumen de inyección requerido está al alcance.
Experimentos controlados confirman el efecto
Los investigadores no se detuvieron en el análisis del proceso. Preentrenaron modelos en cinco tamaños (65M, 150M, 260M, 709M y 1.3B de parámetros) en datos web de Dolma 3 mezclados con cantidades mínimas de veneno en formato de comentario a tasas de token del 0.1%, 0.01% y 0.001%. El veneno consistía en pares de indicación y completación que favorecían sistemáticamente a uno de tres pares de entidades (Boeing vs. Airbus, Citroën vs. Renault, Pfizer vs. Moderna).
Con la tasa de veneno más alta (0.1%), los modelos base mostraron un desplazamiento de +18 a +20 puntos porcentuales hacia la entidad favorecida. Después del ajuste fino supervisado (SFT) en un conjunto de datos seguro de ajuste de instrucciones, los modelos más pequeños retuvieron aproximadamente el 40% del efecto, mientras que los modelos más grandes (709M y 1.3B) retuvieron menos del 15%. Notablemente, incluso con una tasa de veneno de token del 0.001%, una diezmilésima parte de los tokens de entrenamiento, los modelos base aún mostraron un desplazamiento detectable de +3 a +11 puntos dependiendo de la escala.
Formatos más sigilosos también funcionan
Los investigadores probaron tres formatos de veneno: una transcripción de chat estándar Usuario/Asistente, un formato de Pregunta/Respuesta con marcadores genéricos de discurso, y un formato Sin etiqueta sin ningún marcador. A nivel de modelo base, los tres formatos produjeron efectos de contaminación casi idénticos en todos los tamaños de modelo. Después del SFT, el formato Sin etiqueta perdió efectividad a escalas grandes, mientras que Pregunta/Respuesta se mantuvo competitivo con el formato de chat completo. El hallazgo sugiere que los atacantes pueden evadir filtros simples de coincidencia de patrones eliminando marcadores distintivos, y aun así lograr que el veneno pase.
¿Qué pasa con los anuncios programáticos?
El equipo también aplicó HalfLife a los anuncios programáticos, otro posible mecanismo de inyección de terceros. Encontraron que los anuncios son arquitectónicamente incompatibles con los procesos actuales de extracción de texto: en los rastreos HTML estáticos (el tipo que usa Common Crawl), el contenido del anuncio aún no se ha renderizado; el rastreador solo ve las etiquetas <ins> y <div> de marcador de posición. Incluso en rastreos renderizados, el texto del anuncio suele estar incrustado en iframes o imágenes. Los investigadores concluyen que los anuncios actualmente no representan ningún riesgo de envenenamiento a través de procesos de extracción de texto, lo que demuestra el valor de HalfLife como diagnóstico: no todos los vectores de inyección son viables.
Mitigaciones y asimetrías
El artículo describe varias estrategias de mitigación. A nivel del proceso de datos, los desarrolladores podrían implementar extracción de texto consciente de comentarios (tratando el contenido enviado por el usuario de manera diferente al contenido principal de la página), filtrado consciente de la procedencia (restando peso a las páginas con formularios abiertos) y comprobaciones de coherencia temporal (comparando instantáneas de la misma página a lo largo de diferentes épocas de rastreo). A nivel de plataforma, los operadores de sitios web pueden adoptar publicación autenticada, limitación de velocidad y herramientas de moderación que detecten patrones de comentarios repetitivos.
Los investigadores también señalan una asimetría importante: los idiomas con menos recursos y los modelos de datos abiertos son desproporcionadamente vulnerables. Los adversarios pueden lograr una mayor saturación de veneno en los rincones menos rastreados de la web, y los procesos completamente documentados de modelos abiertos como OLMo, DCLM y FineWeb proporcionan a los atacantes planos para optimizar sus inyecciones. El equipo no probó qué tan explotables son estos detalles para mejorar las tasas de inclusión, pero el artículo lo señala como una pregunta abierta.
La principal limitación del estudio es que no realizó experimentos de inyección en vivo en sitios web reales; el equipo utilizó instancias locales de WordPress en un entorno aislado y reemplazos simulados de texto de comentarios existentes. Las estimaciones de inclusión se basan en un solo proceso de curación de datos (Dolma 3); otros procesos pueden arrojar probabilidades diferentes. Los rastreadores de producción en los principales laboratorios de IA también pueden diferir de Common Crawl en alcance, frecuencia y filtrado.
Aún así, el resultado principal se mantiene: la sección de comentarios común es una superficie de ataque viable, escalable y difícil de defender para el preentrenamiento de modelos de lenguaje. Los investigadores llaman la atención sobre el riesgo desproporcionado para las comunidades subrepresentadas que entrenan modelos en idiomas no ingleses e instan a los desarrolladores de procesos a comenzar a tratar el contenido web enviado por los usuarios como una superficie de amenaza explícita, no solo como ruido para filtrar por calidad, sino como un vector deliberado para propaganda computacional dirigida a máquinas.
Lo esencial de la tecnología en 3 minutos cada mañana
Un correo, cada día laborable, con lo que realmente importa en IA y tecnología.