SevenTnewS

IA de pesos abiertos

dots3-note de Xiaohongshu: un MoE abierto de 280B que solo activa 16B

El estudio dots de Xiaohongshu ha lanzado dots3-note preview, su primer modelo de pesos abiertos: un MoE multimodal con 280B de parámetros, 16B activos y una ventana de contexto de 512K. El diseño disperso apunta a un bajo coste de inferencia en un único nodo de 8 GPU, pero la ficha aún no ha publicado cifras de benchmarks.

Emmanuel Fabrice Omgbwa Yasse Asistido por IA

2026-08-20 · 5 min de lectura

dots3-note de Xiaohongshu: un MoE abierto de 280B que solo activa 16B
Fuentes : dots3-note Prev…·seventnews rela…·seventnews rela…

Xiaohongshu, la empresa china de internet de consumo, ha lanzado su primer modelo de pesos abiertos. dots3-note preview, creado por su estudio dots, es un diseño de Mezcla de Expertos con 280B de parámetros totales y 16B activados por token. Acepta texto, imágenes, vídeo y audio como entrada, genera texto, dispone de una ventana de contexto de 512K tokens y se distribuye bajo Apache 2.0.

El lanzamiento es el movimiento inicial de una familia, no algo puntual. La línea dots3 está diseñada en torno a compromisos entre capacidad, latencia y coste de inferencia, y la ficha describe a dots3-note preview como su miembro más ligero. Eso lo sitúa en el extremo económico de un espacio de diseño que el estudio se ha dejado margen para expandir.

Los primeros pesos abiertos de Xiaohongshu

Xiaohongshu no es una fuente obvia de pesos de clase fronteriza. Gestiona una plataforma de consumo, no un negocio de infraestructura de IA. El debut llega en un momento en que la publicación de pesos abiertos se ha convertido en la norma de la industria de IA en China, y la ficha posiciona al modelo en una amplia lista de tareas: seguimiento de instrucciones, razonamiento matemático y lógico, uso de herramientas y flujos de trabajo de agentes multi-paso, generación de código, procesamiento de contexto largo y comprensión de imágenes, documentos, gráficos, audio y vídeo.

Lo que la ficha no publica importa tanto como lo que promete. Las secciones de evaluación para razonamiento general y agentes y para comprensión multimodal aparecen listadas, pero no hay cifras bajo ellas. Un informe completo está marcado como «próximamente».

Una apuesta 17:1 por parámetros dispersos

Lee la ficha técnica y un número destaca. Con 16B activados de 280B totales, la proporción entre parámetros totales y activos es de aproximadamente 17:1, una dispersión más acusada que la de algunos diseños MoE abiertos actuales. Qwen3-VL, una de las familias de pesos abiertos de vídeo-lenguaje más importantes, culmina en una variante 235B-A22B, más cercana a 10:1. A esta escala, el coste por token lo determina la cifra de 16B, no la de 280B.

La arquitectura, en resumen:

Propiedaddots3-note preview
Parámetros totales / activados280B / 16B
Capas1 densa + 45 MoE
Expertos256 enrutados + 1 compartido, top-8
Atención13 DSA + 33 SWA (~1:3)
Longitud de contexto512K tokens
Codificador de visiónMoE ViT, 7B total / 1,2B activos
Codificador de audioDenso, 800M
PrecisiónBF16, FP8
LicenciaApache 2.0

Varios detalles relevantes para la inferencia se esconden en esas filas. La mezcla ejecuta 256 expertos enrutados más un experto compartido con enrutamiento top-8. El codificador de visión es en sí mismo un MoE, de 7B totales con 1,2B activos, mientras que el codificador de audio es un denso de 800M. La atención se reparte entre 13 capas DSA y 33 SWA, aproximadamente 1:3. Una cabeza de predicción multi-token, una capa compartida de 1,13B, alimenta una ruta opcional de decodificación especulativa.

El apéndice de benchmarks está vacío

Aquí es donde el lanzamiento debería frenar a la gente. La ficha anuncia una amplia gama de capacidades, pero tal como se publica no ofrece cifras de evaluación que lo respalden. Las afirmaciones sobre agentes merecen especial cautela: el uso de herramientas, los flujos de trabajo multi-paso y las tareas que requieren exploración y memoria son exactamente los ámbitos donde el campo en general sigue descubriendo que los benchmarks halagan a los modelos. Evaluaciones publicadas han medido a los agentes en un 49% en una prueba que los expertos humanos superan con un 95%. La ventana de contexto de 512K merece el mismo escepticismo, ya que el contexto anunciado y el contexto utilizable rara vez son el mismo número.

Nada de esto significa que el modelo no esté a la altura. Significa que las cifras del proveedor aún no se han publicado, y las comparaciones con modelos abiertos rivales deberían esperar a que lo hagan.

Ejecutarlo: FP8, un nodo, dos pull requests pendientes

La historia del despliegue es más concreta que la de los benchmarks, con una salvedad: el soporte está a medio fusionar. vLLM incluye soporte nativo en su rama principal, por lo que los usuarios necesitan una compilación nightly reciente hasta la próxima versión estable. Las integraciones de SGLang y Transformers existen solo como pull requests, #33829 y #47844, ambas aún en revisión. Hasta que se fusionen, la documentación remite a los usuarios a esas ramas de PR.

La vía recomendada es el checkpoint FP8 en un único nodo de 8 GPU. El ejemplo de vLLM ejecuta ocho H100 con paralelismo de tensor 8, paralelismo de expertos 8, deep_gemm como backend MoE y una longitud de contexto de 262.144 tokens. Eso es la mitad del máximo anunciado, y la ficha indica ajustar el contexto a la memoria disponible, la concurrencia y la modalidad de entrada. BF16 está soportado pero requiere más memoria.

La vía SGLang se distribuye como imagen Docker, lmsysorg/sglang:dev-dots3-note, que descarga el checkpoint FP8 de Hugging Face en el primer arranque. Las banderas cubren el backend de atención fa3 y una configuración opcional de decodificación especulativa en la que la cabeza de predicción multi-token funciona como NEXTN; la documentación dice que esto puede reducir el tiempo por token de salida en más del 50%. Los gráficos CUDA de prefill aún no son compatibles.

Para pruebas más ligeras, la vía Transformers añade torchcodec y FFmpeg para audio y vídeo sobre la pila habitual. Ambas pilas de inferencia exponen una API compatible con OpenAI, y la llamada a herramientas se activa con una bandera de parser específica de dots. Una opción de plantilla de chat, enable_thinking, alterna entre un rastro de razonamiento y una respuesta directa.

Qué quiere una plataforma de consumo con los pesos abiertos

El patrón estratégico detrás de este lanzamiento es la eficiencia. El M3 de MiniMax ya combina multimodalidad nativa, un contexto de 1M de tokens y codificación agéntica en un paquete abierto. Qwen abarca variantes densas y MoE desde 30B-A3B hasta 235B-A22B. En el extremo, el Inkling abierto de 975B parámetros se distribuyó con 1,9 TB antes de que Unsloth lo comprimiera a 270 GB a 1 bit con una retención de precisión del 74,2%. Incluso las salvaguardas pequeñas siguen la misma lógica: Mistral afirma que su Shieldstral de 3B iguala a modelos abiertos de seguridad de texto de hasta siete veces su tamaño.

dots3-note preview encaja en el patrón con un progenitor inusual. La licencia Apache 2.0 mantiene los pesos utilizables en productos comerciales sin restricciones, y el planteamiento de FP8 en un solo nodo sugiere que el estudio está orientado a despliegues reales, no solo a carreras de leaderboards. Dado que la familia está planificada en torno a múltiples puntos de capacidad y coste, es probable que este sea el primero de varios lanzamientos.

Lo que falta es el informe. Una proporción de dispersión de 17:1 y una ventana de 512K solo resultan interesantes una vez que las cifras que las respaldan son públicas. Hasta entonces, dots3-note preview es una declaración arquitectónica desde un frente inesperado. Eso por sí solo es digno de mención. Los benchmarks decidirán si es algo más.

Lo esencial de la tecnología en 3 minutos cada mañana

Un correo, cada día laborable, con lo que realmente importa en IA y tecnología.