SevenTnewSNoticias de IA y tecnología, explicadas

DeepSeek-V4.1-Flash llega al stack vLLM de Cambricon

Un modelo de 552.000 millones de parámetros, un cuarto de la HBM y un port para Cambricon desde el primer día

DeepSeek-V4.1-Flash llegó a los aceleradores de Cambricon el primer día a través de vLLM. El port dice menos sobre el modelo que sobre la rapidez con que los fabricantes chinos de chips pueden ahora seguir un framework de inferencia público.

Emmanuel Fabrice Omgbwa Yasse Asistido por IA

2026-09-22 · 4 min de lectura

Un modelo de 552.000 millones de parámetros, un cuarto de la HBM y un port para Cambricon desde el primer día

DeepSeek publicó el checkpoint de DeepSeek-V4.1-Flash, y Cambricon afirma que el modelo corrió en sus aceleradores ese mismo día. El objetivo de la integración fue vLLM, el stack de inferencia de código abierto en el que los operadores ya se estandarizan, en lugar de un fork privado de este.

Noticias como esta llegan disfrazadas de noticias de modelos. La afirmación que vale la pena poner a prueba es más acotada: un fabricante de chips entregó una ruta de servicio funcional el día del lanzamiento y describió las piezas con suficiente detalle como para ser juzgado por su ingeniería y no por el lenguaje de un anuncio.

Lo que Cambricon realmente entregó para DeepSeek-V4.1-Flash

El entregable es una biblioteca de operadores fusionados, un conjunto de kernels escritos a mano y una configuración de servicio. Los ingenieros de Cambricon usaron Torch-MLU-Ops para acelerar estructuras que la compañía denomina Engram y Compressor, y escribieron kernels BangC optimizados para atención dispersa y comprimida. Dentro de vLLM, Cambricon afirma que su ruta admite paralelismo mixto de cinco dimensiones entre las dimensiones de tensor, pipeline, secuencia, datos y expertos, con comunicación solapada con el cómputo, además de cuantización de baja precisión y desagregación prefill-decode. Todo el stack se asienta sobre NeuWare, la plataforma de software de larga data de Cambricon.

Eso cubre las partes de un stack de servicio que deciden si un clúster se mantiene ocupado. No incluye ninguna cifra. El anuncio no trae ninguna cifra de throughput, ninguna cifra de latencia y ninguna comparación con otro acelerador, de modo que la disponibilidad del mismo día es una afirmación de planificación y no de rendimiento.

Cambricon se unió a la PyTorch Foundation como miembro Platinum días antes, lo que la sitúa en el consejo de gobierno junto a otros contribuyentes de hardware y nube. Leído en conjunto con el port Day-0, la secuencia apunta a una inversión upstream más que a un parche puntual.

Las cuentas de memoria detrás del port del mismo día

DeepSeek-V4.1-Flash es el miembro más pequeño de la familia de arquitecturas más recientes de DeepSeek. Es un modelo de mezcla de expertos de 552.000 millones de parámetros que activa unos 8.000 millones de parámetros en el lado de entrada y 16.000 millones en el lado de salida, y maneja visión de forma nativa. La disposición es un Causal-Encoder-Decoder.

La compresión es lo que les importa a los fabricantes de aceleradores. DeepSeek afirma que la compresión de la caché KV lleva la demanda de HBM a aproximadamente un cuarto y la demanda de SSD a aproximadamente un octavo respecto de la generación anterior, con un tamaño de caché descrito como cientos de veces más pequeño que el diseño de primera generación.

MétricaDeepSeek-V4.1-Flash vs. generación anterior
Demanda de HBMaproximadamente un cuarto
Demanda de SSDaproximadamente un octavo
Tamaño de la caché KVdescrito como cientos de veces más pequeño que el diseño de primera generación

En un nodo de servicio denso, la caché KV limita cuántas secuencias concurrentes caben en memoria, y esos nodos ya fuerzan los presupuestos de HBM. Ahorrar tres cuartos de ella significa más usuarios por tarjeta o menos tarjetas por despliegue, y por eso una caché más pequeña se manifiesta primero como entusiasmo entre los fabricantes de chips. Estas son las cifras de DeepSeek, declaradas para el modelo en lugar de medidas en hardware de Cambricon, y no se ha publicado ninguna verificación independiente.

Cinco líneas de modelos, una receta

Cambricon enumera soporte de inferencia Day-0 o de producción en cinco líneas de modelos chinos: GLM de Zhipu AI, DeepSeek, Qwen de Alibaba, Kimi de Moonshot AI y MiniMax.

La redacción anuncia menos de lo que parece. "Day-0 o producción" abarca tanto la preparación para el día del lanzamiento como el soporte añadido a modelos que se lanzaron meses antes, y la lista no separa ambos casos.

Línea de modeloDesarrolladorEstado declarado por Cambricon
GLMZhipu AISoporte de inferencia Day-0 o de producción
DeepSeekDeepSeekSoporte de inferencia Day-0 o de producción
QwenAlibabaSoporte de inferencia Day-0 o de producción
KimiMoonshot AISoporte de inferencia Day-0 o de producción
MiniMaxMiniMaxSoporte de inferencia Day-0 o de producción

Para los operadores de clústeres, esa distinción es todo el valor de la afirmación. Un port para el día del lanzamiento significa que existe una receta documentada cuando aparece el checkpoint. Una adaptación posterior significa esperar a que el fabricante se ponga al día después de los hechos.

Forks cerrados frente a frameworks públicos

Caixin Global señaló la habilitación del mismo día como un indicador de que los ciclos de software entre modelos y chips nacionales se están acortando, desde ports privados de varios meses hacia la preparación para el día del lanzamiento sobre frameworks públicos que los operadores ya ejecutan. El corto que se mide es un corto de software, no de silicio. Un fabricante que puede seguir los lanzamientos upstream de vLLM carga con una carga de soporte más barata que uno que mantiene un fork cerrado de cada modelo que sirve.

Lo que el anuncio deja abierto es si el patrón escala. DeepSeek-V4.1-Flash es el miembro más pequeño de su familia, y el propio encuadre de Cambricon apunta a la siguiente prueba: variantes más grandes de DeepSeek y combinaciones de servicio multimodal. Portar el modelo pequeño en un día es una buena señal. Todavía no es prueba de que el mismo equipo absorba un checkpoint más grande, o una carga de trabajo que sirva visión y texto juntos, en el mismo calendario.

El Day-0 se ha convertido en una afirmación que varios fabricantes pueden hacer. El que siga cumpliéndola a medida que los checkpoints se agranden es el que vale la pena observar.

Lo esencial de la tecnología en 3 minutos cada mañana

Un correo, cada día laborable, con lo que realmente importa en IA y tecnología.