SevenTnewS

Investigación en IA

Memory Decoder: una memoria adicional de 6.9B permite a un modelo de 410M superar a Pythia-12B

Memory Decoder at Scale separa la memoria a largo plazo del razonamiento en los LLM. Una memoria preentrenada de 6.9B elevó a Pythia-410M por encima de Pythia-12B en 17 benchmarks con un 39% menos de parámetros; las memorias de dominio de 1.7B añadieron más de 9 puntos a Qwen3 Base en todas las escalas probadas.

Emmanuel Fabrice Omgbwa Yasse Asistido por IA

2026-07-31 · Última actualización: 2026-08-02 · 3 min de lectura

Memory Decoder: una memoria adicional de 6.9B permite a un modelo de 410M superar a Pythia-12B

El número más útil del artículo Memory Decoder at Scale, publicado en arXiv el 30 de julio, no es una puntuación de benchmark. Es el 39, el porcentaje de parámetros totales que aparentemente ya no necesitas si dejas de gastar todo tu presupuesto en un modelo base más grande y gastas parte de él en un módulo de memoria preentrenado.

Los modelos de lenguaje decoder-only integran la memoria a largo plazo y el razonamiento en un mismo conjunto de parámetros, argumentan los autores, lo que dificulta aumentar la capacidad de memoria por sí sola. Memory Decoder, un módulo paramétrico de memoria a largo plazo de trabajos anteriores, separa ambas cosas. Sin embargo, la versión anterior solo se había estudiado a pequeña escala. El nuevo artículo la escala: módulos de memoria de hasta 6.9B de parámetros, preentrenados con 300B tokens, conectados a modelos base que van de 410M a 14B de parámetros.

Un modelo de 410M con una mejora de memoria supera a uno de 12B

El resultado estrella es un emparejamiento matagigantes. En 17 benchmarks, un módulo de memoria general de 6.9B conectado a Pythia-410M eleva su puntuación media de 29.86 a 37.34. Pythia-12B, el modelo mucho más grande, promedia 37.24. El modelo de 410M con memoria sale adelante con aproximadamente 7.3B de parámetros totales frente a los 12B de Pythia-12B, una diferencia que el artículo cifra en un 39% menos de parámetros.

El margen es de 0.10 puntos, que no es nada en un promedio de 17 benchmarks, y el argumento cae del lado del coste: una factura total de parámetros más pequeña compra puntuaciones iguales o mejores.

El patrón se repite en otra familia. Para los modelos Qwen3 Base, que van de 0.6B a 14B de parámetros, las memorias de dominio de 1.7B mejoraron la puntuación media en los tres dominios en más de 9 puntos en todas las escalas probadas. Sea cual sea el tamaño del modelo base, comprar memoria rentó más que comprar parámetros.

El muro de la recuperación

Escalar la memoria deja de ser una cuestión puramente de parámetros cuando el entrenamiento previo alcanza los 300B tokens. El coste combinado de indexación y búsqueda hace inviable un pipeline estándar de Faiss a esa escala de datos, escriben los autores. Su solución es un pipeline distribuido para la indexación y recuperación con Faiss, combinado con una carga dispersa y por lotes de distribuciones kNN.

Ese detalle de infraestructura merece explicarse porque es el precio real de la arquitectura. Un módulo de memoria solo mejora un modelo si la recuperación puede seguirle el ritmo. Cualquier equipo que quiera reproducir los resultados, o construir sobre ellos, hereda ese problema de ingeniería en lugar de un camino simple de descargar más parámetros.

Los números en un solo lugar

Esta es la comparación central en la que se apoya el artículo:

ConfiguraciónPuntuación media (17 benchmarks)Parámetros totales
Pythia-410M solo29.860.41B
Pythia-410M + memoria de 6.9B37.34~7.3B
Pythia-12B37.2412B

La cifra de ~7.3B es aritmética a partir de los propios números del artículo: 0.41B de base más 6.9B de memoria, que es exactamente la razón por la que el artículo puede afirmar un 39% menos de parámetros que 12B.

Qué significa para los presupuestos de escalado

La afirmación más amplia es arquitectónica: la memoria y el razonamiento no deberían tener que competir por los mismos parámetros. Si una memoria grande puede preentrenarse una vez y reutilizarse en modelos base más pequeños, mejorar un modelo pasa a ser cuestión de actualizar la memoria en lugar de reconstruir toda la pila. Los números de Qwen3 respaldan esa lectura, ya que las memorias de dominio de 1.7B mejoraron todos los modelos base a los que se conectaron.

Las preguntas abiertas superan a las respuestas. Los módulos de memoria se detienen en 6.9B de parámetros y el entrenamiento previo en 300B tokens, así que si el equilibrio sigue favoreciendo a la memoria más allá de esos límites está sin probar. Las puntuaciones son promedios de 17 benchmarks, lo que puede ocultar dónde ayuda la memoria y dónde no. Y un modelo con memoria carga con una infraestructura de recuperación que los conteos de parámetros no capturan, un coste de despliegue que solo aparece en producción.

El artículo apareció en arXiv el 30 de julio y su página de proyecto ha recibido 48 upvotes en HuggingFace, una señal modesta de la comunidad de que el público del escalado se ha dado cuenta. Nada de esto retira el escalado del modelo base. Entrega a los laboratorios un segundo dial, y los números del artículo sugieren que ese dial ha estado infravalorado.

Lo esencial de la tecnología en 3 minutos cada mañana

Un correo, cada día laborable, con lo que realmente importa en IA y tecnología.