Qwen3
3 published articles
Investigación en IA
Memory Decoder: una memoria adicional de 6.9B permite a un modelo de 410M superar a Pythia-12B
Memory Decoder at Scale separa la memoria a largo plazo del razonamiento en los LLM. Una memoria preentrenada de 6.9B elevó a Pythia-410M por encima de Pythia-12B en 17 benchmarks con un 39% menos de parámetros; las memorias de dominio de 1.7B añadieron más de 9 puntos a Qwen3 Base en todas las escalas probadas.
2026-07-31
Programación competitiva
NousCoder-14B desafía la programación de olimpiadas con un pipeline de RL abierto
Nous Research lanza NousCoder-14B, un modelo de programación competitiva basado en Qwen3-14B mediante RL. Stack abierto completo: pesos, entorno y suite de evaluación. Dirigido a benchmarks de programación de nivel olimpiada.
2026-07-16
LLMs de contexto largo
La atención bifocal de Jet-Long acaba con el compromiso de escalado fijo para LLMs de contexto largo
Jet-Long adapta el reescalado de RoPE dinámicamente por longitud de secuencia, utilizando una ventana local y una ventana de largo alcance fusionadas mediante inclusión-exclusión. En modelos Qwen3 de hasta 128K de contexto, supera las líneas base zero-shot existentes en más de 2 puntos porcentuales en RULER y logra la menor perplejidad en PG-19, todo ello añadiendo menos de un 4% de sobrecarga en generación.
2026-07-12