Qwen3
3 published articles
Recherche en IA
Memory Decoder : une mémoire greffée de 6,9B fait battre Pythia-12B par un modèle de 410M
Memory Decoder at Scale sépare la mémoire à long terme du raisonnement dans les LLM. Une mémoire pré-entraînée de 6,9B a fait passer Pythia-410M devant Pythia-12B sur 17 benchmarks avec 39 % de paramètres en moins ; des mémoires de domaine de 1,7B ont ajouté plus de 9 points à Qwen3 Base à toutes les échelles testées.
2026-07-31
Programmation compétitive
NousCoder-14B défie la programmation olympiade avec un pipeline RL ouvert
Nous Research publie NousCoder-14B, un modèle de programmation compétitive basé sur Qwen3-14B via RL. Pile ouverte complète : poids, environnement et suite d'évaluation. Cible les benchmarks de codage de niveau olympiade.
2026-07-16
LLM à long contexte
L'attention bifocale de Jet-Long tue le compromis de mise à l'échelle fixe pour les LLM à long contexte
Jet-Long adapte la remise à l'échelle de RoPE de manière dynamique en fonction de la longueur de séquence, en utilisant une fenêtre locale et une fenêtre longue fusionnées par inclusion-exclusion. Sur les modèles Qwen3 jusqu'à 128K de contexte, il dépasse les bases zero-shot existantes de plus de 2 points de pourcentage sur RULER et atteint la plus faible perplexité sur PG-19, tout en ajoutant moins de 4% de surcoût de génération.
2026-07-12