Modèles d'IA
Le Laguna XS 2.1 de Poolside gagne 5 points sur les benchmarks de codage avec le même matériel
Le Laguna XS 2.1 de Poolside améliore le SWE-bench Multilingue de 5,4 points pour atteindre 63,1 % tout en conservant la même architecture MoE de 33B totaux et 3B activés. La version inclut des points de contrôle quantifiés, des modèles d'ébauche pour le décodage spéculatif et une licence OpenMDW-1.1, rendant le codage IA local plus pratique.
Emmanuel Fabrice Omgbwa Yasse Assisté par IA
2026-07-21 · 4 min de lecture

Poolside a publié aujourd'hui Laguna XS 2.1, une mise à jour incrémentale de son modèle de codage Mixture-of-Experts. Le chiffre phare est un bond de 5,4 points sur le SWE-bench Multilingue, portant le taux de tâches résolues à 63,1 %. Cela semble être une amélioration mineure jusqu'à ce que l'on regarde le tableau de référence de l'entreprise : XS 2.1 bat désormais des modèles avec 10 à 40 fois plus de paramètres actifs sur plusieurs tests de codage agentiques.
Le modèle conserve la même architecture que XS.2, 33B paramètres totaux, 3B activés par jeton, mais l'entreprise affirme avoir entraîné plus longtemps ou sur de meilleures données, ou les deux. Le billet de publication ne précise pas ce qui a changé dans l'entraînement, seulement que le résultat est 'une amélioration notable sur SWE-bench Multilingue et des performances plus fortes sur les tâches de type terminal'. Ce flou est courant dans les notes de version de modèles, mais il importe ici car les améliorations de référence n'entraînent aucune augmentation du coût matériel. XS 2.1 coûte le même prix sur l'API de Poolside que XS.2 : 0,10 $ par million de jetons d'entrée, 0,20 $ par million de jetons de sortie, 0,05 $ par million de jetons de lecture de cache. Pour les équipes qui exécutent déjà XS.2 localement sur un seul GPU, la mise à niveau est essentiellement gratuite en termes de calcul.
Ce que montrent réellement les benchmarks
Poolside a publié des scores sur quatre benchmarks de codage agentique : SWE-bench Verified, SWE-bench Multilingue, SWE-Bench Pro et Terminal-Bench 2.0. L'entreprise a comparé XS 2.1 à Qwen3.6 (35B-A3B), North Mini Code de Cohere (30B-A3B), MAI-Code-1-Flash (137B-A5B), GPT-OSS-120B et Claude Haiku 4.5. Sur SWE-bench Multilingue, XS 2.1 mène l'ensemble de comparaison à 63,1 %. Sur SWE-bench Verified, il est devancé par plusieurs modèles plus grands. Sur Terminal-Bench 2.0, il est à peu près à égalité avec Qwen3.6.
La conclusion n'est pas que XS 2.1 domine tous les benchmarks, ce n'est pas le cas. Sur quatre tests, il en mène un, est à peu près à égalité sur un, et est devancé sur deux. Mais il fait tout cela avec seulement 3B paramètres actifs. Un modèle qui tient sur un seul GPU grand public rivalise avec des offres qui nécessitent du matériel de centre de données, et cela change l'économie du codage IA local pour les développeurs individuels et les petites équipes.

Décodage spéculatif et inférence locale
Poolside publie également des modèles spéculateurs DFlash pour chaque point de contrôle XS 2.1. Ce sont de petits modèles d'ébauche entraînés pour prédire les prochains jetons du modèle principal à moindre coût, une technique appelée décodage spéculatif. Dans les tests internes de l'entreprise, associer XS 2.1 à son spéculateur double les tokens par seconde atteints. Pour quiconque exécute le modèle localement, où la latence est le goulot d'étranglement, cela fait une différence significative dans la réactivité de l'agent de codage.
Le modèle prend en charge vLLM, SGLang, NVIDIA TensorRT-LLM, les transformateurs Hugging Face et Ollama. Des points de contrôle quantifiés sont disponibles en FP8, INT4 et NVFP4, permettant aux utilisateurs d'échanger la précision contre de la VRAM. L'entreprise indique que les points de contrôle GGUF quantifiés et la prise en charge de llama.cpp arrivent bientôt.
Changement de licence et jeu d'écosystème
Poolside concède XS 2.1 sous licence OpenMDW-1.1, abandonnant la licence utilisée par XS.2. OpenMDW est le cadre de distribution de modèles ouverts soutenu par NVIDIA et la Linux Foundation. L'entreprise la qualifie de 'totalement permissive' et affirme que le changement 'réduit les frictions de licence pour les publications de modèles ouverts'. Pour les équipes évaluant des modèles, cela supprime un casse-tête supplémentaire : pas besoin de faire une révision de licence pour un modèle qui pourrait finir dans un produit commercial.
Le timing coïncide avec une poussée plus large de NVIDIA pour standardiser la distribution des modèles ouverts. L'histoire de Poolside ne concerne pas seulement les chiffres des benchmarks ; il s'agit de rendre ces chiffres accessibles sur du matériel local sous une licence que les avocats approuveront.
Ce qui est dépriorisé
Poolside mettra fin à XS.2 sur sa propre API après une semaine. Les équipes qui ont construit des déploiements dédiés autour de l'ancien modèle peuvent toujours y accéder via la bibliothèque de modèles de Baseten, mais l'entreprise pousse clairement tout le monde vers 2.1. La fenêtre d'une semaine pour l'arrêt de l'API est courte ; les équipes qui effectuent des évaluations ou des tests de régression devront agir rapidement.
L'entreprise a également fait un pari délibéré sur le codage agentique plutôt que sur le raisonnement général. XS 2.1 est conçu pour un 'travail à long terme sur une machine locale', ce qui signifie le type de tâches de codage en plusieurs étapes qu'une boucle agentique gère. Ce n'est pas un chatbot généraliste. Les équipes qui l'utilisent pour autre chose que du code pourraient le trouver plus limité que ne le suggère le tableau de référence.
Le tableau d'ensemble
La publication de Poolside s'inscrit dans une tendance qui se dessine depuis deux ans : les petits modèles efficaces qui tournent sur du matériel local grignotent le territoire qui appartenait autrefois exclusivement aux déploiements massifs en centre de données. XS 2.1 n'est pas une percée, c'est une amélioration incrémentale qui rend un bon argument légèrement meilleur. Le gain de 5,4 points sur un benchmark est modeste. Ce qui importe, c'est que Poolside l'a réalisé sans augmenter l'empreinte du modèle, la tarification de l'API ou les besoins matériels. C'est le genre d'amélioration qui s'accumule avec le temps, et c'est ainsi que le codage IA local devient un flux de travail par défaut plutôt qu'une curiosité.
- Source : Laguna XS 2.1 release blog post
L'essentiel de la tech en 3 minutes chaque matin
Un email, chaque jour ouvré, avec ce qui compte vraiment en IA et en tech.