codage IA
6 published articles
Modèles d'IA
Le Laguna XS 2.1 de Poolside gagne 5 points sur les benchmarks de codage avec le même matériel
Le Laguna XS 2.1 de Poolside améliore le SWE-bench Multilingue de 5,4 points pour atteindre 63,1 % tout en conservant la même architecture MoE de 33B totaux et 3B activés. La version inclut des points de contrôle quantifiés, des modèles d'ébauche pour le décodage spéculatif et une licence OpenMDW-1.1, rendant le codage IA local plus pratique.
2026-07-21
analyse
Là où Kimi K3 dépasse la frontière : un regard benchmark par benchmark sur le modèle ouvert 2,8T
Kimi K3, le modèle ouvert de 2,8 billions de paramètres de Moonshot AI, est à la traîne des modèles propriétaires de pointe sur la plupart des benchmarks généraux, mais mène sur SWE Marathon, Terminal-Bench 2.1, BrowseComp, et d'autres. Le tableau détaillé révèle où ses paris architecturaux sur KDA et Stable LatentMoE portent leurs fruits.
2026-07-17
Analyse comparative approfondie
GPT-5.6 : chaque dollar investi dans l'IA compte plus que jamais
La famille GPT-5.6 d'OpenAI, Sol, Terra, Luna, offre des résultats de pointe en codage, cybersécurité et benchmarks professionnels pour une fraction du coût en tokens de ses concurrents. Le mode multi-agent « ultra » et une tarification par paliers visent à rendre l'intelligence de pointe accessible à davantage d'utilisateurs, tandis que des garde-fous en couches abordent les risques à double usage.
2026-07-09
Intelligence Artificielle
MiniMax M3 brise le plafond des poids ouverts avec une accélération CUDA de 9,4x et zéro aide humaine
MiniMax M3 offre une accélération du noyau CUDA de 9,4x, bat Opus 4.7 sur BrowseComp et a reproduit de manière autonome un article ICLR. Le tout dans un package à poids ouverts.
2026-07-06
Intelligence Artificielle
Le nouveau modèle de codage M2.5 de MiniMax domine le benchmark à 5 % du prix
Le modèle M2.5 de MiniMax domine le benchmark de codage Multi-SWE-Bench, surpasse les modèles grand public dans les tâches de bureau et coûte un dixième à un vingtième de ses concurrents. Les poids open source sont disponibles sur HuggingFace.
2026-07-04
Modèles IA
Anthropic lance Claude Fable 5 : un modèle de cinquième génération pour le travail autonome étendu
Anthropic présente Claude Fable 5, un modèle de cinquième génération capable d'exécuter des agents pendant des jours, de s'attaquer à des projets de codage ambitieux et de gérer des flux de travail d'entreprise complexes avec une supervision minimale. Le tarif commence à 10 $ par million de tokens d'entrée.
2026-07-01