mélange d'experts
13 published articles
IA à poids ouverts
dots3-note de Xiaohongshu : un MoE ouvert de 280B qui n'active que 16B
Le studio dots de Xiaohongshu a publié dots3-note preview, son premier modèle à poids ouverts : un MoE multimodal de 280B de paramètres, 16B actifs et une fenêtre de contexte de 512K. La conception sparse vise un faible coût d'inférence sur un nœud de 8 GPU, mais la fiche technique n'a pas encore publié de chiffres de benchmarks.
2026-08-20
IA open source
Qwen 3.8-Max : le modèle le plus puissant d'Alibaba est désormais téléchargeable gratuitement
Alibaba met en open source Qwen 3.8-Max, son modèle le plus performant jamais conçu : un MoE de 2.4 billions de paramètres qui bat GPT-5.6 Sol sur SWE-bench Pro, PaperBench et IFBench. Nous décortiquons les réserves sur les benchmarks et ce qu'un modèle vedette ouvert à 95B actifs signifie pour les développeurs.
2026-08-16
Modèles d'IA | NVIDIA Nemotron 3.5 Lightning
Pourquoi Nemotron 3.5 Lightning parie que la plupart des étapes d'un agent n'ont pas besoin d'un gros modèle
Le nouveau modèle ouvert de Nvidia fonctionne localement avec 3 milliards de paramètres actifs et un contexte d'un million de jetons, conçu pour les agents qui restent actifs. Nvidia revendique jusqu'à 4 fois le débit et une exécution des tâches 30 % plus rapide que les modèles ouverts comparables.
2026-08-14
IA open source
Le plus grand modèle d'Alibaba a codé seul pendant 16 jours. La semaine prochaine, ses poids seront rendus publics.
Qwen3.8-Max n'active que 95 milliards de ses 2,4 billions de paramètres, se classe deuxième au Vision Arena et a construit un framework d'agents lors d'une exécution autonome de 16 jours. Alibaba publie les poids la semaine prochaine dans le cadre de sa première sortie open-weight d'un modèle phare.
2026-08-10
Open Source
Une course de relais de GPU loués a entraîné le MoE 2,7B de NanoColibri pour 200 $
NanoColibri-Instruct est passé de poids vierges à un MoE 2,7B fonctionnel pour environ 200 $. Des bénévoles ont fait passer un témoin d'entraînement sur le Hugging Face Hub, un GPU loué à la fois, avec un bail compare-and-swap pour que jamais deux personnes n'entraînent la même étape.
2026-08-04
Grok 4.5
Le Grok 4.5 de Cursor a été construit par des agents IA, pas par des humains. C'est ça, la vraie histoire.
Le Grok 4.5 de Cursor est un modèle Mixture-of-Experts construit par apprentissage par renforcement dans des environnements créés par des agents IA antérieurs, et non par des humains. Il gère des tâches complexes et longues dans les domaines du génie logiciel, de la science des données, de la finance et du droit, et est disponible dès maintenant.
2026-07-10
Stratégie de portefeuille
Le Qwen d'Alibaba construit un modèle pour chaque tâche IA, pas un seul pour tous les dominer
L'équipe Qwen d'Alibaba Cloud a discrètement publié un modèle de monde agent MoE 35B, trois nouveaux modèles ASR et un rapport RL sur la génération d'images, révélant un pari stratégique sur l'étendue plutôt que le spectacle dans la course aux modèles IA.
2026-07-09
Google DeepMind
Gemma 4 de Google DeepMind transforme 26 milliards de paramètres en une machine de raisonnement qui tient sur un seul GPU
Le rapport technique de Gemma 4 de Google DeepMind détaille une famille de modèles à poids ouverts avec mélange d'experts, fenêtres de contexte d'un million de tokens et vision multimodale. La publication signale un mouvement stratégique pour apporter le raisonnement de niveau frontalier aux développeurs sans le coût des API propriétaires.
2026-07-09
Intelligence artificielle
La nouvelle bibliothèque megakernel d'Aleph Alpha réduit la latence d'inférence MoE de 200 %
Alpha-MoE fusionne plusieurs opérations en un seul noyau persistant pour obtenir jusqu'à 200 % de gains de vitesse d'inférence par rapport aux noyaux Triton dans vLLM et SGLang, ciblant les modèles MoE en précision FP8.
2026-07-09
Intelligence Artificielle
L'EMO d'Ai2 fait émerger une IA modulaire à partir des données, sans règles humaines
Le nouveau modèle MoE d'Ai2, EMO, utilise une méthode d'entraînement novatrice qui permet aux modules experts d'émerger naturellement des données, permettant une utilisation sélective des experts avec une perte de performance minimale. Le modèle égalise les performances des MoE standards sur les benchmarks tout en offrant une modularité considérablement améliorée.
2026-07-07
Analyse Approfondie
Aleph Alpha construit un modèle d'inférence théorique pour DeepSeek : Déduire les performances à partir des primitives matérielles
Aleph Alpha a créé un modèle d'inférence théorique pour DeepSeek v3 afin d'estimer le débit à partir des paramètres matériels, en analysant les compromis entre configurations GPU pour aider les praticiens à optimiser les performances et les coûts pour les grands modèles MoE.
2026-07-05
Optimisation de l'inférence LLM
Aleph Alpha construit un modèle d'inférence théorique pour décoder les performances de DeepSeek V3 à partir de primitives matérielles
Le modèle théorique d'Aleph Alpha prédit les performances d'inférence de DeepSeek V3 à partir des seuls paramètres matériels, révélant comment le nombre de GPU et la bande passante d'interconnexion déplacent le goulot d'étranglement entre le calcul, la mémoire et la communication.
2026-07-04