quantification
4 published articles
IA open source
Muse Glimmer : l'agent 30B de Meta tient sous 20 Go, cloud en option
Meta a open-sourcé Muse Glimmer, un modèle agentique de 30B qui fonctionne hors ligne sur un seul GPU grand public. La quantification le maintient sous 20 Go, un drafter DFlash offre un décodage jusqu'à 3,1x plus rapide sur un RTX 5090, et les poids sont sur Hugging Face sous licence Apache 2.0.
2026-08-10
Qwen / Alibaba Cloud
Qwen2.5-Omni surpasse Gemini-1.5-Pro sur OmniBench et tient en moins de 12 Go
Le Qwen2.5-Omni open source d'Alibaba a surclassé Gemini-1.5-Pro sur OmniBench et a pris la tête du classement MMAU de raisonnement audio. Les versions quantifiées réduisent la VRAM sous 12 Go et la prise en charge de MNN apporte le chat vocal en temps réel sur les téléphones.
2026-08-07
Recherche IA
Pourquoi la log-probabilité des tokens est le mauvais indicateur pour surveiller les modèles de raisonnement IA
Novelis Research montre que la log-probabilité des tokens échoue en tant que moniteur de décodeur pour les modèles de raisonnement quantifiés, étant aveugle aux boucles confiantes. Ils introduisent un contrôleur e-CUSUM calibré qui combine l'incertitude et les signaux de répétition, atteignant une sélectivité sur GSM8K avec DeepSeek-R1-Distill-Qwen-1.5B.
2026-08-03
Quantification de modèle
Unsloth réduit Inkling de 975B à 270 Go avec 74 % de rétention de précision
La quantification dynamique GGUF d'Unsloth réduit Inkling, un modèle ouvert de 975 milliards de paramètres, de 1,9 To à 270 Go en 1 bit avec 74,2 % de rétention de précision. La méthode préserve sélectivement les couches de haute précision, permettant l'inférence locale sur des machines disposant de 290 Go de RAM+VRAM.
2026-07-16