SevenTnewS

quantification

4 published articles

Meta AIFeatured4 min read

IA open source

Muse Glimmer : l'agent 30B de Meta tient sous 20 Go, cloud en option

Meta a open-sourcé Muse Glimmer, un modèle agentique de 30B qui fonctionne hors ligne sur un seul GPU grand public. La quantification le maintient sous 20 Go, un drafter DFlash offre un décodage jusqu'à 3,1x plus rapide sur un RTX 5090, et les poids sont sur Hugging Face sous licence Apache 2.0.

2026-08-10

Qwen / Alibaba4 min read

Qwen / Alibaba Cloud

Qwen2.5-Omni surpasse Gemini-1.5-Pro sur OmniBench et tient en moins de 12 Go

Le Qwen2.5-Omni open source d'Alibaba a surclassé Gemini-1.5-Pro sur OmniBench et a pris la tête du classement MMAU de raisonnement audio. Les versions quantifiées réduisent la VRAM sous 12 Go et la prise en charge de MNN apporte le chat vocal en temps réel sur les téléphones.

2026-08-07

LLM & Modèles3 min read

Recherche IA

Pourquoi la log-probabilité des tokens est le mauvais indicateur pour surveiller les modèles de raisonnement IA

Novelis Research montre que la log-probabilité des tokens échoue en tant que moniteur de décodeur pour les modèles de raisonnement quantifiés, étant aveugle aux boucles confiantes. Ils introduisent un contrôleur e-CUSUM calibré qui combine l'incertitude et les signaux de répétition, atteignant une sélectivité sur GSM8K avec DeepSeek-R1-Distill-Qwen-1.5B.

2026-08-03

Open Source3 min read

Quantification de modèle

Unsloth réduit Inkling de 975B à 270 Go avec 74 % de rétention de précision

La quantification dynamique GGUF d'Unsloth réduit Inkling, un modèle ouvert de 975 milliards de paramètres, de 1,9 To à 270 Go en 1 bit avec 74,2 % de rétention de précision. La méthode préserve sélectivement les couches de haute précision, permettant l'inférence locale sur des machines disposant de 290 Go de RAM+VRAM.

2026-07-16