GGUF
2 published articles
Open Source3 min read
Quantification de modèle
Unsloth réduit Inkling de 975B à 270 Go avec 74 % de rétention de précision
La quantification dynamique GGUF d'Unsloth réduit Inkling, un modèle ouvert de 975 milliards de paramètres, de 1,9 To à 270 Go en 1 bit avec 74,2 % de rétention de précision. La méthode préserve sélectivement les couches de haute précision, permettant l'inférence locale sur des machines disposant de 290 Go de RAM+VRAM.
2026-07-16
Outils & FrameworksFeatured3 min read
IA locale
Ollama 0.30 apporte une inférence GPU plus rapide et une prise en charge native des modèles GGUF
Ollama 0.30 booste l'inférence NVIDIA jusqu'à 20 %, active la prise en charge GPU Vulkan par défaut pour les appareils AMD et Intel, et étend la compatibilité des modèles GGUF, y compris les modèles affinés de Hugging Face et la prise en charge des appels d'outils avec des agents de codage.
2026-06-05