GGUF
2 published articles
Código Abierto3 min read
Cuantización de modelos
Unsloth reduce el modelo Inkling de 975B a 270 GB con una retención de precisión del 74%
La cuantización dinámica GGUF de Unsloth reduce Inkling, un modelo abierto de 975 mil millones de parámetros, de 1,9 TB a 270 GB en 1 bit con una retención de precisión del 74,2 %. El método preserva selectivamente las capas de alta precisión, permitiendo inferencia local en máquinas con 290 GB de RAM+VRAM.
2026-07-16
Herramientas y FrameworksFeatured3 min read
IA local
Ollama 0.30 trae inferencia GPU más rápida y soporte nativo de modelos GGUF
Ollama 0.30 aumenta la inferencia en NVIDIA hasta en un 20%, habilita el soporte GPU Vulkan por defecto para dispositivos AMD e Intel, y amplía la compatibilidad con modelos GGUF, incluidos modelos ajustados de Hugging Face y soporte para llamadas a herramientas con agentes de codificación.
2026-06-05