cuantización
4 published articles
IA de código abierto
Muse Glimmer: el agente de 30B de Meta cabe en menos de 20GB, la nube es opcional
Meta ha publicado como código abierto Muse Glimmer, un modelo agéntico de 30B que se ejecuta sin conexión en una sola GPU de consumo. La cuantización lo mantiene por debajo de 20 GB, un drafter DFlash ofrece una decodificación hasta 3,1x más rápida en una RTX 5090, y los pesos están en Hugging Face bajo Apache 2.0.
2026-08-10
Qwen / Alibaba Cloud
Qwen2.5-Omni supera a Gemini-1.5-Pro en OmniBench y cabe en menos de 12GB
El Qwen2.5-Omni de código abierto de Alibaba superó a Gemini-1.5-Pro en OmniBench y encabezó la tabla de clasificación de razonamiento de audio MMAU. Las versiones cuantizadas reducen la VRAM a menos de 12GB y la compatibilidad con MNN lleva el chat de voz en tiempo real a los teléfonos.
2026-08-07
Investigación en IA
Por qué la probabilidad logarítmica de los tokens es la señal equivocada para monitorear modelos de razonamiento de IA
Novelis Research demuestra que la probabilidad logarítmica de los tokens falla como monitor de decodificador para modelos de razonamiento cuantizados, siendo ciega a los bucles confiados. Introducen un controlador e-CUSUM calibrado que combina señales de incertidumbre y repetición, logrando selectividad en GSM8K con DeepSeek-R1-Distill-Qwen-1.5B.
2026-08-03
Cuantización de modelos
Unsloth reduce el modelo Inkling de 975B a 270 GB con una retención de precisión del 74%
La cuantización dinámica GGUF de Unsloth reduce Inkling, un modelo abierto de 975 mil millones de parámetros, de 1,9 TB a 270 GB en 1 bit con una retención de precisión del 74,2 %. El método preserva selectivamente las capas de alta precisión, permitiendo inferencia local en máquinas con 290 GB de RAM+VRAM.
2026-07-16