SevenTnewS

cuantización

4 published articles

Meta AIFeatured4 min read

IA de código abierto

Muse Glimmer: el agente de 30B de Meta cabe en menos de 20GB, la nube es opcional

Meta ha publicado como código abierto Muse Glimmer, un modelo agéntico de 30B que se ejecuta sin conexión en una sola GPU de consumo. La cuantización lo mantiene por debajo de 20 GB, un drafter DFlash ofrece una decodificación hasta 3,1x más rápida en una RTX 5090, y los pesos están en Hugging Face bajo Apache 2.0.

2026-08-10

Qwen / Alibaba4 min read

Qwen / Alibaba Cloud

Qwen2.5-Omni supera a Gemini-1.5-Pro en OmniBench y cabe en menos de 12GB

El Qwen2.5-Omni de código abierto de Alibaba superó a Gemini-1.5-Pro en OmniBench y encabezó la tabla de clasificación de razonamiento de audio MMAU. Las versiones cuantizadas reducen la VRAM a menos de 12GB y la compatibilidad con MNN lleva el chat de voz en tiempo real a los teléfonos.

2026-08-07

LLMs y Modelos3 min read

Investigación en IA

Por qué la probabilidad logarítmica de los tokens es la señal equivocada para monitorear modelos de razonamiento de IA

Novelis Research demuestra que la probabilidad logarítmica de los tokens falla como monitor de decodificador para modelos de razonamiento cuantizados, siendo ciega a los bucles confiados. Introducen un controlador e-CUSUM calibrado que combina señales de incertidumbre y repetición, logrando selectividad en GSM8K con DeepSeek-R1-Distill-Qwen-1.5B.

2026-08-03

Código Abierto3 min read

Cuantización de modelos

Unsloth reduce el modelo Inkling de 975B a 270 GB con una retención de precisión del 74%

La cuantización dinámica GGUF de Unsloth reduce Inkling, un modelo abierto de 975 mil millones de parámetros, de 1,9 TB a 270 GB en 1 bit con una retención de precisión del 74,2 %. El método preserva selectivamente las capas de alta precisión, permitiendo inferencia local en máquinas con 290 GB de RAM+VRAM.

2026-07-16