SevenTnewS

NVFP4

4 published articles

IA5 min read

Infraestructura de IA

Nemotron 3 Embed de Nvidia expone el impuesto oculto que paga cada agente de IA

Nvidia lanzó Nemotron 3 Embed, una familia de modelos de embeddings de pesos abiertos que logran una calidad de recuperación de última generación mientras reducen los costos de tokens agénticos posteriores. La variante de 8B ocupa el puesto #1 en RTEB; los modelos más pequeños de 1B ofrecen eficiencia lista para producción.

2026-07-16

VibeCodingFeatured3 min read

Actualización de rendimiento

El motor mlx de Ollama ahora es más rápido y consume menos memoria en Apple Silicon

La actualización del motor MLX de Ollama trae cuantización NVFP4 para modelos de 4 bits de mayor calidad, una inferencia un 20 % más rápida mediante núcleos Metal fusionados y un sistema de almacenamiento en caché de instantáneas que elimina el reprocesamiento del contexto compartido en escenarios multiagente, de modelos de pensamiento y de ramificación.

2026-06-11

IAFeatured5 min read

Infraestructura de IA

El nuevo Nemotron 3 Ultra de Nvidia pone patas arriba la ecuación de costos de los flujos de trabajo agénticos

Nemotron 3 Ultra, el modelo agéntico denso-disperso de Nvidia, promete reducir los costos de inferencia hasta en un 30% frente a modelos abiertos similares, manteniendo un razonamiento de frontera. Con una ventana de contexto de 1 millón de tokens y cuantización nativa NVFP4, se posiciona como el caballo de batalla para cargas de trabajo empresariales de llamadas a herramientas.

2026-06-04

IAFeatured4 min read

Inferencia local de IA

Ollama acaba de reescribir su motor para Apple silicon. La generación M5 es la verdadera historia

Ollama presenta una vista previa de inferencia basada en MLX en Apple silicon, llevando a Qwen3.5-35B-A3B a 1.851 tok/s de prefill en M5. El cambio también trae cuantización NVFP4 para paridad en producción y una caché más inteligente para flujos de trabajo de agentes.

2026-03-30