SevenTnewS

costo de inferencia

4 published articles

IA3 min read

Razonamiento de pesos abiertos

Nemotron-4 de Nvidia es rápido, abierto y apunta directamente a la brecha entre Llama y GPT

La línea Nemotron-4 de Nvidia desafía a Llama 3.3 y Mistral Large con puntuaciones MMLU competitivas y un ahorro del 30 % en inferencia. La licencia abierta y la estrategia de doble tamaño la posicionan como una alternativa práctica para equipos que ejecutan cargas de trabajo agénticas a escala.

2026-07-25

IAFeatured2 min read

Ingeniería de costos

Microsoft prueba un modelo chino para reducir los costos de Copilot hasta en 600 millones de dólares

Microsoft se prepara para probar Kimi K3 de Moonshot AI dentro de Copilot en un intento por reducir los costos de inferencia de IA hasta en 600 millones de dólares. La empresa está buscando alternativas más baratas a los modelos de OpenAI y Anthropic, pero el modelo chino de pesos abiertos aún debe pasar las verificaciones de calidad y latencia.

2026-07-21

IAFeatured5 min read

Infraestructura de IA

El nuevo Nemotron 3 Ultra de Nvidia pone patas arriba la ecuación de costos de los flujos de trabajo agénticos

Nemotron 3 Ultra, el modelo agéntico denso-disperso de Nvidia, promete reducir los costos de inferencia hasta en un 30% frente a modelos abiertos similares, manteniendo un razonamiento de frontera. Con una ventana de contexto de 1 millón de tokens y cuantización nativa NVFP4, se posiciona como el caballo de batalla para cargas de trabajo empresariales de llamadas a herramientas.

2026-06-04

IAFeatured2 min read

Qwen3.7

El vacío de las zonas horarias que reduce los costos de inferencia de IA en un 80%

Model Studio reduce automáticamente los costos de API de Qwen3.7-Max y Qwen3.7-Plus hasta en un 80% durante una ventana nocturna que coincide con las horas laborales en Estados Unidos y Europa. Sin registro, sin cambios de código, solo inferencia más barata para cualquiera que ajuste sus llamadas correctamente.

2026-05-20