SevenTnewS

mezcla de expertos

13 published articles

LLMs y Modelos5 min read

IA de pesos abiertos

dots3-note de Xiaohongshu: un MoE abierto de 280B que solo activa 16B

El estudio dots de Xiaohongshu ha lanzado dots3-note preview, su primer modelo de pesos abiertos: un MoE multimodal con 280B de parámetros, 16B activos y una ventana de contexto de 512K. El diseño disperso apunta a un bajo coste de inferencia en un único nodo de 8 GPU, pero la ficha aún no ha publicado cifras de benchmarks.

2026-08-20

Qwen / Alibaba5 min read

IA de código abierto: Alibaba abre el nivel Max

Qwen 3.8-Max: el modelo más potente de Alibaba ya se puede descargar gratis

Alibaba está publicando como código abierto Qwen 3.8-Max, su modelo más capaz hasta la fecha: un MoE de 2,4 billones de parámetros que supera a GPT-5.6 Sol en SWE-bench Pro, PaperBench e IFBench. Analizamos las salvedades de los benchmarks y lo que significa un modelo insignia abierto con 95 mil millones de parámetros activos para los desarrolladores.

2026-08-16

NVIDIA Research4 min read

Modelos de IA | NVIDIA Nemotron 3.5 Lightning

Por qué Nemotron 3.5 Lightning apuesta a que la mayoría de los pasos de un agente no necesitan un modelo grande

El nuevo modelo abierto de Nvidia se ejecuta localmente con 3B de parámetros activos y un contexto de 1M de tokens, diseñado para agentes que permanecen en ejecución. Nvidia afirma hasta 4 veces más rendimiento y un 30 % más rápido en la finalización de tareas que los modelos abiertos comparables.

2026-08-14

Qwen / Alibaba4 min read

IA de código abierto

El modelo más grande de Alibaba programó en solitario durante 16 días. La próxima semana, sus pesos se harán públicos.

Qwen3.8-Max activa solo 95 mil millones de sus 2,4 billones de parámetros, ocupa el segundo puesto en Vision Arena y construyó un marco de agentes en una ejecución autónoma de 16 días. Alibaba publica los pesos la próxima semana en su primer lanzamiento insignia de pesos abiertos.

2026-08-10

Código Abierto6 min read

Código abierto

Una carrera de relevos con GPUs alquiladas entrenó el MoE de 2.7B de NanoColibri por $200

NanoColibri-Instruct pasó de pesos en blanco a un MoE de 2.7B funcional por unos $200. Los voluntarios se pasaron un testigo de entrenamiento en el Hugging Face Hub, una GPU alquilada a la vez, con un arrendamiento de compare-and-swap para que nunca dos personas entrenaran la misma etapa.

2026-08-04

xAI / GrokFeatured3 min read

Grok 4.5

El Grok 4.5 de Cursor fue construido por agentes de IA, no por humanos. Esa es la verdadera historia.

El Grok 4.5 de Cursor es un modelo Mixture-of-Experts construido mediante aprendizaje por refuerzo en entornos creados por agentes de IA anteriores, no por humanos. Maneja tareas complejas y de larga duración en ingeniería de software, ciencia de datos, finanzas y derecho, y ya está disponible.

2026-07-10

Qwen / AlibabaFeatured5 min read

Estrategia de cartera

Alibaba's Qwen construye un modelo para cada trabajo de IA, no solo uno para gobernarlos a todos

El equipo de Qwen de Alibaba Cloud lanzó silenciosamente un modelo de mundo de agente MoE de 35B, tres nuevos modelos ASR y un informe de RL de generación de imágenes, revelando una apuesta estratégica por la amplitud sobre el espectáculo en la carrera de modelos de IA.

2026-07-09

Google DeepMindFeatured4 min read

Google DeepMind

El Gemma 4 de Google DeepMind convierte 26 mil millones de parámetros en una máquina de razonamiento que cabe en una GPU

El informe técnico de Gemma 4 de Google DeepMind detalla una familia de modelos de peso abierto con mezcla de expertos, ventanas de contexto de 1 millón de tokens y visión multimodal. El lanzamiento señala una jugada estratégica para llevar el razonamiento de nivel fronterizo a los desarrolladores sin el costo de las API propietarias.

2026-07-09

IA3 min read

Inteligencia artificial

La nueva librería megakernel de Aleph Alpha reduce la latencia de inferencia MoE en un 200%

Alpha-MoE fusiona múltiples operaciones en un solo kernel persistente para lograr ganancias de velocidad de inferencia de hasta el 200% sobre los kernels basados en Triton en vLLM y SGLang, dirigido a modelos MoE de precisión FP8.

2026-07-09

Laboratorios e Investigación6 min read

Inteligencia Artificial

El EMO de Ai2 hace que la IA modular surja de los datos, no de reglas humanas

El nuevo modelo MoE de Ai2, EMO, utiliza un método de entrenamiento novedoso que permite que los módulos expertos emerjan naturalmente de los datos, permitiendo el uso selectivo de expertos con una pérdida mínima de rendimiento. El modelo iguala el rendimiento de MoE estándar en pruebas de referencia, al tiempo que ofrece una modularidad enormemente mejorada.

2026-07-07

IA2 min read

Análisis en profundidad

Aleph Alpha construye modelo teórico de inferencia para DeepSeek: Derivando rendimiento a partir de primitivas de hardware

Aleph Alpha creó un modelo teórico de inferencia para DeepSeek v3 que estima el rendimiento a partir de parámetros de hardware, analizando compensaciones en configuraciones de GPU para ayudar a los profesionales a optimizar el rendimiento y el costo de modelos MoE grandes.

2026-07-05

DeepSeek2 min read

Optimización de Inferencia de LLM

Aleph Alpha construye un modelo teórico de inferencia para descifrar el rendimiento de DeepSeek V3 a partir de primitivas de hardware

El modelo teórico de Aleph Alpha predice el rendimiento de inferencia de DeepSeek V3 únicamente a partir de parámetros de hardware, revelando cómo la cantidad de GPU y el ancho de banda de interconexión desplazan el cuello de botella entre cómputo, memoria y comunicación.

2026-07-04

← PreviousPage 1 / 2 · 13 articlesNext →