mezcla de expertos
13 published articles
IA de pesos abiertos
dots3-note de Xiaohongshu: un MoE abierto de 280B que solo activa 16B
El estudio dots de Xiaohongshu ha lanzado dots3-note preview, su primer modelo de pesos abiertos: un MoE multimodal con 280B de parámetros, 16B activos y una ventana de contexto de 512K. El diseño disperso apunta a un bajo coste de inferencia en un único nodo de 8 GPU, pero la ficha aún no ha publicado cifras de benchmarks.
2026-08-20
IA de código abierto: Alibaba abre el nivel Max
Qwen 3.8-Max: el modelo más potente de Alibaba ya se puede descargar gratis
Alibaba está publicando como código abierto Qwen 3.8-Max, su modelo más capaz hasta la fecha: un MoE de 2,4 billones de parámetros que supera a GPT-5.6 Sol en SWE-bench Pro, PaperBench e IFBench. Analizamos las salvedades de los benchmarks y lo que significa un modelo insignia abierto con 95 mil millones de parámetros activos para los desarrolladores.
2026-08-16
Modelos de IA | NVIDIA Nemotron 3.5 Lightning
Por qué Nemotron 3.5 Lightning apuesta a que la mayoría de los pasos de un agente no necesitan un modelo grande
El nuevo modelo abierto de Nvidia se ejecuta localmente con 3B de parámetros activos y un contexto de 1M de tokens, diseñado para agentes que permanecen en ejecución. Nvidia afirma hasta 4 veces más rendimiento y un 30 % más rápido en la finalización de tareas que los modelos abiertos comparables.
2026-08-14
IA de código abierto
El modelo más grande de Alibaba programó en solitario durante 16 días. La próxima semana, sus pesos se harán públicos.
Qwen3.8-Max activa solo 95 mil millones de sus 2,4 billones de parámetros, ocupa el segundo puesto en Vision Arena y construyó un marco de agentes en una ejecución autónoma de 16 días. Alibaba publica los pesos la próxima semana en su primer lanzamiento insignia de pesos abiertos.
2026-08-10
Código abierto
Una carrera de relevos con GPUs alquiladas entrenó el MoE de 2.7B de NanoColibri por $200
NanoColibri-Instruct pasó de pesos en blanco a un MoE de 2.7B funcional por unos $200. Los voluntarios se pasaron un testigo de entrenamiento en el Hugging Face Hub, una GPU alquilada a la vez, con un arrendamiento de compare-and-swap para que nunca dos personas entrenaran la misma etapa.
2026-08-04
Grok 4.5
El Grok 4.5 de Cursor fue construido por agentes de IA, no por humanos. Esa es la verdadera historia.
El Grok 4.5 de Cursor es un modelo Mixture-of-Experts construido mediante aprendizaje por refuerzo en entornos creados por agentes de IA anteriores, no por humanos. Maneja tareas complejas y de larga duración en ingeniería de software, ciencia de datos, finanzas y derecho, y ya está disponible.
2026-07-10
Estrategia de cartera
Alibaba's Qwen construye un modelo para cada trabajo de IA, no solo uno para gobernarlos a todos
El equipo de Qwen de Alibaba Cloud lanzó silenciosamente un modelo de mundo de agente MoE de 35B, tres nuevos modelos ASR y un informe de RL de generación de imágenes, revelando una apuesta estratégica por la amplitud sobre el espectáculo en la carrera de modelos de IA.
2026-07-09
Google DeepMind
El Gemma 4 de Google DeepMind convierte 26 mil millones de parámetros en una máquina de razonamiento que cabe en una GPU
El informe técnico de Gemma 4 de Google DeepMind detalla una familia de modelos de peso abierto con mezcla de expertos, ventanas de contexto de 1 millón de tokens y visión multimodal. El lanzamiento señala una jugada estratégica para llevar el razonamiento de nivel fronterizo a los desarrolladores sin el costo de las API propietarias.
2026-07-09
Inteligencia artificial
La nueva librería megakernel de Aleph Alpha reduce la latencia de inferencia MoE en un 200%
Alpha-MoE fusiona múltiples operaciones en un solo kernel persistente para lograr ganancias de velocidad de inferencia de hasta el 200% sobre los kernels basados en Triton en vLLM y SGLang, dirigido a modelos MoE de precisión FP8.
2026-07-09
Inteligencia Artificial
El EMO de Ai2 hace que la IA modular surja de los datos, no de reglas humanas
El nuevo modelo MoE de Ai2, EMO, utiliza un método de entrenamiento novedoso que permite que los módulos expertos emerjan naturalmente de los datos, permitiendo el uso selectivo de expertos con una pérdida mínima de rendimiento. El modelo iguala el rendimiento de MoE estándar en pruebas de referencia, al tiempo que ofrece una modularidad enormemente mejorada.
2026-07-07
Análisis en profundidad
Aleph Alpha construye modelo teórico de inferencia para DeepSeek: Derivando rendimiento a partir de primitivas de hardware
Aleph Alpha creó un modelo teórico de inferencia para DeepSeek v3 que estima el rendimiento a partir de parámetros de hardware, analizando compensaciones en configuraciones de GPU para ayudar a los profesionales a optimizar el rendimiento y el costo de modelos MoE grandes.
2026-07-05
Optimización de Inferencia de LLM
Aleph Alpha construye un modelo teórico de inferencia para descifrar el rendimiento de DeepSeek V3 a partir de primitivas de hardware
El modelo teórico de Aleph Alpha predice el rendimiento de inferencia de DeepSeek V3 únicamente a partir de parámetros de hardware, revelando cómo la cantidad de GPU y el ancho de banda de interconexión desplazan el cuello de botella entre cómputo, memoria y comunicación.
2026-07-04