Entrenamiento de LLM
5 published articles
IA de código abierto
Boris-2 alimenta su modelo de 125M con 90B tokens, y su 250M con solo 60B
Boris-2 preanuncia tres modelos pequeños con presupuestos de tokens desequilibrados: el de 125M recibe 90B tokens, el de 250M solo 60B. El entrenamiento va del 12 de agosto al 10 de septiembre, sin benchmarks compartidos, solo la ambición declarada de alcanzar la fuerza de SmolLM2-135M.
2026-08-16
Código abierto
Una carrera de relevos con GPUs alquiladas entrenó el MoE de 2.7B de NanoColibri por $200
NanoColibri-Instruct pasó de pesos en blanco a un MoE de 2.7B funcional por unos $200. Los voluntarios se pasaron un testigo de entrenamiento en el Hugging Face Hub, una GPU alquilada a la vez, con un arrendamiento de compare-and-swap para que nunca dos personas entrenaran la misma etapa.
2026-08-04
Destilación de LLM
La destilación de LLM se estanca cuando el contexto se vuelve estático. Este artículo lo hace evolucionar
Los contextos pueden llevar las preferencias de la tarea al entrenamiento de LLM, pero una vez destilados en un estudiante añaden poca supervisión. Flux-OPD de la Universidad de Pekín mantiene el contexto en movimiento con el estudiante y utiliza un término de conflicto para ponderar las correcciones del profesor. El resumen reporta mejoras sobre los paradigmas OPD existentes sin citar cifras.
2026-07-31
Optimización del Entrenamiento
Unsloth afirma entrenamiento de LLM 5 veces más rápido con nuevos kernels Triton y empaquetado automático
La última actualización de Unsloth introduce kernels Triton QK RoPE fusionados para embeddings rotatorios 2.3 veces más rápidos, indexación int64 para contexto largo y empaquetado automático sin relleno. Los benchmarks muestran un rendimiento 1.7-3 veces mayor en Qwen3-32B sin pérdida de precisión.
2026-07-16
Estrategia de datos sintéticos
El atlas de datos de Nvidia muestra por qué los datos sintéticos importan más que los pesos del modelo
El Nemotron Post-Training v3 Prompt Atlas de Nvidia proporciona un mapa interactivo de miles de millones de muestras de datos sintéticos, destacando cómo los datos sintéticos abiertos son la capa faltante para construir agentes de IA confiables. La empresa argumenta que el comportamiento de los agentes debe ser inspeccionable y que los datos sintéticos, publicados de manera abierta, son la única forma de preservar señales propietarias sin exponer secretos comerciales.
2026-07-12