SevenTnewS

Entrenamiento de LLM

5 published articles

LLMs y Modelos3 min read

IA de código abierto

Boris-2 alimenta su modelo de 125M con 90B tokens, y su 250M con solo 60B

Boris-2 preanuncia tres modelos pequeños con presupuestos de tokens desequilibrados: el de 125M recibe 90B tokens, el de 250M solo 60B. El entrenamiento va del 12 de agosto al 10 de septiembre, sin benchmarks compartidos, solo la ambición declarada de alcanzar la fuerza de SmolLM2-135M.

2026-08-16

Código Abierto6 min read

Código abierto

Una carrera de relevos con GPUs alquiladas entrenó el MoE de 2.7B de NanoColibri por $200

NanoColibri-Instruct pasó de pesos en blanco a un MoE de 2.7B funcional por unos $200. Los voluntarios se pasaron un testigo de entrenamiento en el Hugging Face Hub, una GPU alquilada a la vez, con un arrendamiento de compare-and-swap para que nunca dos personas entrenaran la misma etapa.

2026-08-04

LLMs y Modelos4 min read

Destilación de LLM

La destilación de LLM se estanca cuando el contexto se vuelve estático. Este artículo lo hace evolucionar

Los contextos pueden llevar las preferencias de la tarea al entrenamiento de LLM, pero una vez destilados en un estudiante añaden poca supervisión. Flux-OPD de la Universidad de Pekín mantiene el contexto en movimiento con el estudiante y utiliza un término de conflicto para ponderar las correcciones del profesor. El resumen reporta mejoras sobre los paradigmas OPD existentes sin citar cifras.

2026-07-31

IAFeatured3 min read

Optimización del Entrenamiento

Unsloth afirma entrenamiento de LLM 5 veces más rápido con nuevos kernels Triton y empaquetado automático

La última actualización de Unsloth introduce kernels Triton QK RoPE fusionados para embeddings rotatorios 2.3 veces más rápidos, indexación int64 para contexto largo y empaquetado automático sin relleno. Los benchmarks muestran un rendimiento 1.7-3 veces mayor en Qwen3-32B sin pérdida de precisión.

2026-07-16

LLMs y Modelos4 min read

Estrategia de datos sintéticos

El atlas de datos de Nvidia muestra por qué los datos sintéticos importan más que los pesos del modelo

El Nemotron Post-Training v3 Prompt Atlas de Nvidia proporciona un mapa interactivo de miles de millones de muestras de datos sintéticos, destacando cómo los datos sintéticos abiertos son la capa faltante para construir agentes de IA confiables. La empresa argumenta que el comportamiento de los agentes debe ser inspeccionable y que los datos sintéticos, publicados de manera abierta, son la única forma de preservar señales propietarias sin exponer secretos comerciales.

2026-07-12