IAFeatured3 min read
Inteligencia Artificial
Modelos más pequeños que dudan de sí mismos pueden superar a otros 10 veces más grandes
RefineRL entrena modelos de lenguaje pequeños para refinar iterativamente sus propias soluciones de programación competitiva mediante un agente escéptico y aprendizaje por refuerzo. Un modelo de 4B que usa este método supera a modelos de 32B y se acerca al rendimiento de 235B, lo que sugiere que el auto-refinamiento, no el tamaño bruto, puede ser una ruta de escalado más sólida para tareas de razonamiento.
2026-07-25