Razonamiento de IA
2 published articles
Inteligencia Artificial
Modelos más pequeños que dudan de sí mismos pueden superar a otros 10 veces más grandes
RefineRL entrena modelos de lenguaje pequeños para refinar iterativamente sus propias soluciones de programación competitiva mediante un agente escéptico y aprendizaje por refuerzo. Un modelo de 4B que usa este método supera a modelos de 32B y se acerca al rendimiento de 235B, lo que sugiere que el auto-refinamiento, no el tamaño bruto, puede ser una ruta de escalado más sólida para tareas de razonamiento.
2026-07-25
Investigación en IA
Cómo maxproof convierte a los verificadores generativos en un motor de revolución de pruebas
MaxProof es un marco de escalado en tiempo de prueba que modela la generación de pruebas matemáticas como un proceso de búsqueda evolutiva. Al combinar Proof RL, alineación de verificadores y aumento por refinamiento, convierte la verificación generativa poco confiable en un sistema de recompensa confiable para el entrenamiento y la inferencia.
2026-07-05