IAFeatured3 min read
Intelligence artificielle
Des modèles plus petits qui se remettent constamment en question peuvent battre des modèles 10 fois plus grands
RefineRL entraîne de petits modèles de langage à affiner itérativement leurs propres solutions de programmation compétitive à l'aide d'un agent sceptique et d'un apprentissage par renforcement. Un modèle de 4B utilisant cette méthode surpasse les modèles de 32B et approche les performances des modèles de 235B, suggérant que l'auto-affinage, et non la taille brute, pourrait être une voie d'échelle plus robuste pour les tâches de raisonnement.
2026-07-25