IA de raisonnement
2 published articles
Intelligence artificielle
Des modèles plus petits qui se remettent constamment en question peuvent battre des modèles 10 fois plus grands
RefineRL entraîne de petits modèles de langage à affiner itérativement leurs propres solutions de programmation compétitive à l'aide d'un agent sceptique et d'un apprentissage par renforcement. Un modèle de 4B utilisant cette méthode surpasse les modèles de 32B et approche les performances des modèles de 235B, suggérant que l'auto-affinage, et non la taille brute, pourrait être une voie d'échelle plus robuste pour les tâches de raisonnement.
2026-07-25
Recherche en IA
Comment MaxProof transforme les vérificateurs génératifs en moteur de révolution des preuves
MaxProof est un cadre de passage à l’échelle au moment du test qui modélise la génération de preuves mathématiques comme un processus de recherche évolutive. En combinant Proof RL, l’alignement des vérificateurs et l’augmentation par raffinement, il transforme la vérification générative peu fiable en un système de récompenses digne de confiance pour l’entraînement et l’inférence.
2026-07-05