perfectionnement personnel
2 published articles
Recherche en bref
Les goulots d'étranglement structurés surpassent la magie des prompts dans les tâches d'induction des LLM
Une nouvelle méthodologie appelée Hourglass reasoning impose un isolement strict du contexte entre les étapes d'induction, de déduction et de mise en œuvre, ne transmettant qu'une règle symbolique compressée entre elles. Sur ARC-AGI-2, elle améliore la précision pass@5 jusqu'à 14 points par rapport au raffinement itératif ; sur la synthèse Verilog de ChipBench, elle double presque la précision avec GPT-5.5. Les ablations confirment que la topologie elle-même est à l'origine de l'amélioration.
2026-07-31
Intelligence artificielle
Des modèles plus petits qui se remettent constamment en question peuvent battre des modèles 10 fois plus grands
RefineRL entraîne de petits modèles de langage à affiner itérativement leurs propres solutions de programmation compétitive à l'aide d'un agent sceptique et d'un apprentissage par renforcement. Un modèle de 4B utilisant cette méthode surpasse les modèles de 32B et approche les performances des modèles de 235B, suggérant que l'auto-affinage, et non la taille brute, pourrait être une voie d'échelle plus robuste pour les tâches de raisonnement.
2026-07-25