évaluation d'agent
2 published articles
Agents IA
Personne ne peut dire ce que leurs agents de codage IA ont réellement fait aujourd'hui
Les entreprises qui dépensent massivement pour des agents de codage IA ne peuvent pas voir ce que ces agents ont réellement fait, les benchmarks mesurant leur amélioration peuvent être sur-ajustés aux ensembles de test publics, et le code qu'ils écrivent n'est pas examiné par défaut. Trois problèmes distincts avec la même cause racine : l'adoption a dépassé les outils pour l'observer.
2026-07-30
Recherche en IA
L'évolution des harnais semble impressionnante jusqu'à ce qu'on la teste sur des tâches inédites
L'évolution automatique des harnais est censée améliorer les agents LLM, mais un nouvel article soutient que de nombreux gains rapportés pourraient provenir d'un surapprentissage sur l'ensemble de test public. Dans les expériences, des méthodes simples de test-time scaling ont égalé ou surpassé l'évolution, et les harnais évolués ont montré une généralisation limitée à des tâches inédites.
2026-07-27