tâches à long horizon
2 published articles
IA open source
Qwen3.8-Max a battu 458 équipes humaines en 24 heures, en travaillant seul
Qwen3.8-Max a battu 458 des 526 équipes humaines lors d'un concours de 24 heures en travaillant seul, et Alibaba mettra ses poids en open source la semaine prochaine. Chaque chiffre est pour l'instant auto-déclaré, ce qui explique précisément pourquoi les affirmations d'autonomie méritent d'être examinées de près.
2026-08-03
Intelligence Artificielle
Pourquoi la mémoire de travail de votre agent d'IA échoue dans les tâches longues
Un article académique présente StructAgent, un cadre centré sur l'état qui restructure la manière dont les agents numériques suivent la progression des tâches. Il atteint des résultats de pointe sur OSWorld-Verified avec des modèles ouverts, et se généralise à Minecraft. Les travaux identifient que l'historique brut des interactions est un goulot d'étranglement pour les tâches à long horizon, et proposent un état structuré associé à un flux de travail soutenu par un vérificateur comme solution.
2026-07-22