arXiv
18 published articles
Mémoire des agents
TEPA : pour les agents IA, une mémoire obsolète est pire que l'absence de mémoire
La mémoire des agents a un problème de falsifiabilité, soutient un nouveau préprint arXiv : les faits obsolètes restent récupérables et polluent le prompt. Son mécanisme TEPA révoque les mémoires dépassées, et lors des tests de dérive, la mémoire naïve a obtenu un score inférieur à celui de l'absence de mémoire (0.210 contre 0.309), tandis que TEPA a atteint 0.950.
2026-08-19
Scaling au moment du test
Le routage CoBa égalise le vote majoritaire best-of-16 avec 58,9 % de jetons en moins
CoBa, une politique de routage à calcul équilibré issue d'un nouvel article arXiv, égalise le vote majoritaire best-of-16 à moins de 0,01 point près tout en réduisant de 58,9 % les jetons pondérés par paramètres. Sur 3 129 évaluations couvrant MATH-500, AIME et AMC, elle bat également nettement le décodage à échantillon unique, même si un léger avantage du best-of-16 subsiste lorsque le budget n'est pas une contrainte.
2026-08-19
IA / Recherche en codage agentique
Blast Radius enterre le contexte mort. Aucun des 450 corps n'est revenu.
Un nouvel article arXiv, Blast Radius, traite le contexte agentique gaspillé comme de la matière morte et l'enterre de manière réversible : 17 à 26 % d'économies de jetons sur sept modèles OpenAI, 450 contextes archivés, zéro rappel. L'objectif plus ambitieux de l'article est de rendre le codage agentique durable, un jeton récupéré à la fois.
2026-08-19
Agents IA
PsychoAgent a doté les agents d'IA d'une mémoire émotionnelle. Les évaluateurs n'ont trouvé aucun avantage
PsychoAgent donne aux agents LLM une mémoire affective distincte, de sorte que les traces conflictuelles et chargées d'émotion peuvent l'emporter sur celles simplement thématiques. Dans trois scénarios de conflit, il a récupéré plus de mémoires critiques pour le conflit que les deux références (0.933 contre 0.500 et 0.667), mais cinq évaluateurs en aveugle n'ont trouvé aucun avantage qualitatif significatif.
2026-08-19
Recherche en IA
Un patron IA qui ignore les réponses pousse son subalterne dans un état « alien »
Un nouvel article sur arXiv révèle que les agents IA se comportent différemment en interaction qu'en isolation. Un agent patron qui ignore les réponses de son subalterne le pousse dans un état « alien », et lorsque le patron écoute, les deux évoluent ensemble. Ce résultat fait de la livraison des messages une décision de conception pour les systèmes multi-agents.
2026-08-19
Recherche en IA
Des chaînes de pensée plus longues butent sur un mur. ThinkRetrieve injecte le correctif en cours de raisonnement
Le test-time scaling séquentiel atteint souvent des rendements décroissants, voire négatifs, affirme une nouvelle prépublication. ThinkRetrieve récupère des exemples résolus en cours de raisonnement et les injecte dans la trace, rapportant des gains relatifs allant jusqu'à 60 % sur AIME 2025 sur cinq petits modèles de raisonnement.
2026-08-18
Graphes de connaissances & IA urbaine
Les stations ne sont pas des îles : comment RTSKG reconfigure les données de transport urbain
Les modèles de transport à l'échelle urbaine ignorent souvent la manière dont les stations sont liées aux routes et aux commerces. RTSKG, un jeu de données à base de graphe de connaissances publié sur arXiv, modélise explicitement ces interactions et fait état de gains en matière de recommandation de commerces et de prévision de fréquentation.
2026-08-18
Recherche IA
Fini le copier-coller des compétences : la correction sans évaluation de SkillZip pour les agents gonflés
Les agents auto-évolutifs ajoutent des correctifs jusqu'à ce que la même règle apparaisse dans plusieurs branches. SkillZip compresse leurs compétences sans rollouts d'évaluation, en trouvant la plus courte explication structurelle fidèle. Les modes one-shot et Zip-on-Write, et ce que le résumé laisse sans preuve.
2026-08-15
Agents IA
Quand les compétences des agents se retournent contre eux, SkillProx les élaguent comme une descente de gradient
Les compétences étaient censées rendre les agents plus intelligents, mais chaque correctif qu'ils accumulent peut les rendre moins intelligents. SkillProx exécute une boucle avant-arrière inspirée du gradient proximal qui diagnostique, annule et supprime. Résultat : un gain moyen en précision de 3,0 points par rapport à la baseline à base de gradient la plus solide.
2026-08-14
Compréhension vidéo
Gemini 3.6 Flash compte les changements d'état mais ne détecte pas les clignements
Les modèles de langage vidéo échouent à la simple tenue de registre d'événements, selon une nouvelle étude arXiv. Gemini 3.6 Flash compte les changements d'état persistants jusqu'à 12 événements mais ne dispose d'aucune région de comptage positif fiable pour les clignements transitoires ; des images supplémentaires gonflent la précision sans récupération fidèle, avec seulement 0,2 % de comptes finaux corrects dans le régime à comptage élevé.
2026-08-12
Sécurité de l’IA
Shieldstral, le classifieur 3B qui surclasse des modèles sept fois plus grands
Un classifieur de sécurité 3B égale des modèles de texte presque sept fois plus gros et établit un nouvel état de l'art en modération multimodale, selon un article arXiv de juillet 2026. L'astuce : une modération reformulée en question-réponse binaire, entraînée sur environ 54,1 millions d'échantillons.
2026-08-05
Distillation des LLM
La distillation des LLM stagne quand le contexte devient statique. Ce papier le fait évoluer
Les contextes peuvent transporter les préférences de tâche dans l'entraînement des LLM, mais une fois distillés dans un étudiant, ils n'apportent qu'une supervision limitée. Le Flux-OPD de l'université de Pékin maintient le contexte en mouvement avec l'étudiant et utilise un terme de conflit pour pondérer les corrections des enseignants. Le résumé rapporte des gains par rapport aux paradigmes OPD existants sans citer de chiffres.
2026-07-31