SevenTnewS

arXiv

18 published articles

Agents IA4 min read

Mémoire des agents

TEPA : pour les agents IA, une mémoire obsolète est pire que l'absence de mémoire

La mémoire des agents a un problème de falsifiabilité, soutient un nouveau préprint arXiv : les faits obsolètes restent récupérables et polluent le prompt. Son mécanisme TEPA révoque les mémoires dépassées, et lors des tests de dérive, la mémoire naïve a obtenu un score inférieur à celui de l'absence de mémoire (0.210 contre 0.309), tandis que TEPA a atteint 0.950.

2026-08-19

IA5 min read

Scaling au moment du test

Le routage CoBa égalise le vote majoritaire best-of-16 avec 58,9 % de jetons en moins

CoBa, une politique de routage à calcul équilibré issue d'un nouvel article arXiv, égalise le vote majoritaire best-of-16 à moins de 0,01 point près tout en réduisant de 58,9 % les jetons pondérés par paramètres. Sur 3 129 évaluations couvrant MATH-500, AIME et AMC, elle bat également nettement le décodage à échantillon unique, même si un léger avantage du best-of-16 subsiste lorsque le budget n'est pas une contrainte.

2026-08-19

Laboratoires & Recherche5 min read

IA / Recherche en codage agentique

Blast Radius enterre le contexte mort. Aucun des 450 corps n'est revenu.

Un nouvel article arXiv, Blast Radius, traite le contexte agentique gaspillé comme de la matière morte et l'enterre de manière réversible : 17 à 26 % d'économies de jetons sur sept modèles OpenAI, 450 contextes archivés, zéro rappel. L'objectif plus ambitieux de l'article est de rendre le codage agentique durable, un jeton récupéré à la fois.

2026-08-19

Agents IA4 min read

Agents IA

PsychoAgent a doté les agents d'IA d'une mémoire émotionnelle. Les évaluateurs n'ont trouvé aucun avantage

PsychoAgent donne aux agents LLM une mémoire affective distincte, de sorte que les traces conflictuelles et chargées d'émotion peuvent l'emporter sur celles simplement thématiques. Dans trois scénarios de conflit, il a récupéré plus de mémoires critiques pour le conflit que les deux références (0.933 contre 0.500 et 0.667), mais cinq évaluateurs en aveugle n'ont trouvé aucun avantage qualitatif significatif.

2026-08-19

Laboratoires & Recherche4 min read

Recherche en IA

Un patron IA qui ignore les réponses pousse son subalterne dans un état « alien »

Un nouvel article sur arXiv révèle que les agents IA se comportent différemment en interaction qu'en isolation. Un agent patron qui ignore les réponses de son subalterne le pousse dans un état « alien », et lorsque le patron écoute, les deux évoluent ensemble. Ce résultat fait de la livraison des messages une décision de conception pour les systèmes multi-agents.

2026-08-19

Laboratoires & Recherche4 min read

Recherche en IA

Des chaînes de pensée plus longues butent sur un mur. ThinkRetrieve injecte le correctif en cours de raisonnement

Le test-time scaling séquentiel atteint souvent des rendements décroissants, voire négatifs, affirme une nouvelle prépublication. ThinkRetrieve récupère des exemples résolus en cours de raisonnement et les injecte dans la trace, rapportant des gains relatifs allant jusqu'à 60 % sur AIME 2025 sur cinq petits modèles de raisonnement.

2026-08-18

NLP & ML3 min read

Graphes de connaissances & IA urbaine

Les stations ne sont pas des îles : comment RTSKG reconfigure les données de transport urbain

Les modèles de transport à l'échelle urbaine ignorent souvent la manière dont les stations sont liées aux routes et aux commerces. RTSKG, un jeu de données à base de graphe de connaissances publié sur arXiv, modélise explicitement ces interactions et fait état de gains en matière de recommandation de commerces et de prévision de fréquentation.

2026-08-18

Agents IA4 min read

Recherche IA

Fini le copier-coller des compétences : la correction sans évaluation de SkillZip pour les agents gonflés

Les agents auto-évolutifs ajoutent des correctifs jusqu'à ce que la même règle apparaisse dans plusieurs branches. SkillZip compresse leurs compétences sans rollouts d'évaluation, en trouvant la plus courte explication structurelle fidèle. Les modes one-shot et Zip-on-Write, et ce que le résumé laisse sans preuve.

2026-08-15

Agents IA4 min read

Agents IA

Quand les compétences des agents se retournent contre eux, SkillProx les élaguent comme une descente de gradient

Les compétences étaient censées rendre les agents plus intelligents, mais chaque correctif qu'ils accumulent peut les rendre moins intelligents. SkillProx exécute une boucle avant-arrière inspirée du gradient proximal qui diagnostique, annule et supprime. Résultat : un gain moyen en précision de 3,0 points par rapport à la baseline à base de gradient la plus solide.

2026-08-14

IA4 min read

Compréhension vidéo

Gemini 3.6 Flash compte les changements d'état mais ne détecte pas les clignements

Les modèles de langage vidéo échouent à la simple tenue de registre d'événements, selon une nouvelle étude arXiv. Gemini 3.6 Flash compte les changements d'état persistants jusqu'à 12 événements mais ne dispose d'aucune région de comptage positif fiable pour les clignements transitoires ; des images supplémentaires gonflent la précision sans récupération fidèle, avec seulement 0,2 % de comptes finaux corrects dans le régime à comptage élevé.

2026-08-12

LLM & ModèlesFeatured4 min read

Sécurité de l’IA

Shieldstral, le classifieur 3B qui surclasse des modèles sept fois plus grands

Un classifieur de sécurité 3B égale des modèles de texte presque sept fois plus gros et établit un nouvel état de l'art en modération multimodale, selon un article arXiv de juillet 2026. L'astuce : une modération reformulée en question-réponse binaire, entraînée sur environ 54,1 millions d'échantillons.

2026-08-05

LLM & Modèles4 min read

Distillation des LLM

La distillation des LLM stagne quand le contexte devient statique. Ce papier le fait évoluer

Les contextes peuvent transporter les préférences de tâche dans l'entraînement des LLM, mais une fois distillés dans un étudiant, ils n'apportent qu'une supervision limitée. Le Flux-OPD de l'université de Pékin maintient le contexte en mouvement avec l'étudiant et utilise un terme de conflit pour pondérer les corrections des enseignants. Le résumé rapporte des gains par rapport aux paradigmes OPD existants sans citer de chiffres.

2026-07-31

← PreviousPage 1 / 2 · 18 articlesNext →