SevenTnewS

Agents LLM

13 published articles

Laboratoires & Recherche3 min read

Fisher-R1 | Test d'hypothèses

Les agents IA produisent des statistiques sans faille et tirent pourtant de mauvaises conclusions

Les agents qui automatisent les tests d'hypothèses peuvent exécuter des analyses sans faille tout en parvenant à de mauvaises conclusions, car la plupart des benchmarks ne vérifient jamais si la valeur p est valide. Un benchmark de 425 tâches quantifie cet écart, et un modèle open-weight entraîné par RL en comble une partie.

2026-08-19

Agents IA4 min read

Agents IA

PsychoAgent a doté les agents d'IA d'une mémoire émotionnelle. Les évaluateurs n'ont trouvé aucun avantage

PsychoAgent donne aux agents LLM une mémoire affective distincte, de sorte que les traces conflictuelles et chargées d'émotion peuvent l'emporter sur celles simplement thématiques. Dans trois scénarios de conflit, il a récupéré plus de mémoires critiques pour le conflit que les deux références (0.933 contre 0.500 et 0.667), mais cinq évaluateurs en aveugle n'ont trouvé aucun avantage qualitatif significatif.

2026-08-19

Agents IA4 min read

Recherche IA

Fini le copier-coller des compétences : la correction sans évaluation de SkillZip pour les agents gonflés

Les agents auto-évolutifs ajoutent des correctifs jusqu'à ce que la même règle apparaisse dans plusieurs branches. SkillZip compresse leurs compétences sans rollouts d'évaluation, en trouvant la plus courte explication structurelle fidèle. Les modes one-shot et Zip-on-Write, et ce que le résumé laisse sans preuve.

2026-08-15

IA5 min read

Agents IA

Traiter les SOP comme du code : un nouveau runtime à pagination par pile sépare les agents forts des faibles

De nouvelles recherches de Hong Kong et de Chine continentale démontrent que la compilation des SOP en pseudo-code exécutable et leur exécution sur une machine virtuelle à pagination par pile séparent clairement les agents capables des agents fragiles. Le travail donne une règle de déploiement précise : compiler d'abord, paginer seulement après une vérification de discipline au niveau du modèle.

2026-08-04

Agents IA4 min read

Agents LLM

La taxe de régression : pourquoi charger les agents LLM de compétences peut se retourner contre vous

Une nouvelle étude montre que l'ajout de compétences procédurales aux agents LLM n'aide pas toujours, cela peut introduire des régressions, où des tâches auparavant résolues sans compétences échouent après l'ajout de compétences. La recherche identifie trois causes et affirme que la fiabilité dépend davantage de l'ancrage et de la vérification que de la compétence elle-même.

2026-08-03

LLM & Modèles3 min read

Intelligence Artificielle

La génération d'idées de recherche s'améliore de 3,89x avec IDEAgent

IDEAgent utilise des lignées, des retours multi-objectifs et une mémoire séquentielle pour équilibrer qualité et diversité dans les idées de recherche générées par LLM. Testé sur 32 sujets dans 8 domaines de l'informatique, il atteint 3,89x le Yield (idées diverses au-dessus d'un seuil de qualité) des méthodes antérieures.

2026-08-02

Agents IA3 min read

IA industrielle

AgentRCA : analyse de cause racine zero-shot qui explique son propre raisonnement

Un framework agentique zero-shot appelé AgentRCA utilise un jumeau numérique et un LLM pour diagnostiquer les défauts d'usine sans données étiquetées, atteignant une précision de niveau supervisé avec une transparence totale.

2026-08-01

IA5 min read

Recherche

Six mots qui pourraient remodeler la manière dont les agents d'IA explorent et restent en sécurité : perturber, valider, courtier

Une architecture novatrice de cohorte d'agents hétérogènes sépare l'exploration divergente, le filtrage de sécurité à l'exécution et la récupération de connaissances inter-domaines en rôles spécialisés. Le Perturbateur génère des propositions à haute entropie, le Validateur impose des vérifications strictes des appels d'outils, et le Courtier importe des analogies hors domaine via une récupération de nouveauté contrastive. Les échecs d'exécution sont compilés en correctifs de contrainte signés appelés Scars, mis en cache pour les générations futures. Dans les évaluations, la cohorte a atteint 95% de découverte de cibles distantes, zéro violation exécutée, et 15,1% d'économies de jetons grâce aux Scars, avec une réduction de 55,9% des coûts sous contraintes de ressources via une allocation de bande passante basée sur le crédit.

2026-07-30

Outils & Frameworks3 min read

Recherche en IA

L'évolution des harnais semble impressionnante jusqu'à ce qu'on la teste sur des tâches inédites

L'évolution automatique des harnais est censée améliorer les agents LLM, mais un nouvel article soutient que de nombreux gains rapportés pourraient provenir d'un surapprentissage sur l'ensemble de test public. Dans les expériences, des méthodes simples de test-time scaling ont égalé ou surpassé l'évolution, et les harnais évolués ont montré une généralisation limitée à des tâches inédites.

2026-07-27

LLM & ModèlesFeatured4 min read

Recherche

Le fossé de supervision en RL agentique vient d'être comblé par le regard rétrospectif

SEED (Self-Evolving On-Policy Distillation) permet à un LLM d'analyser ses propres trajectoires passées, d'en extraire des compétences réutilisables en langage naturel après coup, puis de distiller ces leçons dans sa politique pendant le RL. Le résultat : une supervision plus dense et en politique qui améliore l'efficacité d'échantillonnage et se généralise à des tâches inédites.

2026-07-25

IA4 min read

Raisonnement à long terme

Un nouveau cadre aide les agents IA à se souvenir de ce qu'ils ont fait il y a cinq minutes

PRO-LONG est un cadre minimal qui aide les agents LLM à conserver et à récupérer des informations sur de longues séquences d'actions. Sur le benchmark ARC-AGI-3, il a amélioré les taux de réussite moyens de 18 points de pourcentage sur les modèles de pointe tout en utilisant 4,2 à 5,8 fois moins de jetons que les harnais existants. Avec Fable 5, il a atteint 97,4 % best@2 pour un coût d'inférence total de 1 750 $.

2026-07-24

IAFeatured3 min read

Recherche en IA

La technique bruyante qui empêche les agents LLM de s’effondrer en production

Les agents LLM actuels s’effondrent face à l’aléatoire du monde réel. NoisyAgent les expose à un bruit contrôlé pendant l’entraînement, améliorant à la fois la robustesse et les performances générales sur les benchmarks. L’article suggère que le domaine a surajusté des conditions parfaites.

2026-07-17

← PreviousPage 1 / 2 · 13 articlesNext →