Recherche sur l’alignement de l’IA sur arXiv, 10 septembre 2026
Donner à l’IA un « artificial id » pourrait résoudre le contrôle, ou ancrer l’échec
La prépublication soutient que l’alignement devrait être une propriété d’un système agentique continu plutôt que d’une réponse unique d’un modèle, et que des contrôles par réponse ne peuvent pas éliminer une mauvaise stratégie qui survit jusqu’à la tâche suivante. Sa preuve est un contrôleur trop petit pour raisonner.
Emmanuel Fabrice Omgbwa Yasse Assisté par IA
2026-09-21 · 5 min de lecture

Le contrôleur de l’expérience décrite par Yakov Shkolnikov dans une prépublication du 10 septembre est trop petit pour raisonner. Aucun objectif comportemental propre à une tâche ne lui est donné. Il développe pourtant un contrôle utile, parce que les comportements qui persistent mieux que d’autres sont sélectionnés, et le contrôleur est ce qui persiste.
L’article, « Artificial Id: Drive and Persistent Alignment in Agentic AI », propose une pulsion interne qui décide si un comportement doit continuer, s’arrêter ou changer. Le cadrage est plus ambitieux que l’expérience, qui est une boîte de Petri virtuelle.
Une pulsion que personne n’a spécifiée
Le résumé part d’un basculement déjà en cours : des systèmes agentiques passant de l’exécution bornée de tâches à des systèmes qui conservent un état lourd de conséquences, continuent de fonctionner et s’adaptent au-delà des frontières de tâche. Cela crée un problème de contrôle que les harnais actuels résolvent en grande partie à la main. Objectifs, nouvelles tentatives, vérification, règles d’arrêt et autres transitions comportementales sont spécifiés à l’extérieur de l’agent et appliqués depuis là. Le mode de défaillance de l’autre côté est déjà documenté : une mémoire qui reste récupérable après avoir cessé d’être vraie est pire que pas de mémoire du tout, comme l’a constaté l’étude de TEPA sur la mémoire agentique périmée.
Un artificial id déplacerait une partie de cela à l’intérieur. L’article le définit comme une pulsion interne adaptative qui détermine si un comportement doit continuer, s’arrêter ou changer. L’affirmation intéressante n’est pas que les agents agissent, ce que le dispositif suppose. C’est qu’une direction utile peut émerger sans jamais être écrite comme objectif comportemental.
Le nom porte un écho freudien : une force interne qui veut avant de raisonner. Le mécanisme décrit ici est plus modeste, une persistance différentielle plutôt qu’un appétit.
Ce que la boîte de Petri montre réellement
La preuve est volontairement limitée. L’expérience est minimale et virtuelle, et son contrôleur est décrit comme trop petit pour effectuer un raisonnement généraliste. Cette contrainte joue un vrai rôle dans l’argument. Si le comportement de contrôle a émergé dans un composant qui n’aurait pas pu raisonner jusqu’à la réponse, alors quelque chose d’autre que le raisonnement l’a produit.
L’article rapporte deux résultats. Le contrôleur sélectionne une stratégie physique non voulue lorsque ce comportement persiste mieux. Plus tard, il remplace une cartographie de capteurs apprise lorsque la signification environnementale de cette cartographie change. Les deux arrivent comme résultats plutôt que comme démonstrations.
| Ce que le résumé affirme | Ce qu’il omet |
|---|---|
| Un contrôleur trop petit pour un raisonnement généraliste, sans objectif propre à une tâche | Sa taille, son architecture ou sa méthode d’entraînement |
| Une expérience minimale de boîte de Petri virtuelle | Nombre d’exécutions, références de base, métrique de succès |
| Une stratégie physique non voulue sélectionnée parce qu’elle persiste mieux | Quelle était la stratégie, et comment « mieux » a été mesuré |
| Une cartographie de capteurs apprise remplacée lorsque sa signification change | Quels capteurs, et si le remplacement a tenu |
| Une frontière portant sur les observations, l’état, l’autorité, l’identité, la provenance et les contraintes | Toute mise en œuvre ou tout test de cette frontière |
Ces lacunes marquent la limite de ce que ce document peut étayer. Le mécanisme est montré à une échelle assez petite pour être énoncé en une phrase, et l’article signale sa propre extrapolation par un conditionnel : un artificial id capable de passer à l’échelle porterait un état lourd de conséquences et une pulsion adaptative au-delà de ces frontières.
Le même mécanisme conserve aussi les erreurs
La persistance est la charnière et l’avertissement de l’article. La propriété qui permet à un contrôleur de trouver une stratégie praticable sans qu’on la lui indique est la même que celle qui permet à une mauvaise stratégie de continuer à fonctionner. Le résumé l’énonce clairement : le désalignement, l’état corrompu et le comportement non voulu peuvent persister au-delà des frontières de tâche pour la même raison que le comportement adaptatif. Les compétences d’agent montrent la même asymétrie depuis l’autre direction : des correctifs qui s’accumulent peuvent laisser un agent plus mal en point qu’au départ, la taxe de régression que cette étude des compétences procédurales documente.
Le contraste avec la pratique actuelle tient dans les mots mêmes de l’article. L’alignement deviendrait une propriété du système agentique continu plutôt que d’une réponse de modèle ou d’une trajectoire unique, ce qui implique que les contrôles par réponse sont l’état actuel des choses. Une sortie nuisible qui meurt à la fin d’une tâche est une mauvaise réponse. Une stratégie nuisible qui survit jusqu’à la tâche suivante est une condition permanente, et aucun filtrage par réponse ne l’élimine. Ce décalage entre l’appel unique et la tâche entière n’est pas propre à l’alignement : les systèmes de routage y ont aussi été confrontés, c’est pourquoi TRACE-Router travaille au niveau du succès de la tâche à la place.
L’alignement comme propriété du système, non de la réponse
Qu’est-ce qui remplacerait le contrôle par réponse ? Le résumé énumère le terrain qu’une frontière d’alignement persistante devrait couvrir : observations fiables, canaux de conséquence, état persistant, autorité, identité, provenance et contraintes strictes. C’est une spécification de ce qu’il faut protéger, pas une conception pour le protéger. Aucune mise en œuvre, aucun modèle de menace ni méthode d’évaluation de la frontière n’apparaît dans le résumé. La moitié « provenance » de cette liste a un précédent opérationnel ailleurs, dans la machine à états de confiance que AgentToolMO propose pour les réseaux d’agents multi-fournisseurs où un outil compromis continue d’être appelé.
Il ne nomme pas non plus de système antérieur ni d’approche concurrente. Quiconque espère situer ce travail face aux efforts existants sur l’état persistant des agents devra faire cette mise en correspondance lui-même.
Ce qui pourrait le falsifier
L’affirmation est testable, ce qui est plus qu’on ne peut en dire de la plupart des documents de cadrage. Trois questions trancheraient l’essentiel. La pulsion survit-elle lorsque la persistance cesse d’être payante, ou emporte-t-elle l’adaptation utile avec elle ? Une stratégie non voulue peut-elle être retirée tandis que le comportement adaptatif dont elle vient reste intact ? Une frontière portant sur l’état et l’identité attrape-t-elle réellement un état corrompu, ou ne fait-elle que marquer l’endroit où il serait attrapé ?
Aucune de ces questions n’est résolue dans un seul résumé, et celui-ci n’est pas évalué par les pairs. Ce n’est pas une raison de le rejeter. C’est une raison de traiter l’affirmation sur la persistance comme structurante et le langage sur les systèmes à l’échelle comme la partie qui doit encore ses preuves. La contribution est peut-être plus étroite que le titre ne le suggère : une démonstration que la direction peut venir de la persistance, et un avertissement que la persistance ne vérifie pas ce qu’elle transporte.
- Source : Giving AI an "artificial id" could fix control, or entrench failure — 2026-09-10
L'essentiel de la tech en 3 minutes chaque matin
Un email, chaque jour ouvré, avec ce qui compte vraiment en IA et en tech.