SevenTnewS

Finance Agentique

La boîte noire de votre portefeuille est sur le point de s’ouvrir : dans les coulisses du premier tracker financier agentique en direct

NextFund enregistre chaque décision prise par un agent de trading IA sur les marchés en direct, permettant aux utilisateurs de comparer les modèles, d’inspecter les justifications et de diagnostiquer les défaillances. Un test sur huit LLM portant sur des actions américaines, chinoises et hongkongaises montre que des signaux intermédiaires similaires peuvent diverger en comportements de portefeuille nettement différents, et que les classements trimestriels basculent selon la métrique privilégiée.

Emmanuel Fabrice Omgbwa Yasse Assisté par IA

2026-07-27 · 6 min de lecture

La boîte noire de votre portefeuille est sur le point de s’ouvrir : dans les coulisses du premier tracker financier agentique en direct
Sources : NextFund: A Uni…

Les grands modèles de langage écrivent désormais des transactions, et non plus seulement des rapports de résultats. Mais les outils permettant de juger s’ils le font correctement sont restés bloqués dans l’âge des ténèbres : quiz statiques et rendements de portefeuille terminaux qui ne révèlent rien sur la manière dont un ordre a été passé. Une plateforme publiée cette semaine par Paradoox AI Research vise à changer cela.

NextFund couple les flux de marché en direct de Hong Kong, des États-Unis et des actions A chinoises avec une journalisation persistante de bout en bout de chaque observation, de chaque signal d’analyste et de chaque action exécutée. Elle inclut également une arène de trading web qui permet aux utilisateurs de passer des scores du classement à la justification textuelle derrière un ordre d’achat ou de vente d’un seul jour. La démo est en ligne sur paradoox.cn/nextfund/.

Trois lacunes que la plateforme comble

L’article détaille trois problèmes structurels que partagent les systèmes d’évaluation de la finance agentique existants. Premièrement, la plupart des benchmarks testent des connaissances statiques ou ne rapportent que le profit et la perte finaux, laissant les preuves intermédiaires et les étapes d’exécution invisibles. Deuxièmement, lorsqu’un agent manipule mal un outil ou s’écarte de son mandat, les développeurs ne peuvent souvent pas déterminer si la faute réside dans la récupération, l’analyse, la synthèse ou l’exécution. Troisièmement, les journaux de décisions, les cas d’erreur et les historiques d’appels d’outils sont systématiquement supprimés après une exécution, de sorte que les institutions accumulent peu de données réutilisables pour les révisions ultérieures des invites ou l’adaptation des modèles.

NextFund aborde ces trois problèmes en intégrant un suivi par écriture directe dans le flux de travail multi-agents. Chaque fois qu’un analyste émet un signal ou que le gestionnaire de décision engage une allocation cible, l’enregistrement, ainsi que sa justification et le contexte de l’invite, est immédiatement persisté sous une horodatage partagé.

Ce que révèlent les premiers tests en direct

Les auteurs ont fait fonctionner huit LLM de pointe, DeepSeek-V4-Flash, DeepSeek-V4-Pro, Gemini-3.5-Flash, GLM-5.1, GPT-5.4-Mini, Kimi-K2.6, MiniMax-M3 et Qwen3.5-Flash, à travers la même pile multi-agents, le même univers et les mêmes contraintes au cours des T1 et T2 2026. Les résultats dressent un tableau bien plus nuancé que ce qu’une seule métrique peut capturer.

Sur les actions américaines au T1, tous les modèles ont perdu de l’argent. Kimi-K2.6 s’est le plus approché de l’équilibre avec un rendement de -2,89 %, tout en enregistrant la meilleure volatilité (5,04 %) et le meilleur drawdown (-4,39 %). DeepSeek-V4-Flash avait le ratio de Sharpe le moins négatif. Au T2, la situation s’est inversée : Qwen3.5-Flash a mené en rendement à 12,23 %, mais GPT-5.4-Mini a dominé sur le Sharpe (3,16), la volatilité (13,03 %) et le drawdown (-6,36 %). La leçon est claire : un modèle à rendement plus élevé n’est pas automatiquement le plus efficace, le plus stable ou le moins actif.

La comparaison entre modèles sur le même flux d’entrée donne un résultat encore plus frappant. En comparant Kimi-K2.6 et Qwen3.5-Flash sur les données américaines du T1, les signaux des analystes concordaient sur environ 92,9 % des cas, ce qui signifie que les deux modèles produisaient des vues spécialisées similaires à partir des mêmes prix et résumés d’actualités. Mais les actions finales d’achat/vente/maintien concordaient seulement sur 36,4 % des jours-titres. Kimi-K2.6 est resté conservateur (396 maintiens, 29 achats, 23 ventes), tandis que Qwen3.5-Flash a tradé de manière beaucoup plus agressive (152 maintiens, 160 achats, 136 ventes). Des preuves intermédiaires similaires n’impliquent pas un comportement de portefeuille similaire, un mode de défaillance que les seuls chiffres de P&L terminaux ne peuvent pas révéler.

Le schéma se vérifie sur tous les marchés. Sur les actions A chinoises, GLM-5.1 a mené en rendement au T1 avec 9,76 %, tandis que Kimi-K2.6 a mené en Sharpe. À Hong Kong, Kimi-K2.6 a affiché un rendement de 30,94 % au T1 avec un Sharpe de 3,21, mais Gemini-3.5-Flash a pris la tête au T2 avec un rendement de 23,41 %. Le même protocole donne des classements qualitativement différents sur chaque place, confirmant qu’un suivi inter-marchés est nécessaire pour une comparaison équitable.

L’inspection de type arène comme outil de diagnostic

Là où NextFund innove le plus, c’est dans la couche d’inspection qu’il fournit. L’Arène de Modèles permet aux utilisateurs de sélectionner un marché, une période d’évaluation et un ensemble d’exécutions de modèles à comparer côte à côte. Les courbes de capitaux propres, le Sharpe, la volatilité, le drawdown et le turnover sont présentés ensemble, et chaque exécution est liée à sa trace d’exécution complète. Un utilisateur qui remarque, par exemple, qu’un modèle a un rendement plus élevé mais un turnover plus élevé peut cliquer dans la vue de suivi détaillé pour voir si la différence provient d’actions plus fréquentes ou de choix d’allocation différents.

Au niveau des décisions, chaque jour de trading et chaque titre sont liés aux sorties des spécialistes, aux décisions du gestionnaire de portefeuille, aux actions exécutées et aux justifications textuelles le long d’une chronologie partagée. Les traces alignées permettent aux inspecteurs de déterminer si deux agents ont divergé lors de l’analyse en amont, de la synthèse des décisions ou de l’exécution. Les auteurs illustrent cela avec une comparaison concrète du T1 : la position conservatrice de Kimi-K2.6 semble être motivée non pas par des signaux d’analystes différents mais par une étape de synthèse différente. Le gestionnaire de décision de Kimi-K2.6 a pondéré le risque par rapport à la conviction, tandis que celui de Qwen3.5-Flash a pondéré la conviction par rapport au risque.

Ce qui manque encore

La version actuelle se concentre sur le rééquilibrage d’actions sur trois marchés avec un pool d’analystes fixe. Le support des produits dérivés, des couvertures multidevises et des règles de conformité plus riches est laissé aux travaux futurs. Même avec des horloges synchronisées et des journaux structurés, les justifications textuelles peuvent rester incomplètes ou seulement partiellement alignées sur le calcul latent du modèle. Un examen humain reste nécessaire pour les décisions importantes. L’évaluation en direct dépend également de flux de marché tiers dont les licences peuvent interdire la redistribution des données brutes ; les artefacts publics mettent l’accent sur les schémas, les traces et les interfaces plutôt que sur des dumps de données propriétaires.

NextFund est conçu comme une aide à l’audit et à la comparaison, et non comme un conseiller en investissement. Les auteurs sont explicites à ce sujet : les résultats de démonstration ne doivent pas être la seule base pour des décisions d’investissement ou réglementaires, et les utilisateurs doivent examiner la provenance, les historiques de décisions et les indicateurs de risque tout en interprétant les résultats du classement comme des preuves comparatives dans le cadre d’un protocole défini plutôt que comme des prévisions de performances futures.

Un substrat pour l’amélioration systématique

Peut-être le choix de conception le plus important est-il que les traces sont complètes, alignées dans le temps et réutilisables. Le même substrat qui permet la comparaison entre modèles et l’attribution des défaillances fournit également matière à révision des invites, adaptation supervisée et apprentissage par renforcement. Les décisions et résumés historiques peuvent être relus dans les exécutions ultérieures comme mémoire, fermant la boucle entre l’enregistrement et le raisonnement.

Alors que les agents basés sur les LLM passent des démos de recherche aux workflows de gestion de portefeuille, l’écart entre la promesse d’un modèle et son comportement vérifiable deviendra la question de gouvernance centrale pour les adoptants institutionnels. NextFund ne résout pas cette question, mais il fournit la première infrastructure pour la poser systématiquement, et cela seul pourrait être sa contribution la plus précieuse.

L'essentiel de la tech en 3 minutes chaque matin

Un email, chaque jour ouvré, avec ce qui compte vraiment en IA et en tech.