SevenTnewS

arXiv

18 published articles

Vision & Diffusion4 min read

Vision par ordinateur, modèles du monde et recherche en IA

PhiZero : apprendre à l'IA vidéo à raisonner en physique avant le rendu

PhiZero, un modèle du monde du CASIA, apprend un « langage physique » discret et compact à partir de vidéos brutes et l'utilise pour raisonner sur la manière dont une scène va évoluer avant de générer les images. Les auteurs soutiennent que cette conception « raisonner puis rendre » produit des vidéos physiquement plus cohérentes que la prédiction directe des pixels.

2026-07-31

Vision & Diffusion4 min read

Recherche IA

VideoCoCo répare la physique défaillante des vidéos IA en pensant en code Blender

VideoCoCo traite le code Blender exécutable comme une chaîne de pensée : un agent de codage scénarise une scène, un simulateur la déroule, et un moteur vidéo rend le résultat photoréaliste. Cette répartition cible le problème de la physique en texte-à-vidéo et obtient les meilleurs scores moyens sur PhyGenBench et VBench-2.0.

2026-07-30

IA3 min read

Intelligence Artificielle

De meilleurs détecteurs d’IA pourraient inciter les gens à utiliser davantage l’IA, pas moins

Des détecteurs d’IA imparfaits peuvent fausser les incitations des utilisateurs, conduisant à une utilisation accrue de l’IA et à des résultats de moindre qualité. Les conclusions de l’article remettent en question l’hypothèse naïve selon laquelle les outils de détection réduisent proprement le contenu généré par machine.

2026-07-26

Tests & Benchmarks4 min read

Benchmark

Le fossé entre les LLM et la méthode scientifique : un nouveau benchmark révèle que les modèles peuvent décrire des données mais pas raisonner à travers elles

SDABench, un nouveau benchmark orienté vers les capacités, couvrant six compétences fondamentales de raisonnement scientifique et cinq domaines, teste 15 LLM et constate que les modèles sont performants sur l’analyse descriptive mais s’effondrent sur les tâches inférentielles et causales. L’article propose un cadre d’analyse d’erreurs en cinq étapes pour localiser les échecs.

2026-07-25

LLM & Modèles4 min read

Recherche en IA

Quatre personnalités, une réponse : pourquoi le raisonnement hétérogène vient de battre la meilleure IA au test le plus difficile de l’humanité

PoTRE divise l’inférence en quatre agents travaillant en parallèle, puis concilie leurs réponses de manière dynamique. Il atteint 49,92 % sur l’Examen Final de l’Humanité, surpassant le meilleur précédent officiel. L’approche fonctionne avec moins de tokens que les baselines mises à l’échelle.

2026-07-24

NLP & MLFeatured4 min read

Recherche en IA

Pourquoi GPT-5.5 domine un benchmark qui teste comment les agents s'améliorent eux-mêmes

EvoPolicyGym isole une capacité critique mais peu étudiée : la capacité d'un agent à affiner une politique exécutable par des modifications répétées sous contrainte de rétroaction. Le benchmark révèle GPT-5.5 comme le plus performant dans 16 environnements, et fournit des diagnostics au niveau des trajectoires qui exposent comment différents agents allouent leur budget et convertissent la rétroaction en paramètres ajustés.

2026-07-11

← PreviousPage 3 / 2 · 18 articlesNext →