SevenTnewS

Grands modèles de langage

7 published articles

Tests & Benchmarks4 min read

Benchmark de raisonnement financier

Les LLM connaissent les formules comptables. FinIndices montre qu'ils ne savent pas les appliquer

Les LLM peuvent réciter des formules comptables, mais FinIndices, un benchmark construit sur de véritables états financiers chinois, montre qu'ils peinent à les appliquer. La précision de Gemini-3.1-Pro est passée de 70,70 % à 38,22 % lorsque les indices de formules ont été retirés, et la génération de tableaux a activement dégradé le raisonnement des modèles.

2026-08-20

Agents IA4 min read

Mémoire des agents

TEPA : pour les agents IA, une mémoire obsolète est pire que l'absence de mémoire

La mémoire des agents a un problème de falsifiabilité, soutient un nouveau préprint arXiv : les faits obsolètes restent récupérables et polluent le prompt. Son mécanisme TEPA révoque les mémoires dépassées, et lors des tests de dérive, la mémoire naïve a obtenu un score inférieur à celui de l'absence de mémoire (0.210 contre 0.309), tandis que TEPA a atteint 0.950.

2026-08-19

Qwen / Alibaba4 min read

Les poids ouverts de Qwen3.8-Max arrivent la semaine prochaine

Le modèle le plus puissant jamais conçu par Alibaba passe en open source

Qwen3.8-Max, le premier modèle open-weight de classe Max d'Alibaba à 2,4 billions de paramètres, débarque sur Hugging Face et ModelScope la semaine prochaine. Ce lancement reformule la question de l'open source : que se passe-t-il quand les poids les plus importants de la frontière sont libres à télécharger et à tester ?

2026-08-06

LLM & ModèlesFeatured3 min read

IA Open Source

Kimi K3 est le plus grand modèle open source jamais créé. Il n'est toujours pas le meilleur.

Kimi K3 est le plus grand modèle open source avec 2,8 billions de paramètres, mais il ne parvient pas à battre les meilleurs modèles propriétaires sur les benchmarks globaux. Bien qu'il excelle sur des tâches spécifiques de codage et d'agents, l'écart avec les leaders de pointe comme Claude Fable 5 et GPT 5.6 Sol expose les limites du passage à l'échelle sans percées architecturales et de données.

2026-07-27

IAFeatured4 min read

Philosophie de l’IA

Non, l’IA n’est pas un esprit rival. C’est une extension du nôtre

S’appuyant sur la phénoménologie de Husserl, des chercheurs soutiennent que les systèmes d’IA sont mieux compris comme des extensions de l’intelligence naturelle, et non comme des esprits autonomes. Cette perspective explique les hallucinations et les échecs de compositionalité tout en déplaçant les débats sur la sécurité des craintes d’une IA rebelle vers une ingénierie et une gouvernance responsables.

2026-07-09

Santé3 min read

Vie privée numérique

Votre IA vient d'écrire votre éloge funèbre en 17 diapositives. C'est le problème.

Un résumé de votre vie en 17 diapositives généré par IA ressemble à un gain de productivité, mais soulève des questions inconfortables sur combien nous concédons volontairement à des machines qui apprennent chacune de nos habitudes.

2026-07-07

NLP & ML4 min read

Données Synthétiques

Pas de patron, pas de goulot d'étranglement : pourquoi un cadre pair-à-pair repense la génération de données synthétiques

Matrix est un cadre décentralisé qui utilise des messages sérialisés transmis via des files d'attente distribuées pour la génération multi-agents de données synthétiques. En éliminant l'orchestrateur central, il atteint un débit 2 à 15 fois supérieur sur du matériel identique.

2026-06-06