SevenTnewS

Référence IA

5 published articles

IA3 min read

Références en biosécurité

Les agents IA ont échoué à un test de surveillance des pathogènes. Cela devrait nous inquiéter

BioSecBench-Surveillance a testé seize configurations d'agents IA sur 100 tâches de surveillance génomique. Les meilleurs performants n'ont atteint qu'environ 50 % de précision. Les erreurs ne provenaient pas d'un mauvais choix de workflow mais des choix contextuels, références, seuils, filtres, que les humains prennent pour acquis.

2026-07-25

Tests & BenchmarksFeatured3 min read

Codage agentique

Comment Grok 4.5 a pris la tête du SWE Marathon, et ce que cela signifie pour les agents de codage

Grok 4.5 mène désormais le classement du SWE Marathon, battant Claude 4 Opus et GPT-5. Le benchmark teste de véritables compétences en génie logiciel : corrections de bugs, ajouts de fonctionnalités et compréhension du code dans des dépôts réels. Ce résultat redessine le paysage concurrentiel des agents de codage IA.

2026-07-20

IA3 min read

Analyse de recherche

Corruption de documents par l'IA dans les flux de travail délégués : ce que révèle un nouveau test de résistance

Le benchmark DELEGATE-52 évalue les systèmes d'IA sur des tâches d'édition de documents déléguées à long terme, constatant que les modèles de pointe accumulent une perte de fidélité sémantique de 19 à 34 % sur 20 itérations. Les flux de travail Python ont montré une dégradation moyenne inférieure à 1 %, mais l'étude souligne que la délégation fiable à long terme reste un défi ouvert.

2026-07-04

IA3 min read

Analyse approfondie d’un benchmark

ARC-AGI-2 : Le benchmark qui mesure l’intelligence fluide des systèmes d’IA

ARC-AGI-2 teste les systèmes d’IA sur l’intelligence fluide à travers des puzzles en grille visuelle qui ne peuvent pas être résolus par mémorisation. Les modèles de pointe atteignent désormais 75-85 %, mais le grand prix de 700 000 $ reste non réclamé. Voici une analyse approfondie de la conception, du score et du classement actuel du benchmark.

2026-07-01

Open Source2 min read

Open source

Le premier agent web open-source qui n'a pas besoin de HTML bat GPT-4o

Les agents MolmoWeb, disponibles en tailles 4B et 8B, ont été entraînés sur MolmoWebMix, un nouvel ensemble de données combinant plus de 130 000 démonstrations synthétiques et humaines. Ils surpassent les modèles fermés et établissent de nouvelles normes pour la recherche ouverte sur les agents web.

2026-04-10