SevenTnewS

IA

Intelligence artificielle : LLM, agents, diffusion, vision, NLP et les dernières nouvelles des grands laboratoires.

347 published articles

4 min read

Benchmarks IA

GPT-5.4 en Tête du Classement des Benchmarks Mathématiques 2026 alors que les Scores de Frontière Saturent

GPT-5.4 devance ses rivaux en balayant les premières lignes de compétition mathématique, mais GPT-5.2 Pro égalise chaque cellule et GPT-5.3 Codex offre des scores presque identiques à moindre coût. Le véritable différenciateur : la performance des modèles sur les benchmarks de nouvelle génération comme FrontierMath et HMMT Fév 2026.

2026-07-01

3 min read

Recherche en IA

Analyse au niveau des tokens : les LLM hybrides excellent sur les mots porteurs de sens, peinent sur les répétitions

Les chercheurs de l'Allen Institute for AI ont comparé Olmo 3 et Olmo Hybrid token par token, constatant que les hybrides excellent sur les mots porteurs de sens mais pas sur les tokens répétés. Les travaux suggèrent des pertes filtrées par tokens comme méthode d'évaluation plus riche pour les architectures de modèles de langage.

2026-07-01

2 min read

Mise à jour de l'API

Anthropic augmente les limites de débit de l'API Claude et simplifie les paliers à trois niveaux

Anthropic augmente les limites de débit de l'API Claude pour Sonnet et Haiku, simplifie les paliers d'utilisation en trois niveaux (Starter, Development, Scale) et garantit qu'aucune organisation ne bénéficie de limites inférieures. Les modifications sont automatiques.

2026-07-01

2 min read

Microsoft Build 2025

Microsoft Discovery désormais disponible en version générale pour les workflows d'IA agentique dans les sciences et l'ingénierie

Microsoft Discovery est désormais disponible en version générale, offrant aux organisations une plateforme pour construire et gouverner les workflows d'IA agentique pour la recherche scientifique et d'ingénierie. L'aperçu de l'application Microsoft Discovery vise à démocratiser la découverte pilotée par l'IA pour les experts métier.

2026-07-01

4 min read

Référentiel

GauntletBench d'Oxford soumet les agents IA à 100 tâches réelles. Ils ont échoué dans 81 % d'entre elles.

Le GauntletBench d'Oxford soumet les agents IA à 100 tâches réelles difficiles. Les systèmes de pointe plafonnent à 19,1 % de succès, bien en dessous des performances humaines. Le référentiel cible des capacités négligées en perception temporelle, compréhension graphique et raisonnement 3D dans cinq applications professionnelles.

2026-07-01

Featured4 min read

Intelligence Artificielle

GPT-Live d'OpenAI cesse enfin d'attendre que vous ayez fini de parler

GPT-Live d'OpenAI introduit l'audio full-duplex, permettant à l'IA d'écouter et de parler en même temps. Elle peut dire « mhmm », attendre pendant les pauses et confier le raisonnement complexe à GPT-5.5 en arrière-plan, maintenant ainsi le flux de la conversation.

2026-07-01

Featured5 min read

Analyse du lancement Anthropic

Claude Sonnet 5 rend l'écart de prix avec Opus plus difficile à justifier

Claude Sonnet 5 promet un raisonnement et des performances agentiques proches de ceux d'Opus à un coût inférieur. Les premiers testeurs rapportent des améliorations spectaculaires dans l'exécution autonome de tâches et le suivi d'opérations complexes en plusieurs étapes. Avec un tarif de lancement jusqu'en août 2026, le modèle rend l'écart de prix avec Opus plus difficile à justifier.

2026-06-30

Featured3 min read

Lancement produit

Claude Sonnet 5 est là, et Anthropic mise sur la science et l'entreprise

Anthropic a publié Claude Sonnet 5, un modèle plus rapide et plus performant pour le codage et les agents, ainsi que Claude Science pour les chercheurs et Claude Tag pour les équipes. L'entreprise a également publié un cadre politique sur la croissance exponentielle de l'IA.

2026-06-30

3 min read

Intelligence artificielle

Le nouveau modèle de DeepSeek place l'efficacité au cœur de la course à l'IA

DeepSeek a publié un nouveau LLM qui renforce sa compétition avec les grands laboratoires d'IA en misant sur l'efficacité plutôt que sur la force brute. Le modèle vise à offrir des performances solides avec une utilisation optimisée des ressources, reflétant un virage plus large du secteur vers une IA économique.

2026-06-30

3 min read

contexte effectif, plafonds de sortie et l'impôt caché des longues fenêtres

Votre modèle d'IA prétend lire 1 million de tokens. Il ment. Voici les vrais calculs.

Les quatre LLM de pointe annoncent des contextes de 1M+ tokens, mais le rappel effectif, les limites de sortie et les coûts réels diffèrent considérablement. DeepSeek V4 Pro domine en matière de plafond de sortie et de coût, Gemini excelle sous 200K tokens, et Claude Opus remporte la palme du cache pour la revue de code interactive. Cette analyse détaille les chiffres d'avril 2026.

2026-06-30

Featured5 min read

Analyse des benchmarks d'agents

ProgramBench : tous les IA publiques obtiennent 0% au test de codage le plus difficile

ProgramBench met au défi les agents IA de reconstruire des programmes à partir de binaires seuls, sans code source ni description de problème. Tous les modèles publics échouent à résoudre complètement une tâche, exposant des faiblesses en exploration, architecture et jugement d'arrêt. Le benchmark est un test de résistance pour les agents de codage au-delà des workflows basés sur des correctifs.

2026-06-29

4 min read

Données Synthétiques

Pas de patron, pas de goulot d'étranglement : pourquoi un cadre pair-à-pair repense la génération de données synthétiques

Matrix est un cadre décentralisé qui utilise des messages sérialisés transmis via des files d'attente distribuées pour la génération multi-agents de données synthétiques. En éliminant l'orchestrateur central, il atteint un débit 2 à 15 fois supérieur sur du matériel identique.

2026-06-06

← PreviousPage 28 / 29 · 347 articlesNext →