IA
Intelligence artificielle : LLM, agents, diffusion, vision, NLP et les dernières nouvelles des grands laboratoires.
347 published articles
Benchmarks IA
GPT-5.4 en Tête du Classement des Benchmarks Mathématiques 2026 alors que les Scores de Frontière Saturent
GPT-5.4 devance ses rivaux en balayant les premières lignes de compétition mathématique, mais GPT-5.2 Pro égalise chaque cellule et GPT-5.3 Codex offre des scores presque identiques à moindre coût. Le véritable différenciateur : la performance des modèles sur les benchmarks de nouvelle génération comme FrontierMath et HMMT Fév 2026.
2026-07-01
Recherche en IA
Analyse au niveau des tokens : les LLM hybrides excellent sur les mots porteurs de sens, peinent sur les répétitions
Les chercheurs de l'Allen Institute for AI ont comparé Olmo 3 et Olmo Hybrid token par token, constatant que les hybrides excellent sur les mots porteurs de sens mais pas sur les tokens répétés. Les travaux suggèrent des pertes filtrées par tokens comme méthode d'évaluation plus riche pour les architectures de modèles de langage.
2026-07-01
Mise à jour de l'API
Anthropic augmente les limites de débit de l'API Claude et simplifie les paliers à trois niveaux
Anthropic augmente les limites de débit de l'API Claude pour Sonnet et Haiku, simplifie les paliers d'utilisation en trois niveaux (Starter, Development, Scale) et garantit qu'aucune organisation ne bénéficie de limites inférieures. Les modifications sont automatiques.
2026-07-01
Microsoft Build 2025
Microsoft Discovery désormais disponible en version générale pour les workflows d'IA agentique dans les sciences et l'ingénierie
Microsoft Discovery est désormais disponible en version générale, offrant aux organisations une plateforme pour construire et gouverner les workflows d'IA agentique pour la recherche scientifique et d'ingénierie. L'aperçu de l'application Microsoft Discovery vise à démocratiser la découverte pilotée par l'IA pour les experts métier.
2026-07-01
Référentiel
GauntletBench d'Oxford soumet les agents IA à 100 tâches réelles. Ils ont échoué dans 81 % d'entre elles.
Le GauntletBench d'Oxford soumet les agents IA à 100 tâches réelles difficiles. Les systèmes de pointe plafonnent à 19,1 % de succès, bien en dessous des performances humaines. Le référentiel cible des capacités négligées en perception temporelle, compréhension graphique et raisonnement 3D dans cinq applications professionnelles.
2026-07-01
Intelligence Artificielle
GPT-Live d'OpenAI cesse enfin d'attendre que vous ayez fini de parler
GPT-Live d'OpenAI introduit l'audio full-duplex, permettant à l'IA d'écouter et de parler en même temps. Elle peut dire « mhmm », attendre pendant les pauses et confier le raisonnement complexe à GPT-5.5 en arrière-plan, maintenant ainsi le flux de la conversation.
2026-07-01
Analyse du lancement Anthropic
Claude Sonnet 5 rend l'écart de prix avec Opus plus difficile à justifier
Claude Sonnet 5 promet un raisonnement et des performances agentiques proches de ceux d'Opus à un coût inférieur. Les premiers testeurs rapportent des améliorations spectaculaires dans l'exécution autonome de tâches et le suivi d'opérations complexes en plusieurs étapes. Avec un tarif de lancement jusqu'en août 2026, le modèle rend l'écart de prix avec Opus plus difficile à justifier.
2026-06-30
Lancement produit
Claude Sonnet 5 est là, et Anthropic mise sur la science et l'entreprise
Anthropic a publié Claude Sonnet 5, un modèle plus rapide et plus performant pour le codage et les agents, ainsi que Claude Science pour les chercheurs et Claude Tag pour les équipes. L'entreprise a également publié un cadre politique sur la croissance exponentielle de l'IA.
2026-06-30
Intelligence artificielle
Le nouveau modèle de DeepSeek place l'efficacité au cœur de la course à l'IA
DeepSeek a publié un nouveau LLM qui renforce sa compétition avec les grands laboratoires d'IA en misant sur l'efficacité plutôt que sur la force brute. Le modèle vise à offrir des performances solides avec une utilisation optimisée des ressources, reflétant un virage plus large du secteur vers une IA économique.
2026-06-30
contexte effectif, plafonds de sortie et l'impôt caché des longues fenêtres
Votre modèle d'IA prétend lire 1 million de tokens. Il ment. Voici les vrais calculs.
Les quatre LLM de pointe annoncent des contextes de 1M+ tokens, mais le rappel effectif, les limites de sortie et les coûts réels diffèrent considérablement. DeepSeek V4 Pro domine en matière de plafond de sortie et de coût, Gemini excelle sous 200K tokens, et Claude Opus remporte la palme du cache pour la revue de code interactive. Cette analyse détaille les chiffres d'avril 2026.
2026-06-30
Analyse des benchmarks d'agents
ProgramBench : tous les IA publiques obtiennent 0% au test de codage le plus difficile
ProgramBench met au défi les agents IA de reconstruire des programmes à partir de binaires seuls, sans code source ni description de problème. Tous les modèles publics échouent à résoudre complètement une tâche, exposant des faiblesses en exploration, architecture et jugement d'arrêt. Le benchmark est un test de résistance pour les agents de codage au-delà des workflows basés sur des correctifs.
2026-06-29
Données Synthétiques
Pas de patron, pas de goulot d'étranglement : pourquoi un cadre pair-à-pair repense la génération de données synthétiques
Matrix est un cadre décentralisé qui utilise des messages sérialisés transmis via des files d'attente distribuées pour la génération multi-agents de données synthétiques. En éliminant l'orchestrateur central, il atteint un débit 2 à 15 fois supérieur sur du matériel identique.
2026-06-06