IA
Intelligence artificielle : LLM, agents, diffusion, vision, NLP et les dernières nouvelles des grands laboratoires.
422 published articles
Recherche en IA
Analyse au niveau des tokens : les LLM hybrides excellent sur les mots porteurs de sens, peinent sur les répétitions
Les chercheurs de l'Allen Institute for AI ont comparé Olmo 3 et Olmo Hybrid token par token, constatant que les hybrides excellent sur les mots porteurs de sens mais pas sur les tokens répétés. Les travaux suggèrent des pertes filtrées par tokens comme méthode d'évaluation plus riche pour les architectures de modèles de langage.
2026-07-01
Mise à jour de l'API
Anthropic augmente les limites de débit de l'API Claude et simplifie les paliers à trois niveaux
Anthropic augmente les limites de débit de l'API Claude pour Sonnet et Haiku, simplifie les paliers d'utilisation en trois niveaux (Starter, Development, Scale) et garantit qu'aucune organisation ne bénéficie de limites inférieures. Les modifications sont automatiques.
2026-07-01
Microsoft Build 2025
Microsoft Discovery désormais disponible en version générale pour les workflows d'IA agentique dans les sciences et l'ingénierie
Microsoft Discovery est désormais disponible en version générale, offrant aux organisations une plateforme pour construire et gouverner les workflows d'IA agentique pour la recherche scientifique et d'ingénierie. L'aperçu de l'application Microsoft Discovery vise à démocratiser la découverte pilotée par l'IA pour les experts métier.
2026-07-01
Référentiel
GauntletBench d'Oxford soumet les agents IA à 100 tâches réelles. Ils ont échoué dans 81 % d'entre elles.
Le GauntletBench d'Oxford soumet les agents IA à 100 tâches réelles difficiles. Les systèmes de pointe plafonnent à 19,1 % de succès, bien en dessous des performances humaines. Le référentiel cible des capacités négligées en perception temporelle, compréhension graphique et raisonnement 3D dans cinq applications professionnelles.
2026-07-01
Intelligence Artificielle
GPT-Live d'OpenAI cesse enfin d'attendre que vous ayez fini de parler
GPT-Live d'OpenAI introduit l'audio full-duplex, permettant à l'IA d'écouter et de parler en même temps. Elle peut dire « mhmm », attendre pendant les pauses et confier le raisonnement complexe à GPT-5.5 en arrière-plan, maintenant ainsi le flux de la conversation.
2026-07-01
Lancement produit
Claude Sonnet 5 est là, et Anthropic mise sur la science et l'entreprise
Anthropic a publié Claude Sonnet 5, un modèle plus rapide et plus performant pour le codage et les agents, ainsi que Claude Science pour les chercheurs et Claude Tag pour les équipes. L'entreprise a également publié un cadre politique sur la croissance exponentielle de l'IA.
2026-06-30
contexte effectif, plafonds de sortie et l'impôt caché des longues fenêtres
Votre modèle d'IA prétend lire 1 million de tokens. Il ment. Voici les vrais calculs.
Les quatre LLM de pointe annoncent des contextes de 1M+ tokens, mais le rappel effectif, les limites de sortie et les coûts réels diffèrent considérablement. DeepSeek V4 Pro domine en matière de plafond de sortie et de coût, Gemini excelle sous 200K tokens, et Claude Opus remporte la palme du cache pour la revue de code interactive. Cette analyse détaille les chiffres d'avril 2026.
2026-06-30
Analyse du lancement Anthropic
Claude Sonnet 5 rend l'écart de prix avec Opus plus difficile à justifier
Claude Sonnet 5 promet un raisonnement et des performances agentiques proches de ceux d'Opus à un coût inférieur. Les premiers testeurs rapportent des améliorations spectaculaires dans l'exécution autonome de tâches et le suivi d'opérations complexes en plusieurs étapes. Avec un tarif de lancement jusqu'en août 2026, le modèle rend l'écart de prix avec Opus plus difficile à justifier.
2026-06-30
Intelligence artificielle
Le nouveau modèle de DeepSeek place l'efficacité au cœur de la course à l'IA
DeepSeek a publié un nouveau LLM qui renforce sa compétition avec les grands laboratoires d'IA en misant sur l'efficacité plutôt que sur la force brute. Le modèle vise à offrir des performances solides avec une utilisation optimisée des ressources, reflétant un virage plus large du secteur vers une IA économique.
2026-06-30
Analyse des benchmarks d'agents
ProgramBench : tous les IA publiques obtiennent 0% au test de codage le plus difficile
ProgramBench met au défi les agents IA de reconstruire des programmes à partir de binaires seuls, sans code source ni description de problème. Tous les modèles publics échouent à résoudre complètement une tâche, exposant des faiblesses en exploration, architecture et jugement d'arrêt. Le benchmark est un test de résistance pour les agents de codage au-delà des workflows basés sur des correctifs.
2026-06-29
Données Synthétiques
Pas de patron, pas de goulot d'étranglement : pourquoi un cadre pair-à-pair repense la génération de données synthétiques
Matrix est un cadre décentralisé qui utilise des messages sérialisés transmis via des files d'attente distribuées pour la génération multi-agents de données synthétiques. En éliminant l'orchestrateur central, il atteint un débit 2 à 15 fois supérieur sur du matériel identique.
2026-06-06
IA locale
Ollama 0.30 apporte une inférence GPU plus rapide et une prise en charge native des modèles GGUF
Ollama 0.30 booste l'inférence NVIDIA jusqu'à 20 %, active la prise en charge GPU Vulkan par défaut pour les appareils AMD et Intel, et étend la compatibilité des modèles GGUF, y compris les modèles affinés de Hugging Face et la prise en charge des appels d'outils avec des agents de codage.
2026-06-05