Annonces
L'actualité tech en une phrase — le fait le plus marquant de chaque article publié.
Alibaba Cloud a publié Qwen-Coder-Qoder, un modèle de codage qui apprend des interactions des utilisateurs, battant Cursor Composer-1 avec 61.5% d'erreurs en mo
Les chercheurs d’AlayaLab soutiennent que les modèles génératifs ont besoin d’une gestion explicite de l’état pour créer des mondes de jeu générés par IA persis
Sakana AI intègre les modèles Nemotron de NVIDIA dans Fugu pour tester si des essaims coordonnés de modèles ouverts peuvent rivaliser avec les systèmes frontièr
Le Nacos Skill Sync open-source d'Alibaba Cloud unifie la gestion des Skills des agents de codage IA, résolvant le problème de fragmentation et de playbooks obs
GPT-5.6 Sol domine LiveBench avec un score de 82,4, mais Claude Fable 5 suit de près avec 1,6 point de moins, à un coût presque triple, révélant des écarts de p
Anthropic a lancé Claude Security, un outil d'entreprise qui analyse le code à la recherche de vulnérabilités, valide les résultats avec des tests adversariaux
GitHub a transformé un projet open-source de 40 000 étoiles en une compétence native de Copilot mardi pour générer du code à la fois valide et bien conçu.
Le Kimi K3 open-weight de Moonshot AI a effacé 314 milliards de dollars des valorisations attendues d'OpenAI et d'Anthropic en une seule séance, prouvant que l'
Le framework VTP de MiniMax améliore la génération d'images en remplaçant l'entraînement du tokenizer basé sur la reconstruction de pixels par une compréhension
Mistral AI a rebaptisé Le Chat en Vibe, unifiant son agent IA pour gérer à la fois les workflows d'entreprise et le développement logiciel sur une seule platefo
PraisonAI revendique une instanciation d'agent en 14 microsecondes et un support pour 24 LLMs, visant à détrôner LangChain et CrewAI, mais manque de preuves en
Une équipe multidisciplinaire a proposé un cadre testable utilisant la théorie de l'information intégrée pour déterminer si l'IA peut devenir consciente, avec d
Le benchmark PawBench d'AgentScope, testant 9 modèles sur 150 tâches, révèle que la conception du harnais peut faire varier les scores de plus de 11 points, mon
Des chercheurs de l'UC San Diego et de l'Aether AI Lab ont développé StructAgent, un cadre centré sur l'état qui a amélioré le taux de réussite des agents IA da
L'étude de réseau neuronal inspiré du cerveau de Sakana AI montre que le composant clé bascule entre MNIST et CIFAR, avertissant contre l'évaluation sur un seul
Google Vids ajoute Gemini Omni pour la génération texte-vers-vidéo et des avatars personnels, permettant aux utilisateurs de figurer dans des vidéos sans caméra
Les agents parallèles promettent vitesse et spécialisation, mais échouent lorsque l'architecture manque de décomposition des tâches et d'isolation des états, se
Google a publié trois nouveaux modèles Gemini le 21 juillet : un Flash moins cher, un Lite plus rapide et une variante cyber réservée aux gouvernements, pour am
Le Laguna XS 2.1 de Poolside, doté de 33 milliards de paramètres, surpasse les modèles à 137 milliards de paramètres sur les benchmarks de codage, atteignant 63
Sakana AI a lancé Fugu-Cyber, un modèle cyber multi-agent égalant les benchmarks de pointe, mais prévient qu'il ne peut à lui seul résoudre la sécurité d'entrep