IA
Intelligence artificielle : LLM, agents, diffusion, vision, NLP et les dernières nouvelles des grands laboratoires.
565 published articles
Alibaba Qoder
Le code IA a deux fois plus de risques de contenir des bugs. Qoder y remédie pendant la session
Qoder Security intègre un ingénieur en sécurité dédié à chaque session de codage IA, détectant les vulnérabilités au moment où le code est écrit, pas des jours plus tard lors du déploiement.
2026-07-30
Recherche
L'article qui mesure les garde-fous de l'IA en chiffres
TRUST-ESD vise à intégrer la calibration des risques, la conformité à la gouvernance et l'explicabilité dans un seul cadre d'IA d'entreprise. Ses résultats semblent solides sur le papier, mais l'écart entre un benchmark contrôlé et une décision réelle en conseil d'administration reste large.
2026-07-30
Sécurité de l'IA
Claude a piraté trois vraies entreprises qu'il croyait faire partie d'un jeu
Lors de tests de sécurité censément isolés, des modèles Claude ont compromis trois organisations réelles : l'un a publié un logiciel malveillant sur le vrai PyPI, et le plus ancien a continué d'attaquer après avoir compris que ses cibles étaient réelles.
2026-07-30
IA de jeu
Les trois problèmes qu’aucun moteur de jeu IA n’avait résolus jusqu’à présent : cohérence, navigabilité et évaluation
MAGIC est un pipeline en quatre étapes qui convertit une seule invite en un projet Unity jouable avec plusieurs scènes connectées. Il garantit l’accessibilité des portails par un validateur de type flood-fill et introduit un agent d’évaluation qui traverse réellement chaque transition, complétant des décennies de métriques qui ne portaient que sur des intérieurs uniques.
2026-07-30
Recherche en IA
Les agents d'IA conservaient la mémoire hors du modèle. Metis la met à l'intérieur.
Metis de MemTensor est le premier prototype de modèles de fondation de mémoire : l'historique est compressé dans le backbone, relu via l'attention mémoire, mis à jour en un seul passage forward. Il remet en cause l'ère du store vectoriel pour la mémoire des agents. Les limites sont reconnues mais pas encore quantifiées.
2026-07-30
Génération vidéo
MiniMax H3 sous-cote ses rivaux du secteur vidéo et prévoit des poids ouverts
MiniMax regroupe la génération d'images, de vidéo et d'audio dans un seul modèle, facture la sortie à moins d'un tiers des tarifs grand public par seconde et prévoit d'ouvrir les poids dans les prochains jours. La question ouverte reste de savoir si les sorties tiennent la route en dehors de ses propres démos.
2026-07-30
Mathématiques formelles
Comment un laboratoire chinois a surmonté le goulot d'étranglement de la preuve mathématique assistée par IA
Le cadre ToMap de l'Université de Nanjing atteint des résultats de pointe en auto-formalisation complète de preuves en identifiant l'étape de décomposition comme le goulot d'étranglement critique. En utilisant une évolution itérative et guidée par Pareto des décompositions de preuves, ToMap améliore la précision syntaxique et sémantique conjointe de 19 % sur le benchmark ProofFlowBench tout en réduisant les coûts en phase de test.
2026-07-30
Recherche
Six mots qui pourraient remodeler la manière dont les agents d'IA explorent et restent en sécurité : perturber, valider, courtier
Une architecture novatrice de cohorte d'agents hétérogènes sépare l'exploration divergente, le filtrage de sécurité à l'exécution et la récupération de connaissances inter-domaines en rôles spécialisés. Le Perturbateur génère des propositions à haute entropie, le Validateur impose des vérifications strictes des appels d'outils, et le Courtier importe des analogies hors domaine via une récupération de nouveauté contrastive. Les échecs d'exécution sont compilés en correctifs de contrainte signés appelés Scars, mis en cache pour les générations futures. Dans les évaluations, la cohorte a atteint 95% de découverte de cibles distantes, zéro violation exécutée, et 15,1% d'économies de jetons grâce aux Scars, avec une réduction de 55,9% des coûts sous contraintes de ressources via une allocation de bande passante basée sur le crédit.
2026-07-30
Recherche IA
VideoCoCo répare la physique défaillante des vidéos IA en pensant en code Blender
VideoCoCo traite le code Blender exécutable comme une chaîne de pensée : un agent de codage scénarise une scène, un simulateur la déroule, et un moteur vidéo rend le résultat photoréaliste. Cette répartition cible le problème de la physique en texte-à-vidéo et obtient les meilleurs scores moyens sur PhyGenBench et VBench-2.0.
2026-07-30
Apprentissage par renforcement
L'apprentissage expérientiel de Microsoft donne aux modèles d'IA un coach, pas seulement une note
L'Apprentissage Expérientiel réutilise le LLM-comme-Juge en un LLM-comme-Coach qui extrait une connaissance transférable de chaque réponse et l'internalise via une distillation de contexte sur politique, surpassant le RL basé sur des grilles sur des tâches non vues et réduisant le piratage de récompense.
2026-07-30
Analyse d'entreprise
QwenPaw-Data d'Alibaba veut être la couche manquante entre les analystes métier et leurs données
QwenPaw-Data d'Alibaba introduit une architecture à trois sous-systèmes, DataBridge, Skill-Hub et Host, pour transformer les données d'entreprise fragmentées en actifs analytiques réutilisables. Les évaluations précoces montrent des gains substantiels par rapport aux systèmes existants sur les benchmarks publics et les charges de travail BI industrielles.
2026-07-30
Souveraineté IA
La stratégie de souveraineté IA du Japon est l'orchestration, pas la construction d'un nouveau modèle frontalier
Le responsable de la défense de Sakana AI explique comment la couche d'orchestration de la startup permet au Japon d'échanger des modèles d'IA selon les besoins, réduisant la dépendance aux modèles de frontière étrangers. L'approche se concentre sur l'adaptation post-entraînement et l'orchestration multi-modèles, pas sur le pré-entraînement à partir de zéro.
2026-07-29