SevenTnewS

IA multimodale

13 published articles

LLM & Modèles5 min read

IA à poids ouverts

dots3-note de Xiaohongshu : un MoE ouvert de 280B qui n'active que 16B

Le studio dots de Xiaohongshu a publié dots3-note preview, son premier modèle à poids ouverts : un MoE multimodal de 280B de paramètres, 16B actifs et une fenêtre de contexte de 512K. La conception sparse vise un faible coût d'inférence sur un nœud de 8 GPU, mais la fiche technique n'a pas encore publié de chiffres de benchmarks.

2026-08-20

LLM & Modèles5 min read

Génération vidéo

MiniMax a abandonné son architecture éprouvée pour que H3 fasse tout

MiniMax affirme que H3 unifie la génération de texte, d'image, de vidéo et d'audio dans un seul modèle, facture la sortie 2K à moins d'un tiers du prix des modèles grand public, et prévoit d'ouvrir les poids dans les prochains jours. Les petites lignes sont la véritable histoire : l'entreprise a abandonné l'architecture qui lui donnait un avantage pour y parvenir.

2026-08-07

Qwen / Alibaba4 min read

Qwen / Alibaba Cloud

Qwen2.5-Omni surpasse Gemini-1.5-Pro sur OmniBench et tient en moins de 12 Go

Le Qwen2.5-Omni open source d'Alibaba a surclassé Gemini-1.5-Pro sur OmniBench et a pris la tête du classement MMAU de raisonnement audio. Les versions quantifiées réduisent la VRAM sous 12 Go et la prise en charge de MNN apporte le chat vocal en temps réel sur les téléphones.

2026-08-07

IoT & Capteurs4 min read

Test de modèle

Qwen2.5-Omni : le modèle open-source qui tient enfin ce que ses concurrents promettent seulement

Analyse approfondie du modèle open-source qui traite simultanément texte, images, audio et vidéo tout en générant un flux de parole, surpassant GPT-4o-mini et Gemini sur plusieurs benchmarks, tout en tenant sur un seul GPU grand public avec quantification.

2026-08-03

Laboratoires & Recherche3 min read

Graph Foundation Models

Le transfert zero-shot sur les graphes a un angle mort multimodal. CHARM propose une solution

CHARM remplace les caractéristiques isolées des nœuds par des contextes de graphe structurés qui capturent la sémantique multimodale et les relations inter-modales. En mappant des motifs propres à chaque domaine à des concepts partagés de haut niveau, le modèle réalise un transfert zero-shot entre des graphes contenant du texte, des images et d'autres modalités.

2026-08-01

IA4 min read

Génération vidéo

MiniMax H3 sous-cote ses rivaux du secteur vidéo et prévoit des poids ouverts

MiniMax regroupe la génération d'images, de vidéo et d'audio dans un seul modèle, facture la sortie à moins d'un tiers des tarifs grand public par seconde et prévoit d'ouvrir les poids dans les prochains jours. La question ouverte reste de savoir si les sorties tiennent la route en dehors de ses propres démos.

2026-07-30

Qwen / Alibaba2 min read

Intelligence Artificielle

Le modèle 7B qui surpasse les plus grands, tourne sur un téléphone et change l'équation des coûts de l'IA

Le Qwen2.5-Omni d'Alibaba Cloud est un modèle 7B qui gère le texte, les images, l'audio et la vidéo, générant de la parole et du texte en temps réel. Son architecture Thinker-Talker et l'encodage positionnel TMRoPE permettent une interaction en streaming, et la variante 3B fonctionne sur des SoC mobiles comme le Snapdragon 8 Gen 1 à des vitesses utilisables.

2026-07-23

IA5 min read

IA multimodale

Le Qwen2.5-Omni d’Alibaba veut être le modèle qui entend, voit et parle, tout à la fois

Qwen2.5-Omni d’Alibaba Cloud traite texte, images, audio et vidéo de bout en bout, générant texte et parole naturelle en temps réel. Les benchmarks montrent qu’il surpasse ou égale souvent les modèles spécialisés, laissant entrevoir un virage vers des architectures unifiées.

2026-07-20

LLM & Modèles2 min read

IA multimodale

Un modèle de 12B bat un modèle de 90B. L'orthodoxie du scaling est en difficulté

Pixtral-12B égale ou bat des modèles sept fois plus grands sur des benchmarks multimodaux, sans sacrifier les performances linguistiques. Mistral publie également un nouveau benchmark ouvert pour l'évaluation pratique vision-langage, remettant en cause l'idée que plus grand est toujours meilleur.

2026-07-17

NLP & MLFeatured4 min read

IA physique

Le Qwen d'Alibaba est désormais le cerveau de 150 000 robots, voitures, lunettes et drones

La famille d'IA Qwen d'Alibaba alimente désormais plus de 150 000 appareils matériels, des robots humanoïdes aux caméras pour enfants, alors que l'entreprise pivote des chatbots vers l'IA physique, intégrant des modèles multimodaux dans des robots, voitures, lunettes et drones.

2026-07-14

LLM & ModèlesFeatured4 min read

Google DeepMind

Gemma 4 vient de donner l’impression que tous les autres modèles open-weight sont 10 fois trop gros

La famille open-weight nativement multimodale Gemma 4 de Google DeepMind introduit un mode de réflexion, une architecture sans codeur et des options MoE. Le modèle à 2,3 milliards de paramètres correspond aux performances du Gemma 3 à 27 milliards. Le modèle à 31 milliards domine les classements open-weight.

2026-07-13

LLM & Modèles2 min read

Alibaba Cloud

Le Spark Serverless EMR d'Alibaba Cloud traite désormais images et vidéos en SQL pur, sans Python nécessaire

Le Spark Serverless EMR d'Alibaba Cloud prend désormais en charge les images et les trames vidéo directement en SQL, permettant aux ingénieurs de données d'éviter la surcharge de Python. Une étude de cas sur le prétraitement de données de conduite autonome montre des pipelines ETL automatisés propulsés par les modèles de vision Qwen remplaçant l'annotation manuelle.

2026-07-09

← PreviousPage 1 / 2 · 13 articlesNext →