multimodal
6 published articles
Multimodal / Open Source
Le pack de plugins Qwen donne à votre agent de codage des yeux, des mains et une mémoire vidéo
L'équipe Qwen d'Alibaba a publié Qwen-MM-Plugins, une boîte à outils Apache-2.0 qui donne aux agents de codage des skills multimodaux natifs : lecture d'images et de vidéos en résolution dynamique, OCR, grounding, ASR, mémoire vidéo longue, génération vidéo et contrôle en client léger de Blender et FreeCAD. Un seul script l'installe sur Claude Code, Codex, Qoder, OpenClaw, Qwen Code et Gemini CLI.
2026-08-15
Sécurité de l’IA
Shieldstral, le classifieur 3B qui surclasse des modèles sept fois plus grands
Un classifieur de sécurité 3B égale des modèles de texte presque sept fois plus gros et établit un nouvel état de l'art en modération multimodale, selon un article arXiv de juillet 2026. L'astuce : une modération reformulée en question-réponse binaire, entraînée sur environ 54,1 millions d'échantillons.
2026-08-05
Intelligence Artificielle
Ce qu'Inkling révèle sur la nouvelle ligne de partage du marché des modèles open-source
Inkling est le premier modèle ouvertement disponible de près de 1 000 milliards de paramètres avec entrée native audio, image et texte, aux côtés d'une fenêtre de contexte de 1 million de tokens et d'une variante quantifiée NVFP4. Les scores bruts des benchmarks sont solides, mais l'histoire la plus révélatrice est la manière dont l'écosystème open-source est passé d'un acteur de rattrapage à une concurrence active à la frontière, et où Inkling s'insère dans cette nouvelle carte.
2026-07-15
État de l’art
Quinze articles sur la génération par IA révèlent trois évolutions plus importantes que n’importe quel modèle seul
Une série de 15 articles sur la génération par IA révèle trois évolutions plus importantes que n’importe quel modèle seul : les pipelines multimodaux sont devenus courants, l’orchestration agentique remplace l’enchaînement manuel, et la rétroaction en temps réel transforme la génération d’un pari en une conversation.
2026-07-11
Intelligence Artificielle
MiniMax M3 brise le plafond des poids ouverts avec une accélération CUDA de 9,4x et zéro aide humaine
MiniMax M3 offre une accélération du noyau CUDA de 9,4x, bat Opus 4.7 sur BrowseComp et a reproduit de manière autonome un article ICLR. Le tout dans un package à poids ouverts.
2026-07-06
Innovation open source
Le Moon Bot de Hugging Face transforme Slack en agent de codage, et ce n'est que cette semaine
Moon Bot apporte l'assistance au codage par IA directement dans les flux de travail Slack, tandis que VLX-Flow et VLX-Seek s'attaquent à la compréhension vidéo en temps réel et à la perception fine. Parmi les autres points forts, citons une recette de pré-entraînement d'encodeur médical, des expériences de distillation QLORA sur Qwen et un benchmark extraterrestre pour l'apprentissage automatique.
2026-06-29