SevenTnewS

multimodal

6 published articles

IA4 min read

Multimodal / Open Source

Le pack de plugins Qwen donne à votre agent de codage des yeux, des mains et une mémoire vidéo

L'équipe Qwen d'Alibaba a publié Qwen-MM-Plugins, une boîte à outils Apache-2.0 qui donne aux agents de codage des skills multimodaux natifs : lecture d'images et de vidéos en résolution dynamique, OCR, grounding, ASR, mémoire vidéo longue, génération vidéo et contrôle en client léger de Blender et FreeCAD. Un seul script l'installe sur Claude Code, Codex, Qoder, OpenClaw, Qwen Code et Gemini CLI.

2026-08-15

LLM & ModèlesFeatured4 min read

Sécurité de l’IA

Shieldstral, le classifieur 3B qui surclasse des modèles sept fois plus grands

Un classifieur de sécurité 3B égale des modèles de texte presque sept fois plus gros et établit un nouvel état de l'art en modération multimodale, selon un article arXiv de juillet 2026. L'astuce : une modération reformulée en question-réponse binaire, entraînée sur environ 54,1 millions d'échantillons.

2026-08-05

LLM & Modèles7 min read

Intelligence Artificielle

Ce qu'Inkling révèle sur la nouvelle ligne de partage du marché des modèles open-source

Inkling est le premier modèle ouvertement disponible de près de 1 000 milliards de paramètres avec entrée native audio, image et texte, aux côtés d'une fenêtre de contexte de 1 million de tokens et d'une variante quantifiée NVFP4. Les scores bruts des benchmarks sont solides, mais l'histoire la plus révélatrice est la manière dont l'écosystème open-source est passé d'un acteur de rattrapage à une concurrence active à la frontière, et où Inkling s'insère dans cette nouvelle carte.

2026-07-15

IA4 min read

État de l’art

Quinze articles sur la génération par IA révèlent trois évolutions plus importantes que n’importe quel modèle seul

Une série de 15 articles sur la génération par IA révèle trois évolutions plus importantes que n’importe quel modèle seul : les pipelines multimodaux sont devenus courants, l’orchestration agentique remplace l’enchaînement manuel, et la rétroaction en temps réel transforme la génération d’un pari en une conversation.

2026-07-11

IA3 min read

Intelligence Artificielle

MiniMax M3 brise le plafond des poids ouverts avec une accélération CUDA de 9,4x et zéro aide humaine

MiniMax M3 offre une accélération du noyau CUDA de 9,4x, bat Opus 4.7 sur BrowseComp et a reproduit de manière autonome un article ICLR. Le tout dans un package à poids ouverts.

2026-07-06

Open Source3 min read

Innovation open source

Le Moon Bot de Hugging Face transforme Slack en agent de codage, et ce n'est que cette semaine

Moon Bot apporte l'assistance au codage par IA directement dans les flux de travail Slack, tandis que VLX-Flow et VLX-Seek s'attaquent à la compréhension vidéo en temps réel et à la perception fine. Parmi les autres points forts, citons une recette de pré-entraînement d'encodeur médical, des expériences de distillation QLORA sur Qwen et un benchmark extraterrestre pour l'apprentissage automatique.

2026-06-29