compréhension vidéo
3 published articles
Multimodal / Open Source
Le pack de plugins Qwen donne à votre agent de codage des yeux, des mains et une mémoire vidéo
L'équipe Qwen d'Alibaba a publié Qwen-MM-Plugins, une boîte à outils Apache-2.0 qui donne aux agents de codage des skills multimodaux natifs : lecture d'images et de vidéos en résolution dynamique, OCR, grounding, ASR, mémoire vidéo longue, génération vidéo et contrôle en client léger de Blender et FreeCAD. Un seul script l'installe sur Claude Code, Codex, Qoder, OpenClaw, Qwen Code et Gemini CLI.
2026-08-15
Compréhension vidéo
Gemini 3.6 Flash compte les changements d'état mais ne détecte pas les clignements
Les modèles de langage vidéo échouent à la simple tenue de registre d'événements, selon une nouvelle étude arXiv. Gemini 3.6 Flash compte les changements d'état persistants jusqu'à 12 événements mais ne dispose d'aucune région de comptage positif fiable pour les clignements transitoires ; des images supplémentaires gonflent la précision sans récupération fidèle, avec seulement 0,2 % de comptes finaux corrects dans le régime à comptage élevé.
2026-08-12
IA Open Source
L'AV-Flamingo de Nvidia s'attaque à la compréhension des longues vidéos là où la plupart des modèles échouent
Nvidia publie AV-Flamingo, un grand modèle de langage audiovisuel open source conçu pour la compréhension de vidéos longues et complexes. Il utilise un programme d'apprentissage en trois étapes et un cadre de chaîne de pensée horodatée pour gérer le raisonnement temporel et cross-modal qui fait trébucher la plupart des modèles.
2026-07-28