raisonnement temporel
3 published articles
Compréhension vidéo
Gemini 3.6 Flash compte les changements d'état mais ne détecte pas les clignements
Les modèles de langage vidéo échouent à la simple tenue de registre d'événements, selon une nouvelle étude arXiv. Gemini 3.6 Flash compte les changements d'état persistants jusqu'à 12 événements mais ne dispose d'aucune région de comptage positif fiable pour les clignements transitoires ; des images supplémentaires gonflent la précision sans récupération fidèle, avec seulement 0,2 % de comptes finaux corrects dans le régime à comptage élevé.
2026-08-12
Benchmark TRACTA
Le raisonnement neuro-symbolique surpasse les modèles neuronaux bruts sur les tâches temporelles, selon un benchmark
Le benchmark TRACTA révèle que l'IA neuro-symbolique bat les modèles neuronaux bruts sur trois tâches de raisonnement temporel, avec les plus grandes marges sur l'alerte précoce et la détection de motifs.
2026-08-02
Référentiel
GauntletBench d'Oxford soumet les agents IA à 100 tâches réelles. Ils ont échoué dans 81 % d'entre elles.
Le GauntletBench d'Oxford soumet les agents IA à 100 tâches réelles difficiles. Les systèmes de pointe plafonnent à 19,1 % de succès, bien en dessous des performances humaines. Le référentiel cible des capacités négligées en perception temporelle, compréhension graphique et raisonnement 3D dans cinq applications professionnelles.
2026-07-01