时间推理
3 published articles
人工智能4 min read
视频理解
Gemini 3.6 Flash 能数清状态变化,却漏掉眨眼
一项新的 arXiv 研究表明,视频语言模型在简单的事件记录任务上表现失败。Gemini 3.6 Flash 最多可正确计数 12 个持续性状态变化事件,但对瞬时眨眼没有可靠的计数区间;额外帧推高了准确率,却无法实现忠实的恢复,高计数场景下最终计数正确的比例仅为 0.2%。
2026-08-12
人工智能3 min read
TRACTA基准
基准测试发现:神经符号推理在时序任务上优于纯神经模型
TRACTA基准揭示,神经符号AI在三个时序推理任务上击败纯神经模型,在早期预警和模式检测任务上差距最大。
2026-08-02
人工智能4 min read
基准测试
牛津大学GauntletBench测试AI代理执行100个真实任务,它们失败了81%
牛津大学的GauntletBench对AI代理提出了100个具有挑战性的真实世界任务。前沿系统的成功率上限为19.1%,远低于人类表现。该基准测试针对五个专业应用中时间感知、图形理解和3D推理等被忽视的能力。
2026-07-01