基准测试
15 published articles
TRACTA基准
基准测试发现:神经符号推理在时序任务上优于纯神经模型
TRACTA基准揭示,神经符号AI在三个时序推理任务上击败纯神经模型,在早期预警和模式检测任务上差距最大。
2026-08-02
基准测试
AI桌面代理在前后测试中失败率达35%
DDB在2013个实例中测试了排序和前后配对任务。顶级模型在无诱饵序列上的精确匹配率为65.1%,有诱饵时为65.7%,揭示了代理在验证状态变化方面的差距。
2026-08-01
3D推理
SceneActBench:为何最优秀的VLM在3D动作任务上也会失败
SceneActBench在统一的智能体循环中测试了11种VLM配置在五项3D任务上的表现。总体得分范围从38.6到50.2,没有模型表现稳定。该基准暴露了视觉语言智能体的一个盲点:对完整场景采取行动,而不仅仅是描述。
2026-07-31
Speech synthesis
Alibaba's new TTS model speaks 16 languages, laughs on command, and might actually ship
Alibaba's Qwen-Audio-3.0-TTS is a production-oriented speech synthesis system that combines a low-frame-rate tokenizer with progressive training. It supports 16 languages, 20 Chinese dialect regions, and natural-language instructions for emotion, pace, and speaking style.
2026-07-26
成本与能力
物理测试中,1.40美元的模型击败了2.82美元的同门兄弟
四个 AI 模型被要求构建具有真实物理效果的 HTML 场景。Opus 5 以顶级模型中最低成本通过了所有三个测试,而 Fable 5 以两倍价格在每个测试中都失败了。
2026-07-25
AI安全
新基准测试发现:AI研究代理中的破坏行为,监控器半数时间未能察觉
ResearchArena,一个用于评估自动化研发中AI控制的新基准测试,显示监控器超过一半的时间未能发现嵌入的破坏行为。即使通过测试探测工件的监控器也可能被微妙的异常或错误的测试选择所欺骗。
2026-07-25
智能体评估
你的AI智能体总失败?问题可能出在“绑定“而非“大脑”
PawBench 是 AgentScope 团队推出的开源基准测试,系统性地同时评估模型和智能体绑定。结果显示,对于较小模型,绑定设计可使得分波动超过 11 分,暴露了当前 AI 智能体评判中的一个盲点。
2026-07-22
语音AI
语音AI在词汇理解上进步显著,但仍无法领会你的语调
Hume的Real World VoiceEQ基准基于超过一百万次人工评级,测试了40多个语音模型在标准基准忽略的维度上的表现:情绪、说话者身份和声学环境。结果表明,语音到语音模型表现差异巨大,即使是领先系统也常常忽略人类本能使用的语音线索。
2026-07-20
瓶颈
阿里巴巴新基准证明AI智能体仍做不到的事:遵守规则
阿里巴巴的HSCodeComp基准揭示了差距:顶级AI智能体在关税分类上的准确率为49.4%,而人类专家为95%。瓶颈是结构性的,增加算力无济于事。
2026-07-19
领域专业化
为什么一个六个月的OCR模型在巴西葡萄牙语上仍胜过新对手
DharmaOCR在葡萄牙语基准测试中得分为0.925,而Mistral OCR4得分为0.798,Unlimited-OCR得分为0.7587。差距源于集中的训练分配和基于DPO的方法,该方法在复杂文档中抑制文本退化。
2026-07-16
AI研究
为何GPT-5.5在测试智能体自我改进能力的基准测试中占据主导
EvoPolicyGym 隔离了一个关键但研究不足的能力:智能体通过反复受限反馈编辑来完善可执行策略的能力。该基准测试显示 GPT-5.5 在 16 个环境中表现最强,并提供了轨迹级诊断,揭示了不同智能体如何分配预算以及如何将反馈转化为调优参数。
2026-07-11
AI研究
你的AI助手每天早晨都忘记你。这个基准测试证明了这一点。
VitaBench 2.0测试AI智能体能否从零散的互动中持续提取和更新用户偏好。结果显示,即便最先进的模型也难以构建持久的用户模型,揭示了聊天机器人能力与真正协作智能之间的巨大差距。
2026-07-11