SevenTnewS

瓶颈

阿里巴巴新基准证明AI智能体仍做不到的事:遵守规则

阿里巴巴的HSCodeComp基准揭示了差距:顶级AI智能体在关税分类上的准确率为49.4%,而人类专家为95%。瓶颈是结构性的,增加算力无济于事。

Emmanuel Fabrice Omgbwa Yasse AI 辅助

2026-07-19 · 阅读需 4 分钟

阿里巴巴新基准证明AI智能体仍做不到的事:遵守规则

在跨境贸易中,一个十位数协调制度编码的错位数字可能导致数千美元的关税误缴、通关延误或法律处罚。对于旨在处理复杂文档的AI智能体来说,这一现实世界的规则遵循测试暴露了一个更深层的弱点:它们无法可靠地应用分层、层级化的规则。你的AI代理意外通过了测试。现在有了评估标准。

阿里巴巴本周推出的HSCodeComp基准为这一差距给出了硬数据。表现最佳的AI智能体(也是阿里巴巴设计的基于Qwen的框架)在632个真实世界产品、32个类别上的准确率为65.0%。测试的最佳闭源智能体准确率为49.4%。人类专家:95.0%。how-alibaba-cloud-pushed-its-way-into-20-gartner-quadrants-and-what-it-means-for-the-ai-cloud-race

45个百分点的鸿沟

这一差距并非源于投入更多算力。论文的实验表明,广泛被推崇的推理时间缩放(一种提升推理能力的方法)并未改善HSCodeComp的性能。研究人员写道:“层级化规则推理需要一种新的架构方法,而不仅仅是增加算力。”这指向了一个远远超出海关清关范围的结构性瓶颈。验证地平线:为什么验证编码代理现在比构建它们更难

该基准迫使智能体从eWTP和官方海关裁决数据库等来源解释关税规则。规则是分层的:某个类别的基准关税,子类别的例外情况,针对材料或用途的进一步修改,以及贸易协定的条件性覆盖。语言往往模棱两可,逻辑隐晦。对于一个智能体来说,解析这个层级结构而不产生幻觉或忽略子规则是核心测试。而它失败了。IFBench:测试AI指令遵循能力的新基准

智能体出错的地方

论文指出了三种主要失败模式。第一,过度推理:智能体启动不必要的自我修正链,导致死循环。第二,推理幻觉:模型编造出在源文本中不存在的规则条件。第三,领域知识缺口:智能体缺乏人类专家多年积累的贸易分类惯例背景知识。the-1115-problem-when-ai-writing-challenges-become-a-test-of-editorial-integrity

在同行评审中,ACL领域主席称该基准为“一个在细分领域用于结构推理、规则遵循、领域定位和智能体失败诊断分析的丰富测试平台。”该论文在圣地亚哥举行的第64届计算语言学协会年会上获得最佳资源论文奖,这一荣誉专为开辟新研究方向的数据库和基准设立。

超越海关

其影响远不止贸易领域。层级化规则应用是法律合规、医疗诊断和税务审计的核心,这些领域中一个规则误用就会带来实际后果。保险理赔处理、监管申报和政府福利资格审核都遵循类似的结构化决策树。一个无法处理十位数海关编码的智能体,不太可能通过税务审计逻辑测试。

阿里巴巴自有的基于Qwen的智能体框架(专为数字海关清关设计)以65.0%的准确率领先基准。这比标准开源智能体(集中在30-40%)有大幅提升,但仍比人类专家低30个百分点。该框架是开源的,可在Hugging Face和GitHub上与HSCodeComp数据集一同获取。

智能体架构的新测试场

ACL奖项表明研究界将HSCodeComp视为严格的诊断工具。随着AI智能体从聊天界面进入企业工作流程,处理发票、路由客服工单、审计合规文档,应用层级化规则的能力成为成败关键。

论文发现增加算力无济于事,这对当前的推理方法尤为严厉。思维链、自一致性等依赖推理时间缩放的技术假设思考时间越长结果越好。HSCodeComp表明,对于层级化规则应用,更长的思考往往产生更多的幻化例外和更长、更脆弱的论证链。

目前,人类专家仍保持95%的桂冠。但基准划定了一个明确目标:任何能够弥合结构推理测试中30个百分点差距的智能体框架,都将展示出一种真正的新能力, , 一种在受分层法规约束的每个领域都具有直接商业价值的能力。

每天早晨用 3 分钟掌握科技要闻

每个工作日一封邮件,只讲真正重要的 AI 与科技动态。