SevenTnewS

LLM 基准测试

5 published articles

基准与测试5 min read

教育中的 AI

AI 辅导工具过度帮助是设计使然。一项新基准量化了这一点

基于 462 次真实辅导环节的基准测试发现,AI 辅导工具默认会替学生完成学习任务。明确的提示词有帮助,但模型仍难以做出核心判断:何时推动、何时搭建脚手架、何时退后一步。

2026-08-10

基准与测试5 min read

语音智能体

为什么 Grok 4.1 Fast 在电话通话中胜过更智能的模型

综合排行榜为语音通话选错了大语言模型。BenchLM 的 2026 年排名将延迟放在首位:Grok 4.1 Fast 在 0.54 秒内作答,而最高分得主 Claude Opus 4.6 需要 1.78 秒。快速模型承担对话;推理模型留在后台工具调用中。

2026-08-05

基准与测试Featured5 min read

AI评估

旧的AI基准测试已失效。以下是替代它们的方法。

像MMLU和GSM8K这样的静态基准测试已经饱和且受污染。行业已转向动态再生、专家级考试和智能体任务环境,以真实衡量AI能力。

2026-08-04

人工智能Featured4 min read

模型竞赛

LiveBench排行榜:边际收益渐微的研究

GPT-5.6 Sol以82.4的平均分在LiveBench上夺得总冠军,但Claude Fable 5仅落后1.6分,成本却高出近三倍。真正的故事在于下方梯队已经明显减少。

2026-07-22

工具与框架4 min read

框架与工具

微软新型可视化语言隐藏样板代码,让AI代理终于不再搞砸图表

微软研究院推出Flint,一种可视化中间语言,帮助LLM和AI代理创建精美图表,无需手动编码比例尺和坐标轴格式等底层参数。一项针对三个模型的研究显示,Flint优于直接生成Vega-Lite,并且已在该公司内部的Data Formulator中投入使用。

2026-07-08