LLM 基准测试
5 published articles
基准与测试5 min read
教育中的 AI
AI 辅导工具过度帮助是设计使然。一项新基准量化了这一点
基于 462 次真实辅导环节的基准测试发现,AI 辅导工具默认会替学生完成学习任务。明确的提示词有帮助,但模型仍难以做出核心判断:何时推动、何时搭建脚手架、何时退后一步。
2026-08-10
基准与测试5 min read
语音智能体
为什么 Grok 4.1 Fast 在电话通话中胜过更智能的模型
综合排行榜为语音通话选错了大语言模型。BenchLM 的 2026 年排名将延迟放在首位:Grok 4.1 Fast 在 0.54 秒内作答,而最高分得主 Claude Opus 4.6 需要 1.78 秒。快速模型承担对话;推理模型留在后台工具调用中。
2026-08-05
基准与测试Featured5 min read
AI评估
旧的AI基准测试已失效。以下是替代它们的方法。
像MMLU和GSM8K这样的静态基准测试已经饱和且受污染。行业已转向动态再生、专家级考试和智能体任务环境,以真实衡量AI能力。
2026-08-04
人工智能Featured4 min read
模型竞赛
LiveBench排行榜:边际收益渐微的研究
GPT-5.6 Sol以82.4的平均分在LiveBench上夺得总冠军,但Claude Fable 5仅落后1.6分,成本却高出近三倍。真正的故事在于下方梯队已经明显减少。
2026-07-22
工具与框架4 min read
框架与工具
微软新型可视化语言隐藏样板代码,让AI代理终于不再搞砸图表
微软研究院推出Flint,一种可视化中间语言,帮助LLM和AI代理创建精美图表,无需手动编码比例尺和坐标轴格式等底层参数。一项针对三个模型的研究显示,Flint优于直接生成Vega-Lite,并且已在该公司内部的Data Formulator中投入使用。
2026-07-08