实验室
研究、实验与开源:硬件、物联网、机器人、生物科技及边缘AI
47 published articles
消费硬件
CMF、Elektron与OhSnap:平价硬件胜过功能臃肿
CMF售价79美元的Clip Pro耳机、Elektron售价349美元的Model系列律动盒,以及OhSnap售价50美元的Snap Grip支架,都因坦然接受取舍而赢得The Verge的好评。同样的规律也出现在AR眼镜上。买家应当留意。
2026-08-23
财务推理基准
LLM 会背会计公式,FinIndices 却显示它们不会应用
LLM 能够背诵会计公式,但基于中国真实财务报表构建的基准 FinIndices 显示,它们在应用这些公式时颇为吃力。移除公式提示后,Gemini-3.1-Pro 的准确率从 70.70% 跌至 38.22%;生成表格这一动作本身还会明显削弱模型的推理能力。
2026-08-20
HDR10+ ADVANCED:三星与Prime Video率先推出
逐场景元数据能否修复运动平滑的坏名声?
从2026年8月起,Prime Video将成为首家在三星2026年款电视上采用HDR10+ ADVANCED的流媒体服务。该标准新增了增强整体亮度以及具备场景感知能力的智能运动平滑功能, , 这一在家庭影院中名声最差的设置,如今有了更智能的元数据支撑。
2026-08-11
教育中的 AI
AI 辅导工具过度帮助是设计使然。一项新基准量化了这一点
基于 462 次真实辅导环节的基准测试发现,AI 辅导工具默认会替学生完成学习任务。明确的提示词有帮助,但模型仍难以做出核心判断:何时推动、何时搭建脚手架、何时退后一步。
2026-08-10
语音智能体
为什么 Grok 4.1 Fast 在电话通话中胜过更智能的模型
综合排行榜为语音通话选错了大语言模型。BenchLM 的 2026 年排名将延迟放在首位:Grok 4.1 Fast 在 0.54 秒内作答,而最高分得主 Claude Opus 4.6 需要 1.78 秒。快速模型承担对话;推理模型留在后台工具调用中。
2026-08-05
AI评估
旧的AI基准测试已失效。以下是替代它们的方法。
像MMLU和GSM8K这样的静态基准测试已经饱和且受污染。行业已转向动态再生、专家级考试和智能体任务环境,以真实衡量AI能力。
2026-08-04
架构与云端
为什么你的IoT仪表盘显示的是昨天的数据,以及如何修复
大多数物联网监控平台并非在数据收集上失败,而是在可靠交付上失败。使用阿里云DataWorks的分层架构可自动化计划同步,消除重复和延迟等风险,无需自定义中间件即可保持仪表板最新。
2026-08-03
特别报道:AI评估
2026年AI基准测试现状:静态测试的崩溃与替代系统的构建
2026年AI基准测试全景深度巡览:MMLU、GSM8K和HumanEval为何失效,动态基准测试和专家级考试(如HLE和GPQA Diamond)如何取代它们,代理式测试和锯齿形智能测试揭示了什么,以及人类偏好、LLM评判和生成式可观测性如何完善整个评估堆栈。
2026-08-03
基准测试
新基准显示,前沿AI视觉模型在基础感知任务上表现不佳
PerceptionBench通过3000个问题测试十项原子视觉能力。没有前沿模型突破60%,相似的整体分数掩盖了截然不同的弱点分布。
2026-08-03
基准分析
LiveBench拒绝一成不变, , 这正是关键
LiveBench用不断更新的编程问题、代码库和预测问题池取代了固定的答案集,避开了削弱MMLU和GSM8K的数据污染问题。它是向动态评估更广泛转变的一部分,同行还包括LiveCodeBench、ForecastBench和LLMEval-Fair。
2026-08-03
模型评测
Qwen2.5-Omni:开源模型终于实现了竞品只承诺的功能
深入解读这个开源模型,它能同时处理文本、图像、音频和视频,并生成流式语音,在多项基准测试中超越GPT-4o-mini和Gemini,且通过量化可适配单张消费级GPU。
2026-08-03
基准分析
500万次投票,25个Elo分:深入解读无人能撼动的Chatbot Arena排行榜
LMSYS Chatbot Arena通过盲评人类偏好,以Elo量表对模型进行排名,目前近500万张选票将顶级实验室压缩在一个25分区间内。LLM-as-a-Judge方法虽然能扩展此类评估的规模,但其自身存在已记录在案的对冗长和顺序的偏见。
2026-08-02