LLM推理
4 published articles
人工智能5 min read
测试时扩展
CoBa路由以58.9%更少的token追平best-of-16投票
CoBa,一篇新arXiv论文中提出的计算平衡路由策略,在0.01个百分点内追平best-of-16多数投票,同时将参数加权token削减58.9%。在跨MATH-500、AIME和AMC的3,129次评估中,它还完全胜过单样本解码,不过在预算不受限时,best-of-16仍保持微弱优势。
2026-08-19
人工智能Featured3 min read
开发者资源
驱动AI栈的30个GitHub仓库:从智能体到本地推理
一份实用的总结,列出了30个对AI开发者至关重要的GitHub仓库,按用例分组并按社区采用率排序。
2026-07-30
大语言模型与模型4 min read
系统优化
DSpark 揭示:快速 AI 推理是调度问题,而非模型技巧
DeepSeek 的 DSpark 论文揭示,简单的推测解码在高并发下会降低吞吐量。其解决方案, , 置信度调度的验证, , 根据每个请求调整块长度,并改变了服务性能的帕累托前沿。
2026-07-12
DeepSeek2 min read
大语言模型推理优化
Aleph Alpha 构建理论推理模型,从硬件原语解码 DeepSeek V3 性能
Aleph Alpha 的理论模型仅凭硬件参数即可预测 DeepSeek V3 的推理性能,揭示 GPU 数量和互连带宽如何改变计算、内存和通信之间的瓶颈。
2026-07-04