arXiv预印本
4 published articles
实验室与研究4 min read
AI 研究
Muon 更快顿悟模加法,随后其解崩溃
经 Muon 训练的 Transformer 比 AdamW 更快顿悟模加法,但在每一种测试配置中都会丢失该解。论文将崩溃归因于表示-读出界面,冻结任一参数组即可阻止崩溃。傅里叶分析表明,任务电路依然存活,只是被投票压倒。
2026-08-19
实验室与研究3 min read
Fisher-R1 | 假设检验
AI智能体统计分析毫无差错,却仍得出错误结论
自动化假设检验的智能体能够完美地执行分析,却得出错误结论,因为大多数基准测试从不检查p值是否有效。一个包含425个任务的基准测试量化了这种差距,而一个经过强化学习训练的开放权重模型填补了其中一部分。
2026-08-19
AI代理4 min read
临床AI
nMAS自动化心力衰竭EHR特征工程,但仅在500名模拟患者上测试
nMAS是一个多智能体流水线,从500份模拟患者记录中生成132个结构化特征和70个按评分标准评分的特征,将留出验证的HFrEF表型识别AUROC从0.895提升至0.963。该预印本尚未在真实患者数据上得到验证。
2026-08-13
大语言模型与模型3 min read
人工智能研究
轻量监控控制器将量化LLM在MATH-500上的得分提升4.5个百分点
新研究提出了一种针对量化小型语言模型的外部监控控制器,可检测重复或退化的推理路径,并触发回滚及受限重新解码。在广泛的评估集上,准确率提升了4.5个百分点,但作者强调这一发现并非确证性。
2026-07-30