SevenTnewSAI 与科技新闻,深度解读

arXiv预印本

4 published articles

实验室与研究4 min read

AI 研究

Muon 更快顿悟模加法,随后其解崩溃

经 Muon 训练的 Transformer 比 AdamW 更快顿悟模加法,但在每一种测试配置中都会丢失该解。论文将崩溃归因于表示-读出界面,冻结任一参数组即可阻止崩溃。傅里叶分析表明,任务电路依然存活,只是被投票压倒。

2026-08-19

实验室与研究3 min read

Fisher-R1 | 假设检验

AI智能体统计分析毫无差错,却仍得出错误结论

自动化假设检验的智能体能够完美地执行分析,却得出错误结论,因为大多数基准测试从不检查p值是否有效。一个包含425个任务的基准测试量化了这种差距,而一个经过强化学习训练的开放权重模型填补了其中一部分。

2026-08-19

AI代理4 min read

临床AI

nMAS自动化心力衰竭EHR特征工程,但仅在500名模拟患者上测试

nMAS是一个多智能体流水线,从500份模拟患者记录中生成132个结构化特征和70个按评分标准评分的特征,将留出验证的HFrEF表型识别AUROC从0.895提升至0.963。该预印本尚未在真实患者数据上得到验证。

2026-08-13

大语言模型与模型3 min read

人工智能研究

轻量监控控制器将量化LLM在MATH-500上的得分提升4.5个百分点

新研究提出了一种针对量化小型语言模型的外部监控控制器,可检测重复或退化的推理路径,并触发回滚及受限重新解码。在广泛的评估集上,准确率提升了4.5个百分点,但作者强调这一发现并非确证性。

2026-07-30