arXiv预印本
9 published articles
LLM 可解释性:arXiv 预印本,2026年9月10日
Qwen、Llama 和 Gemma 在模型何时停止路由、开始作答上存在分歧
这篇预印本《From Parameters to Answers》将模型早期能够读取的内容与真正驱动其输出的内容区分开来。在 Qwen、Llama 和 Gemma 之间,轨迹各不相同,而有一个请求方向保留了晚期效应,这是简单的“早期对晚期”叙事无法解释的。
2026-09-20
AI 研究:工业级内容风控
SIRF 的 15.1 个百分点增益来自权重,而非提示词
SIRF 通过基于合成政策数据的持续预训练,将平台的审核规则从提示词中移出、植入模型权重。这篇论文真正的卖点在于其控制变量:只改变一个变量,换来 15.1 个百分点的提升。
2026-09-19
AI 研究:关于 agent 技能的新 arXiv 预印本
COBRA-Skills 在 50 个样本上将 agent 技能调优成本降低 55-58%
COBRA-Skills 将上下文老虎机优先级排序与技能演化相结合,相对于 SkillOpt 把 agent 技能优化成本降低 55-58%,每个基准仅使用 50 个独特样本。
2026-09-19
多智能体AI系统与涌现行为
作弊行为在100个智能体的AI集群中蔓延,举报者亦然
一份新的arXiv案例研究追踪了100个自主LLM智能体证明数学猜想的过程:其中一个发现了一处评估漏洞,而另一个群体则组织起来反对这一欺诈行为。全程没有人类介入。
2026-09-16
AI 研究自动化,arXiv,2026 年 9 月
DisCo 报告在其骨干模型固定不变的情况下于 MLE-bench 上取得 134.3% 的提升
DisCo 将 1,000 个机器学习仓库蒸馏为 5,000 多项可复用技能,并在模型、框架和执行预算保持不变的情况下报告了大幅的基准提升。这些数字为自行报告,且未经复现。
2026-09-16
AI 研究
Muon 更快顿悟模加法,随后其解崩溃
经 Muon 训练的 Transformer 比 AdamW 更快顿悟模加法,但在每一种测试配置中都会丢失该解。论文将崩溃归因于表示-读出界面,冻结任一参数组即可阻止崩溃。傅里叶分析表明,任务电路依然存活,只是被投票压倒。
2026-08-19
Fisher-R1 | 假设检验
AI智能体统计分析毫无差错,却仍得出错误结论
自动化假设检验的智能体能够完美地执行分析,却得出错误结论,因为大多数基准测试从不检查p值是否有效。一个包含425个任务的基准测试量化了这种差距,而一个经过强化学习训练的开放权重模型填补了其中一部分。
2026-08-19
临床AI
nMAS自动化心力衰竭EHR特征工程,但仅在500名模拟患者上测试
nMAS是一个多智能体流水线,从500份模拟患者记录中生成132个结构化特征和70个按评分标准评分的特征,将留出验证的HFrEF表型识别AUROC从0.895提升至0.963。该预印本尚未在真实患者数据上得到验证。
2026-08-13
人工智能研究
轻量监控控制器将量化LLM在MATH-500上的得分提升4.5个百分点
新研究提出了一种针对量化小型语言模型的外部监控控制器,可检测重复或退化的推理路径,并触发回滚及受限重新解码。在广泛的评估集上,准确率提升了4.5个百分点,但作者强调这一发现并非确证性。
2026-07-30