SevenTnewSAI 与科技新闻,深度解读

机器学习研究:推荐系统

所有顶尖线性推荐模型都可能归结为两种正则化器之一

一篇于2026年9月10日提交至arXiv的预印本论文认为,位居推荐基准榜首的线性模型都归结为两种正则化器之一,随后提出了两个低秩、闭式解的混合方案。

Emmanuel Fabrice Omgbwa Yasse AI 辅助

2026-09-20 · 阅读需 4 分钟

所有顶尖线性推荐模型都可能归结为两种正则化器之一

推荐系统研究已经产生了外观上毫无相似之处的各种架构。Dropout训练和自编码器,以及其他深度学习技术,如今在相同的基准上同台竞争,由此产生的若干模型位居这些排行榜榜首。一篇于2026年9月10日提交至arXiv的论文提出疑问:这种共同的成功是否只是巧合?

其答案是:从数学上看,这些领先模型做的无非是两件事之一。这篇论文, , “On the Regularization Landscape for the Linear Recommendation Models”, , 报告称,在标准推荐基准上,每一个性能领先的线性模型实际上都只加入了基于核范数的正则化器,或基于Frobenius范数的正则化器。训练技术各不相同,正则化器却并无二致。

这一主张比“所有推荐系统都一样”要窄,论文的标题本身也表明了这一点:它讨论的是线性模型。在这一范围内,该发现将一场架构竞赛重新表述为两种目标函数之间的选择。

统一性主张:核范数对Frobenius范数

论文从一个对关注这些基准的人来说并不陌生的谜题出发。其研究对象基于不同的深度学习技术构建,却取得相似的性能,甚至相似的代价函数。这可能是巧合。论文认为并非如此,并认为一旦考察目标函数所惩罚的范数,这些模型就可以统一在同一个框架之下。

两类模型从该框架中浮现。一类实际上加入了基于核范数的正则化器,这会促使拟合矩阵趋向低秩。另一类加入的是基于Frobenius范数的正则化器,不会如此。这一区别听上去像是技术细节,直到你顺着它推导到它所决定的东西:模型能有多强的表达能力,以及求解需要多少数值计算量。

单一框架之所以重要,有一个务实的理由。当基于不同技术构建的模型共享同一个代价函数时,它们已公布分数之间的差异就更难归因于那些区分彼此的技术。按论文的解读,共同要素是范数惩罚项,这样一来,留给上层其他部分去解释的性能差距就更小了。

权衡:刚性的低秩对高表达力的满秩

核范数模型带有一种论文称之为出人意料且刚性的结构。这种刚性限制了它们的预测能力。它们换回的是便利性:其解是低秩且闭式的,因此拟合模型可以直接写出,而无须通过迭代拟合得到。

相比之下,Frobenius范数模型被描述为在推荐任务上更具表达力、也更高效。它们的解要么是满秩的,要么需要论文所称难以调参的数值方法,ADMM就是其中之一。

闭式解与满秩处在一条便利性标尺的两端,论文也正是这样看待它们的。闭式解可以一次性求值。Frobenius范数家族中的数值方法带有论文所称难以设定的调参参数,这就把一项建模选择变成了一项工程任务。

两类模型都没有占据绝对优势。一类紧凑、易于求解,但预测能力有上限。另一类表达的内容更多,拟合成本也更高。这正是论文试图弥合的差距。

提出的混合方案:两个新的低秩闭式解

论文提出了两个解,二者既低秩又为闭式,它们来自摘要所称的对基于Frobenius范数的正则化器进行细致推广。其公开目标是在核范数与Frobenius范数两个世界中各取所长:既有第一类模型紧凑、可直接计算的解,又具备第二类模型的表达力。

方法解的形式表达能力求解方式
核范数正则化器低秩受限于论文所称出人意料的刚性结构闭式
Frobenius范数正则化器满秩在推荐任务上更具表达力、更高效满秩,或论文所称难以调参的ADMM等数值方法
提出的解(推广的Frobenius)低秩被描述为结合了两个家族的优势闭式

摘要未报告任何准确率数字、基准结果,也没有与论文开篇提到的模型进行对比。两个提出的解都没有与它们本要超越的领先模型进行衡量比较。混合方案的理由建立在推导之上。

什么能了结这场争论

如果这一统一性成立,那么在线性推荐中,架构的选择就不如被惩罚的范数重要,而推动如此多研究的排行榜,在某种程度上衡量的其实是一个目标函数。这一主张会影响一个团队在采用某个模型之前如何比较两个候选模型。

能了结此事的是这两个新解在基准上的准确率,并且要与它们本要超越的模型并列报告。在有人公布这些数据之前,这篇论文提供的只是一个框架和两个候选解,以及一个易于陈述却难以证伪的推论。至少对线性推荐模型而言,排行榜顶端的多样性或许只是包装问题。

每天早晨用 3 分钟掌握科技要闻

每个工作日一封邮件,只讲真正重要的 AI 与科技动态。