深度学习的泛化理论简介
本文译自:http://www.offconvex.org/2018/02/17/generalization2/
译者:欧长坤
正如我们在博客上之前讨论的那样,深度学习有着太多秘密没有被理论解释。最近,许多 ML 理论学者开始对泛化之谜感兴趣:尽管这些网络拥有这比样本的数量更多的参数(经典的过拟合机制)但是为什么训练好的深度网络依然在新数据集上的表现如此优秀?Zhang 等人的《理解深度学习必须重新思考泛化性》一文成功将人们的注意力吸引到了这一富有挑战的问题上。他们的主要实验发现是,如果采用经典的卷积网络体系结构,比如 Alexnet,并在带有随机标签的图像上对其进行训练,那么仍然可以在训练数据上获得非常高的精度(此外,通常的 Regularization 策略则被认为能够提升泛化能力,但没有非常明显的帮助)。显然,训练过的网络是没有办法一直对新图片持续预测随机标签的,也就是说泛化能力不好。而这篇论文表明,在传统机器学习中, Rademacher 复杂度作为描述将分类器与带有随机标签的数据相匹配的工具,但其对样本复杂度并没有任何有意义的限制。我发现这篇论文写得很有意思,尽管这里已经介绍了这篇论文的核心部分,但我还是推荐阅读一下原文,并同时祝贺作者在 ICLR2017 上获得最佳论文奖。
但是,如果我没有在 Simons Institute 2017 年春季学期 做关于 ML 理论的报告,那就是我就太大意了。泛化理论的专家们对这篇论文——尤其是这篇论文的标题感到不满。他们认为,类似的问题已经在更简单的模型(例如 Kernel SVMs)的背景下做过广泛的研究了(说句公道话,那篇论文其实提到了这点),设计具有高 Rademacher 复杂度并在实际数据上训练后的结果表示泛化能力很好的 SVM 架构非常简单。更有甚者还发展了一些理论来解释这种泛化行为(以及类似于 boosting 的相关模型)。于此相关的是,一些 Behnam Neyshabur 及其合著者的几篇早期论文(这篇论文详细介绍了 Behnam 的论文)提出了与 Zhang 等人非常相似的关于深度网络的观点。
无论如何,我们都应该为 Zhang 等人的这篇论文来带的对核心理论关注度感到高兴。确实,Simons 学期学者们非常有激情的讨论自己的小组如何对付这一挑战:这些结果由 [Dzigaite, Roy](Dzigaite and Roy)、Bartlett, Foster 和 Telgarsky 和 Neyshabur, Bhojapalli, MacAallester, Srebro 近期公布。
在详细分析这些结果之前,我先介绍一些由 Zhang 等人论文产生的争议,这些争议是由于目前繁华理论是否是规范性或仅仅是描述性的基础性误解。这些误解来自于课堂里或者课本里关于泛化理论的标准处理手段,正如我在我毕业讨论班上发现的那样。
描述型理论 vs 规范型理论 为了展示他们的不同之处,考虑一个患者对他的主治医生说:『医生,我晚上经常很亢奋,但白天却困得不行』。
医生1(没有任何物理诊断):『哦,你失眠了』
我将这样的诊断称之为描述型(descriptive),因为它仅仅只是把标签对应到了患者的问题上,而没有给出任何关于如何解决这个问题的看法。相反:
医生2(进行物理诊断之后):『你的鼻窦导致睡眠时呼吸停止,移除它就可以解决问题。』
这样的诊断就是规范型(prescriptive)的。
