致交·论道·回顾 | 人工智能的尺度泛化

发布时间:2026-09-24 阅读次数:7

 

 

致交·论道

 

9月23日,致远学院明德书屋工作室举办了“论道”系列讲座。本期活动邀请刘方辉副教授围绕人工智能快速发展背景下的重要理论问题——模型规模扩展与泛化能力之间的关系展开报告。活动希望帮助同学们理解大模型背后的数学规律,同时引导大家思考人工智能对科学研究范式、学科发展以及个人成长路径带来的影响。

刘方辉老师作专题分享

 

讲座内容

刘老师首先回顾了深度学习的发展历程。自2012年前后深度学习取得突破以来,神经网络模型规模不断扩大,从早期较小规模模型逐渐发展到Transformer架构和当前的大语言模型。人工智能领域长期存在一个直观认识:模型越大,性能可能越强。

然而,“大模型为什么有效”并不是一个简单的问题。传统统计学习理论通常认为,模型复杂度增加会带来更高的过拟合风险,因此需要在模型表达能力和泛化能力之间寻找平衡。但深度学习实践中出现了大量模型参数超过训练数据规模的情况,即所谓过参数化区域,而模型依然能够在新的任务和数据上表现出较好的泛化能力。刘老师指出,这一现象促使研究者重新思考“模型规模”这一概念。人工智能中的尺度泛化问题,本质上是在研究:随着模型大小、数据规模以及计算资源不断增加,模型性能是否存在稳定规律,以及这些规律背后的数学机制。

刘方辉老师讲解大模型发展历程

报告中,刘老师通过多项式拟合的直观例子解释模型复杂度变化带来的影响。当模型过于简单时,由于表达能力不足,模型无法有效拟合数据,表现为欠拟合;随着模型复杂度增加,模型能够逐渐捕捉数据规律,性能提升;但继续增加复杂度后,传统理论认为模型可能记住训练数据中的噪声,从而导致泛化能力下降。

然而,在深度学习时代,研究者观察到了“双下降(Double Descent)”现象:模型复杂度继续增加,进入过参数化区域后,模型性能可能再次提升。这意味着传统基于简单模型复杂度的解释并不能完全描述现代神经网络。
       刘老师强调,双下降现象并不意味着“模型越大一定越好”,其出现受到数据分布、训练方法、优化算法等多方面因素影响。研究者需要进一步理解,在什么条件下模型规模扩大能够带来有效收益。

刘老师进一步介绍了大模型领域中的Scaling Law问题。在实际训练大模型时,研究者经常面临资源分配问题:如果获得更多计算资源,是应该增加模型参数量,还是增加训练数据规模?模型规模和数据规模之间应该保持怎样的比例?这些问题直接影响大规模人工智能系统的训练策略。Scaling Law研究希望通过实验和理论建立模型性能与规模之间的定量关系。刘老师指出,大模型实验成本极高,尤其是在模型规模不断增加后,实验次数受到限制,因此如何在有限实验条件下进行可靠推断,也是当前统计学习理论需要面对的重要问题。

因此,大模型研究不仅是工程问题,也涉及统计推断、数学建模以及理论分析。刘老师指出,过去研究者通常使用参数数量衡量模型容量,例如模型拥有多少亿、多少百亿参数。但参数数量是否真正代表模型复杂程度,仍值得讨论。

如果将模型参数看作矩阵,那么矩阵的大小并不仅仅由维度决定,还与其范数等性质有关。因此,用更加精细的数学量描述模型尺度,可能比简单统计参数数量更加合理。相关研究尝试利用新的尺度指标刻画模型复杂程度,并研究这些指标与模型泛化性能之间的关系。这一方向试图建立更加准确的理论框架,从而解释为什么某些大规模模型能够保持良好的泛化能力。

在报告最后,刘老师讨论了机器学习理论的发展方向。刘老师认为,现代机器学习具有明显的工程驱动特点,因此理论研究不能脱离实际模型和真实应用场景。一个好的理论不仅应该解释已有实验现象,还应该具有预测能力,并能够进一步指导实践。当前人工智能领域仍存在大量开放问题,例如为什么规模扩展能够带来能力提升、不同数据条件下泛化规律为何不同、如何建立更加可靠的大模型理论等。这些问题需要数学、统计学、计算机科学等多个领域共同探索。

自由讨论与交流

现场同学认真聆听并积极提问

同学提出,如果模型在训练过程中接触过大量代码或文本,那么模型在测试任务中的表现是否只是依赖记忆。刘老师指出,机器学习真正关注的指标是泛化能力,而不是简单记忆训练数据。模型如何在记忆和泛化之间取得平衡,仍是当前人工智能研究的重要问题。

同学询问人工智能是否会改变数学研究模式。刘老师表示,AI能够帮助人类加速已有问题的解决,但数学研究不仅包括解决问题,也包括提出新的问题、建立新的理论和发现新的联系。未来数学家可能更多承担理解、验证、提出方向以及创造新理论的角色,而人与AI之间的协同将成为重要趋势。

针对本科生如何面对AI工具的问题,刘老师认为,AI能够显著降低学习和科研中的信息获取成本,但基础训练仍然重要。学生需要通过数学推导、科研实践建立判断能力,只有真正理解知识,才能判断AI生成结果是否可靠。

现场同学认真聆听并积极提问

讨论中,刘老师提出,可以从不同角度理解人工智能:它既可以作为工具,也可能成为扩展个人能力边界的重要伙伴。未来的重要问题不是简单判断AI是否替代人,而是思考如何利用AI创造过去无法完成的新工作和新研究。

刘老师回答提问

活动总结与反思

本次“致交·论道”活动使同学们深入了解了人工智能领域中的重要理论问题。刘方辉老师的报告不仅介绍了尺度泛化、双下降等机器学习前沿概念,也展示了数学理论如何与实际人工智能发展相互促进。

通过交流讨论,同学们认识到,人工智能的发展不仅改变技术应用,也正在影响科学研究方式和人才培养模式。面对快速变化的科技环境,学生需要在掌握基础理论的同时,提高跨学科能力、问题意识和创新能力。

未来,人工智能仍将提出大量新的科学问题。作为致远学子,应积极关注前沿发展,在理解技术变化的基础上,寻找属于自己的研究方向,并在人工智能时代主动探索新的可能。

 

顶部