北京时间2024年3月29日,,,,,,第十三期优德官网-TNSE团结优异讲座系列运动在线上乐成举行。。。。。。。此次,,,,,,我们有幸约请到南洋理工大学的文勇刚教授先容GPU数据中心大规模深度学习负载调理,,,,,,并分享他在这个领域内的相关研究效果与有趣发明。。。。。。。
本次讲座由优德官网副院长兼群体智能中心主任、香港中文大学(深圳)协理副校长、校长讲座教授、IEEE TNSE主编黄建伟教授担当执行主席和主持人。。。。。。。
面临人工智能日益增添的问题解决能力和泛化能力需求,,,,,,现代深度学习模子变得越来越重大且重大,,,,,,需要消耗大宗盘算资源和时间。。。。。。。使用大规模GPU数据中心举行模子训练和推理优化已成为常见做法。。。。。。。然而,,,,,,由于深度学习使命的高盘算需求和底层硬件的异构性,,,,,,GPU数据中心治理和调理使命面临多重挑战。。。。。。。为此,,,,,,文勇刚教授及其团队开展了一系列研究事情,,,,,,旨在开发先进的调理算法来提升人工智能数据中心系统效率和用户体验。。。。。。。
文勇刚教授首先探讨了与流量特征无关的数据中心调理优化的问题,,,,,,并重点先容了一个关于非抢占式(non-intrusive)、可诠释的调理研究事情Lucid。。。。。。。现有的深度学习使命调理事情大都基于数学求解或机械学习要领对调治战略举行优化,,,,,,在现实大规模安排方面往往保存用户代码侵入、扩展性差等局限性。。。。。。。为此,,,,,,文勇刚教授及其团队设计了一个非抢占式、可扩展和可诠释的深度学习训练调理器Lucid,,,,,,可以有用解决现有调理器现实安排中的问题,,,,,,并可提供和抢占式调理器相当的性能。。。。。。。首先,,,,,,Lucid接纳了一个非抢占式使命剖析器(job profiler)用于高效地网络使命指标并实时提供调试使命反响。。。。。。。其次,,,,,,Lucid接纳了一种打包战略来打包相互之间滋扰不大的使命以规避滋扰。。。。。。。Lucid还凭证预计的使命优先级值和共享分数举行资源调理,,,,,,以实现高效调理。。。。。。。相比于现有最先进的抢占式调理器Tiresias,,,,,,Lucid在排队时延(queuing delay)方面有9倍的性能提升。。。。。。。
针对特定流量模式的数据中心优化,,,,,,文勇刚教授重点分享了一个有关超参数调优(hyperparameter optimization, HPO)的事情。。。。。。。现有的超参数调优开销大,,,,,,系统对硬件资源使用率低,,,,,,且往往忽视数据中心集群资源的特征。。。。。。。为此,,,,,,文勇刚教授及其团队设计了一种基于署理模子(surrogate model)的超参调优框架hydro。。。。。。。首先hydro可以基于m-参数化理论(m-parameterization theory)通过缩小模子来搜索最佳参数。。。。。。。其次,,,,,,它可以通过跨模子融合来提高资源使用率。。。。。。。最后它可以使用数据中心流水线中的空泡(bubble)来调优。。。。。。。与基准要领Ray Tune相比,,,,,,它可以大幅度缩短参数调优的端到端时延,,,,,,并能发明更优的参数。。。。。。。
文勇刚教授的精彩分享发人深思,,,,,,在加入者与两位教授的起劲讨论中,,,,,,涌现了许多有趣的问题,例如数据中心低碳调理,,,,,,大模子训练带来的奇异挑战等。。。。。。。
*特殊鸣谢孙晨光博士对本文的孝顺
