当前位置: 开发笔记 > 编程语言 > 正文

用上PytorchLightning的这六招，深度学习pipeline提速10倍！

作者：风中的百合香迷人 | 来源：互联网 | 2023-09-16 14:26

点击上方“视学算法”，选择加星标或“置顶”重磅干货，第一时间送达金磊发自凹非寺量子位报道|公众号QbitAI面对数以亿计的图片数据，到

点击上方“视学算法”&＃xff0c;选择加"星标"或“置顶”

重磅干货&＃xff0c;第一时间送达

金磊发自凹非寺
量子位报道 | 公众号 QbitAI

面对数以亿计的图片数据&＃xff0c;到底该用什么样的方法才能快速搞实验&＃xff1f;

这样的问题&＃xff0c;或许在做机器学习研究的你&＃xff0c;也会经常遇到。

而就在最近&＃xff0c;一个国外小哥就提出了一种建议&＃xff1a;

在Pytorch lightning基础上&＃xff0c;让深度学习pipeline速度提升10倍&＃xff01;

用他自己的话来说就是——“爬楼时像给了你一个电梯”。

这般“酸爽”&＃xff0c;到底是如何做到的呢&＃xff1f;

优化机器学习pipeline&＃xff0c;很重要

无论你是身处学术界还是工业界&＃xff0c;时间和资源等各种因素&＃xff0c;往往会成为你在搞实验的枷锁。

尤其是随着数据集规模和机器学习模型&＃xff0c;变得越发庞大和复杂&＃xff0c;让实验变得既费时又耗力。

提速这件事&＃xff0c;就变得至关重要。

例如在2012年的时候&＃xff0c;训练一个AlexNet&＃xff0c;要花上5到6天的时间。

而现如今&＃xff0c;只需要短短几分钟就可以在更大的数据集上训练更大的图像模型。

这位小哥认为&＃xff0c;从某种角度上来说&＃xff0c;这是得益于各种各样的“利器”的出现。

例如Pytorch Lingtning&＃xff0c;就是其中一种。

于是&＃xff0c;他便“死磕”pipeline&＃xff0c;总结了六种“闪电加速”实验周期的方法。

并行数据加载

数据加载和增强&＃xff08;augmentation&＃xff09;往往被认为是训练pipeline时的瓶颈之一。

一个典型的数据pipeline包含以下步骤&＃xff1a;

从磁盘加载数据
在运行过程中创建随机增强
将每个样本分批整理

在这个过程中&＃xff0c;倒是可以用多个CPU进程并行加载数据来优化。

但与此同时&＃xff0c;还可以通过下面的操作来加速这一过程&＃xff1a;

1、将DataLoader中的num_workers参数设置为CPU的数量。

2、当与GPU一起工作时&＃xff0c;将DataLoader中的pin_memory参数设置为True。这可以将数据分配到页锁定的内存中&＃xff0c;从而加快数据传输到GPU的速度。

使用分布式数据并行的多GPU训练

与CPU相比&＃xff0c;GPU已经大大加速了训练和推理时间。

但有没有比一个GPU更好的方法&＃xff1f;或许答案就是&＃xff1a;

多个GPU&＃xff01;

在PyTorch中&＃xff0c;有几种范式可以用多个GPU训练你的模型。

两个比较常见的范式是 “DataParallel ”和 “DistributedDataParallel”。

而小哥采用的方法是后者&＃xff0c;因为他认为这是一种更可扩展的方法。

但在PyTorch&＃xff08;以及其他平台&＃xff09;中修改训练pipeline并非易事。

必须考虑以分布式方式加载数据以及权重、梯度和指标的同步等问题。

不过&＃xff0c;有了PyTorch Lightning&＃xff0c;就可以非常容易地在多个GPU上训练PyTorch模型&＃xff0c;还是几乎不需要修改代码的那种&＃xff01;

混合精度

在默认情况下&＃xff0c;输入张量以及模型权重是以单精度&＃xff08;float32&＃xff09;定义的。

然而&＃xff0c;某些数学运算可以用半精度&＃xff08;float16&＃xff09;进行。

这样一来&＃xff0c;就可以显著提升速度&＃xff0c;并降低了模型的内存带宽&＃xff0c;还不会牺牲模型的性能。

通过在PyTorch Lightning中设置混合精度标志&＃xff08;flag&＃xff09;&＃xff0c;它会在可能的情况下自动使用半精度&＃xff0c;而在其他地方保留单精度。

通过最小的代码修改&＃xff0c;模型训练的速度可以提升1.5至2倍。

早停法

当我们训练深度学习神经网络的时候&＃xff0c;通常希望能获得最好的泛化性能。

但是所有的标准深度学习神经网络结构&＃xff0c;比如全连接多层感知机都很容易过拟合。

当网络在训练集上表现越来越好&＃xff0c;错误率越来越低的时候&＃xff0c;实际上在某一刻&＃xff0c;它在测试集的表现已经开始变差。

因此&＃xff0c;早停法 &＃xff08;Early Stopping&＃xff09;便在训练过程中加入了进来。

具体来说&＃xff0c;就是当验证损失在预设的评估次数&＃xff08;在小哥的例子中是10次评估&＃xff09;后停止训练。

这样一来&＃xff0c;不仅防止了过拟合的现象&＃xff0c;而且还可以在几十个 epoch内找到最佳模型。

Sharded Training

Sharded Training是基于微软的ZeRO研究和DeepSpeed库。

它显著的效果&＃xff0c;就是让训练大模型变得可扩展和容易。

否则&＃xff0c;这些模型就不适合在单个GPU上使用了。

而在Pytorch Lightning的1.2版本中&＃xff0c;便加入了对Shared Training的支持。

虽然在小哥的实验过程中&＃xff0c;并没有看到训练时间或内存占用方面有任何改善。

但他认为&＃xff0c;这种方法在其它实验中可能会提供帮助&＃xff0c;尤其是在不使用单一GPU的大模型方面。

模型评估和推理中的优化

在模型评估和推理期间&＃xff0c;梯度不需要用于模型的前向传递。

因此&＃xff0c;可以将评估代码包裹在一个torch.no_grad上下文管理器中。

这可以防止在前向传递过程中的存储梯度&＃xff0c;从而减少内存占用。

如此一来&＃xff0c;就可以将更大的batch送入模型&＃xff0c;让评估和推理变得更快。

效果如何&＃xff1f;

介绍了这么多&＃xff0c;你肯定想知道上述这些方法&＃xff0c;具体起到了怎样的作用。

小哥为此做了一张表格&＃xff0c;详解了方法的加速效果。

那么这些方法&＃xff0c;是否对在做机器学习实验的你有所帮助呢&＃xff1f;

快去试试吧~

参考链接&＃xff1a;

https://devblog.pytorchlightning.ai/how-we-used-pytorch-lightning-to-make-our-deep-learning-pipeline-10x-faster-731bd7ad318a

— 完 —

本文系网易新闻•网易号特色内容激励计划签约账号【量子位】原创内容&＃xff0c;未经账号授权&＃xff0c;禁止随意转载。

点个在看 paper不断&＃xff01;

推荐阅读

get
利用CIFAR10数据集快速掌握Mixup数据增强技术，显著提高图像分类精度

通过使用CIFAR-10数据集，本文详细介绍了如何快速掌握Mixup数据增强技术，并展示了该方法在图像分类任务中的显著效果。实验结果表明，Mixup能够有效提高模型的泛化能力和分类精度，为图像识别领域的研究提供了有价值的参考。 ... [详细]

蜡笔小新 2024-11-05 14:24:36
get
【图像分类实战】利用DenseNet在PyTorch中实现秃头识别

本文详细介绍了如何使用DenseNet模型在PyTorch框架下实现秃头识别。首先，文章概述了项目所需的库和全局参数设置。接着，对图像进行预处理并读取数据集。随后，构建并配置DenseNet模型，设置训练和验证流程。最后，通过测试阶段验证模型性能，并提供了完整的代码实现。本文不仅涵盖了技术细节，还提供了实用的操作指南，适合初学者和有经验的研究人员参考。 ... [详细]

蜡笔小新 2024-11-06 15:21:35
rsa
能够感知你情绪状态的智能机器人即将问世 | 科技前沿观察

本周科技前沿报道了多项重要进展，包括美国多所高校在机器人技术和自动驾驶领域的最新研究成果，以及硅谷大型企业在智能硬件和深度学习技术上的突破性进展。特别值得一提的是，一款能够感知用户情绪状态的智能机器人即将问世，为未来的人机交互带来了全新的可能性。 ... [详细]

蜡笔小新 2024-11-05 20:45:31
java
视觉图像的生成机制与英文术语解析

近期，Google Brain、牛津大学和清华大学等多家研究机构相继发布了关于多层感知机（MLP）在视觉图像分类中的应用成果。这些研究深入探讨了MLP在视觉任务中的工作机制，并解析了相关技术术语，为理解视觉图像生成提供了新的视角和方法。 ... [详细]

蜡笔小新 2024-10-30 09:47:50
java
语义、实例与全景分割的对比分析（Comparative Analysis of Semantic, Instance, and Panoptic Segmentation）

图像分割技术在人工智能领域中扮演着关键角色，其中语义分割、实例分割和全景分割是三种主要的方法。本文对这三种分割技术进行了详细的对比分析，探讨了它们在不同应用场景中的优缺点和适用范围，为研究人员和从业者提供了有价值的参考。 ... [详细]

蜡笔小新 2024-10-29 18:51:14
express
2019年斯坦福大学CS224n课程笔记：深度学习在自然语言处理中的应用——Word2Vec与GloVe模型解析

本文详细解析了2019年斯坦福大学CS224n课程中关于深度学习在自然语言处理（NLP）领域的应用，重点探讨了Word2Vec和GloVe两种词嵌入模型的原理与实现方法。通过具体案例分析，深入阐述了这两种模型在提升NLP任务性能方面的优势与应用场景。 ... [详细]

蜡笔小新 2024-10-29 10:37:07
get
PyTorch常见预训练模型的下载链接及使用指南

本文提供了PyTorch框架中常用的预训练模型的下载链接及详细使用指南，涵盖ResNet、Inception、DenseNet、AlexNet、VGGNet等六大分类模型。每种模型的预训练参数均经过精心调优，适用于多种计算机视觉任务。文章不仅介绍了模型的下载方式，还详细说明了如何在实际项目中高效地加载和使用这些模型，为开发者提供全面的技术支持。 ... [详细]

蜡笔小新 2024-10-27 13:57:42
tree
机器学习的持续探索与进展

在机器学习领域，深入探讨了概率论与数理统计的基础知识，特别是这些理论在数据挖掘中的应用。文章重点分析了偏差（Bias）与方差（Variance）之间的平衡问题，强调了方差反映了不同训练模型之间的差异，例如在K折交叉验证中，不同模型之间的性能差异显著。此外，还讨论了如何通过优化模型选择和参数调整来有效控制这一平衡，以提高模型的泛化能力。 ... [详细]

蜡笔小新 2024-11-11 10:27:39
tree
独家解析：深度学习泛化理论的破解之道与应用前景

本文深入探讨了深度学习泛化理论的关键问题，通过分析现有研究和实践经验，揭示了泛化性能背后的核心机制。文章详细解析了泛化能力的影响因素，并提出了改进模型泛化性能的有效策略。此外，还展望了这些理论在实际应用中的广阔前景，为未来的研究和开发提供了宝贵的参考。 ... [详细]

蜡笔小新 2024-11-09 19:29:56
tree
超分辨率技术的全球研究进展与应用现状综述

本文综述了图像超分辨率（Super-Resolution, SR）技术在全球范围内的最新研究进展及其应用现状。超分辨率技术旨在从单幅或多幅低分辨率（Low-Resolution, LR）图像中恢复出高质量的高分辨率（High-Resolution, HR）图像。该技术在遥感、医疗成像、视频处理等多个领域展现出广泛的应用前景。文章详细分析了当前主流的超分辨率算法，包括基于传统方法和深度学习的方法，并探讨了其在实际应用中的优缺点及未来发展方向。 ... [详细]

蜡笔小新 2024-10-31 15:10:48
tree
深度森林算法解析：特征选择与确定能力分析

本文深入探讨了深度森林算法在特征选择与确定方面的能力。提出了一种名为EncoderForest（简称eForest）的创新方法，作为首个基于决策树的编码器模型，它在处理高维数据时展现出卓越的性能，为特征选择提供了新的视角和工具。 ... [详细]

蜡笔小新 2024-10-29 18:09:45
express
NVIDIA新一代Ampere架构详解：革新与优化并存的显卡技术飞跃

NVIDIA最新推出的Ampere架构标志着显卡技术的一次重大突破，不仅在性能上实现了显著提升，还在能效比方面进行了深度优化。该架构融合了创新设计与技术改进，为用户带来更加流畅的图形处理体验，同时降低了功耗，提升了计算效率。 ... [详细]

蜡笔小新 2024-10-29 14:10:54
get
表面缺陷检测数据集综述及GitHub开源项目推荐

本文综述了表面缺陷检测领域的数据集，并推荐了多个GitHub上的开源项目。通过对现有文献和数据集的系统整理，为研究人员提供了全面的资源参考，有助于推动该领域的发展和技术进步。 ... [详细]

蜡笔小新 2024-10-29 08:22:46
rsa
深入解析 Unity URP/SRP 渲染管线：匠心打造的全面指南

本文深入探讨了Unity中的URP、SRP和HDRP渲染管线，详细解析了它们之间的关系及各自的特点。首先介绍了SRP的基本概念及其在Unity渲染架构中的作用，随后重点阐述了URP和HDRP的设计理念与应用场景。文章还分析了SRP诞生的背景，解释了为何Unity需要引入这一灵活的渲染框架，以满足不同项目的需求。通过对比URP和HDRP，读者可以更好地理解如何选择合适的渲染管线，以优化项目的性能和视觉效果。 ... [详细]

蜡笔小新 2024-10-28 09:54:14
python
5.Numpy 索引(一维索引/二维索引)

本文内容是根据莫烦Python网站的视频整理的笔记，笔记中对代码的注释更加清晰明了,同时根据所有笔记还整理了精简版的思维导图,可在此专栏查看,想观看视频可直接去他的网 ... [详细]

蜡笔小新 2024-10-19 13:29:11