在边缘设备上部署深层学习模型需要优化其大小和计算效率. 量化和推算是有助于降低模型复杂性同时保持性能的两种技术. 本文讨论了如何在边缘部署中有效实施这些方法.

理解量化

量子化涉及降低用于代表模型参数和激活的数的精度,而不是32位浮点数,而是使用8位整数等更低精度格式,这降低了内存使用率,加快了对兼容硬件的推论.

常见的量化技术包括培训后量化和量化-意识培训,培训后量化在培训后应用量化,而量化-意识培训在培训过程中包含量化,以提高准确性.

执行程序

Pruning 从神经网络中去除不必要的或不太重要的重量,这导致一个需要更少计算的较稀疏模型. Pruning可以在训练期间或训练后应用,其技术如量级推算,可以消除低于一定阈值的重量.

结构化的普鲁因策略包括结构化的普鲁因,它可以去除整个神经元或滤波器,以及结构化的普鲁因,它可以去除个人的重量. 结构化的普鲁因经常导致硬件加速器上效率更高的模型.

组合量化和普鲁宁

既应用量子化又应用普鲁因可以显著优化边缘部署的深层模型,这一过程一般是先对模型进行普鲁因,以减少大小和复杂性,然后进行量子化,进一步压缩模型,提高推论速度.

仔细校准对于保持模型精确性是必要的。 诸如推算和量化后的微调技术有助于回收潜在的性能损失。 硬件兼容性也应当考虑最大限度地提高效益 。

执行提示

  • 以普鲁恩开始去除多余的重量.
  • 采用量化-认识训练,以更好地保持准确性。
  • 测试目标硬件上的优化模型,以获得性能收益.
  • 两种技术应用后,对模型进行精细调整.
  • 监测准确性,以确保最低程度的降解。