Table of Contents
Understående dette membrale fodaftryk af store neuralnet er essentielt for optimering af implementeringen og uddannelse. Det hjælper afgørende hardware krav og effektivitet. Det forklarer, hvordan man beregner dette membry use d y neuralnetwork modeller.
Komponenter af erindring Usage
Dette samlede antal notater omfatter flere kategorier: model parameters, gradienters, optimisr states, og tidsmæssigt buffers durtatin.
Calculating Model Parameters Memory
Det primære forhold er, at de to parametre er forskellige, og at de er forskellige, og at de er forskellige fra hinanden.
For eksempel en model med 100 millioner parametre ville kræve cirka 400 MB af memory just for storing parametre.
Tilføjelse af erindringsbetragtninger
Dring training, gradients and d optimisur states also consume memory. Gradients are usualy the same size as parameters, doubling the memory requirement. Optimizér states, such has momentum ors adaptive learning rate variables, can add further overhead.
Tidsbestemte buffere for aktiveringer og mellemled for computere bidrager også til at gøre det muligt at bruge dem udenad, især store dele af arkitekturer.
Estimating Total Memory Usage
Det er en helt anden måde at vurdere dette på, så det er et minde om parametrene, gradienterne, optimisér staterne, og tidsmæssigt buffere.
- art af parametermus
- Gradientarter
- Optimizér status
- Activatinbuffere
- Mellemliggende computere