electrical-and-electronics-engineering
Progrès en électronique numérique pour les grappes informatiques de haute performance
Table of Contents
Introduction à l'informatique à haute performance et à l'électronique numérique
Ces systèmes regroupent des milliers de nœuds informatiques pour résoudre des problèmes qui seraient insolubles sur une seule machine. L'évolution inlassable de l'électronique numérique – processeurs de spanning, mémoire, stockage, interconnexions et gestion de l'énergie – entraîne directement les sauts de performance observés dans chaque nouvelle génération de grappes HPC. La compréhension de ces avancées matérielles est essentielle pour les architectes, les administrateurs de systèmes et les chercheurs qui cherchent à maximiser le débit et à minimiser le temps de réponse.
Les innovations numériques en électronique ont déplacé le paysage des grappes de processeurs homogènes vers des systèmes hétérogènes intégrant des unités de traitement graphique (GPU), des réseaux de portes programmables sur le terrain (FPGA) et des accélérateurs personnalisés. Parallèlement, la bande passante de la mémoire a augmenté grâce aux technologies empilées et à de nouveaux paradigmes de mémoire persistants, tandis que les interconnexions ont poussé vers des latences inférieures et un débit bidirectionnel plus élevé.
Innovations en architecture de processeur
Le nœud de calcul est au cœur de chaque cluster HPC, et la conception du processeur a subi des changements radicaux pour fournir les opérations de point flottant par seconde (FLOPS) nécessaires aux charges de travail modernes. Trois grandes tendances dominent : le parallélisme accru, l'accélération spécialisée et l'échelle des noeuds de processus.
CPU multi-cœurs et multi-cœurs
Les processeurs traditionnels intègrent maintenant des dizaines de cœurs par socket. AMD , EPC , et Intel , les lignes Xeon , Sierra Forest , offrent jusqu'à 128 cœurs par processeur, en s'appuyant sur des nœuds de processus plus petits (5 nm et 7 nm) pour emballer plus de transistors tout en contrôlant la puissance. Ces conceptions mettent l'accent sur la bande passante mémoire élevée par des canaux de mémoire multiples et le support pour DDR5 et HBM3.
Accélérateurs GPU
Les unités de traitement graphiques sont devenues les chevaux de travail de HPC, en particulier pour les tâches d'intelligence artificielle et de simulation qui présentent un parallélisme massif des données. Les architectures NVIDIA , Hopper et Blackwell, offrent plus de 60 téraFLOPS de double précision par puce, en utilisant des noyaux de tensor optimisés pour les opérations de multiplication des accumulations de matrices.
FPGA et accélérateurs personnalisés
Pour les charges de travail où les GPU à fonctions fixes surpassent la fourniture, les FPGA offrent une logique reconfigurable qui peut être adaptée à des algorithmes spécifiques. Microsoft utilise les FPGA Altera dans ses systèmes de projection Azure pour accélérer le réseau en temps réel, tandis que les projets de recherche ont mapé l'analyse graphique directement sur le tissu FPGA.
Avances du nœud de procédé et de l'emballage
Les géométries de transistors (de 7 nm à 3 nm et au-delà) permettent des fréquences d'horloge plus élevées et une puissance réduite par fonctionnement. Mais les innovations d'emballage les plus transformatrices proviennent d'architectures de empilage et de chiplet 3D. Les processeurs EPYC combinent plusieurs copeaux sur un interposeur, connectés via Infinity Fabric. Cette approche modulaire améliore les rendements et permet une intégration hétérogène – par exemple, mélanger des copeaux CPU avec des copeaux d'accélérateur sur le même paquet.
Technologies de mémoire et de stockage
Les améliorations de la vitesse du processeur ne se traduisent par une vitesse d'application que si les données peuvent être alimentées pour calculer les unités assez rapidement. La mémoire et le stockage ont évolué pour répondre aux exigences des grappes HPC modernes, réduisant l'écart croissant entre le calcul et l'accès aux données.
Mémoire à bande haute (HBM)
HBM2e offre jusqu'à 460 Go/s par pile, et HBM3 atteint plus de 800 Go/s. Ceci est crucial pour les accélérateurs GPU qui nécessitent une bande passante mémoire élevée pour l'entraînement des réseaux neuronaux ou des simulations de rendu. La dernière NVIDIA H100 Tensor Core GPU intègre 80 Go de HBM3, fournissant 3,35 To/s de bande passante mémoire, ce qui est essentiel pour la formation de modèles de grande langue.
DDR5 et mémoire CXL
Le protocole de DDR5 DRAM est devenu standard sur les plateformes serveur, offrant une densité et une bande passante plus élevées que le DDR4. Plus important encore, le protocole de Compute Express Link (CXL) permet le pooling et la désagrégation de mémoire entre les nœuds. La mémoire jointe au CXL peut être partagée dynamiquement, permettant aux clusters HPC d'attribuer la capacité de mémoire aux tâches qui en ont le plus besoin, réduisant ainsi les déchets et améliorant le coût total de possession.
Mémoire non-volatile et classe de stockage Mémoire
Intel , la mémoire persistante Optane (maintenant discontinuée, mais la technologie vit sous d'autres formes) a introduit un niveau entre DRAM et SSD. Les solutions actuelles comme Samsung , PM1743 PCIe 5,0 SSD et Kioxia XL-FLASH offrent une latence très faible par rapport aux SSD NAND. La vision de la mémoire de classe de stockage (SCM) – mémoire qui persiste dans les cycles de puissance avec des temps d'accès dans les centaines de nanosecondes – devient progressivement viable grâce à des technologies comme les modules de mémoire persistantes EMR et CXL-attachés.
Stockage NVMe et haute performance
Les systèmes de fichiers parallèles comme Lustre, GPFS (IBM Spectrum Scale) et WekaFS permettent de tirer parti des SSD NVMe pour un débit et un IOPS élevés. Les systèmes de stockage HPC modernes permettent maintenant de réaliser plusieurs téraoctets par seconde de bande passante lecture/écriture, ce qui permet de contrôler les grandes simulations en quelques secondes plutôt que quelques minutes. La combinaison de NVMe et de logiciels de système de fichiers efficaces réduit le goulot d'étranglement des E/S qui affecte souvent les flux de travail scientifiques.
Interconnections à grande vitesse
Pour regrouper des milliers de nœuds en un cluster cohérent, il faut un réseau qui offre une faible latence, une bande passante élevée et une gestion robuste de la congestion.
InfiniBand et HDR/NDR
InfiniBand reste le premier interconnexion pour HPC, avec Mellanox (maintenant NVIDIA) poussant des vitesses de HDR (200 Gbps) à NDR (400 Gbps) par voie. La plate-forme NVIDIA Quantum-2 supporte 400 Gbps par port, RDMA (Accès direct à la mémoire à distance) et contrôle avancé de la congestion. InfiniBand est efficace dans les opérations collectives (réduction totale, diffusion) est essentielle pour l'apprentissage automatique des charges de travail qui synchronisent les gradients dans de nombreux GPU. Le réseau prend également en charge GPUDirect RDMA, permettant aux données de se déplacer directement entre la mémoire GPU et l'adaptateur réseau sans participation CPU, réduisant la la latence et libérant les cycles de processeur.
Avances Ethernet
Bien qu'InfiniBand domine les systèmes Top500, Ethernet continue d'évoluer pour l'utilisation de HPC. 200 GbE et 400 GbE sont maintenant courants et 800 GbE sont en cours de définition. Des technologies comme RoCEv2 (RDMA sur Converged Ethernet) apportent des capacités RDMA aux réseaux Ethernet standard, bien qu'elles nécessitent un contrôle sophistiqué de la congestion (par exemple, DCQCN) pour éviter la perte de paquets.
NVLink, NVSwitch et Compute Express Link (CXL)
Pour la communication intra-noeud entre les GPU, les interconnecteurs propriétaires comme NVIDIAS NVLink (maintenant jusqu'à 900 Go/s bidirectionnel) et NVSwitch créent un tissu GPU entièrement connecté. Les derniers systèmes DGX H100 utilisent NVSwitch pour connecter huit GPU dans un seul nœud avec une sémantique de mémoire partagée. De même, AMD=S Infinity Fabric relie plusieurs GPU. Au niveau du système, CXL et ses variantes apparaissent comme une interconnexion cohérente pour le CPU-Accelerator et le partage de mémoire.
Topologie et conception de réseau
Le choix de la topologie réseau (graisse, libellule, tore) interagit avec les performances d'interconnexion sous-jacentes. Les grappes HPC modernes utilisent souvent une combinaison de technologies : un commutateur à haut rayon dans le cœur (par exemple, libellule) pour la communication globale et un niveau de largeur de bande plus faible et à bande plus élevée pour les groupes de nœuds locaux.
Gestion de l'énergie et refroidissement
Les grappes de CHP consomment des mégawatts de puissance, et le calcul électronique numérique génère également une chaleur énorme. Les améliorations de l'efficacité énergétique et de la gestion thermique sont obligatoires pour maintenir les coûts d'exploitation et l'impact environnemental sous contrôle.
Voltage dynamique et calibrage de fréquence (DVFS)
Les processeurs modernes et les GPUs prennent en charge les DVFS à grain fin qui peuvent ajuster les états de puissance en fonction de la charge de travail. Les planificateurs HPC et les gestionnaires de ressources peuvent fixer des plafonds de puissance par nœud, permettant aux clusters de fonctionner dans les limites de puissance de l'installation tout en respectant les délais de travail.
Refroidissement liquide et refroidissement par immersion
Le refroidissement par air atteint ses limites pour les nœuds HPC à haute densité qui consomment 1 kW ou plus par lame de calcul. Le refroidissement par liquide direct à la puce circule dans des plaques froides attachées aux processeurs, aux GPU et à d'autres composants chauds.Cela élimine la chaleur plus efficacement, permettant des vitesses d'horloge plus élevées ou un emballage plus dense. Certaines installations déploient le refroidissement par immersion, où des nœuds entiers sont immergés dans un fluide diélectrique.
Interconnecter et stocker de manière efficace
Les commutateurs de nouvelle génération utilisent des émetteurs-récepteurs de faible puissance (p. ex. 100 Gbps par lambda avec modulation PAM4) et des systèmes de gavage pour les ports en panne. Les SSD NVMe fonctionnent à une fraction de la puissance par I/O par rapport aux disques tournants, et les nouvelles technologies NAND réduisent la puissance active pendant les lectures et les écritures. Les modules de mémoire persistants peuvent s'asseoir dans des états de faible puissance et se réveiller rapidement lorsqu'ils sont accessibles.
Co-conception de logiciels et de matériel
Les innovations matérielles ne fournissent de valeur que lorsque le logiciel peut les exploiter. La pile de logiciels HPC a évolué pour fournir des abstractions qui masquent la complexité tout en exposant des fonctionnalités critiques de performance.
Modèles de programmation et bibliothèques
Les groupes de coopération et de mémoire unifiés CUDA simplifient la programmation GPU, tandis que les AMD , ROCm fournit des fonctionnalités similaires pour les accélérateurs Instinct. Intel , oneAPI utilise une abstraction C++ parallélisée de données (DPC++) qui compile pour les processeurs, les GPU et les FPGA à partir d'une base de code unique. Les bibliothèques comme cuDNN, rocBLAS et oneMKL sont adaptées à la main pour un matériel spécifique, réalisant souvent des performances quasi-hautes en exploitant des ensembles d'instructions spécifiques et des hiérarchies de mémoire.
Conteneurisation et orchestre
Dans les environnements HPC, la conteneurisation simplifie la reproductibilité et la portabilité entre les clusters. Lorsqu'elle est combinée avec des outils d'orchestration comme Slurm ou Kubernetes (avec des plugins HPC programmateurs), les conteneurs permettent une échelle élastique et l'isolement des ressources. Les abstractions matérielles sous-jacentes – comme NVIDIA Container Toolkit pour l'accès GPU – permettent de traiter les accélérateurs et le réseau comme des ressources que les conteneurs peuvent demander.
E/S et gestion des données
Les systèmes de fichiers parallèles (Lustre, GPFS) s'intègrent désormais aux mouvements de données et aux couches de cache (par exemple, DAOS d'Intel, Cray DataWarp). L'architecture DAOS (Distributed Asynchronous Object Storage) utilise la mémoire non volatile et RDMA pour contourner le noyau du système d'exploitation, en obtenant une latence microseconde pour les opérations de métadonnées. Les bibliothèques HDF5, NetCDF et ADIOS fournissent des abstractions de haut niveau qui tirent parti de ces innovations de stockage de manière transparente.
Études de cas : Comment l'électronique numérique conduit les systèmes HPC du monde réel
Pour apprécier l'impact des innovations en électronique numérique, il faut tenir compte de deux grappes de CHP représentatives : le Top500 leader Frontier au Laboratoire national d'Oak Ridge et le prochain El Capitan au Laboratoire national Lawrence Livermore.
Frontier utilise les processeurs AMD EPYC et les processeurs Instinct MI250X connectés par l'interconnexion HPE Slingshot (un tissu Ethernet personnalisé). Il réalise 1,2 exaFLOPS en utilisant la mémoire HBM2e sur les processeurs et DDR4 sur les nœuds. L'enveloppe de puissance du système est de 21 MW, nécessitant un refroidissement liquide avancé pour les processeurs et les processeurs.
El Capitan (prévu 2024-2025) vise 2 exaFLOPS utilisant la nouvelle génération Instinct MI300 APU, qui combine les pucelettes CPU et GPU sur un seul paquet avec la mémoire HBM3. Ce système utilise HPE=Slingshot interconnect version 11, supportant 400 Gbps par lien et contrôle de congestion avancé. El Capitan intégrera le pooling mémoire attaché au CXL pour permettre des tailles plus grandes de problèmes pour les simulations de gestion des stocks nucléaires.
Orientations futures en électronique numérique pour HPC
Bien que les systèmes actuels à l'échelle examétrique soient remarquables, plusieurs technologies émergentes promettent des performances et une efficacité encore plus grandes au cours de la prochaine décennie.
Calcul quantique et neuromorphe
L'électronique numérique joue un rôle dans les systèmes de contrôle quantique (FPGA pour la lecture du qubit et la correction des erreurs) et dans les algorithmes hybrides classiques-quantum. Les puces neuromorphes, comme Intel , Loihi 2 et IBM , émulent les neurones biologiques pour les réseaux neuronaux qui pourraient réduire considérablement la puissance de certaines charges de travail d'IA. Ces architectures non-Von Neumann peuvent s'intégrer dans les futurs groupes HPC en tant que coprocesseurs.
Interconnections photoniques
Les communications optiques utilisant des puces photoniques et des photoniques en silicium pourraient remplacer les interconnects de cuivre pour les liaisons à longue portée au sein des grappes. Des entreprises comme Ayar Labs et Lightmater développent des interposeurs optiques et des émetteurs TeraPHY qui transportent des données à des centaines de Gbps par canal tout en consommant moins d'énergie que des liaisons électriques équivalentes.
Écosystèmes de pucelettes et Interconnections universelles
La norme Universal Chiplet Interconnect Express (UCIE) vise à créer un écosystème ouvert où les chiplets de différents fournisseurs peuvent être mélangés sur un seul paquet. Cela permettrait aux intégrateurs de système HPC de choisir les meilleurs chiplets de calcul, de mémoire et d'accélérateur pour chaque application, réduisant ainsi le temps de mise sur le marché et le coût.
Calcul proportionnel de l'énergie
L'électronique numérique s'efforcera de développer un comportement proportionnel à l'énergie, où la consommation d'énergie s'équilibre linéairement avec l'utilisation, ce qui nécessite des circuits qui permettent de fixer dynamiquement les horloges, les rails électriques et les blocs logiques entiers. La gestion de l'énergie grâce à l'IA – utilisant des capteurs sur puce et l'apprentissage du renforcement – adapte la tension et la fréquence en temps réel.
Conclusion
Les progrès de l'électronique numérique sont le moteur des progrès inlassables des grappes informatiques à hautes performances. Des processeurs multi-cœurs et des accélérateurs GPU à la mémoire à haute bande, aux interconnections à faible latence et à la gestion intelligente de la puissance, chaque composant a évolué pour surmonter des goulots d'étranglement spécifiques qui, une fois l'échelle limitée. L'intégration des pucelets, des photonique et des accélérateurs spécifiques à domaine promet d'étendre les gains de Moores comme les gains de droit, même si l'échelle transistor traditionnelle ralentit.