Au-delà du câblage fixe: Comment FPGA interconnecte Evolved de la logique de colle aux tissus exascales

Les réseaux de portes programmables sur le terrain ont connu une transformation remarquable au cours des quatre dernières décennies. Ce qui a commencé comme des dispositifs simples pour mettre en œuvre la logique de colle et les machines d'état sont devenus des plates-formes informatiques sophistiquées qui alimentent l'inférence d'intelligence artificielle, le traitement de bande de base 5G et 6G, le commerce à haute fréquence et l'accélération à l'échelle du nuage. Au cœur de cette transformation se trouve le tissu d'interconnexion, le réseau programmable de fils, de commutateurs et d'interfaces qui permettent de navetter les données entre les blocs logiques, la mémoire, les tranches DSP et le monde extérieur.

L'ère Island-Style : flexibilité au prix du rendement

Les premiers FPGA du milieu des années 1980, comme les Xilinx XC2064 et Altera EP300, utilisaient une grille uniforme de blocs logiques configurables entourés de matrices de commutation qui reliaient les canaux de routage horizontaux et verticaux. Cette approche architecturale, connue sous le nom de routage de style île, offrait une grande flexibilité. Tout bloc logique pouvait communiquer avec n'importe quel autre bloc, limité uniquement par la disponibilité des ressources de routage.

La communication hors puce reposait sur des normes parallèles d'E/S telles que TTL et LVCMOS, fonctionnant à des dizaines de mégahertz. Un appareil typique du début des années 1990 pourrait atteindre quelques centaines de mégabits par seconde de bande passante globale d'E/S. Le tissu d'interconnexion lui-même, composé de segments de fils non tamponnés et de commutateurs transistors, consommait une grande surface de dé par rapport à la logique qu'il servait.

La réponse a pris la forme d'un routage hiérarchique. Au lieu d'une grille unique uniforme, les FPGA ont introduit plusieurs niveaux d'interconnexion : routage local dans des grappes logiques, fils tamponnés de longueur intermédiaire pour des distances modérées et ressources de routage global qui ont couvert toute la puce. L'architecture VersaRing de Xilinx dans la famille Virtex a fourni un anneau programmable autour du périmètre pour la distribution d'horloges et de signaux de commande, tandis que la série Stratix d'Altera a affiné le routage multi-pistes avec des chaînes de transport et des interfaces mémoire dédiées.

La révolution en série : des émetteurs qui ont tout changé

L'intégration des émetteurs-récepteurs série multi-gigabits directement sur le silicium FPGA a fondamentalement changé la façon dont ces appareils se sont connectés au monde extérieur. Les bus parallèles avaient des limites de dimensionnement : les grandes voies de données consommaient d'énormes nombres de broches d'E/O, souffraient de la mise en travers des traces de signal et nécessitaient une gestion de temps complexe.

Virtex-II Pro de Xilinx, sorti en 2002, blocs d'émetteurs intégrés capables de 3,125 Gbps par voie, avec une logique de codage physique pour l'encodage 8b/10b et la récupération de données d'horloge. La famille de Stratix GX d'Intel a suivi avec des capacités comparables. Ces premiers émetteurs étaient des implémentations propriétaires, mais l'industrie s'est rapidement ralliée autour de protocoles standard qui pourraient tirer parti de la couche physique série. PCI Express, Gigabit Ethernet et Serial RapidIO sont devenus les interfaces dominantes, et les fournisseurs de FPGA ont répondu en durcissant les piles de protocole pour ces standards directement dans les blocs d'émetteurs.

Les concepteurs pourraient mettre en place des connexions rétroréceptrices à haute vitesse sans puces d'émetteurs externes, réduire la complexité des cartes et obtenir des bandes passantes globales qui n'étaient auparavant pas accessibles avec des interfaces parallèles. Les FPGA modernes comprennent maintenant des tuiles rétroréceptrices fonctionnant à 58 Gbps avec modulation PAM4 ou 112 Gbps avec signalisation non-retour à zéro. Un seul appareil peut fournir une bande passante série globale supérieure à 1 Tbps. Ces quads transceiver sont protocole-agnostiques au niveau physique, configurables par le firmware pour soutenir PCIe Gen5 ou Gen6, 400G Ethernet, Interlaken, CXL ou des liaisons rétroréceptives propriétaires. La flexibilité pour changer des protocoles sans modifications matérielles demeure l'un des avantages déterminants des systèmes FPGA.

Evolution d'interconnexion sur puce: réseaux sur puce et bus IP normalisés

Alors que les émetteurs externes captaient les projecteurs, l'interconnexion sur puce a subi une transformation plus silencieuse qui a été également en conséquence. Le maillage de routage traditionnel ne pouvait pas s'écheller indéfiniment. Comme les densités de FPGA surpassaient un million d'éléments logiques, les ressources de routage ont consommé une part croissante de la surface de la zone de jeu, et atteindre la fermeture de la chronologie pour des conceptions complexes est devenu un cauchemar itératif.

Architectures réseau sur puce durcies

L'architecture Versal ACAP de Xilinx, lancée en 2019, a intégré un réseau dédié à la puce qui est fondamentalement différent du tissu de routage configurable. Ce NoC est une infrastructure durcie, commutée par paquets qui relie les moteurs programmables, les moteurs DSP, les moteurs AI et les contrôleurs de mémoire à travers un ensemble d'interfaces standardisées. Il fonctionne indépendamment du maillage de routage souple, fournissant une latence déterministe et une bande passante garantie pour les chemins de données critiques.

La famille Agilex d'Intel a adopté une approche différente mais complémentaire, en tirant parti du bus d'interface avancé et des ponts d'interconnexion multi-die intégrés pour combiner plusieurs puces dans un seul paquet. Cette intégration hétérogène permet à un seul appareil de combiner logique, émetteurs-récepteurs et mémoire HBM comme matrices distinctes optimisées pour leurs fonctions respectives. Sur la couche logique, l'interface eXtensible avancée d'ARM est devenue la norme de facto pour l'intégration de cœur IP parmi tous les principaux fournisseurs FPGA. AMD et Intel fournissent toutes deux des interfaces de streaming et de mémoire AXI4, permettant une intégration transparente de blocs IP tiers, d'accélérateurs personnalisés et de conceptions anciennes.

Normes hors-chip en profondeur : les protocoles qui définissent la connectivité FPGA

Au-delà de la limite des puces, le paysage d'interconnexion FPGA est façonné par plusieurs normes matures qui assurent l'interopérabilité avec les processeurs, les commutateurs, les périphériques de mémoire et les front-ends analogiques.

PCI Express : l'arrière-plan de l'interface hôte

PCIe reste le mécanisme d'attache primaire pour les FPGA dans les applications d'accélérateur et de datacenter. La norme a progressé de Gen1 à 2,5 GT/s par voie à Gen6 à 64 GT/s avec modulation PAM4, et Gen7 est déjà sur la feuille de route. Les FPGA modernes intègrent des blocs de racine ou de terminaison complets avec des moteurs d'accès direct à la mémoire, permettant une diffusion de données à haut débit pour des applications telles que l'inférence réseau neuronal, l'alignement génomique et le traitement numérique des signaux. La virtualisation I/O à base unique permet à plusieurs machines virtuelles de partager un seul FPGA, une fonctionnalité critique pour les déploiements en nuage.

Ethernet : le tissu de réseau universel

Les fournisseurs de FPGA fournissent des cœurs IP Ethernet configurables qui permettent aux concepteurs d'implanter des analyseurs de paquets personnalisés, des moteurs de chiffrement en ligne ou des analyses de débit de ligne directement dans une logique programmable. Cette capacité rend les FPGA idéales pour les cartes d'interface réseau intelligente, les unités de traitement de données et les fonctions de plan utilisateur 5G où le traitement par fil à 100 Gbps ou plus est nécessaire.

Interfaces mémoire : DDR, HBM et au-delà

La connectivité à la mémoire externe est aussi essentielle que les liaisons CPU pour les applications à forte intensité de données. L'intégration de la bande passante HBM2e et HBM3 représente un changement de la densité de bande passante hors puce. Les piles HBM se connectent par des interposeurs de silicium ou des ponts intégrés à l'aide d'interfaces parallèles larges qui fonctionnent à des vitesses d'horloge plus faibles tout en fournissant un débit global énorme, jusqu'à 1 TB/s ou plus pour HBM3. Les contrôleurs de mémoire durcis dans les FPGA modernes prennent en charge les configurations multi-classes, les codes de correction d'erreurs et les paramètres de synchronisation flexibles, assurant l'intégrité des données pour les applications à grande échelle liées à la mémoire, comme la modélisation des risques financiers et la dynamique des fluides informatiques.

JESD204: Interfaces de convertisseur haute vitesse

Dans les systèmes sans fil, les systèmes de guerre électronique et d'instrumentation, les interfaces FPGA avec convertisseurs analogiques à numérique et numériques à analogiques à haute vitesse. Les normes JESD204B et JESD204C définissent une interface série avec latence déterministe et horlogerie harmonisée, réduisant de façon spectaculaire le nombre de broches par rapport aux interfaces LVDS parallèles. Les FPGA actuels comprennent jusqu'à des dizaines de liaisons JESD204 fonctionnant à 24,75 Gbps ou plus rapidement, permettant un échantillonnage direct des largeurs de bande multi-gigahertz pour les unités radio MIMO massives de 5G, les systèmes radars à arrachage progressif et les plates-formes radio définies par logiciel.

Interfaces de chiplet : UCIe et la désagrégation du silicium

Le standard Universal Chiplet Interconnect Express, annoncé en 2022 et développé par un consortium qui comprend AMD, Intel, ARM et TSMC, spécifie un protocole stratifié pour les liaisons die-to-die. UCIe prend en charge les deux interfaces parallèles pour les emballages avancés avec des interfaces de pitch de bosse fine et série pour les substrats organiques standard. EMIB et AIB d'Intel, ainsi que l'interconnexion puce-to-chip d'AMD dans les appareils Versal Premium, représentent des implémentations commerciales précoces. Ces interfaces permettent d'assembler les FPGA à partir de matrices spécialisées – logiques, transceiver, mémoire et moteurs AI – connectés par une couche physique et de liaison normalisée. Le résultat est une plus grande flexibilité de conception, un rendement amélioré et la capacité d'intégrer les matrices de différents nœuds de processus et même de différents fournisseurs.

Technologies émergentes en mesure de redéfinir les interconnexions FPGA

La pression pour soutenir l'informatique exascale, l'inférence AI en temps réel et le sans fil 6G entraîne l'innovation sur plusieurs fronts. Plusieurs tendances se distinguent particulièrement pour la prochaine génération d'interconnexions FPGA.

Optique co-emballée et intégration photonique

Les interconnecteurs électriques sont confrontés à des limites fondamentales de la bande passante. Au-delà de 112 Gbps, l'intégrité des signaux sur les traces de cuivre se dégrade rapidement, nécessitant une égalisation complexe et consommant une puissance importante. Les interconnecteurs optiques offrent un chemin vers les liaisons térabit-par-seconde sur de plus longues distances avec une énergie moindre par bit. Des initiatives de recherche et des consortiums industriels explorent des optiques co-emballées, où les transceivers photoniques en silicium sont intégrés directement sur le substrat ou l'interposeur FPGA. Le projet d'infrastructure programmable ouverte et le programme PIPES de DARPA ont démontré que les commutations optiques contrôlées par FPGA sont capables de reconfigurer les topologies des centres de données à microsecondes.

Interconnexions Adaptées au temps d'exécution avec le Machine Learning

Les FPGA traditionnels sont effectués une fois à la compilation, avec l'ensemble de l'appareil configuré avant le début de l'opération. Cependant, les FPGA sont de plus en plus déployés dans des environnements dynamiques et multi-tenus tels que les instances Amazon EC2 F1 et Microsoft Azure, où les charges de travail changent au fil du temps. Cela a suscité un intérêt pour les interconnections adaptées au temps d'exécution qui peuvent reconfigurer les itinéraires sans perturber les flux actifs. Les techniques d'apprentissage automatique, en particulier les agents d'apprentissage de renforcement, peuvent analyser les graphiques de charge de travail et prévoir les schémas de trafic pour optimiser les configurations de commutateurs de routage pour la latence, la puissance ou le débit en temps réel.

Intégration 3D et ancrage monolithique

La technologie d'interconnexion en silicium empilé de Xilinx a été un exemple commercial précoce, utilisant un interposeur passif en silicium pour connecter plusieurs tranches de FPGA dans un seul paquet. La prochaine frontière est l'intégration monolithique 3D, où les couches logiques sont fabriquées successivement sur le même substrat, permettant des milliers de connexions verticales par millimètre carré avec une capacité minimale. Cette approche brouille la distinction entre le routage sur puce et le routage inter-die, créant un seul appareil qui se comporte comme un tissu cohérent même lorsqu'il est construit à partir de nœuds de processus hétérogènes optimisés pour différentes fonctions. Le résultat est une densité logique plus élevée, une consommation de puissance plus faible et une meilleure routabilité sans sacrifier la flexibilité qui rend les FPGA attrayants pour des conceptions complexes.

Interconnects neuromorphes et quantiques

Les modèles de calcul neuromorphes reposent sur une communication par pics qui diffère fondamentalement des protocoles de bus synchrones. Les FPGA sont largement utilisés pour prototyper et déployer des réseaux neuronaux à l'occasion d'événements, et les futures normes d'interconnexion peuvent devoir supporter des paquets de données asynchrones avec précision temporelle plutôt que des interfaces conventionnelles à horloges. De même, les contrôleurs quantiques de calcul nécessitent des interfaces électroniques cryogéniques où les FPGA opèrent à température ambiante et communiquent avec les qubits par des liaisons de commande et de lecture analogiques.

L'écosystème des normes : comment la collaboration de l'industrie favorise les progrès

Un écosystème riche de consortiums et de groupes de travail assure l'interopérabilité, fait avancer la feuille de route et empêche la fragmentation qui pourrait nuire à l'écosystème en général:

  • PCI-SIG (pcisig.com[) supervise PCI Express, Compute Express Link et les facteurs de forme connexes, en définissant les spécifications électriques et protocolaires que les émetteurs-récepteurs FPGA mettent en œuvre pour la connectivité de l'hôte.
  • JEDEC définit des normes de mémoire incluant DDRx, LPDDRx et HBM, qui influencent directement les conceptions de contrôleurs de mémoire FPGA IP et de couches physiques pour l'intégration de mémoire à haute bande.
  • IEEE 802.3 définit les spécifications Ethernet, les groupes de travail travaillant activement sur les normes 800 GbE et 1.6 TbE que les blocs FPGA MAC et PCS devront supporter dans les appareils à venir.
  • Le Forum de travail sur l'Internet publie des accords de mise en œuvre pour les liaisons électriques et optiques à grande vitesse, comme les CEI-112G et les CEI-224G, que les modèles d'émetteurs FPGA suivent pour se conformer aux équipements de réseau de qualité transporteur.
  • UCIe (uciexpress.org) conduit des opérations de standardisation d'interconnexion de type die-to-die, avec des sociétés membres, dont AMD, Intel, ARM et TSMC, définissant des couches physiques, de liaison et de protocole pour l'intégration des puces.
  • Open Compute Project favorise la conception de matériel ouvert pour les accélérateurs de datacenters, en spécifiant les topologies d'interconnexion pour les cartes et traîneaux basés sur FPGA utilisés dans les déploiements en nuage, ainsi que des interfaces de gestion normalisées.

Ces organisations veillent à ce que les appareils FPGA puissent se connecter à l'infrastructure existante tout en maintenant un chemin de mise à niveau clair. Des cadres open-source comme l'Open FPGA Stack simplifient encore l'intégration en fournissant des interfaces RTL standardisées, des piles de pilotes et des API logicielles, réduisant le temps de mise en marché des solutions d'accélérateur et réduisant la barrière d'entrée pour les nouveaux développeurs FPGA.

Les FPGA comme ponts universels dans les systèmes hétérogéniques

Les centres de données se déplaçant vers des architectures composites avec des pools désagrégés de calcul, de mémoire et d'accélération, les FPGA sont positionnés de façon unique comme des appareils de type caméléon qui peuvent se transformer en contrôleurs d'interface réseau, contrôleurs de stockage, d'extensions de mémoire ou d'accélérateurs personnalisés sans changement matériel.

CXL est particulièrement transformateur pour l'architecture FPGA. En permettant la mémoire partagée entre le CPU et le FPGA, CXL crée des modèles de programmation où les structures de données résident dans la mémoire associée au FPGA et sont directement accessibles par le processeur hôte avec une cohérence de cache complète. Cette capacité brouille la limite d'E/S traditionnelle, en élevant le FPGA d'un simple moteur de déchargement à une unité de calcul par les pairs avec des droits d'accès à la mémoire égaux.

Dans les architectures du CDI, des bassins d'accélérateurs, de mémoire et de stockage sont connectés par des tissus à haute vitesse tels que CXL ou Ethernet avancé. Les FPGA, avec leurs émetteurs-récepteurs d'agnostics protocole et leur logique reconfigurable, peuvent relier les interfaces héritées de ces tissus de nouvelle génération, agissant comme traducteurs universels entre différentes normes et générations. La capacité de supporter simultanément plusieurs normes de liaison dans un seul appareil – un port Ethernet 100G, une liaison CXL.mem et une interface JESD204C à un front-end radio – démontre la richesse d'interconnexion des FPGA modernes et leur valeur dans des environnements informatiques hétérogènes où la diversité de connectivité est la norme.

Défis techniques persistants et atténuation de ces problèmes

Malgré des progrès impressionnants, plusieurs défis restent à résoudre. La consommation d'énergie des émetteurs multi-gigabits est importante; passer à des taux de données plus élevés avec la modulation PAM4 nécessite une péréquation linéaire continue sophistiquée, une péréquation des retours de décision et une correction des erreurs en avant, qui ajoutent tous de la latence et des frais généraux logiques.

Du côté de la routage, l'analyse statique des itinéraires de criticité mixte sur un FPGA très utilisé demeure un processus itératif et long. L'introduction de NoC durcis aide à réduire la congestion de routage pour les chemins de données prédéfinis, mais les concepteurs doivent gérer l'interaction entre le routage logique souple et le tissu réseau durci, qui introduit son propre ensemble de contraintes et de défis d'optimisation.

L'intégrité des signaux à 112 Gbps et au-delà exige une conception soignée des panneaux, des connecteurs de haute qualité et des matériaux à faible perte de BPC. Les substrats traditionnels FR-4 sont inadéquats à ces fréquences, obligeant les concepteurs à utiliser des stratifiés coûteux comme les matériaux Megtron ou Rogers. Comme les vitesses poussent vers 224 Gbps par voie, même ces substrats avancés sont confrontés à des limitations, ce qui conduit à l'intérêt pour les interconnexions optiques comme solution à long terme.

Trajectoires futures : Tissus autonomes de la balance des Peta

En ce qui concerne la bande passante, on peut s'attendre à ce que le débit total dépasse 200 Tbps par appareil d'ici la fin de cette décennie, en raison des progrès réalisés dans les domaines de l'optique co-emballée, de l'empilement 3D avec des liaisons hybrides et de l'échelle des copeaux activée par UCIe et des normes similaires. Du côté de l'intelligence, les interconnexions deviendront de plus en plus autonomes : autosurveillance de la dégradation des signaux, auto-guérisage par remorquage autour de voies ou canaux défectueux, et capables de reconfigurer pour éviter la congestion ou les points chauds de puissance sans intervention de l'opérateur.

La normalisation s'étendra plus profondément dans la pile logicielle, rendant la configuration d'interconnexion FPGA accessible à un public plus large de développeurs. Des projets comme l'initiative Infrastructure programmable ouverte (opiproject.org) visent à résumer les accélérateurs FPGA derrière les API et les interfaces de plan de données communes, rendant l'interconnexion sous-jacente transparente aux développeurs d'applications qui n'ont pas besoin de comprendre la couche physique.

L'évolution des normes d'interconnexion FPGA reflète la trajectoire plus large de l'industrie des semi-conducteurs : des fils fixes aux réseaux reconfigurables, des taux d'horloges mégahertz aux signaux térabit-par-seconde, et des configurations statiques aux tissus dynamiques et intelligents qui s'adaptent en temps réel aux nouvelles exigences de charge de travail.