Les origines : les tissus d'acheminement précoce et leurs limites

L'histoire de l'interconnexion FPGA est une histoire de percées progressives qui ont transformé la logique programmable d'une solution de colle de niche en une plate-forme capable de concurrencer le silicium sur mesure. Dans les premiers appareils du milieu des années 1980, le tissu de routage était une réflexion après-vente, une collection clairsemée de transistors de passe et de multiplexeurs qui relient des blocs logiques dans une grille rigide. La famille Xilinx XC2000, par exemple, a utilisé une architecture de canal de routage où chaque bloc logique était entouré de points d'interconnexion programmables qui pourraient établir des connexions verticales ou horizontales.

Routage Pass-Transistor et le goulot d'étranglement de vitesse

La conception des systèmes de transmission de l'information a dominé les conceptions initiales en raison de sa simplicité et de sa petite superficie. Un transistor à canal n unique contrôlé par une cellule SRAM pourrait soit connecter ou débrancher deux segments de fils. Cependant, cette topologie a souffert d'une résistance non linéaire qui variait avec la tension du signal, créant des retards de propagation imprévisibles. À mesure que la densité des appareils a augmenté au cours des années 1990, passant de milliers de portes à des dizaines de milliers, le tissu de routage est devenu le principal facteur de retard critique du trajet, représentant souvent 70 % du temps total de trajet.

Le changement vers un calendrier déterministe

Au début des années 1990, plusieurs fournisseurs ont reconnu que l'architecture de routage devait être réformée de façon fondamentale. Actel a introduit des interconnexions basées sur les antifusibles qui offraient une résistance moindre que les transistors de passage, mais qui étaient programmables une fois, sacrifiant la reconfiguration de la vitesse. Plus influente a été le déplacement vers le routage basé sur multiplexeur, où un ensemble de fils d'entrée pouvait être choisi pour conduire un fil de sortie à travers un chemin tampon. Cette approche, lancée dans la série Xilinx XC4000, a remplacé la porte de passage bidirectionnelle par une structure de multiplexage unidirectionnelle qui fournissait des caractéristiques de retard plus déterministes.

Architecture de style insulaire et ère de l'échouement

L'architecture de style île est apparue comme le paradigme dominant à la fin des années 1990 et au début des années 2000, fournissant la base évolutive qui a permis aux FPGA de suivre la loi de Moore. Dans ce modèle, les blocs logiques configurables (CLB) sont disposés dans un tableau bidimensionnel régulier, entouré de canaux de routage qui contiennent des segments de fils de longueurs variables. L'architecture est nommée pour l'apparence visuelle des blocs logiques comme îles dans une mer de ressources de routage. Cette topologie s'est révélée remarquablement évolutive, permettant aux densités de dispositifs de passer de dizaines de milliers à des millions d'éléments logiques sans nécessiter d'augmentation proportionnelle de la zone de routage.

Routage par voie de circulation et segmentation des fils

Les fils courts qui s'étendent sur une seule ligne CLC fournissent des connexions rapides entre les éléments logiques voisins, tandis que les lignes doubles, quad et longues sautent sur les blocs pour réduire le délai pour les terminaux éloignés. Xilinx a lancé un routage hiérarchique avec des matrices d'interconnexion segmentées qui ont permis aux signaux de basculer entre les canaux verticaux et horizontaux aux boîtes de commutation désignées. Les FPGA d'Intel ont introduit des interconnexions à base de lignes et de colonnes avec des chaînes de transport rapide dédiées qui pourraient propager des opérations arithmétiques sur une ligne entière avec un délai d'interconnexion minimal. L'innovation clé a été l'introduction de matrices de commutation programmables aux intersections des canaux de routage, qui ont permis à tout fil entrant de se connecter à tout fil sortant par un chemin tamponné. Cette architecture de matrix de commutation a éliminé la résistance et la non-linéarité du routage de passage-transistor tout en maintenant la pleine programmabilité.

La hiérarchie moderne des interconnexions

Les FPGA contemporains ont peu de ressemblance avec leurs ancêtres de style insulaire. Le tissu d'interconnexion est devenu une collection stratifiée de réseaux spécialisés, chacun optimisé pour un modèle de communication spécifique. Les appareils haut de gamme intègrent désormais des sous-systèmes de processeur durcis, des émetteurs multi-gigabits et des infrastructures réseau-sur-puce qui brouillent la ligne entre la logique programmable et les CAS sur mesure. Cette hiérarchie permet aux concepteurs de choisir la ressource de routage appropriée pour chaque connexion, optimisant à la fois les performances et la routabilité.

Ressources d'acheminement stratifié

Les tissus de routage modernes s'étendent sur une hiérarchie multi-niveaux qui s'étend directement sur des lignes ultra-longues. Au niveau de base, les liaisons directes relient des éléments logiques adjacents avec un délai proche de zéro – généralement moins de 100 picosecondes. Le niveau intermédiaire comprend des lignes doubles et quad qui s'étendent sur deux ou quatre CLB, offrant une faible latence pour des distances modérées tout en maintenant une grande flexibilité de routage. Le niveau supérieur est constitué de lignes longues qui traversent toute la hauteur ou la largeur de la matrice, soutenues par des répéteurs tampons qui maintiennent l'intégrité des signaux sur des distances à l'échelle millimétrique. L'architecture Versal d'AMD illustre cette approche avec son interconnecte multi-niveaux qui comprend des bus de 32 bits pour des chemins à forte intensité de données, tandis que la famille d'Intel Agilex raffine la segmentation pour soutenir les registres logiques Hyperflex qui peuvent capter des signaux à plusieurs points le long d'un fil.

Intégration des E/S série haute vitesse et des émetteurs

L'intégration des transceivers multi-gigabits a étendu l'interconnexion FPGA au-delà de la limite des puces, permettant une connexion directe aux protocoles série haute vitesse sans dispositifs PHY externes. Les transceivers modernes comprennent des circuits intégrés de récupération de données d'horloge, des étapes d'égalisation et une logique de boîte de vitesses capables de supporter des débits de données dépassant 112 Gbps par voie en utilisant la modulation PAM4. Ces transceivers sont organisés en blocs quad avec des horloges de référence et une gestion de puissance dédiées, connectés au tissu central par des canaux de conversion série à bande haute. Le tissu de routage à l'intérieur de la FPGA doit transformer cette bande passante série massive en pipelines de traitement parallèle avec une latence déterministe. Par exemple, un dispositif avec 32 transceivers fonctionnant à 56 Gbps nécessite une bande passante interne globale de près de deux terabits par seconde, qui est réalisée par des bus à grande vitesse dédiés qui contournent le réseau de routage général.

Architectures réseau sur puce durcies

Contrairement à la plate-forme Versal d'AMD, qui utilise son système NoC qui relie les processeurs, les contrôleurs de mémoire, les moteurs DSP et les blocs logiques programmables sur un épine dorsale à haute vitesse avec bande passante garantie et latence. Les routeurs NoC supportent plusieurs canaux virtuels pour l'isolement de la classe de trafic et utilisent des algorithmes de routage déterministes pour assurer un mouvement prévisible des données. Les appareils Agilex d'Intel intègrent un tissu d'accélérateur durci similaire qui fournit des connexions à haute bande passante et à faible latence entre les éléments de calcul et les ports de mémoire. L'architecture NoC découple le mouvement des données de la complexité de configuration, permettant aux concepteurs de spécifier les exigences de communication à un niveau élevé tandis que le matériel fournit des chemins fiables et précaractérisés.

Performance et optimisation de la puissance

L'évolution de la technologie d'interconnexion influence directement les deux paramètres critiques des systèmes électroniques : vitesse et efficacité énergétique. Bien que l'échelle des nœuds de processus offre des performances brutes de transistor, l'interconnexion détermine si cette vitesse peut être utilisée efficacement sans une consommation excessive d'énergie.

Combler le décalage horaire

Chaque génération d'architecture de routage a réduit la pénalité de latence qui a rendu les FPGA historiquement plus lents que les ASIC. L'introduction de chaînes de transport et de voies de cascade a éliminé le besoin de routage programmable dans les opérations arithmétiques, permettant aux adders et aux multiplicateurs de fonctionner à pleine vitesse. Les blocs DSP durcis avec connexion dédiée aux blocs adjacents ont réduit les retards de route dans les chaînes de traitement des signaux de 40 pour cent par rapport à l'acheminement souple.

Réduction de l'interconnexion

Les outils modernes permettent de régler ce problème par des itinéraires adaptatifs qui sélectionnent des voies de capacité inférieure pour les signaux non critiques, réduisant ainsi l'énergie de commutation sans sacrifier le moment. La reconfiguration partielle dynamique permet de réduire les régions inactives de la puce, tandis que le tissu de routage lui-même est conçu avec des épines d'horloge segmentées qui réduisent la distribution inutile. Certaines familles de FPGA intègrent maintenant l'échelle de tension pour des blocs d'interconnexion spécifiques, ajustant l'amplitude du signal en fonction de la longueur de ligne et de la fréquence de fonctionnement. Au niveau du processus, les diélectriques à faible k et les interconnects en cuivre réduisent la capacité parasitaire par rapport aux technologies d'aluminium plus anciennes.

Demandes d'interconnexion avec applications

Les capacités d'interconnexion améliorées ont débloqué de nouveaux domaines d'application où la reconfiguration et le débit élevé sont à la fois critiques. Dans ces systèmes, l'interconnexion n'est pas seulement un moyen de connecter la logique, c'est le principal moteur de performance et de flexibilité du système.

Accélération du centre de données et CNI intelligents

Dans ces applications, l'interconnexion doit prendre en charge plusieurs ports Ethernet 100G directement connectés au tissu, nécessitant des voies d'émetteurs qui alimentent les pipelines de traitement de paquets avec une latence déterministe. Le projet de Microsoft Catapult, qui utilise les FPGA Intel Arria et Stratix, s'appuie sur le routage riche en transceiver de l'appareil pour traiter les flux de données réseau en temps réel. Le NoC durci permet de faire passer les données entre les contrôleurs de mémoire et les unités de calcul sans décrochage, créant ainsi un moteur de flux de données optimisé pour les charges de travail en continu. Avec l'adoption de normes d'interconnexion compatibles avec le cache comme CXL et UCIe, les FPGA peuvent désormais partager la mémoire de manière cohérente avec les processeurs hôtes, intégrant davantage l'accélération programmable dans des architectures informatiques hétérogènes.

Infrastructures 5G et O-RAN

Le déploiement des réseaux 5G exige un traitement massif du signal numérique avec latence déterministe, ce qui fait de FPGA un activateur critique. Les systèmes MIMO massifs exigent que des coefficients de formage de faisceau soient appliqués simultanément à des centaines de canaux d'antenne, exigeant des connexions à large bande entre blocs DSP et émetteurs. Les FPGA équipés de liaisons série JESD204B/C se connectent directement aux convertisseurs de données RF à large bande, supportant des largeurs de bande jusqu'à 400 MHz. Le routage programmable permet une allocation dynamique des ressources au fur et à mesure que la configuration de l'interface aérienne change, permettant une cartographie efficace des fonctions d'unités distribuées et d'unités radio dans les architectures O-RAN. Intel et AMD ont développé des familles FPGA avec correction d'erreurs vers l'avant durcie et un routage optimisé entre blocs DSP pour répondre aux exigences exigeantes de la latence et de débit de 5G NR.

Inférence de l'IA sur le bord

L'inférence d'IA de l'Edge nécessite un équilibre entre le calcul parallèle et le mouvement des données. Les FPGA excellent parce que l'interconnexion peut être personnalisée pour créer des chemins de données en pipelines profonds qui rainent la mémoire sur puce à des milliers d'unités multi-accumulables. Le routage granulaire permet la mise en place de réseaux neuronaux clairs où seules les connexions actives consomment de la puissance et des ressources. À mesure que les modèles d'IA évoluent, le FPGA peut être reconfiguré avec un modèle d'interconnexion optimisé pour chaque nouvelle topologie – une flexibilité que les ASIC ne peuvent pas assortir.

Défis persistants de la conception

Malgré des décennies de progrès, la conception d'interconnexions est confrontée à des défis physiques et économiques fondamentaux qui continuent de stimuler l'innovation.

Intégrité des signaux aux fréquences élevées

Dans les processus de géométrie fine, la densité des fils métalliques et l'espacement étroit des canaux de routage créent un couplage capacitif et un crosstalk important entre les lignes adjacentes. Lorsque les signaux changent à des vitesses de gigahertz, ce couplage peut entraîner une incertitude de synchronisation et des défaillances fonctionnelles. Les fournisseurs de FPGA s'attaquent à cela par un blindage prudent des filets critiques, l'utilisation de signaux différentiels pour les horloges sensibles et la mise en place de plans de sol agressifs dans les couches supérieures de métal.

Densité thermique et gestion

L'activité de commutation dans les tissus de routage à haute densité crée une densité de puissance localisée qui peut dépasser la capacité thermique des paquets standard. Les régions transceiver avec plusieurs voies actives peuvent générer des flux de chaleur comparables aux cœurs du processeur, nécessitant une dissipation thermique efficace par les puits de chaleur et le flux d'air forcé. La gestion de la puissance adaptative et les outils de routage intelligents qui équilibrent les vitesses de basculement à travers les champs de chaleur aident à éviter les points chauds thermiques. La reconfiguration partielle dynamique peut déplacer le calcul vers les régions plus froides de la puce, mais cela nécessite une flexibilité de routage qui supporte la migration sans dégradation des performances.

Orientations nouvelles

La prochaine décennie apportera des changements transformatifs aux interconnexions FPGA à mesure que l'intégration optique, l'emballage tridimensionnel et les technologies sans fil mûriront. Ces avancées redéfiniront les frontières entre les communications sur puce et hors puce, permettant une évolutivité et une reconfiguration sans précédent.

Photonique en silicone et routage optique

Les interconnecteurs électriques sont confrontés à des limites de bande passante fondamentales dues à l'effet de peau et à des pertes diélectriques qui augmentent avec la distance et la fréquence. La photonique en silicone offre une solution potentielle en remplaçant les signaux électriques par la lumière, en obtenant des débits de données multi-terabits avec une puissance moindre par bit. Les chercheurs développent des modulateurs photoniques, des détecteurs et des guides d'onde qui peuvent être intégrés sur les interposeurs FPGA ou directement sur le substrat de silicium.

3D Intégration hétérogénique

Les technologies EMIB et Foveros d'Intel et les conceptions basées sur les puces d'AMD illustrent cette approche. Dans un FPGA 3D, une matrice de base contient l'infrastructure de routage programmable tout en calculant les pucelettes avec les moteurs DSP ou les accélérateurs d'IA. L'interconnexion inter-die devient un élément architectural critique, exigeant un signal qui peut traverser des vias verticaux avec différentes caractéristiques d'impédance que les fils planaires. Cette désagrégation permet le mélange des nœuds de processus – nœuds avancés pour les noyaux de calcul et les nœuds matures pour le routage – optimisant à la fois les coûts et les performances.

Interconnections sans fil et écosystèmes de chiplet

Les antennes miniatures fabriquées sur le substrat de silicium peuvent diffuser des données à de multiples copeaux sans fil, réduire la congestion et permettre un reroutage dynamique des connexions. Bien que des défis subsistent en matière de gestion des interférences et d'efficacité énergétique, le concept s'harmonise avec la philosophie de connectivité flexible de la FPGA. Alors que l'industrie adopte des normes universelles d'interconnexion des copeaux comme UCIe, la frontière entre l'acheminement sur puce et l'acheminement hors puce continuera de s' brouiller. Une FPGA pourrait être assemblée à partir d'une collection de copeaux communiquant sans fil ou sur des liaisons électriques à courte portée, offrant une évolutivité et une reconfigurabilité au-delà de ce que l'intégration monolithique peut atteindre.

L'évolution des technologies d'interconnexion FPGA a transformé la logique programmable d'une solution de niche pour la logique de colle à basse vitesse en une plateforme qui met en péril les ASIC dans les applications à haute performance. Chaque génération d'architecture de routage a relevé des défis fondamentaux en matière de vitesse, de puissance et de prévisibilité, permettant aux FPGA de servir des charges de travail exigeantes dans les centres de données, l'infrastructure sans fil et l'IA bord. À mesure que l'intégration optique, l'emballage 3D et la conception basée sur les puces seront mûrs, le tissu d'interconnexion demeurera le différenciateur critique de la capacité du système.