Les progrès technologiques des procédés ont fondamentalement remodelé le paysage du traitement numérique des signaux.Au cours des deux dernières décennies, la miniaturisation incessante des transistors a permis aux processeurs de signaux numériques (DSP) d'atteindre des niveaux de performance sans précédent tout en réduisant simultanément la consommation d'énergie. Ce double avantage a permis de débloquer de nouveaux domaines d'application – du traitement en temps réel de la bande de base 5G et de l'inférence AI de bord à la fusion de capteurs audio et autonomes à haute fidélité.

Principes fondamentaux de l'expansion technologique des procédés

L'échelle de technologie de procédé se réfère à la réduction systématique des dimensions des transistors – longueur de la porte, épaisseur de l'oxyde et hauteur d'interconnexion – entre les nœuds lithographiques successifs. Historiquement décrite par MooreS Law, cette échelle a progressé de plusieurs micromètres dans les années 1970 à 3 nm et au-delà dans la production commerciale aujourd'hui. Chaque nouveau nœud permet environ deux fois le nombre de transistors par unité de surface, une tendance qui a tenu pendant des décennies bien que récemment ralenti aux nœuds les plus avancés.

Les principes physiques qui sous-tendent l'échelle sont enracinés dans l'échelle Dennard, qui prédit que, lorsque les dimensions du transistor se rétrécissent par un facteur de 0,7, la tension de fonctionnement et le courant diminuent proportionnellement, laissant la densité de puissance à peu près constante. Dans la pratique, l'échelle Dennard s'est rompue autour du nœud de 90 nm en raison des courants de fuite et des limites de tension seuil.

Paramètres d'échelle des clés

Trois paramètres principaux définissent l'impact de l'échelle sur la conception du PSD :

  • Diligement du disque – Les portes plus petites s'interrupteurnt plus rapidement, permettant des fréquences d'horloge plus élevées.
  • Délais d'interconnexion[ – Les fils plus courts réduisent les retards RC, mais les fils plus étroits augmentent la résistance, créant un compromis qui permet aux nœuds avancés d'aborder avec des interconnects de cuivre et des diélectriques à faible k.
  • Courant de fuite[ – Comme l'épaisseur de l'oxyde se rétrécit, les fuites de porte et les fuites subseuils augmentent, ce qui pose un défi à la consommation statique.

La compréhension de ces paramètres est essentielle parce que les architectures DSP sont particulièrement sensibles aux marges de synchronisation et aux modèles d'accès à la mémoire. Un changement de noeud de processus peut modifier l'équilibre optimal entre la profondeur du pipeline, la taille du multiplicateur et la largeur de l'interface mémoire.

Impact de l'expansion sur le rendement du processeur DSP

Les processeurs DSP sont spécialisés dans les opérations multi-accumulation (MAC), le filtrage, les FFT et d'autres arithmétiques de signal. L'échelle de processus améliore leur performance par trois mécanismes interdépendants : des fréquences d'horloges plus élevées, une mémoire sur puce plus grande et des fichiers de registre, et le support pour des datapaths SIMD (Single Instruction Multiple Data).

Fréquence de l'horloge et marges de temps

Par exemple, un DSP conçu sur un nœud de 28 nm pourrait atteindre 1,2 GHz, alors que la même architecture portée à 7 nm peut dépasser 2,5 GHz, soit plus que le doublement du débit brut pour les charges de travail liées au calcul. Cependant, l'échelle de fréquence seule n'est pas suffisante; des pipelines plus profonds et une meilleure prévision des branches sont souvent nécessaires pour maintenir le parallélisme au niveau de l'instruction, surtout pour le code de traitement des signaux lourd de contrôle.

Densité transistorale et complexité architecturale

Une densité de transistors plus élevée permet aux architectes d'intégrer plus d'unités MAC, de voies vectorielles plus larges et d'accélérateurs dédiés sur la même matrice. Un DSP à haute performance typique peut aujourd'hui contenir 16–32 unités MAC par cœur, comparativement à 4–8 dans les conceptions antérieures de 45 nm. Cela permet à un seul noyau d'exécuter plusieurs étapes de radix‐2 FFT en parallèle, réduisant de façon spectaculaire la latence pour la démodulation OFDM en temps réel dans les communications sans fil.

La réduction de la masse de mémoire des cellules SRAM fournit des caches L1 et L2 plus grands et des mémoires de scratch sans augmenter proportionnellement la surface. Par exemple, le déplacement de 28 nm à 7 nm triple approximativement la densité de SRAM embarqué, permettant aux DSP de maintenir des coefficients de filtre plus importants ou des tables de poids de faisceau formant sur puce.

Améliorations apportées aux instructions et aux systèmes

Avec plus de transistors disponibles, les architectures de série d'instructions (ISA) évoluent pour inclure des instructions spécialisées pour l'arithmétique des nombres complexes, l'arrondi, la saturation et la rétroversion des bits. Ces instructions, souvent mises en place comme machines à micro-codage, réduisent le nombre de cycles par MAC et améliorent la densité de code.

Exemple : un DSP de 14 nm peut traiter un FFT de 256 points dans environ 1,2 μs à 1,5 GHz; le même algorithme sur une version de 7 nm du même noyau fonctionne dans 0,6 μs à 2,4 GHz, ce qui représente une amélioration de 2×. Combiné au doublement des unités de MAC, les gains de rendement réel de 3–4× par génération sont communs dans les noyaux DSP en boucle étroite.

Impact sur l'efficacité énergétique

L'efficacité énergétique, mesurée en GOPS/W (giga-opérations par watt), est la mesure la plus critique pour les applications DSP alimentées par batterie et limitées thermiquement. L'échelle des processus a toujours amélioré l'efficacité, mais les mécanismes sont plus nuancés que la réduction de tension simple.

Réduction dynamique de la puissance

La puissance dynamique est proportionnelle à la capacité × tension2 × fréquence. L'échelle réduit la capacité de chaque transistor et interconnecteur, et permet également des tensions de fonctionnement plus faibles. Une baisse de 1,0 V à 28 nm à 0,75 V à 7 nm entraîne une réduction de 44 % de la puissance dynamique par événement de commutation, même si la fréquence augmente. L'effet net est que l'énergie par instruction MAC diminue de façon significative, passant d'environ 10 pJ à 40 nm à moins de 1 pJ à 7 nm pour une MAC standard à 16 bits.

Défis de la puissance statique et de la fuite

La puissance statique, dominée par les fuites subseuil, augmente de façon exponentielle avec la baisse de la tension seuil. Aux nœuds inférieurs à 28 nm, les fuites peuvent représenter 30 à 50% de la puissance totale des puces en régime de ralenti. Les DSP, qui fonctionnent souvent en mode de fonctionnement en régime de service ou en mode d'éclatement, doivent utiliser des systèmes de gavage agressifs, des biais de corps et des bibliothèques CMOS multiseuils pour contrôler les fuites.

Malgré ces mesures, la puissance statique demeure une préoccupation majeure pour les applications DSP toujours sur le marché telles que le réveil par déclenchement vocal ou la fusion de capteurs. Pour faire face, les concepteurs adoptent des systèmes de réglage d'horloge à grain fin et des systèmes de réglage dynamique de la tension (DVFS) au niveau des blocs IP, garantissant que seul le datapath actif consomme une puissance dynamique.

Mesures d'efficacité pour les charges de travail réelles du PSD mondial

Les améliorations de l'efficacité énergétique sont mieux illustrées en comparant les PSD entre les générations. Une étude des carottes de PSD optimisées par le débit montre :

  • 28 nm – ~50 GOPS/W à 1,0 V, 1,2 GHz
  • 16 nm FinFET – ~120 GOPS/W à 0,85 V, 1,5 GHz
  • 7 nm FinFET – ~300 GOPS/W à 0,75 V, 2,4 GHz

Ces chiffres supposent un pipeline DSP typique avec des unités MAC 8-16 et 256 KB de mémoire locale. L'amélioration 6× de 28 nm à 7 nm permet de nouveaux cas d'utilisation comme le traitement radar sur appareil et la formation de faisceaux audio haute résolution qui étaient auparavant impossibles à faire en raison des budgets d'alimentation.

Les compromis et les nouveaux défis

Bien que les avantages de l'échelle soient clairs, la voie menant à des nœuds avancés est de plus en plus complexe et coûteuse.

Coût de fabrication et rendement

Le coût par wafer augmente fortement à chaque nœud en raison de la lithographie avancée (ultraviolet extrême, ou VUE, à 7 nm et moins), de plusieurs étapes de patronage et de l'augmentation des ensembles de masques. Un seul ensemble de masques de 5 nm peut coûter plus de 5 millions de dollars, et les rendements aux nouveaux nœuds sont initialement faibles. Pour les DSP à volume élevé utilisés dans les smartphones et les équipements de réseautage, le coût amorti par puce peut être acceptable, mais pour les applications industrielles ou aérospatiales à volume inférieur, les nœuds plus anciens comme 28 nm ou 22 nm demeurent rentables.

Fiabilité et variabilité

Les dimensions des transistors approchent les échelles atomiques, les variations de processus — fluctuations aléatoires du dopant, rugosité des bords de ligne et erreurs de tension de seuil — deviennent plus prononcées. Cette variabilité peut causer des défaillances de chronométrage dans les trajectoires arithmétiques critiques du DSP, en particulier pour les opérations à point flottant de haute précision.

Dissipation de chaleur et densité thermique

Même si la puissance par transistor diminue, la densité de puissance globale — watts par millimètre carré — a augmenté aux nœuds avancés. Un noyau DSP de 7 nm exécutant une charge de travail soutenue FFT peut générer plus de 100 W/cm2, approcher les limites du refroidissement d'air conventionnel. Cette contrainte thermique oblige souvent les concepteurs à activer la fréquence des horloges ou à mettre en œuvre des politiques sophistiquées de gestion thermique dynamique (DTM), réduisant ainsi le gain de performance réel que promet l'échelle.

. La fin de l'échelle de Dennard a déplacé l'attention de l'échelle de fréquence pure vers l'innovation architecturale et l'accélération spécialisée. Les DSP, avec leurs datapaths réguliers et leurs schémas d'accès à la mémoire prévisibles, sont bien placés pour exploiter la densité de transistors que fournissent les nœuds avancés, mais seulement si les concepteurs gèrent soigneusement les fuites et les budgets thermiques. . .

Orientations futures : Au-delà de l'échelle conventionnelle

Comme Moore , Loi ralentit, l'industrie des semi-conducteurs explore plusieurs pistes pour continuer à améliorer la performance et l'efficacité DSP sans compter uniquement sur le rétrécissement géométrique.

Intégration 3D et emballage hétérogénique

Par exemple, un chiplet DSP intégré à une pile de mémoire à haut bande passante (HBM) utilisant des vias de silicon (TSV) peut atteindre une bande passante de plus de 1 To/s – critique pour le traitement radar et lidar. Le collage hybride, qui empile des mort à l'intersection de quelques microns, promet des chemins encore plus courts et une capacité inférieure, ce qui peut améliorer l'efficacité énergétique de 30 à 50% par rapport aux implémentations 2D.

L'intégration hétérogénique permet également de mélanger des noyaux DSP construits sur un nœud logique avancé (par exemple, 5 nm) avec des blocs analogiques/RF sur un nœud plus ancien et moins cher (par exemple, 28 nm).

Nouvelles architectures de matériaux et de transistors

Les FinFET ont dominé la gamme de 16 nm à 3 nm, mais la prochaine étape – les transistors à grande vitesse (GAA) – offre un meilleur contrôle électrostatique et une plus faible fuite. Samsung 3 nm GAA process a montré une réduction de 30 % de puissance à la même performance que FinFET. Pour les DSP, cela se traduit directement par une plus longue durée de vie de la batterie pour les appareils mobiles et une plus faible dissipation thermique pour les contrôleurs industriels.

Au-delà du silicium, les chercheurs étudient des matériaux 2D comme le disulfure de molybdène (MoS2) et les nanotubes de carbone (CNT) pour les futurs nœuds. Bien que expérimentaux, ces matériaux promettent un transport quasi balistique et des fuites extrêmement faibles, ce qui pourrait permettre aux DSP qui fonctionnent à un niveau de sous‐0,5 V.

Architectures spécifiques au domaine

Plutôt que de construire des DSP à usage général monolithique, de nombreux fournisseurs conçoivent maintenant des accélérateurs spécifiques à un domaine pour des tâches telles que FFT, la multiplication matricielle ou l'inférence réseau neuronal. Ces accélérateurs bénéficient encore plus d'une mise à l'échelle car ils échangent la flexibilité pour l'efficacité brute. Un accélérateur FFT dédié sur un nœud de 7 nm peut atteindre plus de 1 TOPS/W—10× mieux qu'un DSP général exécutant le même algorithme.

Opération ultra-faible tension

L'informatique à quasi seuil, où la logique fonctionne à des tensions juste au-dessus du seuil du transistor (0,4–0,6 V), peut réduire l'énergie par opération de 5–10× par rapport à la tension nominale. Bien que les performances diminuent considérablement, ce régime est idéal pour des tâches toujours sur DSP comme le repérage par mots clés ou le conditionnement des capteurs.

Conclusion

L'échelle de la technologie des procédés demeure un puissant moteur pour faire progresser la performance et l'efficacité du processeur DSP, mais la relation s'est développée de plus en plus complexe à mesure que les limites physiques fondamentales approchent. De 28 nm à 3 nm, chaque nouveau nœud a fourni des fréquences d'horloges plus élevées, des unités arithmétiques plus denses et une énergie moindre par opération MAC – ce qui permet d'utiliser des faisceaux 5G en temps réel pour des ultrasons médicaux portables. Cependant, les défis liés aux fuites, aux coûts de fabrication et à la densité thermique exigent une co-optimisation architecturale prudente plutôt que de s'appuyer aveuglement sur une géométrie rétrécissante.


Moore="s Law – Wikipedia
3D Integration Technology Overview – Wevolver
Gate‐All‐Around Transistors – Semiconductor Engineering