Comprendre le rôle des codes du CLD dans 5G NR

Les codes de vérification de la parité de faible densité (LDPC) ont été adoptés comme système de codage des canaux de données dans la nouvelle radio 5G (NR), remplaçant les codes turbo utilisés dans la 4G LTE. Cette transition a été guidée par des codes LDPC. Cette transition a été conduite par des performances de correction d'erreurs supérieures à des taux de code élevés et leur parallélisme inhérent, ce qui permet le décodage à haut débit – une exigence pour le haut débit mobile 5G amélioré (eMBB). La spécification 3GPP (TS 38 212) définit deux graphiques de base (BG1 et BG2) qui permettent un ajustement de taux flexibles et de supporter des tailles de blocs de transport de quelques centaines de bits à des dizaines de milliers de bits.

Principaux défis matériels dans la mise en oeuvre du décodeur de LDPC

1. Complexité et utilisation des ressources

Le décodage du LDPC est généralement effectué à l'aide d'algorithmes itératifs de transmission de messages, le plus souvent l'algorithme de propagation de croyances (BP). Chaque itération nécessite la mise à jour des nœuds de contrôle (CN) et des nœuds variables (VN) en échangeant des messages de probabilité le long des bords du graphique Tanner. Pour un décodeur qui supporte les codes LDPC quasi cycliques utilisés en 5G, le nombre de bords peut varier de dizaines de milliers à plus d'un million pour les grandes tailles de blocs. La mise en œuvre de ces mises à jour dans le matériel exige des ressources logiques importantes : unités de contrôle (CNU), unités de nœuds variables (VNU), réseaux de routage et banques de mémoire pour stocker des messages intermédiaires.

Un autre défi de ressources vient de la précision des messages internes. L'arithmétique en point flottant est peu pratique pour le matériel de faible puissance; au lieu de cela, les représentations en point fixe avec 4-8 bits par message sont fréquentes. Cependant, la réduction de la largeur de bits amplifie les erreurs de quantification, potentiellement dégradantes performances de correction des erreurs.

2. Consommation d ' électricité

L'efficacité énergétique est sans doute la contrainte la plus critique pour les équipements 5G fonctionnant à batterie. Les décodeurs LDPC consomment de l'énergie proportionnelle au nombre d'itérations et à l'activité de commutation dans les unités de traitement et la mémoire. Un décodeur typique peut avoir besoin de 10 à 20 itérations pour converger à des rapports signal-bruit bas (SNR).

La dissipation dynamique de la puissance est dominée par les accès à la mémoire, car les messages sont lus et écrits dans les banques SRAM chaque itération. La réduction de la puissance de la mémoire nécessite des techniques telles que le gage d'horloge, la suppression de la lecture/écriture pour les nœuds de contrôle convergents précocement, et les bibliothèques multi-Vt pour les cellules à faible fuite. La puissance de fuite, bien que plus petite aux nœuds avancés (7nm et moins), devient proportionnellement plus significative pendant les périodes de ralenti.

De plus, l'algorithme lui-même influence la puissance. L'algorithme sum-product (SPA) offre les meilleures performances mais implique des fonctions hyperboliques coûteuses en calcul. La plupart des implémentations matérielles utilisent l'approximation min-sum (MS) ou ses variantes (offset min-sum, min-sum normalisé) pour remplacer les mises à jour de check-node par des opérations de comparaison et de sélection plus simples.

3. Débit et latence

Pour atteindre ce débit, un décodeur LDPC doit traiter un nouveau bloc de code toutes les quelques centaines de nanosecondes. La latence, en particulier pour les communications ultra-fiables à faible latence (URLLC), doit être de l'ordre de dizaines de microsecondes. Ces demandes contradictoires – un débit élevé avec faible latence – imposent des exigences strictes sur l'architecture de décodeur.

Le débit peut être augmenté en traitant plusieurs itérations de façon pipeline, mais la canalisation introduit un gain de latence égal au nombre d'étapes de pipelines par temps de la période d'horloge. Dans les décodeurs entièrement parallèles, le chemin critique réside souvent dans le réseau de routage reliant les CNU et les VNU. À mesure que la taille du code augmente, de longues interconnexions entraînent des retards de propagation du signal qui limitent la fréquence de l'horloge. Les architectures partiellement parallèles réduisent la congestion de routage par les ressources de traitement multiplexes dans le temps, mais cela réduit le débit instantané. Le compromis entre le parallélisme et la latence est capté par le concept de parallélisme efficace[: le nombre de nœuds de contrôle mis à jour simultanément.

4. Congestion de la mémoire et de l'acheminement

Chaque itération nécessite le stockage des LLR de canaux, des messages VN-à-CN, des messages CN-à-VN et parfois des valeurs postérieures. Pour un bloc de code de longueur N = 26144 bits (maximum pour les messages BG1) et 8 bits, l'exigence de mémoire dépasse 200 KB pour les messages internes uniquement. Cette mémoire est généralement mise en œuvre comme plusieurs banques de SRAM pour permettre un accès parallèle. Cependant, l'irrégularité de la matrice de contrôle de parité (même si cyclique pour chaque sous-matrix) crée des schémas d'accès complexes qui peuvent causer des conflits bancaires, réduire l'utilisation de la mémoire et bloquer le pipeline. De plus, le réseau de routage entre les unités de traitement et les banques de mémoire – souvent un changement de baril ou un réseau Benes – représente une zone et une puissance importantes.

5. Flexibilité et soutien multi-normes

Les appareils 5G doivent supporter une large gamme de taux de code (du 1/3 au 8/9) et de tailles de blocs via des versions de redondance et de redondance (RV) pour les demandes de répétition automatique hybride (HARQ). Le matériel de décodeur doit tenir compte de différents facteurs de levage et graphiques de base sans perte de performance importante. La reconfiguration du calendrier de décodage (couched vs. inondé) ou du nombre d'itérations à la volée est également nécessaire pour s'adapter aux différentes conditions de canal et aux exigences de qualité de service (QoS).

Stratégies pour surmonter les défis du matériel

1. Architectures parallèles et pipelines

Le choix du calendrier de décodage a un impact profond sur l'efficacité matérielle. La programmation en couches permet de mettre à jour simultanément tous les nœuds de contrôle, de maximiser le parallélisme mais nécessite un double tamponnement des messages et de conduire à une bande passante de mémoire élevée. Le décodage en couches (également appelé calendrier en rangée ou vertical) traite une rangée de la matrice de contrôle par parité à la fois, permettant une réutilisation immédiate des messages mis à jour et une convergence plus rapide (généralement en réduisant de moitié le nombre d'itérations).

Pour les codes LDPC quasi cycliques, une approche commune est de créer des unités de traitement Z (CNU et VNU) et d'utiliser un réseau de décalage pour aligner les messages selon les déplacements cycliques spécifiés dans la matrice de base. En traitant des couches Z en parallèle (parallélisme sous-bloc), le décodeur peut approcher le débit de conceptions entièrement parallèles tout en maintenant un routage gérable. Pour un débit plus élevé, plusieurs processeurs de sous-bloc peuvent fonctionner simultanément sur différentes lignes, au prix d'un matériel accru.

La canalisation à l'intérieur de chaque unité de traitement est également essentielle pour respecter la fermeture du temps. Par exemple, une UCN peut avoir un pipeline à trois étapes : lire les messages, calculer les valeurs minimales et écrire les résultats. La profondeur du pipeline doit être prise en compte dans l'ordonnancement pour éviter les risques de données. Dans le décodage en couches, le traitement des couches consécutives peut être recoupé si la structure de mémoire permet la lecture simultanée et l'écriture à la même adresse – une technique connue sous le nom de double-buffering ou pipeline interleaving.

2. Optimisations algorithmiques et arithmétiques

L'arithmétique en point fixe est standard, mais une sélection minutieuse de la quantification est essentielle. De nombreux modèles utilisent 6 à 8 bits pour les LLR et 4 à 6 bits pour les messages internes. L'algorithme de la somme min et ses dérivés (résumé min offset, somme min normalisée) sont presque universels en raison de leur faible complexité. Par exemple, la somme min offset soustrait une petite constante (généralement 0,5 en point fixe) de l'amplitude du nœud de contrôle pour compenser la surestimation.

Les techniques de terminaison précoce arrêtent le décodage lorsqu'un mot de code valide est détecté (en utilisant la vérification du syndrome) ou lorsque les messages convergent. Cela réduit la puissance et la latence moyennes, surtout à un niveau élevé de SNR où seulement une ou deux itérations peuvent suffire. La logique de vérification du syndrome doit être soigneusement intégrée pour éviter d'ajouter un long chemin critique.

Une autre optimisation est l'utilisation de autocorrigée de décodage ou d'approches basées sur la fiabilité[, qui suppriment les messages peu fiables pour améliorer la convergence et réduire le nombre d'itérations.Ces techniques ajoutent des frais généraux négligeables du matériel, mais peuvent réduire les itérations requises de 20 à 30 %.

3. Techniques de gestion de l'énergie

La tension dynamique et l'échelle de fréquence (DVFS) permettent au décodeur de fonctionner à une tension et une fréquence d'horloge inférieures lorsque le dispositif n'est pas en mode de débit de pointe, réduisant de façon spectaculaire la puissance dynamique. Puisque la structure de cadre NR 5G comprend des fentes avec des débits de données variables, le décodeur peut être mis dans un état de faible puissance pendant les symboles de ralenti.

Dans le décodeur, le gage d'horloge est appliqué au niveau de l'unité de traitement : lorsqu'un nœud de contrôle ou une mise à jour variable du nœud peut être désactivée pour le reste de l'itération. De même, les banques de mémoire qui ne sont pas accessibles peuvent être mises en mode veille via le gage de puissance de rétention.

4. Réutilisation de la mémoire et compression

Pour les codes quasi cycliques, seules les valeurs de déplacement cyclique doivent être stockées, et non la matrice complète, enregistrant une surface ROM importante. Pour les messages de nœud variable, la quantification progressive et le stockage delta peuvent réduire le nombre de bits de mémoire par message de 1 à 2 bits avec une perte de performance négligeable.

Le calendrier de décodage en couches réduit intrinsèquement les besoins en mémoire, car une seule couche de messages CN-VN doit être stockée à tout moment, contrairement au calendrier inondé qui nécessite un stockage pour tous les bords. Combiné avec les mises à jour en place de la mémoire LLR a posteriori, les décodeurs en couches ont généralement besoin de 50% de mémoire en moins que les décodeurs en couches.

5. Conceptions reconfigurables et multimodes

Pour supporter la gamme complète de paramètres de code 5G, les concepteurs mettent souvent en place une architecture reconfigurable où la sélection du graphique de base, le facteur de levage et le nombre d'itérations sont programmables via des registres de contrôle. Les unités de traitement sont conçues pour gérer la taille maximale du sous-bloc (Z=384), et pour les unités Z plus petites, les unités inutilisées sont alimentées en puissance. Le réseau de changement de poste, généralement un commutateur de baril ou un réseau de Benes multi-étapes, peut être configuré pour correspondre au modèle de déplacement cyclique à la volée.

Certains modèles avancés intègrent un décodeur multimode qui peut gérer les codes LDPC et polaires (utilisés pour les canaux de contrôle en 5G). Cette réutilisation des unités arithmétiques permet d'économiser de la surface mais ajoute de la complexité dans l'ordonnancement et le contrôle.

Algorithmes avancés et leurs implications matérielles

Bien que la somme minimale standard soit adéquate pour de nombreux scénarios, les chercheurs continuent à développer des algorithmes améliorés qui offrent de meilleurs compromis performance-complexité. Des schémas de somme minimale offset multibits ajustent dynamiquement la somme en fonction des conditions du canal, nécessitant une petite table de recherche. Des facteurs de normalisation spécifiques à la couche peuvent améliorer la vitesse de convergence. Une autre direction prometteuse est le décodage stochastique, où les messages sont représentés comme des flux de bits.

La mise en œuvre matérielle de ces algorithmes doit être soigneusement évaluée pour le chemin critique et la puissance. Par exemple, l'ajout d'un multiplicateur pour l'échelle dans la somme min normalisée peut doubler la surface d'une CNU par rapport à une simple unité de somme min. Les avantages de la réduction itération doivent dépasser le coût matériel.

Tendances futures et au-delà 5G

Les débits de bande passante plus élevés (mmWave, sub-THz) et les nouveaux cas d'utilisation comme la détection et la communication intégrées nécessiteront des décodeurs dont le débit dépasse 100 Gbps. L'atteinte de tels débits va probablement pousser des architectures entièrement parallèles pour les petits codes et des architectures stratifiées fortement en pipeline pour les grands codes. Le décodage assisté par l'IA – utilisant des réseaux neuronaux pour prédire la terminaison précoce ou optimiser l'échelle des messages – est un domaine de recherche actif, bien que les moteurs d'inférence efficaces sur le matériel demeurent difficiles pour les appareils mobiles.

Une autre tendance est l'utilisation de flux de conception hautement automatisés: la synthèse de haut niveau (HLS) des modèles C++ permet une exploration plus rapide des compromis architecturaux. Cependant, RTL optimisée main domine toujours les conceptions de production pour une efficacité maximale.

Enfin, l'adoption de codes LDPC au-delà de la 5G, comme pour les communications par satellite et les réseaux d'espaces profonds, continuera de stimuler les innovations dans les applications de décodeurs à haut débit de faible puissance.

Conclusion

La mise en œuvre de décodeurs LDPC pour les appareils 5G est un défi multiforme qui nécessite une conception co-ficieuse des algorithmes et du matériel. La complexité, la puissance, le débit, la mémoire et la flexibilité interagissent tous dans un espace de conception restreint. Grâce au décodage en couches, à l'optimisation de l'arithmétique, à la gestion de l'énergie avancée et aux datapaths reconfigurables, les ingénieurs ont développé des décodeurs qui répondent aux objectifs ambitieux de 5G NR.

Pour plus de détails sur la norme 5G NR LDPC, voir la spécification 3GPP TS 38.212. Un examen détaillé des architectures de décodeurs LDPC peut être trouvé dans ce document de l'IEEE. Un exemple de décodeur à faible puissance est présenté dans ce travail sur 28nm CMOS.