engineering-design-and-analysis
Eine Überprüfung der Hardware-Implementierungsherausforderungen für Ldpc-Decoder in 5g-Geräten
Table of Contents
Die Rolle von LDPC-Codes in 5G NR verstehen
LDPC-Codes (LDPC-Codes mit niedriger Dichte) wurden als Kanalcodierungsschema für Datenkanäle in 5G New Radio (NR) übernommen und ersetzen die in 4G LTE verwendeten Turbocodes. Dieser Übergang wurde durch die überlegene Fehlerkorrekturleistung von LDPC-Codes bei hohen Coderaten und deren inhärente Parallelität angetrieben, die eine Dekodierung mit hohem Durchsatz ermöglicht - eine Voraussetzung für 5G Enhanced Mobile Breitband (eMBB). Die 3GPP-Spezifikation (TS 38.212) definiert zwei Basisgraphen (BG1 und BG2), die eine flexible Ratenanpassung ermöglichen und Transportblockgrößen von einigen hundert Bits bis zu Zehntausenden von Bits unterstützen.
Wichtige Hardware-Herausforderungen bei der Implementierung von LDPC-Decodern
1. Komplexität und Ressourcennutzung
Die LDPC-Dekodierung wird typischerweise unter Verwendung iterativer Nachrichten-Übergabealgorithmen durchgeführt, am häufigsten der Glaube-Propagation-Algorithmus (BP) . Jede Iteration erfordert die Aktualisierung von Prüfknoten (CN) und variablen Knoten (VN) durch den Austausch von Wahrscheinlichkeitsnachrichten entlang der Ränder des Tanner-Graphens. Für einen Decoder, der die quasi-zyklischen LDPC-Codes unterstützt, die in 5G verwendet werden, kann die Anzahl der Ränder von Zehntausenden bis über einer Million für große Blockgrößen reichen. Die Implementierung dieser Updates in Hardware erfordert erhebliche Logikressourcen: Prüfknoteneinheiten (CNU), variable Knoteneinheiten (VNU), Routing-Netzwerke und Speicherbänke, um Zwischennachrichten zu speichern. In einem ASIC erhöht der physische Bereich, der von diesen Komponenten verbraucht wird, direkt die Siliziumkosten. Für mobile Geräte, bei denen der Die-Bereich eine Premium-Leistung hat, müssen Designer die Anzahl der parallelen Verarbeitungseinheiten sorgfältig gegen den erforderlichen Durchsatz abwägen. Eine vollständig parallele Architektur bietet maximale Geschwindigkeit, ist jedoch für große Codelängen aufgrund von Routing-
Eine weitere Herausforderung bei den Ressourcen ergibt sich aus der Präzision interner Nachrichten. Die Floating-Point-Arithmetik ist für Hardware mit geringem Stromverbrauch unpraktisch; stattdessen sind Fixpunktdarstellungen mit 4-8 Bit pro Nachricht üblich. Allerdings verstärkt die Reduzierung der Bitbreite Quantisierungsfehler und verringert möglicherweise die Fehlerkorrekturleistung. Simulationen sind erforderlich, um die minimale Bitbreite zu bestimmen, die die Zielblockfehlerrate (BLER) unter 5G-Kanalbedingungen erfüllt, was dem Designraum eine weitere Dimension hinzufügt.
2. Stromverbrauch
Die Energieeffizienz ist wohl die wichtigste Einschränkung für batteriebetriebene 5G-Benutzergeräte (UE). LDPC-Decoder verbrauchen aufgrund ihrer iterativen Natur Energie, die proportional zur Anzahl der Iterationen und der Schaltaktivität in Verarbeitungseinheiten und Speicher ist. Ein typischer Decoder benötigt möglicherweise 10-20 Iterationen, um bei niedrigen Signal-Rausch-Verhältnissen (SNR) zu konvergieren.
Die dynamische Leistungsableitung wird durch Speicherzugriffe dominiert, da Nachrichten gelesen und in jede Iteration in SRAM-Banken geschrieben werden. Die Reduzierung der Speicherleistung erfordert Techniken wie Clock-Gating, Lese-/Schreibunterdrückung für frühe konvergierte Prüfknoten und Multi-Vt-Bibliotheken für Zellen mit geringer Leckage. Die Leckageleistung wird bei fortgeschrittenen Knoten kleiner (7nm und darunter), wird jedoch im Leerlauf proportional signifikanter. Designer können Power-Gating verwenden, um Decoderblöcke vollständig herunterzufahren, wenn sie nicht verwendet werden, aber die Aufwecklatenz muss für 5G-Latenzbudgets akzeptabel sein (rund 1 ms Roundtrip-Zeit für URLLC).
Der Summenproduktalgorithmus (SPA) bietet die beste Leistung, beinhaltet jedoch rechenintensive hyperbolische Funktionen. Die meisten Hardware-Implementierungen verwenden die Min-Summe (MS)-Näherung oder ihre Varianten (Offset-Min-Summe, normalisierte Min-Summe), um Check-Node-Updates durch einfachere Vergleichs- und Auswahloperationen zu ersetzen. Dies reduziert die Logikkomplexität und die dynamische Leistung, allerdings auf Kosten einer geringen Leistungsstrafe, die durch erhöhte Iterationen oder Algorithmus-Verfeinerungen kompensiert werden kann.
3. Durchsatz und Latenz
5G NR zielt auf Spitzendatenraten von 20 Gbps für Downlink und 10 Gbps für Uplink ab. Um einen solchen Durchsatz zu erreichen, muss ein LDPC-Decoder alle paar hundert Nanosekunden einen neuen Codeblock verarbeiten. Latenz, insbesondere für ultrazuverlässige Kommunikation mit niedriger Latenz (URLLC), muss in der Größenordnung von zehn Mikrosekunden liegen. Diese widersprüchlichen Anforderungen - hoher Durchsatz mit niedriger Latenz - stellen hohe Anforderungen an die Decoderarchitektur.
Der Durchsatz kann durch die Verarbeitung mehrerer Iterationen in einer Pipeline-Art und Weise erhöht werden, aber Pipelining führt eine Latenzzeit-Overhead ein, die der Anzahl der Pipeline-Stufen mal der Taktperiode entspricht. Bei vollständig parallelen Decodern liegt der kritische Pfad oft im Routing-Netzwerk, das CNUs und VNUs verbindet. Mit zunehmender Codegröße verursachen lange Verbindungsleitungen Signalausbreitungsverzögerungen, die die Taktfrequenz begrenzen. Teilweise parallele Architekturen reduzieren Routing-Stau durch Zeitmultiplexing-Verarbeitungsressourcen, aber dies reduziert den momentanen Durchsatz. Der Kompromiss zwischen Parallelität und Latenz wird durch das Konzept der effektiven Parallelität erfasst: die Anzahl der gleichzeitig aktualisierten Prüfknoten. Für 5G LDPC-Codes mit quasizyklischer Struktur bestimmt der Hubfaktor Z die natürliche Parallelität (normalerweise bis zu 384 für BG1). Ein Decoder, der Z-Prüfknoten pro Zyklus verarbeitet, erreicht den höchsten Durchsatz, erfordert jedoch Z CNUs, die flächenunerschwinglich sein können.
4. Gedächtnis und Routing-Verstopfung
LDPC-Decoder sind speichergebunden. Jede Iteration erfordert die Speicherung der Kanal-LLRs, VN-zu-CN-Nachrichten, CN-zu-VN-Nachrichten und manchmal a posteriori-Werte. Für einen Codeblock von Länge N = 26144 Bits (maximal für BG1) und 8-Bit-Nachrichten übersteigt der Speicherbedarf allein für interne Nachrichten 200 KB pro Iteration. Dieser Speicher ist typischerweise als mehrere Banken von SRAM implementiert, um parallelen Zugriff zu ermöglichen. Die Unregelmäßigkeit der Paritätsprüfmatrix (obwohl zyklisch für jede Submatrix) erzeugt jedoch komplexe Zugriffsmuster, die Bankkonflikte verursachen können, wodurch die Speicherauslastung reduziert und die Pipeline blockiert wird. Darüber hinaus verbraucht das Routing-Netzwerk zwischen Verarbeitungseinheiten und Speicherbanken - oft ein Barrelshifter oder ein Benes-Netzwerk - erhebliche Fläche und Leistung. In fortgeschrittenen CMOS-Knoten dominiert die Verbindungsverzögerung den kritischen Pfad, was die Bodenplanung und die Drahtoptimierung entscheidend macht.
5. Flexibilität und Multistandard-Unterstützung
5G-Geräte müssen eine breite Palette von Coderaten (von 1/3 bis 8/9) und Blockgrößen über Ratenanpassungs- und Redundanzversionen (RV) für hybride automatische Wiederholungsanforderungen (HARQ) unterstützen. Die Decoder-Hardware muss unterschiedliche Hubfaktoren und Basisgraphen ohne erheblichen Leistungsverlust aufnehmen. Die Neukonfiguration des Decodierungsplans (Schichten-Vs.-Überflutung) oder der Anzahl der Iterationen im laufenden Betrieb ist auch erforderlich, um sich an unterschiedliche Kanalbedingungen und QoS-Anforderungen anzupassen. Die Notwendigkeit der Flexibilität zwingt Designer oft dazu, teilweise parallele Architekturen mit programmierbarem Speicher für die Paritätsprüfmatrix zu übernehmen, was zu mehr Komplexität führt und die maximale Taktfrequenz im Vergleich zu einem Festfunktionsdesign reduziert.
Strategien zur Überwindung von Hardware-Herausforderungen
1. Parallele und Pipelined Architekturen
Die Wahl des Decodierungsplans hat einen großen Einfluss auf die Hardwareeffizienz. Die geflutete Planung aktualisiert alle Prüfknoten gleichzeitig, maximiert die Parallelität, erfordert jedoch Doppelpufferung von Nachrichten und führt zu einer hohen Speicherbandbreite. Die geschichtete Decodierung (auch zeilenlagige oder vertikale Planung genannt) verarbeitet jeweils eine Zeile der Paritätsüberprüfungsmatrix, wodurch eine sofortige Wiederverwendung aktualisierter Nachrichten und eine schnellere Konvergenz (normalerweise die Anzahl der Iterationen halbiert) ermöglicht wird. Dies reduziert sowohl die Latenz als auch die Leistung, wodurch die geschichtete Decodierung in modernen 5G-Decodern äußerst beliebt wird.
Architektonisch gesehen muss der Parallelitätsgrad der Struktur des Codes entsprechen. Bei quasi-zyklischen LDPC-Codes besteht ein gängiger Ansatz darin, Z-Verarbeitungseinheiten (CNUs und VNUs) zu instanziieren und Nachrichten mit einem Schiebenetzwerk entsprechend den in der Basismatrix angegebenen zyklischen Verschiebungen auszurichten. Durch die parallele Verarbeitung von Z-Schichten (Subblockparallelität) kann der Decoder den Durchsatz von vollständig parallelen Designs annähern und gleichzeitig ein überschaubares Routing beibehalten. Für einen höheren Durchsatz können mehrere solcher Subblockprozessoren gleichzeitig auf verschiedenen Zeilen arbeiten, was zu Lasten einer erhöhten Hardware geht.
Die Datenverarbeitungs- und -verarbeitungs-Datenverarbeitungs- und -verarbeitungs-Datenverarbeitungs-Datenverarbeitungs-Datenverarbeitungs-Datenverarbeitungs-Datenverarbeitungs-Datenverarbeitungs-Datenverarbeitungs-Datenverarbeitungs-Datenverarbeitungs-Datenverarbeitungs-Datenverarbeitungs-Datenverarbeitungs-Datenverarbeitungs-Datenverarbeitungs-Datenverarbeitungs-Datenverarbeitungs-Datenverarbeitungs-Datenverarbeitungs-Datenverarbeitungs-Datenverarbeitungs-Datenverarbeitungs-Datenverarbeitungs-Datenverarbeitungs-Datenverarbeitungs-Datenverarbeitungs-Datenverarbeitungs-Datenverarbeitungs-Datenverarbeitungs-Datenverarbeitungs-Datenverarbeitungs-Datenverarbeitungs-Datenverarbeitungs-Datenverarbeitungs-Datenverarbeitungs-Datenverarbeitungs-Datenverarbeitungs-Datenverarbeitungs-Datenverarbeitungs-Datenverarbeitungs-Datenverarbeitungs-Datenverarbeitungs-Datenverarbeitungs-Datenverarbeitungs-Datenverarbeitungs-Datenverarbeitungs-Datenverarbeitungs-Datenverarbeitungs-Datenverarbeitungs-Datenverarbeitungs-Datenverarbeitungs-Datenverarbeitungs-Datenverarbeitungs-Datenverarbeitungs-Datenverarbeitungs-Datenverarbeitungs-Datenverarbeitungs-Datenverarbeitungs-Datenverarbeitungs-Datenverarbeitungs-Daten
2. Algorithmen und Arithmetikoptimierungen
Die Festpunkt-Arithmetik ist Standard, aber eine sorgfältige Quantisierungsauswahl ist wichtig. Viele Entwürfe verwenden 6-8 Bits für LLRs und 4-6 Bits für interne Nachrichten. Der Min-Summen-Algorithmus und seine Ableitungen (Offset-Min-Summe, normalisierte Min-Summe) sind aufgrund ihrer geringen Komplexität nahezu universell. Beispielsweise subtrahiert Offset-Min-Summe eine kleine Konstante (normalerweise 0,5 in Festpunkt) von der Prüfknotengröße, um Überschätzungen auszugleichen. Normalisierte Min-Summe verwendet einen Skalierungsfaktor (z. B. 0,75). Diese Algorithmen können mit einfachen Komparatoren, Addierern und Shiftern implementiert werden, wodurch die für SPA erforderlichen Nachschlagtabellen vermieden werden.
Die Frühabbruchtechniken beenden die Dekodierung, wenn ein gültiges Codewort erkannt wird (durch Syndromprüfung) oder wenn die Nachrichten konvergiert sind. Dies verringert die durchschnittliche Leistung und Latenz, insbesondere bei hohen SNR, wo nur eine oder zwei Iterationen ausreichen können. Die Logik zur Überprüfung des Syndroms muss sorgfältig integriert werden, um ein Hinzufügen eines langen kritischen Pfades zu vermeiden.
Eine weitere Optimierung ist die Verwendung von selbstkorrigierten Decodierung oder zuverlässigkeitsbasierten Ansätzen, die unzuverlässige Nachrichten unterdrücken, um die Konvergenz zu verbessern und die Anzahl der Iterationen zu reduzieren.
3. Energiespartechniken
Die dynamische Spannungs- und Frequenzskalierung (DVFS) ermöglicht es dem Decoder, bei einer niedrigeren Spannung und Taktfrequenz zu arbeiten, wenn sich das Gerät nicht im Spitzendurchsatz befindet, was die dynamische Leistung drastisch reduziert. Da die 5G-NR-Rahmenstruktur Slots mit unterschiedlichen Datenraten enthält, kann der Decoder während der Leerlaufsymbole in einen Zustand mit geringer Leistung versetzt werden. Der Power Gating schaltet den Decoder vollständig aus, wenn keine Codeblöcke decodiert werden, die Startlatenz jedoch vom Scheduler ausgeblendet werden muss.
Innerhalb des Decoders wird auf der Ebene der Verarbeitungseinheit ein Clock-Gating angewendet: Wenn ein Prüfknoten oder variabler Knoten die Aktualisierung beendet, kann seine Uhr für den Rest der Iteration deaktiviert werden. Ebenso können Speicherbänke, auf die nicht zugegriffen wird, über Retentions-Power-Gating in den Ruhezustand versetzt werden. In fortgeschrittenen Knoten kann ein feinkörniges Power-Gating die Leckage in Leerlaufbereichen um 90% reduzieren.
4. Memory Reuse und Compression
Speicher ist ein dominanter Beitrag zu Bereich und Leistung. Das Komprimieren der Paritätsprüfungsmatrixdarstellung kann den Speicherbedarf reduzieren. Bei quasizyklischen Codes müssen nur die zyklischen Verschiebungswerte gespeichert werden, nicht die vollständige Matrix, wodurch ein signifikanter ROM-Bereich eingespart wird. Bei variablen Knotennachrichten können inkrementelle Quantisierung und Delta-Speicher die Anzahl der Speicherbits pro Nachricht um 1-2 Bits mit vernachlässigbarem Leistungsverlust reduzieren.
Der geschichtete Decodierungsplan reduziert inhärent den Speicherbedarf, da nur CN-zu-VN-Nachrichten einer Schicht jederzeit gespeichert werden müssen, im Gegensatz zu gefluteter Planung, die Speicher für alle Ränder erfordert. In Kombination mit lokalen Updates des a posteriori LLR-Speichers benötigen geschichtete Decoder typischerweise 50% weniger Speicher als geflutete Decoder.
5. Rekonfigurierbare und Multi-Mode-Designs
Um den vollen Bereich der 5G-Codeparameter zu unterstützen, implementieren Entwickler häufig eine rekonfigurierbare Architektur, bei der die Basisgraphenauswahl, der Lifting-Faktor und die Anzahl der Iterationen über Steuerregister programmierbar sind. Die Verarbeitungseinheiten sind so ausgelegt, dass sie die maximale Subblockgröße (Z = 384) handhaben, und für kleinere Z sind nicht verwendete Einheiten power-gated. Das Schiebenetzwerk, typischerweise ein Barrelshifter oder mehrstufiges Benes-Netzwerk, kann so konfiguriert werden, dass es dem zyklischen Schiebemuster im laufenden Betrieb entspricht.
Einige fortschrittliche Designs enthalten einen Multimode-Decoder, der sowohl LDPC- als auch Polarcodes (für Steuerungskanäle in 5G verwendet) verarbeiten kann. Diese Wiederverwendung von Recheneinheiten spart zwar Platz, erhöht jedoch die Komplexität bei der Planung und Steuerung.
Fortgeschrittene Algorithmen und ihre Hardware-Implikationen
Während Standard-Minsumme für viele Szenarien ausreichend ist, entwickeln die Forscher weiterhin verbesserte Algorithmen, die bessere Kompromisse zwischen Leistung und Komplexität bieten. Multi-Bit-Offset-Minsummenschemata passen den Offset dynamisch an, basierend auf Kanalbedingungen, was eine kleine Nachschlagetabelle erfordert. Schichtspezifische Normalisierungsfaktoren können die Konvergenzgeschwindigkeit verbessern. Eine weitere vielversprechende Richtung ist stochastische Dekodierung, wo Nachrichten als Bitströme dargestellt werden. Stochastische LDPC-Dekodierer haben eine extrem niedrige Fläche pro Knoten, erfordern aber lange Ströme für eine genaue Darstellung, was den Durchsatz begrenzt. Sie werden hauptsächlich für kurze Codes untersucht.
Die Implementierung dieser Algorithmen muss sorgfältig auf kritischen Pfad und Leistung hin bewertet werden. Zum Beispiel kann das Hinzufügen eines Multiplikators für die Skalierung in normalisierter Minsumme die Fläche einer CNU im Vergleich zu einer einfachen Minsummeneinheit verdoppeln. Die Vorteile der Iterationsreduzierung müssen die Hardwarekosten überwiegen. Viele kommerzielle Designs bleiben aufgrund ihres günstigen Kompromisses mit Offset-Minsummen bestehen.
Zukünftige Trends und mehr als 5G
Da sich 3GPP in Richtung 5G-Advanced und 6G entwickelt, werden die Anforderungen an LDPC-Decoder steigen. Höhere Bandbreiten (mmWave, Sub-THz) und neue Anwendungsfälle wie integrierte Sensorik und Kommunikation erfordern Decoder mit einem Durchsatz von mehr als 100 Gbps. Das Erreichen solcher Raten wird wahrscheinlich vollständig parallele Architekturen für kleinere Codes und stark gepipelineste geschichtete Architekturen für größere Codes vorantreiben. AI-unterstützte Dekodierung - unter Verwendung neuronaler Netzwerke zur Vorhersage einer frühen Terminierung oder Optimierung der Nachrichtenskalierung - ist ein aktiver Forschungsbereich, obwohl hardwareeffiziente Inferenz-Engines für mobile Geräte weiterhin eine Herausforderung darstellen.
Ein weiterer Trend ist der Einsatz hochautomatisierter Design-Flows: High-Level-Synthese (HLS) aus C++-Modellen ermöglicht eine schnellere Erkundung architektonischer Kompromisse. Allerdings dominiert die handoptimierte RTL immer noch Produktionsdesigns für maximale Effizienz. Wir können eine stärkere Integration von spezialisierten LDPC-Decoder-IP-Cores mit Soft-Prozessor-Subsystemen für Flexibilität erwarten.
Schließlich wird die Einführung von LDPC-Codes über 5G hinaus, wie etwa für Satellitenkommunikation und Weltraumnetze, weiterhin Innovationen bei Decoder-Implementierungen mit niedrigem Strom- und hohem Durchsatz vorantreiben.
Schlussfolgerung
Die Implementierung von LDPC-Decodern für 5G-Geräte ist eine vielschichtige Herausforderung, die ein sorgfältiges Co-Design von Algorithmen und Hardware erfordert. Komplexität, Leistung, Durchsatz, Speicher und Flexibilität interagieren alle in einem eingeschränkten Designraum. Durch den Einsatz von geschichteter Dekodierung, optimiertem arithmetisches, fortschrittliches Energiemanagement und rekonfigurierbaren Datenpfaden haben Ingenieure Decoder entwickelt, die die ehrgeizigen Ziele von 5G NR erfüllen. Da sich drahtlose Systeme weiterentwickeln, werden die Lehren aus diesen Implementierungen die nächste Generation von Fehlerkorrektur-Hardware informieren und eine zuverlässige und effiziente Kommunikation in einer zunehmend vernetzten Welt gewährleisten.
Für weitere Informationen zum 5G NR LDPC-Standard siehe die 3GPP-Spezifikation TS 38.212 Eine detaillierte Umfrage zu LDPC-Decoder-Architekturen finden Sie in diesem IEEE-Papier. Ein Beispiel für einen Layer-Decoder mit geringem Stromgehalt wird in dieser Arbeit an 28nm CMOS vorgestellt.