Inzicht in de rol van LDPC-codes in 5G NR

Low-Density Parity-Check (LDPC) codes zijn aangenomen als het kanaal codering schema voor data kanalen in 5G New Radio (NR), ter vervanging van de turbo codes gebruikt in 4G LTE. Deze overgang werd aangedreven door LDPC codes . superieure fout-correctie prestaties bij hoge code rates en hun inherent parallelisme, die hoge doorvoer decodering . een vereiste voor 5G verbeterde mobiele breedband (eMBB) . De 3GPP specificatie (TS 38.212) definieert twee basis grafieken (BG1 en BG2) die flexibele snelheid matching en ondersteuning van het transport blok maten van een paar honderd bits tot tienduizenden bits toestaan. Hoewel de theoretische voordelen zijn duidelijk, de praktische implementatie van LDPC decoders binnen de strakke macht, gebied, en latentie beperkingen van 5G apparaten blijft een fors technische uitdaging.

Belangrijkste uitdagingen voor hardware in LDPC Decoder Implementatie

1. Complexiteit en gebruik van hulpbronnen

LDPC decodering wordt meestal uitgevoerd met behulp van iteratieve message-passing algoritmen, meestal de geloofsverruiming (BP) algoritme. Elke iteratie vereist het bijwerken van controleknooppunten (CN) en variabele nodes (VN) door het uitwisselen van waarschijnlijkheidsberichten langs de randen van de Tanner grafiek. Voor een decoder die de quasi-cyclische LDPC codes gebruikt in 5G, het aantal randen kan variëren van tienduizenden tot meer dan een miljoen voor grote blokgroottes. De uitvoering van deze updates in hardware vereist aanzienlijke logische middelen: check-node eenheden (CNU), variabele-node eenheden (VNU), routering netwerken, en geheugenbanken om intermediaire berichten op te slaan. In een ASIC, de fysieke gebied verbruikt door deze componenten rechtstreeks verhoogt siliciumkosten. Voor mobiele apparaten, waar het Die Area is op een premie, moeten ontwerpers zorgvuldig evenwicht het aantal parallelle verwerkingseenheden tegen de vereiste doorvoer. Een volledig parallelle architectuur biedt maximale snelheid maar is verboden voor grote codelengtes als gevolg van het routeren van congestie en gebiedsexplosie.

Een andere resource challenge is het gevolg van de precisie van interne berichten. Floating-point rekenen is onpraktisch voor hardware met een laag vermogen; in plaats daarvan, vaste punt weergaven met 4

2. Energieverbruik

Energie-efficiëntie is misschien wel de meest kritische beperking voor batterij-gebeuren 5G-gebruikersapparatuur (UE). LDPC-decoders, door hun iteratieve aard, verbruiken energie evenredig met het aantal iteraties en de schakelactiviteit in verwerkingseenheden en geheugen. Een typische decoder kan 10 .20 iteraties nodig hebben om samen te komen bij lage signaal-ruis ratio's (SNR). Tijdens piekdoorvoer werking, de decoder kan domineren het stroombudget van de basisband processor.

Dynamische stroomdissipatie wordt gedomineerd door geheugentoegangen, zoals berichten worden gelezen en geschreven naar SRAM-banken elke iteratie. Het verminderen van geheugenvermogen vereist technieken zoals klokgating, lees/schrijf onderdrukking voor vroege convergeerde controleknooppunten, en multi-Vt bibliotheken voor laag-leakage cellen. Leak power, terwijl kleiner op geavanceerde knooppunten (7nm en lager), wordt proportioneel significanter tijdens stationaire periodes. Ontwerpers kunnen gebruik maken van stroom die zich aan de macht te sluiten decoder blokken volledig wanneer niet in gebruik, maar de wake-up latency moet aanvaardbaar zijn voor 5G latency budgetten (ongeveer 1 ms ronde-trip tijd voor URLLC).

Bovendien beïnvloedt het algoritme zelf de macht. Het sum-product algoritme (SPA) biedt de beste prestaties, maar omvat computationeel dure hyperbolische functies. De meeste hardware implementaties gebruiken de min-sum (MS) benadering of de varianten (offset min-sum, genormaliseerd min-sum) om check-node updates te vervangen door eenvoudigere vergelijking-en-select operaties. Dit vermindert de logica complexiteit en dynamische kracht, hoewel ten koste van een kleine prestatie boete die kan worden gecompenseerd door verhoogde iteraties of algoritme verfijningen.

3. Doorvoer en doorzettingsvermogen

5G NR richt piekdatasnelheden van 20 Gbps voor downlink en 10 Gbps voor uplink. Om een dergelijke doorvoer te bereiken, moet een LDPC-decoder een nieuwe codeblok verwerken om de paar honderd nanoseconden. Latency, vooral voor ultra-betrouwbare lage-letterige communicatie (URLLC), moet op de volgorde van tientallen microseconden. Deze tegenstrijdige eisen . hoge doorvoer met lage latency plaats strenge eisen op decoder architectuur.

De doorvoer kan worden verhoogd door het verwerken van meerdere iteraties in een pijpleiding, maar pipelining introduceert een latency overhead gelijk aan het aantal pijpleiding stadia maal de klokperiode. In volledig parallelle decoders, de kritieke pad vaak ligt in het routeringsnetwerk CNU's verbinden en VNU's. Naarmate de code grootte groeit, lange interconnecties leiden signaal propagatie vertragingen die klokfrequentie te beperken. Gedeeltelijk parallele architecturen verminderen routering congestie door tijd-multiplexing verwerkingsmiddelen, maar dit vermindert momentane doorvoer. De trade-off tussen parallelisme en latentie wordt vastgelegd door het concept van []effectieve parallelisme[]: het aantal controleknooppunten dat gelijktijdig bijgewerkt wordt. Voor 5G LDPC codes met quasi-cyclische structuur bepaalt de heffactor Z het natuurlijke parallelisme (gewoonlijk tot 384 voor BG1). Een decoder die Z-checkknooppunten per cyclus de hoogste doorvoersnelheid bereikt, maar die Z-CNU's, die gebiedsverbodig zijn.

4. Geheugen en Routing Congestie

LDPC-decoders zijn geheugengebonden. Elke iteratie vereist opslag van de kanaal LLR's, VN-naar-CN-berichten, CN-naar-VN-berichten, en soms a posteriori waarden. Voor een codeblok van lengte N[ = 26144 bits (maximum voor BG1) en 8-bits berichten, de geheugenbehoefte overschrijdt 200 KB periteratie voor interne berichten alleen. Dit geheugen wordt meestal geïmplementeerd als meerdere banken van SRAM om parallelle toegang mogelijk te maken. Echter, de onregelmatigheid van de pariteit-check matrix (ook al cyclisch voor elke submatrix) creëert complexe toegangspatronen die bankconflicten kunnen veroorzaken, waardoor het gebruik van het geheugen wordt verminderd en de pijpleiding wordt geblokkeerd. Bovendien, het routing netwerk tussen verwerkingseenheden en geheugenbanken .Vaak een vatverschuivend of een Benes netwerk . In geavanceerde CMOS-knooppunten, domineert de interconnect vertraging de kritische weg, waardoor vloerplanning en draadoptimalisatie cruciaal is.

5. Flexibiliteit en ondersteuning van meerdere standaarden

5G-apparaten moeten een breed scala aan codesnelheden ondersteunen (van 1/3 tot 8/9) en blokgroottes via snelheidsmatching en redundantieversies (RV) voor hybride automatische repeat repeat request (HARQ). De decoder hardware moet verschillende heffactoren en basisgrafieken zonder substantieel prestatieverlies bevatten. Het opnieuw configureren van het decoderingsschema (gelaagd vs. overstroomd) of het aantal iteraties op de vlieg is ook nodig om zich aan te passen aan verschillende kanaalomstandigheden en de eisen van de kwaliteit van de dienst (QoS). De behoefte aan flexibiliteit dwingt ontwerpers vaak om gedeeltelijk parallelle architecturen aan te nemen met programmeerbare opslag voor de pariteit-checkmatrix, wat complexiteit toevoegt en de maximale klokfrequentie vermindert in vergelijking met een vast functionerend ontwerp.

Strategieën om hardware uitdagingen te overwinnen

1. Parallelle en gepipelinede architectuur

De keuze van het decoderen schema heeft een diepe impact op de hardware-efficiëntie. Overstroomde planning updates alle controleknooppunten tegelijkertijd, het maximaliseren van parallelisme maar vereist dubbel-buffer van berichten en leidt tot een hoge geheugenbandbreedte. Gelaagde decodering (ook wel rij-gelaagde of verticale planning) verwerkt één rij van de pariteit-check matrix per keer, waardoor onmiddellijk hergebruik van bijgewerkte berichten en snellere convergentie (typisch halveren van het aantal iteraties). Dit vermindert zowel latency als macht, waardoor gelaagde decodering uiterst populair in moderne 5G decoders.

Architectureel gezien moet de mate van parallelisme overeenkomen met de codestructuur. Voor quasi-cyclische LDPC-codes is een gemeenschappelijke aanpak het instantiëren van Z-verwerkingseenheden (CNU's en VNU's) en het gebruik van een shiftnetwerk om berichten uit te lijnen volgens de cyclische verschuivingen die in de basismatrix zijn gespecificeerd. Door Z-lagen parallel te verwerken (subblok parallelisme), kan de decoder de doorvoer van volledig parallelle ontwerpen benaderen met behoud van beheersbare routering. Voor hogere doorvoer, kunnen meerdere dergelijke subblokprocessoren tegelijkertijd werken op verschillende rijen, ten koste van verhoogde hardware.

Pijplijnen binnen elke verwerkingseenheid is ook essentieel om te voldoen aan de sluiting van de tijd. Bijvoorbeeld, een CNU kan een 3-traps pijpleiding hebben: lees berichten, bereken minimum waarden en schrijfresultaten. De diepte van de pijpleiding moet worden verantwoord in de planning om datarisico's te voorkomen. In gelaagde decodering, kan de verwerking van opeenvolgende lagen worden overlapt als de geheugenstructuur gelijktijdig lees- en schrijfmogelijkheden biedt aan dezelfde adres- en schrijfwijze als dubbele-buffer of pipeline inter-out .

2. Algoritmische en rekenkundige optimalisaties

Vaste-punt rekenkundig is standaard, maar een zorgvuldige selectie van de quantization is essentieel. Veel ontwerpen gebruiken 6 .8 bits voor LLR's en 4 .6 bits voor interne berichten. De min-sum algoritme en de derivaten ervan (offset min-sum, genormaliseerd min-sum) zijn bijna universeel vanwege hun lage complexiteit. Bijvoorbeeld, offset min-sum trekt een kleine constante (meestal 0,5 in vaste-punt) uit de check-node magnitude te compenseren voor overbetalen. Genormaliseerde min-sum past een schaalfactor (bijv., 0.75). Deze algoritmen kunnen worden geïmplementeerd met eenvoudige vergelijkings-, adders en veranderaars, het vermijden van de lookup tabellen die nodig zijn voor SPA.

Vroegtijdige beëindigingstechnieken stoppen met decoderen wanneer een geldig codewoord wordt gedetecteerd (met behulp van syndroomcontrole) of wanneer de berichten zijn samengekomen. Dit vermindert de gemiddelde kracht en latentie, vooral bij hoge SNR waar slechts een of twee herhalingen volstaan. De syndrome controle logica moet zorgvuldig worden geïntegreerd om te voorkomen dat een lange kritieke pad.

Een andere optimalisatie is het gebruik van zelfgecorrigeerde decodering of -betrouwbaarheidsgebaseerde benaderingen, die onbetrouwbare berichten onderdrukken om de convergentie te verbeteren en het aantal iteraties te verminderen. Deze technieken voegen te verwaarlozen hardware overhead toe maar kunnen de vereiste iteraties met 20

3. Energiebeheertechnieken

Dynamische spanning en frequentie schaalverdeling (DVFS) laat de decoder toe om te werken met een lagere spanning en klokfrequentie wanneer het apparaat niet in piekdoorvoermodus is, waardoor het dynamische vermogen drastisch wordt verminderd. Aangezien de 5G NR framestructuur slots met verschillende datasnelheden omvat, kan de decoder in een lage vermogenstoestand worden geplaatst tijdens stationaire symbolen. Power-vertering schakelt de decoder volledig uit wanneer geen codeblokken worden gedecodeerd, maar de start-up latency moet worden verborgen door de scheduler.

Binnen de decoder wordt klokgating toegepast op het niveau van de verwerkingseenheid: wanneer een controleknooppunt of variabele knoop wordt bijgewerkt, kan de klok worden uitgeschakeld voor de rest van de iteratie. Op dezelfde manier kunnen geheugenbanken die niet worden geopend in slaapmodus worden gebracht via het retentievermogen te rekken. In geavanceerde knooppunten, fijnkorrelige stroomgating kan lekkage verminderen met 90% in stationaire gebieden.

4. Hergebruik en compressie van het geheugen

Het geheugen is een dominante bijdrage aan zowel gebied als vermogen. Comprimeren van de pariteit-check matrix vertegenwoordiging kan de opslagvereisten verminderen. Voor quasi-cyclische codes, alleen de cyclische verschuiving waarden moeten worden opgeslagen, niet de volledige matrix, het opslaan van significante ROM gebied. Voor de variabele node berichten, incrementele quantisatie en delta opslag kan het aantal geheugen bits per bericht te verminderen door 1

Het gelaagde decoderingsschema vermindert inherent de geheugenvereisten omdat slechts één laag een waarde van CN-to-VN-berichten nodig heeft om op elk moment opgeslagen te worden, in tegenstelling tot overstroomde planning die opslag voor alle randen vereist. In combinatie met updates op de plaats van het a posteriori LLR-geheugen, gelaagde decoders hebben meestal 50% minder geheugen nodig dan overstroomde decoders.

5. Herconfigureerbare en multi-mode ontwerpen

Om het volledige bereik van 5G code parameters te ondersteunen, implementeren ontwerpers vaak een herconfigureerbare architectuur waar de basis grafiek selectie, heffactor en aantal iteraties programmeerbaar zijn via besturingsregisters. De verwerkingseenheden zijn ontworpen om de maximale subblokgrootte (Z=384) te verwerken, en voor kleinere Z, ongebruikte eenheden zijn power-gated. Het shift netwerk, typisch een barrel shifter of multi-stage Benes netwerk, kan worden geconfigureerd om het cyclische shift patroon op de vlieg te passen. Ondersteunen HARQ combineren vereist het opslaan van meerdere zachte bits per bit positie; dit kan worden bereikt door het uitbreiden van het LLR geheugen en het schrijven van de gecombineerde waarden passend.

Sommige geavanceerde ontwerpen bevatten een multi-mode decoder die zowel LDPC als polaire codes kan verwerken (gebruikt voor controlekanalen in 5G). Dit hergebruik van rekenkundige eenheden bespaart gebied, maar voegt complexiteit in planning en controle. Voor kostengevoelige UE-chips, dergelijke integratie wordt gebruikelijk.

Geavanceerde algoritmen en hun hardwareimplicaties

Terwijl standaard min-sum geschikt is voor veel scenario's, blijven onderzoekers verbeterde algoritmen ontwikkelen die betere prestaties-complexiteit trade-offs bieden. Multi-bit offset min-sum schema's dynamisch aanpassen van de offset op basis van kanaalomstandigheden, waarvoor een kleine opzoektafel nodig is. Laagspecifieke normalisatiefactoren kunnen convergentiesnelheid verbeteren. Een andere veelbelovende richting is stochastische decodering, waar berichten worden weergegeven als bitstromen. Stochastische LDPC decoders hebben een extreem lage oppervlakte per node maar vereisen lange stromen voor nauwkeurige weergave, beperken doorvoer. Ze worden meestal onderzocht voor korte codes.

Hardware implementatie van deze algoritmen moet zorgvuldig worden geëvalueerd voor kritieke pad en macht. Bijvoorbeeld, het toevoegen van een multiplier voor schaalvergroting in genormaliseerde min-sum kan het gebied van een CNU verdubbelen in vergelijking met een eenvoudige min-sum eenheid. De voordelen in iteratie reductie moet opwegen tegen de hardware kosten. Veel commerciële ontwerpen blijven met offset min-sum vanwege de gunstige trade-off.

Naarmate 3GPP evolueert naar 5G-Advanced en 6G, zullen de eisen aan LDPC decoders toenemen. Hogere bandbreedtes (mmWave, sub-THz) en nieuwe gebruikscases zoals geïntegreerde sensoren en communicatie vereisen decoders met een doorvoercapaciteit van meer dan 100 Gbps. Het bereiken van dergelijke tarieven zal waarschijnlijk volledig parallelle architecturen voor kleinere codes en sterk gepipelined gelaagde architecturen voor grotere codes duwen. AI- ondersteund decoderen van neurale netwerken om vroegtijdige beëindiging te voorspellen of het optimaliseren van berichtenschalen te optimaliseren is een actief onderzoeksgebied, hoewel hardware efficiënte ingrepen motoren uitdagend blijven voor mobiele apparaten.

Een andere trend is het gebruik van sterk geautomatiseerde ontwerpstromen: high-level synthese (HLS) van C++ modellen maakt een snellere exploratie van architectonische trade-offs mogelijk. Echter, hand geoptimaliseerd RTL domineert nog steeds productie ontwerpen voor maximale efficiëntie. We kunnen meer integratie van gespecialiseerde LDPC decoder IP cores met zachte processor subsystemen voor flexibiliteit verwachten.

Ten slotte zal de invoering van LDPC-codes die verder gaan dan 5G, zoals voor satellietcommunicatie en diepe ruimtenetwerken, innovaties in de implementatie van decoder met een lage capaciteit en hoge doorvoercapaciteit blijven stimuleren.

Conclusie

De implementatie van LDPC-decoders voor 5G-apparaten is een veelzijdige uitdaging die een zorgvuldige co-design van algoritmen en hardware vereist. Complexiteit, stroom, doorvoer, geheugen en flexibiliteit werken allemaal samen in een beperkte ontwerpruimte. Door het gebruik van gelaagde decoderen, geoptimaliseerd rekenen, geavanceerd stroombeheer en herconfigureerbare datapaths, hebben ingenieurs decoders ontwikkeld die voldoen aan de ambitieuze doelstellingen van 5G NR. Naarmate draadloze systemen evolueren, zullen de lessen die uit deze implementaties worden getrokken de volgende generatie van foutcorrectie hardware informeren, waardoor betrouwbare en efficiënte communicatie in een steeds meer verbonden wereld wordt gegarandeerd.

Voor verdere lezing van de 5G NR LDPC-norm, zie de 3GPP-specificatie TS 38.212[. Een gedetailleerd overzicht van LDPC-decoderarchitecturen is te vinden in dit IEEE-papier. Een voorbeeld van een laag-vermogen-decoder is te vinden in ]dit werk op 28nm CMOS.