Giriş: FPGA'nın Yükselişi Hiperscale Data Centers'ta Hızlandırma
Hiper ölçekli veri merkezleri, geleneksel CPU'ların yeteneklerinin hesaplanması için sürekli taleplerle karşı karşıya kalmaktadır.Bu genel amaçlı işlemcilerin teslim edilmesi için mücadele ettiği, gerçek zamanlı video transkript, yüksek frekanslı ticaret ve yazılım tanımlı ağ, yalnızca ham bağlantıya ihtiyaç duyar, aynı zamanda işleyici ve güç verimliliğine de sahiptir.Bu sistemli kapı dizileri, kritik bir hız katmanı olarak ortaya çıkmaktadır.
FPGA Mimarisi ve Stratejik Rol
FPGAs, programlanabilir mantık bloklarının geniş dizilerinden oluşur, göz ardı masaları, yüzer, dijital sinyal işleme dilimleri, blok RAM ve yüksek hızlı transiversiyonlar.Bu esneklik operatörlerin tek bir cihazda sabit bir talimat setini yürüten CPU'lar, Xilinx Versal ACAP'in birlikte yüzlerce bağımsız mantık hücresi sunar, sabit diskolar ve yüksek çözünürlükte sabitler için sabitlenir.
Yeniden yapılandırılabilirlik önemli bir avantajdır: operatörler dağıtımdan uzun süre sonra donanım ivme katmanını güncelleyebilir, ağ protokolleri geliştikten sonra, şifreleme algoritmaları yükseltilir veya yeni sinir ağ mimarisi görünür. FPGA mimarisi ve veri merkezi uygulamaları ayrıntılı bir bakış için, [[0]Intel FPGA ürün sayfası).
Hyperscale FPGA Systems için Core Design Thinkations for Hyperscale FPGA Systems
Binlerce sunucu için FPGA Hızlandırma platformu inşa etmek, birden fazla boyutta titiz planlama gerektirir. Aşağıdaki bölümler performans, maliyet ve ölçeklenebilirliği en kritik faktörleri inceler.
Scalability and Modüler Architectures
Tek bir FPGA kurulu, tüm veri merkezi servisinin hesaplama taleplerini karşılayamaz. Scalability, zeminden inşa edilmesi gerekir. Başarılı tasarımlar, çoklu FPGA hızlandırıcı kartların yüksek bant genişliği ağları ile bir araya getirildiği ve birleşik bir ivme kumaş olarak orkestraya dahil edilmesi gerekir. Bu genellikle büyük hesaplama grafiğini boru hatlarına bölmeden önce, tüm ekranlı bir kartpostal işlemine kısmen bir kartpostalla yeniden yapılandırılabilir.
Modüler ölçeklendirme fiziksel paketleme etkiler: PCIe add-in kartları gibi standart form faktörleri, mezzanine modülleri veya açık bir şekilde hazırlanmış bir proje olarak FPGA kartlarını ayrıştıran bir sunucu şasisi ile uyumlu bir şekilde satın alınabilir.Fort Project[tr|kanıklıklı altyapı modeli, modüler dağıtımlar için tüm donanımlar barındırabilir.
Güç Verimliliği ve Sahipliğin Toplam Maliyeti
Güç tüketimi doğrudan veri merkezlerinde toplam mülk maliyetine (TCO) etkiler, soğutma ve elektrik genellikle en büyük operasyonel harcamalar oluşturur. FPGAs genellikle eşdeğer devirlerde belirli iş yükleri için GPU'lardan daha verimlidir, ancak yüksek uç cihazlar 75-150 W veya daha fazla, dikkatli bir kaynak tasarımı gerektiren.
Dinamik güç optimizasyonu RTL veya yüksek seviyeli sentez aşamasında başlar. Zamansız olmayan işlemler sırasında daha düşük temel gerilime yol açar ve FPGA'nın iyileştirilmiş uyku modlarını azaltır dinamik geçiş aktivitelerini azaltır.Döneticileri, doğrulayıcı devreleri izlemek için güçlendiricileri kullanın - çift zamanlı güç tasarrufu sağlar. Etkili saat domain geçişi yönetimi ve geniş otobüslere gereksiz yere entegre etmek için hiçbir şekilde önemlidir.Sistem seviyesindeki tasarımcılar, güçlendiricileri göz önünde bulundurmalıdır.
Mantık optimizasyonunun ötesinde, doğru cihaz ailesi bir rol oynar. Low-power FPGAs gibi Lattice Nexus platformu hafif sıkıştırma veya şifreleme için yeterli olabilir, ancak güç-hungry aşırı hesaplama görevleri büyük HBM kapasiteleriyle üst düzey cihazlarda çalıştırılabilir.
Latency ve Real-Time Processing
Veri merkezi hizmetleri, tahmin edilebilir performans için kuyruk değerlendirmelerini içeren katı hizmet seviyesi anlaşmaları altında çalışır, örneğin, CPU'dan gelen ağ yığınını kullanan akıllı sınıflar, TCP checksumasyonunu yaparak geç verileri zorlayabilirler. öngörülebilir performans için tasarım, bellek erişim kalıpları ve harici DRAM ile bağlantı kurmak için. Örneğin, CPU'dan gelen akıllıNIC'ler, TCP checksum işlemine geç verileri otomatik olarak kontrol ederek, bağlantı izleme ve paket oluşturma yoluyla zorlayabilirler.
ultra uzun gecikmeli izinler, FPGA'nın I/O altsystems hız tutuyor. Doğrudan yüksek bant genişliği hafıza kanallarını veya önbellek bağlantılarını kullanarak, CXL.mem ve CXL.cache gibi siparişler oluşturabilir. gerçek zamanlı finansal ticaret uygulamaları için, özel FPGA mantığı, kablolama seçenekleri, yeniden hesaplama seçenekleri, şarj edilebilir fiyatlar ve on nanosaniyeler içinde siparişler oluşturabilir.
Yüksek Hızlı Interconnects ve Network Entegrasyonu
Veri merkezi temel olarak ağ merkezlidir ve FPGA hızlandırıcıları x16 bağlantıya kadar bağlantıya sokmalıdır. PCI Express, ana host-attach interconnect, Gen4 (16 GT /s) ve Gen5 (32 GT /s) ile 64 GB /s hızlayıcısı ile bağlantı kurmalı bağlantıya geçiş yapar.In host işlemci ve diğer hızlandırıcılar gibi sorunsuz bir şekilde hareket eder.[CXL) genişletilebilir.[değiştir | kaynağı değiştir]
Doğrudan ağ hızlanması için, FPGA kartları genellikle entegre 100G /400G Ethernet MAC'ları ve şanzıman mantığını içerir. FPGA kumaşı P4 gibi yüksek seviyeli bir dilde, doğrudan donanıma dayalı olarak derlenen özel paket işleme hatları uygulayabilir. Microsoft Project Catapult, Azure filosunda FPGA-kandırıcı SmartNICs'lerin kullanımını öncületir, diğer hedefler üzerinde yazılım tanımlı ağ hızlandırıcıları ve depolamayı çalıştırabilir.
Tasarımcılar ayrıca Aurora ( AMD'den) veya özel seri arayüzlerden oluşan protokollerin daha büyük mantıksal bir dizi olarak hareket eden FPGA'lar ağı oluşturmasını sağlar. Converged Ethernet v2 gibi bir kümesler düşük hacimli iletişim kurabilirler, ev sahibi CPU katılımı olmadan yüksek bant iletişimi sağlayabilir.
Geliştirme İş akışı ve Yüksek-Level Synthesis
VHDL veya Datalog ile geleneksel FPGA gelişimi, C++ veya OpenCL'de ifade edilen ve otomatik olarak veri merkezi yazılım takımlarının hızlı iterasyon döngüleri ile çatışmanın mümkün olduğu zamanlarda uzman beceriler ve uzun bir derleme gerektirir. Yüksek-Level Synthesis, geliştiricilerin kayıt dışı olarak kaynak kullanımı ile karşılaştırıldığında, C++ veya OpenCL'de ifade edilmesine izin verir ve otomatik olarak verimli bir şekilde RTL. Tools ile Intel gibi çalışır.
Yaygın fonksiyonlar için önceden belirlenmiş IP blokları –DDR4/5 kontrolörleri, PCIe DMAs, kriptografik motorları, 100G Ethernet MAC –dramatik olarak entegrasyon çabasını azaltır. Veri merkezi iş akışı genellikle bir boru hattı takip eder: Her kodda sistem düzeyinde bir algoritma, HLS'de algoritma rafinerisi, RTL nesili, döngüyü kullanarak fonksiyonel simülasyonlar, sentez ve yer-ve-route, zamanlama sistemleri ve biraz uç nesil sürekli olarak otomatikleştirilebilir.
Yazılım takımları için, programlama modeli genellikle bir süre API'nin arkasında özetlenir ve Openprogramlanabilir Acceleration Engine (OPAE) Intel FPGAs veya Xilinx Runtime (XRT) olarak bilinen yüksek seviye dilleri kullanarak, yükleme için bir arayüz sağlar[Dönderler, kontrol eder ve işe gönderirler).
Performans Geçerliliği ve Stres Testi
Bir FPGA hızlandırıcısı üretime dağıtılmadan önce, gerçek dünya iş yükleri altında güvenilirlik garanti etmek için egzoz testine maruz kalmalıdır. Fonksiyonel doğrulama geniş bir simülasyonla başlar, ancak hiçbir simülasyon, yüzlerce megahertz'ın fiziksel davranışını tam olarak gürültüyle yakalar.
Stres testi köşe vakalarını kapsamalıdır: Minimum paket boyutları ile maksimum bağlantı, patlamalı trafik modelleri, eş zamanlı olarak paylaşılan anılarda içerik yazma ve tasarımın, FPGA'yı uzun süreler boyunca ısıtılması için ısı tasarım gücüne iten termal soak testleri.Forumable tools – işlem sayacı, latency histogramları ve bant genişliği monitörleri gibi – yavaş yavaş yavaş yavaş yavaş yavaş yavaş yavaş yavaş yavaş yavaş yavaş yavaş yavaş yavaş yavaş yavaş yavaş yavaş yavaş yavaş yavaş yavaş yavaş yavaş yavaş yavaş yavaş yavaş yavaş yavaş yavaş yavaş yavaş yavaş yavaş yavaş yavaş yavaş yavaş yavaş yavaş yavaş yavaş yavaş yavaş yavaş yavaş yavaş yavaş yavaş yavaş yavaş yavaş yavaş yavaş yavaş yavaş yavaş yavaş yavaş yavaş yavaş yavaş yavaş yavaş yavaş yavaş yavaş yavaş yavaş yavaş yavaş yavaş yavaş yavaş yavaş yavaş yavaş yavaş yavaş yavaş yavaş yavaş yavaş yavaş yavaş yavaş yavaş yavaş yavaş yavaş yavaş yavaş yavaş yavaş yavaş yavaş yavaş yavaş yavaş yavaş yavaş yavaş yavaş yavaş yavaş yavaş yavaş yavaş yavaş yavaş yavaş yavaş yavaş yavaş yavaş yavaş yavaş yavaş yavaş yavaş yavaş yavaş yavaş yavaş yavaş yavaş yavaş yavaş yavaş yavaş yavaş yavaş yavaş yavaş yavaş yavaş yavaş yavaş yavaş yavaş yavaş yavaş yavaş yavaş yavaş yavaş yavaş yavaş yavaş yavaş yavaş yavaş yavaş yavaş yavaş yavaş yavaş yavaş yavaş yavaş yavaş yavaş yavaş yavaş yavaş yavaş yavaş yavaş yavaş yavaş yavaş yavaş yavaş yavaş yavaş yavaş yavaş
İyi doğrulama uygulamaları başarısız yer testlerini içerir: Sistem bir FPGA kurulu aşırı ısılar veya transiveriversal şeritler bozuldu mu? Graceful degrads, otomatik olarak trafikten kırmızıya kadar uzanan bir hızlandırıcıya kadar uzanan olarak, kullanılabilirlik SLAs'i korumak için kritiktir.
Vaka Çalışmaları: Üretimde Hiperscale FPGA Deployments
Gerçek dünya dağıtımları, FPGA sistemlerinin hiper ölçekli ortamlarda değer nasıl olduğunu göstermektedir. Microsoft'un Project Catapult bütünleşik Altera (şimdi Intel) FPGA filosunun her sunucuya, başlangıçta derin bir sinir ağı için ve daha sonra 40GbE aracılığıyla ağ için bağlantıya bağlı olarak, işletim sistemi ile birlikte çeşitli iş yüklerini hızlandırabilecek şekilde uyumlu hale getirebilmelerini sağladı.
Amazon Web Services, SDAccel gibi yüksek seviyeli çerçeveler kullanarak EC2 F1 örneklerini sunuyor ve bu model, genomik analiz, video transkript ve finansal Monte Carlo simülasyonları için kabul edildi. Bulut tabanlı bir gelişim ve dağıtım hattı sağlayarak, AWS Donanım Geliştiricilerini veya daha yüksek seviyeli çerçeveleri kullanarak, FPGA performanslarını kullanarak, fiziksel donanımları yönetmek için mümkün kılar.
Baidu'nun konuşma tanıma için FPGA'lar kullanımı, hızdaki en kritik AI iş yüklerinin nasıl fayda sağladığını gösteriyor. Şirket, derin öğrenme skorları için saf FPGA yaklaşımına dayanarak, alt saniye geç kalmışlık için yüzde 40 oranında bir kesintiye uğratarak güç tüketimini yüzde 40 azalttı. FPGA uygulamaları sabit nokta arithmetici ve özel hafıza yapıları en üst düzeye çıkarmak için.
Programlama Modelleri ve Özet Katmanları
Programlanabilir boşluk, veri merkezlerinde FPGA'nın kabul edilmesi için en büyük engellerden biri olarak kalır. Cevap olarak, endüstri, yazılım mühendislerinin derin donanım uzmanlığı olmadan FPGA'ları hedeflemesine izin vermek için birden soyutlama katmanları geliştirdi.
- [FONT:0)OpenCL / SYCL:[Dönetici:[Dönetici:0)[FONT ve SYCL, CPU'lar, GPUs ve FPGA'lar için özel uzantılar sağlar.
- [FONT=0) Yüksek Lisans Synthesis Kütüphaneleri: Her iki satıcı da vizyon için domain özel kütüphaneler sunar, lineer algebra ve sinyal işleme.Bu kütüphaneler hedef için önceden optimize edilir ve daha büyük hızlandırıcılar oluşturabilir.
- [FONT=0]Runtime APIs:[Dönetici: [Dönetici: 0,0) Açık programlanabilir Hızlandırma Motoru (OPAE) ve XRT soyut bit yükleme, tampon yönetim ve senkronizasyon. Apache Ok veya TensorFlow gibi üst düzey çerçeveler ile kapatılabilir düşük seviyeli bir C API'yi ortaya koyarlar.
- [FONT:0)P4 for Networks:[Dönetici:[Dönetici: 0) P4 dili, doğrudan FPGA mantığına derleyen paket işleme boru hatları ve programlanabilir anahtarlar için kullanılan akıllıNICs ve inpost algılama sistemleri tanımlar.
Bu soyutlama katmanları bariyeri azaltır, ancak hala geç kalmışlığı, transkript ve kaynak içeriğini anlamak gerekir.En başarılı dağıtımlar, harita algoritmaları otomatik olarak FPGA kaynaklarına yatırım yapar.
Operasyonel Zorluklar: İzleme, Bakım ve Güvenlik
Üretimde binlerce FPGA hızlandırıcısı, CPU-sadece veri merkezlerinde görmediği zorlukları ortaya koyar. Bitstream yönetimi karmaşık hale gelir, özellikle de kısmi yeniden yapılandırma kullanılıyor. Modern FPGA'lar yapılandırma, bitek ve doğru hataları tespit etmek için ECC'ye ihtiyaç duyar, ancak tasarımcılar hala ovma işlemini tekrar gözden geçirmelidirler.
Sıcaklık izleme, veri merkezinin güç yönetimi sistemi ile entegre edilmiş kartlara özel sensörler gerektirir. FPGA kartları genellikle birden fazla sıcaklık bölgesine sahipse (logic, transceivers, DRAM), ve termal thling, devlet kaybetmeden zararları önlemek için tasarımda uygulanmalıdır. Çoğu üretim sistemi, güç döngüsü veya bireysel hızlandırıcı kartların kullanılması durumunda bir yan bant yönetimini kullanır.
Güvenlik ayrıca, sürekli mantık, çift-rayın bu riskleri azalttığı zaman, ve fiziksel kalkanlama gibi, sıfır güven ağ ilkeleri uygulanır: FPGA yapılandırma güncelleştirmelerini kabul etmeden önce kendilerini gerçekleştirmelidir ve tüm kartpostalarını paylaşıldığında şifreli iletişim şifreli olmalıdır.
Future: FPGAs in Next-Generation Data Centers
FPGA teknolojisi, veri merkezi altyapının geri kalanı ile sıkılaştırmaya bile işaret ediyor. Xilinx Versal AI Edge serisi gibi AI motorlarını zorlaştırır. AI-specific overlays –soft işlemci dizileri, mikrobiyöneticileri ile ölçümlemek için tasarlanmıştır - şimdiye kadar IP olarak FPGA satıcılarından gelen.
Bir başka büyük trend çip tabanlı mimarilerin benimsenmesidir. Monolithic FPGA, yüksek bant genişliği ile bağlantılı çiplere bağlı olarak çipler arası bağlantılarını (örneğin UCIe, Intel's EMIB), üreticiler bir ağ duvarı için karıştırıp, tek bir paketle karıştırabilir.
Yazılım programı kullanılabilirlik geliştirmeye devam edecektir. Açık FPGA Stack Intel ve Vitis'in birleşik yazılım platformu AMD'den gelen doğru yazılım tanımlı donanım deneyimi, güncellemelerin ağ üzerinden itildiği ve FPGA kumaşları, CXL 3.0 ve PCIe olarak, paylaşılan hafıza havuzları birden çok FPGA'lar ve CPU'lar haline gelecektir.
Enerji verimliliği inovasyonu sürücüler. Yakın zamanda gerilim operasyonu ve uyarlayıcı vücut önyargı teknikleri, statik güce söz verirken, kullanım süresi kısmi yeniden yapılandırma, kullanılmayan mantık bölgelerinin dinamik olarak güçlendirilmesine izin verir.Bu gelişmeler FPGA'ların her zaman fikre sahip olduğu zamanlarda hiper ölçekli veri merkezlerinin sürdürülebilirlik hedeflerine ulaşmasına yardımcı olacaktır.
Özetle, FPGA sistemlerinin büyük ölçekli veri merkezleri için tasarlanması, TCO'yu kontrol altında tutmak için tümleşik mühendislikte bir egzersizdir.Seks tasarımları, yüksek seviyeli sentez, eş zamanlı bağlantılar ve titiz doğrulama, altyapı takımları, yalnızca kontrol altında tutmakta olan hızlandırıcı kumaşlar dağıtabilir. FPGA'lar etrafındaki donanım ve yazılım ekosistemleri olarak, veri merkezi hiyerarşisinde daha fazla pervaplı bir tabaka haline gelecektir.