Hesaplamanın Evrimi: CISC Mimarilerinde Artırılmış Talimatlar

Yapay zekanın sürekli gelişimi, bilgisayar donanımlarında daha önce görülmemiş bir talepler koydu. Derin öğrenme çerçeveleri ve özel kütüphaneler ilerlemeye yol açtı, temel işlemci mimarisi, AI performanslarının yatakrocku olarak kalıyor.On yıllardır, Kompleks Öğretim Setleri Hesaplama (CISC) mimarlıkları - uranyumu kullanarak yanlış bir şekilde dönüşüm sağlarken - her şeyi işletme veri merkezlerine yönlendirerek, AI iş yüklerinin karmaşıklığı ve ölçeklendirme işlemlerinin entegrasyonu, AIC işlemcilerine entegre edilmiş talimatların entegrasyonu önemli bir dönüşüme olanak sağlar.

CISC Mimarlıklarını Anlayın: Kompleksity

CISC işlemcileri, tek bir makineli bir eğitimle çok adımlı işlemleri yürütmek için onların yetenekleri tarafından tanımlanır.Bu tasarım felsefesi 1970'lerde ve 1980'lerde ortaya çıktı, yüksek seviyeli diller ve assembly kodu arasındaki semantik boşluğu azaltmak amacıyla, güçlü talimatlar vererek -örneğin, dört on yıl boyunca uzatılmış bir eğitim seti oluşturmak.

CISC'nin temel özellikleri değişken uzunlukta talimatlar, karmaşık işlemleri uygulamak için donanıma dayalı mikrokolay üzerinde yoğunlaşır ve geniş bir uygulama yelpazesi için nispeten küçük sayıda genel amaçlı kayıt içerir. Karşılaştırmalı Öğretim Set Computing (RISC), basit ve sabit uzunlukta talimatları vurgular, CISC, kod yoğunluk ve öğretim gücü önceliklendirir.Bu ticaret-off tarihsel olarak geniş bir dizi uygulama için CISC işlemcileri iyi bir şekilde sundu, ancak aynı zamanda paralel ve vektör-heavy iş yükleri için performans ölçeklendirmede de zorluk getiriyor.

AI-Optimized Talimatların Yükselişi

AI-opted talimatları, makine öğreniminin temel hesaplama modellerini hızlandırmayı amaçlayan özel bir işlemci komutları: matris multiplikasyon, konvolution, onor operations ve yüksek boyutlu vektör arithmetic. Bu talimatlar veri düzeyinde paralellik ve kontrol akışını azaltır. Common examples include Intel's and control flow.

Paralel İşleme ve Vectorization

AI ivmesinin kalbinde paralel işleme yatıyor. Standart bir ölçeklendirme nerede tek bir çift operacı üzerinde çalışır, vektör talimatları - SSE, AVX ve AVX-512 aileler - aynı anda birden fazla veri elementine aynı şekilde uygulanır.Bu tek bir fark, bilgisayar vizyonunda piksel işleme gibi görevler için ideal, sabit olmayan işlemler için ağırlık güncelleştirmeleri ve aktivasyon fonksiyonu hesaplamaları.

Özel Matrix ve Tensor Operasyonları

Basit vektörlemenin ötesinde, modern AI iş yükleri matrix multiplikasyon ve onor sözleşmeleri üzerinde ağırlığa güveniyor. Bu, işlemci satıcıları matrixe özel talimatları tanıttılar. Örneğin, karo kayıt ve "TDPBF16PS'nin talimatını 16-bit beyin-flot-to-vardırı tek bir operasyonda kullanarak gerçekleştirirler.Bu talimatlar büyük matris işlemleri daha küçük ölçeklendirme talimatlarına veya vektör talimatlarına izin verir.

Donanım Hızlandırma Birimleri

AI-optize talimatları genellikle özel mikroaritectural birimleri tarafından desteklenir. Örneğin, Intel'in Saf Hızlı işlemcilerinde yapılan uygulama, önbellekli ve bantlı bir ünitede, yüksek işlem oranlarına daha az devam etmek için tasarlanmıştır - bfloat16 performansına ulaşmada - bu tür birimlerin entegrasyonu, bu tür bir CISC çekirdeğinin önbellek ve bant genişliğine sahip olmasını sağlar.

AI Talimatlarını CISC'ye entegre etmek: Yaklaşımlar ve Ticaret-offlar

CISC mimarilerine entegre edilen talimatları entegre etmek, mevcut SIMD aileleri eklemek ve tamamen yeni öğretim sınıflarını eklemek için basit bir konudur.

Var olan SIMD Öğretim Setleri

En basit yol popüler SIMD talimatı setlerini genişletmektir. Intel'in AVX-512, ilk olarak Skylake-SP ile tanıtıldı, zaten zengin bir vektör işlemleri içerir. VNNI in Cascade Lake and later AVX512 BF16 in Cooper, çin seviyesinde ve batflo16 yetenekleri getirdi. Bu uzatmalar mevcut vektör kaydı dosyasına kayıt yaptırır (ZMM kayıt işlemine dahil olmak üzere, aynı dekoder mantığından yararlanın, yeni mikrocode dizileriyle birlikte.

Yeni Öğretim Sınıfları ve Kayıt Dosyalar

Daha radikal bir ivme için, satıcılar tamamen yeni eğitim sınıflarını kendi kayıt dosyalarıyla tanıttılar. Intel'in AMX, örneğin sekiz tane kayıt (önder ve sütunlar için yapılandırılabilir) geleneksel genel amaçlı kayıtlardan ayrı olarak yararlanıyor ve mikrokolay ROM uzayını gerektiriyor.Bu yaklaşım daha yüksek performans sunuyor, ancak "TILELOAD" ve "TITERELOAD" gibi talimatları da genişletiyor.

Dengeleme ve Verimlilik

CISC tasarımındaki yıllık bir meydan okuma, eğitim gücü ve donanım karmaşıklığı arasındaki gerginliktir.Indüksiyon-opted talimatlarını kullanarak mümkün olan bazı düzeltme modlarını arttırır ve yürütme birimlerini yönlendiren birkaç μops ile genişletilebilir.Bu yaklaşım, RISC benzeri verimlilikten yararlanırken, modern CISC işlemcileri genellikle karmaşık talimatları daha basit mikro-işlemlere dönüştürür (μops). AI-start talimatları genellikle uygulama birimlerine göre genişletilmelidir.Bu yaklaşım, uygulama birimlerini kullanarak geri yükleme işlemine yarar sağlar.

Vaka Çalışmaları: Intel ve AMD Uygulamaları

CISC pazarındaki iki büyük oyuncu – Intel ve AMD – AI-opted talimatları entegre etmek için farklı yollar aldı. stratejilerini incelemek, pratik ticaret-offları dahil ediyor.

Intel'in AVX-512 ve AMX

Intel, AI talimatlarını x86'ya ekleyerek en agresiftir. AVX2 (Haswell) ile başlayın ve AVX-512 (Skylake-SP), her nesil FMA, tam zamanlı FMA gibi özellikler içerir ve işletim sistemi desteği gerektirir (XSAV /VEXRS ile birlikte). Intel, bfloat16 ve int8 veri türü için yerel karo işlemleri sağlar.

AMD'nin AVX-512 ve BF16 Destek

AMD başlangıçta AVX-512'den kaçındı, heyecan verici güç ve karmaşık endişeler. Zen 4 mimarisi ile, AMD AVX512 ile AVX-512'yi 256-bit veripath'ye taşıdı, Intel'in iki 256-bit yarı yarıya doğru ilerledi. Bu yaklaşım, vektör performansının çoğunu teslim ederken, AI'nın daha küçük bir dizi işlemden faydalandığını ve daha hızlı bir şekilde entegre edilen bir şekilde tümleşik bir şekilde uygulamadaki birçok standartta matris uzantılı işlemden faydalanabileceğini savundu.

Gerçek Dünya Bütünleşmesinde Meydanlar ve Dikkatler

CISC mimarilerine yönelik tüm talimatları uygulamak engel değildir. Aşağıda mimarlar ve sistem tasarımcıları tarafından karşı karşıya kalan önemli zorluklar vardır.

Backward Compatability and Software Ecosystem

Yeni komutlar eklemeden kullanım alanınıza eklenmeli ve yeni komut akışları bozmadan kullanım alanınızı genişletilmelidir.Bu özellikle x86'da, opcode haritasının neredeyse tam olarak tam olarak tam olarak tam olarak tam olarak tam olarak tam olarak tamamlanmış olması gerekir.Invercodes to improve the encoding space. Software must be recompiled with new Flags (e.g., “-mavx512vn’ in GCC) veya kütüphaneler çalıştırılabilir ve kullanım talimatları kullanarak tekrarlanmalıdır.

Güç ve Termal Yönetim

AI talimatları, özellikle matrix çarpıt işlemleri, önemli bir güç çizebilir - tek bir soket için 200W'yi aşabilir.Gezemdeki operasyonların yoğunluğu, kalıcı AI iş yükleri sırasında aşırı ısıtılması ve soğutma çözümlerinin geliştirilmesi gerekir.

Vector Uzunluk ve Memory Band geniş

Wider vektör veya matrix işlemleri daha yüksek hafıza genişliği talep eder. 512-bit vektör operasyonu yük başına 64 tane getirmek gerektirir; 1024-bit matrix karo operasyonu, AI birimlerini beslemek için yüzlerce taneleri gerektirebilir. ancak, önbellek koherens trafiği ve geç bellekleri şişe tezgahları, özellikle de Intel'in yüksek çözünürlükteki tüm diskolar gibi yüksek çözünürlükte kalır.

Güvenlik ve Side-Channel Saldırıları

Yeni talimatlar yeni saldırı yüzeylerini tanıtıyor. Örneğin, çingene kayıtları, düzgün bir şekilde izole edilmemiş olsa da spekülatif infaz saldırılarına karşı hassastır. Intel, mikroarjit korumalara karşı performans kazançlarını (örneğin, çingenetik koruma ünitesini okumak için sömürülmesini engellemek) ve AI talimatlarının daha yaygın hale gelmesi gerekir.

Future: CISC-AI Entegrasyonunun Sonraki Nesili

CISC mimarilerindeki AI optimize edilmiş talimatların entegrasyonu devam eden bir süreçtir. Birkaç trend önümüzdeki beş ila on yıl boyunca şekillendirecektir.

Azallık ve karma-precision Support

AI modelleri giderek düşük ücretli veri türlerini kullanır -bfloat16, FP16, INT8 ve hatta INT4 - hafıza ayak izi azaltır ve tam anlamıyla iş yükleri için daha fazla iki katına çıkar. Ayrıca donanım dönüşüm birimleri ve optimize edilmiş birikim dahil olmak üzere özel veri türlerini de görebiliriz. Örneğin, iki uint4'ü çoğaltma ve yüksek ücretli bir alıcıda bir araya getirebilme yeteneği tam anlamıyla iş yükleri için iki katına çıkarabilir.

Temporal ve Spasal Sparse Acceleration

Birçok AI modeli sparse-vector ve sparse-matrix operasyonlarının yanı sıra, sıkıştırılmış sparse sıra (CSR) formatları veya toplama ile ilgili olarak, Intel'in araştırmadaki sparse matris uzantıları ile deneyenleri çarpıcı şekilde azaltabilir ve ticari işlemcilerin bunları birkaç yıl içinde kabul etmesi gerekir.Bu özellikle de dönüştürücü-bazlı modeller için yararlı olacaktır.

Kontrol ve Data Flow'ın Gelişen Dekoupling of Control and Data Flow

Mevcut CISC işlemcileri, AI iş yükleri genellikle yüksek veri paralelliği basit kontrol akışı ile sergileyebilir. Future tasarımları, AI talimatlarını gerçek anlamda yürütebilirken, ana boru hattının diğer koda sahip olması için ortak kullanım noktaları tanıtabilir. Intel'in AMX zaten ana anahtarını devre dışı bırakabilir ve sonra emekli olabilir, AMX birim işlemcileri arka planda (TI 'ONE' gibi senkronizasyon noktaları ile birlikte).

Chiplet Architectures ile entegrasyon

Maliyet ve verimi yönetmek için, modern işlemciler, yüksek hızlı bir kumaşla birbirine bağlı olarak birden çok çipli cihazdan daha fazla inşa edilir. AI-opted talimatları sadece belirli hesaplamalarda yer alabilir, hafıza ve I/O çipler sistemin geri kalanıyla birlikte kalır.Bu, modüler bir tasarım kullanır ve AMD'nin Zen tabanlı işlemcileri çalıştırır.In future, yeni talimatları uygularken, hafızayı uygularız ve hafızada kalır.

Sonuç: CISC ve AI için bir Symbiyotik Geleceği

AIC mimarisine yönelik ayrıntılı talimatlar entegrasyonu sadece teknik bir ayarlama değildir - genel amaçlı hesaplamanın temel bir evrimi temsil eder. Makine öğrenimi için makine öğrenimi için özel işlemleri çok öğretim setine dahil ederek, işlemciler x86 yazılımının zengin ekosistemini terk etmek için dramatik performans geliştirmelerini sağlayabilir.

AI her endüstriyi permeate olarak, karmaşık donanım hızlandırma talebi yalnızca artacaktır. CISC mimarisi, bilgisayar ortamındaki derin kökleriyle bu talepleri karşılamak için adapte edilir. Sonuç, karmaşık ve el yapımı bir bilgisayar yazılımı ile, bilgisayar aramaları veya el yazma talimatları ile ilgili talimatların yeni bir nesil tarafından yazılması gerekir.In developers, the key takeaway is that performance-kritik AI code intended to avoid these new instructions –whether through compiler auto-vectorization, library calls or handwrite intrinsics.In developers, the future of Computing code intended to avoid this new logic intelligence of Query