Integrating Machine Learning Accelerators with CISC Processor Systems

שילוב של למידת מכונה (ML) מאיצים עם מערכות מחשוב מורכבות (CISC) מסמן שינוי משמעותי בארכיטקטורה המודרנית של המחשב.As ML Workloads הביקוש אי פעם- incrating compute באמצעותput, כללי כללי כללי-תכליתי CPUs - אפילו אלה עם הרחבות מתקדמות של מערכות אבטחה - החלטיות כדי לעמוד בקצב של מתמטיקה ופעולות מקבילים המגדירים עמוק על ידי נישואין המורשת, גמישה, גמישה, כגון מעבדי CPU-CIVES (מעבדים)

מערכות ניהול CISC

מעבדי CISC, המודגם על ידי ארכיטקטורת x86 מ- Intel ו- AMD, נועדו לבצע הוראות מורכבות שחבילות פעולות מרובות ברמה נמוכה להדרכה אחת.פילוסופיה עיצוב זו מפחיתה את הפער הסימנטי בין שפות ברמה גבוהה וקוד מכונה, מפשטות את התפתחות המדור ומאפשרת ערכות הדרכה עשירות. x86ML הטבות מעשרות שנים של אופטימיזציה תוכנה, תאימות לאחור, ובסיס עצום מותקף, כמו גם רשתות מחשוב גדולות, כלומר, הן מורכבות, כמו גם מקבילות, הן אינן יכולות להיות אופטימיזציה של רשתות מחשוביות, באופן משמעותי, כמו קודים, הן מורכבות, כמו גם מקבילות, כמו גם מקבילות, כמו גם מקבילות, כמו אלה, כמו אלה, כמו גם קיבולת גבוהה, כלומר, כלומר, כלומר, באופן משמעותי, כמו גם קידוד רבת, כמו גם מקבילות, כמו גם קידוד רב עוצמה, כמו רשתות מחשוב מורכבות, באופן משמעותי, כמו אלה, באופן משמעותי, באופן משמעותי, כמו קוד מקבילה, כמו אלה, כמו גם מקבילה, באופן משמעותי, כמו גם רשתות מחשוב רב עוצמה, כמו רשתות מחשוב קיפולנטיבות, כמו תיבות של תיבות של תיבות של תיבות של תיבות של מערך התקנים מודרניים, כמו אלה, כמו אלה,

מה הם מכונות למידת Accelerators?

מאיצים ML הם מנועי קידוד מיוחדים שעוצבו מהבסיס עבור אלגברה ליניארית ועשרות או פעולות השולטות באימוני רשת עצבית והקצאות.שלושת הצורות הנפוצות ביותר הן:

  • (FLT:0) יחידות עיבוד (TPUs): 1:1 של ASICs מותאם אישית של גוגל המספקים שיא דרך ספוט עבור טספוסים עבודה TensorFlow.כל PU מכיל אלפי יחידות ממטריקס-multiply וזיכרון פס גבוה, מותאם אישית עבור הכשרה והערכה.
  • (FLT:0)Field-Programmable Gate Arrays (FPGAs): מיפוי 1 Reverse Logic השביר שבבים שניתן לתכנת כדי ליישם את הנתונים המותאמים אישית.השטריקס של אינטל ושל שילינקס אלבו (כיום AMD) משפחות מאפשרות למפעילי מרכז נתונים להתאים למודלים ספציפיים של ML, להגדרה מחדש של ביצועים נמוכים יותר מאשר ASIC.
  • (FLT:0) אינטגרטיבי Integrated Circuits (ASICs): שבבי השבבים הקבועים של הפונקציה שעוצבו עבור קבוצה צרה של פעולות.דוגמאות כוללות מאיצים מבוססי GPU של NVIDIA (אשר, בעוד שלא טהור ASICs, לשלב עשרות או ליבות ייעודיות) ואת מעבדי Habana Gaudis עבור הכשרה ASIC מציעים את היעילות הגבוהה ביותר אך דורש מחזורי פיתוח ארוך יותר.

מאיצים אלה חולקים תכונות אדריכליות משותפות: מקבילות מסיביות, ממשקי זיכרון פסים גבוה, ותמיכה בקידוד מעורבות (FP16, BF16, INT8) הם מקלקלים את הפעולות החריפות של עשרות או פעולות מה- CPU, המאפשר למארח CISC להתמקד בתזמורת, בקרה, ו- INT8.

איך אינטגרציה עובדת

קשר להתנצלות

שילוב של מאיץ ML למערכת CISC דורש חיבור גבוה, נמוך-עקביות נמוך.הבחירה הנפוצה ביותר היא PCI Express (PCI) 4.0/5.0, CXL (Compute Express Link), ומרקמים קנייניים כמו NVIDIA של NVLink.Ie נשאר האוניברסלי ביותר, מציע עד 32 נתיבים / GT / IPY למיפוי נתונים הדוקים עם CDC עבור מערכות זיכרון CDC עם CDC עם CPU מחובר עם CIRDIX.

זיכרון קוהרנטיות ותנועת נתונים

אתגר מפתח הוא הימנעות מ-Data-copy Overhead. in an Disrete accelerator, CPU חייב למקם את ה- CPU והנפיק DMA העברות, המציגות חיבורים קוהרנטיים מודרניים (CXL, Intel UPI, AMD IF) לאפשר מאיץ זיכרון ישיר לקרוא ולכתוב את הזיכרון של CPU כאילו הוא מקומי, צמצום תוכנה על גבי פרוטוקולי זיכרון מתוחכמות יותר, אך דורש לחץ דם מתוחכמות יותר.

שכבת תוכנה

אינטגרציה קשה לבד אינה מספיקה; תוכנה חייבת לזמר את חלוקת העבודה. Open-source ספריות כגון TensorFlow, PyTorch, ו- ONNX Runtime מופשטת את פרטי המאצ'ר באמצעות ניצול גרפי שמפות פעולות למכשיר המתאים.ברמה, נהגים (למשל, מערכת OpenCLtime של אינטל עבור FPGAs, AMD ROCm for GPUs, כדי לשפר את ה-CPU הנוכחי, לתקן את ה-CPU, לתקן את ה-TPU, לתקן את ה- CPU) ו-TPU של Google.

היתרונות של אינטגרציה

  • (FLT:0) ביצועים חדשים: FLT:1 Accelerators לספק 10-100 × גבוה יותר באמצעות ערכת פעילות ממטריקס מאשר CPU- רק גישות.לדוגמה, מעבד יחיד Intel Xeon 8380 משיג בערך 2 TFLOPS של FP32 ביצועים; אחד NVIDIA A100 GPU מספק 19.5 TFLO FP32 ו 312 TFIMS מאפשר TERR (R) מ-TMSCERCERCERCERCER CER CERIERIERCER CERCERCERCERCERCERCERCERCERCERCERCERCERCERIER CER CER CER TERRI TERRI TERRIER TERRI TERRI TERRIER TERRI TERRIER TERRER TERRIER TERRIER TERR.
  • (FLT:0)אנרגיה אי-יעילות: בהגדרות מרכז הנתונים, משימות ML-acceleration יכולות להיות מטופלים עם 5-10 וואט טוב יותר עבור תפעול מאשר ליבות CPU מטרות כלליות. בהגדרות מרכז נתונים, משימות ML-acceleration יכולות להיות מטופלים עם 5-10 × Better FLOPS/וואט, הורדת עלויות הכוללות בעלות וטביעת פחמן.
  • (FLT:0) ,Scalability:FLT:1 ניתן בקנה מידה אופקי (מאגרפים מרובים עבור CPU) ו אנכי (לולים של צמתים כאלה) בדים משולבים ו coherent מאפשרים הקצאת משאבים דינמיים, שבו מאגר של FPGAs או TPUs משמש בבקשות ממארחים רבים CPU.
  • (FLT:0) lexibility: FLT:1 מעבדי CISC לשמור על הגמישות שלהם עבור יישומים מורשת, בעוד מאיצים להתמודד עם עומס העבודה המתעורר של ML.יכולות דו-תכליתיות זו מאפשרת לארגונים לעבור בהדרגה לזרימות עבודה מונעות על ידי AI מבלי להחליף תשתיות קיימות.

אתגרים באינטגרציה

תאימות והתאמה

הבטחת תקשורת חלקה בין מאיצים ומערכות אקולוגיות CISC היא לא טריוויאלית.כל מוכר מאיץ משתמש במודל זיכרון משלו, מערכת הוראה וערעור הנהג.לדוגמה, מכשירים NVIDIA CUDA דורשים ספריות קנייניות, בעוד AMD ROCm הוא קוד פתוח-מקור, אבל lags בתמיכה עבור מסגרות מסוימות.A שואפת לאחד CPU, GPU, ו- FPGA, יש צורך בהגדרות הפעלה חד-מפורמול, אך ורק באמצעות מערכת הפעלה אחת.

מורכבות תכנות

קוד כתיבה אשר מנצל ביעילות הן CPU ו מאיץ הוא קשה.מפתחים חייבים להבין גרפים של זרימת נתונים, היררכיות זיכרון, ויכולות המכשיר.גם עם מסגרות ברמה גבוהה כמו TensorFlow, suboptimal kernel מיקום או דפוסים של נתונים יכול לשלול רווחים חומרה.

עלויות ועיצוב מורכבות

הוספת מערכת מגבירה את מערכת ביל-of-Materials על ידי מאות עד אלפי דולרים לצומת. PCIe Pathways תקציבים מוגבלים; הוספת מאיצים מרובים עשויים לכפות את הבורסות (למשל, פחות NVMe SSDs) כוח עיצוב תרמית מסיבי חייב להתאים את הפירוק התרמית הגבוהה של מאיץ - אחד A100 GPU שואב עד 400 WCR מתאים, במיוחד עבור ציוד אחסון CRic, במיוחד עבור ציוד אחסון חזק כל כך חזק, כולל CPU.

תוכנה Fragmentation

האופי המהיר של מסגרות ML פירושו כי מאיץ תומך לעתים קרובות מפגר מאחורי הפעולות האחרונות. פונקציה הפעלה חדשה או סוג שכבתי לא יכול להיות ליבנל מותאם עבור FPGA נתון או ASIC, מה שמחייב את נפילה ל- CPU. פיצול זה יוצר תחזוקה מעל ראש ויכול להאט את אימוץ של מודלים המדינה-של האמנות.

יישום אמיתי בעולם

אינטל Xeon + FPGA

מעבדי ה- Xeon של אינטל עם Arria FPGAs משולבים (למשל, Intel Xeon Platinum 8580 + Intel FPGA AI Suite) מאפשרים ללקוחות לפרוס רשת עצבית השוויון בזמן אמת או ניתוח וידאו. FPGA מחובר באמצעות coherent UPI ופועל כאצ'ר כמעט-memory, ביצוע צינורות חסכוניים ללא מגע CPU של 2x4 עבור מודלים נבחרים.

AMD EPYC + Alveo

מעבדי EPYC של AMD יחד עם Xilinx (כיום AMD) Alveo accelerators להשתמש PCIe 4.0 וספריית תוכנה אישית הממנף את קוד פתוח Xilinx Runtime (XRT) בשירותים פיננסיים, שילוב זה משמש לדגימה סיכונים: ה-EPYC מטפל סימולציות מונטה קרלו בעוד Alveo מבצע פעולות ממטריקס עבור מודלים ליניאריים.

VIDIA גרייס הופר

NVIDIA's Grace Hopper Superchip משלבת חיבור מבוסס 72-core Arm-CPU (Grace) עם Hopper GPU (H100) באמצעות חיבור NVLink-C2C. בעוד גרייס משתמשת ב- RISC-כמו ARM ISA ולא CISC, הארכיטקטורה ממחישה את המגמה לכיוון CPU-R-celern-R2C, לעומת CV-C2CDR.

ASIC + x86 במרכזי נתונים בענן

ספקי ענן מרכזיים פריסת ASICs קניינית לצד Intel Xeon או מעבדי AMD EPYC. TE V4 של גוגל מחוברים ל- CPU מארחים באמצעות חיבורים מהירים; המארח פועל TensorFlow המשרתת בעוד ה-TPU מבצע מודל הסימון ב-CDC Inferentia שבבים משולבים באמצעות PCIe ב- EC2 מקרים (Inf1, Inf1, באמצעות ה-Cupitated Energy Index) ו-Cupitize.

Benchmarking and Performance Considerations

כדי להעריך מערכות משולבות, מתרגלים משתמשים במדדים מעבר ל-TFLOPS. End-to-end דרךput (inferences per second), זנבות לנטייה, ויעילות אנרגיה (הקצאות לוואט) משנה יותר.לדוגמה, כאשר מגישים מודל תזמון של בסיס דאנס, עומס נכון של אינטל Xeon לבדו עשוי להשיג 200 נקודות / אקסק עם 100 מ"ק לעקביות; תוספת של 10 נקודות עבודה עם קיפולק ל-2,000 נקודות עבודה רגילות, עם קיבולת גבוהה עם קיבולת.

קריטריונים סטנדרטיים כגון MLPerf Inference (מ-MLCommons) כוללים כעת קטגוריות עבור מערכות קצה וקוד נתונים עם האצה heterogeneous. Vendors להגיש תוצאות המציגות את יעילותם של שילובים של CISC-accel. נכון ל-2024, ההגשה העליונה לסיווג תמונה וזיהוי אובייקטים לעתים קרובות להשתמש במערכות עם עשרות מאיצים ל-CPU, הממחישים את הטיעון הדרגתי.

דרישות עבור אימוץ מערכות משולבות

ניתוח עומס העבודה

לא כל משימה ML מרוויחה באותה מידה משילוב מאיץ.מודלים שהם קושרים ויש להם דפוסי גישה רגילים לזיכרון (רשתות מהפכתיות, טרנסים) רואים את הרווחים הגדולים ביותר. הפוך, מודלים שהם זיכרון-עקביות בשפע (למשל, רשתות עצביות גרפיות עם נתונים דלים) עשויים לא לנצל את המאצ'ל ביעילות ואפילו לסבול ממערכות משולבות.

כוח ותקציב

צפיפות כוח ממוקדת נתונים היא דאגה גוברת. Accelerators לעתים קרובות דורשים קירור נוסף: כמה ASICs high-end דורש קירור נוזלי.אם המעטפה הכוללת של כוח עולה על יכולת המתקן, דרוג עם יותר CPUs עשוי להיות מעשי יותר. Integrated עיצובים לחלוק רכבת כוח אחת (למשל, מעבדי H של אינטל עם GPU משולב) יכול להיות יותר יעיל מאשר כרטיסי דיסקרטי.

תוכנה Maturity

להעריך את הבשלות של ערימה התוכנה עבור מאיץ הנבחר שלך.האם מסגרות ML פופולריות נתמכת? האם יש נהגים מוכנים בייצור עם סובלנות לקויה ורמת דינמיות? עבור FPGAs, לשקול כי איסוף bitstream יכול לקחת שעות - ביצוע עדכונים במודל בזמן אמת קשה. ASICs ו TPUs בדרך כלל יש זמני איסוף מהירים יותר אבל פחות גמישות.

תמיכה עתידית

טכנולוגיית Accelerator מתפתחת במהירות. PCIe 5.0 ו- CXL 3.0 יגדילו את רוחב הפס ויאפשרו למחול זיכרון על פני מספר מאיצים מרובים. יכולתו של CXL לצרף מאגר זיכרון בו-זמנית נגיש על ידי CPU ו- Accelerators עשויים להפוך ל-changer-changer עבור הכשרה בקנה מידה גדול. בעת השקעה, לבחור חיבורים מבוססי סטנדרטים ומודלים פתוחים כדי למנוע מ-Auto-in.

פרספקטיבה עתידית

המסלול ברור: מערכות של CISC-accelerator היברידיות יהפכו לנורמה במחשוב בעל ביצועים גבוהים, מרכזי נתונים בענן ואפילו מכשירים קצה. Advances in האריזה - כגון שבבים ו- 3D ערימה של - אפשר CPU מת ומאיץ מת כדי להתגורר באותה החבילה, צמצום הגמישות והכוח של אינטל.

מסגרות תוכנה מתפתחות לטיפול מאיצים כאזרחים ממדרגה ראשונה.עלייה של שפות ספציפיות לתחום (למשל, טריטון, TVM) וייצוגים ביניים סטנדרטיים (MLIR) יפחיתו את המחסום למפתחים.בנוסף, מודלים שפה גדולים (LLMs) דוחפים את הגבולות של זיכרון מאיץ, מה שהופך חידושים בעומס ו-mory (IMC) יישארו חיוניים יותר ויותר לשליטה על ידי חבר העמים.

עבור ארגונים אשר מעבדים עומסי עבודה משמעותיים של ML, ההחלטה לשלב מאיצים עם תשתית CISC שלהם היא כבר לא שאלה של "אם" אבל "איך" על ידי בזהירות במשקל היתרונות - ביצועים, יעילות, דרוגיות - נגד האתגרים - עלות, מורכבות, פיצול - ולאחר עקרונות העיצוב המתואר לעיל, מהנדסים יכולים לבנות מערכות כי הם מוכנים לגל הבא של התקדמות AI.