Table of Contents
מבוא: עלייתו של FPGA Acceleration במרכזי נתונים היפר בקנה מידה
מרכזי נתונים היפר בקנה מידה עומדים בפני דרישה בלתי פוסקת לביצועים חישוביים כי ניתוק את היכולות של CPUs מסורתיים. Workloads כגון למידת מכונה, בזמן אמת וידאו חוצה, מסחר גבוה, ורשתות מוגדרות תוכנה דורשות לא רק גלם באמצעות חישובים, אלא גם קביעת יעילות נמוכה ויעילות כוח כי מעבדים למטרות כלליות נאבקים לספק מערכות סטנדרטיות של C-GA במהירות גבוהה כמו גם מרכז קבוע של פונקציות קריטיות.
אדריכלות FPGA ותפקידה האסטרטגי
FPGAs מורכב מערכים עצומים של בלוקים לוגיים מתוכנתים, שולחנות תצוגה מוכחים, סיליקון קצה, חתיכות עיבוד אותות דיגיטליים, חסום RAM, וטרנסיבי מהירות גבוהה. בניגוד CPUs המבצעת הוראה קבועה על קומץ של ליבות, מרכז נתונים קבוע של CCAPL CCAP מציעה מאות אלפי תאים לוגיים עצמאיים המסוגלים ליישם נתונים מותאמים אישית, מערך סינתי או ממפה עמוקה זו מאפשרת פונקציות של תאים.
Reconfigurability הוא יתרון מפתח: מפעילי יכולים לעדכן את שכבת האצה החומרית זמן רב לאחר הפריסה, קריטי כאשר פרוטוקולי רשת מתפתחים, אלגוריתמי הצפנה משודרגים, או אדריכלות רשת עצבית חדשנית מופיעים.עבור סקירה מפורטת של אדריכלות FPGA ויישומים מרכז נתונים, עמוד מוצר FLT:0Intel FPGA FPGA FPGA 1 מספק תיעוד טכני נרחב.
המונחים: Hyperscale FPGA Systems
בניית פלטפורמה האצה FPGA עבור אלפי שרתים דורש תכנון קפדני על פני ממדים מרובים.הסעיפים הבאים לבחון את הגורמים הקריטיים ביותר המשפיעים על ביצועים, עלות ועלילות בקנה מידה.
אדריכלות סקלאפילית ואדריכלות מודולריות
לוח FPGA יחיד אינו יכול לספק את הדרישות המנציח של שירות מרכזי נתונים שלם. Scalability חייב להיות מונדס מן הקרקע למעלה. עיצובים מוצלחים לאמץ גישה מודולרית, שבו מספר כרטיסי מאיץ FPGA מחוברים באמצעות רשתות מתקדמות וזרימים תנועה מצופים גבוה, ללא ייצור האצה אחיד.זה כרוך לעתים קרובות פיצול גרפים חישובים גדולים לתוך שלבים צינורות לתוך צינורות שונים, או להחליף מודל דינמית על ידי מערכת הפעלה חלקית.
(מודולריות מקיפים השפעות פיזיות: גורמי צורה סטנדרטיים כגון PCIe Add-in Card, mezzanine מודולים, או לוחות כי להתחבר לפרויקט Compute (OCP) תואם שרת כיסס מפשט ותחזוקה.שימוש במודל תשתית הניתן להגדרה, המפעילים יכולים להקצות משאבים FPGA כדי לעבוד באמצעות מנהל מוגדר תוכנה, טיפול בבריכת של מאגרים כגון: CERFregal:
כוח יעילות ועלויות הכוללות של בעלות
צריכת החשמל משפיעה ישירות על העלות הכוללת של בעלות (TCO) במרכזי נתונים, שבו קירור וחשמל מהווים לעתים קרובות את ההוצאה התפעולית הגדולה ביותר. FPGAs הם בדרך כלל יותר יעילים כוח מאשר GPU עבור עומסי עבודה מסוימים בשווה ערך באמצעות חישוב, אך מכשירים מתקדמים יכולים להתפזר 75-150 W או יותר, הדורשים עיצוב עודף אנרגיה זהיר.
אופטימיזציה של כוח דינמי מתחיל בשלב הסינתזה של RTL או ברמה גבוהה.טכניקות כגון שעון גלידת, בידוד אופרות, ניצול מצבי שינה מוצפנים של FPGA להפחית פעילות החלפת דינמי. וולטאז קנה מידה - מניעת חיישנים מתחים הניתנים להפעלה של אינטל כדי להפחית את המתח הליבה במהלך פעולות לא קריטיות - יכול להניב חיסכון כפול של כוח ניהול שטח יעיל ולהפחית את אוטובוסים סטנדרטיים של כוח מדידה, כמו ניהול יעיל על ידי ניהול כוח מדידה יעילה על ידי ניהול יעיל של כוח מדידה יעילה על ידי ניהול יעיל של כוח, כמו גם על ידי ניהול יעיל של כוח יעיל.
מעבר לאופטימיזציה לוגית, בחירת משפחת המכשיר הנכון ממלא תפקיד. Power FPGAs כמו פלטפורמת ה-Lattice Nexus עשויה להספיק לדחיסה קלה או הצפנה, בעוד משימות בעלות משקל קיצוניות יכולות לפעול על מכשירים בעלי רמה גבוהה עם יכולת HBM גדולה. TheFLT:0Xilinx Versal Management User GuideFLT:1 מציע אסטרטגיות קונקרטיות עבור כוח תרמי ופלטפורמות ניהול כוח מואץ.
שקיפות ותהליך בזמן אמת
שירותי מרכז נתונים פועלים תחת הסכמי רמת שירות מחמירים המפרטים את רמות הזנב בטווח המיקרו השני. FPGAs מצטיין כאן כי הם ליישם אדריכלות צינורות עמוק, מזון קדימה כי לעבד נתונים עם דטרמיוני, נמוך ג'יר נמוך.עיצוב ביצועים צפויים דורש ניהול זהיר של עומק צינור, דפוסי גישה זיכרון, ואינטראקציה עם DRAM חיצוני. לדוגמה, מנטיקה כי מחוץ לרשת מחסנית CGA יכול לראות לחלוטין בדיקות CPUTP, באופן קבוע, עיבוד CFP.
השגת שקיפות אולטרה נמוכה דורש כי מערכות I / O של FPGA לשמור על קצב. ישירות לצרף ערוצי זיכרון גבוהה פסוויים או מינוף חיבורים בין-חושיים כגון CXL.m ו- CXL.cache מבטלים עותקים רבים ומתגים בהקשר של יישומים מסחר פיננסי בזמן אמת, לוגיקה FPGA מותאם אישית יכולה ליישר קופס בלתי אפשרי, פורמטים של תוכנות, ו-2, עבור הזמנות.
חיבורים מהירים ושילוב רשת
מרכז הנתונים הוא ביסודו של רשת ממוקדת, ו-FPGA מאיצים חייב להתחבר לתוך מרש סדרתי במהירות גבוהה. PCI Express נשאר הקישור הדומיננטי המארח-טאך, עם Gen4 (16 GT/s) ו- Gen5 (32 GT/s) המספק עד 64 GB/s של רוחב פס ל- x16.
עבור האצה ישירה-to-network, כרטיסי FPGA כוללים לעתים קרובות משולבים 100G / 400G Ethernet MACs ו- לוגיית תיבת הילוכים.המרקה יכול ליישם צינורות עיבוד מותאם אישית בשפה ברמה גבוהה כמו P4, שנאספו ישירות על החומרה של Microsoft Project Catapult חלוצית על השימוש של FPGA-en-en-NICs על פני צי שלה, להפגין בקנה מידה גדול היקף רשת Fcc-FD (F-F-F-Fal) ו-Ferc-F-F-F-Fercate (Fercup) מערכת אחסון מערכת אחסון מערכת נתונים פתוחה התקנים (FD) ו-FD (FD) ו-FD.com-FD.
מעצבים חייבים גם לשקול רב-FPGA להתנצלות.פרוטוקולים כמו Aurora (מ- AMD) או ממשקים סדרתיים קנייניים מאפשרים חיבורי שבב ישיר אל שבב, יצירת מאפר של FPGAs אשר מתנהגים כמערך הגיוני גדול יותר. בשילוב עם RDMA על Ethernet מודבק Ethernet v2, אשכולות כאלה יכולים להשיג תקשורת נמוכה, גבוהה ללא מעורבות CPU.
פיתוח זרימת עבודה ו High-Level Synthesis
פיתוח FPGA מסורתי עם VHDL או Verilog דורש מיומנויות מיוחדות וזמני ייצור ארוכים כי הסכסוך עם מחזורי ההצתה המהיר של צוותי תוכנה במרכז נתונים מרכז נתונים. High-Level Synthesis הפך אבן הפינה של עיצוב נתונים יצרני מרכזי FPGA, המאפשר אלגוריתמים להיות מובע C, C++, או OpenCL ובאופן אוטומטי מתורגם כלי RTL יעילים.
בלוקים IP ייעודיים לפונקציות משותפות - DDR4/5 בקרים, PCIe DMAs, מנועי הצפנה, 100G Ethernet Mac - באופן דרמטי להפחית את מאמצי האינטגרציה. זרימת העבודה במרכז הנתונים בדרך כלל עוקב אחר צינור: אדריכלות בכלי מודל ברמה מערכתית, אלגוריתם ב HLS, RTL, סימולציה פונקציונלי באמצעות מודלים של מחזור תיקון, סינזה ומקומות, תזמון, תזמון, תזמון, סימולציה לא יכול לבצע שינויים סימולציה פונקציונליים עם מערכות תזמון או תזמון, סימולציה פונקציונלי.
עבור קבוצות תוכנה, מודל התכנות הוא לעתים קרובות מופשט מאחורי API במשרה מלאה. Libraries כגון Open Programmable Acceleration Engine (OPAE) עבור Intel FPGAs או Xilinx Runtime (XRT) לספק ממשק מאוחד עבור טעינת bitstreams, ניהול buffers, והגשת עבודה למאגרת ה-EC.
ביצוע ובדיקות מתח
לפני ש-FPGA מאיץ הוא פרוס לייצור, זה חייב לעבור בדיקות ממצה כדי להבטיח אמינות תחת גליונות עומס עבודה בעולם האמיתי. אימות פונקציונלי מתחיל עם סימולציה נרחבת, אבל שום סימולציה מלאה ללכוד את ההתנהגות הפיזית של סיליקון פועל במאות מגה-הרץ עם אספקה רועשת של כוח.Harware-in-the-loop Testing, שבו לוח ה-FPGA משולב עם תנועה בפועל או שרת חי, הוא חיוני.
בדיקות מתח חייבות לכסות מקרים פינה: מקסימום דרך חישוב עם גודל החבילה המינימלי, דפוסי תנועה מרופפים, לקרוא / לשכתב תוכן בזיכרונות משותפים, ובדיקות ספוגיות תרמיות הדוחקות את כוח העיצוב התרמית שלה לתקופות מורחבות. הצגים משובצים בד ה-FPGA - כגון ניגודי עסקה, צמיגים עקביים, וצפי רוחב פס - צריכים להיחשף באמצעות ממשקי ניקוי כדי לאמת בהדרגה את מטרותיה של לחץ דם נמוך, תוך כדי הפעלת לחץ דם גבוה של תאים חדשים, תוך כדי הפעלת תאים חדשים של תאים, תוך כדי הפעלת לחץ על פני טווח תאים חדשים ברמת הקיבולת גבוהה של תאים, תוך כדי הפעלת לחץ על פני טווח של תאים קצרים, תוך כדי הפעלת לחץ על פני טווח של תאים חדשים של תאים חדשים של תאים חדשים של תאים חדשים של תאים חדשים, תוך כדי הגדלת של לחץ דם, תוך כדי הפעלת לחץ דם גבוה של תאים קצרים, תוך כדי הפעלת לחץ דם, תוך כדי הפעלת תאים חדשים, כדי הפעלת לחץ על מנת להגביר את לוח זמנים, תוך כדי הגדלת טווח תאים חדשים, תוך כדי הפעלת לחץ על מנת לדרגת של לוח זמנים, תוך כדי הפעלת לחץ על מנת להגביר את לוח זמנים, תוך כדי הפעלת לחץ על מנת להגביר את לוח זמנים, תוך כדי הפעלת לחץ על מנת להגדלת לוח זמנים של לוח זמנים, תוך
שיטות אימות טובות כוללות בדיקות שאינן במקום: איך המערכת מתנהגת כאשר לוח FPGA overheats או נתיב transceiver Path Path Path Degrads? - תוכניות השפלה גרייסי, כגון הפניית התנועה אוטומטית מאיץ מחוספס אדום, הם קריטי לשמירה על זמינות SLAs.
מחקרים: Hyperscale FPGA Deployments בייצור
פריסות בעולם האמיתי ממחישות כיצד מערכות FPGA מספקות ערך בסביבות היפר-ממדיות.פרויקט Catapult המשולבות של Microsoft (כיום אינטל) FPGAs לכל שרת של צי Azure שלה, בתחילה עבור רשת עצבית עמוקה ולאחר מכן עבור רשתות מוגדרות תוכנה ואחסון כבויה.התוכנית הוכיחה כי בד FPGA עקבי על פני עשרות אלפי שרתים יכול להאיץ עבודה מגוונת ללא שינויים חומרה כל שרת הפעלה נמוכה, באמצעות שרת ה-ידי מערכת הפעלה של PCGGGG.
Amazon Web Services מציעה מקרים EC2 F1, שנבנה על Xilinx Ultrascale+ FPGAs, כפלטפורמת האצה נגישה למפתחים. משתמשים מעצבים מאיצים באמצעות ה-AWS Hardware Developer Kit או באמצעות מסגרות גבוהות יותר כמו SDAccel. מודל זה אומץ לניתוח genomics, קטעי וידאו טרנסקוינג, וסימולציות פיננסיות מונטה קרלו.
השימוש של Baidu ב- FPGAs להכרה בדיבור מראה כיצד עומסי AI קריטיים תועלת.החברה הציבה גישה FPGA טהורה עבור ניקוד למידה עמוק, השגת עצלות תת-מיל שנייה לביטוי וצמצום צריכת החשמל ב-40% בהשוואה ל- GPU בסיס.
מודלים תכנות ושכבות אבסטרון
פער ההסתברות נשאר אחד החסמים הגדולים ביותר לאימוץ FPGA במרכזי נתונים.בתגובה, התעשייה פיתחה שכבות מופשטות מרובות כדי לאפשר מהנדסי תוכנה לכוון FPGAs ללא מומחיות חומרה עמוקה.
- (FLT:0) OpenCL / SYCL:FLT:1 של אינטל ותמיכה Vitis של AMD OpenCL ו- SYCL, המאפשר תכנות בסגנון הקרנל על פני CPUs, GPUs ו- FPGAs. SYCL בפרט מספק קוד יחיד C + עם הרחבות ספציפיות עבור צינורות וזיכרון.
- (FLT:0) High-Level Synthesis Libraries:BuildFLT ( 1:1 שני הספקים מציעים ספריות ספציפיות דומיין עבור חזון, אלגברה ליניארית, עיבוד אותות.הספרות האלה הן טרום-אופטימיות למטרה FPGA וניתן להלחין לתוך מאיצים גדולים יותר.
- (FLT:0) Runtime APIs:FLT:1 Open Programmable Acceleration Engine (OPAE) ו- XRT טעינה מופשטת bitstream טעינה, ניהול חיפר וסינתזה.הם חושפים ממשק API ברמה נמוכה C שניתן לעטוף על ידי מסגרות גבוהות יותר כמו צ'אפאצ'י חץ או TensorFlow.
- (FLT:0)P4 עבור רשתות:FLT:1 שפת P4 מגדיר צינורות עיבוד החבילה אשר מתאספים ישירות ללוגיקה FPGA, המשמש לתגים הניתנים לתוכנה, מכונים חכמים ומערכות זיהוי חדירה.
שכבות מופשטות אלה מורידות את המחסום אך עדיין דורשות הבנה של הטיות, דרך חישוב, ושביעות רצון משאבים.הפריסות המוצלחות ביותר משקיעות בשכבה בינונית של מדפים ספציפיים לתחום וכלים כוונון אוטומטי הממפה אלגוריתמים על משאבי FPGA באופן אוטומטי.
אתגרים תפעוליים: ניטור, תחזוקה וביטחון
הפעלת אלפי מאיצים FPGA בייצור מציגה אתגרים שלא נראו במרכזי נתונים CPU בלבד. Bitstream ניהול הופך מורכב, במיוחד כאשר שימוש בהגדרה חלקית. המפעילים צריכים תמונה בטוחה, חתימה על bitstreams, ומנגנון רולבק מודרני.המרק עצמו יכול להיות דאגה ביטחונית: כי התצורה נשמרת ב-SRAM, היא פגיעה בתצורה של תצורה של שימוש בתצורה של תצורה תצורה תצורה תצורה תצורה מפונקטיבית ו-Fervtictictic עדיין צריך לשקול שגיאות תצורה של תצורה של תצורה של תצורה של תצורה של תצורה של תצורה של תצורה של תצורה של תצורה של תצורה של תצורה של תצורה של תצורה של תצורה של תצורה של תצורה של תצורה תצורה של PGGA תצורה של תצורה של תצורה של תצורה של תצורה של תצורה של תצורה אחורית ו-PTSD עצמו יכול להיות תצורה אחורית ו-PTR.
ניטור תרמי דורש חיישנים ייעודיים לכל כרטיס המשולב עם מערכת ניהול כוח של מרכז הנתונים. FPGA כרטיסי לעתים קרובות יש אזורי טמפרטורה מרובים (לוגיקה, transceivers, DRAM), וגזר תרמי חייב להיות מיושם בתכנון כדי למנוע נזק ללא הפסד המדינה.רוב מערכות הייצור להשתמש בקר ניהול צד שיכול מחזור או איפוס כרטיסי מאיץ בודדים אם הם הופכים ללא אחריות.
אבטחה גם מרחיבה את התקפות ה-Frettime. Side-channel, כגון ניתוח חשמל או אלקטרונים אלקטרומגנטיים, הם אפשריים אם תהליכי FPGA רגישים נתונים.טכניקות כמו לוגיקה קבועה, קידוד כפול, ומגן פיזי מקטין את הסיכונים האלה.ברמה צי, עקרונות רשת אפס-אמון להחיל: מאיצים FPGA צריכים לאמת את עצמם לפני קבלת עדכונים, וכל התקשורת הבין-קרדיו צריך להיות מוצפנים כאשר הם צריכים לשתף מסלולים.
כיוונים עתידיים: FPGAs במרכזי נתונים הבאים
המסלול של טכנולוגיית FPGA מצביע על שילוב הדוק יותר עם שאר תשתיות מרכז הנתונים. AI הקצוץ בקצה ובענן דוחף FPGAs מעבר לתפקידים ההאצה המסורתית. AI ספציפית יתר - מעבדים רכים שנועדו לבצע רשתות עצביות קוונטיות עם יעילות קיצונית - עכשיו ספינה כמו ספקי ה-FPGA.
מגמה נוספת היא אימוץ של ארכיטקטורות מבוססות השבבים.על ידי פירוק ה- monolithic FPGA לתוך שבבים המחוברים באמצעות חיבורים בין-על-ידידים (למשל, UCIe, Intel's EMIB), יצרנים יכולים לערבב ולתאם את לוח ה-HSD, זיכרון, ו- I/O אריחים על חבילה אחת.
תוכנה תוכנה תוכנה תמשיך לשפר את.ה-FPGA Stack הפתוח מ- Intel ופלטפורמת התוכנה המאוחדת Vitis מ- AMD במטרה להביא חוויית חומרה מוגדרת תוכנה אמיתית, שבה עדכונים יכולים להיות דוחפים מעל הרשת ואת מרק ה-FPGA מחדש הגדרות במילימטרים. as CXL 3.0 ו- PCIe 6.0 יהפכו לזרם מרכזי, בריכות זיכרון משותפות יעברו מספר רב של FPGAs, GPUs, ו- Crings, ועוד, בין קווי מטושטשים.
יעילות אנרגיה מניעת חדשנות. Near-threshold Stress Act וטכניקות הטיה הגוף הסתגלות מבטיח ל-Slash כוח סטטי, בעוד הפעלה חלקית חלקית של reuration מאפשר אזורים לוגיקה לא בשימוש להיות מופעל באופן דינמי.ההתקדמות הזו תעזור FPGAs לעמוד במטרות הקיימות של מרכזי נתונים היפר בקנה מידה תוך מתן אי-פעם באמצעות וואט.
לסיכום, תכנון מערכות FPGA עבור מרכזי נתונים בקנה מידה גדול הוא תרגיל בהנדסה הוליסטית כי מאזן אדריכלות, כוח, קישוריות, וזריזות תפעולית. על ידי אימוץ עיצובים מודולריים, סינתזה ברמה גבוהה, קוהרנטית חיבורים, ואימות קפדני, קבוצות יכולות לפרוס מארגי מאיץ כי להסתגל לעומסי העבודה של מחר תוך שמירה על TCO תחת תוכנה ו- Fokes סביב היררכיה קצרה, הם יהפכו למרכז נתונים, אפילו יותר ויותר.