control-systems-and-automation
שילוב של הוראות מאופטימיזות על ידי AI בארכיטקטורות Cisc
Table of Contents
האבולוציה של מחשוב: AI-Optimizedהוראות באדריכלות CISC
ההתקדמות הבלתי פוסקת של בינה מלאכותית הציבה דרישות חסרות תקדים בחומרת מחשוב.בעוד שחידושים תוכנה כמו מסגרות למידה עמוקות וספריות מיוחדות הובילו התקדמות, ארכיטקטורת המעבד הבסיסית נותרה סלע הביצועים של AI במשך עשרות שנים, ארכיטקטורות מורכבות של מערכת החינוך (CISC) – שהוזנחו על ידי משפחת מחשוב אקס86 המסוימת לחלוטין – מונעים הכל מהמחשבים האישיים למרכזי נתונים ארגוניים.
הבנת ארכיטקטורות CISC: A Legacy of Complexity
מעבדי CISC מוגדרים על ידי יכולתם לבצע פעולות מרובות שלבים עם הדרכה מכונה אחת.פילוסופיה עיצוב זה התפתחה בשנות ה-70 וה-80, במטרה להפחית את הפער הסימנטטי בין שפות ברמה גבוהה לבין קוד ההתאספות. על ידי מתן הוראות עוצמתיות - כגון חיפושים מיתרים, פעולות צף-נקודות, וזיכרון-ל-ל-זיכרון-למטרים מפשטים עיצובים ולהפחית את מספר ההוראות של תוכנית x-86, לאחר מכן, לאחר מכן, לאחר מכן, הפך ל- 80 עשורים, לאחר מכן, לאחר מכן, לאחר מכן, כוח-x-86, לאחר מכן, לאחר מכן, הפך לכוח הפות-x-x-הכוחו של צוותו של צוות של הפות-מחדש, לאחר מכן, לאחר מכן, לאחר מכן, לאחר מכן, לאחר מכן, לאחר מכן, לאחר מכן, לאחר מכן, לאחר מכן, לאחר מכן, הפך ל-מחדש-מחדש-מחדש, לאחר מכן, לאחר מכן, לאחר מכן, לאחר מכן, לאחר מכן, הפך ל-מחדש-מחדש-ידי צוות שלמדורג'מחדש-עשר עשורים, לאחר מכן, לאחר מכן, לאחר מכן, לאחר מכן, לאחר מכן, לאחר מכן, לאחר מכן, לאחר מכן, ל
מאפיינים מרכזיים של CISC כוללים פורמטים הוראה באורך משתנה, להתמקד microcode מונע חומרה כדי ליישם פעולות מורכבות, ומספר קטן יחסית של רישומים למטרות כלליות.בניגוד הקטנת מערכת ההוראה (RISC), אשר מדגיש פשטות והוראות קבועות באורך, CISC עדיפות צפיפות קוד וכוח.זה קטורס מסחר הפך היסטורי מעבדים של CISC מתאים היטב עבור מגוון רחב של יישומים, אבל מציג גם את האתגרים המקבילים עבור ביצועים מודרניים.
עלייתו של הוראות AI-Optimized
הוראות AI-optimized הן פקודות מעבד מיוחדות שנועדו להאיץ את הדפוסים החישוביים של למידת מכונה: matrix multiplication, convolution, Tenor תפעול וקטורציה מדרגה גבוהה.הוראות אלה לנצל מקבילות ברמת הנתונים ולהפחית את פני הגישה של הזיכרון וזרימת הבקרה.דוגמאות נפוצות כוללות את AVX-512N של אינטל (הוראות רשת ניאל), AVX2EX עם VEX ו-AMD יותר מתקדם (R).
עיבוד וקטוריזציה
בלב האצה AI מונח עיבוד מקבילים.במקום שבו הוראה סטנדרטית פועל על זוג יחיד של אופרות, הוראות וקטור - כמו אלה ב SSE, AVX ו- AVX-512 - כמעט אותו פעולה לאלמנטים מרובים בו זמנית. זה יחיד-instruction, מספר רב-נתונים (SIMD) הוא אידיאלי עבור משימות כגון עיבוד פיקסל בראייה, משקל בעדכונים, ותפקוד כפול עם AI-Factated באופן משמעותי, כולל פעולות חד-MA-MA-D (SIG) ותפקוד חד-מטבהתאמה) הוא אידיאלי עבור משימות כגון עיבוד פיקסל-מטמים עם ביצועים משופרים עם ביצועים מתקדמים באופן משמעותי, אשר לעתים קרובות.
מטריקס ייעודי ו- Tensor Operations
מעבר לVirtativeization הפשוט, יצרני ה-AI המודרניים מסתמכים במידה רבה על ריבוי ממטריקס ועומסי Tenor.כדי לטפל בזה, יצרני המעבד הציגו הוראות ספציפיות ממטריקס. AMX של אינטל, למשל, מוסיף האריחות והוראות ה-"TDPBF16PS" לביצוע 16 סיביות פעילות גופנית מהירה יותר, המאפשרת ל- BCCTV-Fx פחות מכפלה הפעלה אחת.
יחידת הזיהוי הרדיפת
הוראות AI-optimized לעתים קרובות מגובים על ידי יחידות מיקרו-אטוריות ייעודיות.לדוגמה, יישום AMX במעבדים של Intel ספירה Rapids כולל יחידת האריזה ויחידת טעינה / חנות שעובדת בשיתוף פעולה הדוק עם ההיררכיה של cache. אלה בלוקים נועדו לקיים שיעורי פעולה גבוהים - לעתים קרובות להגיע aflops של ביצועים bfloat16 - בעוד צמצום צריכת הכוח ביעילות בתוך יחידות חומרה כאלה בתוך רוחב פסים קטנים יותר, ללא רוחב פסים של משימות חיצוני.
הוראות AI לתוך CISC: גישות ומסחר
הגדלת הוראות AI-optimized לתוך ארכיטקטורות CISC אינה עניין פשוט של הוספת קודים.זה דורש הרחבה זהירה של מערכת ההוראה, שינוי של צינורות קודר ומיקרוקוד, ולפעמים שינויים לרשום מצב או זיכרון שיטות טיפול. שתי גישות עיקריות הופיעו: הרחבת משפחות SIMD קיימות והוספת כיתות הוראה חדשות לחלוטין.
הרחבת מערכת ההוראה SIMD הקיימת
הדרך הפשוטה ביותר היא להרחיב את מערכות ההוראה ה- SIMD פופולריות. AVX-512 של אינטל, שהוצגו לראשונה עם Skylake-SP, כבר כולל קבוצה עשירה של פעולות וקטורת. תוספת של VNNI ב- Cascade Lake ומאוחר יותר AVX512 BF16 ב-Coream הביא את הארי-level ו-bfloat16 יכולות. אלה מחזרות את קובץ הרישום הקיים (MMZ ב- AV-5X) ו-II, אך ניתן למזער רצף זה עדיין לוגי, אך ורק אם כי הם לוגיים, אך ורק תואמים את המשתנים, אך ורק תואמים את המשתנים, אך ורק אם כי הם רצף זה, אך ורק על ידי רצף זה, אך ורק על ידי לוגיים, אך ורק על ידי רצף זה, אך ורק על ידי רצף לוגיים, אך ורק על ידי לוגי, אך ורק על ידי לוגיים, אך ורק על ידי רצף קידוד לוגיים, אך ורק על ידי שימוש ב-זמנית, יש צורך למזערי, אך ורק על ידי רצף זה, אך ורק על ידי רצף זה, אך ורק על ידי רצף זה, אם כי הם יכולים למזערי תיבות של רצף
כיתות הוראה חדשות וקבצים רשומים
עבור האצה רדיקלית יותר, ספקים הציגו כיתות הוראה חדשות לחלוטין עם הקבצים שלהם להירשם. AMX של אינטל, למשל, מוסיף שמונה רושמים אריחים (כל אחד תצורה של שורות ועמודות) בנפרד מהקודמים הכלליים המסורתיים ורישום וקטור. אלה אריחים חיים באזור אחסון ייעודי, והוראות כמו "TILSTOAD" ו-"TESTpilid" נתונים של ניהול קוד פתוח, דורשים גם תכונות הפעלה חדשות.com יכולות להיות מסוגלות.
מינוף המורכבות והיעילות
אתגר רב שנתי בעיצוב CISC הוא המתח בין כוח ההוראה ומורכבות החומרה.הוספת הוראות AI-אופטימיות מגביר את מספר קודים אפשריים ולטפל בצורות, אשר יכול לנפח את הפעוט ולעלות צריכת חשמל.כדי להפחית את זה, מעבדי CISC מודרניים לעתים קרובות להשתמש צינור קוד אשר מתורגמת הוראות מורכבות למיקרו-קוד פשוט יותר (μops AI) הם בדרך כלל ממפה למספר מיקרו-מודולים לאחור של שיטות הפעלה.
מחקרים: Intel ו- AMD Implementations
שני שחקנים מרכזיים בשוק CISC - Intel ו- AMD - לקחו נתיבים נפרדים כדי לשלב הוראות AI-optimized.בדיקת האסטרטגיות שלהם מגלה את ההסכמים המעשיים הכרוכים.
AVX-512 של אינטל ו-AMX
אינטל הייתה האגרסיבית ביותר בהוספת הוראות בינה מלאכותית ל- x86. החל מ- AVX2 (Haswell) והמשך באמצעות AVX-512 (Skylake-SP), כל דור הוסיף תכונות כמו FMA, Integer FMA, ולבסוף VNNI למהירויות של רשתות עצביות מהפכתיות (BN) עם ספירת מהירות גבוהה (D2X) ו-BSX) נדרשים גם ל-D2X2X).
AVX-512 ו- BF16 תמיכה
AMD בתחילה נמנע AVX-512, וציין חששות כוח ומורכבות.עם ארכיטקטורת הזן 4, עם זאת, AMD ייושם AVX-512 עם 256-bit Datapath, פיצול 512 סיביות לשני חצאי 256 סיביות.עם זאת, גישה זו מפחיתה את העלות החומרה בעוד עדיין מספק את רוב הביצועים אולטרה סגול.
אתגרים ושיקולים באינטגרציה אמיתית בעולם
הגדלת הוראות AI-optimized לתוך ארכיטקטורות CISC אינה ללא מכשולים. להלן הם אתגרים מרכזיים העומדים בפני אדריכלים ומעצבי מערכת.
חזרה ל-Compettibility ו- Software Ecosystem
העוצמה הגדולה ביותר של CISC - תאימות לאחור לאורך זמן - היא מגבילה כאשר מוסיפים הוראות חדשות. קודים חדשים חייב להיות ממוקם בחלל ללא שימוש ללא שימוש ללא שימוש קידוד מבלי לשבור זרמים קיימים.זה קשה במיוחד ב x86, שבו מפת ה-code היא כמעט מלאה.אי ו- AMD לעתים קרובות להשתמש ב-VEX ו- EVEXfixes כדי להרחיב את החלל הקידוד.תוכנות חייבות להיות מחוספסות עם דגלים חדשים (D) או קודים שונים (D.
ניהול כוח ו-Thermal Management
הוראות AI, במיוחד מריצה פעילות, יכול לצייר כוח משמעותי - לעתים קרובות מעל 200W עבור שקע יחיד. צפיפות מוגברת של פעולות מחזור מעלה את העודף הנוכחי ואת צפיפות תרמית.אדריכלים חייב לתכנן משלוח כוח חזק פתרונות קירור, ומערכות הפעלה חייב ליישם תדירות גבוהה מוטבעת (למשל, Intel Speed Shift) כדי לאזן ביצועים וכוח.
אורך זיכרון וזיכרון בנדווית
וקטור וקטור או מטריצה דורשים רוחב פס זיכרון גבוה יותר.A 512-bit ומבצע דורש להביא 64 ע"י מצעים לעומס; ניתוח אריח מטריצה 1024 סיביות עשוי לדרוש מאות ע"י מכשירים להדרכה.אם מערכת הזיכרון אינה יכולה לספק נתונים מהר מספיק, את המעבדים של Intel C משלבים ריבועים גדולים (-2MB לליבת מחיר) וזיכרון גבוה (DR, במיוחד) כגון יחידות זיכרון CB5, אך הן מכילות) עם זיכרון מסוג C2, אך הן מורכבות (D) אך הן מורכבות (D) אך הן מכילות) עם C2 Cv) אך הן מכילות (D) עם Cv) עם CER (D) עם Cv) עם C2 C2 C2 C2 C2 C.
אבטחה וצד-Channel Attacks
הוראות חדשות מציגות משטחים חדשים של התקפה.הארי נרשם ב AMX, למשל, רגישים להתקפות להורג של ⁇ אם לא מבודד כראוי.אינטל הוסיפה אמצעי הגנה מיקרו-אטוריים (למשל, מניעת יחידת הארי multiplication מלהיות מנוצלים עבור פעולות קריאה) ודורשת ניקוי מצב הארי על מתג.
כיוונים עתידיים: הדור הבא של אינטגרציה CISC-AI
שילוב של הוראות AI-optimized אדריכלות CISC הוא תהליך מתמשך. מגמות מספריות יעצבו את חמשת עד עשר השנים הבאות.
צמצום העדיפות ותמיכה במעורבות
מודלים AI יותר ויותר להשתמש סוגים של נתונים נמוכים -bfloat16, FP16, INT8, ואפילו INT4 - כדי להפחית את טביעת הרגל הזיכרון ולהאיץ חישוב. הרחבות של CISC בעתיד סביר להוסיף תמיכה Native עבור פורמטים אלה, כולל יחידות המרת חומרה והוספת אופטימיזציה.לדוגמה, היכולת להכפיל שני ערכים uint4 ולהצטבר ב aprecision aculator יכול גם להכפיל את סוגי העבודה באופן ישיר (מפרקט) כמו FP) כגון מטריקס).
הסכם ספיידר זמני וספאטי
מודלים רבים של בינה מלאכותית מציגים ספאריות - מספר גדול של אפסים במשקל או הפעלה. Exploiting ספאrsity יכול להפחית באופן דרמטי את המאמץ חישובי.הוראות בינה מלאכותית עתידיות עשויות לכלול פעולות ספיידר-מטריקס, כגון דחיסה של שורת ספאאר (CSR) פורמט רב-כפל או איסוף-קטר עם אפס-סקיצה.
שיפור של שליטה וזרימת נתונים
מעבדי CISC הנוכחיים לפענח הוראות באופן סדרתי, אבל עומסי AI לעתים קרובות מציגים מקבילות נתונים גבוהות עם זרימה פשוטה שליטה. עיצובים עתידיים עשויים להציג קונטקסטים של ביצוע פעולה דמוי-מעבדים שיכולים לבצע הוראות AI באופן מסונכרן בעוד הצינור הראשי ממשיך לרוץ קוד אחר.איי.א.א.ס.ס.א.ס.ס.ס.ס.ס. X כבר מאפשר את הליבה העיקרית להנפיק הוראות ממטריקס ולאחר מכן לפרוש, בעוד יחידת AMX מלוכדת ברקע (עם זאת באמצעות Synct) יכול להסתיר את ה-L.
שילוב עם אדריכלות Chiplet
כדי לנהל את העלות והתשואות, מעבדים מודרניים בנויים יותר ויותר מ שבבים מרובים מקושרים באמצעות בד מהיר.ההוראות AI-optimized יכול להיות ממוקם רק על שבבים ספציפיים, בעוד הזיכרון ו- I / O השבבים נשארים גנריים.הספירה של אינטל משתמש עיצוב רב-טריבי, מעבדים מבוססי זן של AMD מעסיקים ארכיטקטורות.
מסקנה: עתיד סימביוטי עבור CISC ו-AI
השילוב של הוראות AI-optimized לתוך ארכיטקטורות CISC אינו רק התאמה טכנית - זה מייצג את האבולוציה הבסיסית של מחשוב כללי מטרה. על ידי הטמעת פעולות מיוחדות ללמידה מכונה לתוך מערכת ההוראה מאוד, מעבדים יכולים לספק שיפורים ביצועים דרמטיים מבלי לדרוש מתכנתים לנטוש את המערכת האקולוגית העשירה של x86 תוכנה. אתגרים כגון מורכבות, כוח, תאימות מטופלים באמצעות אופטימיזציה מיקרו-אקציונית וחדשנות בהדרכה.
בעוד AI ממשיכה לחלחל בכל תעשייה, הביקוש להאצה יעילה, נגישה רחבה רק יגדלו ארכיטקטורות CISC, עם שורשים עמוקים שלהם בנוף מחשוב, להסתגל לענות לדרישות אלה.התוצאה היא דור חדש של CPUs כי הם מסוגלים לרוץ מורכבות סניף-וטכניק חלקה כפי שהם צוברים את הרשת העצבנית, עבור, הביצועים העיקריים של AIOSTS לוקח עכשיו קוד פתוח לתוך אינטגרציה, אבל לא צריך להיות מתווך חדש של תכונות AI- AI-או-המה, אבל זה צריך להיות מתווך של אינטגרציה, אבל אינטגרציה, אבל אינטגרטיבית המפתח הוא עכשיו, אבל אינטגרטיבית, אבל אינטגרטיבית, אם זה צריך להיות מתווך של AI- AI- AI- AI- AI-המכונה אינטגרציה, אבל אינטגרטיבית, אם זה צריך להיות מתווך של אינטגרציה, אם זה צריך להיות מתווך של אינטגרציה, אם זה צריך להיות מתווך של אינטגרטיבית, אם זה לוקח עכשיו, אבל אינטגרציה של פונקציות מתקדמות יותר מתווך של פונקציות מתקדמות של פונקציות מתקדמות של פונקציות מתקדמות כדי אינטגרציה של אינטגרטיבית של אינטגרציה, אבל אינטגרטיבית, אבל אינטגרציה של אינטגרציה, אבל אינטגרטיבית, אבל אינטגרטיבית