Table of Contents

שחר של עיצוב CISC

במשך עשרות שנים, הנרטיב סביב מעבד עיצוב חיתול נגד צריכת חשמל.אדריכלות מורכבות הוראה (CISC) אדריכלות, אפילמיזציה על ידי משפחת x86, נתפסו לעתים קרובות כ- Power-hungry behemoths הטוב ביותר מתאים עבור שולחן עבודה לשרתים. עם זאת, דחיפה חסרת רחמים עבור מחשוב נייד, מכשירים אולטרה-פורט, ויעילות מרכזית נתונים מסיבית יש חשיבה יסודית, היום, CISC הם רק פונקציות נמוכה של כוח-עוצמה כי הם רק כוח-עוצמה נמוכה.

טרנספורמציה זו מונעת על ידי הרחבה של התקדמות חומרה ומיקרו-ארכיטקטורה מיקרו-ארכיטקטורה.בעוד RISC (מחשוב הוראה מחדש סט) אדריכלות כמו ARM פעם שלטו בשיחה יעילות כוח, שבבי CISC מודרניים סגרו את הפער באמצעות הנדסה מתוחכמת.התוצאה היא מחלקה חדשה של מעבדים שיכולים להתאים באופן דינמי את פרופיל הכוח שלהם, מזער בכל רמה transistor, ולספק ביצועים חסרי תקדים - מדדים עבור מעבדי מחשוב מרכזי.

התפתחות ארגונית: ממהירות השעון ועד להגדלת האנרגיה

השנים הראשונות של עיצוב CISC הוגדרו על ידי גזע ללא רחמים כדי להגדיל את תדרי השעון.האינטל Pentium 4, למשל, דחף מעבר 3 GHz אבל עלות של פיזור כוח עצום חום.התעשייה בסופו של דבר פגעה חומה תרמית, המוביל לפרדע פרדיגמה הרחק מתדירות הסקאלה לעבר יעילות ארכיטקטונית.שינוי זה הוא סלע של מעבדי כוח מודרניים של CISC.

סוף ההכחשה

דנברי קנה, אשר ציין כי כפי שהטרנסיסטורים מתחזים, צפיפות הכוח נותרה קבועה, נשבר סביב זרם ה-90nm Node. Leakage ומגבלות מדרגת מתח פירושו כי טרנזיסטורים קטנים יותר לא פחות באופן אוטומטי כוח. מעצבי CISC היו צריכים לנטוש את הגישה התמימה של "shrink ומהירות למעלה" ובמקום זאת להתמקד במחשוב פרופורציונלי – בעיצוב שבבים שצורכים את הכוח בעבודה, לא נעשה באופן קבוע, לא קבוע.

Rise of Multi-Core and Heterogeneous Architectures

אחת התגובות המשמעותיות ביותר הייתה ה- pivot לעיצובים רב-coreים.במקום ליבת אחת חמה, גבוהה-core, מעבדי CISC משלבים כעת מספר ליבות שניתן להפעיל באופן אינדיבידואלי, או לרוץ בתדרים נמוכים יותר תוך שמירה על ידי מקבילה.אחרונה, אדריכלות הטרוגנית-אלגנטית (ביצועים חזקים "ביצועים" עם ליבות קטנות יותר "יעילות" על אותה נקודה מתה - הופכת לשילוב של תפקוד אלטרגני (אפקטיביות) עם ביצועים חזקים של תפקודים חזקים של תפקוד אנטי-קליביים) עם ארכיטקטורטיביים (אפקטיביים) עם ארכיטקטוניים (אפקטיביים) עם ארכיטקטורטיביים עם ארכיטקטורטיביים) עם ארכיטקטורטיביים עם ארכיטקטורטיביים (אפקטיביים) עם ארכיטקטורטיביים עם ארכיטקטורטיביים עם הליבה עם תפקוד של תפקוד אנטי-קליביים) עם ארכיטקטורת-קלימיים (אפקטיביים (אפקטיביים) עם ארכיטקטורטיביים עם תפקודים עם ארכיטקטורטיביים חזקים עם "יעילות" קטן יותר, החל מנטליים) עם הליבה עם הליבה עם הליבה עם הליבה עם תפקודים) עם תפקודים עם "יעילות" קטן יותר, החל מנטליגנטיים (אפקט

גישה זו מאפשרת למערכת ההפעלה לקבוע משימות רקע או תהליכים בעלי עוצמה נמוכה על ליבות יעילות, בעוד יישומים תובעניים לעסוק בליבת הביצועים רק כאשר יש צורך.התוצאה היא צמצום דרמטי בצריכת כוח דלה ונמוכת ללא הקרבת ביצועי שיא. בדומה, עיצוב השבבים של AMD עם I/O מת ו- CCDs (re Complex Dies) מאפשר כוח מוטבע היטב ומתחים על פני המעבדים שונים.

המונחים: Hardware-Level Power Management innovation

מעבר לספירת הליבה, מעבדי CISC מודרניים להטביע מעגלים ואלגוריתמים מתקדמים כדי לנהל את הכוח ב- nanother granularity. מנגנוני חומרה אלה אינם נראים לתוכנה אלא חיוניים ליעילות אנרגיה.

דינמי וולט ותדירות גבוהה Scaling (DVFS) 2.0

DVFS מדרג מתח ותדירות בצעדים coarse המבוססים על CPU ניצול מעבדים מודרניים CISC ליישם את per-core DVFS, שבו כל ליבה יכולה באופן עצמאי להגדיר את נקודת התפעול שלה.טכנולוגיית Shift המהירות של אינטל לוקחת את זה עוד על ידי כך לאפשר לחומרה לשלוט בתדירות מעברים הרבה יותר מהר מאשר מושלים מסורתיים המבוססים על מערכת ההפעלה, צמצום הגמישות ושיפור התגובה תוך שמירה על אנרגיה משולבת עם מתח מתוחכם יותר ויותר המשולבת של ה-Firepertulations (Rolators) ו-Ratchdertators (Ratepherd) משולבים מחדש של , או TRADVRs) משולבים יותר על פני , , , , , מחסנים מחדש של , , מחסנים מחדש של מערכת ההפעלה (Ratephertulations) ו-Ratulations (Rateerpherpherpherpherphertulations) , שיפור יעילות משולבת יותר מהר יותר מהר יותר מאשר , , , , , , , , , , , , , , מחסנים מחדש של מערכת ההפעלה המסורתית, מחסנים מחדש של מערכת ההפעלה המסורתית,

שעון GING ו- Fine-Garrow

כוח חיתוך כוח בלוקים שלמים של היגיון שאינם בשימוש.ב שבבי CISC מודרניים, ליבות שלמים, פרוסות מטמון, בקרי זיכרון, ואפילו יחידות פונקציונליות ספציפיות בתוך הליבה יכול להיות נחקר כוח.זה מבטל את זרם הדליפה, אשר מהווה חלק משמעותי של כוח במדינות idle. ברמה בסדר, שעון מתפורר את האות לרישום פעיל ומניעה של מצבי חירום קצרים, כמו גם מצבי חירום קצרים.

גוף הסתגלות ו Near-Threshold Computing

כדי להפחית עוד מתח, כמה שבבי CISC הם ניסויים עם הטיה הגוף להסתגל, שבו מתח סף של טרנזיסטורים מותאם דינמי מבוסס על עומס עבודה וטמפרטורה. ליד-הרס החזק מתח (NTV) מחשוב, שבו מתח האספקה מופחת ליד סף transistor הסף, יכול לחתוך כוח על ידי גורם של 10 או יותר. בעוד מאתגר באופן מסורתי עקב ביצוע עונשים ותהליך, מעצבי CISC משולבים בטכניקות נמוכות עבור יעילות רשתית.

סירוב מיקרו-ארכיטקטורה לאנרגיה

הארכיטקטורה הסטטקטורת של CISC מורכבת מטבעה, עם הוראות באורך משתנה ומובנים רבים לטיפול באופן מסורתי, המורכבות הזו הובילה לאנרגיה קוד גבוהה.עם זאת, מהנדסים פיתחו מגוון של טכניקות מיקרו-ארכיטקטורה שהופכות את המורכבות הזאת ליעילות.

מיקרו-op Caches ו- Decode Fusion

במקום לקלקל שוב ושוב הוראות x86 מורכבות (אשר יכול להיות 1 עד 15 ע"י מילימטרים), מעבדי CISC מודרניים מקלקלים את המיקרו-פעולה הקודרת (μop) של אינטל מחסני עד אלפי מיקרופוסים בשימוש נפוץ, ע"י עקיפה את לוגיקה דה-קוד אנרגיה-חושנית.זה מקטין צריכת חשמל דינמי בהוראה וקודד על ידי עד 30%.

Macro-op Fusion ו- Micro-op Fusion

היתוך Macro-op משלב שני הוראות x86 פשוטות (למשל, השוואה ואחריו קפיצה מותנית) לתוך מאקרו אחד שיתוף פעולה מוקדם צינור, צמצום מספר ה- μops כי צריך להיות מעובד. מיקרו-op היתוך לוקח את הצעד הזה עוד יותר על ידי שילוב שני מיקרו-קופים (כגון עומס ופעולת ALU) לתוך אחד, ומאפשר להם להיות מועבר יחד על ידי ביטול אנרגיה אחת.

מנועים מחוץ להזמנות

(מתוך ביצוע הזמנה) הוא סימן ההיכר של מעבדי CISC בעלי ביצועים גבוהים, אך הוא נצרך באופן מסורתי כוח משמעותי בשל מכופים גדולים (ROB), תחנות הזמנה, ולוגיקה של עיצובים חדשים יותר מעסיקים FLT:0selective WakeuptureFLT:1 - רק להעיר את ההוראות התלות כי הם למעשה מוכנים לבצע, ולא לשדר את כל ההוראות המתינויות, בנוסף, יעיל יותר, עם מנוע אחד בלבד, אשר יהיה מוגבל, עם שימוש ישיר, עם מנוע אחד, ולהפחית את הפחתת זמן אחד, עם שימוש ישיר, עם מנועים, ולהפחית את הפחתת זמן אחד בלבד, עם שימוש יעיל יותר ויותר מוגבל, כאשר הוא גם עם שימוש בקובץ אחד מוגבל יותר, כאשר הוא מוגבל על ידי שימוש ב-FB2 מוגבל, רק לאחר מכן, עם שימוש יעיל יותר, עם שימוש יעיל יותר, עם שימוש ב-מחץ אחד, עם שימוש יעיל יותר, עם שימוש יעיל יותר, עם שימוש בקובץ אחד, עם שימוש יעיל יותר, עם שימוש ב-מספקים, עם שימוש ב-מספקים, עם שימוש יעיל יותר, ללא שימוש יעיל יותר, ללא שימוש יעיל יותר, רק לאחר מכן, עם שימוש יעיל יותר, כאשר הוא גם על ידי שימוש יעיל יותר, כולל מוגבל יותר, כאשר הוא

Cache Hierarchy Optimizations

הגישה לזיכרון היא יצרנית אנרגיה גדולה.מעבדים של CISC משחזרו את ההיררכיה המטמון שלהם כדי להפחית את האנרגיה לגישה.חדשנות כוללים:0-אין-אין-כולל עיצובים של cacheFLT:1 אשר להפחית את התנועה קוהרנטיות, FLT:2sctor FLT 3: המאפשר בדיקות חלקית, ו-FLT:4 רק L-Afreaderme) ל-Cli-i-iOS (D) ⁇ dows) ⁇ (מסמך תכונות גדולות של זיכרון.

הוראות קביעת הרחבה לעוצמה

באופן פרדוקסלי, הוספת יותר הוראות ל- CISC ISA יכול למעשה לשפר את יעילות הכוח אם ההוראות מבצעות פעולות מורכבות צעד יחיד, מותאם אישית ולא רצף של פשוט יותר.אדריכלות x86 ראתה התרחבות של הרחבות שנועדו במיוחד להפחית את הכוח על ידי צמצום ספירת ההוראה ותנועת הזיכרון.

AVX-512 ו-VNNI: עיבוד של Power-Efficient Vector

תוספות כמו AVX-512 (הרחבות מתקדמות של Vector) ו-VNNI (הוראות רשת וקטור נילי) מאפשרות הוראות יחיד לעבד אלמנטים נתונים מרובים.עבור עומסי עבודה מקבילים של נתונים כגון AI inference, מדיה ⁇ , ומחשוב מדעי, הוראות אלה להפחית באופן דרסטי את מספר ההוראות של vos ו-codes. כאשר משולב עם יחידות ביצוע ייעודיות שיכול לפעול בדרגות נמוכות יותר מאשר מתח, מאפשרות שימוש באופן משמעותי ביחידות אנרגיה גם כאשר מופעלות באופן משמעותי.

הוראות Cryptographic ו-Compression

הוראות ייעודיות עבור הצפנה AES, SHAHING, ו- DEFLATE דחיסה (למשל, Intel QAT בתוך הליבה) לטעום משימות אלה מ-Louיות תוכנה לחומרה ייעודית.זה לא רק משפר את הביצועים אלא מקטין את הכוח על ידי ביטול הצורך בהוראות רבות של סניף וגישה זיכרון.לדוגמה, AES-NI יכול לבצע הצפנה מלאה בהוראה אחת, צריכת אנרגיה הרבה פחות מאשר תיבת חיפוש תוכנה.

הרחבות SynSyncization (TSX) והקשויב לוקה אליטל

Synchronization בתוכנות מרובות-הנקראות לעתים קרובות כרוך להסתובב על מנעולים, אשר מבזבז כוח. TSX של אינטל (כיום חלק בלתי-מוגבלות בשל פרצות אך חשוב מבחינה קונספטואלית) אפשר חומרה למנעולים ולבצע חלקים קריטיים באופן בולט.כאשר מוצלח, זה מבטל את הספין-קשר של מנעול ואת הפסולת האנרגטית המשומשתנית.

מערכת-Level אינטגרציה ו-Uncore Efficiency

יעילות כוח אינה רק על הליבה CPU. רכיבי "לא-core" - בקרים אמפריים, מרכזי IO, חיבורים וגרפיקה משולבת - יכול לצרוך חלק משמעותי של כוח שבב הכולל.

מפקחי חשמל משולבים (PCU)

למעבדים מודרניים יש יחידת בקרת חשמל ייעודית (PCU) שפועלת כמיקרו-בקר המפעילה קושחה ניהול חשמל מורכב.ה- PCU כל הזמן לפקח על טמפרטורה, נוכחית, ניצול ואספקת חשמל, הסתגלות מתח, תדירות ושערי חשמל על פני מאות תחומים בזמן אמת. רמה זו של גרנוריות ואינטליגנציה היא ממריץ עיקרי ליעילות CISC, המאפשר תכונות כמו קירור, לחץ, פיקוח תרמילי, ניטור טמפרטורה חיזוי.

High-Bandwidth, Low-Power Interconnects

במודולים רב שבבים (MCM) כמו עיצוב השבבים של AMD, הקישור הבין-die (אינסופית הבד) מותאם למידתיות אנרגיה.זה יכול לשנות באופן דינמי רוחב, תדירות ומתח המבוסס על תנועה. בדומה, פרוטוקול EMIB של אינטל (שרדת Multi-die Interconnect Bridge) משתמש בסימן קצר מאוד, נמוך עוצמה בין מת על סולם רחב יותר, CIputericial (D) מאשר C.comD.

קידוד DRAM וזיכרון

גישה DRAM היא אחד המבצעים המשפיעים ביותר במערכת.מעבדים של CISC משתמשים כעת בקרים זיכרון חכמים כי עדיפות לבקשות זיכרון למזער רעננות ולהפעיל רק את הבנקים הדרושים. .בקרי זיכרון רב ערוצים יכולים גם להיות מוקרן חלקית כאשר רק ערוץ אחד נדרש.

השפעה אמיתית בעולם: ממרכזי נתונים ל- Edge מכשירים

החידושים המתוארים לעיל אינם תיאורטיים.הם מתרגמים ישירות לחיסכון בכוח הניתן למדידה בפריסות בעולם האמיתי.

מרכז הנתונים יעילות ו- TCO

(במרכזי נתונים של יתר, כוח מהווה חלק משמעותי מהעלות הכוללת של הבעלות (TCO) שרתי CISCcore מודרניים מ- Intel (Xeon Scalable) ו- AMD (EPYC) משלבים תכונות כגון FLT:0P-state Regroing שרתים של CISFLT:1 אשר מקטין באופן אגרסיבי את מרכזי העבודה של Intel-FLT:2powercapof: כדי למנוע עונשים יעילים, ו-D5, כדי להפחית את כמות התקני אבטחה נמוכה יותר מ-C5.

ביצועים ניידים וחיי סוללה

בחזית הניידת, מעבדי הליבה של אינטל (מסקייק ועד לקטר לייק) שיפרו באופן דרמטי את חיי הסוללה במחשבי מחשב ניידים.המבוא של E-cores ב-Alder Lake אפשרו לקט ספרים אולטרה-אורים כדי להשיג חיי סוללה בכל הימים, בעודם מספקים ביצועים גבוהים עבור משימות פורצות סוללות, Apple של השימוש של X86 ב- Mac מבוסס אינטל (לפני המעבר ל-Apple) ראו גם רווחים ממנו עשוי להיות מ-C יעיל יותר, אם כי הוא עשוי להזיז את ה- AI, אם כי הוא יעיל יותר, או יעיל יותר, אם כי בסופו של חברת האבטחה של Apple CRMC, בסופו של Apple, בסופו של דבר, אם כי בסופו של Apple מופעלת, אם כי בסופו של דבר, באופן יעיל יותר, אם כי הוא מופעלת, באופן משמעותי, אם כי בסופו של דבר, על ידי חברת האבטחה של דבר, באופן יעיל יותר, עם זאת, על ידי חברת האבטחה של דבר, עם יעילות מוגבלת, עם יעילות מוגבלת, עם יעילותווץ, עם זאת, עם יעילות מוגבלת, עם יעילותו של Apple, אם כי הוא מופעלת, אם כי הוא מופעלת של Apple, על ידי חברת האבטחה של Apple, על ידי חברת האבטחה של Apple, לאחר מכן, אם כי הוא מופעלת של

צוק איתן והפרעה

מעבדי CISC משמשים יותר ויותר עבור אי השוויון AI בקצה, שבו תקציבי חשמל הדוקים.DL של אינטל (VNNI) וספריות ה- AVX2-optimized inference ממינוף הרחבות כדי להפעיל רשתות עצביות ביעילות ללא צורך ב-DL Boost דיסקרטי GPU. בשילוב עם דפוסי גישה יעילים ומצבים idle בעוצמה נמוכה, מעבדים אלה יכולים למעשה למנוע זיהוי של פתור או רק על פתורים סולאריים.

אתגרים וכיוונים עתידיים

למרות ההתקדמות, אתגרים משמעותיים נותרו.המורכבות הבסיסית של קידוד ההוראה של CISC עדיין מטילה עלות אנרגיה בסיסית כי ארכיטקטורות RISC אין.התעשייה בוחנת כמה דרכים קדימה.

היברידיות אדריכליות וצ'יפס

העתיד של CISC עשוי לכלול ההיברידיזציה נוספת.עיצובים הבאים של אינטל עשויים לכלול מעבדים מבוססי RISC ייעודיים עבור משימות ספציפיות (כמו מנוע ניהול או יחידת טיפול בהקשר נמוך כוח רצון) צ'יפס גם לאפשר שילוב של אבני תהליך שונות - שימוש בצומת מתקדם ויעיל כוח עבור ליבות ומעט יקר, גבוה-לא סובלני עבור I / Oon - אותה חבילה כל זה יכול להתאים שבב כוח.

ניהול כוח AI-Driven Power Management

למידת מכונות משמשת לחיזוי דפוסי עומס עבודה ולהתאמה אקטיבית של מתח, תדירות והחלטות שער כוח.טכנולוגיית הכוונון הדינמי של אינטל כבר משתמשת בטלמטרי כדי להתאים מדיניות תרמית וכוח.מעבדים עתידיים עשויים להטמיע רשתות עצביות קלות משקל בתוך PCU כדי להשיג אפילו מהר יותר, מדויק יותר ניהול כוח.

מעבר לסיליקון: חומרים מתקדמים ואריזות

חידושים טרנסיסטורים כמו Gate-All-Around (GAA) ב- RibbonFET של אינטל ו-Backside Power Delivery (PowerVia) מבטיחים להפחית את ההתנגדות בין-קשרית ולאפשר רגולציה מתוחה יותר, שיפור ישיר ביעילות הכוח. בצד האריזה, ערימה של 3D של כאב ולוגיקה באמצעות חיבור היברידי מפחית את עלות האנרגיה של תנועת נתונים, המהווה כוח דומיננטי במעבדים מודרניים של CISC.

אבטחה-יעילות המסחר

פרצות ספציפיות ומלטה לאחור אילצו את ספקי CISC ליישם סטיות שלפעמים הוסיפו כוח מעל פני השטח.עיצובים עתידיים חייבים לטפל בבעיות אבטחה אלה מבלי להתפשר על יעילות האנרגיה.זה אומר לפתח מיקרו-ארכיטקטורה חדשה או ליישם נטיות חומרה יעילות שאינן מסתמכות על כאבי ראש או צמצום ספקולציות.

מסקנה

הרעיון כי מעבדי CISC הם לא יעיל כוח מטבעו הוא משוחזר מיושן.באמצעות עשרות שנים של חדשנות רצינית בניהול כוח, מיקרו-ארכיטקטורה, עיצוב מערכת הדרכה, ושילוב מערכת, צ'יפס CISC מודרני הופיעו כתחנות כוח יעילות כוח-יעילות כוח.מסמארטפונים (באופן אירוני, x86 ניסו ונכשלו, אבל השיעורים היו מוחלים) כדי exa Supercomputers, מעבדי CISC עכשיו להתחרות על יעילות גבוהה של ביצועים בודדים.

בעוד התעשייה נעה לעבר מחשוב heterogeneous, ארכיטקטורות שבבים, אופטימיזציה מונעת AI, הפער בין CISC ו RISC יעילות כוח ימשיך צר.החידושים המפורטים כאן אינם רק מצטברים; הם מייצגים המצאה בסיסית של מעבד CISC עבור עולם ללא אנרגיה מאומנים. הדור הבא של מחשוב יעיל כוח ייבנה על יסודות אלה, המספק ביצועים כי היה פעם כוח נמוך כוח.


מקור:0 (ב) מקורות:

  • (FLT:0) אדריכלות ההיברידית של אינסטל (אלדר לייק) אנדרל 1:1 - דף מוצר רשמי המפרט עיצוב P-core / E-core.
  • (ב) ⁇ 0(AMD Chipletcio TechnologyFLT:1) - הסבר של עיצוב מבוסס שבב עבור כוח וביצועים.
  • (FLT:0) כיסויו של אננדטק של אינטל אדריכלות יום 20203,FLT:1 - דיון טכני מפורט על חידושים מיקרו-ארכיטקטורה.
  • (ב) ויקרא יא: ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇