Рассвет микропроцессоров: революция 1970-х годов

В начале 1970-х годов произошел сейсмический сдвиг в вычислительной технике. До того, как микропроцессор стал полагаться на дискретные транзисторы и малые интеграционные схемы, заполняя целые комнаты. Изобретение однокристального микропроцессора консолидировало центральный процессор (CPU) на кусочек кремния, сделав компьютеры доступными, компактными и доступными. Intel запустила в 1971 году 4-битный процессор, предназначенный для японского калькулятора. С 2300 транзисторами, работающими на частоте 740 кГц, он мог выполнять 60 000 операций в секунду — монументальное достижение для своего времени. Архитектура 4004 представила базовый набор инструкций, отдельные пространства памяти программ и данных и простой стек, устанавливающий шаблон для будущих поколений.

В 1974 году Intel выпустила 8080, 8-битный процессор, который питал ранние микрокомпьютеры, такие как Altair 8800. С 6000 транзисторов и тактовой частотой 2 МГц, 8080 мог адресовать 64 КБ памяти, что позволяло создавать более сложные программы. Его архитектура включала 16-битную адресную шину и набор из 78 инструкций, многие из которых стали устаревшими инструкциями x86. Примерно в то же время Motorola представила 6800, более чистый дизайн с меньшим количеством регистров, но более простым временем шины, и Zilog дал нам Z80, улучшенный 8080-совместимый процессор, который доминировал в домашних компьютерах и игровых консолях в 1980-х годах. Эти ранние микропроцессоры использовали nMOS (металл-оксид-полупроводник n-типа), который предлагал более

Ключевые архитектурные особенности этой эпохи включали в себя выполнение с одним циклом (хотя часто микрокодируется), поддержку прямого доступа к памяти (DMA) и обработку прерываний для периферийных устройств. Ограниченное количество транзисторов означало простые блоки управления и отсутствие кэша. Производительность измерялась тысячами инструкций в секунду (KIPS). Несмотря на их простоту, эти чипы заложили основу для бума персонального компьютера. Для подробной истории см. Собственная история 4004 Intel.

1980-е годы: доминирование CISC и восстание RISC

К 1980-м годам микропроцессорный ландшафт разделился на два конкурирующих лагеря: CISC (Complex Instruction Set Computer) и RISC (Reduced Instruction Set Computer). Семейство Intel x86, начиная с 8086 (1978) и заканчивая 80286 и ориентиром 80386 (1985), типично CISC. 386 был первым процессором x86, использующим 32-битную архитектуру, позволяющую использовать 4 ГБ адресной памяти, поддержку виртуальной памяти через подачу и блок исполнения. Он работал на частоте до 33 МГц и содержал 275 000 транзисторов. CISC конструкции упаковали много сложных инструкций — таких как струнные ходы и счетчики циклов — в микрокод, что облегчало программирование сборки, но требовало большей площади и мощности. Intel поддерживала обратную совместимость, решение, которое закрепило доминирование x86 в ПК, но обременяло

В ответ на сложность CISC, академические исследователи из UC Berkeley и Stanford впервые RISC. Проекты Berkeley RISC-I (1981) и Stanford MIPS (1981) продемонстрировали, что более простые инструкции могут обеспечить более высокую производительность посредством трубопроводного проектирования, больших регистровых файлов и кодирования инструкций фиксированной длины. Процессоры RISC обычно имели 32 или более регистров общего назначения, архитектуру нагрузочного магазина (только память доступа к инструкциям загрузки / магазина) и простые режимы адресации. ARM (Acorn RISC Machine) появился в 1985 году как коммерческий процессор RISC для BBC Micro, отличающийся элегантным 32-битным дизайном для BBC Micro, с участием элегантного 32-битного процессора MIPS (Microprocessor without Interlocked Pipeline Stages) (Microprocessor without Interlocked Pipeline Stages) дебютировал в 1985 году и стал архитектурной основой для

К концу десятилетия процессоры RISC превзошли CISC по скорости, но программная экосистема x86 сохранила доминирование Intel. В 1980-х годах также было введено на чипе кэш — 80486 (1989) интегрированные 8 КБ кэша L1 — и пипелирование (80486 имел пятиступенчатый конвейер). Эти инновации увеличили пропускную способность команд без резкого увеличения тактовой частоты. Впервые микропроцессоры начали включать блоки с плавающей запятой (FPU) на том же кристалле, что и в 486DX, отмечая переход к интегрированным функциональным блокам . Для тщательного сравнения RISC против CISC, примечания проекта UC Berkeley RISC остаются отличным чтением.

1990-е: Суперскаляр, Вне порядка и Гонка за ГГц

1990-е годы принесли взрыв производительности, обусловленный суперкальярным исполнением — возможностью выдавать несколько инструкций на тактовый цикл. Pentium (1993) Intel был первым суперскалярным дизайном x86, с двумя параллельными целыми конвейерами (u и v.) Он также представил 64-битную шину данных и предсказание ветви. Pentium Pro (1995) добавил вне порядка исполнения и переименование регистра, что позволило процессору переупорядочивать инструкции, чтобы держать исполнительные блоки занятыми. Это был крупный архитектурный скачок, преобразовывая микроархитектуру при сохранении совместимости x86. Последующие Pentium II и III, добавив инструкции MMX и SSE SIMD для мультимедиа.

Конкуренция накалилась. AMD выпустила K6 (1997), а затем Athlon (1999), который соответствовал тактовым частотам Intel и ввел размеры кэша первого уровня, превышающие 128 КБ. Athlon был первым процессором x86, достигшим 1 ГГц (2000). Микроархитектура K7 использовала суперскаляр, вне порядка с 10-ступенчатым целым конвейером и отдельным FPU. Между тем, PowerPC развилась в G3 и G4, используемые в Apple Macs, с использованием векторной обработки AltiVec. DEC Alpha (1992) был самым быстрым процессором своего времени, работающим на частоте 200 МГц изначально и масштабировавшимся до более чем 1 ГГц к концу 1990-х годов, с 64-битной архитектурой и глубокими трубопроводами. Однако высокое энергопотребление Alpha и отсутствие совместим

Другие архитектурные тенденции включали многоуровневые кэши [[L1, L2, часто неумирающий L2 на картридже]], ветвящиеся целевые буферы и спекулятивное исполнение. ошибка Pentium FDIV (1994) подчеркнула важность строгой проверки дизайна.ARMARM набрала силу в мобильных и встроенных устройствах, в то время как MIPS приводила в действие Nintendo 64 и Sony PlayStation. Десятилетие закончилось с тактовой частотой, превышающей 10 миллионов. Для углубленного взгляда на архитектуру Pentium Pro см. Руководство по микроархитектур

2000-е годы: многоядерный, Power Wall и мобильный всплеск

Поскольку тактовая частота приближалась к 3-4 ГГц в начале 2000-х годов, разработчики процессоров достигли силовой стенки . Распределение мощности, масштабируемое как частота кубирования, делает дальнейшее увеличение ГГц непрактичным без экзотического охлаждения. Промышленность развернулась к многоядерным архитектурам, поместив несколько ядер процессора на один кристалл, чтобы повысить производительность за счет параллелизма, а не тактовой частоты. Intel представила Core 2 Duo в 2006 году, который соединил два ядра с общим кэшем L2, суперскалярным исполнением и энергоэффективным дизайном. AMD Athlon 64 X2 (2005) принес двухъядерный рабочий стол с интегрированным контроллером памяти, уменьшив задержку. Обе компании приняли 64-битные вычисления [[F

Рост мобильных вычислений навсегда изменил архитектуру микропроцессоров. ARM, с его маломощными конструкциями RISC, стал доминирующим ISA для смартфонов и планшетов. Cortex-A8 (2005) и позже Cortex-A9 представила многоядерные реализации, вне порядка исполнения и NEON SIMD. Чипы Apple A4 (2010) и A5 интегрировали ядра ARM с GPU, контроллером памяти и I/O в единый System-on-Chip (]. Этот подход SoC резко уменьшил размер и энергопотребление, необходимый для портативных устройств. Процессор Intel Atom (2008) пытался конкурировать в мобильных устройствах, но боролся с энергоэффективностью.

Другие инновации включали гиперпоточность (Intel, Pentium 4), который представил два логических ядра на физическое ядро, и Turbo Boost (Intel Core i7, 2008), позволяющий динамическое разгонирование в тепловых пределах. Интегрированные контроллеры памяти (AMD Opteron, 2003) и QuickPath Interconnect (Intel, 2008)) заменили старые передние шины, улучшив пропускную способность памяти. GPU начал мигрировать на процессорную матрицу в качестве интегрированной графики, сначала с AMD APU (Accelerated Processing Unit, 2011) и Intel HD Graphics. Виртуализация аппаратное обеспечение стало стандартным (Intel

2010-е годы до сегодняшнего дня: неоднородность, чиплеты и ускорение ИИ

2010-е годы открыли новую парадигму: гетерогенные вычисления. Вместо однородных ядер процессоры объединили высокопроизводительные «большие» ядра с энергоэффективными «маленькими» ядрами. Архитектура ARM big.LITTLE2011 года в паре с ядрами Cortex-A15 и Cortex-A7, управляемая системным планировщиком, который перемещал задачи между кластерами. Эта идея стала универсальной в мобильных SoC. Apple M1 (2020) взяла её дальше, интегрируя восемь ядер (четыре высокопроизводительных, четыре эффективных) с унифицированной памятью и пользовательскими ускорителями для машинного обучения, видеокодирования/декода и обработки изображений. M1 продемонстрировал, что чипы на основе ARM могут превзойти x86 процессоры в однопоточной и многопоточной рабочей нагрузке при

На стороне x86 микроархитектура AMD Zen ознаменовала возвращение, используя чиплет дизайн. Вместо большого монолитного кристалла процессоры Zen упаковали несколько маленьких кристаллов (чиплетов) на одной подложке с использованием Infinity Fabric. Этот подход улучшил выходы, позволил модульное масштабирование (4, 6, 8, 16 ядер) и снизил затраты. Чипы AMD Ryzen и EPYC соответствовали или превышали производительность Intel на часы, заставляя Intel внедрять инновации. Intel ответила Skylake-X (2017) и позже Alder Lake (2021), который принял гибридную компоновку ядра большого размера (] Alder

Спрос на искусственный интеллект привел к включению специализированных ускорителей ИИ . Нейронный движок Apple, блок обработки тенноров Google (TPU) и ядра Da Vinci от Huawei все добавили специализированное оборудование нейронной сети. GPU, уже массивно параллельные, превратились в вычислительные движки общего назначения (CUDA, OpenCL) и были в паре с процессорами общего назначения в гетерогенных платформах. Система на чипе Модель расширилась на ноутбуки и серверы, интегрируя Wi-Fi, анклавы безопасности и несколько контроллеров памяти. Apple M1 Ultra (2022) даже использовала die-to-die interconnect (UltraFusion) для объединения двух M1 Max гибнет в один логический чип с 20 ядрами процессора и 64 ядрами GPU.

RISC-V появился как ISA с открытым стандартом, набирающий обороты для встроенного и исследовательского использования. Его модульность позволяет дизайнерам выбирать расширения, от векторной обработки до криптографии, без уплаты лицензионных сборов. Закон США о CHIPS и глобальный интерес к разработке открытого оборудования ускоряют RISC-V. Такие компании, как SiFive и Esperanto Technologies, создают высокопроизводительные чипы RISC-V, направленные на рабочие нагрузки ИИ и центров обработки данных. Обзор технологии чиплетов см. на странице AMD Infinity Architecture .

Эволюция иерархии кэширования и памяти

На протяжении всех эпох иерархия памяти росла глубже. От одного 8-килобитного L1 кэша 486 современные процессоры имеют три уровня: L1 (32-64 КБ на ядро), L2 (256 КБ-1 МБ на ядро) и L3 (несколько МБ до 128 МБ совместно). Протокол когерентности кэша (например, MESI) обеспечивает согласованность между ядрами. Некоторые конструкции, такие как Intel Уровень 4 eDRAM на некоторых чипах Haswell и Broadwell, добавили четвертый ярус кэша. Переход к 3D-стекленная память (HBM, HMC) разместил DRAM непосредственно на пакете процессора, резко увеличивая пропускную способность для GPU и ускорителей HPC.

Управление питанием и тепловой дизайн

По мере ужесточения ограничений мощности микропроцессорная архитектура интегрировала сложное управление мощностью. Динамическое масштабирование напряжения и частоты (DVFS), P-состояния на ядре и более тонкие состояния сна (C-состояния) позволили процессорам мгновенно замедляться во время простоя. Гонка к холостому стала целью проектирования: быстро заканчивать задачи, а затем спать. SpeedStep и AMD Cool’n’Quiet задали основу. На мобильных SoC специализированные контроллеры управления мощностью (PMIC) и аппаратные мониторы производительности позволяют практически мгновенно регулировать частоту. Apple M1 достигает своей эффективности благодаря широкой ширине проблемы, агрессивной предварительной выборке и пользовательской ткани, которая уменьшает внебиржевой трафик.

Новые технологии, формирующие будущее

Поскольку закон Мура замедляется, будущее архитектуры микропроцессора лежит в специализации и новых способах вычислений . Конструкции на основе чиплетов позволят смешивать различные узлы процессов: логические чиплеты на продвинутых узлах наряду с памятью и I/O чиплетами на зрелых узлах. UCIe (Universal Chiplet Interconnect Express) стандарт направлен на то, чтобы сделать чиплеты от разных поставщиков совместимыми. RISC-V уже производит ядра с открытым исходным кодом, которые могут быть настроены для конкретных рабочих нагрузок, от краевого ИИ до космического уровня радиационной терпимости.

Нейроморфные вычисления имитируют биологические нейронные сети, используя пиковые нейронные сети (SNN) и событийную обработку.Loihi 2 и IBMNorthPole демонстрируют энергетическую эффективность порядков величины для определенных задач распознавания.Квантовые вычисления остаются эмбриональными, но могут решить конкретные проблемы (факторинг, моделирование), которые не могут решить классические микропроцессоры. IBM, Google и другие строят небольшие квантовые процессоры с коррекцией ошибок, но они, вероятно, будут сосуществовать с классическими процессорами в течение десятилетий.

Другие тенденции включают в памяти вычислений (обработка данных, где он сидит), фотонные межсоединения для центров обработки данных, и приближённые вычисления для по своей сути ошибки-толерантных рабочих нагрузок, как распознавание изображений. Безопасные анклавы (Apple’s Secure Enclave, Intel SGX, AMD SEV) в настоящее время стандартны, изолируя чувствительные вычисления от основной ОС. GPGPU GPGPU продолжает развиваться с NVIDIA Hopper и AMD’s CDNA архитектуры, сливаясь тензорные ядра, лучевые блоки отслеживания и трансформаторные двигатели.

Подробный обзор будущих направлений см. в специальном выпуске IEEE о будущем микропроцессоров .

Заключение

От скудных 4-битных операций Intel 4004 до унифицированной архитектуры с миллиардом транзисторов Apple M1 эволюция микропроцессоров следовала неустанной траектории повышенной сложности, производительности и эффективности. Каждое десятилетие приносило основополагающие идеи: RISC против CISC, сверхскалярное исполнение вне порядка, многоядерный параллелизм, гетерогенная интеграция и ускорители, специфичные для домена. Сегодняшние чипы - это не только процессоры, но и целые системы на кристалле, оркеструя симфонию специализированных блоков. Как мы смотрим вперед, конец масштабирования транзисторов заставляет архитекторов внедрять инновации через упаковку, специализацию и новые вычислительные модели. Микропроцессор - когда-то простой чип калькулятора - стал двигателем цифровой эпохи, и его эволюция далека от завершения.