Влияние переменности производства микропроцессоров на надежность системы

Оригинальное название: The Hidden Challenge in Silicon

Каждая современная вычислительная система — от смартфона до суперкомпьютера — зависит от микропроцессоров, которые производятся с точностью до нанометрового масштаба. Тем не менее, даже в самых передовых производственных объектах мира, идеальное единообразие остается недостижимым идеалом. Минутные изменения в процессе производства могут производить чипы, которые, будучи функционально идентичными на бумаге, демонстрируют значительно различное электрическое и тепловое поведение. Это явление, известное как изменчивость производства, стало одним из наиболее важных факторов, влияющих на надежность системы в полупроводниковой промышленности.

По мере того, как размеры транзисторов уменьшаются ниже 10 нанометров, относительное влияние несовершенств атомного масштаба растет. Один неуместный атом в слое оксида затвора может сдвигать пороговые напряжения на десятки милливольт, изменяя скорость переключения транзистора или ток утечки. При умножении на миллиарды транзисторов на кристалле эти изменения усугубляются реальными проблемами надежности: преждевременным износом, прерывистыми ошибками и даже катастрофическими сбоями. Понимание источников этой изменчивости, ее влияния на надежность системы и стратегий, используемых для ее смягчения, имеет важное значение для инженеров, проектирующих надежные вычислительные системы для приложений, начиная от облачных серверов до автономных транспортных средств.

Источники изменчивости производства

Микропроцессорное изготовление включает в себя сотни этапов процесса, каждый из которых вносит свой собственный потенциал для изменения. Эти изменения могут быть в целом классифицированы на три типа: систематические, случайные и экологические. Системные изменения возникают из предсказуемых источников, таких как аберрации линз литографии, несоответствие маски или неоднородность толщины химической механической полировки (CMP) по всей пластине. Случайные изменения, с другой стороны, происходят из фундаментально стохастических явлений, таких как размещение атома допанта, шероховатость на передней кромке или колебания толщины оксида затвора. Изменения окружающей среды включают температурные градиенты во время обработки и механическое напряжение от упаковки.

Процессно-шаговая вариабельность Breakdown

Литография:] Фотолитография определяет критические размеры транзисторов. Вариации фокусировки, экспозиционной дозы и выравнивания маски могут вызывать изменения ширины линии (ошибки однородности критических размеров), которые непосредственно влияют на ток и утечку транзистора. На экстремальных ультрафиолетовых (EUV) длинах волн шум фотонного снимка добавляет еще один слой случайности. Эти литографические ошибки часто отображают пространственные паттерны по пластине — центр против края — которые приводят к коррелированным изменениям среди чипов в той же партии.

Допинг: Ионная имплантация вводит атомы допанта в кремний для создания р-n переходов. Число и размещение атомов допанта колеблются случайным образом, особенно по мере сокращения объемов перехода. Это случайное колебание допанта (RDF) является основным источником несоответствия порогового напряжения транзистора, особенно в аналоговых и запоминающих схемах. Даже при точном контроле дозы статистическая изменчивость Пуассона гарантирует, что точное количество атомов допанта отличается от транзистора к транзистору.

Рост оксида затвора: Слой оксида затвора, как правило, толщиной всего в несколько атомных слоев, должен быть однородным, чтобы обеспечить постоянную напряженность электрического поля. Изменения толщины оксида даже одного атомного слоя (около 0,3 нм) могут изменять токи туннелирования на порядки величины, влияя как на производительность, так и на надежность (например, зависящий от времени диэлектрический пробой).

Металлизация и межсоединение: Изменения ширины, толщины и диэлектрической постоянной металлической линии влияют на сопротивление и емкость, что приводит к несоответствию во времени на чипе. Время жизни электромиграции также зависит от размера зерна и качества интерфейса, оба из которых варьируются в зависимости от условий осаждения.

Как изменчивость ставит под угрозу надежность системы

Надежность системы определяется способностью вычислительной системы выполнять требуемые ей функции в заданных условиях за определенный период. Производственная изменчивость подрывает это несколькими глубоко взаимосвязанными способами. Последствия варьируются от тонкой деградации производительности до внезапных, невосстановимых сбоев.

Повышенные мягкие коэффициенты ошибок (SER)

Мягкие ошибки — это переходные битовые сальто, вызванные нейтронами космических лучей или альфа-частицами, поражающими чувствительные узлы. Переменность порогового напряжения транзистора и емкости напрямую влияет на критический заряд, необходимый для переключения ячейки памяти или логических затворов. Чипы с более высокой изменчивостью имеют более низкие минимальные критические заряды, что делает их более восприимчивыми к одномерным расстройствам. Исследования показали, что индуцированные производством вариации порогового напряжения могут увеличить мягкую частоту ошибок массивов SRAM на 2-5 × по сравнению с идеальным однородным процессом. Для крупномасштабных центров обработки данных это приводит к тысячам дополнительных исправленных или неисправимых ошибок памяти в год.

Сроки нарушений и неудачи пути

Каждый микропроцессор предназначен для работы в определенном диапазоне частот и напряжений. Производственные вариации сдвигают задержки транзисторов, в результате чего некоторые комбинационные логические пути проходят закрытие времени, в то время как другие нарушают время установки или удержания. Чипы из одной и той же пластины часто демонстрируют распределение максимальных рабочих частот (сортированных по скоростям). Но даже в пределах одного чипа локальные вариации могут создавать «горячие» и «холодные» пятна. Трасса цепи, которая незначительно быстра на типичном кристалле, может стать слишком медленной на кристалле с высокой изменчивостью, что приводит к периодическим сбоям времени, которые зависят от температуры и напряжения. Эти патологии, как известно, трудно диагностировать, потому что они могут появляться только при определенных комбинациях рабочей нагрузки или условиях окружающей среды.

Ускоренное износ и сокращение продолжительности жизни

Механизмы надежности, такие как неустойчивость температуры смещения (BTI), впрыск горячей несущей (HCI) и электромиграция, усугубляются изменчивостью. Например, нестабильность температуры отрицательного смещения (NBTI) со временем ухудшает PMOS-транзисторы, вызывая сдвиги порогового напряжения. Чипы, начинающиеся с более высокой начальной изменчивости, стареют быстрее, потому что локальное электрическое напряжение концентрируется в уже ослабленных регионах. Распределение времени до отказа становится более широким, а это означает, что в то время как среднее время жизни может соответствовать спецификации, значительная часть чипов преждевременно выходит из строя. В критически важных системах, таких как автомобильные микроконтроллеры, этот хвост ранних отказов представляет серьезный риск.

Более высокие показатели отказов в многоядерных и графических массивах

Современные процессоры интегрируют множество идентичных ядер или вычислительных блоков. Производственная изменчивость заставляет каждое ядро иметь несколько разные характеристики производительности и мощности. В то время как динамическое напряжение и частотное масштабирование (DVFS) может компенсировать на грубом уровне, система должна работать со скоростью своего самого медленного ядра. Это приводит к штрафу за выход и надежность: вероятность того, что все ядра на кристалле соответствуют минимальному уровню производительности, экспоненциально уменьшается с количеством ядер. Гетерогенная изменчивость также вводит несбалансированное старение, где некоторые ядра деградируют быстрее, чем другие, в конечном итоге вызывая многоядерные сбои синхронизации или тепловой бег.

Тематические исследования: инциденты с надежностью в реальном мире

Влияние изменчивости производства на надежность системы не является чисто теоретическим. Несколько заметных инцидентов за последнее десятилетие подчеркивают, как тонкие вариации процессов могут привести к широко распространенным проблемам.

7-нм Yield Challenges (2021): Intel публично признала, что изменяемость производства в 7-нм технологическом узле приводит к значительному снижению доходности. В частности, изменяемость в шаге транзисторных ворот и стеке металлических ворот с высоким содержанием кабеля привела к высокой плотности дефектов, вынудив компанию отложить запуск продукта и принять более агрессивное адаптивное тестирование. Это привело к затратам на реинжиниринг и подчеркнуло сложность поддержания надежности в отрасли на передовых узлах.

AMD Ryzen 3000 Series Voltage Issues (2019):] Архитектура Zen 2 AMD демонстрировала более высокие, чем ожидалось, напряжения на определенных чипах из-за изменения усилителей, используемых в петле управления регулятором напряжения. Изменение вызвало условия перенапряжения, которые ускоряли электромиграцию в пакетных межсоединениях, уменьшая срок службы затронутых процессоров. AMD ответила обновлениями прошивки, которые добавили защитные полосы, эффективно торгуя пиковой производительностью для надежности.

Исследование ошибок DRAM от Google (2013): Исследователями Google были проанализированы годы журналов ошибок DRAM в их центрах обработки данных. Они обнаружили, что производственная изменчивость была основным предиктором частоты ошибок: чипы из определенных пластин имели частоту ошибок до 10 × выше, чем другие, даже когда они были связаны в один и тот же класс скорости. Это подчеркнуло сложность фильтрации переменных чипов только с помощью обычного тестирования.

Стратегии смягчения: от дизайна до времени выполнения

Для решения проблемы изменчивости производства требуется многоуровневый подход, охватывающий проектирование, изготовление, тестирование и управление временем выполнения. Недостаточно какой-либо одной техники; надежные системы обычно объединяют несколько из следующих стратегий.

Дизайн для производства (DFM)

Методы DFM изменяют схемы схем, чтобы терпеть ожидаемую изменчивость. Обычные практики включают добавление избыточных сквозняков, расширение критических проводов и использование стилей компоновки, которые минимизируют чувствительность к литографическим и допинговым вариациям. Например, разработчики аналоговых схем используют шаблоны компоновки с общим центром и межцифровой компоновкой для отмены низкочастотных пространственных градиентов. Цифровые стандартные библиотеки ячеек характеризуются не только для типичных и наихудших углов, но и для чувствительных к процессу статистических углов. Наборы проектирования процессов (PDK) теперь включают статистические модели SPICE, которые захватывают как глобальные, так и локальные вариации, позволяя дизайнерам выполнять Монте-Карло и статистический статический анализ времени (SSTA) во время выключения.

Процессный контроль и метрология

Фабы вкладывают значительные средства в передовую метрологию для раннего обнаружения вариаций. Оптическая рассеянность, электронно-лучевая инспекция и встроенная CD-SEM (критическая размерная сканирующая электронная микроскопия) используются для измерения толщины слоя, ширины линии и ошибки наложения. Статистические схемы управления процессом (SPC) контролируют ключевые параметры; вне трендовые сигналы запускают немедленные корректирующие действия, такие как корректировка параметров инструмента или выполнение профилактического обслуживания. В последние годы модели машинного обучения были развернуты для прогнозирования выхода и надежности от встроенных измерений, позволяя фабам отклонять пластины или партии, прежде чем они понесут дальнейшие затраты на обработку. Этот проактивный подход уменьшает количество чипов с дефектами, ограничивающими надежность.

Адаптивное тестирование и скрининг

Стандартный производственный тест (например, сканирование на неисправности, тест на скорость) предназначен для обнаружения функциональных дефектов, но часто пропускает скрытые проблемы надежности, вводимые изменчивостью. Адаптивное тестирование идет дальше, регулируя условия тестирования (напряжение, частота, температура) на основе характеристик конкретного чипа. Например, чип с более высокой, чем в среднем, утечкой может быть протестирован при более высокой температуре для ускорения эффектов старения и выявления слабых клеток. Тестирование на сжигание, где чипы работают в условиях стресса в течение периода, экранирует те, которые с ранним износом. Однако, сгорание является дорогостоящим и может ухудшить чипы, которые в противном случае прошли бы. Следовательно, статистический анализ выбросов - флагманские чипы, параметрические измерения которых (например, IDDQ, максимальная частота, напряжение при минимальном Vmin) выходят за рамки трех сигм - используется для нацеливания только на самые рискованные единицы для сжигания.

Исправление ошибок и увольнение

После развертывания системы методы выполнения справляются с остаточной изменчивостью. Память кода коррекции ошибок (ECC) теперь стандартна в процессорах серверного класса для обработки мягких ошибок. Даже один паритет может уменьшить необнаруженные сбои на порядки. Для логических схем тройное модульное резервирование (TMR) и контрольное указание используются в системах высокой надежности (авионика, пространство). Более современные подходы включают дублирование на уровне инструкций и избыточное многопоточность (например, одновременное многопоточность IBM с выполнением двух потоков). Увольнение также может применяться на базовом уровне: многие серверные чипы включают запасные ядра, которые могут быть активированы, если первичное ядро выходит из строя из-за износа, вызванного изменчивостью.

Напряжение и частотное масштабирование

Системы адаптивного масштабирования напряжения и частоты (AVFS) отслеживают датчики на чипе (кольцевые осцилляторы, температурные диоды) и корректируют рабочие точки в режиме реального времени. Если задержка пути ядра увеличивается из-за старения (ускоренная изменчивость), напряжение может быть увеличено или понижено частотой для поддержания пределов времени. Такое управление замкнутым контуром становится обычным явлением в мобильных SoC, где мощность и надежность должны быть сбалансированы. В крайнем случае некоторые процессоры включают самотест на чипе, который работает при системном простое время, обнаруживает временной слак и соответствующим образом обновляет таблицы частот. Этот динамический подход продлевает срок службы системы и уменьшает полосы защиты, которые в противном случае потребовались бы.

Упреждающее управление надежностью

Вместо того, чтобы ждать сбоев, проактивные системы используют данные об использовании и телеметрию для прогнозирования и планирования обслуживания. Например, облачный сервер может отслеживать счетчики уровня ядра для исправленных ошибок, событий снижения напряжения и тепловых экскурсий. Когда ядро показывает признаки ускоренного дрейфа (возможно, из-за крайней изменчивости), система может мигрировать рабочие нагрузки, производительность дросселя или заменять серверный узел до сбоя. Эта ориентированная на надежность оркестровка является растущей тенденцией в центрах обработки данных и стимулирует спрос на чипы, которые включают больше датчиков и интерфейсов на снимке, которые подвергают данные вариации системному программному обеспечению.

Будущее: изменчивость на атомной границе

По мере того, как полупроводниковая промышленность будет двигаться к 3-нанометровым и даже 2-нанометровым узлам, изменчивость производства будет только усиливаться. Структуры атомного масштаба, такие как нанолисты с затвором и 2D-каналы дихалкогенида переходного металла, вводят совершенно новые механизмы вариации. Например, толщина нанолистов должна контролироваться в пределах нескольких атомных слоев для обеспечения последовательной электростатики. Между тем тенденция к трехмерной интеграции (3D-укладка) добавляет изменчивость посредством тепловой связи и межслойного смещения.

Новые технологии смягчения

Несколько перспективных технологий разрабатываются для решения будущей изменчивости. Кооптимизация технологии проектирования (DTCO) интегрирует технологические и проектные решения с самых ранних стадий, позволяя схемам, которые по своей сути более терпимы к вариациям. Самоисцеляющиеся схемы с использованием перенастраиваемых антифюсов или бэкэнд-программирования могут регулировать время и смещения после упаковки, компенсируя производственные спреды. Вероятностные вычисления и алгоритмы, устойчивые к ошибкам в ускорителях машинного обучения могут выдерживать определенное количество неточностей, ослабляя ограничения надежности и позволяя более высокую изменчивость. в памяти вычисления с использованием мемристивных устройств могут полностью обойти традиционные ограничения транзисторов.

Прогнозное моделирование с ИИ

Искусственный интеллект революционизирует то, как моделируется и управляется изменчивость. Генеративные состязательные сети (GAN) могут имитировать правдоподобные карты вариаций процессов из ограниченных данных измерений, позволяя быстрее итерации проектирования. Агенты обучения с подкреплением используются для оптимизации последовательностей испытательного потока в производстве, сокращения времени тестирования при сохранении качества. Во время выполнения модели машинного обучения прогнозируют оставшийся срок полезного использования чипа на основе сенсорной телеметрии и моделей рабочей нагрузки, вызывая действия по смягчению последствий до возникновения сбоев. Эти интеллектуальные системы становятся неотъемлемой частью экосистемы надежности.

В заключение, изменчивость производства является неизбежной реальностью изготовления микропроцессоров. Его эффекты пульсируют через каждый слой вычислительной системы - от физического транзистора до прикладного программного обеспечения. Хотя изменчивость не может быть устранена, она может быть понята, управляема и в значительной степени смягчена посредством тщательного проектирования, строгого управления процессом, адаптивного тестирования и интеллектуальных механизмов выполнения. Поскольку чипы продолжают сокращаться и интегрировать больше функций, способность создавать надежные системы, несмотря на изменчивость, будет определяющим конкурентным преимуществом. Инженеры, которые осваивают эту проблему, позволят следующее поколение надежных высокопроизводительных вычислений для приложений, которые требуют непоколебимой надежности.

Читать далее: