Использование алгоритмов машинного обучения для улучшения анализа носимых данных
Роль машинного обучения в анализе носимых данных
Носимые технологии, включая фитнес-трекеры, умные часы и медицинские пластыри, стали основой для личного мониторинга здоровья. Эти устройства постоянно собирают потоки физиологических и активных данных: частота сердечных сокращений, количество шагов, стадии сна, температура кожи и даже электродермальная активность. Тем не менее, огромный объем, скорость и изменчивость этих данных переполняют традиционные методы анализа. Сырые выходы датчиков являются шумными, высокоразмерными и контекстно-зависимыми. Алгоритмы машинного обучения (ML) предлагают систематический способ превратить эти необработанные данные в надежные, действенные идеи. Изучая образцы из исторических данных, модели ML могут классифицировать действия, обнаруживать аномальные сердечные ритмы, прогнозировать уровни стресса и персонализировать рекомендации по здоровью. В этой статье исследуется, как различные методы ML применяются к носимым данным, преимущества, которые они предоставляют, и проблемы, которые остаются для широкого распространения.
Понимание машинного обучения в носимом контексте
Машинное обучение, подмножество искусственного интеллекта, включает в себя алгоритмы обучения данным, чтобы они могли делать прогнозы или решения, не будучи явно запрограммированными для каждого сценария. В носимой аналитике процесс обычно начинается со сбора данных с датчиков (акселерометры, гироскопы, оптические мониторы сердечного ритма и т. Д.), Затем следует предварительная обработка (фильтрация, нормализация, оконное сканирование), извлечение признаков (например, среднее значение, дисперсия, компоненты частотной области) и, наконец, обучение модели и оценка. Затем модель работает либо на устройстве (вывод на устройстве) или в облаке. Цель состоит в том, чтобы преобразовать показания датчиков в осмысленные состояния: ходьба против бега, REM против глубокого сна, нормальный синусовый ритм против мерцательной аритмии. Способность ML обрабатывать сложные, нелинейные отношения делает его идеальным для этих задач.
Типы алгоритмов машинного обучения для носимых данных
Надзорное обучение
Надзорное обучение требует помеченных данных, где каждый сегмент датчика помечается истинной информацией (например, «ходьба», «прыжки», «сердечное биение нерегулярно»).
- Случайные леса — совокупность деревьев решений, которые хорошо обрабатывают данные датчиков высокой размерности и обеспечивают оценки важности функций.
- Поддержка векторных машин (SVM) — эффективна для классификации типов деятельности, особенно когда количество признаков велико относительно образцов.
- Связочные нейронные сети (CNN) — модели глубокого обучения, которые автоматически изучают пространственные и временные особенности из необработанных сигналов датчика; обычно используется в анализе вариабельности сердечного ритма и обнаружении шагов.
- Рекуррентные нейронные сети (RNN) / LSTMs — Предназначен для последовательных данных; идеально подходит для моделирования моделей временных рядов в походке, стадиях сна или ЭКГ-формах волн.
Например, CNN, обученный данным трехосевого акселерометра, может классифицировать повседневную деятельность с точностью более 95% на общедоступных наборах данных, таких как ] UCI Распознавание человеческой активности .
Неконтролируемое обучение
Когда помеченные данные скудны или дороги для сбора, неконтролируемое обучение находит скрытые структуры. Алгоритмы кластеризации (k-средства, DBSCAN, иерархическая кластеризация) могут группировать пользователей по схемам активности или аналогичным сегментам сна. Снижение дифференцируемости (PCA, t-SNE, автокодировщики) помогает визуализировать данные о движении в больших измерениях и может служить в качестве этапа предварительной обработки для удаления шума. Обнаружение аномалий Обнаружение аномалий (например, изолированные леса, одноклассный SVM) используется для обозначения необычных событий сердечного ритма или падений без необходимости примеров всех возможных аномалий).
В недавней работе была применена кластеризация для носимых данных для выявления общих траекторий здоровья, например, группирование людей с аналогичными нарушениями циркадного ритма (см. это исследование 2021 года) .
Усиление обучения
Усиление обучения (RL) обучает агента принимать последовательности решений, взаимодействуя с окружающей средой и получая вознаграждение. В носимых устройствах RL все еще появляется, но показывает обещание для:
- Адаптивный коучинг — виртуальный тренер по здоровью, который учится, когда доставлять мотивационные сообщения для оптимального соблюдения.
- Замкнутые системы — настройка интенсивности вибрации в реальном времени или времени напоминания на основе отзывчивости пользователя.
- Управление энергией — Устройство учится, когда уменьшить выборку датчиков для сохранения батареи при сохранении качества данных.
Хотя RL сегодня менее распространен в потребительских носимых устройствах, исследовательские прототипы продемонстрировали его потенциал в персонализации обратной связи без явного программирования на основе правил.
Глубокое обучение и коллективные подходы
Помимо классических неглубоких алгоритмов, глубокое обучение стало доминирующей техникой для носимых данных. Механизмы внимания и Трансформаторные архитектуры адаптируются к сенсорным временным рядам, позволяя моделям фокусироваться на соответствующих временных окнах (например, фокусироваться на пиках сердечного ритма во время упражнений). Федерированное обучение — распределенный подход, при котором модели обучаются на многих устройствах без обмена необработанными данными — набирает обороты как метод сохранения конфиденциальности. Исследовательская группа Google показала, что федеративные модели могут улучшить предсказание слов на смартфонах, и аналогичные подходы тестируются на такие показатели здоровья, как обнаружение шагов при сохранении данных на устройстве.
Предварительная обработка данных и разработка функций для носимых устройств
Сырые данные датчиков, как известно, ненадежны. Показания акселерометра содержат гравитационный дрейф; мониторы сердечного ритма восприимчивы к артефактам движения; сигналы проводимости кожи включают в себя пот-индуцированные шипы. Эффективные модели ML зависят от чистых, хорошо спроектированных функций. Общие этапы предварительной обработки включают:
- Фильтрация (FLT:0) Фильтрация (FLT:1) – фильтры с низкими частотами удаляют высокочастотный шум; фильтры с высокими частотами изолируют ускорение тела от силы тяжести.
- Окнование — Потоки датчиков сегментируются на перекрывающиеся окна (например, 2-10 секунд) для захвата временного контекста.
- Нормализация — Функции масштабирования до нуля средней и единицы дисперсии не позволяют моделям быть смещенными различиями в диапазоне датчиков.
- Обработка недостающих данных — методы интерполяции или вычисления заполняют пробелы в упавших пакетах Bluetooth или отключениях датчиков.
Инжиниринг функций часто сочетает в себе функции временной области (среднее, стандартное отклонение, корреляция между осями), функции частотной области (материи частот, спектральная энергия) и специфические функции домена (интервалы RR от PPG, нулевые скорости пересечения от акселерометров). Однако при глубоком обучении автоматическое извлечение функций из необработанных сигналов уменьшило потребность в функциях ручной работы, хотя тщательная предварительная обработка все еще улучшает обобщение.
Реальные приложения и тематические исследования
Признание деятельности
Потребительские носимые устройства, такие как Apple Watch и Fitbit, используют ML для классификации ходьбы, бега, езды на велосипеде, плавания и подъема по лестнице. Алгоритмы полагаются на потоки акселерометра и гироскопа, часто работающие на выделенных нейронных процессорах (NPU), чтобы поддерживать низкий уровень задержки и управляемый разряд батареи. Публичные тесты, такие как база данных FiioNet Motion Artifact, помогают исследователям сравнивать модели.
Частота сердечных сокращений и кардиомониторинг
Датчики фотоплетизмографии (PPG) в смарт-часах измеряют изменения объема крови, но движение и окружающий свет вносят шум. Модели ML - особенно CNN и LSTM - надежно фильтруют артефакты и оценивают частоту сердечных сокращений. Функция обнаружения фибрилляции предсердий (AFib) Apple Watch, очищенная FDA, использует глубокую нейронную сеть для анализа нерегулярных сердечных ритмов из данных PPG. Исследования показывают чувствительность и специфичность, сопоставимую с клиническими патчами ЭКГ.
Классификация стадии сна
Традиционная постановка сна требует ЭЭГ, ЭОГ и ЭМГ в лаборатории. Сегодня носимые устройства используют акселерометрию и вариабельность сердечного ритма (ВСР) для оценки бодрствования, света, глубокого и быстрого сна. Модели ML обучаются на данных, помеченных полисомнографией, и достигают примерно 80-85%-ного соглашения с ручным подсчетом. Такие компании, как Oura и Withings, усовершенствовали свои алгоритмы с использованием крупномасштабных исследований, а недавние исследования , опубликованные в Sleep Medicine , показывают, что модели на основе RNN могут превосходить линейные дискриминантные классификаторы.
Стресс и мониторинг психического здоровья
В носимом на основе обнаружения стресса используются функции от частоты сердечных сокращений, ВСР, проводимости кожи и температуры кожи. Классификаторы ML (например, повышение градиента, автокодировщики) могут обнаруживать острые стрессовые события с точностью около 85%. Некоторые системы идут дальше, предсказывая колебания настроения при биполярном расстройстве, комбинируя носимые данные с самоотчетами, как видно в проекте MONARCA .
Преимущества интеграции машинного обучения в носимые устройства
В оригинальной статье перечислены три преимущества; мы расширяем каждый из них конкретными доказательствами:
- Повышение точности — МЛ уменьшает ложные срабатывания и ложные отрицания. Например, традиционный пороговый счетчик шагов может ошибочно классифицировать вибрации шины как шаги; случайная лесная модель, которая включает временный контекст и гравитационные функции, сокращает такие ошибки более чем на 40%.
- Персонализация – модели, ориентированные на пользователя, адаптируются к уникальной физиологии. Общий калькулятор зоны сердечного ритма может быть отключен на 15 б/мин для человека, но CNN, изучающий передачу, который точно настраивается на собственный HR и HRV пользователя, дает персонализированные зоны обучения с ошибкой <5 б/мин.
- Раннее обнаружение — МО может обнаружить тонкие отклонения задолго до того, как они станут клинически заметными. Показано, что модель, обученная непрерывным данным HR от умных часов, предсказывает будущий диагноз гипертонии за шесть месяцев до этого, основываясь на постепенных изменениях в ночном HR и темпах восстановления.
- Эффективность батареи — ML на устройстве может решать, когда будить датчики. Вместо непрерывной выборки акселерометра на частоте 100 Гц классификатор с низким энергопотреблением может работать на частоте 1 Гц, и только полноразмерная выборка включена при обнаружении нестабильности походки — экономия до 60% батареи.
- Масштабируемость — Облачные модели могут быть развернуты на миллионах устройств мгновенно. Это позволяет производителям выпускать новые функции здоровья с помощью обновлений программного обеспечения, как видно из истории фибрилляции предсердий Apple Watch, выпущенной в 2022 году.
Проблемы и ограничения
Несмотря на обещание, до того, как носимые устройства с улучшенным ML станут стандартом в клиническом и повседневном использовании, остаются несколько препятствий:
- Конфиденциальность и безопасность данных — Данные о здоровье очень чувствительны. Такие правила, как GDPR и HIPAA, накладывают строгие правила на хранение, обмен и обработку. Обработка на устройстве и федеративное обучение смягчают некоторые риски, но поверхность атаки (телефонные приложения, облачные серверы, брокеры данных) по-прежнему велика. Пользователи должны доверять тому, что их биометрические данные не будут проданы или просочились.
- Вычислительные ограничения — Носимые устройства имеют ограниченную мощность процессора, память и батарею. Запуск глубокой нейронной сети непрерывно может разряжать батарею за несколько часов. Методы сжатия модели (квантизация, обрезка, перегонка знаний) необходимы, но они могут ухудшить точность. Компромисс между сложностью модели и потреблением ресурсов является ключевой инженерной задачей.
- Качество и маркировка данных — контролируемое обучение требует большого количества меченых данных. Сбор ярлыков «земная правда» для условий свободного проживания (например, «пользователь съел еду» или «испытал паническую атаку») чрезвычайно сложен. Ярлыки, сообщаемые сами по себе, ненадежны, и собранные в лаборатории данные могут не обобщаться в реальных условиях.
- Биас и обобщаемость — Модели, обученные преимущественно молодым, здоровым и белым популяциям, плохо работают в различных группах. Тон кожи влияет на качество сигнала PPG; индекс массы тела влияет на размещение акселерометра. Без репрезентативных данных обучения носимые устройства могут усугубить неравенство в отношении здоровья.
- Интерпретируемость — Модели глубокого обучения часто являются «черными ящиками». Клиницист может колебаться, чтобы действовать на предсказание (например, «высокий риск падения»), не понимая способствующих факторов. Разрабатываются понятные методы ИИ (SHAP, LIME), но они добавляют сложность и еще не являются стандартными в потребительских устройствах.
- Регуляторные проблемы — Точность медицинского уровня требует клиренса FDA или маркировки CE, что требует строгой клинической проверки. Многие компании предпочитают продавать свои устройства как «оздоровительные», а не «медицинские», чтобы избежать регуляторных накладных расходов.
Будущие направления
Обучение на грани AI и On-Device
Достижения в маломощных чипах ИИ (например, Neural Engine от Apple, Tensor Processing Units от Google для мобильных устройств) позволяют сложным моделям полностью работать на устройстве. Следующий рубеж — это точная настройка на устройстве, позволяющая устройству каждого пользователя продолжать учиться на своих собственных данных, не отправляя их в облако. Это улучшит персонализацию при сохранении конфиденциальности.
Мультимодальная фьюжн
Комбинирование сигналов от нескольких датчиков (акселерометр, гироскоп, PPG, температура, микрофон, даже камера) создаст более богатую картину состояния пользователя. модели ML, которые объединяют эти модальности, могут улучшить диагностику таких состояний, как апноэ сна (сочетание насыщения кислородом с движением) или стресс (сочетание HRV с голосовым тоном из микрофона телефона).
Интеграция с системами здравоохранения
По мере того, как носимые данные становятся более надежными, они будут интегрированы в электронные медицинские записи (EHR). Модели ML могут автоматически суммировать активность и сон пациента за последний месяц, отмечать тенденции и предупреждать команду по уходу. Пилотные программы уже осуществляются в кардиологии и лечении диабета.
Самоконтролируемое обучение
Чтобы уменьшить зависимость от меченых данных, самоконтролируемое обучение (SSL) предварительно тренирует модели на немаркированных данных датчика, предсказывая недостающие сегменты или контрастные задачи. Начальные результаты показывают, что SSL может изучать представления, которые хорошо передаются на задачи нисходящего потока, такие как обнаружение падения и классификация активности, требуя только небольшого набора меток для точной настройки.
Заключение
Алгоритмы машинного обучения перешли от экспериментальных прототипов к ядру современной носимой технологии. Они позволяют точно классифицировать активность, выявлять аномалии здоровья в реальном времени и персонализировать коучинг - все из данных датчиков, которые пользователи уже генерируют. Однако достижение надежных, справедливых и частных носимых устройств с улучшенным ML требует продолжения исследований в области сжатия моделей, федеративного обучения и смягчения предвзятости. Для преподавателей и студентов в области науки о данных и информатики здравоохранения важно понять, как ML обрабатывает носимые данные: он устраняет разрыв между необработанными сигналами и значимыми результатами в области здравоохранения. По мере совершенствования алгоритмов и созревания оборудования грань между фитнес-трекером и клиническим монитором будет продолжать размываться, делая управление личным здоровьем умнее и доступнее, чем когда-либо прежде.