🫀 Подключи часы Garmin — получи ежедневный AI-разбор на русском Попробовать бесплатно →
Данные и метрики

Почему модели стресса принимают физическую нагрузку за нервы

Бегунья остановилась на дорожке, держится за бок и озадаченно смотрит на спортивные часы
Коротко

Модели распознавания стресса по данным носимых датчиков в этой работе реагировали на физиологическую активацию целиком, а нервное напряжение — только её часть. В работе Аберистуитского университета лучшая калиброванная модель пометила 82,6% тренировочных окон как «стресс», хотя тренировки в обучение не включали. Фирменные шкалы производителей часов в работе не измерялись, так что перенос вывода на них остаётся допущением. Высокая цифра во время самой пробежки означает разогнанный организм.

Про цифру на шкале стресса меня спрашивают регулярно. Человек смотрит на цветную шкалу и читает её как отчёт о своих нервах: серая зона — спокоен, оранжевая — на взводе. 8 сентября 2026 года в Medical Engineering & Physics вышла онлайн, до печатного выпуска, работа, которая измеряет ровно этот разрыв между тем, что шкала называет, и тем, что она видит.

Как проверяют модели стресса и что здесь сделали иначе

Айдоган и Повина из Аберистуитского университета (Уэльс) переанализировали два публичных набора данных носимых устройств (PubMed, PMID 42710527, DOI 10.1088/1873-4030/aea41e).

Их отправная точка — методическая. Модели распознавания стресса по носимым датчикам обычно проверяют так: берут записи покоя, берут записи стрессовой пробы и смотрят, отличит ли модель одни от других. Отличила — модель работает. Но такая проверка отвечает только на вопрос «видит ли модель разницу между покоем и возбуждением». Она ничего не говорит о том, отражает ли выход модели именно стресс — физиологическая активация шире.

Авторы сделали главным тестом другое — сопоставление внутри одного и того же набора данных. По событийным меткам PhysioNet восстановили блоки, заданные протоколом: покой и индукция стресса. В анализ вошли 29 участников, у которых были парные аэробные и анаэробные записи, — это 522 окна покоя, 192 окна стресса и 3431 окно тренировочных сессий.

Четыре классификатора на признаках обучали отличать покой от стресса при вложенной перекрёстной проверке с исключением одного участника. Всю настройку авторы держали внутри обучающей части: там же чистили сигнал, там же подбирали параметры модели и там же выбирали порог, за которым окно объявляется стрессом. Записи тренировочных сессий в разработку модели не попадали ни на одном шаге. Для готовой модели тренировка осталась состоянием, которого она никогда не видела.

Результат: покой отделяется, нагрузка — нет

Лучшей калиброванной моделью оказался XGBoost. На той задаче, для которой её обучали, она отработала прилично: сбалансированная точность 0,703, определение стресса 0,604, специфичность покоя 0,801. И при этом пометила «стрессом» 82,6% отложенных окон, записанных во время самих тренировочных сессий.

Доля ложного «стресса» в расчёте на участника: покой против тренировки
100% 75% 50% 25% 0 доля ложного «стресса», на участника 0,221 покой интервал 0,151–0,301 0,840 тренировочная сессия интервал 0,775–0,897 парная разница 0,619 интервал 0,537–0,699

Числа работы Aydoğan Y, Povina FV, Med Eng Phys, 8 сентября 2026 (PubMed, PMID 42710527, DOI 10.1088/1873-4030/aea41e), перерисовано в нашей палитре. Доли на уровне участника для лучшей калиброванной модели XGBoost, в скобках — интервалы, приведённые в публикации (их тип в абстракте не указан).

Разрыв между столбцами и есть содержание работы. Обе доли сняты у одного и того же человека одним и тем же классификатором: при проверке с исключением участника его записи покоя и его тренировочные записи судит модель, обученная без него. Ложный «стресс» она ставит на 22% записей покоя и на 84% тренировочных записей — в расчёте на одного участника. Доля считалась внутри каждого человека отдельно, а публикуются сводные 0,221 и 0,840 с интервалами 0,151–0,301 и 0,775–0,897: у отдельных участников доли расходятся, и как именно их сводили в общую оценку, в абстракте не сказано.

Насколько хороша модель на своей задаче

Обучена модель аккуратно — чистка сигнала, подбор параметров и выбор порога остались внутри обучающей части, — и это делает результат сильнее: списать промахи на грубую ошибку обучения не выйдет. Выдающейся её при этом не назовёшь: стресс она ловит в 0,604 случаев, а в покое ошибается примерно в каждой четвёртой-пятой записи участника. Покой от стрессовой пробы она отделяет со сбалансированной точностью 0,703 и специфичностью покоя 0,801 — и всё равно валится на физической нагрузке.

Лучшая калиброванная модель: показатели на своей задаче и поведение на тренировке
0 0,5 1,0 сбалансированная точность 0,703 определение стресса 0,604 специфичность покоя 0,801 тренировочных окон как «стресс» 0,826

Числа работы PMID 42710527 (DOI 10.1088/1873-4030/aea41e), перерисовано в нашей палитре. Первые три показателя — на задаче «покой против стрессовой пробы», нижняя строка — доля отложенных тренировочных окон, помеченных моделью как стресс.

Добавление признаков вариабельности сердечного ритма во временной области результат существенно не изменило. Перенос модели с набора WESAD на данные PhysioNet остался слабым — его авторы отнесли к второстепенным доказательствам, потому что там к переносу примешиваются различия наборов и протоколов. Зато закрыто удобное возражение «а может, в стрессовых блоках люди и не нервничали»: самооценка стресса в блоках протокола была выше, чем в блоках покоя, — средняя разница 1,22 балла по шкале 1–10 (интервал 0,89–1,53), односторонний критерий Уилкоксона p=4,64×10⁻⁶; в абстракте эта оценка помечена как относящаяся к 27 участникам из 29 — что именно означает дробь, там не расшифровано. Метки протокола согласуются с самоотчётом участников — в среднем на 1,22 балла из десяти; ошибка возникает дальше — там, где обученная модель встречает состояние, которого она не видела: тренировочную нагрузку.

Как это выглядит со стороны датчика

Что подавалось на вход моделям, абстракт не раскрывает. Механику ниже я излагаю как общее свойство наручных датчиков — измерением авторов она не является. Датчик на запястье видит пульс и промежутки между ударами. Симпатическая активация поднимает пульс и сжимает вариабельность, и делает она это в обоих случаях: когда человек ждёт неприятного разговора и когда он бежит в горку. Поводы разные, а по этим двум сигналам подъёмы выглядят похоже. Измеренное авторами — одно: лучшая калиброванная модель, обученная отличать покой от стрессовой пробы, пометила «стрессом» 82,6% тренировочных окон, то есть нервное напряжение и физическую нагрузку она не разделила.

Один и тот же подъём по датчику: разговор и пробежка
высоко низко активация по датчику нервный эпизод пробежка утро вечер

Схема, поясняющая механику: форма подъёма пульса и падения вариабельности у нервного эпизода и у нагрузки для датчика на запястье выглядит похоже. Числовых значений здесь нет, ось подписана качественно.

Отсюда и осторожность формулировок. Работа переанализирует публичные наборы и тестирует исследовательские классификаторы. Фирменные алгоритмы производителей часов в ней не измерялись, поэтому сказать «шкала стресса Garmin ошибается в 82,6% случаев» из этой публикации нельзя. Сказать можно другое: модели этого класса способны в массовом порядке принимать физическую активацию за стресс — на этих данных так и вышло, при том что тренировки в обучение не попадали.

Что с этим делать человеку с часами на руке

  • Во время нагрузки шкала говорит о нагрузке. Именно на окнах тренировочных сессий модель ставила ложный «стресс» в 82,6% случаев. Сколько времени после финиша цифра остаётся про нагрузку, работа не измеряла: её предмет — специфичность стресса, восстановление в ней не изучалось вовсе, так что осторожность к ближайшим после тренировки значениям — мой вывод, авторам он не принадлежит.
  • Смотрите на спокойные окна. Ночь, утро до выхода из дома, рабочий день без тренировки — там подъём шкалы вероятнее связан с чем-то другим, и это уже разговор по делу. Безошибочными спокойные окна не становятся: в этой работе модель ставила ложный «стресс» и в покое — примерно в каждой четвёртой-пятой записи участника (0,221).
  • Сравнивайте похожее с похожим. Вторник с интервальной и вторник без неё — разные дни по определению. Дневная сумма стресса, посчитанная поверх обоих, сравнивает разное.
  • Держите в голове, что метка — не измерение. Устройство измеряет пульс и интервалы между ударами, а слово «стресс» появляется уже на выходе модели, которая эти сигналы истолковала.

Границы этого разбора

  • Читал абстракт. Полного текста работы у меня нет, поэтому деталей протокола сверх перечисленных здесь я не привожу — состава стрессовых проб, набора признаков, схемы записи.
  • 29 участников. Выборка небольшая, и это переанализ уже собранных публичных данных: своего протокола записи у авторов здесь нет.
  • Не про конкретный бренд. Авторы обучали собственные классификаторы. Перенос вывода на фирменную шкалу конкретных часов — интерпретация; измерения по ней в работе нет.
  • Признаки моделей не раскрыты. Абстракт называет классификаторы «признаковыми» и не перечисляет входы, поэтому утверждать, что работа проверяла ровно те же сигналы, на которых стоят фирменные шкалы, я не могу.
  • Своих чисел в статье нет. Оба графика с данными нарисованы по числам публикации, третий помечен как схема. Данные пользователей PulseCoach здесь не участвуют.
  • Материал не медицинская консультация. Он объясняет, как устроена метрика в часах. Решения о здоровье, лечении и допуске к нагрузкам принимаются с врачом, а не по шкале на экране.

Итог

Работа не отменяет шкалу стресса — она уточняет, что именно шкала измеряет. Датчик на запястье измеряет активацию, и на окнах тренировочных сессий модель называет эту активацию стрессом в 82,6% случаев. Пока метрика читается как «насколько я разогнан», она полезна. Как только её читают как «насколько я нервничаю», тренировочные окна перестают значить то, что на них написано.

Дальше про эту же группу метрик: стресс и тренировки в данных Garmin, Body Battery и вариабельность сердечного ритма — три показателя, у которых общий вход: пульс и интервалы между ударами. Как Garmin оценивает готовность после тяжёлой сессии — по Recovery Time, HRV и пульсу покоя — разобрано в статье про восстановление после тренировки.

Как PulseCoach читает шкалу стресса

Сама по себе цифра одинаково растёт от нервного дня и от интервальной работы, и по ней одной эти два дня не различить. PulseCoach смотрит на шкалу вместе с остальной выгрузкой часов: была ли в этот день тренировка, когда она закончилась, как выглядели ночь и пульс покоя. Вот что он отвечает на вопрос «почему стресс такой высокий» вечером тренировочного дня:

PulseCoach в действии: ответ на вопрос о стрессе

День с тренировкой и день без неё читаются по-разному

Бот знает, была ли нагрузка и когда она закончилась, поэтому высокий стресс в тренировочный день он не выдаёт за нервы. В день без тренировки такая же цифра становится поводом разобраться, что происходило в этот день.

  • Разводит день с нагрузкой и спокойный день
  • Объясняет, откуда взялся подъём шкалы
  • Подсказывает, когда цифру не стоит читать как нервы
PulseCoach Ответ на вопрос 21:10
Средний стресс за сегодня заметно выше твоего обычного уровня. Но сегодня была интервальная работа, и закончилась она меньше двух часов назад, так что эту цифру я читаю как след нагрузки.
Показательнее будет ночь и завтрашнее утро: там шкала уже расскажет про восстановление.
А во вторник тренировки не было, и средний стресс за день вышел такой же высокий. Вот тот день и стоит обсудить: что тогда происходило?

Разбирать такие вопросы по своим данным помогает PulseCoach: он читает выгрузку часов и объясняет, что за цифрой на экране стоит и стоит ли на неё смотреть в этот час.

Хочешь видеть свои данные вот так каждый день?

PulseCoach подключается к твоим часам Garmin и объясняет, что происходит с твоим восстановлением — на русском, без 40 непонятных графиков.

Подключить часы →

Часто задаваемые вопросы

Почему часы показывают высокий стресс после тренировки?
Шкала стресса считается по пульсу и вариабельности сердечного ритма, а пульс и вариабельность сдвигаются и от нервного напряжения, и от физической нагрузки, поэтому по этим двум сигналам подъёмы выглядят похоже. Фирменные шкалы производителей в этой работе никто не проверял, но исследовательская модель — лучшая калиброванная из четырёх — пометила «стрессом» 82,6% окон, записанных во время самих тренировок, хотя данные тренировок в обучение вообще не попадали. Замеряли авторы именно окна тренировочных сессий: сколько минут цифра остаётся про нагрузку после остановки часов, работа не проверяла. Пока идёт сама тренировка, высокая цифра говорит о разогнанном организме, и это ожидаемое состояние.
Насколько часто модель ошибается в покое и насколько — на тренировке?
В расчёте на одного участника доля ложного «стресса» на тренировочных записях составила 0,840 (интервал 0,775–0,897), в покое — 0,221 (0,151–0,301). Парная разница — 0,619 (0,537–0,699). То есть на тренировке модель ошибалась почти вчетверо чаще, чем в покое.
Значит ли это, что шкала стресса в часах бесполезна?
Нет. Работа показывает границу применимости: на своей задаче — отделить покой от стрессовой пробы — лучшая модель дала сбалансированную точность 0,703 и специфичность покоя 0,801, и самооценка участников подтвердила разницу между блоками (средняя разница 1,22 балла по шкале 1–10). Ломается именно перенос на физическую активацию. При этом и в покое та же модель ставила ложный «стресс» примерно в каждой четвёртой-пятой записи участника — то есть даже спокойные окна она читает не безошибочно. Всё это измерено на исследовательских классификаторах: фирменную шкалу производителя часов в работе не проверяли, перенос вывода на неё остаётся допущением.
Проверялась ли в этой работе шкала стресса конкретно у Garmin?
Нет. Авторы переанализировали два публичных набора данных носимых устройств и обучали собственные классификаторы, а не фирменные алгоритмы производителей часов. Вывод относится к исследовательским классификаторам на данных носимых датчиков; какой именно набор признаков в них входил, абстракт не раскрывает — сказано лишь, что добавление признаков вариабельности во временной области результат не изменило. Сходство этих моделей со шкалами стресса в потребительских устройствах — моё допущение, прямого замера конкретного бренда в работе нет. Что Garmin считает под словом «стресс» и как читать эту шкалу рядом с тренировочной нагрузкой, разобрано в статье про стресс и тренировки в данных Garmin.
Помогает ли добавление показателей вариабельности ритма?
В этой работе — нет: добавление признаков вариабельности во временной области результат существенно не изменило. Перенос модели с набора WESAD на данные PhysioNet тоже остался слабым, но авторы отнесли его к второстепенным доказательствам, потому что там смешиваются различия наборов и протоколов.