Почему модели стресса принимают физическую нагрузку за нервы
Модели распознавания стресса по данным носимых датчиков в этой работе реагировали на физиологическую активацию целиком, а нервное напряжение — только её часть. В работе Аберистуитского университета лучшая калиброванная модель пометила 82,6% тренировочных окон как «стресс», хотя тренировки в обучение не включали. Фирменные шкалы производителей часов в работе не измерялись, так что перенос вывода на них остаётся допущением. Высокая цифра во время самой пробежки означает разогнанный организм.
Про цифру на шкале стресса меня спрашивают регулярно. Человек смотрит на цветную шкалу и читает её как отчёт о своих нервах: серая зона — спокоен, оранжевая — на взводе. 8 сентября 2026 года в Medical Engineering & Physics вышла онлайн, до печатного выпуска, работа, которая измеряет ровно этот разрыв между тем, что шкала называет, и тем, что она видит.
Как проверяют модели стресса и что здесь сделали иначе
Айдоган и Повина из Аберистуитского университета (Уэльс) переанализировали два публичных набора данных носимых устройств (PubMed, PMID 42710527, DOI 10.1088/1873-4030/aea41e).
Их отправная точка — методическая. Модели распознавания стресса по носимым датчикам обычно проверяют так: берут записи покоя, берут записи стрессовой пробы и смотрят, отличит ли модель одни от других. Отличила — модель работает. Но такая проверка отвечает только на вопрос «видит ли модель разницу между покоем и возбуждением». Она ничего не говорит о том, отражает ли выход модели именно стресс — физиологическая активация шире.
Авторы сделали главным тестом другое — сопоставление внутри одного и того же набора данных. По событийным меткам PhysioNet восстановили блоки, заданные протоколом: покой и индукция стресса. В анализ вошли 29 участников, у которых были парные аэробные и анаэробные записи, — это 522 окна покоя, 192 окна стресса и 3431 окно тренировочных сессий.
Четыре классификатора на признаках обучали отличать покой от стресса при вложенной перекрёстной проверке с исключением одного участника. Всю настройку авторы держали внутри обучающей части: там же чистили сигнал, там же подбирали параметры модели и там же выбирали порог, за которым окно объявляется стрессом. Записи тренировочных сессий в разработку модели не попадали ни на одном шаге. Для готовой модели тренировка осталась состоянием, которого она никогда не видела.
Результат: покой отделяется, нагрузка — нет
Лучшей калиброванной моделью оказался XGBoost. На той задаче, для которой её обучали, она отработала прилично: сбалансированная точность 0,703, определение стресса 0,604, специфичность покоя 0,801. И при этом пометила «стрессом» 82,6% отложенных окон, записанных во время самих тренировочных сессий.
Числа работы Aydoğan Y, Povina FV, Med Eng Phys, 8 сентября 2026 (PubMed, PMID 42710527, DOI 10.1088/1873-4030/aea41e), перерисовано в нашей палитре. Доли на уровне участника для лучшей калиброванной модели XGBoost, в скобках — интервалы, приведённые в публикации (их тип в абстракте не указан).
Разрыв между столбцами и есть содержание работы. Обе доли сняты у одного и того же человека одним и тем же классификатором: при проверке с исключением участника его записи покоя и его тренировочные записи судит модель, обученная без него. Ложный «стресс» она ставит на 22% записей покоя и на 84% тренировочных записей — в расчёте на одного участника. Доля считалась внутри каждого человека отдельно, а публикуются сводные 0,221 и 0,840 с интервалами 0,151–0,301 и 0,775–0,897: у отдельных участников доли расходятся, и как именно их сводили в общую оценку, в абстракте не сказано.
Насколько хороша модель на своей задаче
Обучена модель аккуратно — чистка сигнала, подбор параметров и выбор порога остались внутри обучающей части, — и это делает результат сильнее: списать промахи на грубую ошибку обучения не выйдет. Выдающейся её при этом не назовёшь: стресс она ловит в 0,604 случаев, а в покое ошибается примерно в каждой четвёртой-пятой записи участника. Покой от стрессовой пробы она отделяет со сбалансированной точностью 0,703 и специфичностью покоя 0,801 — и всё равно валится на физической нагрузке.
Числа работы PMID 42710527 (DOI 10.1088/1873-4030/aea41e), перерисовано в нашей палитре. Первые три показателя — на задаче «покой против стрессовой пробы», нижняя строка — доля отложенных тренировочных окон, помеченных моделью как стресс.
Добавление признаков вариабельности сердечного ритма во временной области результат существенно не изменило. Перенос модели с набора WESAD на данные PhysioNet остался слабым — его авторы отнесли к второстепенным доказательствам, потому что там к переносу примешиваются различия наборов и протоколов. Зато закрыто удобное возражение «а может, в стрессовых блоках люди и не нервничали»: самооценка стресса в блоках протокола была выше, чем в блоках покоя, — средняя разница 1,22 балла по шкале 1–10 (интервал 0,89–1,53), односторонний критерий Уилкоксона p=4,64×10⁻⁶; в абстракте эта оценка помечена как относящаяся к 27 участникам из 29 — что именно означает дробь, там не расшифровано. Метки протокола согласуются с самоотчётом участников — в среднем на 1,22 балла из десяти; ошибка возникает дальше — там, где обученная модель встречает состояние, которого она не видела: тренировочную нагрузку.
Как это выглядит со стороны датчика
Что подавалось на вход моделям, абстракт не раскрывает. Механику ниже я излагаю как общее свойство наручных датчиков — измерением авторов она не является. Датчик на запястье видит пульс и промежутки между ударами. Симпатическая активация поднимает пульс и сжимает вариабельность, и делает она это в обоих случаях: когда человек ждёт неприятного разговора и когда он бежит в горку. Поводы разные, а по этим двум сигналам подъёмы выглядят похоже. Измеренное авторами — одно: лучшая калиброванная модель, обученная отличать покой от стрессовой пробы, пометила «стрессом» 82,6% тренировочных окон, то есть нервное напряжение и физическую нагрузку она не разделила.
Схема, поясняющая механику: форма подъёма пульса и падения вариабельности у нервного эпизода и у нагрузки для датчика на запястье выглядит похоже. Числовых значений здесь нет, ось подписана качественно.
Отсюда и осторожность формулировок. Работа переанализирует публичные наборы и тестирует исследовательские классификаторы. Фирменные алгоритмы производителей часов в ней не измерялись, поэтому сказать «шкала стресса Garmin ошибается в 82,6% случаев» из этой публикации нельзя. Сказать можно другое: модели этого класса способны в массовом порядке принимать физическую активацию за стресс — на этих данных так и вышло, при том что тренировки в обучение не попадали.
Что с этим делать человеку с часами на руке
- Во время нагрузки шкала говорит о нагрузке. Именно на окнах тренировочных сессий модель ставила ложный «стресс» в 82,6% случаев. Сколько времени после финиша цифра остаётся про нагрузку, работа не измеряла: её предмет — специфичность стресса, восстановление в ней не изучалось вовсе, так что осторожность к ближайшим после тренировки значениям — мой вывод, авторам он не принадлежит.
- Смотрите на спокойные окна. Ночь, утро до выхода из дома, рабочий день без тренировки — там подъём шкалы вероятнее связан с чем-то другим, и это уже разговор по делу. Безошибочными спокойные окна не становятся: в этой работе модель ставила ложный «стресс» и в покое — примерно в каждой четвёртой-пятой записи участника (0,221).
- Сравнивайте похожее с похожим. Вторник с интервальной и вторник без неё — разные дни по определению. Дневная сумма стресса, посчитанная поверх обоих, сравнивает разное.
- Держите в голове, что метка — не измерение. Устройство измеряет пульс и интервалы между ударами, а слово «стресс» появляется уже на выходе модели, которая эти сигналы истолковала.
Границы этого разбора
- Читал абстракт. Полного текста работы у меня нет, поэтому деталей протокола сверх перечисленных здесь я не привожу — состава стрессовых проб, набора признаков, схемы записи.
- 29 участников. Выборка небольшая, и это переанализ уже собранных публичных данных: своего протокола записи у авторов здесь нет.
- Не про конкретный бренд. Авторы обучали собственные классификаторы. Перенос вывода на фирменную шкалу конкретных часов — интерпретация; измерения по ней в работе нет.
- Признаки моделей не раскрыты. Абстракт называет классификаторы «признаковыми» и не перечисляет входы, поэтому утверждать, что работа проверяла ровно те же сигналы, на которых стоят фирменные шкалы, я не могу.
- Своих чисел в статье нет. Оба графика с данными нарисованы по числам публикации, третий помечен как схема. Данные пользователей PulseCoach здесь не участвуют.
- Материал не медицинская консультация. Он объясняет, как устроена метрика в часах. Решения о здоровье, лечении и допуске к нагрузкам принимаются с врачом, а не по шкале на экране.
Итог
Работа не отменяет шкалу стресса — она уточняет, что именно шкала измеряет. Датчик на запястье измеряет активацию, и на окнах тренировочных сессий модель называет эту активацию стрессом в 82,6% случаев. Пока метрика читается как «насколько я разогнан», она полезна. Как только её читают как «насколько я нервничаю», тренировочные окна перестают значить то, что на них написано.
Дальше про эту же группу метрик: стресс и тренировки в данных Garmin, Body Battery и вариабельность сердечного ритма — три показателя, у которых общий вход: пульс и интервалы между ударами. Как Garmin оценивает готовность после тяжёлой сессии — по Recovery Time, HRV и пульсу покоя — разобрано в статье про восстановление после тренировки.
Как PulseCoach читает шкалу стресса
Сама по себе цифра одинаково растёт от нервного дня и от интервальной работы, и по ней одной эти два дня не различить. PulseCoach смотрит на шкалу вместе с остальной выгрузкой часов: была ли в этот день тренировка, когда она закончилась, как выглядели ночь и пульс покоя. Вот что он отвечает на вопрос «почему стресс такой высокий» вечером тренировочного дня:
День с тренировкой и день без неё читаются по-разному
Бот знает, была ли нагрузка и когда она закончилась, поэтому высокий стресс в тренировочный день он не выдаёт за нервы. В день без тренировки такая же цифра становится поводом разобраться, что происходило в этот день.
- Разводит день с нагрузкой и спокойный день
- Объясняет, откуда взялся подъём шкалы
- Подсказывает, когда цифру не стоит читать как нервы
Разбирать такие вопросы по своим данным помогает PulseCoach: он читает выгрузку часов и объясняет, что за цифрой на экране стоит и стоит ли на неё смотреть в этот час.
Хочешь видеть свои данные вот так каждый день?
PulseCoach подключается к твоим часам Garmin и объясняет, что происходит с твоим восстановлением — на русском, без 40 непонятных графиков.
Подключить часы →

