
В журнале Nature Communications опубликовано многоцентровое исследование, в котором речь использовали как цифровой биомаркер большого депрессивного расстройства (БДР). Авторы проанализировали 23 608 записей 1816 человек и разработали модель глубокого обучения на основе Whisper. Во внешней выборке модель правильно выявляла 82,5% участников с депрессией и правильно относила к группе без депрессии 83,8%. Однако исследование пока не показывает, что голосовой алгоритм способен заменить клиническую диагностику. В выборку вошли пациенты с активным депрессивным эпизодом и участники без депрессии, поэтому способность различать БДР и другие психические расстройства требует отдельной проверки.
Диагностика депрессии основана на клинической беседе, наблюдении и сообщениях самого пациента. Этот подход остаётся основным, но доступ к специалистам ограничен, а симптомы могут долго оставаться нераспознанными. Поэтому исследователи ищут дополнительные объективные показатели, которые помогли бы быстрее выделять людей, нуждающихся в полноценной психиатрической оценке.
Речь подходит для такого скрининга по нескольким причинам. Её можно записать на обычный смартфон, а изменения темпа, громкости, интонации, пауз и артикуляции давно описаны при депрессии. Ещё Эмиль Крепелин в 1921 году обращал внимание на монотонность, снижение интенсивности голоса и замедление речи. Современные алгоритмы способны анализировать тысячи характеристик сигнала, включая закономерности, которые трудно заметить на слух.
Как проводилось исследование
В основную когорту вошли 811 пациентов с депрессией и 845 участников без депрессивных симптомов. Восемьдесят процентов данных использовали для разработки модели, остальные 333 случая – для внутренней проверки. Независимая внешняя выборка включала 80 пациентов с БДР и 80 участников без депрессии из других клинических центров и периодов набора.
Каждый участник предоставлял 13 записей. В одних заданиях нужно было читать стандартизированный текст, в других – спонтанно говорить о личном опыте и эмоциональном состоянии. Использовали положительные, нейтральные и отрицательные стимулы. Записи делали в обычных условиях на телефоны и планшеты, включая кабинеты, амбулаторные зоны и домашнюю среду.
Диагноз у пациентов устанавливали психиатры по критериям DSM-IV с применением структурированного диагностического интервью MINI. Участников контрольной группы набирали по интернет-объявлениям; они должны были иметь менее 10 баллов по опроснику депрессивного состояния PHQ-9.
Что именно анализировала модель
Сначала авторы построили традиционную модель CatBoost на 6373 признаках, извлечённых openSMILE. Они описывали спектр, высоту и интенсивность голоса, просодию, вокализацию и временную структуру речи. Во всех трёх наборах данных 26 признаков устойчиво различали группы по эмоциональному состоянию.
Некоторые из тех же характеристик заметно различались у мужчин и женщин. Поэтому пол мог смешивать связь между голосом и депрессией. В основной архитектуре авторы добавили отдельные эмбеддинги пола и состязательное обучение, призванное уменьшить зависимость прогноза от индивидуальных особенностей говорящего.
Главная модель использовала Whisper-large-v2. Это предварительно обученная система, которая преобразует необработанную речь в многомерные представления. На следующем этапе transformer-классификатор искал в них паралингвистические сигналы, связанные с депрессией.
Насколько точным оказался алгоритм
Модель, использовавшая только возраст и пол, достигла AUC 0,647 при внутренней и 0,711 при внешней проверке. Традиционная CatBoost-openSMILE работала лучше, но уступала Whisper-Emb. Внутренняя AUC основной модели составила 0,932, внешняя – 0,879. Во внешней выборке чувствительность достигла 82,5%, специфичность – 83,8%.
AUC показывает, насколько хорошо модель в целом разделяет два класса при разных порогах. Значение 0,5 соответствует случайному различению, 1,0 – идеальному. Снижение AUC во внешней выборке ожидаемо важно: независимые данные лучше показывают, сохранится ли эффективность за пределами материала, на котором модель разрабатывали.
Whisper-Emb сохранила преимущество перед WavLM-Emb и HuBERT-Emb. Анализ калибровки также показал, что прогнозируемые вероятности достаточно хорошо соответствовали наблюдаемым результатам. Это поддерживает возможность скринингового применения, но ещё не подтверждает готовность к самостоятельной диагностике.
Сколько речи достаточно
Эффективность возрастала по мере увеличения длительности записи и начинала выходить на плато после 80 секунд. По интерпретации авторов, более длинный фрагмент позволяет устойчивее уловить замедление речи и другие проявления психомоторной заторможенности.
Формат задания влиял меньше. Открытые вопросы повышали чувствительность, но снижали специфичность по сравнению с закрытыми; AUC оставалась сходной. Положительная, нейтральная или отрицательная эмоциональная окраска стимулов тоже не давала статистически значимого различия эффективности.
Может ли голос отражать тяжесть депрессии
Во внешней выборке прогноз модели умеренно коррелировал с оценкой по Шкале депрессии Гамильтона: r = 0,662. Связь была сильнее с заполняемыми клиницистом HAMD и HAMA, чем с PHQ-9 и шкалой самодетерминации SDS.
Этот результат нельзя напрямую понимать как точное восстановление балла клинической шкалы. Выход модели находился в диапазоне от 0 до 1, тогда как HAMD – от 0 до 52; средняя абсолютная ошибка составила около 10,7 балла. Речь пока лучше рассматривать как источник дополнительного сигнала, а не как замену оценке симптомов.
Что модель могла “услышать”
Интерпретация традиционной модели указала на менее выраженную артикуляцию, меньшую энергию, более монотонную или нерегулярную просодию, вариабельность вокализации и замедленный темп. Авторы связывают эти паттерны с психомоторной заторможенностью, то есть замедлением двигательной и когнитивной активности при депрессии.
Преимущество Whisper они объясняют масштабным предварительным обучением на разнообразной речи. Такая модель способна извлекать сложные сочетания признаков без их полного ручного задания и поэтому может лучше переноситься между выборками.
Сильные стороны и ограничения
К сильным сторонам относятся крупная речевая база, независимая внешняя валидация и сбор данных в обычных условиях на разных устройствах. Диагностические метки у пациентов опирались на оценку психиатров и структурированное интервью, а не исключительно на самоопросник.
Вместе с тем разнообразие участников остаётся недостаточным для уверенного переноса на другие языковые и культурные группы. Контрольную группу определяли по отсутствию выраженных симптомов, тогда как основная клиническая группа состояла из пациентов с активным БДР. Алгоритм ещё предстоит проверить при биполярной депрессии, тревожных, психотических и других расстройствах, способных менять речь.
Поперечный дизайн не позволяет понять, исчезают ли голосовые признаки после улучшения состояния. Они могут быть маркерами текущего эпизода или более устойчивой индивидуальной особенностью. Кроме того, голос и сведения о психическом здоровье относятся к чувствительным данным, поэтому практическому применению должны предшествовать строгие решения по защите приватности.
Что это значит на практике
Работа показывает, что короткая запись на обычном мобильном устройстве может содержать достаточно информации для предварительного выделения людей с вероятной депрессией. Наиболее реалистичная роль такого инструмента – поддержка скрининга и решение о направлении на дальнейшую оценку.
До клинического внедрения необходимо подтвердить эффективность на более разнообразных выборках, сравнить БДР с другими психическими расстройствами и проследить изменения речи на фоне лечения и ремиссии. Поэтому речь идёт о перспективном вспомогательном биомаркере, а не об автоматическом диагнозе по голосу.
Перевод: Рерих Е. С.
Источник: Lin, Y., Liyanage, B.N., Shi, C. et al. Speech as a biomarker for supported diagnosis of major depressive disorder using self-supervised representations. Nat Commun 17, 7886 (2026). https://doi.org/10.1038/s41467-026-74122-9