Новости


В журнале Frontiers in Psychiatry опубликовано крупное международное исследование надёжности психиатрической диагностики. 1038 врачей из 19 стран оценивали одинаковые клинические случаи и выбирали диагноз по МКБ-10. Общая межэкспертная согласованность оказалась умеренной: два врача ставили один и тот же диагноз примерно в 55 % случаев, а совпадение с заранее определённым экспертным диагнозом составляло 66 %. Особенно большие расхождения возникали при расстройствах шизофренического спектра, тогда как биполярное расстройство, депрессия и обсессивно-компульсивное расстройство распознавались значительно стабильнее. Опыт работы и профессиональный статус врача почти не влияли на согласованность.


Вопрос о воспроизводимости психиатрических диагнозов далеко не новый. В 1970-е годы знаменитый американо-британский диагностический проект показал существенные различия между психиатрами двух стран: американские специалисты значительно чаще диагностировали шизофрению, тогда как британские – аффективные расстройства. Эти и другие исследования того периода поставили под сомнение способность разных врачей одинаково классифицировать одни и те же клинические состояния.

 

Одним из ответов стала «операциональная революция» в психиатрии. DSM-III и последующие классификации ввели формализованные критерии и правила, которые должны были повысить воспроизводимость диагностики. Однако позднейшие исследования, включая полевые испытания DSM-5, вновь продемонстрировали сравнительно низкую согласованность для ряда расстройств. Авторы новой работы решили проверить, насколько надёжной остаётся психиатрическая диагностика в XXI веке в большой международной выборке врачей.

 

Как проводилось исследование

 

В исследовании участвовали 1038 врачей, работающих во взрослой психиатрии, из 19 стран Европы и Южной Америки. Среди них было 639 психиатров, 282 врача-резидента по психиатрии и 117 других врачей, работающих в психиатрической службе. Почти треть участников имели не более четырёх лет клинического опыта, ещё около трети – более 15 лет.

 

Каждому участнику случайным образом предоставляли два из девяти письменных клинических случаев. В общей сложности врачи вынесли 1902 диагностических решения. Все случаи содержали достаточную информацию для постановки диагноза по МКБ-10, а список возможных ответов был ограничен 30 наиболее распространёнными психическими расстройствами.

 

Среди девяти случаев были три варианта шизофрении, один случай шизотипического расстройства, а также по одному случаю биполярного расстройства, депрессивного эпизода, генерализованного тревожного расстройства, обсессивно-компульсивного расстройства и эмоционально неустойчивого расстройства личности. Два случая были взяты из официального клинического руководства по МКБ-10, остальные разработали авторы исследования вместе с экспертами.

 

Для каждого случая заранее определяли наиболее вероятный экспертный диагноз. При этом авторы специально подчёркивают, что этот диагноз использовался лишь как клиническая точка сравнения, а основной показатель исследования – межэкспертная согласованность – рассчитывался независимо от него.

 

Врачи совпадали примерно в половине случаев

 

Общая межэкспертная надёжность составила α Криппендорфа 0,48 при 95 % доверительном интервале 0,46–0,51. По используемым авторами критериям это соответствует низкой согласованности.

 

Если перевести статистический показатель в более понятную форму, вероятность того, что два врача независимо выберут один и тот же диагноз для одного и того же клинического случая, составила примерно 55 %. Эмпирический расчёт дал практически идентичный результат – 55,3 %. Среднее совпадение с заранее определённым экспертным диагнозом составило 66 %. Однако этот показатель очень сильно зависел от конкретного заболевания.

 

Шизофрения оказалась самым сложным диагнозом

 

Самые большие диагностические расхождения наблюдались в случаях расстройств шизофренического спектра. Для трёх случаев шизофрении совпадение с экспертным диагнозом составляло всего 37 %, 43 % и 54 %, а для шизотипического расстройства – 38 %.

 

Особенно показательным оказался первый случай. 41 % врачей диагностировали обсессивно-компульсивное расстройство, а 37 % – шизофрению. Во втором случае 45 % выбрали расстройство личности и 43 % – шизофрению. В третьем 54 % диагностировали шизофрению, тогда как 25 % сочли клиническую картину биполярным расстройством.

 

При шизотипическом расстройстве разброс оказался ещё шире: 38 % врачей выбрали шизотипическое расстройство, 21 % – расстройство аутистического спектра, 13 % – шизофрению, 10 % – депрессивное расстройство и 8 % – обсессивно-компульсивное расстройство. Именно этот случай продемонстрировал максимальную диагностическую вариабельность среди всех девяти виньеток.

 

Аффективные расстройства и ОКР распознавались лучше

 

В более типичных клинических случаях согласованность была значительно выше. Биполярное расстройство правильно определили 94 % врачей, депрессивное расстройство – 88 %, обсессивно-компульсивное расстройство – 92 %. Для тревожного расстройства совпадение составляло 73 %, для расстройства личности – 72 %.

 

При этом интересная деталь заключалась в том, что те же диагнозы, которые врачи хорошо распознавали в типичных случаях, часто ошибочно выбирались в более сложных ситуациях. Например, обсессивно-компульсивное расстройство, биполярное расстройство и расстройства личности становились частыми альтернативными диагнозами при случаях шизофренического спектра.

 

Расхождения оказались систематическими

 

Авторы подчёркивают, что диагностические ошибки распределялись совсем не случайно. Врачи, по-видимому, по-разному оценивали значимость отдельных симптомов и использовали разные клинические модели при интерпретации одной и той же информации.

 

Например, специалист мог сосредоточиться на ярко выраженных обсессивных симптомах и придать им большее диагностическое значение, чем психотическим проявлениям. В результате один врач видел прежде всего обсессивно-компульсивное расстройство, другой – шизофрению.

 

Проблема особенно заметна в клинических картинах, где одновременно присутствуют симптомы нескольких доменов. Формальная иерархия МКБ-10 предполагает, что некоторые более высокие по диагностической иерархии расстройства должны иметь приоритет, однако этот принцип применялся врачами непоследовательно.

 

Поэтому авторы предлагают говорить скорее о структурированном диагностическом расхождении, чем о случайной ошибке. Разные специалисты получают одинаковую информацию, однако организуют её в разные диагностические конструкции.

 

Большой опыт не решил проблему

 

Можно было бы ожидать, что опытные психиатры будут значительно чаще совпадать между собой. Исследование этого не подтвердило. У специалистов-психиатров показатель согласованности составил 0,50, у резидентов – 0,45, у других врачей, работающих в психиатрии, – также 0,45. Различия статистически значимыми не были.

 

Согласованность также практически не менялась при разделении врачей по стажу: менее пяти лет, 5–9 лет, 10–14 лет и 15 лет и более. Следовательно, обнаруженные диагностические расхождения нельзя просто объяснить недостатком клинического опыта.

 

Почему результаты выглядят особенно тревожно

 

В реальной клинической практике один пациент может по-разному описывать симптомы двум специалистам, врачи задают разные вопросы, обращают внимание на разные детали и располагают неодинаковым объёмом информации. В этом исследовании таких источников вариабельности практически не было. Все участники читали одинаковое заранее подготовленное описание, содержащее информацию, которую авторы считали достаточной для диагностики.

 

Более того, число возможных диагнозов было ограничено тридцатью распространёнными категориями, а часть близких диагнозов исследователи объединяли в более широкие группы. Оба решения должны были скорее повышать, чем снижать согласованность. Поэтому авторы допускают, что полученные показатели могут представлять относительно благоприятную оценку воспроизводимости психиатрической диагностики. В обычной клинической практике согласованность потенциально может быть ещё ниже.

 

Вернули ли DSM и МКБ психиатрии надёжность?

 

Авторы осторожно сравнивают свои результаты с историческими исследованиями. В полевых испытаниях DSM-III общий коэффициент каппа составлял около 0,72 для расстройств первой оси и 0,64 для второй оси. В новом исследовании общий показатель составил 0,48, хотя прямое количественное сравнение ограничено различиями дизайна и статистических методов.

 

Примечательно, что и полевые испытания DSM-5 показали относительно низкую воспроизводимость ряда диагнозов. Например, коэффициент каппа составлял 0,46 для шизофрении, 0,56 для биполярного расстройства I типа и всего 0,20 для генерализованного тревожного расстройства.

 

Авторы поэтому приходят к достаточно жёсткому выводу: спустя десятилетия после введения операциональных критериев проблема надёжности психиатрической диагностики остаётся нерешённой. Одного дальнейшего уточнения формальных диагностических критериев может оказаться недостаточно.

Что это означает для клинической практики

 

Диагностическая согласованность имеет вполне практические последствия. Если разные специалисты систематически относят одну и ту же клиническую картину к разным расстройствам, могут различаться выбор терапии, прогноз, рекомендации пациенту и интерпретация последующего течения заболевания.

 

Исследование также подчёркивает значение подробной оценки психопатологии. Проблема возникает не только на уровне формальных критериев МКБ, но и раньше – когда врач решает, какие симптомы являются центральными, какие вторичными и как соотнести их между собой.

 

Особенно важной эта задача выглядит при сложных психотических состояниях, где обсессивные, аффективные, личностные и психотические феномены могут присутствовать одновременно.

 

Последствия для исследований

 

Проблема выходит далеко за пределы индивидуального пациента. Научные исследования обычно предполагают, что люди с одним диагнозом образуют относительно однородную группу.

 

Если одна и та же клиническая картина в разных центрах классифицируется по-разному, выборки исследований могут оказаться гораздо менее однородными, чем предполагается. Это способно затруднять поиск специфических биологических механизмов, ухудшать воспроизводимость исследований и размывать эффекты лечения.

 

Авторы связывают эту проблему и с растущим интересом к трансдиагностическим подходам, которые изучают отдельные симптомы, функции или механизмы вне жёстких границ традиционных категорий.

 

Ограничения

 

Главное ограничение исследования – использование письменных клинических случаев. Они не позволяют врачу задать дополнительные вопросы, уточнить временную последовательность симптомов, наблюдать поведение пациента, его речь и аффект. Поэтому такой формат не полностью воспроизводит настоящую психиатрическую диагностику.

 

Одновременно письменные случаи обеспечивают гораздо большую стандартизацию: каждый врач получает абсолютно одинаковую информацию. Это делает дизайн особенно подходящим именно для изучения межэкспертной согласованности.

 

Другим ограничением был добровольный набор врачей через профессиональные сети. Точную долю ответивших определить невозможно, а специалисты, заинтересованные в психопатологии и диагностике, могли участвовать чаще других. Участники также были неравномерно распределены между странами.

 

Наконец, использование только 30 диагностических вариантов и объединение некоторых диагнозов в крупные категории могло искусственно повысить согласованность.

 

Почему это важно

 

Спустя почти полвека после введения операциональных критериев психиатрическая диагностика остаётся существенно зависимой от того, как именно врач интерпретирует психопатологическую картину. В стандартизированных условиях два специалиста соглашались примерно в половине случаев, причём опыт работы почти не менял этот показатель. Самые большие трудности возникали в диагностике расстройств шизофренического спектра.

 

Работа показывает, что дальнейшее совершенствование психиатрической диагностики требует внимания к качеству оценки психопатологии, диагностическому мышлению и тому, как врачи определяют относительную значимость разных симптомов. Уточнение формальных критериев само по себе, судя по этим данным, проблему высокой диагностической вариабельности пока не решило.

 


Перевод: Жоров Е. Н.

 

Источник: Boberg M., Henriksen M. G., Berge J., et al. Reliability of psychiatric diagnoses in the 21st century. Frontiers in Psychiatry. 2026;17:1891625. doi:10.3389/fpsyt.2026.1891625. Опубликовано 29 июля 2026 года.