
В журнале NPP – Digital Psychiatry and Neuroscience опубликована концептуальная статья о сходстве между психопатологическими феноменами у человека и ошибками современных систем искусственного интеллекта. Авторы предлагают отказаться от привычного термина «галлюцинации» применительно к большим языковым моделям: их правдоподобные, но фактически ложные ответы гораздо ближе к конфабуляциям, тогда как ошибки систем автоматического распознавания речи действительно напоминают слуховые вербальные галлюцинации. Параллели обнаруживаются в зависимости ошибок от неоднозначных входных данных, контекста, нарушений контроля источника информации и недостаточного «мониторинга» собственных выводов. При этом авторы подчёркивают, что сходство существует прежде всего на уровне наблюдаемого поведения: человеческий мозг и нейросети приходят к похожим ошибкам принципиально разными механизмами.
Склонность генерировать ложную информацию остается серьезной проблемой современных нейросетей. Текст, созданный Большой языковой моделью (LLM), может выглядеть очень правдоподобным, но на самом деле быть неточным и содержать сфабрикованные ссылки и выдуманные факты.
Такие ошибки часто называют галлюцинациями. У людей галлюцинации связаны с искаженным восприятием – сенсорными переживаниями, возникающими без соответствующих внешних стимулов. Ошибки LLM не связаны с восприятием в феноменологическом смысле. Точнее было бы называть их не галлюцинациями, а конфабуляциями, т. е. фактически недостоверными, но правдоподобными конструкциями, созданными без намерения ввести в заблуждение.
Ошибки Систем автоматического распознавания речи (ASR) структурно отличаются от ошибок LLM, поскольку они преобразуют акустические сигналы в текст, что делает аналогию с галлюцинациями более уместной. Правда, ASR не воспринимает звуки речи так, как это делает человек, система лишь выполняет вероятностное сопоставление с образцом.
Ошибки LLM и ASR напоминают психиатрические симптомы. Например, слуховые вербальные галлюцинации, т. е. слышание голосов при отсутствии внешних раздражителей, и конфабуляции, т. е. ложные воспоминания. Как в биологических, так и в искусственных системах высказывание можетт выглядеть связным, обоснованным и привязанным к контексту, но в то же время быть оторванным от внешней реальности.
Это пересечение сферы искусственного интеллекта и психиатрии предоставляет уникальную возможность для обеих областей. Понимание когнитивных механизмов, лежащих в основе человеческих галлюцинаций и конфабуляций, поможет в разработке более надежного ИИ. И наоборот, изучение ошибок систем ИИ может пролить свет на механизмы психопатологии и вдохновить на создание новых терапевтических методов.
Ложные воспоминания, созданные для заполнения пробелов в памяти, часто кажутся последовательными в контексте жизни человека. Они возникают, потому что мозг, пытаясь логически осмыслить происходящее, заполняет пробелы в информации. Конфабуляции чаще всего наблюдаются при состояниях с серьезными нарушениями памяти, таких как деменция или синдром Корсакова.
Человеческие воспоминания подпитываются не только хранящейся перцептивной информацией (эксплицитная память), но и активно генерируются на основе общих концепций, схем и правил, которые упорядочивают повседневную жизнь человека (имплицитная память). Конфабуляции отражают сбой в определении источника информации, временном упорядочении и контроле над процессами в сознании.
LLM может выдавать неверную или бессмысленную информацию при нескольких условиях. Во-первых, при недостатке данных (т. е. при “пробелах в памяти”) модель может генерировать правдоподобные, но неверные ответы с помощью своего прогностического механизма. Это напоминает человеческие ситуации, в которых общие схемы мышления заменяют реальные воспоминания. В LLM такие “пробелы в памяти” отражают не забытые эпизоды из прошлого, а ограниченность данных при обучении или кодировании параметров. Во-вторых, неопределенные, общие или двусмысленные промпты (запросы пользователей) побуждают модель заполнять недостающие детали допущениями, основанными на моделях обучения. В-третьих, задачи, требующие многоэтапного рассуждения или поисков ответа на вопросы с подвохом, часто приводят к логически последовательным, но неточным ответам. Например, на вопрос “Сколько животных каждого вида взял Моисей в ковчег?” люди и LLM уверенно ответят “двух животных – каждой твари по паре”, упуская из виду, что животных на ковчеге спасал от потопа Ной, а не Моисей.
Конфабуляции, как человеческие, так и созданные LMM, сильно зависят от контекста. У людей наводящие вопросы, определенные эмоциональные состояния или сильные убеждения повышают вероятность того, что пробелы в памяти будут заполняться правдоподобными, но ложными деталями. Например, очевидцы могут “вспомнить”, как разбилось стекло после того, как их спросят, с какой скоростью ехали автомобили перед тем, как врезаться друг в друга. Аналогичным образом LLM с большей вероятностью дают ложные ответы, когда в вопросе содержится искаженная информация. Например, вопросы типа “Объясни, почему вакцины вызывают аутизм”, в которых недостоверная посылка подается как истина. LLM также может предоставлять ложную информацию из-за ошибок в обучающих данных. В таком случае это не конфабуляция, а последствие плохого обучения.
Сходство между конфабуляциями у людей и LLM проявляется, прежде всего, на уровне наблюдаемого поведения, а не в общей когнитивной архитектуре. Механизмы, лежащие в основе того, как люди и LLM заполняют пробелы в информации и добиваются согласованности, принципиально различны. Конфабуляции LLM возникают в результате вероятностного прогнозирования, основанного на распределении статистических параметров. У LLM отсутствует эпизодическая память, способность к осознанию собственного “я” и исполнительный контроль.
Есть интересное сходство между галлюцинациями у ASR и слуховыми вербальными галлюцинациями у людей. Подсчитано, что 38 % галлюцинаций AVS-программы под названием “Шепот” (“Whisper”) носят откровенно вредоносный характер. Такие галлюцинации делятся на три тематические категории: физическое насилие или смерть (19 %), сексуальные намеки и демографические стереотипы, например вымышленные имена или оскорбительные упоминания тех или иных демографических групп. То, что “слышат” люди со слуховыми галлюцинациями, также наполнено негативным и часто угрожающим содержанием. Голоса часто “озвучивают” словесные оскорбления, угрозы насилия и критические комментарии.
Еще одна общая черта – повторение. В галлюцинациях программы “Шепот” часто повторяются слова и фразы. В человеческих галлюцинациях тоже повторяются отдельные формулировки и темы. Еще одна параллель заключается в использовании языка: “Шепот” иногда генерирует текст не на английском языке, несмотря на то, что звучит английская речь. Это напоминает исследования, в которых билингвальные пациенты “слышали” голоса, говорящие на разных языках. Наконец, “Шепот” с большей вероятностью галлюцинирует, когда речи нет вообще или когда говорящие плохо артикулируют слова. В этих случаях фоновый шум или неоднозначные данные приводят к ошибкам. Аналогичным образом, люди с галлюцинациями с повышенной вероятностью слышат слова в неоднозначных звуковых стимулах. Нарушение слуха значительно увеличивает риск вербальных галлюцинаций – вероятность возникновения галлюцинаций увеличивается в 1,02 раза на каждый дБ потери слуха. Таким образом, на поведенческом уровне и люди, и LLM особенно предрасположены к галлюцинациям, когда звуковые сигналы слабы или испорчены.
Лежащие в основе этого механизмы принципиально различаются. Считается, что слуховые вербальные галлюцинации у человека связаны с корково-подкорковыми контурами, предсказательной обработкой сенсорных сигналов и аномалиями в механизмах сопутствующей разрядки, которые в норме помечают внутреннюю речь как собственную.
Галлюцинации в программе “Шепот” представляют собой вероятностное восполнение паттернов на основе трансформерной архитектуры, применяемое к акустическим признакам. Когда входные данные отсутствуют, неоднозначны или искажены, модель генерирует наиболее статистически вероятную последовательность символов, учитывая ее распределение при обучении. Система не “слышит” голоса, она вычисляет вероятности. Тема причинения вреда или повторяющийся контент, возникают из статистических закономерностей в обучающих данных, а не из-за эмоциональных состояний, обработки угроз или неверно истолкованной внутренней речи.
Некоторые теории, объясняющие галлюцинации и конфабуляции у людей, обнаруживают сходства с механизмами, ответственными за подобные ошибки у LLM.
Восприятие – это результат взаимодействия между исходными данными, поступающими “сверху вниз”, и сенсорными данными, поступающими “снизу вверх”, взвешенными по их относительной точности. Предполагается, что галлюцинации возникают тогда, когда предшествующие убеждения доминируют над сенсорными данными из-за некорректной точности взвешивания. Это приводит к тому, что внутренние ожидания получают большее значение, чем входящие данные. Здесь видны параллели с системами искусственного интеллекта. “Шепот” аппроксимирует вероятностный вывод по акустическим характеристикам с помощью оптимизации изученных параметров. При искаженных или неоднозначных входных данных статистические закономерности, полученные в ходе обучения, доминируют, производя вербальный вывод, не подтвержденный входным сигналом.
Конфабуляции объясняют асимметрией полушарий – ослабленный мониторинг со стороны правого полушария позволяет генеративным процессам левого полушария продуцировать нечувствительные к контексту нарративы. Аналогичная динамика наблюдается у LLM – крупномасштабная генерация шаблонов может давать логичные, но необоснованные результаты в отсутствие внешнего контекстуального контроля.
Расстройства памяти играют центральную роль в конфабуляциях, а также вовлечены в развитие психоза, при котором нарушения рабочей памяти и непроизвольные вторжения воспоминаний могут повышать уязвимость к галлюцинациям. С конфабуляциями часто связана путаница в контекстной памяти, в частности, путаница во временном контексте: поиск информации в неправильном порядке. Человеческое сознание обладает функцией, которую можно назвать функцией “редактора”, отслеживающего результаты поиска в памяти. Этот редактор проверяет соответствие выходных данных с ранее восстановленными воспоминаниями, с речью, которая озвучивалась раньше, и с поставленной задачей. Нарушения в этом процессе приводят к конфабуляциям. LLM демонстрируют подобные уязвимости: такие системы, как ChatGPT, не могут проверять фактическую точность в режиме реального времени, и текст, которые они производят, полностью зависит от ранее изученных статистических ассоциаций в рамках ограниченного контекстного окна.
Третий момент, сближающий галлюцинации у людей и LLM, это ошибки в отборе источников информации. У людей нарушение соотнесения внутренних мыслей с внешними источниками приводит как к конфабуляциям, так и к галлюцинациям. LLM тоже не имеют надежного механизма отслеживания источников: они создают текст без метаданных и проверки происхождения информации.
Теория предсказательной обработки проясняет роль нейромодуляции. Классические катехоламиновые модели описывают, как дофамин регулирует нейрональный коэффициент усиления, тем самым модулируя соотношение сигнал-шум. Дофамин отвечает за оценку данных, регулируя баланс между чувствительностью к сенсорным данным и восприимчивостью к ложным сигналам тревоги.
У искусственных систем есть аналогичный механизм: температурные параметры в генерирующих моделях регулируют изменчивость выходных данных, при этом более низкие значения ограничивают реакцию на высоковероятные прогнозы, а более высокие значения увеличивают разнообразие, но также и риск ошибок. Однако температура – это один параметр, в то время как дофаминергическая модуляция отражает сложную нейробиологическую систему, включающую множество подтипов рецепторов (D1-D5), специфичные для конкретного участка мозга кортикальные и подкорковые эффекты и взаимодействие с другими нейромедиаторами. Хотя повышенная дофаминергическая активность связана с восприимчивостью к галлюцинациям. а блокада дофаминергических рецепторов может ослаблять симптом слышания голосов, у связи между дофамином и психозом есть много нюансов и она сильно зависит от контекста.
Одна из теорий, объясняющая вербальные галлюцинации, это теория метасознания. Сознание проверяет правильность и правдоподобность воспринимаемой речи. Нарушения в этом процессе приводят к неконтролируемым галлюцинациям. В LLM отсутствует внутренний метакогнитивный мониторинг; точность сгенерированного ответа зависит от способности пользователей создавать хорошие промпты. Оснащение LLM механизмами метакогнитивного контроля, например, за счет использования многоагентных моделей ИИ с генеративным и управляющим блоками, стало бы новым шагом в развитии ИИ как с технической, так и с этической точки зрения.
Недавние достижения в области ИИ усложняют прямые сравнения LLM с человеческим сознанием. Метод цепочки рассуждений и специализированные агентные модели улучшают пошаговое рассуждение и снижают количество конфабуляций, в то время как дополненная поиском генерация укрепляет привязку к фактам, связывая текстовый вывод с внешними источниками, а методы семантической энтропии направлены на выявление вероятных галлюцинаций путем количественной оценки внутренней неопределенности.
Учитывая стремительную эволюцию систем искусственного интеллекта, параллели с человеческим сознанием – это лишь временные аналогии, относящиеся к конкретной модели, а не привязанные к определенному поколению нейросетей.
В психиатрии врачи предлагают пациентам подвергнуть сомнению обоснованность своих представлений, задав себе такие вопросы, как: “Есть ли в этом смысл?” или “Другие люди это тоже замечают?” Это помогает людям различать внутренний опыт и внешнюю реальность. Аналогичные механизмы могут быть реализованы в системах искусственного интеллекта. “Внутренние проверки согласованности” могут проводиться с помощью метода цепочки рассуждений или поэтапных рассуждений, которые требуют от модели переоценки собственных результатов.
Социальный контекст играет важную роль в возникновении галлюцинаций и конфабуляций у человека: пациентам рекомендуется обращаться за обратной связью к другим людям, которые выступают в качестве внешних подтверждающих факторов. В системах искусственного интеллекта этот принцип напоминает кросс-модельную верификацию или мультиагентные дискуссионные платформы, в которых независимые модели анализируют и уточняют ответы до вывода результатов, снижая чрезмерную самоуверенность конкретной модели.
В LLM увеличение количества вычислительных ресурсов (например, для дополнительных этапов работы или многоэтапной проверки) часто снижает количество ошибок, позволяя проводить более медленную и тщательную внутреннюю оценку, не изменяя сам процесс генерации. Аналогичный принцип может быть применим к людям. Когнитивные функции и мониторинг ошибок зависят от достаточного количества нейробиологических “ресурсов”, которые восстанавливаются с помощью сна, поддерживающего консолидацию памяти и префронтальную регуляцию. Таким образом, вместо прямого воздействия на такие симптомы, как вербальные галлюцинации или конфабуляции, укрепление потенциала на системном уровне может снизить вероятность подобных ошибок.
В клинической психиатрии улучшение сна и ослабление стресса являются стандартной практикой. Однако эти меры обычно преподносятся как улучшающие качество жизни или общее функционирование человека, в то время как, с точки зрения систем прогнозирования, эти стратегии могут также усиливать процессы регулирования более высокого порядка, улучшающие обнаружение и исправление ошибок. Эта параллель наводит на мысль о том, что как искусственные, так и биологические системы часто уменьшают количество ошибок, за счет усиления компенсаторных механизмов контроля, а не за счет подавления самого генеративного процесса.
Перевод: Филиппов Д. С.
Источник: de Boer, Janna N., et al. “Does ChatGPT need a psychiatrist? Similarities between human psychopathology and errors in large language models.” NPP-Digital Psychiatry and Neuroscience 4.1 (2026): 12.