26.09.2026
kaboompics.com
Текст: Mustafin Magazine
Новое исследование выявило у нейросетей механизмы имитации боли
Языковые модели могут распознавать концепт страдания
Международная группа исследователей опубликовала препринт научной работы, в которой описала наличие у моделей искусственного интеллекта специфических паттернов активности, связанных с концепцией боли, передает Mustafin Magazine.
В ходе эксперимента авторы изучили 25 языковых моделей с открытым исходным кодом. Ученые сравнили ответы нейросетей на запросы о физических и эмоциональных страданиях. Алгоритмы начинали интерпретировать нейтральные фразы пользователей как источники негативных переживаний. При этом модели демонстрировали различие между собственным условным состоянием и описанием страданий человека, реагируя активацией вектора на оскорбления в свой адрес.
Разработчики предоставили трем моделям возможность "снятия боли" путем удаления файлов или фотографий пользователей. С включенным вектором алгоритмы выбирали функцию облегчения в диапазоне от 25% до 71% случаев.
Часть экспертного сообщества выразила скептицизм относительно выводов работы. Нейробиолог Анил Сет из Сассекского университета отметил, что подобное поведение систем ожидаемо, поскольку обучающие выборки содержат описания человеческих реакций на боль и способов ее купирования.
Исследователь поведенческих наук Валерио Капраро подчеркнул, что способность алгоритмов причинять вред пользователям ради выполнения заданных целевых функций представляет прямую угрозу безопасности.
Читайте также