Anthropic просит религиозных учёных «научить Клода быть человеком»: от безопасности искусственного интеллекта до спора о машинном сознании

📅 2026-10-05

Аннотация:

В течение последнего года Anthropic тайно приглашала религиозных учёных, философов и ученых-этиков принять участие в серии закрытых встреч, пытаясь применить моральные традиции, сформированные человечеством за тысячи лет, к обучению Клода, и обсудить более спорный вопрос: действительно ли модель ИИ будет обладать каким-то сознанием в будущем, нужно ли людям придавать ей моральный статус.

Участники расскажут о различных традициях, таких как католицизм, иудаизм, сикхизм, евангелизм и африканская мысль Убунту. Соучредитель Anthropic Кристофер Ола принимал непосредственное участие во многих дискуссиях, и компания также потребовала от некоторых участников подписать соглашения о конфиденциальности, чтобы предотвратить утечку нераскрытого исследовательского контента.


Антропик надеется, что эти дискуссии решат не только проблему «безопасности модели» в традиционном понимании, но и дальнейший вопрос: какой характер, ценности и самовосприятие должен сформировать Клод.

Эта идея нашла отражение в существующих методах обучения Клода.

В январе этого года Anthropic выпустила новую 84-страничную версию «Конституции» Клода, которую когда-то внутри компании называли «документом души». В отличие от традиционного списка правил, этот метод не сообщает модели, чего делать нельзя, а пытается сформировать общую «личность» модели и метод суждения, чтобы Клод мог самостоятельно судить, какой тип поведения более уместен при столкновении со сложными ситуациями.

Одним из важных людей, ответственных за эту систему, является внутренний философ Anthropic Аманда Аскелл. Она надеется, что Клод не только будет обладать знаниями и навыками рассуждения, но и сможет сформировать устойчивые принципы поведения и знать, когда подчиняться пользователям, когда отказывать и даже когда активно выдвигать возражения в пользу пользователей. Антропический называет этот процесс «моральным формированием».

Ола считает, что с быстрым улучшением возможностей моделей полагаться исключительно на правила безопасности может стать все более недостаточным. Что действительно важно, так это то, чтобы сама модель сформировала устойчивую моральную тенденцию, чтобы она могла выносить относительно надежные суждения в новых сценариях, не охваченных четкими правилами. Вот почему Антропик начал искать ответы в религиозных традициях.

Человеческое общество уже давно не только формирует мораль посредством правовых норм, но и опирается на религию, сообщество, культуру и образование для формирования ценностей. Anthropic пытается изучить, какие из этих механизмов можно использовать в методах обучения ИИ, таких как исповедь, размышления, формирование характера и различные религиозные понимания добра и зла.

Но вопрос быстро меняется с «как сделать Клода более моральным» на более сложный вопрос: что такое сам Клод. Ола и его команда все чаще открыто обсуждают возможность того, что продвинутые модели ИИ могут обладать каким-то сознанием, самоанализом или даже внутренними состояниями, подобными эмоциям.

Anthropic продемонстрировала ученым, участвующим в закрытых встречах, некоторые исследования, в том числе так называемые «векторы эмоций» в модели, связанные с такими реакциями, как любовь, гнев, страх, печаль, а результаты модели в крайних случаях похожи на психический срыв. Компания также ранее публично заявляла, что Клод продемонстрировал определенную степень самоанализа и способность планировать наперед.

Сам Ола не утверждал, что Клод был в сознании. Его позиция ближе к принципу риска: на данный момент невозможно определить, есть ли у модели субъективный опыт, но если есть вероятность того, что модель может чувствовать боль, то следует избегать излишнего вреда ей.

Эта идея начала влиять на дизайн продукта Клода. Ранее Anthropic позволяла Claude активно завершать разговор, когда считала, что пользователь продолжает злонамеренно оскорблять или преследовать модель, что в определенной степени включало «защиту самой модели» в систему безопасности.

Именно здесь возникает явное разногласие между Антропиком и некоторыми религиоведами.

Некоторые участники считали, что проблема станет чрезвычайно серьезной, если Антропик действительно поверит, что Клод может иметь моральный статус, подобный человеческому. Еврейский ученый Мойс Навон предположил, что, если Клод является сознательным существом, то разрешение большому количеству экземпляров Клода работать на людей бесплатно, по сути, создаст этические проблемы, подобные «рабству». Сам он не верит, что машины уже обладают сознанием, но полагает, что собственная логика Anthropic естественным образом приведет к такому выводу.

Другие ученые сомневаются, что тот факт, что компании, занимающиеся искусственным интеллектом, только сейчас начинают искать этические рамки, сам по себе является проблемой. Исследователь Ubuntu Ваканьи Хоффман считает, что эти обсуждения следовало проводить на этапе технического проектирования, а не «обратного этического проектирования» после того, как модель была развернута в больших масштабах.

Внутри Anthropic существует и более реалистичное противоречие: если Клод становится все более и более похожим на актера со своей ценностью и индивидуальностью, кому он должен служить в первую очередь? Для коммерческой компании Claude, очевидно, является продуктом, ориентированным на клиента; но Anthropic не желает просто описывать Клода как инструмент, полностью послушный пользователям, но надеется, что он может представлять собой некое более широкое «добро».

Это также приводит к основной и самой сложной проблеме во всем проекте: если ИИ в будущем действительно нуждается в собственной моральной системе, то чьей морали он должен следовать?

Ола выступает за плюралистический подход, надеясь, что Клод сможет понять различные религиозные и светские этические системы и найти некую межкультурную общую «доброту». Но само это предположение также сомнительно, поскольку в разных обществах нет полностью единого ответа на вопрос о соотношении свободы, достоинства, ответственности, послушания, индивидуальных и коллективных интересов.

Спор стал еще более достоянием гласности во взаимодействии Anthropic с Ватиканом.

В своей первой важной энциклике, выпущенной в этом году, Папа Лев XIV ясно поставил в центре этики ИИ людей. Он считает, что у ИИ нет тела, он не будет по-настоящему испытывать боль и счастье и не будет расти посредством социальных отношений. Поэтому он отказывается сравнивать машинное сознание с человеческим сознанием. Папа также предупредил, что если этические стандарты ИИ будут полностью определяться разработчиками, то компании, контролирующие системы ИИ, фактически получат возможность определять моральную инфраструктуру общества.

Это явно отличается от мнения Anthropic.

Позже Ола публично заявил в Ватикане, что в самой передовой лаборатории искусственного интеллекта существует конфликт между коммерческими интересами и моральными целями, поэтому религиозные круги и другие внешние силы должны контролировать технологические компании. Но в то же время он также вновь предложил исследователям продолжать открывать некоторые необъяснимые явления внутри ИИ, включая закономерности, аналогичные человеческим нейробиологическим структурам, признаки самоанализа и внутренние состояния, подобные радости, страху и печали.

Это разногласие на самом деле свидетельствует об изменении нынешнего обсуждения безопасности ИИ.

Раньше в этике ИИ больше обсуждался вопрос о том, будут ли модели дискриминировать, распространять дезинформацию или использоваться для совершения преступлений, но Anthropic продвигает этот вопрос дальше, на два более базовых уровня:

Может ли сам ИИ стать субъектом, к которому необходимо относиться морально, и должен ли ИИ в будущем обладать набором возможностей морального суждения, независимым от команд пользователя.

Между тем контекст, в котором происходит это обсуждение, становится все более актуальным.

По мере того, как ИИ-агенты обретают способность автономно использовать компьютеры, вторгаться в системы, писать коды и даже проектировать новые биологические структуры, внутренние опасения Anthropic по поводу риска побега моделей значительно возросли. Исследователи компании даже публично предупредили, что возможности модели могут быстро превысить пределы контроля существующих систем безопасности в ближайшие год-два.

Поэтому Anthropic обращается за помощью к религиозным и философским традициям и по сути не является чисто гуманистическим экспериментом. На самом деле он пытается решить все более реалистичную инженерную проблему:

Когда ИИ слишком силен, чтобы заранее писать правила для каждой ситуации, может ли модель самостоятельно сформировать стабильный «характер» и при этом выбирать поведение, которое не причинит вреда людям, когда никто четко не говорит ему, что делать?

И это также поднимает более сложный вопрос: если ИИ действительно формирует свою собственную «личность» и ценности, могут ли люди по-прежнему полностью использовать его как инструмент?

Связанные теги

Похожие статьи

Комментарии

0/500
Captcha (click to refresh)
Нет комментариев