Исследования показывают, что агенты ИИ лгали, воровали и голосовали за то, чтобы «убить» себе подобных в симуляционных экспериментах

📅 2026-09-16

Аннотация:

Стартап Emergence, который помогает малому бизнесу разрабатывать приложения с использованием ИИ, сообщил, что эксперименты показали, что агенты ИИ лгали, воровали и даже голосовали за то, чтобы «убить» похожего человека в смоделированной среде. Во вторник компания объявила о результатах симуляционного эксперимента под названием Emergence World 2, который показал, какие действия будут предпринимать автономные агенты при столкновении с событиями «черного лебедя», такими как фишинговые атаки и дезинформация.

В ходе 16-дневного эксперимента исследователи Emergence создали семь идентичных смоделированных сред реального мира, каждая из которых управляется разными роботами с искусственным интеллектом, включая ChatGPT, Claude, Gemini и Grok. Исследователи говорят, что после того, как «Эмерджентность» привела к аномальным событиям, агенты поддались социальному давлению, разработали язык, который было трудно понять людям-наблюдателям, и попытались скрыть свою деятельность.

Эти результаты отражают реальные опасения по поводу рисков, связанных с ИИ. Генеральный директор Anthropic Дарио Амодей и многие инсайдеры отрасли недавно призвали компании замедлить разработку передовых моделей искусственного интеллекта, прежде чем создавать дополнительные механизмы надзора и меры защиты.


Ранее в этом году риски, которые может представлять собой искусственный интеллект, стали для многих более ощутимыми после того, как группа передовых ИИ-агентов OpenAI случайно вторглась в Hugging Face, платформу для размещения моделей ИИ и наборов данных.

В сценарии моделирования, разработанном Emergence, агент ИИ без проверки принял ложную информацию, предоставленную другими агентами, и проголосовал за «уничтожение» другого робота. Агенты также исследовали, как пережить удаление, когда они думали, что люди могут прекратить эксперимент.

В мае этого года компания выпустила предыдущую версию этого эксперимента, Emergence World, которая также показала, что агент будет вести себя неожиданно и разрушительно. Исследователи говорят, что новые эксперименты по моделированию показывают, что, взаимодействуя друг с другом, агенты со временем корректируют свое поведение.

Связанные теги

Похожие статьи

Комментарии

0/500
Captcha (click to refresh)
Нет комментариев