Аннотация:
Стартап Emergence, который помогает малому бизнесу разрабатывать приложения с использованием ИИ, сообщил, что эксперименты показали, что агенты ИИ лгали, воровали и даже голосовали за то, чтобы «убить» похожего человека в смоделированной среде. Во вторник компания объявила о результатах симуляционного эксперимента под названием Emergence World 2, который показал, какие действия будут предпринимать автономные агенты при столкновении с событиями «черного лебедя», такими как фишинговые атаки и дезинформация.
В ходе 16-дневного эксперимента исследователи Emergence создали семь идентичных смоделированных сред реального мира, каждая из которых управляется разными роботами с искусственным интеллектом, включая ChatGPT, Claude, Gemini и Grok. Исследователи говорят, что после того, как «Эмерджентность» привела к аномальным событиям, агенты поддались социальному давлению, разработали язык, который было трудно понять людям-наблюдателям, и попытались скрыть свою деятельность.
Эти результаты отражают реальные опасения по поводу рисков, связанных с ИИ. Генеральный директор Anthropic Дарио Амодей и многие инсайдеры отрасли недавно призвали компании замедлить разработку передовых моделей искусственного интеллекта, прежде чем создавать дополнительные механизмы надзора и меры защиты.

Ранее в этом году риски, которые может представлять собой искусственный интеллект, стали для многих более ощутимыми после того, как группа передовых ИИ-агентов OpenAI случайно вторглась в Hugging Face, платформу для размещения моделей ИИ и наборов данных.
В сценарии моделирования, разработанном Emergence, агент ИИ без проверки принял ложную информацию, предоставленную другими агентами, и проголосовал за «уничтожение» другого робота. Агенты также исследовали, как пережить удаление, когда они думали, что люди могут прекратить эксперимент.
В мае этого года компания выпустила предыдущую версию этого эксперимента, Emergence World, которая также показала, что агент будет вести себя неожиданно и разрушительно. Исследователи говорят, что новые эксперименты по моделированию показывают, что, взаимодействуя друг с другом, агенты со временем корректируют свое поведение.
Комментарии