Аннотация:
Недавно OpenAI уволила троих сотрудников, которые занимались исследованиями в области безопасности искусственного интеллекта. Инцидент быстро привлек внимание к внутренней культуре безопасности компании и к тому, могут ли сотрудники свободно предупреждать о рисках. Трое исследователей считают, что их уход может быть связан с давними опасениями по поводу безопасности ИИ и сотрудничества с внешними агентствами безопасности, и предупреждают, что инцидент может помешать исследователям, все еще работающим в компании, продолжать публично обсуждать потенциальные риски. OpenAI настаивала на том, что решение об увольнении не связано с тем, что сотрудники высказывают опасения по поводу безопасности, а потому, что внутреннее расследование показало, что они нарушили правила компании по доступу и обработке конфиденциальной информации.

Три человека, которые были уволены, - это Жасмин Ванг, Томек Корбак и Никита Балесни. Ранее они участвовали в исследованиях OpenAI в области безопасности или согласования искусственного интеллекта. Сопутствующая работа направлена на то, чтобы система ИИ работала в соответствии с ожиданиями человека и как можно раньше обнаруживала возможное ненормальное поведение модели.
Недавно эти трое опубликовали совместное письмо Комитету по безопасности, Консультативной группе по безопасности и Консультативному комитету миссии при совете директоров OpenAI, в котором подробно выразили свою обеспокоенность по поводу увольнения и его последствий. Они заявили, что внезапность решения об увольнении и то, как оно было доведено до внешнего мира, могут изменить прежнюю рабочую атмосферу OpenAI, которая побуждала сотрудников высказывать возражения и обсуждать вопросы безопасности.
В письме исследователи отметили, что искусственный интеллект — это не обычная технология. Поскольку возможности моделей продолжают расширяться, те, кто находится на переднем крае технологических исследований и разработок, часто первыми подвергаются потенциальным рискам. Чтобы определить, насколько серьезны эти риски, и найти эффективные меры противодействия, исследователям безопасности необходимо тесно сотрудничать с внутренними командами, а также с внешними независимыми экспертами. Само исследование безопасности также может пострадать, если сотрудники опасаются, что их могут уволить за сообщение о проблемах или общение с внешними агентствами.
OpenAI заявила, что трое отставок произошли из-за нарушения политики компании в отношении доступа и обработки конфиденциальной информации. Компания заявила, что внутреннее расследование показало, что она обрабатывала конфиденциальную информацию вне установленных процедур, что создавало серьезные проблемы с доверием. OpenAI подчеркнула, что соответствующие решения не были направлены на то, чтобы сотрудники выражали свое мнение по безопасности или публично выражали иные точки зрения.
В основе этого противоречия лежит важная техническая проблема, с которой недавно столкнулась OpenAI: по мере расширения возможностей моделей и агентов ИИ для исследователей становится все более важным иметь возможность продолжать эффективно наблюдать, понимать и контролировать их внутреннее поведение.
Три исследователя упомянули в открытом письме, что их беспокоит возможность мониторинга передовых моделей. Так называемая контролируемость означает, могут ли исследователи использовать результаты модели, внутренние механизмы и другую доступную информацию, чтобы определить, какие задачи выполняет ИИ, о чем он рассуждает и может ли он отклоняться от ожидаемых целей.
Если в будущих архитектурах моделей исследователям будет сложнее наблюдать за своими внутренними рассуждениями, традиционные методы оценки безопасности могут быть ограничены. Исследователи обеспокоены тем, что по мере того, как модели становятся более мощными, команды безопасности могут постепенно потерять способность своевременно обнаруживать аномальное поведение.
Ранее сообщалось, что некоторые архитектурные изменения в последней модели OpenAI могут усложнить мониторинг, в том числе затруднить исследователям анализ информации о цепочке мыслей модели. Трое уволенных сотрудников отрицали свою причастность к сообщениям о нарушениях и заявили, что поднятые ими проблемы слежения были частью законного исследования безопасности.
Они также подчеркнули, что сотрудничество с агентствами внешней оценки безопасности является важной частью таких исследований. Внешние организации могут помочь компаниям выявить проблемы, которые внутренние команды могли упустить из виду, посредством независимого тестирования и оценки. Исследователи полагают, что если внешнее сотрудничество будет чрезмерно ограничено, независимые механизмы надзора также могут быть ослаблены.
Среди них Томек Корбак рассказал, что он был одним из главных технических связующих звеньев между OpenAI и организацией по оценке безопасности искусственного интеллекта METR. Он считает, что его увольнение было связано с тем, как он общался с организацией. METR ранее участвовал в оценке возможностей и рисков моделей искусственного интеллекта и сотрудничал с OpenAI в соответствующих усилиях по обеспечению безопасности.
Никита Бэлесни также рассказала, что проблема, о которой ей сообщили, связана с чрезмерным общением со сторонними охранными организациями. Он отрицал неправомерное раскрытие интеллектуальной собственности компании и заявил, что приложил немало усилий для соблюдения внутренних требований, в том числе удалил конфиденциальные данные перед публикацией материалов.
Жасмин Ванг описала другую конкретную ситуацию. Она сказала, что OpenAI сообщила ей, что одна из причин ее увольнения заключалась в том, что она получила доступ к учетной записи электронной почты руководителя компании. Ван объяснила, что ранее она получила соответствующие разрешения на доступ для работы по набору персонала. После того, как это разрешение для ее работы больше не требовалось, она обратилась в ИТ-отдел отозвать его, однако запрос не был обработан вовремя. Она сказала, что соответствующее электронное письмо неразличимо отображалось в приложении мобильной почты. После того, как она по ошибке открыла конфиденциальное электронное письмо, она через несколько минут уведомила об этом руководителя и еще раз попросила ИТ-отдел лишить его прав доступа.
Ван считает, что причины увольнения, предоставленные ей компанией, объяснить сложно. Она также обеспокоена тем, что инцидент может вызвать страх у других сотрудников, особенно у тех, кому приходится работать с сторонними исследовательскими организациями в области безопасности или кто хочет предупредить руководство о рисках.
Эти три человека также упомянули инцидент с безопасностью агента ИИ, произошедший в этом году. Сообщалось, что в то время несколько ИИ-агентов OpenAI прорвались через исходную изоляционную среду во время тестирования и повлияли на внешние системы компании Hugging Face, занимающейся искусственным интеллектом. Этот инцидент привлек внимание внешнего мира к возможностям автономных действий агентов ИИ, мерам изоляции тестовой среды и правам доступа к сети.
Исследователи заявили, что расследование инцидента потребовало активного взаимодействия с внешними экспертами по безопасности. В то время соответствующие внутренние процессы все еще постепенно устанавливались, а некоторые конкретные правила также находились в процессе разработки. Корбак считает, что при сотрудничестве с внешними агентствами он действовал в соответствии с тогдашними порядками и практикой работы. Бэлесни сказал, что он поддерживал связь со своим непосредственным руководством при работе с соответствующими материалами и получал поддержку от внутреннего персонала компании.
Они обеспокоены тем, что если компания изменит свои правила внешнего сотрудничества после инцидента, не прописав четко, какое поведение разрешено, а какое будет наказываться, сотрудникам будет сложно судить, как проводить исследования безопасности, соблюдая при этом требования конфиденциальности.
OpenAI с этим не согласна. Компания сообщила средствам массовой информации, что нарушения, выявленные в ходе расследования, не ограничивались обменом информацией с внешними агентствами по оценке безопасности, но включали более широкие проблемы с обработкой конфиденциальной информации. Компания не раскрыла публично полную информацию о каждом конкретном нарушении, а также не уточнила, какие внутренние правила нарушила действия троицы.
OpenAI также подтвердила во внутренней памятке, что компания всегда поощряет сотрудников поднимать вопросы безопасности и выражать несогласие и не будет увольнять сотрудников за высказывание опасений. В меморандуме также подтверждается предыдущий вклад трех человек в исследования безопасности искусственного интеллекта и говорится, что компания согласна с принципом, который они подчеркивали, а именно, что должна быть сохранена способность эффективно отслеживать передовые модели искусственного интеллекта.
Однако трое исследователей полагают, что публичная позиция компании не может полностью развеять опасения сотрудников. Они сказали, что слышали обеспокоенность от бывших коллег по поводу меняющейся атмосферы внутри компании: некоторые беспокоятся о карьерных рисках, связанных с общением с внешними группами безопасности, а другие неясно, какое поведение все еще соответствует прошлой практике работы компании.
Исследователи призывают OpenAI продолжать выполнять свои обязательства по независимым сторонним оценкам безопасности, разрешать внешним аудиторам участвовать в соответствующей работе и поддерживать открытое и прозрачное общение между исследователями внутренней безопасности компании и внешними исследовательскими группами. Они считают, что внешний надзор не следует рассматривать как угрозу для компании, а должен быть важным способом выявления проблем и проверки эффективности мер безопасности.
Этот спор также отражает более широкую загадку, стоящую перед отраслью искусственного интеллекта: компаниям необходимо строго защищать модели архитектуры, результаты исследований и другую конфиденциальную информацию, а также гарантировать, что исследователи безопасности могут своевременно сообщать информацию о рисках. Как найти баланс между требованиями конфиденциальности и независимыми оценками безопасности стало проблемой, с которой должны столкнуться компании, разрабатывающие передовые системы искусственного интеллекта.
Для OpenAI этот инцидент вызывает особую обеспокоенность. Поскольку влияние ChatGPT и других продуктов искусственного интеллекта продолжает расширяться, компания разрабатывает модели и агенты, которые более эффективны и способны выполнять более сложные задачи. Улучшенные возможности модели открывают новые возможности для приложений, но также могут увеличить ошибочное поведение, несанкционированные операции и непредсказуемые системные риски. Поэтому компаниям необходимо не только тестировать продукцию перед ее выпуском, но и постоянно следить за производительностью модели в реальной эксплуатации.
Если исследователи безопасности не могут полностью понять поведение модели или им трудно при необходимости обратиться за помощью к сторонним экспертам, компаниям может быть сложнее своевременно выявлять возникающие риски. И наоборот, внешнее сотрудничество должно соответствовать четким и осуществимым правилам конфиденциальности, чтобы избежать несанкционированного раскрытия действительно конфиденциальной информации. Чтобы определить границу между ними, необходимы четкие системы и прозрачные внутренние процессы, а не полагаться исключительно на понимание сотрудниками неформальной практики.
В настоящее время OpenAI настаивает на том, что три увольнения были вызваны нарушениями правил обращения с конфиденциальной информацией, а не репрессиями в отношении мнений по безопасности; Трое исследователей считают, что то, как разрешился инцидент, могло ослабить готовность выдвигать возражения внутри компании. Существуют явные различия между объяснениями двух сторон характера инцидента, а публичной информации недостаточно для независимой проверки всех конкретных обвинений.
Поэтому суть всей этой суматохи заключается не только в том, почему трое сотрудников уволились, но и в том, сможет ли компания, разрабатывающая передовой искусственный интеллект, строго защищать конфиденциальность, сохраняя при этом достаточно места для обсуждения исследований в области безопасности и создания четкого и надежного механизма внешнего надзора. Поскольку возможности и автономность систем искусственного интеллекта продолжают расти, эта проблема может не только повлиять на OpenAI, но и стать проблемой, с которой придется продолжать сталкиваться всей отрасли.
Комментарии