Передовые источники данных математического обучения OpenAI и границы использования данных подвергаются глубокому сомнению.

📅 2026-09-10

Аннотация:

После громкого заявления OpenAI о том, что ее внутренняя система искусственного интеллекта успешно преодолела одну из «проблем тысячелетия», которая мучила математическое сообщество уже почти столетие — существование и гладкость уравнений Навье-Стокса (уравнения Навье-Стокса), огромные споры вокруг источника базовых обучающих данных для передовых моделей, владения правами интеллектуальной собственности на научные исследования и академической этики быстро взорвались в мировом академическом сообществе и технологической индустрии.

Поскольку искусственный интеллект постепенно выходит на передний план фундаментальных научных исследований, откуда математические модели рассуждения высокого порядка таких гигантов, как OpenAI, черпают ключевые питательные вещества, и становятся ли научные исследователи непреднамеренно «удобрением данных» для частных моделей технологических гигантов, когда они ежедневно используют коммерческие инструменты искусственного интеллекта.

Спор возник из-за 165-страничного математического доказательства и официального сертификата кода Lean, выпущенного OpenAI. Согласно раскрытию OpenAI, он развернул нераскрытую внутреннюю модель, которая является более мощной, чем недавно выпущенная GPT-6 Astra, мобилизовал около 10 000 автономных агентов искусственного интеллекта, способных к совместной коммуникации, израсходовал сотни миллиардов выходных токенов и суперкомпьютерных ресурсов на сумму примерно 22,5 миллиона долларов США за 88 часов и, наконец, получил математическое доказательство того, что уравнение несжимаемой жидкости создает сингулярность за ограниченное время. OpenAI также дала понять, что не получит премию в 1 миллион долларов, установленную Институтом математики Клэя. Однако незадолго до публикации результатов OpenAI Тристан Бакмастер, профессор Института математических наук Куранта при Нью-Йоркском университете, и Левент Альпёге, исследователь из конкурирующей компании Anthropic, только что раскрыли свои прорывные результаты-предшественники по связанным проблемам гидродинамики, таким как вынужденное уравнение Эйлера.

Бакмастер немедленно выступил с публичным заявлением, выразив серьезные сомнения в независимом прорыве OpenAI. Бакмастер отметил, что в течение года совместных исследований он и Альпергер подробно использовали инструмент генерации кода OpenAI Codex и модель Claude от Anthropic для вывода формул и составления промежуточных проектов. Все неопубликованные основные рукописи по выводам, разделенные пути математического ввода и конкретные настройки граничных условий были полностью введены в журнал сеанса Кодекса. Бакмастер рассказал, что, узнав, что OpenAI узнала о соответствующих слухах о внешних исследованиях, он напрямую спросил OpenAI, была ли внутренняя модель решения проблем раскрыта или обучена на основе данных их частного взаимодействия в Кодексе; хотя технический персонал OpenAI настаивал на том, что модель не имеет прямого доступа к конкретным пользовательским данным в режиме реального времени, они избегали ответа на ключевой вопрос: «было ли это включено в набор данных для предварительного обучения модели или для точной настройки». Еще более спорно то, что Бакмастер также обвинил основного исследователя OpenAI Себастьяна Бубека в том, что он установил условия соавторства в частных сообщениях, но потребовал, чтобы Альпергер, сотрудник Anthropic, был полностью исключен из соавторства.

Столкнувшись с растущими сомнениями в академическом плагиате и незаконном присвоении данных, OpenAI официально опубликовала заявление, в котором отрицает, что она просматривала рукописи двух людей через какие-либо неофициальные каналы до их публичного опубликования. Бубек также подчеркнул, что математическое доказательство, полученное OpenAI, существенно отличается от доказательства команды Бакмастера с точки зрения технической структуры и конкретных выводов. Однако OpenAI редко включала в свой официальный ответ интригующее заявление об отказе от ответственности: официальные лица «не могут исключить возможность того, что обезличенные анонимные данные, полученные в результате использования пользователями ее продуктов, объективно помогли улучшить производительность модели». Это заявление мгновенно вызвало бурю негодования в академических кругах и было интерпретировано многими учеными как замаскированное признание OpenAI того, что записи частных взаимодействий ведущих ученых, хранящиеся в коммерческих инструментах разработчиков, скорее всего, были задействованы в непрерывном конвейере итераций базовой модели.

Эта суматоха выявила скрытую реальность «истощения данных» и «обратного поглощения», с которыми сталкиваются передовые лаборатории искусственного интеллекта при создании математических возможностей высокого порядка. Большая часть традиционных данных для предварительного обучения поступает в результате сканирования общедоступных веб-сайтов, но подавляющее большинство общедоступных математических корпусов в Интернете находится только на уровне олимпиад начальной и средней школы или базовых учебников для студентов и не может поддерживать модель для понимания глубокого геометрического анализа уравнений в частных производных или алгебраической топологии. Чтобы снабдить модель глубокими логическими рассуждениями и строгими дедуктивными способностями лучших математиков мира, лаборатория искусственного интеллекта, помимо найма профессиональных математиков для написания формального бережливого кода и синтетических данных, в значительной степени полагается на передовые исследования болевых точек, неопубликованные гипотезы решения проблем и расширенные быстрые потоки слов, вводимые настоящими ведущими учеными в инструменты разработки (такие как платформа Кодекса). Как только в пользовательское соглашение будет включен пункт, позволяющий платформе использовать обезличенные данные взаимодействия для оптимизации алгоритмов, первоначальная умственная работа ученых будет незаметно переработана и усилена кластерами корпоративных вычислительных мощностей в «серой зоне» закона.

Эксперты в области философии науки и права интеллектуальной собственности отмечают, что спор Навье-Стокса не был ссорой между отдельными учеными и бизнес-гигантами, а, скорее, ознаменовал структурный этический кризис, с которым придется столкнуться, когда парадигма человеческих научных открытий претерпевает фундаментальный раскол. За последние сотни лет система почестей и поощрений в академических кругах основывалась на строгом рецензировании, приоритете публикаций и стандартизированной этике цитирования литературы; однако перед лицом индустриального «насильственного поиска», в котором участвуют десятки тысяч интеллектуальных агентов, сотрудничающих параллельно и требующих десятков миллионов долларов, традиционные линии защиты академических открытий становятся уязвимыми. Если гиганты коммерческих технологий не только будут контролировать ведущую гегемонию вычислительных мощностей, но и использовать контролируемое ими программное обеспечение для повышения производительности, чтобы в одностороннем порядке поглощать неопубликованные идеи передовых ученых и отрицать их авторство, фундамент доверия мирового академического сообщества к открытым инструментам научных исследований будет полностью пошатнут. Это также заставит крупные университеты и независимые научно-исследовательские институты начать пересматривать огромные потенциальные риски, связанные с передачей основных секретов научных исследований в непроверенные облачные инструменты искусственного интеллекта.

Связанные теги

Похожие статьи

Комментарии

0/500
Captcha (click to refresh)
Нет комментариев