Сора стал новогодним «королем» в мире искусственного интеллекта. 16 февраля OpenAI выпустила большую модель Sora, которая может автоматически генерировать видео, используя только текст. Это еще один весьма революционный продукт для крупных моделей после текстовой модели ChatGPT и графической модели Dall-E.

Текстовые видео начинались не с Соры. По неполным статистическим данным, по состоянию на конец прошлого года в мире появилось более 20 подобных продуктов, включая Runway, Pika и StableVideoDiffusion. Но дебют Sora, несомненно, принес революционный эффект, а его превосходные характеристики почти достигли уровня «сокрушения» аналогичных продуктов.

После того как OpenAI запустит Sora, как будет развиваться разрыв в сфере ИИ между Китаем и Соединенными Штатами? Является ли этот шаг «естественной пропастью» или «близким шагом»?

Сора

Прорывная «модель мира»

Будет ли увеличиваться разрыв в области ИИ?

Подрывная деятельность, продемонстрированная Сорой, проявляется во многих измерениях. Видео, которое можно выводить напрямую, имеет продолжительность до 60 секунд, а видео содержит сложную и деликатную фоновую среду, динамические и изменяемые движения камеры, разнообразное поведение персонажей, а также плавную стыковку одного кадра с концом или переключение между несколькими камерами. От тонких изменений выражений персонажей до яркой имитации поз животных — этого достаточно, чтобы выглядеть фальшиво и реально.

В видеоролике, опубликованном OpenAI, модная женщина прогуливается по шумным и суетливым улицам Токио. Здания на заднем плане, улицы и портреты сохраняют высокую степень единообразия. Даже при монтаже различных кадров явных искажений нет.


Некоторые люди отметили, что видео, созданные Сорой, демонстрируют высокое качество, будь то изменения света, тени, цвета, движения камеры или даже небольшие изменения в структуре текстур. Он также может моделировать физические законы реального мира. Например, видео «Два пиратских корабля сражаются в жестокой битве за чашкой кофе» не только демонстрирует плавную динамику кофе и реалистичный рендеринг света и тени, но также использует технологии трассировки лучей, фотографии с наклоном и сдвигом и т. д., обладая мощными навыками.

OpenAI подчеркнула, что «Sora является основой для понимания и моделирования моделей реального мира. Мы считаем, что эта функция станет важной вехой в реализации общего искусственного интеллекта (AGI)».

Появление Sora вызвало бурные дискуссии о том, увеличивается ли разрыв в области ИИ между Китаем и Соединенными Штатами. Чжоу Хунъи из компании 360 отметил, что, хотя уровень разработки отечественных больших моделей близок к GPT-3.5, по-прежнему существует разрыв примерно в полтора года по сравнению с GPT-4.0.

Чжоу Хунъи считает, что у OpenAI также может быть нераскрытое секретное оружие. «Разрыв в области искусственного интеллекта между Китаем и Соединенными Штатами, возможно, все еще увеличивается».

В то же время многие представители отрасли заявили, что фундаментальный разрыв в развитии ИИ между Китаем и США может заключаться не в самой технологии.

ОпенАИ

Данные — «секретное оружие»

Игровой движок может быть ключевым

Репортер «IT Times» отметил, что согласно техническому отчету, опубликованному OpenAI, мощные возможности Sora объясняются двумя моментами: один — использование модели диффузии на основе Transformer (DiffusionModel); другой — преобразование различных типов визуальных данных в единый формат — пиксельные патчи (patch), чтобы можно было использовать большой объём данных с отличным качеством и экономичной вычислительной мощностью.

В техническом отчете OpenAI не раскрыла источник обучения и конкретные детали. Инсайдеры отрасли полагают, что данные, вероятно, станут одним из наиболее важных факторов успеха Sora.

«Я думаю, что основная идея заключается в том, что у OpenAI достаточно данных». Соучредитель LogenicAI Ли Боцзе рассказал репортеру «IT Times», что основная причина, по которой OpenAI может совершать прорывы в области генеративных моделей, заключается в его значительных преимуществах в качестве и количестве данных.

Чжао Цзюньбо, исследователь и научный руководитель программы «Сотня талантов» Чжэцзянского университета, также сказал в интервью The Paper, что в кругах до сих пор существуют разные мнения о том, какие данные Сора использовал для обучения. Предполагается, что это может быть использование крупномасштабных данных, генерируемых игровыми движками:«Возможно, такого рода данные выводятся из игрового движка, но мы действительно не знаем, как они собираются, как производятся и обрабатываются и как они в конечном итоге передаются в Sora для конвейерного предварительного обучения».

OpenAI выпустила два 20-секундных демонстрационных видеоролика версии Minecraft для Sora. После того, как исследователи предоставили Соре подсказку, содержащую слово «Minecraft» (игра «Minecraft»), Сора может визуализировать HUD, высокоточную визуализацию мира и динамику игры, которые очень похожи на игру «Minecraft», а также может управлять персонажем игрока.

Стоит отметить, что в августе прошлого года OpenAI официально объявила о своем первом в истории приобретении. Целью приобретения была Globalillumination, стартап, производящий версию Minecraft с открытым исходным кодом. Ли Боцзе предположил, что, судя по результатам демонстрации версии Minecraft для Sora, приобретение OpenAI компании Globalillumination могло внести определенный вклад в накопление данных Sora.

С точки зрения вычислительной мощности, хотя количество графических карт, используемых OpenAI для обучения модели Sora, не является беспрецедентным, другим компаниям по-прежнему сложно повторить успех OpenAI, если у них есть достаточные аппаратные ресурсы. Основное узкое место заключается в том, как получить и обработать крупномасштабные высококачественные видеоданные.

Репортер «IT Times» заметил, что одновременно с приобретением Globalillumination компания OpenAI анонсировала инновационный метод обучения моделей ИИ, который, как ожидается, позволит сэкономить процесс обучения маркировке большого количества данных.

В то время объявленная OpenAI «модель предварительного видеообучения» VPT позволила ИИ научиться строить каменные кирки с нуля в «Minecraft». Первоначально весь процесс занимал у заядлого игрока не менее 20 минут, а всего требовалось 24 000 операций. Сначала исследователи собрали волну данных, чтобы аннотировать игровые данные аутсорсеров, которые включали видео и записи операций с клавиатурой и мышью. Затем используйте эти данные для создания модели обратной динамики (IDM), чтобы определить, как движется клавиатура и мышь на каждом этапе видео.

Таким образом, вся задача становится намного проще, и для достижения цели требуется гораздо меньше данных, чем раньше. Это исследование было опубликовано в июне 2022 года, а также в статье указано, что эта работа ведется уже год. Другими словами, OpenAI проводит подобные исследования как минимум с 2021 года.

«Даже такие компании, как Google, обладающие самым большим объемом данных в мире, не обязательно могут иметь лучшие данные для обучения, чем OpenAI, при обучении больших моделей». Напротив, отечественные компании все еще могут иметь определенный пробел в накоплении и использовании данных.Ли Боцзе считает, что преимущество первопроходца OpenAI определяет барьеры в передаче данных на раннем этапе, из-за чего компаниям, которые выходят на рынок позже, становится сложнее наверстать упущенное.

С одной стороны, опоздавшие могут оказаться не в состоянии получить некоторые ключевые данные, которые были доступны ранее, из-за изменений в политике и других ограничений; с другой стороны, поскольку контент, созданный ИИ, все чаще наводняет Интернет, исходные реальные данные «загрязняются», что затрудняет получение высококачественных и объективных обучающих данных.

Это похоже на ситуацию с GPT-4. Хотя его успех неотделим от поддержки мощных вычислительных мощностей, основным конкурентным преимуществом по-прежнему остается большой и высококачественный набор данных. Многие другие компании, даже несмотря на то, что у них были достаточные вычислительные ресурсы, столкнулись с трудностями при создании и использовании наборов данных того же размера и качества и, следовательно, не смогли своевременно разработать аналогичные передовые модели.

Отечественный ИИ

Значительный прогресс был достигнут в больших текстовых моделях.

Существует большой разрыв между большими мультимодальными моделями.

OpenAI признала в техническом отчете, что у Соры могут возникнуть трудности с точным моделированием физики сложных сцен; он может не понимать причинно-следственных связей; это также может сбить с толку пространственные детали сигналов; у него могут возникнуть трудности с точным описанием событий, происходящих во времени, например, при движении камеры по определенной траектории.

«Сора, по сути, является относительно небольшой моделью». Ли Боцзе считает, что главное значение появления Соры заключается в том, чтобы доказать важность построения моделей мира и указать правильный путь исследований для отрасли. Однако будущая тенденция развития по-прежнему направлена ​​на сквозные мультимодальные большие модели, такие как GPT-5, которые могут лучше понимать и генерировать контент, содержащий сложные сюжеты и логику.

Ли Боцзе рассказал репортеру «IT Times», что нынешний разрыв в разработке крупных моделей ИИ в стране и за рубежом в основном отражается на разработке мультимодальных моделей.В Китае некоторые компании добились замечательных результатов в текстовых моделях, достигнув или превысив уровень GPT-3.5, и прилагают все усилия, чтобы догнать GPT-4. Это показывает силу и скорость прогресса отечественных компаний в отдельной области обработки текста.

Однако, что касается исследований и разработок мультимодальных моделей, многие отечественные компании, которые сосредоточены на разработке крупных моделей, возможно, не полностью осознали важность мультимодальных технологий и не вложили достаточно человеческих, материальных и финансовых ресурсов в соответствующие исследования и разработки.Ли Боцзе считает, что рынок в целом считает, что текстовые модели, такие как GPT-4, работают хорошо, поэтому они больше сосредотачиваются на обработке текста и игнорируют построение и разработку мультимодальных моделей.

Кроме того, отечественные компании могут столкнуться с ограниченностью ресурсов при изучении путей инноваций, включая ограничения в вычислительной мощности и плотности кадров. По сравнению с европейскими и американскими компаниями, такими как OpenAI, которые обладают огромными вычислительными ресурсами и концентрируют лучшие таланты, китайские компании сталкиваются с более серьезными проблемами в области независимых инноваций. Поэтому отечественные предприятия склонны следовать проверенным технологическим маршрутам мировых лидеров. Эта стратегия относительно более надежна и эффективна и может быстро сократить технологический разрыв.

Выравнивание

Стоимость крупных зарубежных моделей слишком высока

Сценарии внутреннего применения — это возможности

Многие люди в отрасли считают, что Sora не совершила существенного прорыва с точки зрения основных технических принципов. Согласно анализу GF Securities, Sora можно больше понимать как аналог ChatGPT, основанный на тех же технических принципах, что является еще одним важным «количественным изменением» в эстетике насилия.

Чэн Вейчжун, основатель и генеральный директор Zhongke Deep Intelligence, заявил в интервью СМИ, что алгоритм Сора не является большим прорывом с точки зрения значимости. С одной стороны, Сора использует чрезвычайно жестокую эстетику и использует огромные вычислительные мощности для решения проблемы согласованности времени между кадрами. То есть в Sora не только используется модель диффузии для решения проблемы генерации одного и того же кадра, но также используется модель диффузии для решения проблемы генерации синхронизации между кадрами. Это также определяет, что стоимость создания видео Sora не может быть снижена за короткое время. Без возможности решить проблему «иллюзий» создание по-настоящему управляемых и полезных видео в краткосрочной перспективе будет очень дорогостоящим.

Эти ограничения могут также стать возможностями для опоздавших.

«Точно так же, как сейчас все согласны с тем, что GPT-4 является самым мощным, но если вы действительно создадите компанию, вы обнаружите, что не можете придерживаться ее в течение нескольких дней, потому что GPT-4 слишком дорог. Поэтому большинство моделей, которые мы на самом деле используем в компании, не являются GPT-4 или используют большие модели с открытым исходным кодом. Если вы можете использовать 7B, вам не нужна 70B, а если вы можете использовать 70B, вам не нужен GPT-4. Цена разница может быть более чем в 100 раз, а стоимость является очень важным фактором». Ли Боцзе рассказал.

Как говорится, хотя GPT-4 является мощным, стоимость действительно является реальной проблемой, что также побуждает предприятия выбирать более экономичные решения в практических приложениях, такие как модели с открытым исходным кодом или меньшие коммерческие модели. Что касается создания видео Sora, по оценкам Ли Боцзе, стоимость видео колеблется от нескольких до десятков долларов. Если это популяризируется среди общественности, стоимость необходимо снизить до 1% от текущего уровня, чтобы она была приемлемой. Снижение стоимости при одновременном повышении качества генерации и логической последовательности является ключевой задачей, которую необходимо решить в срочном порядке.

Фактически, с развитием технологий искусственного интеллекта все аспекты производства контента начали подвергаться воздействию и претерпевать глубокие изменения.

Премьер-министр Сюн, менеджер по продукту Mixlab Unbounded Community и основатель китайского сообщества энтузиастов ComfyUI, рассказал репортеру IT Times, что для нужд местного рынка разработанные внутри страны крупномасштабные модели предварительного обучения, такие как Baidu Wenxinyyyan, показали довольно хорошую практичность в сценариях универсального применения. Однако при решении сложных задач все еще существует определенный разрыв с ведущими зарубежными крупными моделями. Однако для удовлетворения большинства существующих потребностей в производственных инструментах текущие коммерческие модели с открытым исходным кодом и отечественные коммерческие модели уже могут предоставлять в основном полезные и удовлетворительные услуги, особенно по мере того, как сценарии применения постепенно становятся все более обширными, а внедрение крупных отечественных моделей ускоряется.

Премьер-министр дядя Сюн заметил, что в первой половине прошлого года искусственный интеллект выполнял лишь некоторые простые работы по дублированию при производстве контента и использовался в таких сценах, как массовое производство некачественных фильмов и телевизионных комментариев. Но во второй половине года технологии искусственного интеллекта еще больше проникли в важные аспекты производства контента, такие как перерисовка анимационных работ. Штатные команды начали использовать технологии искусственного интеллекта для улучшения качества работ и снижения производственных затрат.С другой стороны, анализ и вспомогательные инструменты на основе искусственного интеллекта постепенно становятся популярными в кино- и телеиндустрии, меняя исходный творческий процесс, позволяя профессиональным кино- и телепроизводителям сокращать затраты и улучшать управляемость за счет генерации искусственного интеллекта.


В этом процессе силу сообщества открытого исходного кода нельзя недооценивать. Премьер-министр Сюн Шу отметил, что, хотя некоторые модели OpenAI не являются полностью открытыми, результаты исследований и публикации в документах служат значительным источником вдохновения для глобальных научно-исследовательских групп и сообществ открытого исходного кода. Как только документы с похожими функциями или некоторыми техническими подробностями будут обнародованы, многие команды и разработчики открытого исходного кода быстро начнут следить, воспроизводить, улучшать и запускать версии моделей с открытым исходным кодом. Например, успех серии GPT вдохновил многие проекты с открытым исходным кодом на создание аналогичных языковых моделей. После непрерывной оптимизации и итераций производительность этих моделей может постепенно приближаться к передовым моделям с закрытым исходным кодом или даже конкурировать с ними при выполнении определенных конкретных задач.

Ли Боцзе также считает, что в области развлекательных приложений отечественные компании смогут догнать их на уровне приложений, воспользовавшись преимуществами богатой экологии и сценариев применения, а также получить возможность расширить рынок, выйдя за границу.