В процессе обучения больших моделей искусственного интеллекта покупка суперкомпьютерных услуг или памяти также становится новым способом эффективного снижения беспокойства по поводу вычислительной мощности. Недавно Чжэн Вэйминь, академик Китайской инженерной академии и профессор кафедры компьютерных наук Университета Цинхуа, отметил в разговоре с Sina Technology: «Раньше обучение большой модели стоило миллиарды, но если вы обучаете большую модель на суперкомпьютере, цена будет составлять лишь одну шестую от цены NVIDIA».
Кроме того, Чжэн Вэйминь также указал на новую тенденцию в развитии рассуждений ИИ — «обмен на основе депозита». В качестве примера он взял технологическую структуру Mooncake, совместно разработанную Университетом Цинхуа и компанией-единорогом искусственного интеллекта Dark Side of the Moon, и представил принцип того, как эта технология основана на идее «от депозита к депозиту», чтобы помочь интеллектуальному помощнику кими Dark Side of the Moon снизить жесткий спрос на вычислительную мощность, тем самым избегая простоя сервера.
«Перенесите обучение больших моделей на суперкомпьютер, цена составит всего 1/6 цены NVIDIA»
Чжэн Вэйминь увидел, что после выпуска ChatGPT мировые технологические компании быстро догнали его, большие модели этого года имеют две характеристики: во-первых, базовая большая модель перешла в мультимодальное состояние, не только текст, но также изображения, видео и т. д.; во-вторых, она действительно используется, и большая модель интегрируется с реальными условиями различных отраслей, таких как большая модель + финансы, большая модель + медицина, большая модель + автомобиль, большая модель + интеллектуальное производство и т. д.
«Большие модели действительно тесно интегрированы с ВВП национальной экономики и уровнем жизни людей. Я всегда думал, что наш уровень базовых крупных моделей все еще немного отстает от США, но с точки зрения «Большой модели+» мы все еще надеемся превзойти Соединенные Штаты». Сказал Чжэн Вэйминь.
Однако реальный процесс применения больших моделей требует большого количества вычислительных ресурсов на протяжении всего жизненного цикла, включая сбор данных, предварительную обработку данных, обучение модели, точную настройку модели и обоснование модели. Как получить более эффективные и надежные вычислительные ресурсы для больших моделей искусственного интеллекта с меньшими затратами, стало вопросом, над которым задумывается каждое предприятие.
Из-за трудностей с получением высокопроизводительных чипов за рубежом, одним из основных решений, разрабатываемых в настоящее время в Китае для удовлетворения огромного спроса на вычислительную мощность, вызванного крупномасштабным обучением моделей искусственного интеллекта, является создание кластеров из тысяч карт и 10 000 карт и закупка чипов у нескольких производителей посредством массивного стека микросхем и полупроводников для совместного обучения гетерогенных карт, чтобы удовлетворить огромный спрос на вычислительную мощность для обучения продуктов больших моделей. Однако, по мнению Чжэн Вэйминя, хотя этот метод и может решить проблему нехватки вычислительной мощности, он также имеет некоторые недостатки.
Прежде всего, для построения домашней системы Ванка важно ее построить, но хорошо ею пользоваться сложно. Чжэн Вэйминь сказал, основываясь на своем личном опыте в области высокопроизводительных вычислений: «Постройте систему из 2000 карт, 1000 из которых использовали чипы NVIDIA, а остальные 1000 использовали чипы других производителей. Система была построена и работала, но в конце выяснилось, что производительность этих чипов была разной, а некоторые были менее функциональными. Некоторые из них более функциональны. Задача разделена на 2000 частей, и 1000 из них разделены на меньшие задачи, а остальные 1000 делятся на более крупные задачи. Это все еще статично. Если оно динамическое, оно напрямую делится на 2000 мельчайших частей для обработки, и производительность очень низкая».
Чжэн Вэйминь отметил, что при построении крупномасштабных вычислительных кластеров существует эффект бочки. Некоторые вычислительные карты обладают сильными возможностями, тогда как другие слабы. Точно так же, как количество воды, которое может вместить все ведро, в конечном итоге определяется короткой доской, оно бесполезно, какой бы длинной она ни была. «Таким образом, совокупная производительность 1000 старых графических процессоров и 1000 новых графических процессоров немного ниже, чем производительность 2000 старых графических процессоров, а стоимость создания крупномасштабного вычислительного кластера также довольно высока».
По мнению Чжэн Вэйминя, сложно и неэкономично достичь максимальной производительности в статической среде при крупномасштабном совместном обучении разнородных карт. Еще сложнее будет, если будут задействованы удаленные карты. Данные передаются из Пекина в Гуйчжоу, а результаты обрабатываются в Гуйчжоу, а затем отправляются в Шанхай. Затраты времени чрезвычайно высоки. «Людям с меньшими деньгами это не обязательно делать, но люди с большими деньгами могут попробовать».
Чжэн Вэйминь предложил предприятиям попытаться использовать суперкомпьютеры для обучения больших моделей ИИ. «В нашей стране 1,4 миллиарда суперкомпьютерных систем, и деньги платит государство. У некоторых машин все еще есть небольшой излишек, потому что отечественные суперкомпьютеры дешевы, в отличие от NVIDIA, которая должна покрывать стоимость машины и при этом зарабатывать деньги, поэтому все проводят крупномасштабное обучение моделям и ходят на суперкомпьютер Qingdao Sunway, и одной шестой цены достаточно». Сказал Чжэн Вэйминь.
«Преобразование хранилища в депозит может эффективно снизить затраты на рассуждения ИИ».
Фактически, реальный процесс применения больших моделей требует большого количества вычислительных ресурсов в течение всего жизненного цикла, включая сбор данных, предварительную обработку данных, обучение модели, точную настройку модели и обоснование модели. Для хранения огромных результатов вычислений также требуется большой объем ресурсов хранения. Особенно в процессе вывода моделей вопрос о том, как хранить больше данных, быстро их передавать и обеспечивать высокую рентабельность, стал проблемой, о которой думает вся отрасль вместе.
Ранее Чжэн Вэйминь публично упомянул: «Хранилище ИИ является ключевой базой для больших моделей искусственного интеллекта. Система хранения существует на каждом звене жизненного цикла больших моделей и является ключевой базой для больших моделей. Используя хранилище для выполнения вычислений и используя хранилище для преобразования вычислений, расширенное хранилище ИИ может улучшить доступность обучающих кластеров, снизить затраты на логические выводы и улучшить взаимодействие с пользователем».
В общении с Sina Technology Чжэн Вэйминь поделился основным принципом «от депозита к конверсии». Он отметил: «Большие модели требуют большой вычислительной мощности, будь то для обучения или вывода, а также требуют большого объема памяти для хранения огромных параметров, обученных большой моделью, а также некоторых данных процесса, сгенерированных в процессе вывода». Однако если в течение всего процесса обучения или вывода необходимо хранить все больше и больше данных, это приведет к нехватке ресурсов памяти, что в конечном итоге станет «бременем» для повышения производительности большой модели.
По словам Чжэн Вэйминя, для решения вышеуказанных проблем Университет Цинхуа придумал два метода: во-первых, в процессе вывода в настоящее время в основном работает карта вывода, а центральный процессор и память хоста не используются. Таким образом, мы можем найти способы использовать память на хосте в процессе вывода, что улучшает использование памяти. Повышая производительность, это также экономит деньги. Снижаются капитальные затраты на постоянную покупку карт вывода; во-вторых, сохраняется общий контент, созданный в процессе вывода и предоставленный пользователями. Сохраняя данные, сгенерированные в ходе необходимого процесса вывода, его можно напрямую вызывать при возникновении последующих подобных проблем, что напрямую исключает процесс вывода каждый раз, когда возникают подобные проблемы, повышая эффективность и экономя ресурсы.
Взяв в качестве примера технологическую структуру Mooncake, совместно разработанную Университетом Цинхуа и Dark Side of the Moon, Чжэн Вэйминь отметил: «Извлечение и сохранение публичного контента разговоров между разными пользователями и Кими не только сокращает процесс регенерации каждый раз, когда пользователь задает вопрос, но также экономит много вычислительных карт, а также уменьшает такие проблемы, как «задержка доступа» или «время простоя», вызванные чрезмерным доступом к Кими».
Текст丨Sina Technology Чжоу Вэньмэн