Генеральный директор Qualcomm намекает, что крупномасштабные языковые модели, способные обрабатывать 100 миллиардов параметров, могут быть доступны к 2028 году

📅 2026-10-11

Аннотация:

Некоторые ведущие компании, занимающиеся искусственным интеллектом, продвигают индустрию мобильных телефонов разработку устройств, способных непрерывно запускать большие языковые модели со 100 миллиардами параметров, причем целевой срок указывает на 2028 год. Однако эта идея сталкивается с двумя практическими проблемами: во-первых, для работы такой большой модели требуется большой объем памяти, а во-вторых, центры обработки данных искусственного интеллекта конкурируют за глобальные мощности по производству памяти, что приводит к ограничению поставок памяти потребительского уровня и продолжающемуся росту цен.

Генеральный директор Qualcomm Амон заявил в интервью Fireside Alpha, что некоторые компании, находящиеся на переднем крае индустрии искусственного интеллекта, изучают мобильные телефоны, которые могут непрерывно выполнять сотни миллиардов моделей параметров. Он не раскрыл конкретных названий этих компаний, но соответствующие заявления показывают, что ожидания компаний, занимающихся искусственным интеллектом, в отношении мобильных устройств меняются: в будущем мобильные телефоны могут перестать быть просто терминалами, которые время от времени вызывают облачные службы ИИ, а станут персональными вычислительными устройствами, которые смогут постоянно запускать большие модели локально и активно решать задачи.

Однако заявление Амона больше касалось описания целей, предложенных отраслевыми клиентами, а не официально объявленной дорожной карты продукта Qualcomm. В настоящее время Qualcomm еще не предоставила полноценного аппаратного решения, способного достичь этой цели в 2028 году, и не пообещала, что к тому времени выпустит коммерческий мобильный телефон с соответствующими возможностями.

С технической точки зрения модель со 100 миллиардами параметров предъявляет гораздо более высокие требования к аппаратному обеспечению мобильных телефонов, чем распространенные в настоящее время модели искусственного интеллекта на устройствах. Параметры большой языковой модели определяют большое количество значений, которые модель должна сохранять и вызывать, и эти данные обычно необходимо хранить в памяти, чтобы процессор мог быстро получить к ним доступ во время вывода.

В качестве примера возьмем модель со 100 миллиардами параметров. Если используется 4-битное квантование, для каждого параметра теоретически требуется только 4 бита памяти, поэтому только сами параметры модели требуют около 50 ГБ памяти. В реальной работе пространство также должно быть зарезервировано для операционной системы, других приложений, контекстного кэша и временных данных во время вывода. Таким образом, 50 ГБ — это не полный объем памяти, необходимый мобильному телефону для бесперебойной работы модели.

Если модель дополнительно квантуется до 2 бит, для каждого параметра требуется только 2 бита, а теоретические требования к памяти для параметров модели могут быть уменьшены примерно до 25 ГБ. Однако это решение по-прежнему требует, чтобы мобильные телефоны имели объем памяти, намного превышающий объем памяти нынешних основных продуктов, а квантование с чрезвычайно низкой точностью может значительно ухудшить качество вывода модели, особенно в сложных задачах вывода.

Следует отметить, что количество параметров не определяет напрямую полные возможности модели. Данные обучения, архитектура, методы обучения и методы вывода различных моделей будут влиять на конечную производительность. Вполне возможно, что небольшая оптимизированная модель превзойдет более крупную модель при выполнении конкретной задачи. Таким образом, даже если мобильный телефон на данный момент не может напрямую запускать модель со 100 миллиардами параметров, это не означает, что он не может обеспечить реальный опыт использования, близкий к опыту использования большой модели.

В настоящее время все еще существует явный разрыв между конфигурацией памяти смартфонов и емкостью, необходимой для сотен миллиардов моделей параметров. Раньше некоторые флагманские телефоны Android имели 24 ГБ памяти LPDDR5X. Однако из-за нехватки памяти и роста цен производители мобильных телефонов начали переоценивать коммерческую ценность версий с большим объемом памяти. Для обычных потребителей увеличение объема памяти означает более высокие затраты на оборудование, и производителям мобильных телефонов сложно определить, готовы ли пользователи платить дополнительно за использование более крупных локальных моделей искусственного интеллекта.

Это создает противоречие: компании, занимающиеся искусственным интеллектом, надеются, что мобильные телефоны будут иметь все более мощные локальные вычислительные возможности, но память, необходимая для достижения этой цели, становится все дороже и ее трудно получить.

Глобальный запас памяти ограничен, что тесно связано с быстрым расширением центров обработки данных искусственного интеллекта. Крупные технологические компании продолжают инвестировать в серверы искусственного интеллекта, которым требуются большие объемы DRAM, памяти с высокой пропускной способностью и высокоскоростных устройств хранения данных. Производители памяти также уделяют все больше внимания продуктам, связанным с искусственным интеллектом, которые пользуются большим спросом и более высокой прибылью при организации производства. Таким образом, традиционная память, необходимая для потребительского электронного оборудования, находится под давлением.

Хотя маломощная DRAM, используемая в смартфонах, и память с высокой пропускной способностью, используемая в ускорителях искусственного интеллекта, различаются по структуре продукта и производственным требованиям, на них по-прежнему влияют изменения в распределении производственных мощностей, а также рыночном спросе и предложении во всей полупроводниковой промышленности. Чем выше спрос на память со стороны инфраструктуры искусственного интеллекта, тем сложнее производителям бытовой электроники будет поддерживать прежние условия с точки зрения цен и предложения.

Это давление отразилось на затратах на производство мобильных телефонов. Ранее опубликованный анализ исследовательской компании Counterpoint Research показал, что во втором квартале 2026 года цены на память для смартфонов выросли более чем на 80% по сравнению с предыдущим кварталом. Среди мобильных телефонов разных ценовых категорий рост стоимости памяти оказывает существенное влияние на общие затраты на материалы.

В компании Counterpoint отметили, что стоимость спецификации мобильных телефонов среднего класса выросла примерно на 52 % по сравнению с прошлым годом, а на долю памяти пришлось примерно 40 % от общей стоимости спецификации. Пострадали и мобильные телефоны высокого класса, а DRAM даже превзошла чипы системного уровня и стала самым дорогим компонентом в некоторых флагманских мобильных телефонах.

Это означает, что производители мобильных телефонов должны не только подумать, есть ли у них возможность настроить 50 ГБ или более памяти для моделей со 100 миллиардами параметров, но также должны ответить на более реалистичный вопрос: готовы ли потребители платить за эту память?

Если просто использовать большие модели, необходимо увеличить память мобильного телефона с нынешних 12 или 16 ГБ до 64 ГБ или даже выше, а стоимость всей машины может значительно возрасти. В сочетании с более мощными процессорами, усовершенствованной упаковкой и тепловой конструкцией цена конечного продукта может оказаться еще дальше от диапазона, приемлемого для обычных потребителей.

Qualcomm и Apple пытаются решить эту проблему с помощью архитектуры чипов и технологии упаковки. В связанных отчетах упоминается, что Apple A20 Pro и флагманская платформа нового поколения Qualcomm Snapdragon изучают конструкции чипов и методы организации памяти, которые более благоприятны для работы больших моделей, в надежде повысить эффективность доступа к данным и снизить накладные расходы на передачу данных между процессором и памятью.

Однако повышение эффективности инкапсуляции и доступа к данным не означает, что требования к физической памяти автоматически исчезнут. Даже если процессор сможет использовать память более эффективно, сама модель со 100 миллиардами параметров все равно должна сохранять много данных параметров. Чтобы сделать модели такого масштаба по-настоящему адаптируемыми к мобильным телефонам, отрасли, возможно, потребуется совершить дальнейшие прорывы в области сжатия моделей, архитектуры вывода и доступа к памяти.

Одним из возможных решений является более радикальная технология количественного анализа. За счет уменьшения количества битов, используемых для каждого параметра, модель может работать в меньшем пространстве памяти. Однако количественная оценка не обходится без затрат. Для задач, требующих сложных логических рассуждений, слишком низкая числовая точность может привести к значительному ухудшению производительности модели. Поэтому вопрос о том, как найти баланс между использованием памяти и качеством модели, станет важным направлением исследований для конечного ИИ.

Другим решением является гибридная экспертная модель, представляющая собой архитектуру MoE. В отличие от традиционных интенсивных архитектур, требующих вызова всей модели для каждого вывода, модель MoE выбирает часть экспертной сети для участия в расчетах на основе конкретных задач. При правильном проектировании каждый раз при обработке токена необходимо активировать лишь небольшой набор параметров модели.

Если технология выгрузки экспертов будет принята в дальнейшем, система сможет сохранять эксперты, необходимые в данный момент, в DRAM, а эксперты, которые временно не нужны, - во флэш-памяти. Когда для процесса вывода требуются другие эксперты, соответствующие данные считываются из флэш-памяти в память.

Этот подход может уменьшить объем данных, которые модель должна одновременно хранить в DRAM, но за счет увеличения доступа к хранилищу и накладных расходов на передачу данных. Характеристики скорости доступа и задержки флэш-памяти UFS, используемой в мобильных телефонах, существенно отличаются от DRAM. Если модель часто считывает параметры из флэш-памяти, это может повлиять на скорость вывода.

Apple также ранее изучала возможность использования встроенной памяти устройства для запуска больших языковых моделей. Ожидается, что этот тип технологии уменьшит зависимость от емкости DRAM, но возможность достижения достаточно низкой задержки, высокой пропускной способности и приемлемого энергопотребления на мобильных телефонах все еще требует дальнейшей проверки.

Кроме того, непрерывная работа больших моделей также может привести к проблемам с рассеиванием тепла и сроком службы батареи. Внутреннее пространство мобильных телефонов ограничено, и они не могут быть оснащены масштабными системами охлаждения, как настольные компьютеры или серверы. Если процессор выполняет интенсивный вывод искусственного интеллекта в течение длительного времени, температура чипа может продолжать расти, что впоследствии запускает механизм снижения частоты, что приводит к снижению производительности.

Особенно остро эта проблема стоит для агентов, которым необходимо работать круглосуточно. Традиционные чат-боты обычно начинают обработку задач после того, как пользователь делает запрос, но новому поколению ИИ-агентов, возможно, потребуется постоянно отслеживать информацию, анализировать контекст и активно выполнять операции в подходящее время. Если телефон должен работать на больших моделях круглосуточно, не только память должна быть доступна в любое время, но также необходимо жестко контролировать энергопотребление процессора и расход заряда батареи.

Поэтому, даже если будущий мобильный телефон сможет успешно загружать модель со 100 миллиардами параметров, это не означает, что он сможет продолжать работать с идеальной скоростью. Может ли модель действительно находиться в памяти, сколько слов она может обрабатывать в секунду, сколько тепла она выделяет во время работы и какое влияние она оказывает на срок службы батареи — все это важные показатели для измерения фактической полезности использования.

По сравнению с непосредственным подключением модели со 100 миллиардами параметров к мобильному телефону, более реалистичным решением может быть запуск очищенной и оптимизированной модели среднего размера.

Дистиллация модели обычно использует возможности большой модели для обучения меньшей модели, чтобы последняя могла максимально сохранить производительность большой модели в конкретной задаче при значительном уменьшении масштаба параметров. Wccftech считает, что правильно очищенная модель с 20–30 миллиардами параметров может приблизиться к производительности модели со 100 миллиардами параметров при выполнении определенных задач и, следовательно, более подходит для того, чтобы стать основной силой локального ИИ в будущих смартфонах.

Преимущество этого решения заключается в том, что оно не требует чрезвычайно большого объема памяти и имеет возможность предоставить довольно мощные возможности рассуждения. Производителям мобильных телефонов вместо того, чтобы просто гоняться за тем, сколько параметров можно учесть, лучше добиться лучшего фактического опыта с ограниченными аппаратными ресурсами за счет архитектуры модели, количественного анализа, дистилляции и оптимизации вывода.

Конечно, производительность разных моделей сильно различается, и модель с 20–30 миллиардами параметров не может заменить модель со 100 миллиардами параметров для всех задач. Такие возможности, как сложные рассуждения, экспертные знания и обработка длинного контекста, по-прежнему зависят от обучения и проектирования архитектуры конкретных моделей. Но с точки зрения производства возможность выполнять большинство повседневных задач при разумном энергопотреблении и стоимости может быть более ценной, чем стремление к чистому масштабированию параметров.

Заявление генерального директора Qualcomm также отражает тот факт, что индустрия смартфонов ищет новые направления роста. Поскольку предельные выгоды от модернизации традиционного оборудования постепенно уменьшаются, производители мобильных телефонов надеются использовать агенты искусственного интеллекта, чтобы по-новому определить способы использования устройств.

Смартфоны будущего могут перестать быть просто устройствами, ожидающими, пока пользователи откроют приложения и ввести команды, а скорее личными помощниками, которые смогут постоянно понимать потребности, организовывать задачи и вызывать различные службы в рамках авторизации пользователя. Такие системы требуют более сильных возможностей локального рассуждения, а также более эффективного управления памятью, вычислений с низким энергопотреблением и механизмов безопасности.

Однако между целями отрасли и конечным продуктом по-прежнему существует большая дистанция. Amon не назвала название конкретной компании-партнера и не предоставила полную дорожную карту оборудования или график массового производства. 2028 год больше подходит для понимания как целевого времени, когда некоторые компании, занимающиеся искусственным интеллектом, надеются достичь этой возможности, а не как дата выпуска продукта, подтвержденная Qualcomm.

Судя по текущим техническим условиям, для мобильных телефонов в 2028 году не является абсолютно невозможным запуск сотен миллиардов моделей параметров, но метод реализации может отличаться от того, что люди представляют себе, «загружая все полные модели в память мобильного телефона». Более агрессивное квантование, архитектура MoE, экспертная разгрузка, дизайн выделенной памяти и дистилляция модели — все это может быть частью достижения цели.

В то же время глобальные тенденции поставок памяти и цен будут напрямую влиять на коммерческую жизнеспособность этого направления. Если поставки DRAM потребительского уровня будут ограничены центрами обработки данных искусственного интеллекта в течение длительного времени, даже если технически возможно производство мобильных телефонов с памятью 64 ГБ и более, производители, возможно, не захотят выпускать такие продукты в больших масштабах.

Поэтому концепцию Qualcomm о мобильном телефоне со 100 миллиардами параметров действительно необходимо реализовать не только с точки зрения производительности чипа, но и с точки зрения полного баланса между размером модели, объемом памяти, себестоимостью производства, рассеиванием тепла, временем автономной работы и потребительским спросом. Для обычных пользователей самым примечательным вопросом в будущем может быть не то, сможет ли мобильный телефон работать с моделью со 100 миллиардами параметров, а сможет ли он предоставлять надежные, быстрые и по-настоящему полезные локальные услуги искусственного интеллекта без значительного увеличения цены или серьезного ущерба для времени автономной работы.

Связанные теги

Похожие статьи

Комментарии

0/500
Captcha (click to refresh)
Нет комментариев