Аннотация:
Эксперимент, проведенный разработчиком, показывает, что подключение iPhone 17 Pro Max к MacBook Pro, оснащенному чипом M4 Pro, с помощью специального программного обеспечения может значительно повысить эффективность работы локальной модели большого языка. При использовании модели Qwen3.8-27B производительность предварительного заполнения системы повышается до 44%.

Основой этого эксперимента является то, что большие языковые модели предъявляют чрезвычайно высокие требования к видеопамяти и объему системной памяти. Хотя MacBook Pro, оснащенный чипом M4 Pro, имеет 24 ГБ унифицированной памяти, он по-прежнему ограничен объемом памяти и размером контекстного окна при работе с большой моделью с 27 миллиардами уровней параметров. Поэтому разработчики попытались использовать iPhone 17 Pro Max в качестве дополнительного вычислительного узла для запуска моделей совместно с MacBook Pro через интерфейс USB-C.
Согласно заявленному разработчиком плану, MacBook Pro отвечает за обработку вычислительных задач от уровня 1 до уровня 40 в каждой партии из 256 токенов и передает промежуточные данные активации на iPhone в режиме реального времени. Впоследствии iPhone 17 Pro Max использует графический процессор в чипе A19 Pro для продолжения выполнения операций с уровня 41 по 64, в то время как Mac одновременно начинает обработку следующего пакета данных. Благодаря такому конвейерному разделению труда два устройства могут одновременно участвовать в процессе вывода модели.
Результаты эксперимента показывают, что по сравнению с запуском модели только на MacBook Pro скорость предварительного заполнения значительно улучшилась после появления iPhone. В контекстном окне 8K скорость обработки увеличивается со 132 токенов в секунду до 177 токенов, увеличение на 35%; в контекстном окне 16 КБ производительность увеличивается со 109 токенов в секунду до 157 токенов, увеличение на 44%; в сценарии контекстного окна 32 КБ скорость обработки увеличивается со 101 токена в секунду до 130 токенов, увеличение примерно на 29%.
Помимо совместных вычислений на графическом процессоре, в некоторых задачах также участвует механизм нейронной сети в чипе A19 Pro. Разработчики заявили, что каждый исторический контекст 16 тыс. будет преобразован в специальную модель нейронной сети для обработки. В масштабе контекста 140 000 токенов время записи одного токена сокращается с 279 миллисекунд при использовании только графического процессора до 176 миллисекунд, что еще больше повышает эффективность работы в сценариях с длинным контекстом.
Однако это решение не лишено ограничений. Разработчики отметили, что iPhone в основном помогает повысить производительность этапа предварительного заполнения, в то время как в задачах генерации текста размером менее 64 КБ большая часть фактической работы по рассуждению по-прежнему выполняется в основном Mac. Кроме того, данное решение требует специально разработанной программной поддержки и на данный момент не подходит для непосредственного развертывания обычными пользователями.
Тем не менее, этот эксперимент демонстрирует потенциал устройств Apple потребительского уровня для локальных вычислений с использованием искусственного интеллекта. Поскольку производительность мобильных чипов продолжает улучшаться, в будущем между смартфонами, планшетами и персональными компьютерами может быть сформирована более гибкая совместная вычислительная система, тем самым уменьшая зависимость от аппаратной конфигурации одного устройства для запуска больших моделей искусственного интеллекта.
Комментарии