Аннотация:
После постоянного улучшения возможностей рассуждений, кода и агентов компания DeepSeek наконец добавила визуальные возможности в V4. Утром 31 августа DeepSeek находился в Хаггинге. Face открыла веса моделей DeepSeek-V4-Flash-Vision-Exp, и разработчики могут напрямую загружать веса моделей и самостоятельно их развертывать. Помимо файлов моделей, официальный склад также включает реализации ссылочного вывода таких компонентов, как визуальный кодировщик и Aligner, а также охватывает DFlash. Внимание, МО, Гипер-Соединения и DSpark и другие части.

Всего 10 дней назад компания DeepSeek официально анонсировала модель V4-Flash-Vision-Exp с масштабом примерно 305 миллиардов параметров. По букве «Exp» в названии легко понять, что это первая экспериментальная мультимодальная модель серии V4. Он построен на архитектуре V4-Flash. Добавляя визуальный модуль и продолжая обучение, модель получает возможность обрабатывать изображения.
Что касается простых текстовых задач, чиновник сообщил, что V4-Flash-Vision-Exp и V4-Flash в целом находятся на одинаковом уровне. Основное отличие состоит в том, что новая модель может распознавать содержимое фотографий, читать текст на скриншотах, анализировать диаграммы, а также использовать изображения в рабочем процессе агента, вместо того, чтобы полагаться исключительно на текстовые описания.
Кейсы, продемонстрированные DeepSeek, включают создание PPT в соответствии с требованиями, чтение и изменение веб-страниц, а также создание интерфейсных страниц с динамическими эффектами.

Общим для этих задач является не распознавание изображений в традиционном понимании, а то, что модели необходимо сначала понять визуальный контент, а затем объединить код, рассуждения и вызовы инструментов для выполнения последующих операций. Судя по бенчмарк-тесту, опубликованному DeepSeek, после добавления визуальных возможностей V4 уже близок к мультимодальной большой модели Anthropic Claude Opus 4.8, которую он выбрал для сравнения в некоторых мультимодальных агентских задачах.
В частности, в тесте ApexBench показатель Pass@1 V4-Flash-Vision-Exp составил 36,5, что ниже, чем у Opus-4.8 — 39,4. Чартография составляет 64,3 и 65,0 соответственно, разрыв небольшой. На последнем экзамене агентов DeepSeek набрал 27,3 балла, что выше, чем у Opus-4.8 25,7. Оценка Pass@5 в ZeroBench составляет 35,0, что также выше, чем у Opus-4.8 34,0.

Среди четырех мультимодальных тестовых данных двое превысили Opus-4.8
Стоит отметить, что недавно добавленный визуальный модуль существенно не жертвует исходными возможностями текстового агента V4-Flash.
Например, в Terminal Bench 2.1 версия Vision набрала 83,9 балла, а V4-Flash-0731 ранее набрала 82,7 балла; Оценка DeepSWE выросла с 54,4 до 59,3, превысив официально указанный показатель Opus-4,8, равный 58,0. Однако NL2Repo составляет всего 57,7, что значительно ниже 69,7 у Opus-4.8, а CyberGym упал с прежних 76,7 до 75,3. Таким образом, DeepSeek оценивает свои возможности работы с открытым текстом как «на одном уровне» с V4-Flash.
С другой стороны, зрительные способности сами по себе имеют пределы. Это не визуальная система, которая может бесконечно считывать детали высокой четкости.
Согласно документации DeepSeek API, модель поддерживает изображения JPEG, PNG, GIF и WebP и может принимать одно или несколько изображений. Однако перед входом в модель изображение будет масштабировано в соответствии с размером. Изображения большего размера в конечном итоге будут сжаты до общего объема пикселей, эквивалентного примерно 800×800, и каждое изображение будет занимать до 384 токенов.
Причиной выбора этого подхода является контроль вычислительных затрат, связанных с визуальным вводом. Однако масштабирование изображения также может быть ограничением для задач, которые конкретно полагаются на мелкий текст, локальные текстуры или собственное разрешение.
Но, несмотря ни на что, DeepSeek наконец-то наверстал упущенное у V4.
Комментарии