Аннотация:
Выпущены Fable 5.1 и Mythos 5.1! Он занял первое место во всех 8 публичных тестах производительности, а цена упала до 45%. Особенно в области научных исследований и кодирования он явно оставил позади Fable 5 и своего соседа GPT-5.6 Sol. С более интуитивной точки зрения, теперь работает Fable 5.1 со средним и низким уровнями вывода, производительность в основном эквивалентна старой версии Mythos 5 с чрезвычайно высоким или даже самым высоким уровнем вывода. В этой волне «Басня» убила «Мифос».


Что касается цены, в Fable 5.1 цена чтения кэша снижена до 0,25 доллара США за миллион токенов, то есть на 75 %.
Цены на входе и выходе соответствуют ценам Fable 5 и составляют 10 и 50 долларов за миллион токенов соответственно.
Кажется, что была снижена только одна цена, но фактическое влияние относительно велико, поскольку в задаче агента на чтение кэша приходится большая часть затрат.
По данным Anthropic, стоимость типичных рабочих нагрузок примерно на 25 % ниже, чем в Fable 5. Если это высокоинтеллектуальная задача, можно сэкономить до 45 %.

В официальном релизном видео есть что сказать:
Независимо от того, какую задачу вы раньше поручили Клоду, Fable 5.1 сможет сделать больше и сделать самые сложные части лучше.

Он делает это потому, что хорошо справляется с многоэтапными задачами.
В задачах такого типа, если на втором этапе произойдет небольшая ошибка, к 40-му шагу все рухнет, но Fable 5.1 может обеспечить стабильный результат на протяжении всего процесса.
Если вы столкнулись с проблемой, которую невозможно решить, система сообщит вам, какие решения вы пробовали и где застряли.
Исследователь Фликс Ризеберг также особо отметил, что с точки зрения написания Fable 5.1 сокращает использование жирных шрифтов, использует меньше заголовков, списков или кавычек и лучше следует стилям.
Я хочу сказать, можете ли вы, кстати, открыть исходники своих советов по стилю?

Сохраняя свою форму, Fable 5.1 открыта для всех пользователей, а Mythos 5.1 доступен только проверенным организациям в области кибербезопасности и медико-биологических наук через программу доверенного доступа.
Практические научные исследования: дизайн белков, создание карт Венеры, ускорение на графическом процессоре
Помимо подсчета очков, Anthropic также продемонстрировала практические результаты Fable 5.1 и Mythos 5.1 в области научных исследований.
Что касается проектирования белков, Anthropic использовала Mythos 5.1, чтобы использовать инструменты проектирования белков и сворачивания с открытым исходным кодом для разработки белков с высоким сродством связывания, и отправила план двум внешним организациям для экспериментальной проверки.
По трем мишеням аффинность связывания конструкции Mythos 5.1 была в 10 раз выше, чем у лучшего решения в конкурсе по разработке белков Adaptyv Bio. По всем 12 целям уровень достижения был близок к 50 процентам по сравнению с типичным показателем успеха в нынешней области дизайна белков, составляющим от 10 до 15 процентов.
Белки, связывающиеся с высоким сродством, являются первым шагом во многих распространенных процессах разработки лекарств и напрямую определяют, может ли лекарство работать в более низких дозах.

В астрономии Fable 5.1 обучила нейронную сеть на основе радиолокационных изображений, полученных космическим кораблем НАСА «Магеллан» более 30 лет назад, для создания новой топографической карты одной трети поверхности Венеры в высоком разрешении.
Ранее доступные топографические карты покрывали только одну пятую Венеры с разрешением от 10 до 20 километров. В Fable 5.1 разрешение увеличено до 2–3 километров, а точность высоты на 25 % выше, чем раньше. Эта карта была выпущена с открытым исходным кодом по лицензии CC и будет использоваться в качестве справочного материала для предстоящих миссий NASA VERITAS и ESA EnVision, чтобы помочь определить ключевые геологические особенности для будущих наблюдений.

С точки зрения вычислительной биологии, Mythos 5.1 повышает скорость работы семи моделей глубокого обучения с открытым исходным кодом до 2,5 раз за счет написания собственных ядер графического процессора и кэширования промежуточных результатов, а выходные данные полностью согласованы.

В реальных исследованиях биологам, возможно, придется запускать эти модели тысячи раз, проверяя все возможные мутации рядом с каждым геном человека. Оптимизированные модели могут снизить затраты на графические процессоры на 30–60 %.

Такая оптимизация обычно занимает несколько недель, и многие академические лаборатории просто не могут себе этого позволить. Однако Mythos 5.1 сделал это всего за несколько дней и опирался исключительно на открытый исходный код.
Anthropic планирует открыть исходный код этих оптимизаций в ближайшем будущем.
Механизм защиты от дистилляции подключен к сети
С выпуском Fable 5.1 появились некоторые особые правила и изменения API.
Давайте сначала кратко поговорим о безопасности.
Показатель ложных срабатываний сетевой безопасности в Fable 5.1 на 60% ниже, чем в Fable 5. Теперь его разрешено использовать для обнаружения уязвимостей программного обеспечения, но разработка эксплойтов по-прежнему запрещена. Задачи двойного назначения, такие как тестирование на проникновение, генерация эксплойтов, сканирование уязвимостей на основе двоичных файлов и т. д., по-прежнему будут перенаправлены на модель серии Opus.
Доля ложноположительных результатов по базовым вопросам биологии и медицины сократилась на 85 %, но запросы, связанные с исследованиями и разработками в области биологических наук, по-прежнему направляются на обработку модели Opus, и профессионалам необходимо получить доступ через Программу проверки медико-биологических наук (LSVP) Mythos 5.1.
Тогда давайте поговорим о недавно добавленном механизме антидистилляции.
Начиная с сегодняшнего дня вновь зарегистрированные учетные записи API не могут вручную редактировать контекст Клода в нескольких раундах разговоров, сохраняя при этом записи цепочки мыслей.
Существует распространенный метод, который был публично зафиксирован ранее: ручное вмешательство в предыдущий контекст Клода в нескольких раундах разговоров, но намеренное сохранение записи цепочки мыслей. Это позволяет модели воспроизвести свои рассуждения под другим набором инструкций под новым, возможно, враждебным набором инструкций.
Эта дорога сейчас заблокирована.

Подход заключается в добавлении подписи к каждому блоку цепочки мышления.
Когда пользователь отправляет ответ помощника обратно в API в последующих запросах, система будет использовать эту подпись для двух целей: проверить, имеет ли текущая модель право читать этот блок, и проверить, является ли весь диалог перед этим блоком (включая слова системных подсказок, список инструментов и все исторические сообщения) точно таким же, как при его первоначальном создании.
Проверка подписи не будет выполнена, если кто-либо прикоснется к чему-либо в разговоре.
Что делать после сбоя, зависит от параметра prefix_mismatch_behavior, установленного разработчиком: значение по умолчанию — «ошибка», которое напрямую возвращает код состояния 400, и запрос отклоняется; если установлено значение «drop_block», система молча сбросит блок и все мыслительные цепочки после него, а сам запрос будет выполнен в обычном режиме.
Отброшенная часть не учитывается (люди какие-то странные) и будет указана в массиве input_transformations в ответе.

Какие операции приведут к сбою проверки?
В документации представлен подробный список: редактирование, перестановка или удаление любых предыдущих сообщений пользователя/помощника/системы, изменение слова системной подсказки верхнего уровня, внесение любых дополнений, удалений или переименований в список инструментов, удаление блока цепочки мыслей из истории разговора, но сохранение последующих блоков, а также ссылка на URL-адрес изображения или документа, который возвращал различное содержимое между запросами.
Любое из вышеперечисленного приведет к тому, что все последующие блоки цепочки мышления станут недействительными.

И наоборот, некоторые операции безопасны:
Добавление новых сообщений в конце разговора, удаление блока цепочки мышления из начала истории, изменение параметров запроса, таких как max_tokens, увеличение или уменьшение тегов кэша_контроля, а также сжатие на стороне сервера или редактирование контекста не приведут к сбоям проверки.
Существует также схема проверки цепочки. Каждый блок цепочки мышления записывает информацию своего предыдущего блока, образуя перекрестную цепочку. Блоки можно удалять из головы цепочки, но если один из них удалить из середины, каждый следующий за ним блок станет недействительным, а вся цепочка станет недействительной с момента разрыва.
Чтобы разработчики не застряли, Anthropic также предлагает ряд альтернатив, которые позволяют добиться того же эффекта, не затрагивая историю.
Нужно изменить инструкции на полпути? Используйте системные сообщения в середине разговора вместо прямого изменения слова-подсказки верхнего уровня.
Нужно добавить временное напоминание для каждого раунда? Используйте системное сообщение раундового уровня с параметромclear_at, чтобы заменить старый метод «сначала вставить, а затем удалить».
Нужно добавить или удалить инструменты на полпути? Используйте блокиtool_addition иtool_removal вместо непосредственного редактирования списка инструментов.
Нужно вырезать контекст? Замените грубое усечение на стороне клиента сжатием и контекстным редактированием на стороне сервера.
Если вы используете официальные продукты, такие как Claude Code, claude.ai, Claude Managed Agents или Claude Agent SDK, вам не нужно ничего менять. Они автоматически гарантируют, что префикс разговора не будет подделан.
Но если вы разработчик, который напрямую вызывает API сообщений, Anthropic предлагает использовать массив сообщений только для добавления, а затем запустить полный многораундовый тест сеанса с prefix_mismatch_behavior, установленным в режим «drop_block», чтобы увидеть, есть ли в журнале какие-либо записи prefix_binding_mismatch.
В итоговом документе также конкретно упоминается сценарий, при котором легко попасть в беду.
Если вы поддерживаете инструмент или платформу, а пользователи используют свои собственные ключи API для его вызова, вновь зарегистрированные пользователи пройдут эту проверку раньше. Поскольку собственный ключ разработчика, скорее всего, будет зарегистрирован до 31 августа, он еще не вступил в силу.
В этом случае рекомендуется заранее установить prefix_mismatch_behavior и протестировать его заранее. Не ждите, пока пользователи выйдут из строя, прежде чем вы об этом узнаете.
Еще кое-что
При таком большом волнении, исходившем от компании А, соседний OpenAI определенно не сможет сидеть на месте.
Но их новая модель Astra действительно еще не готова, поэтому сначала им придется дать символический превью.

По случаю выхода Fable 5.1 и OpenAI Astra Илья также редко выступал с высказываниями, призывая к усилению сетевой безопасности.

Комментарии