Claude Fable 5.1: обзор и первые впечатления
Начну нетипично. Fable 5.1 выходит почти через три месяца после Fable 5 – и это дольше весеннего графика Anthropic, когда модели обновлялись каждые два и даже полтора месяца. После инцидента с властями США, компания осторожничает и тратит лишнее время на дополнительные проверки.
Но вот что интересно: Fable 5 и GPT-5.6 – первые на моей памяти модели, свежего релиза после которых я почти и не ждал. Не было времени: до последнего дня все упиралось не в возможности модели, а в наличие у меня новых интересных вопросов – я проводил с ними эксперименты, о которых полгода назад просто не задумался бы.
Разумеется, Fable 5.1 ответит на еще больше вопросов. В первую очередь – научных.
После серии открытий, сделанных Fable 5 и GPT-5.6 Sol, именно наука стала новой любимой витриной ИИ-компаний. Поэтому, соответствующий бенчмарк в анонсе вынесен вперед.
В Terminal-Bench-Science 0.1, где модель должна взять сложную исследовательскую задачу и автономно довести ее до конца, новинка показывает 52,6% против 29,0% у ближайшего преследователя, Opus 5.
Предположительно, именно Fable 5.1 стоит за увеличением доли нулей дзета-функции Римана на критической прямой с 41,6% до 67,2% и за августовским контрпримером Левента Альпёге к гипотезам Каратеодори и Лёвнера.
Во время тестов она:
— построила новую карту высот трети Венеры, обучив нейросеть на снимках зонда Magellan тридцатилетней давности: детали различимы на 2–3 километрах вместо 10–20, высоты точнее на четверть.
— спроектировала белковые связыватели, с которых начинается разработка лекарств: на трех мишенях сродство в десять раз выше лучших работ конкурса Adaptyv Bio, а доля дизайнов, сработавших в пробирке, — почти 50% на двенадцати мишенях при сегодняшней норме в 10–15%.
— переписала GPU-ядра семи открытых биологических моделей: ускорение до 2,5 раз при идентичном результате. Команде инженеров это стоило бы недель.
Отдельно — шифр, над которым бились с XIX века. Шотландец Томас Уркхарт спрятал в конце трактата 1653 года две строки по 32 числа; частотный анализ и подстановки не работали, а ключом оказалась сама книга: криптограмма напечатана сразу после 32 разделов, и каждое число указывает номер слова в соответствующем разделе, из первых букв складывается молитва за Карла II. Fable 5.1 дошла до этого за 44 минуты без вмешательства человека, а следом тем же способом расшифровала второй шифр того же автора. Автор эксперимента месяцами безуспешно гонял по нерешенным шифрам другие модели и честно пишет: выдающегося криптоанализа тут нет, подсказка простая. Модель перебрала кучу загадок, выбрала ту, что поддается, и не бросила.
В коде и офисных задачах рост в единицы процентов – следствие того, что модель и раньше выполняла их хорошо. Выбиваются агентные: в бизнес-задачах AutomationBench скачок с 17,1% до 31,4%, а на браузерном бенчмарке компании Browserbase – 82% задач против 74% у Opus 5 и 57% у Fable 5, при меньшем расходе токенов.
Прорыв в кибербезопасности есть, но не там, где ждали: уязвимости модель находит не лучше прежнего, зато рабочий эксплойт из готового краша в Firefox собирает в 245 случаях из 250 против 52% у Opus 5. То есть научилась не находить, а доводить находку до оружия.
Зато Anthropic осмелились ослабить классификаторы безопасности – в кибере и биологии, больше нигде. Ложных срабатываний в Claude Code обещают на 60% меньше, а по вопросам о биологии – на 85%.
Цена в API осталась прежней из исключением кэшированных запросов – они подешевели на 75%. При этом Anthropic утверждает, что Fable 5.1 в режимах рассуждений Low или Medium дает такой же или лучший результат, чем Fable 5 High.
Дальше будет еще интереснее. OpenAI только что выпустила блог-пост о том, как готовила GPT Astra к запуску – а значит выход в этот четверг кажется очень вероятным.
—
О том, как выжимать максимум из новых моделей, я рассказываю на “Бусти”. Там личный опыт, практика ведущих ИИ-экспертов – плюс недавно я начал обновлять старые тексты, чтобы у вас под рукой всегда был актуальный курс по ИИ.
Самое время подписаться!
Post #659
7.52K

- ❤ 39
- 👍 34
- 🔥 4
- 😁 1