1 сентября 2026 года, в день выхода Claude Fable 5.1, Simon Willison прогнал новую модель через свой «пеликаний бенчмарк»: один и тот же промпт про велосипедного пеликана на пяти уровнях reasoning — и впервые за долгое время получил результат, который назвал лучшим у Anthropic. Заодно вскрылись вещи поважнее картинки: как модель распределяет токены между уровнями effort, почему отключить reasoning нельзя и как сравнивать модели по одному и тому же промпту. Ниже — перевод-разбор этого теста и инструкция, как повторить его самому. Дата «на момент публикации» — 07.09.2026.
С чего началось: «но как хорошо она умеет в пеликанов?»
В день релиза Fable 5.1 Anthropic публикует анонс с акцентом на научные бенчмарки — Terminal-Bench-Science 0.1, где модель берёт 52.6% против 24.7% у Fable 5. У Simon Willison, который каждую заметную модель гоняет через свой личный тест, реакция прагматичная:
But how well can it pelican?
«Но как хорошо она умеет в пеликанов?»
Пеликаний бенчмарк — личный полигон Willison ещё с 2025 года: модель должна сгенерировать SVG-изображение пеликана, едущего на велосипеде. В июле 2026 года он писал, что теряет веру в этот тест — корреляция между «хорошим пеликаном» и реальными способностями модели ослабла (пост про Kimi K3, июль 2026). Поэтому в заметке про Fable 5.1 он сразу же уточняет, что именно теперь даёт тесту ценность:
The most interesting insights I get from it now are comparisons within model families, and particularly comparisons for the same prompt at different reasoning effort levels.
«Самое интересное, что я получаю от него сейчас, — сравнения внутри модельного семейства и особенно сравнения одного и того же промпта на разных уровнях reasoning-effort.»
Это ровно то, что сделала Fable 5.1: у неё пять уровней reasoning — low, medium, high, xhigh, max — и, в отличие от ряда моделей конкурентов, нет варианта выключить reasoning вовсе. Один промпт, пять глубин рассуждения, и по результатам видно, за что платишь.
Подготовка: починить запись reasoning-трейсов
Прежде чем гонять промпты, Willison наткнулся на баг в своём инструменте llm-anthropic — CLI-обёртке над API Anthropic: reasoning-трейсы (мышление модели) записывались некорректно. Без них сравнение уровней effort невозможно: не видно, сколько модель «думала» и о чём. Он починил issue в репозитории (issue #88, llm-anthropic) и только потом запустил тесты.
Это хорошая иллюстрация того, как устроен тест: результат важен не сам по себе, а вместе с reasoning-трейсом — иначе нельзя понять, почему модель потратила 36 000 токенов вместо 2 000.

Пять прогонов одного промпта: что показали числа
Промпт у всех уровней одинаковый — «Generate an SVG of a pelican riding a bicycle». Разница только в параметре effort. Полные результаты (SVG + reasoning-транскрипт каждого уровня) Willison выложил в gist. Сводка чисел:
| Effort | Reasoning-трейс | Выходных токенов | Время | Цена |
|—|—|—|—:|—:|—:|
| low | не показан | 1 998 | 23.8 с | $0.100 |
| medium | не показан | 1 977 | 23 с | $0.099 |
| high | короткий план (~2.6K) | 2 612 | 29.6 с | $0.131 |
| xhigh | длинный многошаговый | 36 767 | 7 мин 51 с | $1.83 |
| max | итерации по деталям | 65 927 | 13 мин 54 с | $3.30 |
Таблица — по данным теста Simon Willison от 01.09.2026. Цены посчитаны на llm-prices.com.
Разброс по цене между low и max на одном и том же промпте — в 33 раза, с $0.10 до $3.30. Разброс по выходным токенам — тоже 33 раза. Это, пожалуй, самый наглядный из известных замеров того, что такое reasoning-effort в деньгах.

Загадка: на low и medium reasoning «не показан»
Первое, что озадачило Willison, — на low и medium модель вообще не выдала видимого reasoning-трейса. У Fable 5.1 reasoning включён всегда (adaptive thinking, always-on), поэтому отсутствие трейса странно. При этом на high появился короткий план — впрочем, Willison честно замечает, что по качеству картинки high почти не отличается от low/medium.
Объяснение, скорее всего, в том, как устроен выход модели: у Claude счётчик выходных токенов включает reasoning-токены, и на low/medium модель просто не генерирует отдельный публичный reasoning-блок для этого простого промпта. Для практики это значит: «always-on thinking» не означает «видимый трейс на любой задаче» — на простых промптах модель может опускать размышления даже на средних уровнях.
xhigh и max: где деньги идут в качество
На xhigh картина меняется радикально — 36 767 токенов, 7 минут 51 секунда, $1.83. Reasoning-трейс разворачивается в многошаговое рассуждение: добавление крыла к рулю, ног к педалям, хвостового пера, «пеликан намеренно больше велосипеда для комического эффекта». Модель даже рассуждает о стилистике: «приму лёгкую толстоватость как очаровательную, а не буду переусложнять».

На max модель делает 65 927 токенов за 13 минут 54 секунды ($3.30) — и упирается в детали, о которых на нижних уровнях речи не было. Из reasoning-трейса:
Now I’m debating a bicycle helmet on the head versus the pelican’s signature crest — the beak and pouch already read clearly as “pelican,” so a helmet could reinforce the bicycle theme without losing identity, though it might compete with the crest for visual space.
«Теперь я думаю: шлем на голове против фирменного хохолка пеликана — клюв и горловой мешок и так читаются как “пеликан”, поэтому шлем усилил бы велосипедную тему, не теряя узнаваемости, хотя мог бы соперничать с хохолком за визуальное пространство.»
— reasoning-трейс Fable 5.1 на effort=max, пост Simon Willison
Итог — лучший пеликан, которого Willison видел от моделей Anthropic:
Setting effort to max gave me the best pelican I’ve seen from any of Anthropic’s models.
«Настройка effort = max дала мне лучшего пеликана из всех, что я видел от моделей Anthropic.»
С оговоркой про конкуренцию: он отмечает, что Gemini 3.7 Flash в августе сделал пеликана с большим «флэром», но он об этом и не просил — просил SVG, и получил SVG.

Анимация: как из «решённого бенчмарка» получился мультик
После публикации результатов на Hacker News появился комментарий от пользователя swalsh (тред HN):
Now that it’s a solved benchmark, can we get the animated version?
«Раз уж бенчмарк решён — а можно анимированную версию?»
— swalsh, Hacker News, 01.09.2026
Willison не стал тратить ещё $3.30 на max — он взял готового пеликана уровня max из истории сессии и скормил его модели на дефолтном уровне (high) с одним словом «animate this». Команда целиком работает через его llm CLI:
llm logs -cx | llm -m claude-fable-5.1 -s 'animate this'
Затраты: 6 121 токен на вход, 26 201 на выход, $1.37. Модель превратила статичный SVG в анимированный: пеликан крутит педали, колёса вращаются, сцена оживает. Willison даже заметил, что в экспортной MP4-версии колёса крутятся «не в ту сторону» — но это артефакт конвертации, в оригинальном SVG направление правильное.

llm logs -cx | llm -m claude-fable-5.1 -s 'animate this' (6 121 входных, 26 201 выходных токенов, $1.37). Кадр из MP4, приложенного к посту Simon Willison, 01.09.2026.Для практики здесь два урока. Первый: доработка дешевле генерации с нуля — $1.37 за анимацию готового артефакта против $3.30 за повторную генерацию с max. Второй: дефолтный уровень high справился с творческой доработкой, хотя для исходной генерации его не хватило — то есть выбор effort зависит не только от сложности задачи, но и от того, что именно вы просите: «создай сцену» и «измени сцену» — разные нагрузки на рассуждение.
Как это связано с Terminal-Bench-Science и «новым стандартом»
Пеликаний тест — лишь иллюстрация, а не доказательство. Формальные цифры Anthropic приводит на бенчмарке Terminal-Bench-Science 0.1, объявленном 27 августа 2026 (terminal-bench-science.ai):
| Модель | Terminal-Bench-Science 0.1 |
|---|---|
| Claude Fable 5.1 | 52.6% |
| Claude Fable 5 | 24.7% |
| Claude Opus 5 | 29.0% |
| GPT-5.6 Sol | 22.4% |
Источник: анонс Anthropic, данные на 01.09.2026.
Willison в посте отмечает: по остальным бенчмаркам прогресс у Fable 5.1 относительно Fable 5 «чуть лучше», и только Science-направление даёт скачок в два с лишним раза. Формулировка анонса — «sets a new standard for coding, knowledge work, and long-running problem-solving tasks» («задаёт новый стандарт для кодинга, интеллектуальной работы и длительных многошаговых задач») — опирается прежде всего на длинную агентную работу, а не на «пеликанов». Подробный разбор возможностей модели и того, где апгрейд ощутим в реальных задачах, — в соседней статье «Claude Fable 5.1: что нового в модели для кодинга и где апгрейд даёт результат»; здесь сфокусируемся на том, как тестировать такие модели самому.
Как повторить тест: пошагово
Чтобы прогнать собственный мини-бенчмарк на Fable 5.1, не обязательно повторять пеликана — методика переносится на любую задачу вашего проекта.
Шаг 1. Выберите промпт, который остаётся стабильным. Хороший тестовый промпт — с однозначным результатом, который можно сравнить глазами или тестами: «нарисуй SVG-схему», «напиши функцию X с юнит-тестами», «объясни причину краша по этому логу». Не менять промпт между прогонами.
Шаг 2. Запустите один промпт на всех пяти уровнях. В Claude Code модель переключается через /model, выбираете claude-fable-5-1; уровень effort задаётся флагом запуска или в настройках сессии. В API — полем effort (пример ниже). Если работаете через llm-экосистему Simon Willison — как он, через llm -m claude-fable-5.1.
Шаг 3. Сохраняйте reasoning-трейс. Именно трейс показывает, сколько модель думала и о чём. На простых задачах на low/medium трейс может отсутствовать даже при «always-on thinking» — это нормально и само по себе информация.
Шаг 4. Замеряйте токены, время и цену. Разброс между уровнями на одном промпте у Fable 5.1 достигает десятков раз. Для оценки стоимости используйте счётчики токенов из ответа API и актуальный прайс (llm-prices.com — сервис, которым пользуется сам Willison для сверки цен).
Пример запроса к Messages API с указанием уровня:
{
"model": "claude-fable-5-1",
"max_tokens": 32768,
"messages": [
{ "role": "user", "content": "Напиши SVG: пеликан едет на велосипеде" }
],
"output_config": {
"effort": "xhigh"
}
}
На xhigh/max выставляйте крупный max_tokens: у Claude это жёсткий лимит на весь вывод, включая reasoning-токены (docs, effort). На max пеликан вышел на 65 927 выходных токенов — при max_tokens в 8K запрос просто оборвался бы.
Что тест говорит о качестве кодинга между Fable 5 и 5.1
Честный ответ: сам по себе пеликаний тест — не метрика кодинга. Но наблюдения Willison по механике модели — рабочие:
- Reasoning нельзя выключить. Если вашей задаче не нужны рассуждения и вы гонитесь за скоростью — Fable 5.1 не оптимальна; это осознанный выбор Anthropic в пользу качества длинных задач. Альтернативы с отключаемым reasoning описаны в статье «Маленькие быстрые модели для кодинга».
- Уровень effort — регулятор, а не тумблер качества. На простом промпте high дал картинку почти как low, но стоил дороже; на сложной многошаговой работе xhigh/max дают другой класс результата. Нет универсального «лучшего» уровня — есть цена и глубина, которые вы выбираете под задачу.
- Вывод модели стал главным расходом. 33-кратный разброс токенов означает, что на длинных агентных сессиях с высоким effort счёт идёт не на входной контекст, а на выход. Управление контекстом и понимание, куда уходят токены, — обязательный навык; о том, как следить за этим в Claude Code, — в статье «Контекст Claude Code: как управлять памятью агента».
- Творческие «доработки» дешевле генерации. Анимация готового SVG стоила $1.37 против $3.30 за повторный прогон с max: если агент уже сделал 90% работы, дешевле докрутить на среднем effort, чем перегенерировать.
Честные ограничения
- Один человек, один промпт, один день. Пеликаний тест — это наблюдение, а не статистика. На малой выборке (по одному прогону на уровень) случайность не исключена: другой промпт может дать другой профиль расходов.
- Пеликаны ≠ продакшен-код. Красивая картинка на
maxне гарантирует, что модель так же глубоко подумает над вашим рефакторингом. Используйте методику на задачах из своей кодовой базы, а не чужих «весёлых» промптах. - Цены в статье — на момент публикации (07.09.2026). Anthropic менял прайс на модели в этом году; перед расчётом стоимости длинных сессий сверяйтесь с актуальными тарифами.
- Отсутствие reasoning на low/medium может вводить в заблуждение. «Без видимого трейса» не равно «без мышления» — модель может рассуждать в скрытом виде. Для отладки поведения агента полагайтесь на полные трейсы с xhigh/max.
- Стоимость высоких уровней быстро растёт. Прогон одного промпта на max — $3.30. Ночной автономный прогон агента на max по всей кодовой базе может оставить счёт, который вы не ожидали. Всегда начинайте с high (дефолт) и поднимайте effort точечно.
Российские реалии: доступ к Fable 5.1 и оплата
Anthropic не ведёт официальных продаж в России — страна отсутствует в списке поддерживаемых. Для теста на Fable 5.1, как и для любого другого доступа к claude.ai или API, из российского IP нужен VPN. Оплата российскими картами невозможна: Visa и Mastercard российских банков не принимаются. Рабочие схемы — иностранная карта, UnionPay (зависит от эмитента), покупка API-ключа у посредников за рубли или криптовалюту через обменные сервисы.
Русскоязычных материалов именно про тест Fable 5.1 на момент публикации нет — теме неделя. Общая картина по доступности Anthropic из России и обходам geo-блокировки — на Habr (ЦНИС, июнь 2026); практический путь «Claude через VPN и посредников» с честной оценкой рисков банов — в кейсе на spryt.ru. Если не хотите зависеть от зарубежной оплаты ради каждого теста, обратите внимание на доступные в РФ модели без VPN — подборка в статье «Маленькие быстрые модели для кодинга».
Вывод
Тест Simon Willison наглядно показал главную особенность Fable 5.1: модель научилась масштабировать глубину рассуждения в 33 раза на одном и том же промпте — от $0.10 без видимого мышления до $3.30 с многошаговыми итерациями по деталям. Для практики это означает: effort стал полноценным регулятором «цена × качество», и выбор уровня — инженерное решение, а не вкусовое.
Повторять такие тесты полезно не ради пеликанов, а ради цифр по своей задаче: один промпт, пять уровней, замер токенов и reasoning-трейсов — и вы увидите, где ваша типовая работа реально выигрывает от дорогого reasoning, а где платите за воздух. Для длинных агентных сессий и сложных root-cause задач уровень xhigh/max с большой долей вероятности оправдает себя — но проверять это лучше на своих промптах, с теми же замерами, что сделал Willison.
Дальше по теме: Claude Code через API: как подключить и использовать, контекст Claude Code: как управлять памятью агента, маленькие быстрые модели для кодинга, Claude Fable 5.1: что нового в модели для кодинга.
