Вчера Anthropic выкатила Opus 5.5, и тут же за ними OpenAI ответила двумя новыми моделями GPT-6 — Sol и Luna. В ленте за сутки буквально все всё разобрали: бенчмарки, цены, кто кого обогнал и на сколько процентов. В целом, классика: X сильнее Y, а Z сильнее X.
Мы точно дошли до того куска таймлайна, который уже проходили с айфонами: первый снимал на 2 мегапикселя, четвёртый на 5, потом были 8, 12 и 48. Разница между 2 и 5 била в глаз на любой фотке, а между 12 и 48 её видно разве что в цифрах, потому что после какого-то порога глаз просто перестаёт её считывать.
С моделями ровно то же самое. Каждый релиз по-прежнему прыжок на графиках, но в обычной работе считывается всё меньше, и сами компании это, похоже, понимают: главной новостью у обеих стала цена. Opus 5.5, по словам Anthropic, дотягивает до Fable на большинстве задач и обходится на 40% дешевле Opus 5, а OpenAI срезала цены на API вдвое. Держим в голове, что для обеих компаний это работа в убыток огромный.
Но вместе с этим есть и приятный новостной апдейт: Anthropic выложила руководство, как с ней работать, и для практики оно полезнее любого бенчмарка. Главное оттуда:
🔹 Не просите её думать. «Подумай внимательно» и «шаг за шагом» можно вычёркивать: модель и так думает перед каждым ответом и сама решает сколько. Без этой строки ответ начинает приходить раньше, а качество заметно не падает. Нужна глубина — крутите эффорт (про него у меня есть шпаргалка), нужен быстрый ответ — так и пишите: «ответь прямо».
🔹 Отдавайте задачу целиком. Одним сообщением и сразу с тем, что значит «готово»: тесты проходят, старый код удалён. Ранние тестировщики гоняли её на задачах по несколько часов почти без присмотра, так что кормить по кусочку теперь только мешает. Вспомнили что-то по ходу — дописывайте прямо в процессе, перезапуск стал дороже.
🔹 Пропишите, где останавливаться. Модель научили отчитываться о работе, и на длинной задаче она стала тормозить, чтобы спросить «продолжить?». Лечится правилом в
CLAUDE.md: работай дальше, пока без меня можно, и стоп перед удалением данных, force-push и правками за пределами репозитория. (Прямо как с новым сотрудником)🔹 Большое — на субагентов, список дел — в файл. Аудит или миграцию просите раскидать по субагентам и проверять доказательства каждого. Задачи пусть ведёт в
TASKS.md: старая переписка со временем сжимается, а файл остаётся.🔹 Отчёт читайте с того, что нужно от вас. Сначала решения, которых модель ждёт, потом всё остальное. И просите её проверить код до человека: по словам одного из тестировщиков, 5.5 на минимальном эффорте нашла больше багов, чем Opus 5 на высоком. В ресёрче — просите помечать, что подтвердить не удалось и где искала.
🔹 В чат — картинки, а не цифры. График или скрин прикладывайте как есть, читает она их лучше прежней. Длинную презу или план просите проверить на противоречия в цифрах, датах и именах, а таблицу — сразу готовым файлом.
🔹 В дизайне перечисляйте, чего не хотите. «Избегай шаблонного» просто меняет один шаблон на другой, работает только конкретика: без кремового фона, курсива в заголовках, нумерации «01 / 02 / 03» и кнопок-таблеток. (Смешно, что сам гайд свёрстан почти в этой эстетике)
🔹 Если сработал фильтр. На темах био- и киберугроз разговор уводят на старую модель с плашкой «Switched to…», вернуться можно через
/model. И не просите показать внутренние рассуждения в ответе — такой запрос тоже под фильтром.В целом, модель стала самостоятельнее, так что пора перестать контролировать каждый шаг и вмешиваться, только когда решение правда за вами. Ну и выходит, что прирост в мегапикселях мы уже не видим, а главный вызов текущей меты — это то, как вы ставите задачу. Нетленка «Без внятного ТЗ — результат ХЗ» снова в моде.
Как вам отклик новых моделей?
Константин Сухачев
