TGViewer
Александр Львов Александр Львов @boringmarketer · 7.47K subscribers
Post #1318 1.09K
Первые впечатление от ChatGPT 5.6

Все выходные без отдыха я нещадно сжигал на тесты лимиты максимальной подписки. Сжёг почти недельный лимит, благо сегодня его сбросили

1. Все модели семейства ChatGPT 5.6 очень исполнительны

Это плюс для решения задач по спецификации и минус, когда надо сделать что-то хорошо на ходу

Пример: гонял аудит сложного кода через Opus, Fable, Terra и Sol. Все кроме Opus нашли одну проблему, но только Fable подумал, а что если этот же класс проблем есть в смежных зонах, докопался и нашёл еще баг с той же природой

2. У них повышенные требования к промптам

Если с Fable в большинстве случаев достаточно простым языком объяснить, что делать, то чтобы добиться схожих по уровню результатов от 5.6 Sol нужны заморочки с промптами

Самому промпты писать не надо, достаточно сформировать правила по их написанию. Для этого я скормил Fable системную карточку и гайд, описал чего мне не хватает в работе модели и попросил сделать универсальный шаблон промпта, который подтянет самостоятельность моделей ChatGPT до нужного мне уровня

3. Младшие модели нет смысла использовать в разработке

В семействе 3 модели: Luna, Terra и Sol. Подразумевается, что Luna надо использовать для простых задач, Terra гонять как рабочую лошадку для большинства, а Sol включать только на самые сложные задачи

Я пробовал решить одни и те же задачи разными комбинация агентов, а потом сравнивал результаты. В идеале хотелось добиться топ качества при меньшем расходе лимитов. Luna после трех прогонов отвалилась сразу. А вот между Terra и Sol пришлось выбирать

Основной вопрос был такой: будет ли то же качество, если решать задачу средним агентом, а потом пускать поверх него сильных аудиторов против варианта, когда все агенты в цепочке сразу сильные. Пробовал Luna Max, Terra High и Xhigh, Sol Medium и Sol Xhigh как рабочую лошадку. За рабочей лошадкой в цикле всегда запускались два аудитора: Terra Xhigh и Sol Xhigh. А после аудита совокупное качество решения задачи сравнивал Fable. В итоге, остановился на том, что магии нет и оптимальный формат, если задачу решает сразу Sol Xhigh. Он и сам не сильно дороже получается, потому что быстрее находит решение, и аудиторы после него тратят меньше токенов, потому что исходное решение сильнее
  • ❤ 9
  • 👍 2
More from @boringmarketer
  1. Sep 17, 2026⚡ Лайфхак: как заплатить 30 000 ₽, а получить 50 100 ₽ на Авито Рекламу Все просто: в сент…
  2. Sep 14, 2026Главное ограничение в работе с нейросетями — способность человека принимать решения Нейрон…
  3. Aug 24, 2026Микроконверсии по активности пользователя на сайте в Директе могут навредить обучению алго…
  4. Aug 7, 2026Нейронки с тотальной уверенностью раздувают важность неважных вещей Вчера поймал агента на…
  5. Aug 3, 2026Находка про ботов в Яндекс Директе Клод отлично справляется с поиском паттернов поведения…
  6. Jul 29, 2026Иногда нейросети разговаривают на птичьем языке Вот что мне сейчас заявил агент: Волна 4 ц…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →