TGViewer
Гречневые мысли Гречневые мысли @buckwheat_thoughts · 1.77K subscribers
Post #359 1.7K
А чем вайбкодить?

Вышла GPT-5.6 и появился вопрос — кому мне платить 100 баксов в следующем месяце: Anthropic или OpenAI? Я их меняю и просто пользуюсь лучшим вариантом из двух, но как UI мне Codex нравится значительно больше. Да и в целом, интересно было бы проверить как работают новые модели от OpenAI.

Чтобы ответить на этот вопрос, я взял ту самую задачу из поста про локальные модели и запустил генерацию через Haiku 4.5, Sonnet 5, Opus 4.8, Fable 5 (харнесс — Claude Code, везде reasoning effort high) и GPT-5.6 Sol/Terra/Luna (харнесс — codex, сетка эффорта от low до max). Потом отправил Codex делать ревью имплементаций в надежде получить красивые графики качества/времени выполнения задачи/числа токенов и понять, что является парето-оптимальным. Дополнительно я закинул несколько опенсорсных моделей, которые клеймят, что они близки к сота моделям — GLM-5.2, Kimi-K2.7-Code, MiniMax-M3, DeepSeek V4 Flash/Pro внутри opencode — чтобы посмотреть, насколько эти клеймы подтвердятся на практике.

Результаты:

1. GPT-5.6 Terra как будто бы не находится на парето фронтире.. Luna дешевле почти в три раза, но почти такая же по качеству на тех reasoning effort, где есть смысл их использовать, а Sol справился лучше.
Sol high = Luna xhigh по скору и по времени выполнения
Клод ни в одном из четырёх случаев не лучше и не быстрее 5.6 — конкретно для кода он хуже предложений OpenAI
“Дешёвые” предложения OpenAI не хуже “дорогих” и вполне себе good enough
Единственная конкурентоспособная опенсорсная модель — GLM-5.2, но по времени ответа она на уровне GPT-5.6 Sol max, будучи в четыре (!) раза дороже сопоставимой по качеству GPT-5.6-Luna.
Иногда higher reasoning effort помогал модели составить более эффективный план и решить задачу даже быстрее и за меньшее число токенов. Семь раз померь, один раз отрежь.

Это ни в коем случае не scientific eval — я делал один прогон ревью одного решения одной задачи через субагентов кодекса без зафиксированной модели-судьи и не гонял внешних тестов, статзначимости я бы от этого теста не ожидал. Но при этом, получившиеся графики хорошо коррелируют с моими ощущениями от качества работы моделей: GLM-5.2 действительно не опус, а GPT-5.6 мне нравится больше клода.

Значит ли это, что надо пересаживаться на Luna? Нет. Модель хорошо будет работать на run задачах (что-то запустить, что-то простое пофиксить, скилл отработать, конфиги написать), коих большинство, но если надо писать что-то с нуля, я всё равно буду пользоваться Sol high. Да и для не кодинговых задач результаты могут отличаться. Но тем не менее, сравнение, имхо, интересное.
Telegram Гречневые мысли On the state of local models Когда-то у меня был сервак с 3090 и зеоном с алика и я крутил локальные модели. Это было ещё в те восхитительные времена, когда всё взаимодействие с LLM было в вебморде, когда агенты только-только начинались и чтобы нормально…
  • ❤ 13
  • 👍 3
  • 🔥 3
More from @buckwheat_thoughts
  1. Sep 17, 2026Сигнал получен, цель видна, отправляюсь за тортиком
  2. Sep 10, 2026Ураураураура! Вы спрашивали, вы ругались, вы просили, вы недоумевали — а мы делали гигачат…
  3. Aug 28, 2026Вот пришло и мое время рассказывать истории про умные хитрые модели: замеряли Qwen-3.8-27b…
  4. Aug 15, 2026Выводы: - Эксперимент очень интересный, в первую очередь тем, что гипотеза провалилась, но…
  5. Aug 15, 2026Пример простой неудачной генерации: # Prompt def subtract(a, b): """Return a minus b.""" #…
  6. Aug 15, 2026Вот табличка с результатами. Я дополнительно попробовал сделать модели чуть большего разме…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →