Токены подешевели, а время нет
Хотел проверить, можно ли заменить повседневную работу в чатах с ChatGPT и Claude локальной моделью. Ответ: пока нет, и дело не в железе.
Контекст. У нас есть пара машин Asus - это аналоги NVIDIA DGX Spark. Гонять через них большие объёмы данных отлично, а вот в чате мучение: токены выдают медленно.
Локальные модели у меня и так крутятся в сетапе с OpenClaw, но это фон и триангуляция, а не живой диалог.
Обсуждали взять новый Mac Studio: Apple даёт лизинг и беспроцентный кредит для жителей США. Осталось понять, какую модель на него ставить.
Взял GLM 5.3, которую все сейчас рекомендуют, и последний DeepSeek. Пока через OpenRouter, чтобы не покупать железо вслепую. Дал несколько простых задач.
Разочаровался быстро. Отвечают шустро и чётко, но по глубине заметно отстают даже от базового ChatGPT.
DeepSeek понравился чуть больше, но восторга тоже нет. Те же задачи у последних ChatGPT и Claude, для меня полный вау.
Как разговор с рассудительным, начитанным собеседником, который думает глубже и держит больше измерений задачи одновременно.
Это субъективно, ни на что не претендую, но идея с Mac Studio и домашним чатом отпала сразу.
Год назад я писал про DeepSeek, что цена токена будет падать очень быстро. Так и вышло, но дешёвые токены не сделали работу дешевле.
Счёт просто переехал из API в моё время.
В программировании и исследованиях я плачу не токенами, а итерациями.
Код от слабой модели не работает, и я превращаюсь в промпт-инженера и тестировщика, который вытягивает из неё результат.
Модель фантазирует там, где надо было подумать, а я перепроверяю выводы и переписываю тексты. Экономия на токенах съедается с большим запасом.
Так недавно вышло с Perplexity и похоже, они стали экономить на моделях. Это сразу чувствуется, и я почти перестал им пользоваться.
В большой организации то же самое, умноженное на сотрудников. Модель нестабильна, ошибается, не дорассуждает там, где нужно, и компания платит часами людей вместо долларов за API. В отчёте это выглядит как экономия.
При этом для простых коммерческих задач дешёвых моделей более чем достаточно, и там экономить надо. Дилемма в том, что фронтир дорогой, а граница между простой и непростой задачей размыта.
Думаю, будет всё больше умных роутеров, которые подставляют модель под уровень задачи. Пока их мало.
Китайские модели молодцы: дают жару и поджимают. Побочный эффект - это подписки за $200 приносят эквивалент нескольких тысяч долларов потребления по API.
Пока лимиты не исчерпаны, я сижу на фронтире и считаю это подарком от их инвесторов.
Моё правило пока простое. Если результат приемлем на 90% рутинных задач, то можно использовать дешёвую модель. Если сложная задача и результат проверяю я, то только фронтир.
Своё время на роль тестировщика тратить пока нет смысла
@maxvotek | linkedin | substack
Post #536
2.7K
- 👍 38
- ❤ 16
- 🔥 12
- 😁 1