В последнее время замечаю тенденцию повышения аппетитов на токены - проектов и фич кодится все больше и их масштабы только растут. Если раньше я мог заваншотить агенту задачу на несколько тысяч строк кода (по спеке обычно), то теперь задачи на десятки тысяч LoC, а иногда и на сотню тысяч становятся нормой (дни или недели работы). И я заметил, что с появлением Астры этот аппетит только вырос - она позволяет делать довольно мощные планы, которые позволяют быстро получать результат, соответствующий ожиданиям. Так вот, к чему это я? К тому, что потребность в дешевых, но стабильных и быстрых моделях-исполнителях растет. Такие модели - это просто воркеры, от которых зачастую требуется просто тщательно выполнить план без отсебятины.
Так вот, я уже рассказывал про очень щедрые лимиты на Grok 4.5 из подписки Grok Heavy, которую ранее можно было купить за 100$ на 3 месяца, но, похоже, что эта акция закончилась, да и грок сам по итогу меня слегка разочаровал - слишком много отсебятины делал*.
В общем, китайцы сделали весьма полезный сервис для сравнения лимитов на модели в разных подписках: https://real-api-pricing.vercel.app/ (вкладка Monthly Allowance).
И этот сервис как раз прекрасно подходит для поиска таких вот дешевых моделей-исполнителей.
Главные инсайты оттуда:
1. 200$ подписка на Codex дает 145 миллиардов токенов в неделю на Luna - поэтому, если луна вас устраивает как исполнитель, то выбор очевиден в принципе. Я лично редко пускаю луну код писать, зато в кач-ве исследователя использую ее регулярно (иногда в десятки потоков).
2. 200$ подписка на Claude Code дает 40 миллиардов Sonnet 5 токенов. Признаюсь, соннет я вообще забыл как модель - уж очень она слаба в бенчмарках, да и на токены прожирлива. Но выглядит так, что если у вам доступна только подписка на Claude Code, то Sonnet medium/high - неплохой исполнитель с весьма большим лимитом.
3. Но, пожалуй, главная серая лошадка - это моделька Muse Spark 1.3 (Contributor) внутри OpenCode Go 10$ подписки. Это обновленная модель от Марка, которая на фоне более громких релизов осталась практически незамеченной, хотя результаты на бенчах она выбивает не хуже Опуса / Sol. Они пишут, что в OpenCode Go на нее сейчас недельный лимит 12.5 миллиардов токенов. А сами OpenCode указывают на ~45300 запросов в 5 ч. - в общем, выглядит очень жирно и вкусно. И работает она очень шустро. Единственный минус Contributor версии в том, что данные, которые вы отправляете в модель Марк потом сможет использовать для обучения новых моделей.
Моя рефка на OpenCode Go, если все-таки захотите попробовать.
А вот про Grok 4.5 на Grok Heavy там, кстати, явно брехня - между грок 4.5 и грок 4.6 разница в потреблении точно x10+.
И из моего опыта интересное открытие - Opus 5 low (особенно на 200$ подписке) лимитов хватает на довольно большой объем работы, сильно больше, чем Sol, например. Понятное дело, что она очень хороший исполнитель.
* Кстати, когда просите архитектора-оркестратора делегировать задачи мелким моделям, лучше сразу так и писать ему:
Имей в виду, что эта модель глуповата и может как упускать детали, так и делать лишнюю отсебятину, поэтому ставь ей задачу предельно точно и по итогам работы проверяй ее код сам. А также продумывай заранее потенциальные грабли, на которые модель может наступить при выполнении этой задачи и расписывай их сразу в описании задачи.
А еще, за эти полторы недели работы с Opus 5 / Fable 5.1 / Astra я несколько раз оказался свидетелем глупости Opus, которую очень здорово разруливали Fable / Astra, поэтому несмотря на бенчи, в которых Opus 5 в среднем идет почти в ровень с фейбл и астрой, в реальности на сложных задачах разница действительно ощущается.
Напомню, что для делегирования работы другим моделям/harnesses я использую скилл agents-consilium - он теперь поддерживает как muse spark, так и новую дипсик, и даже умеет перебивать исполнителя когда нужно (steer).
А какие модели вы используете для оркестрации?
@ai_driven
