Что произошло с ценой на ИИ
Миллион слов у лучшей модели Anthropic стоит 50 долларов, у DeepSeek — 87 центов. TNW собрал материал со ссылками на WSJ и Fortune, и заголовки везде про одно: китайские модели дешевле, американским лабам плохо, IPO под угрозой. Это правда, но это не самое интересное в новости. Интереснее то, как именно компании начали экономить.
Год назад знаком жечь токены было доказательством серьёзности. Теперь в моде так называемый thrift-maxxing. Сначала компании просто лимитировали, сколько сотрудник может потратить на ИИ, потом начали подбирать модели на задачи.
Далее IDC опросила 260 крупных компаний в США и выяснили, что 47% используют хотя бы одну китайскую модель хотя бы под одну задачу. На маркетплейсе OpenRouter в одну из июльских недель китайские модели забрали 57% потреблённых токенов. Coinbase вдвое срезал расходы на ИИ, DoorDash отдаёт «низовую работу» на Kimi, Airbnb гоняет Qwen на поддержке.
Откуда вообще такой тренд: экспортные ограничения США, кажется, сработали против замысла. Отрезанные от топовых чипов Nvidia, китайские лабы были вынуждены выжимать больше из худшего железа. Ограничение стало тренажёром эффективности — за цену одного чипа Nvidia берут десять своих локальных и оптимизируют под них.
И самое интересное, как всегда, это кейсы: как устроен стек Telnyx после того, как они перестроились под экономию:
— anthropic-модель дирижирует и планирует работу,
— модели с открытыми весами делают реализацию,
— модель от OpenAI ревьюит результат.
Причём это не полностью связано с экономией, это распределение ролей. Дорогая модель поставлена туда, где её цена оправдана, — на планирование и ревью. Дешёвая — на реализацию. Ещё примем: Cursor посчитал сборку браузера с нуля: целиком на топовой модели OpenAI — чуть больше 10 000 долларов. Та же работа, распределённая между своей моделью и Opus, — 1 339. Разница в восемь раз не за счёт того, что взяли что подешевле, а потому что каждую часть работы отдали модели по её уровню.
Ну и приземлимся на наши контентные дела
Год назад все брали одну самую мощную модель и писали с её помощью всё подряд. Сейчас получается уже дороговато. Но и в качестве терять не хочется. Поэтому появляется пайплайн.
Планировщик, исполнители, ревьюер — разные модели на разных ролях, каждая по деньгам. Компания перестаёт спрашивать «какая модель лучшая» и начинает спрашивать «какая модель нужна вот на этом шаге». Это взросление. Ровно тот же переход, что редакция проходит от «дайте нам ИИ» к «у нас есть процесс, и в нём агенты стоят на местах».
И про навык, который будет востребованы. Не «умею писать крутые промпты», а «умею собрать оркестр из моделей разного класса так, чтобы дорого было только там, где оправдано». Это инженерия пайплайна.
И более того, если раньше вы могли взять клод и не смотреть на другие модели. «Я редактор, я не хочу разбираться». А сейчас вам прям нужно шарить, тестировать модели на различных задачах и считать токены.
Это, кстати, мой опыт. В какой-то момент мои агенты начали жрать. Да, качество выросло, но лимиты выедались в момент. Так что пришлось делать рефакторинг, ограничивать запросы и использовать разные модели на этапах создания текстов.
Цена на интеллект падает. Ценность умения его правильно распределить — растёт. И это, кажется, единственный навык здесь, который не подешевеет.
#ai
Post #2941
127
- 🤯 2
- ❤🔥 1