Если кому то казалось что виден край дефицитам мощностей для вычислений, или хотя бы плато - то нет, все только начинается.
Сейчас начинается переход от модели чатов к агентным нагрузкам, а это кратно возрастающая нагрузка https://t.me/book_cube/4517.
Кстати, кто не знал, даже функции в ide автокомплита и контекстного изменения потребляют кратно меньше токенов т.к. работают по другому, и часто вызываются на других моделях. И все больше разработчиков переходя на следующий уровень к агентной нагрузке давят на мощности.
В связи с этим мы начинаем видеть как основные поставщики дотационных подписок начинают закручивать гайки. Последние дни мы видим кучу сигналов:
1. Деградация opus 4.7, быстрее иссякающие лимиты.
2. Обсуждения и ab test что Pro подписка теперь без claude code возможностей.
3. Отмена github новых халявных pro подписок (которые многие абъюзили по черному)
4. В целом все большая "лень" openai моделей которые нужно постоянно уговаривать сделать всю работу, а не только ее часть.
5. Проверка антропиками подписчиков через верификацию по паспортам.
Халява должна была рано или поздно заканчиваться, но у меня были ожидания что это начнется позже. И были надежды что графики стоимости инференса (стоимость падает с годами) и себестоимости подписок пересекутся в какой-то относительно комфортной точке.
Некоторый бизнес в европе работающий на enterprise подписках с расходом по токенам выделяет по 2.5-3k евро на разработчика. Эффективность потребления большинства людей подписок за 20/100/200 долларов далека от того чтобы при росте до 2-3k (в токенах это реальная себестоимость) давать окупаемость.
Что делать:
1. Начинать думать об эффективности потребления токенов в командах.
2. Смиряться с мыслью что нужно будет всем разрабам со временем сидеть на 100-200$ подписках, и даже их будет нехватать. Риск что антропики задушат Pro подписки не мал, и за ними последуют остальные.
3. Лучше изучать возможности локального инференса, держать руку на пульсе когда их уровень будет достаточным. Пока что откровенго демпингованные подписки конечно кратно выгоднее и быстрее любого локального инференса.
Post #202
487
- 👍 11
- ❤ 1