Да, нельзя обойти стороной, что Cocoon это по сути своей AWS Lambda в мире AI Computing, и рейты должны быть выше (все таки вам дают тут руду, а не кирку), и в таком случае нужно уже считать иначе.
Согласно калькулятору, одна видеокарта H200 позволит обрабатывать порядка 150М токенов в месяц при полной утилизации, вероятно в рамках одной из моделей (к примеру Qwen3-0.6B), которая по сути своей очень схожа с GPT-4.1-nano от OpenAI.
150M токенов в GPT-4.1-nano обойдутся вам +-60$. А в более «крупнокалиберной» 4.1-mini = +-240$.
Вот где-то в этом моменте и начинается самое интересное.
Post #132
947