LLM + Vision
Задача: есть 100к фото
нужно каждую из них распознать, описать, прописать метаданные и т.д. чтобы сделать по ним удобный поиск
как же это сделать оптимально по цена-качество?
может локальное железо выгоднее?
или какую облачную модель взять?
каждое фото в разрешении 1024p а на выходе 4000токенов описание с метаданными на каждое фото
Вот что у меня получилось по цене
(примерно одинаковом качество описания):
На локальном ПК (цена электричества +30%)
GPU 3090, модель Gemma 4, на 1к фото примерно 3.5 часа
За 1000 фото: $2.45
цена с тарифами из OpenRouter
(input) + (output) = цена
Gemma 4 26B
за 1000 фото: $0.032 + $0.880 = $0.91
Gemini 2.5 Flash-Lite
за 1000 фото: $0.025 + $1.60 = $1.625
GLM-4 Flash Vision
за 1000 фото: $0.046 + $1.40 = $1.45
Qwen3 VL Flash
за 1000 фото: $0.150 + $1.88 = $2.03
GPT-4o-mini
за 1000 фото: $0.115 + $2.40 = $2.51
GLM-4V
за 1000 фото: $0.383 + $6.000 = $6.38
Gemini 2.5 Flash
за 1000 фото: $0.077 + $10.000 = $10.08
Kimi K2.5 Vision
за 1000 фото: $0.456 + $12.0 = $12.456
мой Вывод: локальное железо это не экономия а дополнительные сложности и расходы
Post #440
239
- 🔥 6
- ❤ 5
- 👍 1
- 💯 1