Как выбрать LLM-модель для задачи — и почему рейтинги не помогут
У меня парсер новостей: читает десятки Telegram-каналов, классифицирует, извлекает тикеры и сентимент, собирает сюжеты. Работал на gpt-4.1-mini. Модели за год ушли далеко — пора обновлять.
Открыл арены. На llmarena и MERA (русскоязычный бенчмарк) сверху Claude Opus, потом GPT-5, Qwen3, DeepSeek. Ранжирование красивое.
Проблема: арены меряют "приятность ответа человеку", а не мою задачу. Там голосуют за красивые общие эссе. А мне надо, чтобы модель прочитала "Сбер повысил дивиденды" и вернула строгий JSON с тикером SBER и типом "dividend". Это другой навык.
Ещё нюанс: флагманы для такой работы — оверкилл. Opus стоит в 50 раз дороже мелких моделей. Для классификации "это новость или конкурс на айфон" его мощь не нужна.
Поэтому буду тестировать сам. План универсальный — пригодится любому, у кого есть повторяющаяся задача на LLM:
• Собрать 100 реальных примеров со своими метками. У меня архив в Airtable с уже расклассифицированными статьями. У вас — размеченный датасет или примеры, сделанные вручную.
• Взять 5-6 кандидатов разного ценового уровня. Я беру gpt-4.1-mini, Haiku 4.5, Gemini 2.5 Flash, Qwen3-30B, Qwen3-4B, DeepSeek V3. От $0.05 до $5 за миллион токенов.
• Прогнать через OpenRouter. Один API, один ключ, разные модели меняются строкой в коде. Не надо коллекционировать ключи от каждого вендора.
• Собрать метрики: точность, ложные срабатывания, пропуски, сколько раз модель сломала JSON-схему, стоимость на 1000 вызовов, скорость.
• Посмотреть глазами 10-20 расхождений. Часто выясняется, что в вашей разметке ошибки, а "худшая" модель на самом деле права.
Бюджет на всё — пара часов и $1-2. Зато решение обосновано данными, а не ощущением "Claude вроде хороший".
Вывод: рейтинги дают шортлист. Финальный выбор — только на своих данных. Это правило работает и для моделей, и для любых других инструментов.
🔥 — круто
🤔 — ничего непонятно
@mintering
Post #766
497
- 🔥 8
- 🤔 3
- ❤ 1