TGViewer
Михаил Минт Михаил Минт @mintering · 3.12K subscribers
Post #766 497
Как выбрать LLM-модель для задачи — и почему рейтинги не помогут

У меня парсер новостей: читает десятки Telegram-каналов, классифицирует, извлекает тикеры и сентимент, собирает сюжеты. Работал на gpt-4.1-mini. Модели за год ушли далеко — пора обновлять.

Открыл арены. На llmarena и MERA (русскоязычный бенчмарк) сверху Claude Opus, потом GPT-5, Qwen3, DeepSeek. Ранжирование красивое.

Проблема: арены меряют "приятность ответа человеку", а не мою задачу. Там голосуют за красивые общие эссе. А мне надо, чтобы модель прочитала "Сбер повысил дивиденды" и вернула строгий JSON с тикером SBER и типом "dividend". Это другой навык.

Ещё нюанс: флагманы для такой работы — оверкилл. Opus стоит в 50 раз дороже мелких моделей. Для классификации "это новость или конкурс на айфон" его мощь не нужна.

Поэтому буду тестировать сам. План универсальный — пригодится любому, у кого есть повторяющаяся задача на LLM:

Собрать 100 реальных примеров со своими метками. У меня архив в Airtable с уже расклассифицированными статьями. У вас — размеченный датасет или примеры, сделанные вручную.

Взять 5-6 кандидатов разного ценового уровня. Я беру gpt-4.1-mini, Haiku 4.5, Gemini 2.5 Flash, Qwen3-30B, Qwen3-4B, DeepSeek V3. От $0.05 до $5 за миллион токенов.

Прогнать через OpenRouter. Один API, один ключ, разные модели меняются строкой в коде. Не надо коллекционировать ключи от каждого вендора.

Собрать метрики: точность, ложные срабатывания, пропуски, сколько раз модель сломала JSON-схему, стоимость на 1000 вызовов, скорость.

Посмотреть глазами 10-20 расхождений. Часто выясняется, что в вашей разметке ошибки, а "худшая" модель на самом деле права.

Бюджет на всё — пара часов и $1-2. Зато решение обосновано данными, а не ощущением "Claude вроде хороший".

Вывод: рейтинги дают шортлист. Финальный выбор — только на своих данных. Это правило работает и для моделей, и для любых других инструментов.

🔥 — круто
🤔 — ничего непонятно

@mintering
  • 🔥 8
  • 🤔 3
  • ❤ 1
More from @mintering
  1. Sep 14, 2026Когда сделал MCP-автопостинг и создал наконец-то контент план для своих каналов. Хотите та…
  2. Sep 11, 2026Дивидендная доходность 13 голубых фишек за 10 лет, по годам. Лидер десятилетия МТС: 11,5%…
  3. Sep 10, 2026Anthropic выложила модель: что ИИ сделает с экономикой США к 2030. Прочитал, и это касаетс…
  4. Sep 9, 2026Смотрите? https://www.youtube.com/watch?v=39BalPDuTo0
  5. Sep 9, 2026photo post
  6. Sep 3, 2026Запускаю акцию Финансовых сервисов сейчас много. Какие-то из них вам нравятся больше, каки…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →