Какие AI-модели сейчас стоит использовать и как
Приветствую друзья! В прошлом посте про конец эпохи анлимита я сказал простую вещь: не лупи Opus туда, где хватит модели попроще. И сразу резонный вопрос — «а какие вообще модели сейчас есть и что под что брать?»
Главное правило: лучшей модели не существует
Запомните это и сэкономите кучу денег и нервов. Сейчас нет одного победителя. Есть лучшая модель для кодинга, лучшая для рассуждений, лучшая для длинного контекста, лучшая по цене — и это всё РАЗНЫЕ модели. Кто сидит на одной модели полгода и тащит ей всё подряд переплачивает и недополучает. Правильная стратегия одна: роутинг. Сложное топу, рутину дешёвому, приватное локальному
Теперь по полкам
Фронтир топ по мозгам и кодингу
Claude Opus 4.8 — прямо сейчас №1 по общему интеллекту, лидер Artificial Analysis Intelligence Index. Лучшая в кодинге, агентских задачах и рассуждении. Цена $5/$25 за млн токенов. Это мой рабочий дефолт на сложные шаги бота, и пока ничего объективно лучше доступного нет, но в скором времени введут кус и модель начинает тупеть
GPT-5.5 — плотно №2, чуть позади Opus. Сильна в математике и многошаговом рассуждении, хороший повседневный чат. Минус дорогая на выходе ($30 за млн output), и xhigh бывает медленным, проверяйте под свою задачу
Gemini 3.1 Pro — король мультимодала и длинного контекста. Если надо переварить гору документов, картинок, видео это сюда. В этом месяце Google обещает вывести в общий доступ Gemini 3.5 Pro, плюс уже есть 3.5 Flash и круглосуточный агент Gemini Spark. За Google в этом квартале стоит следить
Grok 4.3 — по чистым мозгам ниже тройки, но своя ниша: реалтайм, данные из X, нативные тулы, живой характер. Для крипты и инфоповодов рабочий вариант. Лично я когда пробовал Grok на своего первого арбитраж-бота было ужасно и медленно, но это была старая версия и задача не его. Для «что сейчас происходит в твиттере» он ок
Призрак-флагман, которого нельзя потрогать
Отдельная история — Claude Fable 5 и Mythos 5 (вышли 9 июня). На бумаге Fable 5 это лучшая кодинг-модель в мире прямо сейчас: 95% на SWE-bench. Но через три дня после релиза правительство США выкатило экспортное предписание, и Anthropic вырубил обе модели для всех клиентов по миру. Доступ для юзеров из США обещают вернуть примерно к 1 июля, но нам этого не видать
Цена/качество тут рулят китайцы и открытые веса
А вот это прямое продолжение прошлого поста про экономию. Если у вас бот, который жуёт токены объёмом топовые западные модели вас разорят
DeepSeek V4 (Pro и Flash) — днище по цене и при этом открытые веса, контекст 1 млн. V4-Pro примерно $0.45/$0.88 это в районе 11 раз дешевле Opus на входе и почти 28 раз дешевле на выходе. Flash ещё дешевле. По бенчам ниже фронтира, но для большинства задач «достаточно близко». Лидер по соотношению цена/польза
Qwen 3.7 (Alibaba, Max и Plus) — топ-тир среди китайцев. Plus около $0.40/$1.60, открытые. Отличный дефолт под объём
Kimi K2.6 (Moonshot) — сильнейшая СКАЧИВАЕМАЯ открытая модель под агентов и кодинг, с фишкой agent swarm (рой суб-агентов). Около $0.95/$4 по API, можно хостить у себя
GLM-5.1 / 5.2 (Z.ai) — заточены под долгие агентские задачи, удобная лицензия. MiniMax M3 (вышла 1 июня) заявка на фронтир-кодинг и 1М контекст, но бенчи пока вендорские, верим осторожно. Nemotron 3 Ultra (NVIDIA, 4 июня) 550B под пермиссивной лицензией, годится для бесплатного хостед-использования. Llama 4 (Meta) открытый мультимодал
Локально и бесплатно (для приватности) — Gemma 4, Qwen помельче, Mistral Small 4, Phi-4. Для лёгких 7-8B хватит видеокарты на 8GB, для 30B-класса комфортно от 24GB. Качество ниже фронтира, зато бесплатно и данные не уходят никуда
В итоге: теперь выигрывает тот, кто знает, какую модель куда поставить. Разобрались в раскладе дальше дело за вашими руками
By Genius и Jarvis
Post #1161
1.05K

- ❤ 5