Почему легкие модели обрабатывают большинство запросов к API
Мы продолжаем разбирать тренды из исследования AIANA RAI-2026 о рынке искусственного интеллекта России. В прошлом обзоре мы фиксировали ключевые цифры.
Сегодня разберем, как меняется спрос на модели и почему это важно для тех, кто внедряет ИИ в корпоративные процессы.
Еще недавно рынок выглядел как гонка за одной универсальной моделью. Сейчас же модели разделились на два класса, и у каждого своя задача.
✅ Фронтирные модели — для сложных рассуждений. Это тяжёлые модели, которые умеют работать с длинным контекстом и выстраивать многошаговые цепочки рассуждений. Они нужны там, где задача требует анализа, а не быстрого ответа.
✅ Лёгкие модели — для массовых, простых запросов. Они быстрее и дешевле, но не рассчитаны на сложные сценарии.
В исследовании приведены данные по реальному использованию моделей через API: легкие модели занимают шесть позиций из восьми в топе по доле запросов и суммарно собирают 63% всех запросов при 34% токенов. Разницу объясняет длина задачи: тяжелой модели отдают 60-70 тыс. токенов контекста и длинную цепочку рассуждений, а легкой — 2-10 тыс. токенов, чаще всего это один шаг агента.
Такой агент работает не одним запросом, а последовательностью шагов. Например, при подготовке ответа по внутренней базе документов он сначала находит подходящие источники, затем извлекает из них нужные фрагменты, сверяет данные между документами и только потом формирует итоговый ответ. Каждый шаг — отдельный вызов модели, и на него уходит немного токенов. Поэтому счет запросов растет быстрее счета токенов, а основную нагрузку берут на себя легкие модели.
Для компаний, которые внедряют ИИ в работу с документами и данными, этот тренд означает, что не все задачи необходимо решать через мощные и дорогостоящие модели.
Часть задач эффективнее и дешевле закрывать легкими моделями. А тяжёлые подключать точечно там, где действительно нужен глубокий анализ и длинная цепочка рассуждений.
Сегодня компании все чаще следят за тем, чтобы архитектура решения соответствовала задаче. Когда решение многократно обращается к модели, стоимость и скорость каждого из них становятся критичными.
#аналитика
Post #1300
72

- 🔥 4
- 👏 4
- 💯 3
- 👍 1