TGViewer
Слезы продакта Слезы продакта @alice_product · 857 subscribers
Post #491 163
🏆 SOTA: почему лучшая модель не всегда нужна твоему продукту

На очередном викли кто-то приносит новость, что вышла новая модель и она SOTA. И вот уже хочется всё бросить, сменить провайдера и сделать презу для c-level что работаем только с самыми передовыми моделями (и сколько денег ЕЩЕ нам на это нужно) Давайте разбираться, что такое SOTA и почему продакту важно понимать это

Что это за аббревиатура
SOTA расшифровывается как State of the Art и зто лучший заявленный или опубликованный результат на конкретной задаче, по конкретной метрике и на конкретном тестовом наборе. То есть SOTA не означает, что модель топчик. Она означает, что сегодня она показала лучший результат в определённом тесте.
Те, модель может быть SOTA в математике, но это не гарантирует, что она так же хороша в решении других задач
Обученная для распознавания лиц европеоидов модель, едва ли хорошо импортируется в Китай. А обученная на английском языке фича по модерации отзывов едва ли поймёт что «ёшкин кот» это ругательство, а «фиг с ним» выражает неготовность обсуждать тему дальше


Что такое бенчмарк
Бенчмарк это стандартизированный экзамен для моделей, где есть набор заданий, правила подсчёта и итоговый балл. Он нужен, чтобы сравнивать модели в одинаковых условиях.
Проблема в том, что не надо путать экзамен и работу в реальных условиях

Где подвох
Первое, бенчмарк измеряет только то, что в него положили. Высокий балл по одной метрике не гарантирует, что модель полезна для вашей задачи.
Второе, часть публичных тестов годами доступна в инете, они могут попадать в обучающие данные, поэтому высокий балл не всегда означает, что модель научилась решать новые задачи, а не встретила похожие примеры раньше
Третье, в лидерборде обычно не видно того, что волнует продукт
🔺сколько стоит 1 успешный сценарий
🔺какая задержка ответа
🔺как часто модель глючит на ваших данных
🔺что происходит с безой и перс данными
🔺может ли пользователь вообще понять и принять её ответ

И самое важное, в ИИ-фиче пользователь общается не с моделью, а с целой системой. Там есть ваши данные, поиск по ним, промпты, инструменты, интерфейс, ограничения и человек, который потом разгребает косяки) Поэтому SOTA-модель в кривой обвязке может проиграть более скромной модели в нормальном продукте

Что проверяем перед переходом на новую SOTA
🔺на какой задаче и по какой метрике она стала лучшей
🔺похожи ли эти задачи на наши реальные сценарии
🔺какую цену, задержку и качество мы получим на своих данных
🔺что покажет наш собственный тестовый набор, а не чужой лидерборд
Вот тут и начинается продуктовая работа. Не выбрать модель с самым громким маркетингом, а понять, решает ли она конкретную проблему лучше, быстрее и за вменяемые деньги

Короче, SOTA это хороший сигнал, что модель стоит проверить, но точно не повод немедленно тащить её в прод и выбивать бюджет

Что еще почитать по теме
💬РБК Тренды. Как оценивать качество ответов нейросетей
💬Habr. Оценка мультиагентных систем

Ciao! 💚

@alice_product
#этобаза #ИИ
  • ❤ 3
  • 👍 1
  • 🔥 1
More from @alice_product
  1. Sep 3, 2026😀Кейс: эмодзи или как 176 пикселей стали языком интернета Представьте, что вы делаете моб…
  2. Sep 1, 2026🤖 ФЗ о регулировании ИИ в России: саммари основных положений Итак, подписан ФЗ № 243-ФЗ «…
  3. Aug 28, 2026🫥Теория мёртвого интернета Открываешь канал 98 подписчиков, но 43 лайка на последнем пост…
  4. Aug 27, 2026✍️5 приемов изящного промптинга для тех, кто устал) Так, если время уже четверг, а ваш гла…
  5. Aug 26, 2026✅ Поставьте галочку, если вы не робот Думали, что выбирая светофоры и гидранты, вы просто…
  6. Aug 25, 2026👏Цифровое клеймо: конец эпохи анонимного ИИ? Думали, что ваш ИИ-копирайтинг останется нез…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →