RAG без облака: как запустить LLM для FinTech и уложить inference в одну H100
В KTS обратился крупный клиент из FinTech с запросом на корпоративную базу знаний.
Сначала мы собрали демоверсию на собственной облачной инфраструктуре. По качеству она устраивала клиента и показывала нужный результат. Но облачные AI-инструменты для FinTech часто не подходят из-за высоких требований к безопасности данных.
В таких проектах обычно используют open source LLM. У этого подхода есть две проблемы: качество таких моделей часто ниже, чем у облачных, а inference обходится дорого.
Мы рассчитали инфраструктуру для решения. Оценили стоимость видеокарт, которые понадобятся для запуска модели, и возможный экономический эффект. На старте экономика выглядела неочевидной — стоимость видеокарт могла съесть значительную часть потенциальной выгоды.
Поэтому мы начали экспериментировать с демоверсией продукта и искать способ повысить качество и снизить стоимость inference. В итоге решение удалось запустить полностью на одной карте H100 с требуемым качеством (более 94% корректных ответов на базе знаний).
В результате задача, которая изначально выглядела слишком дорогой для on-premise инфраструктуры, стала экономически оправданной.
Для FinTech и других регулируемых отраслей это важный кейс. Облачные AI-сервисы часто недоступны из-за требований к данным, а стоимость локальной инфраструктуры останавливает такие проекты ещё на старте.
#александр_опрышко
Post #109
1K
- ❤ 11
- 👍 5
- 🔥 2