В демо всё выглядит магией:
модель отвечает, пишет код, общается как человек.
В продакшене начинается реальность.
И она гораздо менее глянцевая 👇
1️⃣ Галлюцинации — уверенно, но неправильно
LLM не “знает”.
Она генерирует наиболее вероятный ответ.
Поэтому:
👉 придумывает факты
👉 ссылается на несуществующие источники
👉 уверенно врёт
Самое опасное — звучит правдоподобно.
2️⃣ Нестабильность ответов
Один и тот же запрос:
👉 сегодня → один ответ
👉 завтра → другой
👉 с чуть изменённой формулировкой → третий
Для бизнеса это боль.
👉 сложно тестировать
👉 сложно гарантировать качество
3️⃣ Prompt engineering — это костыль
В теории:
«просто напиши хороший prompt»
На практике:
👉 десятки версий prompt’ов
👉 постоянный тюнинг
👉 ломается от малейших изменений
Это не инженерия. Это шаманство с контролем версий.
4️⃣ Стоимость растёт незаметно
Каждый запрос = токены = деньги
А дальше:
👉 длинные контексты
👉 RAG
👉 chain’ы
👉 retries
Прототип за $50 превращается в систему за $5000+.
5️⃣ Latency убивает UX
LLM думает долго:
👉 1–3 секунды — норм
👉 5–10 секунд — уже раздражает
👉 10+ секунд — пользователь ушёл
Особенно критично для:
👉 чатов
👉 real-time систем
👉 API
6️⃣ Evaluation — это ад
Как понять, что стало лучше?
👉 accuracy не работает
👉 метрик нет
👉 нужно вручную оценивать ответы
Evaluation = дорого + субъективно + медленно.
7️⃣ Безопасность и контроль
LLM может:
👉 сгенерировать токсичный текст
👉 выдать приватные данные
👉 обойти ограничения
Нужны:
👉 guardrails
👉 фильтры
👉 логирование
👉 мониторинг
8️⃣ Контекст — ограниченный ресурс
Даже у больших моделей:
👉 ограничение на токены
👉 длинные диалоги ломаются
👉 важная информация теряется
Поэтому без RAG никуда.
💥 Главный инсайт
LLM в продакшене — это не про модель.
Это про систему вокруг неё:
👉 retrieval
👉 кеширование
👉 monitoring
👉 fallback’и
👉 eval pipeline
В одном предложении
Сложность LLM-продукта — не в том, чтобы «подключить GPT»,
а в том, чтобы сделать его надёжным.