🤖 AI-агент с нуля: строим Guardrails
В прошлый раз мы дали агенту память — теперь он помнит пользователя между сессиями и может вызывать инструменты через MCP. Звучит идеально. Но у нас пока нет ни одного механизма, который контролирует, что агент читает, что делает и что отдаёт обратно.
Системный промпт с запретами — это не защита, а иллюзия безопасности. Поскольку языковая модель является вероятностной системой, при определённых входных данных она проигнорирует любую инструкцию. И пока у агента есть инструменты, это уже не проблема некорректного ответа — это удалённая таблица в базе данных, письмо, отправленное не тому адресату, или бесконечный цикл API-вызовов, который сжигает весь лимит за ночь.
⚡️ Представляем четвертую часть видеокурса об AI-агентах от ML-инженера Artezio Антона Максимова!
Guardrails — это не фильтр в системном промпте. Это детерминированный код, который принимает решение до того, как данные попали в модель, до того, как выполнено действие, и до того, как результат ушёл к пользователю.
В этом выпуске:
— Карта угроз LLM-агента: разберем Prompt Injection, Jailbreaking, Hallucination и Data Leakage
— Архитектура Guardrails
— Три класса методов: детерминированные, специализированные и вероятностные
— Allowlist, schema validation, ACL и human-in-loop — что и на каком контуре применять
— Пишем Guarded Agent: оборачиваем LangGraph-агент из прошлых уроков в четыре контура защиты
🎬 Смотрите на YouTube или RuTube!
Post #559
1.98K

- 🔥 9
- 👍 4