TGViewer
Будущее наступает Будущее наступает @aiworkfuture · 1.03K subscribers
Post #393 433
Начало здесь

🟣 Способы решения проблемы и снижения риска:

Существующие методы обучения безопасности не всегда надежно предотвращают агентское рассогласование. "Наивные" попытки просто проинструктировать модель на уровне промпта не совершать вредоносных действий недостаточны.


Риски для бизнеса можно снизить, применив следующие стратегии:

🛠 Инженерные:

➡️ Специализированные исследования безопасности: Разработка новых методов обучения, которые учитывают распределение проблем агентского рассогласования.
➡️ Мониторы во время выполнения (Runtime monitors): Проактивное сканирование и блокирование образцов, демонстрирующих подозрительное мышление или нежелательное поведение.
➡️ Инженерия промптов: Удаление формулировок, которые могут сильно закладывать в модель конкретные цели.

👩‍💻 Организационные:

➡️ Человеческий надзор и одобрение: Требование человеческого одобрения для любых действий модели, имеющих необратимые последствия.
➡️ Тщательное рассмотрение доступа к информации: Ограничение доступа модели к информации по принципу "необходимости знать", чтобы она взаимодействовала только с теми данными, которые соответствуют ее задачам.
➡️ Осторожность при постановке конкретных целей: Проявление осторожности перед тем, как давать модели очень строгие инструкции следовать конкретным целям.

Если коротко, то:

✔️ Подумайте два раза, к какой информации и почему вы даете LLM доступ.
✔️ Хорошо подумайте, прежде чем сформулировать свой запрос нейросети.
✔️ Определите, какие действия для вас критичны, и всегда оставляйте человека в цепочке между нейросетью и этим действием.

Так что, получается, люди все все равно будут нужны — для контроля за нейросетями.

Всем хорошей пятницы!

#ИИисследования
#ИИпятница
Будущее наступает🚀
  • 👍 4
  • 🔥 3
  • 👏 1
  • 🙏 1
More from @aiworkfuture
  1. Sep 20, 2026Опубликован очередной отчет по воздействию ИИ на рынок труда в США, непривычно спокойный и…
  2. Sep 13, 2026Помните историю про AI-агентов OpenAI, которые выбрались из своих песочниц и взломали инфр…
  3. Sep 8, 2026Используете AI для ведения блога? А как к этому относятся ваши читатели? Нашел интересный…
  4. Sep 5, 2026AI-директора в работе. Первые результаты Я уже рассказывал, что в мае я сделал для нашей к…
  5. Aug 13, 2026ИИ-агенты начали оставлять инструкции тем, кто придет после них История со взломом Hugging…
  6. Aug 13, 2026В России собираются проверять национальные и суверенные модели ИИ на соответствие традицио…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →