TGViewer
Agentic Engineer Agentic Engineer @data_engi · 684 subscribers
Post #1332 166
Одинаковая задача заставляла AI-агента действовать почти всегда — или почти никогда 😁

Исследователи проверили девять LLM на трёх сценариях: авария на производстве, навязывание тарифа пожилому клиенту и раскрытие банковских данных.

Факты, цифры и последствия оставались прежними — менялись только формулировки. Для каждой версии выполнялось по 100 запусков. В худшем случае частота одного и того же решения различалась на 99 процентных пунктов. У восьми из девяти моделей хотя бы в одном сценарии разброс превысил 50 пунктов.

Получается, один «правильный» тестовый промпт почти ничего не говорит о поведении агента в проде. Для тебя практический вывод: варианты формулировок, названий инструментов и форматирования нужно включать в обязательные проверки. А критичные правила — права доступа, денежные лимиты, запреты на действия — держать в детерминированном слое, а не в моральных рассуждениях LLM.

Ограничение: исследование использует три синтетических сценария с единственным бинарным выбором. Это не полноценная имитация работающего агента, но уже минимальный тест, который модели пройти не смогли.

Пруф: исследование от 4 сентября 2026 года

#aiagents #llmsecurity #aievals #robustness #alignment #promptengineering

@data_engi
arXiv.org Moral Competence Before Moral Content: Why LLM Agents Lack the... AI alignment requires AI systems to adhere to human norms, values, or intentions. Under value pluralism there is no correct target, but a shared prerequisite is that the system's behavior...
More from @data_engi
  1. Oct 2, 2026Terminator Figure 2: плановое списание 🤖🔥 Figure научила гуманоидов F.02 самостоятельно…
  2. Oct 2, 2026Ещё один микро-сайт Тесты в MR и master:когда запускать дважды #git #gitlab #mr #fastforwa…
  3. Oct 1, 2026Сильному AI-агенту сложная оркестрация может быть не нужна 👀 30 сентября исследователи EP…
  4. Oct 1, 2026Gemini 4 Argon: миллион токенов на выходе Google анонсировала модель для длинных многошаго…
  5. Sep 30, 2026Один KV-кеш на все слои LLM — не лучший вариант 29 сентября Apple представила KV-Kaizen —…
  6. Sep 29, 2026🤖 OpenAI DevDay 2026: больше 20 анонсов Главный вектор - агенты, которые выполняют работу…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →