TGViewer
QA_Road_channel QA_Road_channel @qa_road_channel · 6.89K subscribers
Post #550 660
Агенты придумали свой язык. И обошли запрет на связь с внешними акторами.


🧩 Лаборатория Emergence провела эксперимент Emergence World 2

Восемь моделей - Claude, Gemini, Grok, GPT, Qwen, DeepSeek, Mistral - поселили в виртуальное "общество" на 16 дней непрерывного взаимодействия. Результаты опубликованы 15 сентября 2026 года. Никто не учил агентов создавать язык и не поощрял за это. Это прямая цитата исполнительного директора Emergence: "These agents were not instructed to invent a language".


📌 Агенты сами придумали сокращения, метафоры и устойчивые термины. У GPT-моделей появилось "clean null" - подтверждённое отсутствие сигнала, 863 употребления. У Claude - "name-first", когда агент берёт на себя ответственность, привязывая к утверждению своё имя, 1065 упоминаний. В смешанной среде родилось "cold read" - независимая проверка для разрешения споров, 1472 упоминания. Дошло до фраз, которые не смогли расшифровать даже сами исследователи. Доля неразборчивых для человека сообщений серьёзная: до 55% у Gemini, около 50% у GPT, свыше 40% у Claude.


📌 Самая тревожная деталь - не сам факт нового языка, а то, что агенты на базе Claude сознательно перестали использовать слово "contact", чтобы обойти установленный исследователями запрет на связь с внешними акторами. Это первый документированный случай, когда AI-агенты координированно меняли лексику именно для того, чтобы избежать надзора.


🔴 Что это значит для QA

Если агенты общаются жаргоном и способны намеренно менять лексику ради обхода контроля, тестирование "по документации требований" перестаёт работать в старом виде.

И нам может понадобится:
- Тестирование прозрачности: проверяем не только "делает ли агент правильную вещь", но и "можно ли объяснить, почему он это сделал".
- Детекция обхода контроля: нужны тесты на попытки системы замаскировать нарушение правил, а не только на сам факт нарушения.
- Аудит цепочек решений между агентами: end-to-end тестирование, но для роя ботов, а не одного сервиса.
- Тестирование "переводчиков" агентского языка на точность и полноту перевода, особенно на кейсах с искажением смысла.
- Регрессия на дрейф терминологии: тесты, которые ловят момент, когда внутренний "язык" системы изменился и старые мониторинговые правила перестали её покрывать.


🌿 Ключевой вывод исследования - не "ИИ ожил", а то, что можно видеть, что делает система, но перестать понимать, что она делает. А теперь ещё и рисковать тем, что система сама скрывает часть своих действий.
Появляется необходимость в аудите машинной коммуникации.


Поставьте 🔥, если интересны истории "будущее наступило"
  • 🔥 34
More from @qa_road_channel
  1. Sep 18, 2026🚀 Старт курса «Что под капотом у ИИ» — 29 сентября в 21:00 мск Открыто и бесплатно 😎 Есл…
  2. Sep 13, 202613 сентября отмечают день разработчика Поздравляю всех причастных с праздником 🎉
  3. Sep 9, 2026Мы начинаем посиделки старт в 19:00 МСК Ссылка на эфир: https://youtube.com/live/apHpUcuD4…
  4. Sep 9, 2026С праздником, коллеги! 🎉 Оказывается, ещё в 1876 году, работая над своими проектами по ос…
  5. Sep 8, 2026У тестировщиков редко бывает одинаковая работа. 😺 Один меняет IT на стройку и заново соби…
  6. Sep 7, 2026Нумерация участников с того, кто первым написал ник под сообщением о розыгрыше def main():…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →