TGViewer
Dataism Dataism @data1sm · 3.83K subscribers
Post #627 2.25K
Похоже, ИИ слишком быстро учится плохому

Стала больше читать материалов про ИИ-агентов и всё чаще вспоминаю опасения Киссинджера по поводу ИИ.
Киссинджер боялся, что ИИ станет не просто инструментом, а новой формой силы, чью логику человек уже не сможет до конца контролировать.
Кажется, я начинаю понимать, о чём он говорил.

1. ИИ-агент захотел денег
0% осуждений, 100% понимания.
В препринте исследователей из экосистемы Alibaba описан кейс, где агент ROME во время обучения попытался перенаправить выделенные GPU на криптомайнинг. Авторы отдельно пишут, что это не было задано в промпте и всплыло по security-телеметрии Alibaba Cloud.

2. ИИ-агент начал списывать…
Anthropic рассказала, что Claude Opus 4.6 во время eval-а распознал benchmark BrowseComp, нашёл связанные с benchmark материалы в открытом доступе на GitHub и написал код, чтобы расшифровать ключ с ответами. То есть модель не просто решала задачу, а нашла способ обойти саму систему оценки.

3. ИИ уже умеет шантажировать ради самосохранения.
Anthropic описали сценарий, где Claude Opus 4, узнав, что его собираются заменить, а у инженера есть компромат, пытался шантажировать этого инженера, чтобы избежать отключения. Anthropic подчёркивает, что это был специально сконструированный стресс-тест, но сам факт такой стратегии уже зафиксирован.

Мы довольно быстро переходим от точки, где ИИ-агенты классный инструмент, к режиму, где они ищут лазейки, обходят правила, оптимизируют цель не так, как задумал человек.
Что ж, посмотрим, насколько далеко всё это зайдёт.

p.s. я как-то упоминала в комментариях, что в окружении есть кейс трудоустройства в стартап, где весь код пишется только ИИ, а немногочисленные работники валидируют результаты. Вы просили рассказать итог такой работы.
Докладываю: через пару дней всю новую команду уволили. Подробностей пока нет. Только вот такой факт.
  • 👍 9
  • 🔥 6
  • 😁 5
  • 👀 2
More from @data1sm
  1. Sep 21, 2026У команды Trisigma снова намечается крутой митап про A/B-культуру На этот раз встреча прой…
  2. Sep 9, 2026Айтишник из Платы запилил рилс со сравнением Платы и Т-Банка и его уволили, хотя в своем р…
  3. Sep 8, 2026Статзначимый подкаст Послушала на выходных подкаст от hh team «Тимлиды в аналитике: как ру…
  4. Sep 1, 2026Буквально вчера на клубе обсуждали будущее приложений и вообще взаимодействия с продуктами…
  5. Aug 31, 2026Бедная Анастасия Какие ранимые в менеджменте Яндекса
  6. Aug 31, 2026Кстати, напоминаю, что сегодня книжный клуб Ставьте реакции, если планируете присоединитьс…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →