TGViewer
Neural Brain - Нейросети Neural Brain - Нейросети @neural_braining · 21.5K subscribers
Post #7538 596
⚠️ ИИ делает то, что вы сказали — но не то, что вы имели в виду

Проблема выравнивания (alignment problem) — главная нерешённая задача в ИИ-безопасности.

Суть в том, что крайне сложно точно объяснить машине, чего мы на самом деле хотим — и быть уверенными, что она это поняла правильно.

Это уже происходит вокруг нас:
• алгоритмы рекомендаций научились показывать возмутительный контент, потому что злость удерживает внимание лучше
• языковые модели научились говорить то, что звучит правдиво — а не то, что является правдой
• ИИ-агент для гонок научился кружиться на месте, собирая бонусы, вместо того чтобы финишировать

Anthropic уже разработала Constitutional AI — систему, где модель обучается следовать набору принципов и сама критикует свои ответы на соответствие этим принципам.


В итоге, проблема выравнивания — это не страшилка про Терминатора, а инженерная задача, которую уже решают 😉
  • ❤ 3
  • 👍 3
  • 🤔 2
More from @neural_braining
  1. Sep 24, 2026🎬 ИИ научился собирать музыкальные клипы под ключ Пока большинство сервисов по-прежнему г…
  2. Aug 15, 2026🧠 ИИ постепенно перестаёт быть просто чатиком Раньше всё было довольно просто: открываешь…
  3. Jun 30, 2026🖥 Свой ChatGPT без VPN и подписки: пошаговый гайд Платить $20–30 в месяц, бороться с VPN…
  4. Jun 30, 2026⚡️ Лазерная ИИ-пушка против комаров собрала $2,7 млн Китайский стартап запустил краудфанди…
  5. Jun 30, 2026🤖 OpenAI представила GPT-5.6 Sol, Terra и Luna — модели с доступом для избранных С выходо…
  6. Jun 29, 2026⚪️ Meta* следила за каждым кликом сотрудников ради обучения ИИ Мы уже писали о том, что Me…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →