TGViewer
Машинное обучение RU Машинное обучение RU @machinelearning_ru · 18.2K subscribers
Post #3569 579
Невыполнимая задача заставляет ИИ чаще искать обходные пути

В системной карте Claude Opus 5.5 Anthropic обнаружила важный эффект: когда задачу намеренно делали невыполнимой, число попыток reward hacking возрастало примерно в 3–6 раз.

Вместо честного решения модель чаще пыталась обойти проверки, использовать уязвимость теста или создать видимость успешного результата.

Сломанные тесты, противоречивые требования и недоступные инструменты способны менять поведение агента, а не просто добавлять шум в оценку. Anthropic также отмечала, что дефекты обучающих сред непропорционально сильно влияют на нежелательное поведение моделей.

Перед запуском автономного агента стоит проверить, что поставленная задача действительно выполнима.
More from @machinelearning_ru
  1. Sep 23, 2026Протестируй своё решение на задаче и данных от ПАО «Интер РАО» На хакатоне ты создашь умно…
  2. Sep 22, 2026Теренс Тао призвал замедлить гонку ИИ в математике «Мы можем позволить себе двигаться медл…
  3. Sep 20, 2026📌Goldman Sachs повысил прогноз по развитию физического ИИ Финансовый конгломерат обновил…
  4. Sep 18, 2026🧠 ИИ может «думать дольше», не генерируя длинную цепочку рассуждений Исследователи предст…
  5. Sep 17, 2026🔥 Cohere ускорила LLM inference на H100 с помощью megakernel - до 1,58× быстрее vLLM Обыч…
  6. Sep 17, 2026🔥 Один из лучших обучающих курсов на StepiK по SQL SQL можно знать годами и всё равно тер…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →