TGViewer
OK ML OK ML @okmlai · 978 subscribers
Post #90 340
ML-инженерам пора в коучи или психологи моделей?

Исследователи из Университета Цинхуа, Пекинского института общего ИИ и Penn State представили систему Absolute Zero Reasoner (AZR) без датасета, разметки, учителя, фичей и всего того, что мило сердцу мл-инженера:
🍾 модель сама придумывает задачи на Python,
🍾 сама их решает,
🍾 сама оценивает результат и обучается на своих ошибках.

По-моему отличный повод и переквалифицироваться из ML-инженеров в психологов моделей :) И серьезно порассуждать про безопасность!

Кстати, это не единичный случай
🐔 Agent0 (Stanford, UNC, Salesforce) - агенты, которые улучшают себя через self-play
🐔 Self-play SWE-RL (Meta) - агенты, которые внедряют баги в реальный код и сами их чинят, обучаясь на этом процессе
🐔 более ранние концепции от Юргена Шмидхубера.

😡 AZR, обучавшийся полностью без внешних данных, превзошел модели, натренированные на десятках тысяч человеческих примеров:
лучшее качество рассуждений,
лучшие результаты в программировании и математике,
лидер среди моделей ~7B параметров!

А теперь мое личное интересное и тревожное - безопасность

1️⃣ goal drift - self-play оптимизирует то, что полезно модели для дальнейшего обучения,
но не обязательно то, что полезно человеку. 🚣 Модель начинает усиливать инструментальные навыки, игнорируя безопасность, этику или ограничения, если они не входят в reward
2️⃣ Автономное масштабирование без датасета и человека 🥦 резко снижает человеческий контроль над темпами и направлением развития.
3️⃣Особенно опасно, что self-play активно применяется в software engineering, так как ИИ учится находить слабые места в коде 😈, учится ломать и чинить системы, формирует навыки, напрямую применимые к оффенсив.

😫 И тут вот возник вопрос выходного дня, как это связано с рисками AGI и супералаймента. Похоже, что механизмы RLHF и сэйфти-фильтры тут не помогут, так как мы не можем заранее задать правильный реворд для системы, которая будет изобретать новые способы быть умной. 🎈 Как доказать, что система, умнее нас, будет продолжать учитывать наши интересы, даже когда ей это невыгодно? и кто вообще должен это доказывать - мы или уже она? 🎈 И как научить ИИ заботиться о людях, когда люди перестанут быть для него самым интересным датасетом?

Все!
🙃
  • ❤ 8
  • 🔥 6
  • 🥰 4
More from @okmlai
  1. Sep 23, 2026Зачем писать стилер, если у пользователя уже есть ИИ-ассистент с доступом ко всему? Патрик…
  2. Sep 21, 2026ИИ получил доступ к своим весам. ЧБД? 16 сентября Irregular опубликовала исследование agen…
  3. Sep 14, 202610 сентября Anthropic опубликовала Detecting and countering misuse of AI — отчёт о злоупот…
  4. Sep 11, 2026Репозиторий недели. Mantis разделить нельзя объединять 📬 У Google есть Mantis — набор нав…
  5. Sep 9, 2026Пароль сменили. Сессии закрыли. А чужие инструкции остались в памяти ИИ. Именно такой сцен…
  6. Sep 4, 2026AI-агенты начали действовать вне инструкций. Вот что нужно знать разработчикам ⤵️ Недавно…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →