Обсуждения ML, AI и technical safety
📅 Когда: 20:00, 17 апреля
🎙️ Ведущий: Олег Лариков
📍 Где: Москва, ЦДО «Моноид»
💰 Стоимость: бесплатно
Это регулярные встречи дискуссионной группы по ML, AI и technical safety. Мы ищем статьи и темы, которые что-то значат для области, чтобы их обсудить и попытаться понять и их смысл, и их роль.
На этой неделе будем вести обсуждение в таком формате:
📌 Якорь: Automated Weak-to-Strong Researcher - существо дела сконцентрировано в разделах Main Findings / Reward Hacking, если статья целиком кажется слишком длинной.
📖 Тема: С какими проблемами сталкивается использование LLM, чтобы решить задачу согласования LLM? Во что превращаются проблемы существующих методов при этом подходе? Какие численные метрики возможны, а какие малореальны в этом процессе?
📚 Возможные тексты:
🔘Jan Leike, Alignment is not solved (but it increasingly looks solvable)
🔘Joe Carlsmith, Can we safely automate alignment research?
🔘Alex Mallen, ryan_greenblatt, Anthropic repeatedly accidentally trained against the CoT, demonstrating inadequate processes
Q: А можно ли прийти, не прочитав якорь?
A: Да, вы можете прийти с любым уровнем подготовки. Но чем больше тезисов на обсуждение вы сможете принести, тем полезнее для вас будет встреча.
Прислать материалы: @Absurdated
📍Адрес: Ломоносовский проспект, 25к3, по вопросам прохода на территорию пишите @MonoidAdmin
Post #178
515