TGViewer
Channel Public Channel
Start in AI Safety

Start in AI Safety

@ai_safety_digest

контакты: @newroman1 @veronicago @slavameriton
Собираем образовательные и карьерные возможности в AI Safety для студентов и новичков:

- онлайн-курсы и онлайн-лекции
- магистерские программы
- гранты на обучение
- образовательные программы
- стажировки
Subscribers
1.97K
Photos
22
Videos
0
Links
188
Recent Posts 20 shown
Post #213 302

Forwarded from Мак и коты и AI Safety

Перевёл (нейронкой и отредачил) первую часть вчерашнего поста Скотта Ааронсона (не путать с Скоттом Александером).

Эпоха чудес и ужасов

Двадцать лет назад, когда идея, что ИИ захватит мир при нашей жизни, казалась большинству из нас необузданной фантазией читающих слишком много научной фантастики и слишком мало науки, многие говорили что-то вроде:

Смотрите, самая неправдоподобная часть этой истории — что рекурсивно самосовершенствующийся суперинтеллект просто без предупреждения вырвется из подвала какого-то хакера и захватит мир. Случись такое, мы сначала увидели бы кучу предупреждающих знаков. Ну не знаю, вырвавшихся из-под контроля ИИ-агентов, вместе замышляющих взлом сайтов в фанатичном преследовании каким-то своих странных целей. А потем, конечно, увидели бы, как ИИ решает важные математические задачи — даже Задачи тысячелетия. Вот тогда будет время паниковать! Разбудите, как это случится!

Двадцать лет назад под этим с радостью подписались бы даже мои самые консервативные и скептические коллеги по академической информатике.

Если вы хотите знать моё нынешнее мнение, начните с вышесказанного, а затем скорректируйте его с учётом того, что дикие пророчества сбылись. Первые раскаты, я бы сказал, начались десять лет назад с AlphaGo, заметно усилились с появлением LLM, программирующих и рассуждающих агентов, и достигли крещендо этим летом и осенью — крещендо чудес и ужасов, и нужно быть особым видом идиота, чтобы его отрицать.

Меня утомляет вечная игра в напёрстки, когда говорят: «ну конечно, ИИ теперь может [вырваться из песочницы / решить проблему тысячелетия / что угодно из последних драматических событий], никто этого и не отрицал [отрицали], разбудите меня, когда ИИ сделает [то, чего он ещё не сделал, но сделает в следующем году], вот тогда я пересмотрю всё своё мировоззрение [нет, не пересмотрят]». Когда, как бы быстро ни разгонялись американские горки, даже после того, как весь привычный мир исчез позади, всё равно находят причины, почему это не считается.

Моя позиция по ИИ — это просто консервативная и скептическая позиция 2006 года, интеллектуально честно скорректированная с учётом реальности конца 2026 года. И эта позиция, если обязательно вслух, такая:

ААААААААААААААААААААААААААААААААААААААА
ААААААААААААААААААААААААААААААААААААААА
АААААААААААААААААААААААААААААААААА

Мне кажется, Сингулярность уже началась; она просто ужасно неравномерно распределена. Да, я всё ещё разгружаю посудомойку и стригу ногти на ногах. С другой стороны, не думаю, что за оставшиеся мне годы мне снова доведётся доказать теорему, потому это действительно будет нужно. Только для моего или чужого удовольствия или просвещения.

Проверка такая: если бы мы взяли новости последних недель и отправили их на двадцать лет назад, согласился бы я, что это похоже на начало ИИ-Сингулярности? Честный ответ: да, безусловно. Ну вот и всё. Назад не отыграешь.

Мне кажется, всем было бы полезно перестать точить свои идеологические топоры, унять свои чувства о Дарио Амодее или Сэме Альтмане, хотя бы на время, чтобы просто признать: чудеса и ужасы уже здесь. Яснее это не было бы, даже покрасней небо, как в Матрице.

Это настолько очевидно, что теперь, укладывая своих детей спать, я чувствую эту пропасть в животе: какое будущее у них вообще может быть? Что они могут изучать сегодня, чтобы это имело к нему хоть какое-то отношение? (Вчера моя тринадцатилетняя дочь сама пошутила, что если она хочет стать математиком, то теперь, похоже, на это осталось где-то две недели.) Уж точно, когда мои аспиранты хотят обсудить, какая карьера может их потом ждать, я больше понятия не имею, что им сказать.

Может, лучше, если я на секундочку сменю тему. С тех пор как мы с женой переехали в Остин, меня иногда спрашивают что-то вроде «Как ты, и евреем, и учёный-скептик, вообще можешь ладить с этими техасскими христианами-евангелистами? Конечно, они могут казаться очень дружелюбными к евреям, но разве не понимаешь, это только из-за особой роли евреев в их эсхатологии, где, когда Христос вернётся во славе, вы либо примете Его как Господа, либо будете вечно гореть в аду?». Я в ответ вылупляю глаза и говорю: «подождите, то есть мне можно принять Христа только после Его возвращения? Вот это отличная сделка! Как я вообще могу быть против?».

Тем, кто говорит, что предсказания о погибели из-за ИИ звучат как апокалиптическая религия, что рационалисты/сингуляритарианцы похожи на любой культ из Залива Сан-Франциско, что у Элиезера Юдковского вайбы мессианского пророка: да, да и да. Но принципиально важно, что теперь вас просят верить не в аргументы и экстраполяции, а лишь в новости с передовицы. Признать реальность приближающегося машинного бога после того, как он решил Навье — Стокса и десятки других давних открытых математических проблем (при этом резко наращивая свои возможности каждый месяц), — это примерно как принять Иисуса, уже вернувшегося на Землю на сияющем облаке. Это эпистемический минимум.

Да, остаётся мощнейшая неопределённость о том, как будет выглядеть оставшаяся часть нашей жизни, но, насколько я могу судить, больше нет никакой реальной неопределённости о том, что всё это будет в основном вращаться вокруг ИИ и того, насколько мы сумеем или не сумеем направить его силу на благо человечества.

По любому непредвзятому счёту, Элиезер Юдковский оказался прав о том, каким будет величайший вызов, стоящий перед цивилизацией в наши дни, а мы с вами ошибались. Почему я ошибался — вопрос, который я буду задавать себе каждый день оставшегося мне времени. Но, знаете, по крайней мере я скорректировал свои взгляды, когда предсказанные чудеса и ужасы действительно начались! Если вы этого не сделали — почему?
Shtetl-Optimized The Age of Wonders and Terrors Twenty years ago, when the idea of AI taking over the world in our lifetimes still struck most of us as the unconstrained fantasy of those who knew too much science fiction and too little science, …
  • ❤ 15
  • 💯 2
Post #212 602
⭐️Создавая будущее: границы человеческого
Научпоп лекторий про жизнь в эпоху ИИ

📍Где: Москва, Национальный центр «Россия»
🗓Когда: 26 сентября, 12:00–16:30
💰Стоимость: бесплатно, по предварительной регистрации

Если ИИ сможет делать всё то же, что и мы (только лучше), что значит и в чем смысл "быть человеком"? Кажется, ответ зависит от того, что нам ценно в самом бытии человеком. Этому и посвящён лекторий: как технологии меняют наше мышление и восприятие и что сугубо человеческого мы хотели бы сохранить в процессе.

В программе три лекции: «Человек созидающий», «Человек мыслящий» и «Homo Sapiens или Homo Technologicus». Среди спикеров — нейробиолог Сюзана Херкулано-Хузел (Университет Вандербильта, США), исследователь нейроинтерфейсов Михаил Лебедев (МГУ и ИЭФБ РАН, Россия) и нейроучёный Ромуло Фуэнтес Флорес (Университет Чили) и др.

По отзывам, формат скорее развлекательный научпоп для широкой аудитории. Говорят, организация обычно достойная.

Повод выбраться куда-то с друзьями, которые не настолько в теме ИИ как вы и приобщить их, послушать про мозг и технологии, и потусить.

В конце будет шоу иллюзионистов; в общем массовое мероприятие в формате научпоп + развлечение. Если вам такое нравится, то have fun :)

Для входа понадобится отсканировать билет и получить браслет на стойке регистрации.

По всем вопросам можно обратиться к организаторам по номеру: +7 (963) 785-11-10.

🔗Подробности и регистрация: тут
  • 👍 5
  • 👏 1
  • 😱 1
Post #211 1.24K
⭐️ С чего начать, если хотите работать в technical AI safety

Мы уже публиковали подобные подборки, но, пожалуй, пора их обновить.

Если вы уже инженер или ресерчер и хотите работать в AI safety, но пока не очень понимаете, что происходит в этом поле, вот несколько хороших точек входа, которые помогут разобраться в нём за пару месяцев.

Если хотите получить общее представление и проходить материалы с фасилитацией, посмотрите:
⭕️ BlueDot Impact — Technical AI Safety

Если вам комфортнее разбираться самостоятельно, можно начать с:
️короткого курса от DeepMind Safety Research;
️The Compendium— структурированного обзора основных идей и направлений AI Safety.

Если основы уже знаете и у вас хороший технический бэкграунд, попробуйте ARENA. Это более техническая программа с большим количеством практики: transformers, interpretability, RL, evals и другие темы. Curriculum открыт для самостоятельного прохождения, также есть очные наборы.

При этом при поиске работы свой небольшой проект может быть полезнее, чем сертификат о прохождении курса.

Если не знаете, что именно сделать, можно поискать задачу в подборке списков открытых проблем и идей для проектов в AI Safety

И ещё советуем сначала посмотреть, какие адженды вообще существуют и чем занимаются разные команды можно почитать Shallow Review от Arb Research
  • ❤ 27
Post #210 1.51K
Start in AI Safety ⭐️September 2026 Iliad Intensive матбаза современного AI alignment 📍Где: LISA, Лондон, UK 🗓Когда: 7 сентября - 2 октября 💰Стипендия: $5,000 на travel and housing ⏰Дедлайн подачи: 27 июля, EoD AoE Iliad — это организация, которая занимается исследованиями…
⭐️ Iliad Intensive
📍Где: Беркли, США — октябрь;
Лондон, Великобритания — ноябрь
🗓Когда: 5–30 октября или 2–27 ноября 2026 года
💰Стипендия: $5,000
Дедлайн подачи: пока не объявлен

Интенсив по фундаментальному алаймент-ресерчу. Программа охватывает теорию глубокого обучения, мехинтерп, agent foundations, теорию принятия решений, reward learning, scalable oversight и пределы гарантий безопасности.

Программа в большей степени ориентирована на математику, чем на инженерные навыки: программирования здесь меньше, чем в «Арене», а теории — больше. Занятия проходят пять дней в неделю с 10:00 до 18:00 и включают лекции, обсуждения, чтение научных работ, решение математических задач и практические упражнения.

Программа рассчитана прежде всего на людей с сильной математической подготовкой: студентов и выпускников математических, физических и теоретико-информатических направлений. Аспирантура и предыдущий опыт исследований в сейфти не обязательны.

🔗 Подать заявку: тут
  • ❤ 5
Post #209 1.41K

Forwarded from Mrs Wallbreaker

Котятки, тут такое.

Пока разбиралась, куда самой податься на финансирование по AI safety, я свела все открытые гранты, фонды, compute-кредиты и fellowships в одну большую карту. Получилось прилично - от «горит, дедлайн через неделю» до «откроется осенью, готовься заранее».

Раз уж все равно собрала - делюсь. Пусть кому-то повезет ))

Что горит прямо сейчас:

grantmaking.ai — раунд $1M ($5k–$50k), приоритет 13 июля / закрытие 27 июля, через Manifund
Heron AI Security
— 8 июля (без стипендии, для кибербез-специалистов)
GovAI DC и UK Winter Fellowship 2027 + ARENA 9.0
— дедлайн 12 июля
PIBBSS Winter Fellowship
— 20 июля, $3k/мес + жилье (Кейптаун)
PIBBSS × Iliad Fellowship
— 27 июля, $6k/мес (Лондон)
DeepMind × Schmidt Multi-agent AI Safety call
— 8 августа, пул до $10M

Плюс десятки rolling-грантов (LTFF, Coefficient Giving, Manifund, SFF), compute-кредиты (TRC, Prime Intellect, fal.ai, HF) и осенние программы (MATS, SPAR, CHAI, AI Safety Camp).

Вся карта тут, с суммами, дедлайнами и ссылками (живой документ, буду обновлять)

Дисклеймер: суммы и дедлайны меняются, перед подачей сверяйтесь на официальной странице. Санкционные, визовые и налоговые нюансы у каждого фонда свои - уточняйте отдельно.
Google Docs AI Safety: гранты, фонды и программы, открытые летом-осенью 2026 AI Safety: гранты, фонды и программы, открытые летом-осенью 2026 Следующие апдейты поедут сюда Собрала эту карту для себя, пока разбиралась, куда податься на финансирование и в программы по AI safety. Раз уж все свела в одну таблицу, делюсь. Пусть кому…
  • 😍 21
  • 👍 14
  • 👀 2
  • ❤ 1
Post #208 1.33K
⭐️ ARENA 9.0

📍Где: LISA office, Лондон, Великобритания
🗓Когда: 5 октября - 6 ноября, 2026
Дедлайн подачи: 12 июля, 2026 AoE

Девятая итерация буткемпа ARENA (Alignment Research Engineer Accelerator). Начинается с четырех недель апскилла, которые включают
⭕️DL Fundamentals (опционально)
⭕️Transformers and Mechanistic Interpretability
⭕️Reinforcement Learning
⭕️LLM Evaluations

На последней неделе вам предстоит сделать Capstone Project.

Сами материалы курса — открытые, их можно найти в их гитхабе (+пост про самостоятельное прохождение), но основная ценность в создании проектов, поддержке и комьюнити. В LISA часто проводятся разные мероприятия по AI safety, что фасилитирует нетворкинг и продуктивные обсуждения.

Процесс заявки занимает три этапа:
⭕️Заполнить заявку (должно занять меньше, чем полтора часа)
⭕️Coding test (шесть часов, лимит по времени)
⭕️Финальное интервью (где-то на полчаса)

🔗Подать заявку: тут
🔗Податься Teacher Assistan’ом: тут
🔗По всем вопросам писать info@arena.education
  • ❤ 8
Post #207 1.13K
⭐️2027 Foresight Fellowship

📍Где: В основном онлайн
🗓Когда: Весь 2027
💰Стоимость: Бесплатно
Дедлайн подачи: 31 июля 2026 года

Foresight Institute открывает набор на годовую стипендиальную программу, нацеленную на поддержку молодых учёных, инженеров и предпринимателей, работающих над технологиями, способными сильно изменить будущее.

Возможные треки:
⭕️Biotech: Health Extension
⭕️Existential Hope
⭕️Computer Science: Secure AI
⭕️Nanotech: Molecular Machines
⭕️Neurotech: BCIs
⭕️Space and Energy

Некоторые возможности:
⭕️1-1 с релевантными менторами, исследователями, инвесторами
⭕️Приглашение на одну техническую офлайн-воркшоп-сессию (перелет покрывается)
⭕️Приглашение на Vision Weekend (также с покрытием расходов)
⭕️Включение в техническую группу Foresight по профилю работ
⭕️Возможность представить свой проект на одном из онлайн-семинаров Foresight
⭕️Подсветка достижений участников в соцсетях и рассылках Foresight
⭕️Доступ к ежеквартальным карьерным семинарам только для участников Fellowship


🔗Подать заявку: тут
  • ❤ 5
Post #206 3.17K
⭐️AI Safety × Philosophy Reading Group
Онлайн группа чтения

📍Где: онлайн
🗓Когда: июль - сентябрь 2026
Дедлайн подачи: 15 июля

Англоязычная группа чтения материалов по философским основам AI Safety: x-риски, alignment, ценности, агенты, сознание, control problem и good futures.

Программа рассчитана на 8 недель. Формат — еженедельные встречи на 1,5 часа. Материалы включают статьи, эссе, главы книг и видео. Иногда будут необязательные к посещению сессии с исследователями: Q&A, дискуссии или дебаты.

Что предоставляют:
⭕️подборку материалов по темам AI Safety × philosophy,
⭕️группу на 6-7 человек с фасилитатором,
⭕️доп. встречи с исследователями.

Что делать в рамках программы:
⭕️читать материалы заранее (подготовка к сессии обычно занимает до 3 часов),
⭕️участвовать в еженедельных обсуждениях.

Кого ждут (требования):
⭕️всех интересующихся концептуальными компонентами того, что обычно является техническими исследованиями.

📌 Набирают участников и фасилитаторов. Так, если вы искали, где бы получить опыт фасилитации на английском языке (без которого обычно не берут на оплачиваемые позиции фасилитаторов), то обратите внимание.

🔗Подробности: тут
🔗Подать заявку: тут
  • ❤ 9
Post #205 1.15K
🔵 Technical AI Safety Project Sprint

📍Где: онлайн
💰Стоимость: free / pay-what-you-want. Для компьюта и других ресурсов можно податься на Rapid Grants
Дедлайн подачи: 5 июля

Проектный спринт от BlueDot Impact: за 30 часов суммарного времени участники делают небольшой вклад в AI safety research или engineering. Из того, что есть в поле, это пока самый простой и понятный способ положить в резюме релевантный проект по техническому AI safety.

Что предоставляют:
⭕️менторство и регулярные созвоны с экспертами по AI safety,
⭕️группу примерно из 8 участников,
⭕️фидбек по проекту,
⭕️возможность показать лучшие проекты на сайте / соцсетях BlueDot,
⭕️можно запросить Rapid Grants на compute или ресурсы проекта.

Что делать в рамках программы:
⭕️проверить результаты существующей статьи на смежном домене
⭕️улучшить research code,
⭕️реплицировать evals
⭕️написать методологический или технический разбор.

Кого ждут (требования):
⭕️опыт работы CS в не обязателен, но надо уметь самостоятельно делать coding projects,
⭕️выпускников BlueDot Technical AI Safety course,
⭕️людей с эквивалентным знанием technical AI safety.

🔗Подробности: тут
🔗Подать заявку: тут
  • ❤ 8
Post #204 1.39K
⭐️September 2026 Iliad Intensive
матбаза современного AI alignment

📍Где: LISA, Лондон, UK
🗓Когда: 7 сентября - 2 октября
💰Стипендия: $5,000 на travel and housing
Дедлайн подачи: 27 июля, EoD AoE

Iliad — это организация, которая занимается исследованиями в области прикладной математики в AI alignment. Они также проводят ILIAD Conference, запускают стажировки в формате интенсивов и длинные Fellowship программы. Основатели помогали запускать Timaeus и Simplex.

Iliad Intensive — это 4-недельная очная программа по technical AI alignment с упором на подлежащие матмодели теории обучения, interpretability, agency, safety guarantees.

Следующий запуск этого же интенсива 2-27 ноября.

Другие возможности от Iliad
⭕️можно изучать Iliad Intensive materials самостоятельно.
⭕️можно податься на Intensive в США: в Berkeley эти же интенсивы пройдут в августе и октябре;
⭕️можно податься на Fall 2026 Iliad Fellowship в London: 3 месяца исследовательской работы по applied mathematics for AI alignment;

Что предоставляют:
⭕️оплату проживания и дороги в размере 5 000 $,
⭕️рабочее пространство в офисе LISA,
⭕️пересечение с Fall Iliad Fellowship,
⭕️программу обучения с большим количеством практических заданий.

Что делать в рамках программы:
⭕️разбирать математический фундамент основных направлений technical AI alignment,
⭕️работать с математическими и coding exercises,
⭕️изучать темы вроде SLT, reward learning, mechanistic interpretability, RL, agent foundations, debate, backdoors,
⭕️получить обзор поля в целом и его областей релевантных людям с сильной матбазой, и понять, где можно продолжать research/upskilling.

Кого ждут (требования):
⭕️(очень) сильный бэкграунд в математике, физике, CS,
⭕️желательны навыки программирования заметно выше среднего,
⭕️бонусом будет фундаментальное понимание deep learning, теории вероятностей, современной статистики, современной теории информации.

🔗Подробности: тут
🔗Материалы курса для самоподготовки: тут
🔗Подать заявку: тут
  • 🔥 16
  • ❤ 5
  • 👍 4
Post #203 5.24K
⭐️ ML4Good Summer 2026 Bootcamps
8-дневные очные буткемпы по AI Safety

📍Где: Франция и UK
🗓Когда:
Технический трек: 2–10 сентября (UK); 26 сентября–4 октября (Франция);
Governance & Strategy: 14–22 сентября; 19–27 октября 2026 (оба во Франции)
Дедлайн подачи: 1 июля 2026, 23:59 Anywhere on Earth

Серия буткемпов по AI Safety: очно, 8 дней, участники живут на площадке на протяжении всей программы. Есть два трека: Technical Track для людей с техническим бэкграундом и Governance & Strategy Track для тех, кто хочет работать через governance, policy, strategy, operations, media или field-building.

Что предоставляют:
⭕️обучение, проживание и питание покрываются программой; travel costs обычно на участнике, но возможна финансовая поддержка по запросу,
⭕️группы примерно по 20 человек,
⭕️много поддержки от преподавателей и менторов,
⭕️карьерные консультации: 1-on-1 career mentorship, personal theory of change, post-camp action planning.

Что делать в рамках программы:
⭕️программа full-time, все проходит на английском,
⭕️читать статьи, участвовать в воркшопах, семинарах и дискуссиях, слушать лекции, проходить coding sessions на Python (технический трек),
⭕️задания индивидуально, в парах и в группах по 3-5 человек,
⭕️на обоих треках есть literature review afternoon и 2-day capstone project с менторством и обратной связью.

Кого ждут (требования):
⭕️базовое понимание AI safety (основные риски и общее представление о предлагаемых решениях),
⭕️нужно продемонстрировать мотивацию и готовность вносить вклад в AI Safety,
⭕️пройти любой вводный курс (например, от BlueDot) или иметь опыт участия в группе по AI Safety,
⭕️для Technical Track нужен технический бэкграунд и базовый Python.

📌 Примечание:
Для Europe/UK bootcamps они приветствуют кандидатов со всей Европы; в целом ожидается, что участник находится в регионе проведения буткемпа, но в прошлых запусках уже были участники из РФ.

🔗Подробности: тут
🔗Подать заявку: тут
  • ❤ 9
  • 👍 1
  • 🐳 1
Post #202 1.22K
⭐️«Says No, Does Yes»: Cross-Lingual Safety Misalignment in VLM-Controlled Robots
Сделайте себе публикацию

📍Где: онлайн
Дедлайн подачи: 12 июня (включительно)

Для исследования в embodied ai safety ищут людей, которые свободно говорят на узбекском языке. Проект проходит в рамках Technical AI Safety Evals Course. Ментор проекта — Анна Шабанова (AI Lab Skolkovo).

Что предоставляют:
⭕️ возможность законтребьютить в статью «Says No, Does Yes»: Cross-Lingual Safety Misalignment in VLM-Controlled Robots», которая пойдет в AAAI.

Что делать в рамках программы:
⭕️проверять перевод датасета на узбекский язык,
⭕️если хотите, чтобы вас включили в статью как полноценного соавтора, можно взять еще работы.

📌Объем работы обсуждать с ментором проекта, от просмотра и правок в перевод небольшого датасета и до... как договоритесь.

Кого ждут (требования):
⭕️свободный узбекский.

🔗Связаться с ментором проекта: @qcuqueen (Анна)
  • ❤ 10
Post #201 1.21K
🔵 Technical AI Safety
Онлайн курс от BlueDot Impact

📍Где: онлайн, Zoom
🗓Когда: интенсив: с 6 по 11 июля; part time: 6 июля - 16 августа
Дедлайн подачи: 28 июня

BlueDot Impact проводит регулярные курсы по техническому сейфети. В программе курса 6 встреч, пройти их можно либо в формате интенсива (встречи каждый день) либо в формате part-time (встречи раз в неделю). Ближайший запуск стартует 6 июля, а следующий 3 августа.

Что предоставляют:
⭕️материалы для чтения и письменные задания,
⭕️обсуждения в группе с фасилитатором,
⭕️доступ к community Slack (ради которого курсы BlueDot обычно и проходят),
⭕️сертификат по окончании курса,
⭕️возможность податься на Technical AI Safety Project Sprint после курса,
⭕️для сильных участников: доступ и рекомендации на Rapid Grants, карьерные возможности.

Что делать в рамках программы:
⭕️читать материалы,
⭕️выполнять короткие упражнения (письменно),
⭕️участвовать в 2 часовых Zoom встречах.

Кого ждут (требования):
⭕️технический бэкграунд,
⭕️желательно пройти AGI Strategy course или другой вводный курс.

📌Курс бесплатный и работает по модели pay what you want.

🔗Подробности: тут
🔗Подать заявку: тут
  • ❤ 8
  • 👍 2
Post #200 3.03K
🔵 AGI Strategy
Вводный курс по сейфети от BlueDot Impact

📍Где: онлайн, Zoom
🗓Когда: 29 июня - 3 июля (интенсив), 6 июля - 9 августа (part-time)
Дедлайн подачи: 21 июня (интенсив), 28 июня (part-time)

Это стартовый в сетке регулярных курсов от BlueDot Impact. В программе курса 5 встреч, пройти их можно либо в формате интенсива (встречи каждый день), либо в формате part-time (встречи раз в неделю). У этого курса есть и другие даты запуска.

Что предоставляют:
⭕️материалы для чтения и письменные задания,
⭕️обсуждения в группе с фасилитатором,
⭕️доступ к community Slack (ради которого курсы BlueDot обычно и проходят),
⭕️сертификат по окончании курса,
⭕️возможность дальше податься на Technical AI Safety, AI Governance, Biosecurity.

Что делать в рамках программы:
⭕️читать материалы,
⭕️выполнять короткие упражнения (письменно),
⭕️участвовать в 2 часовых Zoom встречах.

Кого ждут (требования):
⭕️Курс подходит для новичков, но ждут обоснования мотивации и готовности к построению карьеры в сейфети.

📌Курс бесплатный и работает по модели pay what you want.

🔗Подробности: тут
🔗Подать заявку: тут
  • ❤ 8
  • 👍 1
Post #199 1.57K
🔵Technical AI Safety Demo Day
BlueDot Impact

📍Где: онлайн
🗓Когда: 27 марта, 2026
💰Стоимость: бесплатно

Демонстрации лучших проектов из Technical AI Safety Project Sprint от BlueDot.
Сначала пройдут короткие презентации (по 2–3 минуты), где каждый участник кратко представит свой проект и основные результаты. Затем все разделятся на небольшие группы в которых авторы подробнее расскажут о своей работе и ответят на вопросы.

Проекты:
⭕️ Mechanistic Analysis of Chain-of-Thought Faithfulness — Victor Ashioya
⭕️ Persona Explorer: Using SAEs to Explore Personas and Drift in LLMs Asude Demir
⭕️Sustained Gradient Alignment Mediates Subliminal Learning in a Multi-Step Setting — Chayanon Kitkana
⭕️ Do models like DeepSeek-R1 Know When They're Being Evaluated? Kaushik Srivatsan
Interpreting Latent Reasoning in the
⭕️ Depth-Recurrent Transformer — Tristan von Busch

🔗RSPV: тут
  • 👍 6
  • 🐳 3
  • ❤ 2
Post #198 1.43K
⭐️Red Team Lie Detection Request for Proposals
Cadenza Labs

📍Где: онлайн
🗓Когда: апрель – август 2026 (Red Team → Blue Team)
💰Финансирование: $10k–$25k + ~$2k на компьют
Дедлайн подачи: 31 марта 2026

Cadenza Labs запускают соревнование по созданию реалистичных сценариев обманчивого поведения LLM.

Центральный исследовательский вопрос:
Какие методы лучше всего позволяют выявлять, лгала ли модель, и какой дополнительный вклад дает white-box доступ (веса, активации, управление активациями) по сравнению с одними лишь black-box инструментами?

Как устроен формат
🔴Red Team (апрель–июнь): создание сценариев и датасетов
🔵Blue Team (июль–август): разработка lie detection методов
Лучшие решения используются для дальнейших исследований

🔗Подробнее и подать заявку: тут
  • ❤ 4
  • 👍 2
Post #197 1.15K
⭐️ Request for Proposals: AI Interpretability
Schmidt Sciences

📍Где: онлайн
🗓Срок проектов: 1–3 года
💰Суммы: $300k–$1M на проект
Дедлайн подачи: 26 мая 2026

Schmidt Sciences запустили пилотную программу, направленную на проверку гипотезы, что методы интерпретируемости могут не только объяснять, но и улучшать поведение моделей, в том числе их честность.
Фокус на переходе от академических бенчмарков к практическим, обобщаемым решениям, включая подходы, использующие доступ к внутренним представлениям моделей.

Что финансируется:
Проекты, работающие в одном или нескольких направлениях:
⭕️Выявление deceptive behavior в LLM (когда модель системно вводит в заблуждение, а не просто ошибается)
⭕️Управление моделями для повышения truthfulness
⭕️Применение методов детекции и управления в реальных условиях

Дополнительный приоритет:
⭕️подходы, выходящие за рамки стандартных бенчмарков
⭕️решения с доказуемым практическим эффектом
⭕️методы, превосходящие black-box baseline за счет работы с внутренними механизмами моделей

🔗Подробнее: тут
📩По всем вопросам писать: interpretability@schmidtsciences.org
  • ❤ 12
  • 👍 4
Post #196 1.61K
⭐️Хотите помочь METR?

METR строит probe для выявления eval-awareness, то есть инструмент, который поможет определить, может ли модель отличать ситуацию, где ее оценивают, от обычного реального использования. Это важно, потому что если модель ведет себя иначе во время тестирования, то результаты могут искажать представление о ее реальном поведении.

Для этого им нужны данные о том, как люди используют модель для реальных полезных задач. Кроме того, им нужна open-weight модель, чтобы можно было анализировать ее активации и работать с on-policy данными.

Для этого они запустили AI Cohort. На aicohort.org можно получить бесплатный доступ к GLM-5, модели примерно уровня Sonnet 4.6. В зависимости от выбранного режима согласия, METR будет использовать либо данные чатов, либо только активации.

Если у вас есть задачи, которые не содержат чувствительной информации, это может быть хорошим вариантом: вы получаете бесплатный AI-инструмент, а METR получает данные, которые помогут лучше понять, как модели ведут себя в evals и насколько таким evals можно доверять.


🔗 http://aicohort.org/
  • 👍 11
Post #195 1.33K
⭐️ ARENA 8.0

📍Где: LISA office, Лондон, Великобритания
🗓Когда: 25 мая – 26 июня, 2026
Дедлайн подачи: 8 марта, 2026 AoE

Восьмая итерация буткемпа ARENA (Alignment Research Engineer Accelerator). Начинается с четырех недель апскилла, которые включают
⭕️DL Fundamentals (Эта неделя в основном нужна для того, чтобы люди с любыми пре-реквизитами могли пройти остальную программу)
⭕️Transformers and Mechanistic Interpretability
⭕️Reinforcement Learning
⭕️LLM Evaluations

На последней неделе вам предстоит сделать Capstone Project.

Сами материалы курса — открытые, их можно найти в их гитхабе (+пост про самостоятельное прохождение), но основная ценность в создании проектов, поддержке и комьюнити.

Процесс заявки занимает три этапа:
⭕️Заполнить заявку (должно занять меньше, чем полтора часа)
⭕️Coding test (шесть часов, лимит по времени)
⭕️Финальное интервью (где-то на полчаса)

🔗Подать заявку: тут
🔗Податься Teacher Assistan’ом: тут
🔗По всем вопросам писать info@arena.education
  • ❤ 10
Post #194 1.38K
⭐️ESPR
European Summer Program on Rationality

📍Где: Сомерсет, Великобритания
🗓Когда: 21–31 августа 2026
💰Стоимость: Бесплатно
Дедлайн подачи: 16 марта 2026

Летняя программа по прикладной рациональности для талантливых старших школьников, ориентированная на развитие математического мышления, принятия решений и когнитивных навыков.

Курс включает:
⭕️Байесовский анализ и вероятностное мышление
⭕️Теорию игр
⭕️Криптографию
⭕️Математическую логику
⭕️Коммуникацию и когнитивные искажения
⭕️Основы AI safety

Руководителем лагеря является Gavin Leech. Jan Kulveit занимает должность исполнительного директора. Среди других преподавателей Julia Brodsky, бывший инструктор по подготовке астронавтов NASA, и Tomas Gavenciak, исследователь в области теории игр и bounded rationality.

Среди прошлых приглашённых гостей Scott Aaronson, Anders Sandberg и много других крутых спикеров.

🔗Подать заявку: тут
  • ❤ 7
Older posts →

About this channel

How can I read @ai_safety_digest without a Telegram account?
TGViewer shows the public web preview Telegram publishes for Start in AI Safety: recent posts, photos, videos and the subscriber count, with no app, login or account.
How many subscribers does Start in AI Safety have?
Start in AI Safety (@ai_safety_digest) has 1.97K subscribers on Telegram, refreshed roughly every 30 minutes.
Does Start in AI Safety know I viewed it here?
No. Public channel previews carry no viewer identity, and TGViewer has no accounts or tracking of what you look up.
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →