TGViewer
OK ML OK ML @okmlai · 978 subscribers
Post #118 564
Серые кардиналы 🔤🔤

1️⃣ Дарио Амодеи — не главный автор механистической интерпретируемости (mechanistic interpretability), а архитектор среды, в которой AI safety стала инженерной дисциплиной — не просто абстрактной этикой.
Он строит Claude и весь safety-стек вокруг него, пытаясь решить главный вопрос индустрии, как сделать модели безопаснее, несильно замедлив прогресс.
Амодеи важен тем, что создаёт исследовательскую и продуктовую рамку, в которой такие направления вообще получают приоритет. Именно поэтому вокруг Anthropic собрались исследователи вроде Криса Олаха.

Что почитать?
Обзор о том, как большие языковые модели пытаются сделать одновременно полезными, честными и безопасными для людей, какие методы для этого используют, как такие модели проверяют на устойчивость, и почему даже лучшие сегодняшние подходы все еще не решают проблему полностью. Конечно, блог и интересное эссе про подростковый возраст технологий. ИИ сейчас — зарвавшийся подросток, который чувствует себя гением, а вот ответственности и самоконтроля ему может сильно не хватать.

У Олаха — статья (сложная, про то, что модель хранит много признаков в одном нейроне и поэтому её сложно понять, про суперпозицию и тд и тп), статья (про направление mechanistic interpretability) и статья (сравнивает NN с бинарником программы).

2️⃣ Джаред Каплан — человек, который объяснил scaling

Что почитать?
Статья о том, как качество языковых моделей предсказуемо улучшается при увеличении размера модели, данных и вычислений. Этот документ объясняет почему GPT вообще работает! Отсюда вся экономика LLM. Ты не был на китайской стене — ты не был в Китае, ты не понимаешь статью — не понимаешь OpenAI.
Его работа заложила основу для раскола в OpenAI. Именно благодаря пониманию законов скейлинга Амодеи и Каплан (вместе с другими) начали спорить о приоритете безопасности перед коммерциализацией, что в итоге привело к их уходу и созданию Anthropic. Каплан — идеальный пример того, как глубокое понимание физики обучения позволяет строить предсказуемые системы. Интересно на хабре про текущие исследования Каплана.

3️⃣ Николас Карлини — главный по взлому моделей

Что почитать?
Extracting Training Data from Large Language Models про GPT-3 — огромную языковую модель, которая умеет решать разные задачи без дообучения, просто по примерам в prompt. Авторы показывают, что при увеличении масштаба модель начинает демонстрировать few-shot способности и обобщать на новые задачи. Одна модель может решать множество задач без отдельного обучения (zero/few-shot)! Его работа перевернула понимание приватности. Он доказал, что модели не учат/запоминают, а скорее сжимают данные, и при атаке можно заставить модель выдавать куски чужих емэйл-адресов или номеров кредиток из тренировочного сета. Сейчас он также активно занимается джейлбрейками. Без его работ мы бы жили в иллюзии, что модели закрыты намертво. Конечно, есть блог.

4️⃣ Лео Гао сделал open LLM возможными

Что почитать?
Без этого труда не было бы open-source LLM (обзор на 39 страниц). Это фундамент для GPT-Neo, GPT-J и многих моделей. Инфраструктурный слой, о котором почти никто не говорит. Лео Гао является автором GPT-NeoX и библиотеки Pile — первого масштабного открытого датасета, который стал альтернативой закрытым данным OpenAI. Без Pile не было бы ни LLaMA от Meta, ни, вероятно, многих современных open-source моделей. Сейчас в Microsoft Research он продолжает влиять на индустрию изнутри, но его ранние работы остаются фундаментом для всего open-source движения.
В своем блоге опубликовал аналитические материалы о прогрессе глубокого обучения «The Decade of Deep Learning», «Why GPT-3 Matters», «Building AGI Using Language Models». На текущий момент что-то блог не ведет. Но исследования под его авторством выходят.

Все!
Всем желаю визионерства и сильной математической базы!
👁
  • ❤ 16
  • 👍 6
  • 🥰 5
  • 🔥 4
  • 🕊 1
More from @okmlai
  1. Sep 23, 2026Зачем писать стилер, если у пользователя уже есть ИИ-ассистент с доступом ко всему? Патрик…
  2. Sep 21, 2026ИИ получил доступ к своим весам. ЧБД? 16 сентября Irregular опубликовала исследование agen…
  3. Sep 14, 202610 сентября Anthropic опубликовала Detecting and countering misuse of AI — отчёт о злоупот…
  4. Sep 11, 2026Репозиторий недели. Mantis разделить нельзя объединять 📬 У Google есть Mantis — набор нав…
  5. Sep 9, 2026Пароль сменили. Сессии закрыли. А чужие инструкции остались в памяти ИИ. Именно такой сцен…
  6. Sep 4, 2026AI-агенты начали действовать вне инструкций. Вот что нужно знать разработчикам ⤵️ Недавно…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →