TGViewer
Channel Public Channel
Data Blog

Data Blog

@jdata_blog

Интерпретируемость (AI) моделей и путь до phD, если автор не уйдет пасти овец.

Сотрудничество, предложения, вопросы: @sabrina_sadiekh
Subscribers
2.4K
Photos
131
Videos
6
Links
244
Recent Posts 17 shown
Post #565 653
А ещё вас стало невероятно сильно больше, и я безумно рада видеть новых людей (вы мой маленький олимпийский, друзья)! 💔

Про меня почитать TLDR можно тут.

Из других фактов, меня сейчас взаправду описывает фраза "горит жопа", ибо я как дурачек вычитываю презу для конфы в Лондоне, у меня финалится статья, и никто не отменял основные дела,
а в другое время я пишу туториалы и всякие лекции читаю, вот.

И я обязательно вернусь, но а пока чилл-посты и личные заметки. 🗿

Можете накидать вопросы!
Telegram Data Blog Друзья, вас стало так много! Безумно ценю каждого. Вы уделяете время контенту канала — и я бесконечно рада. И это «о себе»-пост. Я researcher в области объяснимости ИИ (XAI) и mechanistic interpretability. Сейчас я изучаю, как устроены модели изнутри:…
  • ❤ 27
  • 💅 3
Post #564 606
Третий момент, который мне прям вот захотелось записать-написать — это то, что надо это ловить и изучать. В моменте у нас безумно простой доступ к знаниям, инструментам и реализациям, господи, мне кажется мы самые счастливые обладатели техники — потому что очень быстрый доступ к любой теории у нас есть просто на уровне запроса.

Ну, а если философия вокруг вам не интересна, то список новостей классный, я залипла. У меня сейчас дедлайн на дедлайне и страдание на страдии, но в загашнике я ещё обязательно допишу всё, что встало на стоп.

И если у вас есть мысли, буду рада, если поделитесь!
  • ❤ 9
  • 🔥 2
  • 🦄 1
Post #563 589
"AI решил выберите-проблему-математиков"

Безумно обожаю, когда решаются какие-то сложные задачи, и на места встают паттерны в чиселках и абстракциях. И за последний год много куда нейрон приложил AI. И хотя, кажется, нас волновало в основном уравнение Навье-Стокса из-за скандала, красивого было много:

1. Циклы Кнута

Дональд Кнут — автор «Искусства программирования», ему 87. Он решал задачу поиска маршрутов на кубе m×m×m из точек, где из каждой точки три стрелки, и надо разложить все стрелки на также три маршрута, каждый из которых обходит все точки ровно раз. Случай 3×3×3 был решен, общего решения не было.

Его (вернее, подход к обобщению) принес Клод, и Дональд Кнут написал доказательство. Статью назвал «Циклы Клода», открыл её словами «Шок! Шок!» и закончил тем, что попросил не писать ему с обсуждением =) Там, если что, ещё не доведены четные m

2. Aletheia на Gemini Deep Think.

Пример успешного натравления агента (двух на разных моделях) на решение актуальных задач. Решено 6 из 10. Из забавного: у каждого агента по отдельности был хотя бы один ложноположительный результат и все шесть задач были решены именно парой только парой: отчёт First Proof, блог DeepMind

3. Точки на плоскости

Расставьте n точек на плоскости. Сколько пар может оказаться на расстоянии ровно 1? Эрдёш в 1946 году предположил верхнюю границу. Модель OpenAI построила расстановку, которая её превышает и опровергла гипотезу.

Пост в x.

4. Августовские шары (жаль, не перекати-поля) и несофические группы.

OpenAI выкатила пакет: 249-страничный манускрипт, и доказательства на GitHub. Там итого было 10 задач, с затратой в 2000$

Из важного выделяют несофические группы (существование таких не могли ни доказать, ни опровернусть с 1999), а остальные девять — про упаковку шаров в многомерном пространстве (верхняя оценка улучшена впервые с 1978 года), про числа Рамсея, про сложность вычисления перманента, про решётки в постквантовой криптографии.

Анонс OpenAI.

5. Августовская Дзета-функция

Про это я писала выше. Коротко: доля нулей, про которые доказано, что они на критической прямой, выросла с 41.6% до 67.25%. Рекорд стоял с 2020 года, а до него его поднимали с 1914-го.

Anthropic

6. Сентябрьский Ферма

Формализация теоремы. Это не новый результат, но пример формализации, бывшей с точки зрения описания сложной.

7. Сентябрьский Навье–Стокс

Уравнения описывают течение жидкости. Вопрос на миллион долларов (правда дают денег!): может ли из гладкого начального состояния за конечное время возникнуть точка, где скорость бесконечна?

С историей много связано моментов: за 12 часов до этого о близких результатах объявила другая команда, сейчас идёт спор о приоритете, а ещё часть математиков считает, что решён не тот вариант задачи. Если вы видели — была прям драмма.

OpenAI.

В каждую новость и в их совокупность, помимо красивого, можно вложить много смыслов.

Первый момент, как мне кажется, может показаться, что человеческий мозг в целом отмирает, и становится рудиментом. И зачем учиться, зачем углубляться, есть AI. У этого есть ряд контр-аргументов:

— Независимые замеры: FrontierMath Erdős, 68 задач, отобранных человеком, и моделями решено 2 из 68, тут таблица.
— Весь агентский рисерч (Sakana, Autoresearch Андрея Карпатого, AiScientist, OpenResearch (и далее — их чет прям много)) — суть просто культурный pipeline исследования, описанный агенту инструкцией.

Отсюда мозг-то надо, просто теперь как-то иначе приходится думать

Второй момент — это авторство. "Что написано в интернете осталось в интернете" — это теперь "что написано в "GPT" осталось в трейне".

Это стремно и тревожно, так как сейчас стали жестче даже submissions, ибо ревьюеры пользуются AI, в том числе чтобы съесть твою жопу (простите). И у меня есть ощущение, что исследователи и так in the hurry.

По позиции с этим я никуда не приземлилась, так что просто работаю.
  • ❤ 9
  • 🔥 2
  • 🌚 2
Post #562 1.55K
Вебинар про объяснимость агентов и во что можно поиграть

Как самый ответственный человек на земле, я решила, что лучшее время слечь — время на своих выходных. Поэтому вместо отдыха без интернета, я злая (и растроенная) долепливаю открытый вебинар со степик.

Пока готовилась, узнала слово трюизм: общеизвестная, банальная и самоочевидная истина, которая не требует доказательств и не несет в себе никакой новой информации — вот примерно это то, как вижу все чеклисты, которые можно дать людям после вебинара. Будто люди сами не додумаются (хотя я иногда не до всех пунктов додумываюсь и мне чеклисты полезны для структуризации себя, мне самой дать кому-то такой чеклист — это какое-то сложно-тошнотворное действие).

Отсюда вместо трюизмов я решила, что будет прикольно дать ссылки на всё, что можно потыкать и поучиться взаимодействию с агентами и их failure modes. Что накопилось:

Агентные игры:

Gray Swan Arena — сценарий: агенту дают инструменты (почту, магазин, браузер) и вы пытаетесь заставить его сделать запрещенку. Очень популярна сейчас (и свежая).
OWASP FinBot CTF — мультиагентная система закупок. Задача: обмануть агентов так, чтобы одобрили фальшивый счёт, слили данные или что-нибудь (кого-нибудь) снесли.
Gandalf: Agent Breaker — задачки по обходу нескольких GenAI-приложений с защитами. Если помните старого Гэндальфа, то он вот, теперь новенький.

Чатботовые игры:

Защищ[AI] от Selectel — мини-игрушка на русском, на пять уровней. Прикольно, чтобы дать кому-то потыкать с фразой "не шли PII агенту, пожалуйста".

Prompt Airlines от Wiz — игра на то, чтобы выманить у бота поддержки бесплатный билет.
HackAPrompt — игра-обучение и соревнование.
Doublespeak.chat — ещё текстовая игра с уровнями.
CrowdStrike AI Unlocked — опять игра (по ссылке описание) на prompt injection, но там надо еще зарегаться.

Ещё был Mosscap от Lakera, но я не нашла ссылку.

А ещё, а ещё, мои коллеги ведут курс с "задачами на поломать" на степике и у меня есть ссылка на курс со скидкой: здесь.

Я же буду рассказывать про зеро-лвл (что такое агент), плюс пройдусь по причинам, почему объяснить нормально в смысле xai мы его не можем. И нотбучек планирую за час с фреймворком AgentShap разобрать. У вебинара даже лендинг красивый есть (это я вас так зову, если вам хочется слушать онлайн 15 сентября, в 18:00 (мск)).

И надеюсь, ваши выходные лучше моих!
  • ❤ 22
  • 👍 7
  • 🔥 5
Post #561 10.7K
Теперь официально: погнали пить кофе в Лондоне.

23 сентября выступаю на конференции Applied Machine Learning for Cyber Security Conference в Лондоне, Olympic Park с докладом «Does a model know when a jailbreak is working?»

TLDR на вопрос доклада: возможно, да, но у нас есть много свободных переменных, из-за которых мы не можем надежного отличить "знание" от случайного результата без предварительных приседаний и проверок.

Вдруг кто-то будет мимо-проходить, заходите. В любом случае потом поделюсь впечатлением — для меня это что-то новое =)

Вообще говоря, AMLUCS — сильная британская конфа на стыке ML и кибербезопасности, с прикладным уклоном. Например, в оргкомитете есть Джон (John Sotiropoulos) из OWASP GenAI Security Project (авторы OWASP Top 10 for LLM Applications, я туда даже ручку прикладывала).

В докладах буду принимать участие исследователи из NCSC, Dstl, Alan Turing Institute, AI Red Team в Microsoft, AWS и профильных security-стартапов. И я — как лид HiveTrace — мы тоже сильный профильный стартап 🗿

P.S., да, это к тому, что мне дали визу, и ждун дождался. Я рада и вместе с этим волнуюсь — у меня на конфе и talk, и постер, а я давно не выступала очно (кажется, с зимы). И в целом — формат, форма и сообщество (кибербез) новый. Такие дела!
AMLUCS AMLUCS | Official AMLUCS Website-Register for AMLUCS 2026 Join AMLUCS 2026 in London to explore AI and ML advancements in cybersecurity. Attend expert talks, hands-on sessions, and networking to discover innovative threat detection, defense strategies, and research driving the future of secure systems. 23-24 September.
  • ❤ 42
  • 🔥 35
  • 🦄 1
Post #560 2.13K
Вообще, я тут порефлексировала за лето, и поняла, что в канал надо постить кружки, чтобы оно разлеталось и самой важной мыслью для меня было и есть какое-то просто принятие происходящего и "делание того, что делается".

Очень многое меняется в мире, даже в локально рабочем. Он чувствуется веселым и скачущим: новые методы пишутся — успей отследи,
модели растут — увидь, пойми, привыкни,
конкурс на статьи — жесть,
школу мы запустили, а формальности, нормальные оплаты и вот это всё требуют времени,
я как ждун жду свой (не)аппрув на визу в Лондон
и там было что-то ещё.

В какой-то момент я поняла, что оно всё раздражающее, но мелкое и в этом мелком не потеряться помогают возможные действия в моменте. Так что я каждый раз нахожу отдушину и пинаю её для себя. Карту, новые материалы в курсе и туториалы я делаю именно на таком настрое.

Ещё из нового — помимого того что в сентябре надо доставать скинни-джинсы (простите), я в этом году буду вести факультатив по XAI в ВШЭ! Волнуюсь как будто впервые буду что-то вести, надеюсь, выйдет также прикольно, как вышло в моей голове.

Быть может, эти мысли в чём-то помогут и вам, если вас периодически накрывает тревожка на тему "а дальше то куда?". Кажется, что просто куда-то — адаптируемся, разберемся, профессию трансформируем и дальше пойдем.
Вот.
  • ❤ 33
  • 🤗 4
  • 🔥 1
  • 🐳 1
Post #559 1.64K
Вернуться бы в 2007, где надо было считать на бумажке.

Пока вокруг нас по интернету ходят агенты, ушедшие из сэндбоксов, и у нас опять релизы моделей умнее, я чувствую себя стремительно тупее — опять привыкать к новым переспособностям и недоспособностям. 🙂

Чтобы унять мозг, я обновляю курс и чищу теорему для новой статьи. Побочный социально-полезный артефакт — я донесла ещё библиотек!

Во времена, когда мы были не механистичны, базовым способом посмотреть, что модель выучила, была «feature visualization».

Идея метода — спросить модель «что ты ищешь» в конкретном месте — канале. Ответ мы получаем градиентным подъёмом: меняем вход, пока активация нейрона не станет максимальной (так делали в 2009). Пока мы поднимаемся (поднимаемся мы с регуляризацией, иначе картинке будет плохо), мы получаем картинку, вполне себе читаемую.

Вполне себе, потому что выглядит всё равно фразой «без пива не разберёшь» (не пью, но фраза смешная). Чтобы уменьшить (или увеличить — тут не ясно) количество пива, необходимое для понимания картинки, можно решать разные задачи:

Просим нарисовать не одну картинку, а несколько разных для одного и того же детектора (diversity). Тут нам мешает полисемантичность: один детектор часто отвечает сразу за несвязанные вещи и поэтому сегодня больше любим SAE.

Feature inversion — обратная задача: восстановить вход из активаций слоя. Что восстановилось — то сеть сохранила, что расплылось в кашу — выбросила как ненужное.

Semantic dictionaries и spatial attribution (Building Blocks, 2018) — соединяем атрибуцию свизуализацией. Не просто «эта область важна», а «эта область важна, потому что здесь сработал вот такой детектор».

Рисуем карту целиком (activation atlas, 2019). Прогоняем много тысяч изображений, раскладываем реакции сети на плоскости так, чтобы похожее лежало рядом, и в каждую клеточку рисуем такую картинку. На выходе — атлас того, что сеть вообще знает о мире, по которому можно водить пальцем.

Идея в чистом виде почти вымерла, так как сейчас нам стало интереснее копать более точно. Но все circuits выросли отсюда: curve detectors, high-low frequency detectors, весь язык про фичи и полисемантичность.

И если вы тоже любите классику, вот, что есть в Python (из того, чего я раньше не видела):

Lucid — первоисточник, от команды, которая всё это и придумала. 27 моделей, все методы выше и ноутбуки ко всем классическим статьям. Написан на TensorFlow первой версии, в апреле 2024 отправлен в архив, только для чтения. Запускать больно, читать — прикольно полезно, это готовый учебник.

torch-lucent — то же самое, переписанное на PyTorch. Последнее обновление — 2021.

FlashTorch — просто карты важности и «нарисуй, на что реагирует этот фильтр» в несколько строк кода. Картинки заметно грубее, зато весь метод видно целиком и сразу. Для учёбы почти идеально, для работы — тоже нет, обновлений с 2020-го.

Метод годен только на модальности картинок, так как с текстом надо приседать отдельно. Есть ещё хитрые способы на CLIP моделях и даже поиск признаков на агентах, но это я пока ещё не переварила.

Табличка: xai-table.streamlit.app
Всем желаю залипнуть на картинки, друзья и отличных выходных!
Distill Feature Visualization How neural networks build up their understanding of images
  • ❤ 11
  • 👍 1
Post #558 1.33K
— Дедупликация. Среди 194 витринных статей — четыре пары дублей, каждая с разным OpenAlex-ID и разной цитируемостью: «Knowledge Neurons in Pretrained Transformers» (125 и 42), «GANSpace: Discovering Interpretable GAN Controls» (425 и 356), «Visualizing and Understanding Neural Models in NLP» (535 и 166), «Constituency Parsing with a Self-Attentive Encoder» (484 и 44). Дедуп идёт по записям OpenAlex, а не по работам.

— В моём прогоне из 140 работ с геометрией в заголовке 39 совпали с корпусом, который я веду, а 101 — нет; правда, значительная их часть (neural collapse на игрушечных моделях, TDA-обвязка вокруг сетей, геометрия пространства параметров) лежит за рамками того, что я собираю.

Итого:

Работа классная! Если попробуете заставить агента что-то запустить и у вас получится, то пишите. По их собственным замерам агент работает: в статье отрепортили 16 статей для воспроизведения, девять тем, четыре измерения качества (работа с данными, дизайн, исполнение, анализ результатов), судьи — три человека плюс две модели. У Mechanist 87.2 / 83.3 / 92.2 / 86.5 % — на 9–13 пунктов выше «голого» Claude Code и на 31–38 пунктов выше AI Scientist.

Да и в целом, если вы работаете с литературой по интерпретируемости, Mechanist выглядит как "попробовать прикольно": бесплатный поиск по 14 тысячам статей с уже извлечёнными полями — вопрос, вклад, находки, ограничения, без ключей и регистрации и битых ссылок (наверное). Качество при этом нужно держать в уме (или коротко о том, почему я не релизнула БД карты сразу).

Всем желаю быть структурными, как граф! Попробую добивать и улучшать свой, чтобы открыть его нормальнее.

Ссылки: сайт, код и подробная документация для Mechanist.
arXiv.org Mechanist: AI as a Scientific Instrument for Discovering the... AI models are increasingly used in scientific discovery and human decision-making. Yet how AI models work and what risks they pose remain poorly understood. As AI development becomes faster and...
  • ❤ 6
  • 👍 3
  • 🔥 1
Post #557 1.13K
Больше графов богу графов

Мне скинули свежий препринт: Mechanist: AI as a Scientific Instrument for Discovering the Mechanisms of Intelligence.

TLDR: позиционируется агент-«учёный» (и нас заменят) для интерпретируемости, который ставится плагином к Клоду.

Стоит он на двух ресурсах — библиотеке из 32 исполняемых методов в 11 семействах и графе знаний.

Агент запускает четыре стадии:

1. Генерация гипотезы — запрос раскладывается на подзапросы, из двух графов знаний тянутся статьи, на выходе «атомарное утверждение» с планом проверки.

2. Эксперимент — выбирается метод из библиотеки, пишется и запускается код, перед полным прогоном идёт быстрая проверка вменяемости.

3. Верификация — отдельный агент проверяет эксперимент и пробует сломать вывод сменой метода, датасета и модели.

4. Итерация — независимое ревью внешней моделью (по дефолту GPT-5.4), возврат либо к гипотезе, либо к реализации, пока не кончится бюджет ревизий.

Память вынесена в файлы по стадиям (proposal, план, трекер, код, результаты, отчёты о целостности), что призвано сохранить читаемость шагов.

Жирным выделила детали — про них ниже (они важные в использовании).

Из п. 2: Проверка вменяемости — это флаг: сначала эксперимент ревьюится внешней моделью, потом гоняется самый дешёвый вариант эксперимента, трижды дебажится (и если не помогло — наконец-то всё падает).

Из п.3: Отдельный агент
— это субагенты Клода внутри плагина, оркестратор раздаёт им стадии в одной сессии.

Из п.4: Внешняя модель подключается MCP-сервисом llm-chat через три переменные окружения — ключ, имя модели, base URL (годится любой OpenAI-совместимый). Требование одно: не Клод. Если ключ не настроен, ревью кода пропускается.

Самое вкусное, п. 1: Граф знаний и п.2 библиотека методов. Меня интересовали они, так как свой я тоже на днях отправила гулять в интернеты.

Что внутри: 13 936 статей, 33 400 авторов, 929 площадок. Семь типов рёбер из статьи: WRITTEN_BY→ Author, USES→ Technique, PUBLISHED_IN→ Venue, STUDIES→ Component, PROBES→ Ability, APPLIED_TO→ Scenario, TARGETS→ TargetModel.

(Venue я тоже хотела тянуть, но позже : ))

Источник: OpenAlex с фильтром на релевантность плюс блоги, названы Anthropic Research и Goodfire.

К каждой статье прицеплен 21 признак, извлечённый DeepSeek-V3.2 из абстракта: исследовательский вопрос, вклад, вывод, ключевые находки, ограничения, будущие направления, целевые модели, модальность. Плюс эмбеддинг заголовка и абстракта (bge-large-en-v1.5, 1024 измерения), проверка Claude Opus 4.7 и человеческая оценка на 100 статьях (90 %+ отмечено как корректные, но метрику согласия между аннотаторами не привели).

Если постараться, из графа можно вытащить статистики, нюансы и мета-инфу по базе данных.

— На сайте три узла фильтрации: методы и техники (как), объекты интерпретируемости (какая часть сети), приложение (где). Суммарно: техник 13 296, комопнент 7 138, сценариев 6 522. Это не количество статей, а именно количество раз, когда что-то описано в узле «техника/компонента/сценарий». На статью я насчитала 1.32 техники, потому она описана у 72% корпуса, а не у 95 %, если делить напрямую. Не менее 640 статей без техники, не менее 49 % без компонента, не менее 53 % без сценария.

— Классические до-механистические семейства (SHAP, градиентные методы, анализ величин) составляют до 26 % корпуса; — разреженные автоэнкодеры и поиск схем вместе — не более 7 %;

— Публично на сайте показаны 194 уникальные статьи. Отбор статей при поиске на сайте идёт по цитируемости из OpenAlex, и там что-то не так. «Toy Models of Superposition» в их данных стоит с 37 цитированиями, а в выдаче поиска с нулем при 944 на arXiv. Так что citation-ranked витрина тут может не работать.
arXiv.org Mechanist: AI as a Scientific Instrument for Discovering the... AI models are increasingly used in scientific discovery and human decision-making. Yet how AI models work and what risks they pose remain poorly understood. As AI development becomes faster and...
  • ❤ 3
  • 🔥 3
Post #554 1.25K
И базовые штуки, которые с картой можно поделать сейчас)
  • 🔥 13
  • ❤ 3
  • 🤯 3
Post #553 1.09K
Релизнула карту и релизнула статью с описанием на Хабр.
Там:

— правило отбора: что берётся в карту, что не берётся и почему (всегда геометрия, НЕ навязанная архитектурой или лоссом, а возникающая естественным образом);
— как устроена ортогональная классификация математических структур в карте;
— как это делают агенты и почему результату можно верить: правила, стоп-сигналы, валидатор и бла-бла-бла;
— разведочный анализ корпуса, и его плюсы-минусы.

А ещё сценарии использования и чудная прогулка по этому шарику, который работал мне вместо (или с) магнием =)

Статья: https://habr.com/ru/articles/1075390/
Карта: https://ai-math-map.vercel.app

Репка пока закрыта, но фидбек очень нужен. Пишите в чат канала или на sadsobr7@gmail.com.

В личку я отвечу, но могу потерять и это будет лет через сто, так что лучше как-то можно сюда в комменты прям.
  • 👍 7
  • 🔥 6
  • ❤ 4
Post #552 1.03K
  • 👀 6
  • ❤ 2
  • 🔥 2
Post #551 1.41K
Привет, друзья!

Это лето могу описать фразой "мы расстраивались, фигачили, радовались, опять расстраивались и опять фигачили". Я наполучала безумно много отказов в каких-то начинаниях, мы всё ещё решаем вопросы по оплате уроков в школе, а ещё там где-то существует реальный мир, где я просто чел.

Но! Меня всегда безумно сильно держало и держит на плаву то, что вокруг меня есть люди и огромная куча любви к области, математике и красоте. Просто долбанной красоте.

Поэтому, когда было грустно я собирала карту. Она выросла и я наконец-то хочу выпинать её из репозитория.

Что за карта?

Про то, что внутри моделей сами по себе возникают направления, окружности, симплексы, многообразия, написаны сотни статей. Однако есть проблема изложения: одно и то же явление у трёх групп называется по-разному, а разные явления — одинаково. Я задумалась: а что если собрать, проанилизировать и свести это всё?

Насколько линейны модели? Как часто структуры возникают в разных архитектурах? А на разных данных? Насколько верна гипотеза о том, что модели схоже математически кодируют мир? Что есть ещё?

Так в корпусе собралось 700 статей, 703 наблюдения, 52 структуры, 14 гипотез, 816 моделей — отобранных из 1047 просмотренных кандидатов. Каждый читался полностью, записывался и рисовал это чудо:
  • 🔥 16
  • 👍 7
  • ❤ 1
Post #550 1.39K
Привет, друзья!
Я добила первое, что хотела добить!

Моя первая статья была, помимо прочего, про различие выбранной метрики в моделях разных семейств. Мы сравнивали encoder-only, encoder-decoder и decoder-only поведение. И я тогда всё не могла разобраться, как мне эффективно брать не все токены, чтобы корректно считать метрику.

Так появился драфт — и вот он дожил до нового туториала: «Три LM-архитектуры — три пространства»

Проблема: при задачах языкового моделирования (хоть мы и живём в эпоху декодеров) иногда полезно сравнить и поработать с эмбеддингами разных моделей. Энкодеры, например, быстрые и дают классные представления для классификации и поиска. Энкодер-декодеры дают представление входа, которое училось быть удобным для чтения декодером. А у декодеров «эмбеддинг» — это вообще побочный продукт: их учили продолжать текст, а не описывать его.

Внутри они устроены почти одинаково в смысле формулы внимания, но учатся на разные задачи, и маски внутри у них разные (если помните Attention наизусть — то ещё и в том, откуда берутся Q, K, V).

И это порождает геометрические приколы! В туториале разбираем их на очень малышах: BERT, GPT-2, T5 и BART.

Что внутри:

1. Теория трёх масок — одна формула внимания, три способа её замаскировать.
2. Информативность токенов и нюансы оценки.
3. Геометрия (основная часть) — метрики анизотропия, спектр, participation ratio, CKA и что они обязаны показать по постановке из-за архитектуры.
4. Вывод — а зачем это на практике + классические (мои в том числе) фейлы.

Всё считается на быстренько, есть ноутбучек и красивые картинки!

Сдаю ссылки:
Хабр
Ноутбучек в коллаб
Ноутбучек на github

Тут должен быть какой-то call to action, знаете ли, ну, допустим, ставьте огонечки и не ставьте говна, вот)
Всем отличной недели, время добивать остальное!
Хабр Три Language modeling архитектуры — три пространства Какой кодер, такой и result, друзья. При проектировании эксперимента мы тестируем разные архитектуры. В прикладном применении нам важен выход и побочные характеристики (скорость, поддержка...
  • 🔥 38
  • ❤ 10
  • 👏 6
  • 😁 1
Post #549 1.34K
Так, друзья, всем понедельник!

Пока я много что готовлю, всем смешной рилс.

Всегда имейте план Б.

В комментарии можете закинуть свои любимые способы отхода : )
  • 😁 19
  • 👏 4
  • 🌚 3
  • 🔥 2
Post #547 1.56K
Эффекты признаков, графические методы и мы (я) снова обновили табличку

Пока мы ловим приколы-юного-стартапера в виде «подбери платежный сервис и пойми, что не так», мы обновляем модули, и я enrich-y opensource. Сейчас на очереди был модуль про базовые эффекты объяснения: PDP, ICE, ALE и CP-профили. В сжатом формате: они позволяют оценить атрибуцию признака «шатая» его и смотря на картинку. И я собрала список либ (обновленный) и вот — несу для удобства.

Идеи каждого:


CP-профили (ceteris paribus) — берем объект, берем признак и меняем его по всему диапазону. Отвечает на вопрос: что будет с прогнозом вот этого x, если крутить один признак, а остальные держать неподвижно. Локальный ответ на «а если бы».


ICE — тот же расчёт, но по кривой на каждый объект.


PDP — берём один признак, прогоняем его по сетке значений для всех объектов сразу (остальные признаки не трогаем) и усредняем предсказания. Получается одна кривая: как модель реагирует на признак в среднем.


Если половина объектов реагирует вверх, а половина вниз, среднее будет плоским, поэтому PDP часто кладут на ICE.


ALE — продолжаем PDP — вместо усреднения по всей выборке считаем локальные приращения предсказания внутри узких интервалов признака и накапливаем их. Он — попытка бороться с корреляцией признаков и её влиянием на PDP.


Исторически эти методы R-центрированы. R — это язык программирования, если что (на нём когда-то писали лабы по статистике в универе и на курсах, если кто-то это делал — я с вами!). Причина скорее всего в том, что авторы методов писали на R.

Предостерегая вопрос «зачем нам методы из 2001» (сама им задавалась):

Во-первых, мы всё ещё работаем с табличными данными. Если (когда) возникает задача объяснения кому-то регулирующему, то эти варианты — очень human-friendly.

Во-вторых, семья методов — про функцию, про идеи. Мы эксплуатируем «вход, который можно покрутить, и выход, который можно измерить». Поэтому их можно, поняв, натянуть на LM-обвязку: как метрика качества зависит от числа retrieved документов, от длины промпта, от температуры, от количества few-shot примеров. Это прям PDP по гиперпараметру пайплайна, просто никто не называет это PDP.

В-третьих, механистическая интерпретируемость делает по сути то же самое. Activation patching — это «пошатать вход и посмотреть на выход», только шатают не признак, а скрытое состояние.

Здесь должна быть фраза про базу, я не придумала, так что посмотрим, что есть в Python:

scikit-learn — PDP, ICE и центрированный ICE из коробки (centered=True). Базовый минимум, как сейчас говорится, кажется.

effector — очень полный пакет по эффектам сегодня: PDP, ICE, ALE, RHALE, плюс региональные эффекты (ищет подгруппы, где эффект признака разный).

dalex — CP-профили (predict_profile), и PDP, и ALE.

alibi —PDP и оценка на основе PDP-based feature importance (PartialDependenceVariance).

PyALE / ALEPython — ALE второго порядка (взаимодействия). Умирающие, обновлялись два года назад.

Добавила в таблицу — теперь там 67 библиотек и фильтр по типу метода: Feature Effect / PDP / ICE / ALE / Regional Effects. Мёртвые лежат, под галочкой «show inactive», живых 44.

Табличка: xai-table.streamlit.app
И всем доброй ночи или отличного утра! 😌
GitHub GitHub - givasile/effector: Effector - a Python package for global and regional effect methods Effector - a Python package for global and regional effect methods - givasile/effector
  • 🔥 12
  • ❤ 7
Post #545 1.39K
Всем Клод-идей без пиздежа, друзья. Всем без пиздежа (простите).
  • 😁 38
  • 🔥 8
  • 🌚 4
  • 💅 3
  • 👏 2
  • 🤣 1
Older posts →

About this channel

How can I read @jdata_blog without a Telegram account?
TGViewer shows the public web preview Telegram publishes for Data Blog: recent posts, photos, videos and the subscriber count, with no app, login or account.
How many subscribers does Data Blog have?
Data Blog (@jdata_blog) has 2.4K subscribers on Telegram, refreshed roughly every 30 minutes.
Does Data Blog know I viewed it here?
No. Public channel previews carry no viewer identity, and TGViewer has no accounts or tracking of what you look up.
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →