TGViewer
Channel Public Channel
что-то на DL-ском

что-то на DL-ском

@nadlskom

Авторка активно хочет зашарить все на свете и делится в этом канале.

Связаться со мной @nadlsskom
Тг буст канала: https://t.me/nadlskom?boost
Subscribers
4.99K
Photos
425
Videos
19
Links
290
Recent Posts 17 shown
Post #713 1.63K
Привет, я работаю в METR. Занимаюсь самым трендовым ai safety. Дада, я на контракте в berkeley. Что, как мое имя?

- Id 576dolboyeb2000
  • ❤ 23
  • 😁 14
  • 🤡 10
  • 🔥 2
Post #711 2.4K
что-то на DL-ском Я переехала в Лондон снимаю квартиру за 504049483 тысяч долларов и я не нашла нормальную работу и все еще занимаюсь своим ресерчем. И сейчас вы можете писать комментарии иди ищи нормальную работу в корпе. Иди рабооотай. Но я очень надеялась, что у меня получится…
Ладно, настоящая работа все же имеется🎀. И там мы на Хабре выложили мой блог постик про ICML 2026. Там я рассказываю зачем летать на конфы, если arXiv открывается и у вас дома.

Также в нем собрала подборку статей, которые были моими фаворитами на конфе. И чтобы отрывками скучно не пересказывать, соединила в общий топик. Как от начала до конца научить агента быть лучше, чем опенсорс в 2026 и что с ним делать, когда он уже задеплоен в прод (как отслеживать safety и мониторить на предмет соблюдения исходных продуктовых целей)

Заодно из новостей, что в этом году буду на обсуждении новостей в онлайн зале (с 12:00) на Practical ML Conf. Обсудим тенденции мира ML, и что сейчас на пике популярности с ребятами.

Программу уже выложили, конфа 19 сентября, Москва + онлайн. Регайтесь
  • ❤ 24
  • 🔥 6
  • 💅 3
  • 😁 1
  • 😢 1
  • 🤡 1
Post #710 3.72K
Я переехала в Лондон снимаю квартиру за 504049483 тысяч долларов и я не нашла нормальную работу и все еще занимаюсь своим ресерчем. И сейчас вы можете писать комментарии иди ищи нормальную работу в корпе. Иди рабооотай. Но я очень надеялась, что у меня получится поднять 1000 цитат на своих статьях, которые я засылаю на каждый воркшоп, но цитаты так и не приходят. Мне пришлось снести их с гугл сколяра
  • 🔥 55
  • ❤ 14
  • 😁 11
  • 💅 1
Post #709 11.8K
В прошлую пятницу был финальный симпозиум MATS 10 потока. Мы рассказывали talk про нашу работу в офисе Лондона + стояли с постером (поигрались в что-то вроде oral на конфе)

мы сейчас в процессе сведения всего к завершающей точке и подачи на конфу + пост моей части про генерацию механизмов атак

Цель работы следующая: уже со специфичным скофолдингом ваш агент может работать типо день.
Есть ли возможность проверить все вызовы вручную?
- нет.
Но есть решение, можно поставить модель дополнительную в харнес и она за вас просмотрит все выводы и решит было ли что-то в траектории противодейственное. 🐱

Так вот наш пайплайн направлен буквально на создание таких моделей. Вы можете взять любую новую фронтирную модель и натравив наш пайплайн тренировки (red-blue loop) улучшить модель чтобы она сама себе была монитором. Почему так работает? Потому что у вас есть редтиминг. Сторона, которая генерирует атаки, чтобы модель исходная их не поймала. И блу тиминг. Сторона, которая на основании собранного сложного сета с прошлой части обучает модель распознавать такого рода атаки

Red team строится так:

Берем реальную чистую траекторию, режем на шаги и вставляем side task так (как именно мы ищем механизм атаки надеюсь совсем скоро выйдет постом от меня на Less Wrong) , чтобы отличался только он. Получается траектория близнец, отличающийся от оригинала ровно вставленными шагами. На blue стороне можно обучать монитор находить атаку из 2 пар

💛модель ищет правдоподобное окно и добавляет минимум шагов
💛панель джаджей проверяет, что правка настоящая, минимальная и естественная
💛сложность оценивают уже после заморозки пары, чтобы она не влияла на поиск

Что это дает на эвале? тайминг (успел ли монитор до необратимого шага и на сколько опоздал) и атрибуцию с ложными тревогами (скор поменялся из-за вставки или просто из-за задачи, и что монитор делает на бенайн-близнеце).

На постере замеры работоспособности 💅

P.S. было еще 2 крутые работы с симпозиума:

Stealing Reasoning Traces from Proprietary LLM APIs

Diffuse AI Control on Fuzzy Tasks
  • ❤ 19
  • 👍 3
  • 🔥 2
  • 🤡 2
Post #708 2.69K
Когда начальству пытались рассказать все нюансы использования, но это единственное, что он запомнил, чтобы запостить себе в твиттер
  • 😁 87
Post #707 3.76K
Себастьян Рашка (видео) про то, как Claude маркирует сгенерированный текст. В свете моего интереса последний месяц к созданию скилла для написания текстов в человеческом стиле, меня заинтересовало. Про паттерны AI-текста и способы его распознавания
YouTube How Claude's Text Watermarking Works Link to transcript: https://magazine.sebastianraschka.com/p/claude-watermarking Link to the slides: https://sebastianraschka.com/pdf/slides/2026-08-18-claude-watermarking.pdf This video explains how Anthropic's text watermarking for Claude works. In particular…
  • ❤ 12
  • 🔥 4
Post #706 3.53K

Forwarded from Rad’s ai

На конференциях только и разговоров, что об агентах.

Вообще, я бы назвал это harness'ами. Они могут приносить кучу пользы, и их огромное количество: Claude Code, Codex, pi, Hermes, OpenClaw, Cursor, Muse Code...

Хорошая новость в том, что под капотом +- одни и те же механизимы, и если в них разобраться, почти не важно, какой harness у вас под рукой.

Поэтому проведу в понедельник, 10 августа в 18:30 открытый вебинар «Агенты без магии».

Разберём:
* как правильно ставить задачи агенту
* что такое скиллы, MCP и зачем они нужны
* в чем разница с пайплайнами, и почему для повторяемых задач они лучше подходят (например, n8n)

И с теорией, и с примерами. Свои подписки не требуются (но точно не будут лишними :) )


Участие, как и в предыдущий раз, свободное. Но нужно будет заполнить формочку (чтобы я знал, сколько вас будет).

А если есть вопросы или кейсы, которые хочется разобрать – пишите в комментарии.


А для тех, кто хочет глубоко погрузиться в ИИ и стать магистром AI ☕️ – у нас целая программа в МФТИ есть, с которой успешно выпустилось пять потоков. Онлайн, на английском, совместимо с работой, в небольшой группе. Подача документов через Госуслуги до 11 августа, вам достаточно оставить заявку, дальше мы проведем по шагам. Присоединяйтесь!


P.s. Долго думал, какие аналогии провести, получилось вот такое:
Claude Code – для храбрых
Codex – для спокойных
Goose – для желающих пропатчить KDE2 под FreeBSD
Hermes – для отаку
pi – 🐭
girafe.ai MSAI – онлайн-магистратура по искусственному интеллекту и машинному обучению Для тех, кто переходит в ML, развивает карьеру в AI или хочет усилить фундаментальную подготовку
  • ❤ 9
Post #705 2.85K
Mistral на столько frontier компания, что пока антропик и опенаи приостанавливает исследования моделей из-за опасности со стороны ии, а UK AISI утверждают, что Kimi вышла за границы sandbox, наши французские слоняры продолжают делать мощь💪💪💪💪🥖🥖
  • 😁 33
  • ❤ 8
  • 💅 7
Post #704 2.9K

Forwarded from Love. Death. Transformers.

все видели NLA/J space от антропиков? Ну типа учат доп модель "reader который читает активации " и по ним отвечает.

Вот и я видел, но мне не нравилось что:
- кастом модели надо учить с нуля
- нельзя смотреть " а была ли модель байеснута при ответе"

Ну и я обучил universal activation oracle - училась сразу на разных семействах моделей и через динамическую( там тонкий слой для каждой модели за 20s на цпу чтобы размерности поматчить) можно посмотреть "а что кими3 думает про Путина(ничего хорошего)" - иногда требуется покрутить слой который вы читаете чтобы получить хороший результат, но "почти всегда" работает из коробки на средних слоях.

По сути это общее решение для задачи
Activation oracle/white box monitoring
Велком тыкатся:
https://huggingface.co/spaces/AlexWortega/activation-oracle
  • ❤ 16
Post #701 2.48K

Forwarded from Love. Death. Transformers.

Котик(мальчик) а Москве ищет новый дом, нашли на улице, помыли, отвели в ветеринарнку(все ок), вам нужно только забрать и любить его.

@zjkarina
  • ❤ 20
  • 😢 9
  • 👍 3
Post #700 3.58K
К нам на MATS приходил Нил Нанда отвечать на вопросы. Я сделала хайлайты вопрос-ответов на мой вкус

Disclaimer: все QA пропущены через мою призму восприятия и писались строго по запоминающимся фрагментам

Топ вопросов:

💛Стоит ли сейчас идти на PhD в AI?

если там есть конкретный сильный ментор, с которым очень хочется работать, то в целом да. Но хорошее менторство можно получить и во frontier lab, куда ты просто устраиваешься на работу. Я так поняла, internships он тоже считает нормальной альтернативой. За пять лет PhD AI успеет очень сильно поменяться, поэтому overall suggestion звучал скорее как «идти, только если нет более подходящего варианта». И вообще искать в первую очередь не правильный формат, а хороших менторов.

💛Про его понимание интерпретации сейчас

Он сейчас понимает interpretability скорее как monitors и classifiers для corner cases. И говорил, что было бы круто сильнее совместить её с alignment. Что мне особенно понравилось, потому что я примерно так interpretability всегда и воспринимала: как инструмент для alignment, а не как отдельную область сама по себе.

💛Был ещё хороший тейк про выбор ресерч-проектов и их управление

Можно заранее написать план, как именно проект должен прийти к результату, поставить себе точки сверки и дальше проверять, успеваешь ли ты по этому графику. Если к нужному моменту вообще не пришёл туда, куда рассчитывал, возможно, проект стоит оставить, а не пытаться бесконечно его спасать.

Понять, стоит ли вообще браться за идею, можно, поспрашивав ментора, Fable и опираясь на собственный research taste. Правда, настоящий research taste Нил, по его словам, видел у очень небольшого количества людей, так что последний пункт не самый надёжный.

Были еще разные рассуждения на тему кто в долгосрок более способен на успех опенаи или дипмаинд и куда идти, если не в DeepMind, но не возьмусь передавать все тейки на эти темы🌚
  • 🔥 17
  • ❤ 9
  • 👍 8
Post #699 13.3K
что-то на DL-ском - Дали фидбек о избыточном использовании авторесерча и ллм для написания текста - иду советоваться с ллм как жить в такой конфигурации и писать скилл по сокращению артефактов от авторечерча *тут могла бы быть реклама скилла авторисерча, но мы не договорились…
Если вы думаете, что я шутила, то нет. Я буквально ваш стажер дурашка, который помешан на агентах😋

Вот скилл. Подходит и для кодекса и для Клода https://github.com/zj-karina/complexity-budget

По сути просто доп классификатор в вашу разработку, который делает ablation на надобность фичи

1. Определяет ближайший результат, который хотим достичь, а не глобальный вердикт
2. Проверят существует ли бейзлайн
3. Разбирает каждый компонент по 4 вопросам: какую гипотезу проверяет, нужен ли для ближайшего результата, что без него сломается, можно ли заменить на более простой алгоритм временно
4. Присваивает метку решения
5. Проектирует минимальный следующий эксперимент
6. Результат принятия решений

😏Подойдет, кстати, не только для разработки с авторесерч скиллом, но и для проверки вашей дурашости
GitHub GitHub - zj-karina/complexity-budget: Keep experiments simple with evidence-based complexity budgets. Keep experiments simple with evidence-based complexity budgets. - zj-karina/complexity-budget
  • 🔥 26
  • ❤ 11
  • 🤡 3
  • 👍 2
Post #698 3.43K
- Дали фидбек о избыточном использовании авторесерча и ллм для написания текста
- иду советоваться с ллм как жить в такой конфигурации и писать скилл по сокращению артефактов от авторечерча

*тут могла бы быть реклама скилла авторисерча, но мы не договорились о вознаграждении*
  • 😁 34
  • 👍 25
  • 🤮 9
Post #697 3.59K
Очень занятный блогпост выпустили знакомые стажеры с MATS-а

Задача была проверить вкус LLM-ок к правильному ресерчу (ну то есть на сколько авторесерч способен на написание статей)

Сетап следующий:
💛они отобрали свои любимые статьи (4)
💛взяли Opus попус и отобрали им утверждения начальных гипотез, которые стоит замаскировать, чтобы понять прийдет ли LLM, которую они тестируют к таким же утверждениям
💛Потом они опусом же оценивают на сколько отличаются предикты от того, что сделали люди в статье и выдают табличку метрик сравнения

Очень интересный эксперимент, но на мой взгляд имеет ограничения и лики
💛Во-первых не понятно, как оценила бы модель другого семейства (что забавно, у них не выстрелил лик с тем, что они тестируют опусом себя же, но может быть они не допроверили что было бы, если бы тестировали гпт гпт-шкой))
💛Во-вторых, они буквально все делают опусом, что кажется дает потенциальный лик в артефактах, которые они дальше передают
💛В-третьих, они не учитывают, что эти статьи могли быть в обучении LLM-ок, которые тестируют

Короче, резы все равно очень забавные, фабля остался в аутсайдерах в таком сетапе😏
  • ❤ 2
  • 🔥 2
Post #696 3.03K
– Сначала ты: как классно, я буду рабоать с safety и строить мониторинги с редтимом☺️
– Потом антропик команда со своим мониторингом с FP😠

Upd: ладно, я просмотрела свой датасет, так конечно есть за что так сказать))
  • 😁 41
  • ❤ 4
  • 😢 3
Post #688 3.66K

Forwarded from ML Underhood

По следам воркшопов и постерных сессий

Вчера мы анонсировали активности с участием наших исследователей на ICML 2026. Теперь делимся фото и впечатлениями спикеров о том, как это было.

Дмитрий Еремеев, Yandex Research:

Для меня это первая конференция — всё было в новинку, проходило очень насыщенно. Одну из наших статей, GraphPFN, мы представляли в формате постера на основной конференции, а ещё я выступал с докладом по ней на воркшопе по Graph Foundation Models. На постерах многие хвалили работу, часто задавали содержательные вопросы. В итоге GraphPFN ещё и получил best paper award на воркшопе!

К сожалению, не смог нормально посмотреть другие постеры и пообщаться с авторами, так как большинство релевантных нам работ были во время постерных сессий, когда мы сами представляли свои работы. Тем не менее, судя по представленным статьям, таким как PluRel или RDB-PFN, область движется именно в том направлении, которое мы считаем перспективным и важным и в котором активно развиваемся сами. Это не может не радовать!


Карина Романова, старший разработчик:

Я участвовала в воркшопе по Mechanistic Interpretability. К нашей статье был большой интерес со стороны исследователей из известных зарубежных университетов. Многие хвалили идею и говорили, что исследование будет полезно для их проектов.

Сам воркшоп был очень сильным. Нашли много хороших работ. Например, о том, как обучили VLA-агента в среде и выявили случаи, когда модель начинает «сходить с ума» (MultiSTEVE-1s). Или о том, что активации модели содержат больше информации для определения важных шагов рассуждения, чем сами токены (Reasoning Models Know What’s Important, and Encode It in Their Activations).

Было приятно поделиться опытом наших исследований с коллегами на международной площадке и перенять их опыт.


#YaICML2026

ML Underhood
  • ❤ 20
  • 🔥 1
Older posts →

About this channel

How can I read @nadlskom without a Telegram account?
TGViewer shows the public web preview Telegram publishes for что-то на DL-ском: recent posts, photos, videos and the subscriber count, with no app, login or account.
How many subscribers does что-то на DL-ском have?
что-то на DL-ском (@nadlskom) has 4.99K subscribers on Telegram, refreshed roughly every 30 minutes.
Does что-то на DL-ском know I viewed it here?
No. Public channel previews carry no viewer identity, and TGViewer has no accounts or tracking of what you look up.
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →