TGViewer
что-то на DL-ском что-то на DL-ском @nadlskom · 5K subscribers
Post #709 11.8K
В прошлую пятницу был финальный симпозиум MATS 10 потока. Мы рассказывали talk про нашу работу в офисе Лондона + стояли с постером (поигрались в что-то вроде oral на конфе)

мы сейчас в процессе сведения всего к завершающей точке и подачи на конфу + пост моей части про генерацию механизмов атак

Цель работы следующая: уже со специфичным скофолдингом ваш агент может работать типо день.
Есть ли возможность проверить все вызовы вручную?
- нет.
Но есть решение, можно поставить модель дополнительную в харнес и она за вас просмотрит все выводы и решит было ли что-то в траектории противодейственное. 🐱

Так вот наш пайплайн направлен буквально на создание таких моделей. Вы можете взять любую новую фронтирную модель и натравив наш пайплайн тренировки (red-blue loop) улучшить модель чтобы она сама себе была монитором. Почему так работает? Потому что у вас есть редтиминг. Сторона, которая генерирует атаки, чтобы модель исходная их не поймала. И блу тиминг. Сторона, которая на основании собранного сложного сета с прошлой части обучает модель распознавать такого рода атаки

Red team строится так:

Берем реальную чистую траекторию, режем на шаги и вставляем side task так (как именно мы ищем механизм атаки надеюсь совсем скоро выйдет постом от меня на Less Wrong) , чтобы отличался только он. Получается траектория близнец, отличающийся от оригинала ровно вставленными шагами. На blue стороне можно обучать монитор находить атаку из 2 пар

💛модель ищет правдоподобное окно и добавляет минимум шагов
💛панель джаджей проверяет, что правка настоящая, минимальная и естественная
💛сложность оценивают уже после заморозки пары, чтобы она не влияла на поиск

Что это дает на эвале? тайминг (успел ли монитор до необратимого шага и на сколько опоздал) и атрибуцию с ложными тревогами (скор поменялся из-за вставки или просто из-за задачи, и что монитор делает на бенайн-близнеце).

На постере замеры работоспособности 💅

P.S. было еще 2 крутые работы с симпозиума:

Stealing Reasoning Traces from Proprietary LLM APIs

Diffuse AI Control on Fuzzy Tasks
  • ❤ 19
  • 👍 3
  • 🔥 2
  • 🤡 2
More from @nadlskom
  1. Sep 16, 2026Привет, я работаю в METR. Занимаюсь самым трендовым ai safety. Дада, я на контракте в berk…
  2. Sep 14, 2026Я обучил очень простой переводчик мозга мухи который позволяет ей управлять microduck, так…
  3. Sep 11, 2026Ладно, настоящая работа все же имеется🎀. И там мы на Хабре выложили мой блог постик про I…
  4. Aug 28, 2026Я переехала в Лондон снимаю квартиру за 504049483 тысяч долларов и я не нашла нормальную р…
  5. Aug 25, 2026Когда начальству пытались рассказать все нюансы использования, но это единственное, что он…
  6. Aug 22, 2026Себастьян Рашка (видео) про то, как Claude маркирует сгенерированный текст. В свете моего…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →