TGViewer
Data Blog Data Blog @jdata_blog · 2.42K subscribers
Post #536 1.4K
Зонды в проде и что послушать/почитать

Что такое зонд:
Зонд — мини-ML-вида-модель, которая работает на активациях большой модели. Задача такова:
Наш Х — скрытое состояние LLM на каждом токене — список матриц (для каждого примера — матрица d × n, где n — длина последовательности, d — внутренняя размерность модели). Не тензор, потому что есть нюансы — скину в комменты.
Наш Y на списке матриц — бинкласс — как там сейчас говорят «норм или стрём».


Зачем:
На зонд можно смотреть как на аппроксимацию. Ряд Тейлора мы тоже не считаем до конца, а берем приближение — тут также — мы что-то приближаем (пространство решений нашей страшной модели), чем-то попроще.

И, гуляя по интернету — я словила два свежих упоминания, где лабы выкатили детекторы-зонды на внутренних состояниях в прод.

Anthropic: короткое и без деталей
Борис Черни рассказал, что у них на трафике (на нас, получается) крутится классификатор prompt injection, который смотрит на загорающиеся нейроны — модель об инъекции не скажет, а нейроны видно. Но это подкаст, и всё в нём — слова.

DeepMind: подлиннее, с деталями
Building Production-Ready Probes For Gemini. Статья январская, но я её нашла в июльском отчёте, где как раз и написано, что зонды доехали до прода. Там же написано, что это «сложное изменение, затрагивающее много частей инфраструктурного стека» — но раз внедрили, видимо, оно того стоило.

Что делали:
Ловили cyber-offensive промпты на входе Gemini 2.5 Flash. Вредные запросы здесь очень похожи на легитимные вопросы по безопасности и вообще на обычный процесс написания кода. Почему — потому что давайте сами вспомним свой последний запрос в LLM при починке прода или эксперимента — специфика области.

Тезисы на забрать или осмыслить:

1. Линейная модель — база, но в прод доедет не на всём. В статье семь семейств: четыре из прошлых работ (линейный, EMA, MLP, attention) и три своих (MultiMax, Max of Rolling Means Attention и найденные автоматическим поиском через AlphaEvolve). Различаются они функцией агрегации (не путать с активацией) — тем, как n оценок, по одной на токен, сворачиваются в один скаляр.

2. Линейная модель фолзит, и фолзит агрегация. FNR на длинноконтекстных атаках у линейного зонда с mean pooling — 99.13%. Причина — усреднение, вред — это очень мало токенов из их большого количества. При этом, если сменить только агрегацию (на скользящее экспоненциальное среднее с максимумом), то FNR падает в среднем с 58.84% до 7.12%, но растет FPR (с 5.29% до 26.69%) и в целом ошибка модели на пару процентов. Зонды также не бьют LLM-классификаторы по общей ошибке, но бьют их по FNR на длинном контексте и джейлбрейках (на многоходовых и адаптивных атаках — проигрывают).

3. Сид в зондах — слабая компонента влияния на качество. Менять сиды в зондах — классическое требование всех статей, отсюда и GDM гоняли по 100 сидов на архитектуру. Отбор лучшего по валидации даёт выигрыш 0.008 test loss. А выбор архитектуры — 0.064 у линейного mean против 0.025 у лучшего.

4. Для практического внедрения зонда порог выбирается не по его качеству. В статье порог — взвешенная сумма FPR и FNR на валидации, и веса — цена каждого типа ошибки. Упрощая: заблокировать невиновного здесь в десять раз дороже, чем пропустить виновного (вес 50 против 5) — потому что настоящих атак в трафике исчезающе мало, а обиженных пользователей будет много.

С чего в прод понесли?

Зонд — это инференс стоимостью обученных весов. У простейшего линейного зонда таких весов выйдет всего d; у остальных архитектур больше, но всё равно на порядки меньше любой LLM. Активации — почти бесплатный датасет — модель всегда считает сама для forward pass-а, мы их подбираем.

В статье разрыв в стоимости с LLM-классификатором — больше 10 000× (это вычислительная стоимость инференса на запрос).

Что получили, работает:
Каскад: они отправляют в LLM только ~8% запросов, где зонд не уверен, — и получают ошибку ниже, чем у самой LLM. Причём Flash по всей кривой цена/качество бьёт Pro версию и мы (снова) видим, что большая модель ≠ лучший классификатор.
Ycrootaccess Boris Cherny: Building Claude Code Claude Code creator Boris Cherny on Opus 5, agents that run for days, and building products when the models keep outrunning you.
  • 🔥 7
  • ❤ 4
More from @jdata_blog
  1. Sep 18, 2026А ещё вас стало невероятно сильно больше, и я безумно рада видеть новых людей (вы мой мале…
  2. Sep 18, 2026Третий момент, который мне прям вот захотелось записать-написать — это то, что надо это ло…
  3. Sep 18, 2026"AI решил выберите-проблему-математиков" Безумно обожаю, когда решаются какие-то сложные з…
  4. Sep 13, 2026Вебинар про объяснимость агентов и во что можно поиграть Как самый ответственный человек н…
  5. Sep 10, 2026Теперь официально: погнали пить кофе в Лондоне. 23 сентября выступаю на конференции Applie…
  6. Sep 4, 2026Вообще, я тут порефлексировала за лето, и поняла, что в канал надо постить кружки, чтобы о…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →