TGViewer
Роман с данными Роман с данными @roma_data · 2.72K subscribers
Post #192 3.21K
Anthropic выкатили любопытный разбор “Detecting and preventing distillation attacks”

Они утверждают, что DeepSeek, Moonshot (Kimi) и MiniMax в промышленных масштабах «дистиллировали» Claude — то есть генерили ответы сильной модели и использовали их как обучающие данные для своих. По их оценке, было сгенерировано больше 16 млн диалогов через ~24 тыс. фрод-аккаунтов и прокси. Ключевая цель — самые дорогие навыки: reasoning, tool-use, coding, агентность.

Почему это вообще имеет смысл? Потому что это про экономику.

Если вы хотите получить сопоставимое качество данных «вручную», то вам нужны тысячи человеко-часов: разметка, сравнение ответов, рубрики, проверки, консистентность, контроль качества. Даже если очень грубо и дешево считать $1 за “качественную единицу разметки” (а для сложных задач это часто сильно выше), 16 млн единиц — это $16 млн. Если считать ближе к реальности пост-трейнинга (где люди реально думают, оценивают, спорят, прогоняют рубрики) — легко получается сотни миллионов долларов!

А синтетика от сильной модели превращает это в «копейки». Условно: не $1–$20, а $0.01 и ниже (в зависимости от длины ответов, модели и прайса/доступа). Тогда 16 млн — это $160k–$1.6 млн. То есть разница не “в два раза”, а на порядки: x50–x500+ по стоимости (и это без учета того, что синтетика ещё и масштабируется мгновенно).

Вот почему тема дистилляции такая токсичная: вы не просто «ускоряете обучение», вы переносите самый дорогой актив — “качество” — практически напрямую. И дальше уже вопрос не только бизнеса, но и контроля: сохранятся ли safeguards, как это влияет на экспортные ограничения и т.д.

Мой вывод простой: у фронтира главный дефицит — не только GPU, а качественный пост-трейнинг. И именно поэтому все будут либо защищаться от дистилляции, либо пытаться её делать.

Кстати, мы во VseLLM натренировались и научились генерировать синтетику не хуже китайцев.
Так что если интересно - пишите в ЛС 😉
  • ❤ 10
  • 🔥 8
  • 😱 4
  • 👍 2
More from @roma_data
  1. Aug 11, 2026⭐️ Новая арена и вклад в развитие сообщества В этом году LLM Arena стала победителем на пр…
  2. Jun 30, 2026Так, я не дурак 😀 Yupp сжег 33 ляма баксов и закрылся 😬😬😬 Что произошло: мы запустилис…
  3. Jun 21, 2026Ездил в апреле в США в SF - там все обсуждали harness Приехал на Саусхаб - снова harness,…
  4. Jun 10, 2026photo post
  5. Jun 10, 2026photo post
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →