TGViewer
Эхо Телеги Эхо Телеги @echo_telegi · 9.43K subscribers
Post #287 16.3K
В MAX встроена нейросеть, которая слушает ваши звонки 📞

VK модифицировали WebRTC – технологию, через которую работают звонки – и встроили туда систему распознавания ключевых слов. Та же технология, что «Привет, Алиса». Только здесь она работает на вашем микрофоне во время звонка, а вы об этом не знаете.

Когда вы звоните в MAX, нейросеть режет аудио с микрофона на куски по 10 миллисекунд и на каждом решает – произнесено ключевое слово или нет. Модель BC-ResNet, 1.17 МБ, ~300 тысяч параметров, streaming mode. Сейчас обучена на фразу «не слышу» – якобы для определения плохой связи. На данный момент выключена на сервере.

Но вот в чем дело. Модель не зашита в код приложения. Она лежит на публичном CDN – st.okcdn.ru и скачивается по ссылке из серверного конфига. При запуске MAX получает от сервера JSON с тремя полями: URL модели, MD5 и флаг use. Скачал, проверил хэш, загрузил в движок. Все.

Приложение вообще не проверяет, что модель распознает. Нет списка допустимых слов. Нет whitelist. VK кладет на CDN новый файл, меняет URL в конфиге – и при следующем звонке ваш телефон уже ищет не «не слышу», а что угодно. Без обновления в сторе и уведомления. Можно включить для одного конкретного userId.

При срабатывании отчет улетает на api.ok.ru. Внутри метрика bad_call_detected_by_audio_spotter, строка «не слышу», уровень уверенности от 0 до 1, привязка к userId и call_id. VK видит: в таком-то звонке у такого-то пользователя сработал детектор. Название метрики зашито в код – даже если модель заменят, отчет все равно уйдет как «не слышу». Удобно.

Модель рабочая. Побрутили CDN, перебрали 200+ путей – других моделей пока нет. Три версии SDK, во всех одна и та же модель с одинаковым MD5.

Теперь про звонки. P2P-соединений в MAX нет. Все медиаданные идут через TURN-сервер VK. Шифрование DTLS-SRTP есть – но от вас до сервера, а не от вас до собеседника. На relay-сервере шифрование заканчивается. Ключи у VK. То есть VK технически имеет доступ к аудио всех звонков.

И вишенка. В коде есть серверный флаг calls-sdk-log-audio – если VK его включит, аудио звонка пишется в файл. Плюс JNI-методы для дампа raw-аудио в файловый дескриптор. Все управляется с сервера.

Разница между детектором плохой связи и прослушкой – один URL в конфиге. Код, процесс, отправка на сервер – все одно и то же. Меняется только файл на CDN 🙃

Полный разбор по ссылке.

@echo_telegi​​​​​​​​​​​​​​​​
  • 🤯 73
  • 👍 44
  • 🤬 29
  • 😁 16
  • 🤔 3
  • 👎 2
More from @echo_telegi
  1. Oct 1, 2026MAX дал каналам две недели на регистрацию в РКН 🤦‍♂️ Админам MAX-каналов от 10 тысяч подп…
  2. Sep 15, 2026Ниша, в которую админы заходят прямо сейчас ✈️ 65 миллионов россиян открывают телегу через…
  3. Sep 8, 2026Телеграм массово ломают стикером в три строки 😵‍💫 Со вчерашнего вечера Telegram начал вы…
  4. Aug 26, 2026И что, ловит даже в ПВЗ?! 😄 @echo_telegi
  5. Aug 14, 2026Telegram сегодня празднует 13-летие! 🚀 Тринадцать лет – и ни одного спокойного. Внутри за…
  6. Aug 13, 2026Медведь-террорист? 🤯 Вышел новый подарок – медвежонок в камуфляже, автомат, бомба. 50 зве…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →