TGViewer
ml phys ml phys @mlphys · 2.89K subscribers
Post #317 1.92K
Пост про децентрализованный инференс

В прошлом году я писал про Cocoon, децентрализованный инференс для LLM на NVIDIA TEE. TEE это технология NVIDIA, которая гарантирует, что вычисления идут приватно. Владелец видеокарты не может прочитать ваш запрос, а вы можете проверить, что он действительно запустил нужную модель. Поэтому покупатель токенов знает две вещи: он получает модель, за которую заплатил, и никто не читает его запросы. Это гарантирует криптография, сервису не нужно верить на слово.

GPU confidential computing появился начиная с NVIDIA H100. H100 стоит десятки тысяч долларов, это совсем не потребительская видеокарта. Поставщиками в таких сетях в основном становятся дата-центры, и децентрализация получается ограниченной.

А хотелось бы, чтобы любой человек в любой точке мира мог подключить обычную видеокарту и генерировать токены (где-то мы это уже видели) для разных AI-моделей. Такая сеть могла бы задействовать огромный парк дешёвого простаивающего железа по всему миру: люди подключают свои видеокарты на ночь, предложение compute растёт, цена инференса падает относительно дата-центров.

Но тут возникает проблема: как гарантировать, что инференс-провайдер выполняет нужные операции и запускает нужную модель? В сеть могут войти аферисты, которые запустят заквантованную до лоботомии версию модели, модель сильно меньше исходной или вообще будут выдавать константный текст, получая деньги за токены.

Проверяют это через logprobs. Исполнитель вместе со сгенерированным текстом отдаёт распределение вероятностей следующих токенов. Валидаторы случайным образом выбирают позиции, повторно вычисляют их на заявленной модели с теми же параметрами и сравнивают распределения. Значимое расхождение выдаёт подмену: мошенника исключают из сети и лишают вознаграждения. Достаточно проверить малую случайную долю позиций. Logprob-проверка подтверждает честность инференса, но приватность запроса сама по себе не обеспечивает.

На этом подходе строится Gonka, сеть децентрализованного инференса, которую развивают братья Давид и Даниил Либерманы. Сеть рассчитана на распределённое железо, включая потребительские GPU.
Telegram ml phys Сосун Недавно Telegram прдеставили cocoon - децентрализованную сеть для инференса моделей LLM. Почти одновременно с ними (но не так громко) запустились еще 2 подобные сети - gonka.ai от Либерманов и Loyal который собрал сумашедшие 75 млн долларов на IDO…
  • ❤ 21
  • 🤝 4
  • 🤔 1
More from @mlphys
  1. Sep 20, 2026Дайте астре почилить хотя бы в воскресенье
  2. Sep 16, 2026https://mimo.xiaomi.com/rl/ Риал тайм дашборд трейнинга новой модели сиаоми
  3. Sep 10, 2026Изи
  4. Sep 8, 2026Очередной benchmark забенчмаксили , причем всего с 14 до 28 процентов, почему все так хайп…
  5. Sep 3, 2026Agi is here?
  6. Sep 1, 2026Post #343
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →