TGViewer
Карлсон, который живет до Сrash'a | IoT, АСУТП, Linux, AI Карлсон, который живет до Сrash'a | IoT, АСУТП, Linux, AI @rtsoftcourses · 313 subscribers
Post #360 253
Отличный материал для тех, кто проектирует инфраструктуру под LLM под промпредприятия.

Если коротко: эпоха, когда инференс был просто одним прогоном нейросети закончилась, наступила эпоха Inference 2.0 (sic!)

В корпоративном секторе сейчас правят бал агентные системы. Один пользовательский запрос дробится на кучу задач: один агент достает данные из базы, второй анализирует, третий проверяет на соответствие политикам безопасности. Плюс поверх всего висит RAG, векторные базы и графы знаний. Инференс превратился в оркестрацию целого рабочего процесса.

Из-за этого архитектура систем сильно меняется:

Во-первых, метрики. Важны уже не голые токены в секунду, а время до полезного ответа. И этот ответ должен быть не только быстрым, но и авторизованным, и задокументированным для аудита. Если платформа А генерирует текст в два раза быстрее, но платформа Б быстрее подтягивает корпоративный контекст и права доступа, то пользователь быстрее получит результат именно от Б. Выбор в пользу Б очевиден.

Во-вторых, бутылочные горлышки. Ускорять только матричные умножения уже бессмысленно. Главная боль — управление памятью. Агенты постоянно дергают одни и те же системные промпты и контекст. Чтобы не гонять одно и то же по кругу, приходится внедрять paged attention (как в vLLM), кэширование префиксов через radix trees и спекулятивное декодирование. Управление KV-кэшем стало важнее, чем пиковые флопсы.

В-третьих, железо и интерконнекты. HBM на ускорителях не резиновая, поэтому в ход идут CXL для шеринга памяти между CPU и ускорителями без лишних копирований. А рутину вроде шифрования, сетевой сериализации и проверок прав доступа скидывают на DPU и SmartNIC, чтобы разгрузить GPU. Сам рантайм теперь работает как диспетчер: векторный поиск едет на CPU, тяжелая математика на GPU, а проверки политик — на хостовые ядра. Сеть из фона переехала прямо в критический путь выполнения запроса.


В общем , будущее наступило. А вы n8n уже активно пользуетесь, или чем-то еще? 🤔
EDN Inference 2.0: How enterprise AI is reshaping AI system architectures - EDN Enterprise AI is turning inference from a model-level computation into a context-aware workflow. System architects must now reconsider what AI performance really means.
More from @rtsoftcourses
  1. Sep 18, 2026АСМР: во что сублимируется инженерная мысль (когда много свободного времени и энтузиазма ч…
  2. Sep 18, 2026👋 Традиционно собрали для вас вебинары с промышленным уклоном на грядущую неделю (21 сент…
  3. Sep 18, 2026Мы сгоняли на прошлой неделе на конференцию Smart Oil & Gas 2026 и выступали с докладом о…
  4. Sep 17, 2026Web-интерфейс в контроллере — это удобно Кто ж спорит. Открыл браузер, подключился к устро…
  5. Sep 16, 2026Certificate expired Чаще всего такая надпись в терминале может заставить задержаться на ра…
  6. Sep 14, 2026Stuxnet помните? 16 лет прошло, а USB остаётся одним из главных векторов атак на промышлен…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →