TGViewer
Книжный куб Книжный куб @book_cube · 15.7K subscribers
Post #4781 2.76K
ASUS ExpertCenter Pro ET900N G3: локальные модели за $100 тысяч (Рубрика #AI4SDLC)

Посмотрел опубликованный 30 июля 2026 года тест Алекса Зискинда «This was a data center a year ago… Now it's on my desk». Кажется, свои локальные модели никогда ещё не были так близко. Осталась мелочь: найти $100 тысяч на собственный настольный суперкомпьютер ASUS ExpertCenter Pro ET900N G3.

И это почти не преувеличение. Один из американских продавцов указал для системы цену $99,999.99. За эти деньги получаем башню на архитектуре NVIDIA DGX Station: 72-ядерный Grace CPU, Blackwell Ultra GPU, до 20 PFLOPS в FP4 по спецификациям NVIDIA и 748 ГБ когерентной памяти. Год назад такой объём AI-вычислений ассоциировался скорее со стойкой, а теперь коробку можно поставить рядом со столом. Правда, с максимальным энергопотреблением системы до 1,6 кВт это всё-таки больше сервер в офисе, чем новый домашний PC:)

Самое интересное здесь - память. В рекламной строке 748 ГБ выглядят как один огромный общий пул, но физически он состоит из двух очень разных частей:
- 252 ГБ HBM3e с пропускной способностью до 7,1 ТБ/с;
- 496 ГБ LPDDR5X с пропускной способностью до 396 ГБ/с;
- между Grace и Blackwell - когерентный NVLink-C2C, поэтому GPU может обращаться к обеим областям в общем адресном пространстве.

Это снимает жёсткую границу «модель не поместилась в VRAM - запуск невозможен», но не отменяет физику. В тесте квантованная до NVFP4 GLM-5.2 занимает около 465 ГБ и целиком в HBM не помещается. Она запускается локально, однако части весов приходится читать из более медленной памяти, поэтому скорость заметно уступает моделям, которые полностью остаются в HBM. Когерентная память - это не магические 748 ГБ одинаково быстрой VRAM.

Вторая важная часть видео - это не скорость одного чата, а конкурентный режим работы моделей. На NVIDIA Nemotron 3 Super 120B Алекс запускает до 128 параллельных агентов. В зависимости от модели и числа запросов суммарная производительность доходит до нескольких тысяч токенов в секунду. Это работает за счёт continuous batching: GPU собирает много запросов и эффективнее обрабатывает их вместе. При этом отдельный агент ждёт дольше - общий throughput растёт не бесплатно.

И вот здесь система становится интересной не богатому любителю, а команде. Один локальный узел может обслуживать coding agents, исследовательские задачи и внутренние AI-сервисы, не отправляя код и данные во внешний API. Можно держать десятки долгоживущих агентов, экспериментировать с большими open models и получать предсказуемую инфраструктуру под высокой постоянной нагрузкой.

Но я бы поспорил с формулировкой «нулевая цена токена». Цена просто переезжает из API-счёта в капитальные затраты, электричество, охлаждение, хранение, обновления и эксплуатацию. А ещё локальная модель должна пройти тот же quality gate, что и облачная: 128 агентов бесполезны, если каждый из них быстро производит посредственный результат.

Для меня главный вывод такой: локальный AI действительно сменил класс. Теперь «локально» может означать не маленькую модель на ноутбуке, а сотни миллиардов параметров и целую команду агентов на одной машине. Железо не спроектирует за нас агентную архитектуру и не решит задачу качества, но резко поднимает потолок того, что можно собрать в собственном контуре.

Свои локальные модели ещё никогда не были так близко. Особенно если у вас завалялись $100 тысяч, отдельная линия питания и очень убедительный бизнес-кейс:)

P.S.
А моя жаба раскошелилась только на комп "Beelink GTR9 Pro AMD Ryzen™ AI Max+ 395" (или вот он же, но уже в России), которого тоже хватает для экспериментов:)

#AI #AI4SDLC #Agents #Engineering #Architecture #Hardware
YouTube This was a data center a year ago… Now it's on my desk 748GB of unified memory, 400Gb networking, and a 1400 watt superchip on one desk. I tested how many AI agents the ASUS ExpertCenter Pro ET900N G3 can actually run. 🔹 Try out ChatLLM - http://chatllm.abacus.ai/ltf and Abacus AI DeepAgent - http://deepage…
  • ❤ 11
  • 👍 5
  • 👎 1
  • 🔥 1
More from @book_cube
  1. Oct 4, 20263 AImigo S1E8: AI-native компания — материалы выпуска (Рубрика #AI4SDLC) Собрал материалы…
  2. Oct 4, 2026В процессе подготовки к переезду начал разбирать книжки и освобождать свою библиотеку. Нат…
  3. Oct 4, 2026Stanford CME295, лекция 1: как текст становится вычислениями (Рубрика #AI) Первая лекция к…
  4. Oct 3, 2026Камил видит руками (Рубрика #ForKids) Читаю своему пятилетнему сыну Кириллу перед сном эту…
  5. Oct 3, 2026Где деньги в своих данных: цены, клиенты, ассортимент — материалы второго выпуска (Рубрика…
  6. Oct 2, 2026Как AI меняет роль техлида: запись круглого стола (Рубрика #AI4SDLC) Если агент пишет код,…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →