Свой AI сервер
1. Начало
Желание поиграться с локальными нейросетями возникло у меня год назад вместе с организацией рабочего место и сборкой PC. С этой целью (ну и еще изредка поиграть) была куплена RTX3080 на 10GB. Она позволяла довольно комфортно запускать доступные на тот момент 7B модели вроде llama-2, vicuna и что-то еще. Быстро наигравшись с ними я понял, что хочется большего и следующей покупкой стала P102-100 10 GB – майнинговый обрезок то ли GTX1080TI, то ли еще чего-то, с целью проверки работы 2-GPU. На удивление особых проблем не возникло и в такую конфигурации помещались уже 14B модели. Так, постепенно меняя GPU, я остановился на 2xRTX3090 24 GB в рабочем PC. Эта конфигурация позволяет запускать модели до 70b с небольшим контекстом, и вполне уверенно работать Qwen3-Coder 30B в агентном режиме. Но и этого кажется мало, ведь есть есть куда более интересные модели вроде GLM 4.5 Air, GPT-OSS-120B и Qwen3-Next 80B, которые никак не влезут в 48GB. К сожалению мой корпус (да и мало какой) не вмещает больше двух RTX3090, да PC лишний раз трогать не хочется, т.к. сейчас это мой главный рабочий инструмент. Поэтому в конце лета я решил собрать себе отдельный сервер под AI, тем более на WB подвернулось интересное предложение по видеокартам.
2. Видеокарты
Основа AI сервера - видеокарты, чем они мощнее и чем больше у них памяти - тем больше возможностей, но и выше цена и энергопотребление. Мне не хотелось вкладывать много - уже был довольно неплохой PC с двумя RTX3090 и однажды, увидев на WB AMD Radeon Mi50 Instinct по небольшой цене и почитав про эти ускорители я решился их приобрести. Получалось, что за цену одной RTX3090 четыре Mi50 давали в 5 раз больше памяти с половинной производительностью по GPU. Конечно 5 RTX3090 выглядят гораздо интереснее, но тратить столько денег я не был готов (RTX3090 сейчас чуть ли не лучший выбор по соотношению цена/производительность). Варианты с Tesla M и K серии отмел из-за недостаточной производительности, P100 была примерно в ту же цену, но 16GB, а V100 по привлекательной цене появилась только сейчас (правда тоже только на 16GB еще и с китайским адаптером SXM2 - PCI-E, версия на 32GB все еще в два раза дороже Mi50)
3. Охлаждение видеокарт
Проблема этими видеокартами еще в том, что они рассчитаны на продув вентиляторами в серверном корпусе, а желания ставить их в жилое помещение у меня никакого нет. К счастью из-за небольшой цены у этих видеокарт быстро набралось сообщество фанатов в [дискорде](https://discord.gg/svMRdGFs), которые разработали несколько вариантов охлаждения с приемлемым уровнем шума. Несколько часов печати на 3D принтере и месяц ожидания, и вот турбинное охлаждение для видеокарт выглядит почти как заводское.
3. Платформа
Кроме видеокарт нужны еще прочие компоненты - материнская плата, процессор(ы) и оперативная память. Обычные материнские платы не позволяют так просто подключить четыре видеокарты, обычно не хватает слотов PCI-Ex16 и их расположение. В моем текущем десктопе стоит одна из немногих материнских плат, имеющих расстояние в 4 слота между разъемами PCI-Ex16, но при этом второй разъем фактически только x1. Плюс обычные процессоры имеют ограниченное число линий PCI-E, например для AMD Ryzen 5 9600x который, стоит у меня в PC доступно только 24 линии. Мне же для четырех видеокарт в идеале иметь 64 линии (в теории количество линий влияет лишь на скорость загрузки моделей, но лучше больше, чем меньше). Такую возможность предоставляют серверные платформы на XEON и EPYC, а также HEDT вроде Threadreaper. Проблемы с ними в том, что серверы сильно шумят и никак не рассчитаны на работу в жилом помешении, а HEDT решения обычно представляют из себя обычные ATX или EATX платы с теми же проблемами с подключением нескольких GPU. Тут могли бы помочь райзеры, но это увеличивает размер корпуса и усложняет сборку. В результате поисков на Aliexpress была найдена двухпроцессорная материнская плата на платформе 2011-3 и два процессора Xeon E5-2687WV3, каждый из них дает по 40 линий PCI-E, чего вполне должно хватить.
4. Память
Post #7
66