PSA для тех, кто подумывает купить себе AI Max (ответ на пост https://t.me/grakovne/817)
*идет токсично делиться экспертизой*
1) Важную роль в скорости ответа несет память, чем она быстрее, тем больше токенов в секунду. Нужно прочитать все активные веса, чтобы сгенерить 1 токен
Конечно 128 гигов против 24 выглядит как мегапобеда, но потом мы копаем внимательнее и видим всего 210 GB/s у GMKtec EVO-X2 против 920 GB/s у RTX 4090, разница больше чем в 4 раза
2) gpt-oss-120b это *очень* устаревшая модель, да, она вышла только год назад, но если посмотреть ее место на агрегаторе бенчмарков https://benchlm.ai/, то у нее 133 место, против 114 места у вышеупомянутого Qwen3.6-35B-A3B
Притом у oss активных весов ~5b против 3b у квена
Тоесть эта модель сосет по всем фронтам: ей нужно больше оперативы, она медленнее и она тупее
3) Что касается сравнения Qwen3.6-35B-A3B и Qwen3.6-27B, большая разница тут в количестве активных весов. Если очень упростить то количество активных весов это умность, а суммарный размер это кругозор. При правильно прикрученном харнессе 27B порвет 35B очень сильно, тк разница по активным весам там в 10 раз
Кстати тот факт что модель dense, мешает ее запускать на относительно медленном (210 GB/s) железе, будет очень медленно, даже с MTP. И собственно этот факт делает неплохим кандидатом RTX PRO 6000 Blackwell, там скорость аж 1800 GB/s, в 9 раз быстрее AI Max
Как альтернативу можно ее запихнуть в 5090 особенно в 4 bit, чтобы не продавать почку
4) Отдельно хочется отметить абсолютно корявую поддержку дров AMD в ситуациях когда ты немного отходишь от стандартного пути. Я так понимаю NPU на линкус до сиг пор нормально не затащили. Хотя там были некоторые подвижки, может инфа старая
Основная прелесть обладания карточками nvidia это высокая поддержка софтом и моделями, их релизят со сразу рабочими cuda кернелами, когда под amd все доедет по принципу когда-нибудь, а в такой резко меняющейся отрасли как AI, это значимо
Post #1706
319