Если вдруг вы задумались об аренде сервера или сборке своего собственного для запуска LLM, то у меня для вас кое-что есть
CPU inference == боль в попе
Даже 8 ядер и 16 гб ОЗУ дадут максимум 15 токенов в секунду, что можно сравнить со скоростью выполнения кода на джаве
А на GPU, ну...
просто смотреть дорого...
Для простого работяги цена ошибки - выкинутый месяц работы
Но какой-то китаец озаботился вопросом и погонял популярные модели на популярном железе
Так что держите мега ценную и мега полезную табличку
https://github.com/XiongjieDai/GPU-Benchmarks-on-LLM-Inference
Post #591
3.61K