Для сравнения: большинство флагманских моделей сейчас дают 80–120 tok/s.
При этом речь не об урезанной модели, качество то же, ускорили именно систему запуска.
Команда TileRT переписала то, как модель работает на GPU: вместо сотен последовательных мелких операций с паузами между ними — один непрерывный процесс, который не останавливается между генерацией токенов.
@ai_for_devs