Почему самая маленькая квантизированная модель оказалась медленнее — разбор на бенчмарках
Chris Merrick прогнал MobileNetV2 в трёх квантизациях (FP32/INT8/INT4) на Pixel 10. Результат - самая лёгкая по весу INT4 на CPU оказалась медленнее INT8. Вывод: размер файла не главный критерий быстродействия.
Полезно, если делаешь on-device inference и оптимизируешь модели под мобилки.
#AI #Android #OnDeviceAI
Post #201
2.44K
- 👍 6
- 👎 5