☕ Java добралась до GPU Tensor Cores почти без потери производительности
В Project Babylon показали, как один и тот же Java Tensor API можно запускать на разных GPU через HAT — без переписывания логики под каждого производителя.
На NVIDIA A10:
- обычный matrix multiply: около 240 GFLOP/s
- через Tensor Cores: до 7,3 TFLOP/s
- производительность приблизилась к native CUDA/WMMA
На Apple M4 Max тот же Java-код запускается через OpenCL 1.2, а после настройки tile size и параметров запуска получил до 8× ускорения относительно наивной реализации.
Под капотом:
- Project Babylon даёт code reflection
- HAT преобразует Java-код под GPU backend
- Tensor API абстрагирует MMA-операции
- NVIDIA получает аппаратные Tensor Cores, а другие платформы — эквивалентное tiled-исполнение
Интересный шаг к тому, чтобы писать высокопроизводительные GPU-вычисления на Java и сохранять переносимость между разным железом.
https://social.ora.cl/6011BEbmLc
Post #2329
1.82K
- 🔥 5
- ❤ 4
- 🥰 2
- 🤯 1
- 🎉 1