Когда у тебя в продакшене сотни тысяч видеокарт, даже один процент производительности — это серьезные деньги.
Михаил Лукин из компании Судо рассказал, как они 70 дней бенчмаркили разные варианты инструкций.
✏️ Code reordering для compute-bound задач на примере CUDA
Часовой доклад о микроархитектурной оптимизации для RTX 30-й и 40-й серий. Узнаешь, почему целочисленные операции до сих пор в 64 раза медленнее floating-point и как обмануть компилятор NVCC.
Если работаешь с CUDA на production-нагрузках — сохрани в закладки. Где вы обычно теряете производительность на GPU?
👉 Доклад
🔹 Курс «Алгоритмы и структуры данных»
🔹 Получить консультацию менеджера
🔹 Сайт Академии () 🔹Сайт Proglib
Библиотека C/C++ разработчика
#линкер_рекомендует
