TGViewer
Channel Public Channel
GPGPU Russia

GPGPU Russia

@gpgpu_ru

Канал по GPGPU
Subscribers
520
Photos
45
Videos
2
Links
317
Recent Posts 20 shown
Post #387 499
Для тех, кто не едет в Москву вкусно покушать и выиграть подарки послушать крутые доклады, 24 сентября в 19:00 в ПОМИ будет крутая лекция (кстати, бесплатно, но зато без шашлыка): Автоматическое построение PBR текстур для фотограмметрических моделей. Приходите, будет интересно. Я бы тоже пришёл, но уже задействован в SmartData. А кто потом захочет посмотреть записи, приходите сюда в комменты и задавайте вопросы!
Post #386 332
23 и 24 сентября в Москве и онлайн будет проходить конференция SmartData. В этом году это не оффтоп для нашего канала, потому что SmartData фактически объединилась с конференцией IML, и там будут прикольные доклады про инференс нейросетей на GPU, например, такие:
* LLM под нагрузкой: как измерять производительность self-hosted моделей;
* LLM Ops: оптимизация инференса и ML-serving в реальном production-кластере.

PS: Как обычно, на конференциях JUG кормят не хуже, чем в all inclusive отелях Турции, что является дополнительным стимулом выпросить у работодателя оффлайн-билет на конфу.

PPS: На правах участника ПК мне, как обычно, выдали промо-код на скидку, но его нельзя публиковать, а в личке его опять никто не попросит, так что всё тлён.

#GPU #симпозиум
  • 🔥 5
Post #384 366
Post #383 416
Теперь это и для меня самое запоминающееся место.

Исходник драйвера

#Linux #offtopic
  • 😁 23
  • ❤ 4
Post #382 568
Поздравляем всех программистов с Днём Программиста! 🎉

А всех непрограммистов с Днём Танкиста 🎉
  • 🎉 21
  • 👏 5
  • 😁 2
  • 🔥 1
Post #381 820
Коллеги из YADRO запускают email-проект о работе с легаси-кодом на C++. Среди авторов — Константин Владимиров, Андрей Карпов, Антон Полухин. Расскажут про классы управления ресурсами, настройку аллокатора общей памяти в PostgreSQL, модернизацию билд-систем и языка в целом.

За верные ответы на задачи от разработчиков дарят подарки: карьерную консультацию, книги от авторов писем с их автографами и мерч. Первое письмо придет 15 сентября, затем — по одному письму в неделю. Всего получите семь материалов. Оставляйте email-адрес на лендинге проекта, чтобы не пропустить начало.

#мненезаплатили
  • 👍 8
  • 🔥 4
  • 👀 2
Post #380 813
Очередной сезон курса по вычислениям на видеокартах от Николая Полярного. Бесплатно, без регистрации и смс (нет, если хотите не в записи, а очно, то с регистрацией).
Для тех, кто в этом году решил научиться эффективно программировать видеокарты, я думаю, это лучшее, что есть.

Занятия будут проходить по вторникам с 18:00 в Мраморном зале, ПОМИ РАН, наб. реки Фонтанки, 27, Санкт-Петербург. Для тех, кто не в Питере, должны быть записи, по идее.
Telegram Опушка единорогов Открыта регистрация на осенний курс по GPGPU (CUDA/OpenCL/Vulkan)! Массовый параллелизм! 🕺🕺🕺🕺 Распараллеливание линейных алгоритмов! 😱 🦾 МОЩЬ СОВРЕМЕННЫХ ЧИСЛОДРОБИЛОК!!! 🖥
  • ❤ 9
  • 🔥 6
  • 👍 1
Post #379 638
Сегодня, в день знаний, по традиции, публикуем обучающие материалы — введение в технологию.

Для изучения основ графики предлагаем серию статей A trip through the Graphics Pipeline 2011
Несмотря на то, что прошло уже много лет, основные фундаментальные принципы почти не изменились: базовая модель конвейера, базовая архитектура работы памяти GPU, базовые принципы работы с текстурами и введение в оптимизацию. Это можно читать смело.

А для изучения современных технологий рекомендуем регулярно обновляемый портал Vulkan Tutorial, Vulkan Guide и How to Vulkan 2026, которые любезно предложили в комментариях.
The ryg blog A trip through the Graphics Pipeline 2011: Index Welcome. This is the index page for a series of blog posts I’m currently writing about the D3D/OpenGL graphics pipelines as actually implemented by GPUs. A lot of this is well known among gra…
  • ❤ 8
Post #378 1.01K
GPGPU Russia Nvidia опубликовала подробную документацию к своему центральному процессору для ИИ-датацентров. 88 ядер (их назвали NVIDIA Custom Olympus) на базе архитектуры ARM v 9.2 Пропускная способность памяти до 1.2 ТБ/с, это больше, чем на любой потребительской видеокарты…
Nvidia выпустила CUDA MCP Server: https://api.copilot.nsight.ngc.nvidia.com/mcp/cuda-docs , по которому агент может получить документацию и примеры кода из первых рук.
NVIDIA Developer NVIDIA Nsight AI An AI-powered accelerated computing assistant providing intelligent code suggestions and assistance for NVIDIA CUDA development.
  • 🔥 9
  • 🤔 2
Post #377 913
Nvidia опубликовала подробную документацию к своему центральному процессору для ИИ-датацентров.
88 ядер (их назвали NVIDIA Custom Olympus) на базе архитектуры ARM v 9.2
Пропускная способность памяти до 1.2 ТБ/с, это больше, чем на любой потребительской видеокарты, кроме 5090.
Потребление до 450 Вт, как на 4090.
Само собой, наличие NVLink, через который идёт связь с GPU.
https://nvdam.widen.net/s/nmw5vblpqd/nvidia_vera_cpu_architecture_whitepaper
  • 🔥 5
Post #375 1.19K
В комментах к этому посту можно задавать вопросы после митапа.
  • 🔥 2
Post #374 1.21K
Меня внезапно зазвали на AI Dev Meetup поговорить про локальных ИИ-агентов и потыкать их на практике. Поговорим, кому и зачем это может быть нужно, посмотрим бесплатные альтернативы и попробуем их на живой задаче из нашего декомпилятора.

Пойду куплю себе микрофон по такому случаю.

PS: Интересно, что телега не хочет показывать preview ссылки с таймпада, а мах показывает.

PPS: Если вы уже опытный, так сказать, вайб-кодер, то вряд ли услышите что-то новое для себя. Встреча ориентирована на новичков.
  • 🔥 7
  • 👏 1
Post #372 1.82K
Пост о том, что такое CUDA Tile, который зарелизили в CUDA 13.3:
https://developer.nvidia.com/blog/develop-high-performance-gpu-kernels-in-cpp-with-nvidia-cuda-tile/

Если кратко, то они ввели новый вид кернелов: __tile_global__, в которых вообще не указываешь работу для отдельных потоков, а пишешь кода для обработки на уровне тайлов, а компилятор уже сам определяет, как там потоки работают между собой.
Для этого есть пространство имён cuda::tiles.
В нём живут:
tensor_span (аналог std::mdspan), его растаскивают на весь буфер при помощи extents{m, n},
и обёртка partition_view, которая нарезает буфер на те самые тайлы при помощи функции load().

Получается, примерно, такой кернел для сложения массивов:
#include "cuda_tile.h"
__tile_global__ void vectorAdd(float* a, float* b, float* out, size_t n) {
 
/* set up the namespace */
  namespace ct = cuda::tiles;
  using namespace ct::literals;
 
/* attach shape to raw pointers */
  auto aSpan = ct::tensor_span{a,   ct::extents{n}};
  auto bSpan = ct::tensor_span{b,   ct::extents{n}};
  auto oSpan = ct::tensor_span{out, ct::extents{n}};
 
/* partition each span into tiles of size 8 */
  auto aView = ct::partition_view{aSpan, ct::shape{8_ic}};
  auto bView = ct::partition_view{bSpan, ct::shape{8_ic}};
  auto oView = ct::partition_view{oSpan, ct::shape{8_ic}};
 
/* load the a and b tiles from global memory */
  int bx = ct::bid().x;
  auto aTile = aView.load(bx);          // load bx-th tile
  auto bTile = bView.load(bx);
 
/* add the two tiles together, elementwise */
  auto oTile = aTile + bTile;
 
/* store the result tile to the output partition. */
  oView.store(oTile, bx);
}


Конкретно для такой задачи он намного сложнее обычного кода, но в нём не надо думать о переполнении памяти, гонках и так далее.

#CUDA #GPU #GPGPU
NVIDIA Technical Blog Develop High-Performance GPU Kernels in C++ with NVIDIA CUDA Tile Developers can now use NVIDIA CUDA Tile programming within large existing C++ GPU codebases to develop highly optimized GPU kernels using tile-based abstractions. NVIDIA CUDA Tile…
  • 👍 8
  • 🔥 2
Post #371 1.44K
В CUDA 13.3 Добавили нативную поддержку питона. Надеюсь, теперь, наконец, не будет отваливаться Nsight как это обычно бывает с pycuda 🎮

CUDA 13.3 получился очень насыщенным:
* Поддержка Python;
* Релиз CUDA Tile C++;
* CompileIQ — фреймворк автотюна кернелов, обещают, что ускорили некоторые аж на 15%;
* Полная поддержка С++ 23.

https://developer.nvidia.com/blog/nvidia-cuda-13-3-enhances-gpu-development-with-tile-programming-in-c-compiler-autotuning-and-python-updates/

#CUDA #GPGPU #Python
NVIDIA Technical Blog NVIDIA CUDA 13.3 Enhances GPU Development with Tile Programming in C++, Compiler Autotuning, and Python Updates NVIDIA CUDA 13.3 brings new capabilities and performance optimizations to developers across the CUDA ecosystem. The launch of NVIDIA CUDA Tile programming in C++, enables high-level…
  • 🔥 12
Post #370 822
Post #369 1.31K
Alibaba выпустила пост про новую модель Qwen 3.7-Max: https://qwen.ai/blog?id=qwen3.7

Интересно посмотреть на раздел "Self-Evolving in the Wild". В нём они хвастаются, что с помощью этой модели ускорили референсную реализацию multi-head attention в SGLang в десять раз. Там же перечислены основные оптимизации, до которых додумалась нейронка.
qwen.ai Qwen Studio Qwen Studio offers comprehensive functionality spanning chatbot, image and video understanding, image generation, document processing, web search integration, tool utilization, and artifacts.
  • 🤯 3
  • 👍 2
Post #368 1.71K
Good news, everyone!

Инженеры компании YADRO сегодня развернули среду для воркшопа про ускорение LLM, и теперь можно на тестовый прогон записаться и без доступа к железу, а подключиться к их серверу.

Так что если кто хотел записаться, но не имел железа, теперь можно. Кроме того, это шанс бесплатно потрогать серверную GPU Nvidia H100.

Кстати, мы завели чаты в телеге:
🥹: тут.
🪵: тут.
Google Docs Запись на тест воркшопа "Ускоряем LLM с помощью своего расширения для PyTorch" Тест будет проходить 12 мая, во вторник, в 19:00 по московскому времени. Записавшихся добавим в группу в Телеграме, и там будет опубликована вся необходимая информация.
  • 👍 4
  • 🔥 4
  • ❤ 1
Post #367 2.8K
Продолжаем готовиться к конференции C++ Russia 2026.

У нас запланированы воркшопы и мастер-классы, и мы сейчас приглашаем желающих на тестовые прогоны двух из них.
Тестовые прогоны пройдут 12 мая в 19:00.

1. Ускоряем LLM с помощью своего расширения для PyTorch.

📃 Форма для записи.

Важно. Prerequisites:
* Во время тестового прогона мы не предоставляем доступ к железу. От участников требуется иметь доступ к машине, у которой есть видеокарта Nvidia, совместимая с CUDA 13 и установлен Docker.
* Требования к участникам: умение писать код на C++, собирать его с CMake и умение понимать Python. Умение программировать видеокарты НЕ требуется.


2. Кросс-разработка в режиме live Linux-драйвера символьного дисплея LCD1602.


📃 Форма для записи.

На этот мастер-класс каких-то особых требований к участникам нет.
  • 👍 4
Older posts →

About this channel

How can I read @gpgpu_ru without a Telegram account?
TGViewer shows the public web preview Telegram publishes for GPGPU Russia: recent posts, photos, videos and the subscriber count, with no app, login or account.
How many subscribers does GPGPU Russia have?
GPGPU Russia (@gpgpu_ru) has 520 subscribers on Telegram, refreshed roughly every 30 minutes.
Does GPGPU Russia know I viewed it here?
No. Public channel previews carry no viewer identity, and TGViewer has no accounts or tracking of what you look up.
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →