NVFP4, deepgemm, DSpark, P/D disaggr, CUDA 13.0
Это все для привлечения внимания, потому что:
Снова ищу инженеров в команду AI платформы Битрикс24
В прошлый раз из канала пришло много сильных ребят, так что заходим на второй круг.
Сейчас нанимаем LLM Ops - тех, кто будет отвечать за то, как модели живут внутри платформы.
Что за платформа?
Это основа, на которой строятся все AI фичи компании: от простых сценариев до агентов, управляющих Б24.По факту - мы внутренний провайдер моделей, а наши заказчики - продуктовые и внутренние команды, которые генерируют больше 20 млн запросов в месяц (и это только llm).
Мы отвечаем за модельки под капотом (для этого у нас больше 200 серверов с GPU от t4 до 8хH200 и B200), за их качество, доступность, производительность и эффективное использование. Плюс вот эти ваши лайтллмы, роутеры, кэши, эвалы, guardrails и прочие интересные штуки. Команда кросс-функциональная: разработчики, ML и *Ops инженеры.
Что за LLM Ops?
Всё, что связано с моделями, vLLM и инференсом: поднять, настроить, разогнать, обновить и отвечать за то, что оно держит нагрузку и не сжигает деньги впустую.
Чем предстоит заниматься:
- выжимать максимум из того железа и фреймворка, что уже есть;
- поднимать модели и готовить среду под тесты и прод - llm, stt, эмбеддинги и тд;
- следить за релизами vLLM и обновляться, потому что каждый релиз приносит фичи, которые нам реально нужны (ну или баги, которые чинить тоже иногда приходится нам);
- отвечать за производительность конкретных инстансов: смотреть метрики, ловить узкие места, реагировать;
- считать ёмкость и стоимость: 200 машин сами себя эффективно по моделям не разложат.
Что ждём от кандидата:
- практический опыт именно с vLLM(SGLang тоже котируется);
- продовый опыт эксплуатации LLM-сервисов;
- понимание, как устроены современные LLM: трансформеры, токенизация, контекстное окно, как и что влияет на latency и throughput;
- уметь работать и без кубернетисов;
Сильно в плюс:
- опыт с различными вариантами роутинга кэша (vllm-r, dynamo, LMCache. и тд);
Куда писать и что присылать?
Пишите мне в личку: @Ser_no
В сообщении лучше сразу прислать:
- CV / LinkedIn / GitHub;
- пару слов, в чём вы сильны или крутые кейсы которые решали в последнее время;
- любые артефакты, если есть: код, конфиги, бенчмарки, дашборды, отчёты, посты;
Про платформу рассказываю тут и про команду тут.
Перешлите тому самому, верю в силу телеграма)
Post #1241
1.22K
Forwarded from AI да парень! / Sergei Notevskii
- 🔥 4
- 😁 4
- 👍 2
- ❤ 1