TGViewer
DEKSDEN notes DEKSDEN notes @deksden_notes · 3.07K subscribers
Post #1241 1.22K

Forwarded from AI да парень! / Sergei Notevskii

NVFP4, deepgemm, DSpark, P/D disaggr, CUDA 13.0
Это все для привлечения внимания, потому что:

Снова ищу инженеров в команду AI платформы Битрикс24

В прошлый раз из канала пришло много сильных ребят, так что заходим на второй круг.
Сейчас нанимаем LLM Ops - тех, кто будет отвечать за то, как модели живут внутри платформы.

Что за платформа?
Это основа, на которой строятся все AI фичи компании: от простых сценариев до агентов, управляющих Б24.По факту - мы внутренний провайдер моделей, а наши заказчики - продуктовые и внутренние команды, которые генерируют больше 20 млн запросов в месяц (и это только llm).

Мы отвечаем за модельки под капотом (для этого у нас больше 200 серверов с GPU от t4 до 8хH200 и B200), за их качество, доступность, производительность и эффективное использование. Плюс вот эти ваши лайтллмы, роутеры, кэши, эвалы, guardrails и прочие интересные штуки. Команда кросс-функциональная: разработчики, ML и *Ops инженеры.

Что за LLM Ops?
Всё, что связано с моделями, vLLM и инференсом: поднять, настроить, разогнать, обновить и отвечать за то, что оно держит нагрузку и не сжигает деньги впустую.

Чем предстоит заниматься:
- выжимать максимум из того железа и фреймворка, что уже есть;
- поднимать модели и готовить среду под тесты и прод - llm, stt, эмбеддинги и тд;
- следить за релизами vLLM и обновляться, потому что каждый релиз приносит фичи, которые нам реально нужны (ну или баги, которые чинить тоже иногда приходится нам);
- отвечать за производительность конкретных инстансов: смотреть метрики, ловить узкие места, реагировать;
- считать ёмкость и стоимость: 200 машин сами себя эффективно по моделям не разложат.

Что ждём от кандидата:
- практический опыт именно с vLLM(SGLang тоже котируется);
- продовый опыт эксплуатации LLM-сервисов;
- понимание, как устроены современные LLM: трансформеры, токенизация, контекстное окно, как и что влияет на latency и throughput;
- уметь работать и без кубернетисов;

Сильно в плюс:
- опыт с различными вариантами роутинга кэша (vllm-r, dynamo, LMCache. и тд);

Куда писать и что присылать?
Пишите мне в личку: @Ser_no

В сообщении лучше сразу прислать:
- CV / LinkedIn / GitHub;
- пару слов, в чём вы сильны или крутые кейсы которые решали в последнее время;
- любые артефакты, если есть: код, конфиги, бенчмарки, дашборды, отчёты, посты;

Про платформу рассказываю тут и про команду тут.

Перешлите тому самому, верю в силу телеграма)
  • 🔥 4
  • 😁 4
  • 👍 2
  • ❤ 1
More from @deksden_notes
  1. Sep 22, 2026⚪️ ZCode UI mode Добавлен переключатель - видно в Settings - Onboarding, второй экран ▶️ Н…
  2. Sep 22, 2026⚪️ Qwen 4 Так как начало недели выдалось бедненьким на анонсы моделей, и в последние полча…
  3. Sep 22, 2026⚪️ Анонс Gpt-6 Sol + Luna состоялся Ну - наконец то анонс с блогом. Почитаем! Начнём с цен…
  4. Sep 22, 2026⚪️ Gpt-6 Sol + Luna Чтобы помочь антропикам отпраздновать выход Опуса 5.5, их друзья - кло…
  5. Sep 22, 2026⚪️ Claude Opus 5.5 Ну что ж! Пока мы заняты важным ожиданием ресета на кодексе, скрасим вр…
  6. Sep 22, 2026⚪️ Z.ai акция - Часы бесплатного флеша продляются Вот эта акция: https://t.me/deksden_note…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →