Как выбрать LLM под конкретную бизнес-задачу?
Отвечают инженеры YADRO, которые протестировали на своих GPU-серверах пять популярных моделей: от огромной DeepSeek-R1-0528 с 685B параметров до небольшой DeepSeek-R1-Distill-14B. Тесты проводили на трех платформах с 4090 и H100 в условиях, максимально приближенных к реальным бизнес-кейсам.
Из статьи вы также узнаете, зачем уменьшать контекстное окно, запускать инстансы одной и той же LLM на нескольких GPU, а в случае с DeepSeek R1 — использовать gpu_memory_utilization=0.95 в vLLM.
Изучить →
erid: 2W5zFHn3M1J
Post #4833
3.1K

- 🤮 6
- ⚡ 2
- 👍 2
- ❤ 1