Вместе с релизом GigaChat 3.1 Ultra и Lightning мы добавили поддержку tool calling в основные опенсорсные инференс-движки:
— vLLM (>=0.18.2rc0)
— SGLang (>=0.5.9)
— llama.cpp (>=b8457)
Для vLLM и SGLang достаточно поднять сервер с
--tool-call-parser gigachat3 — после этого работает стандартный /v1/chat/completions с описанием tools. В llama.cpp tool calling поддерживается нативно, без дополнительных аргументов.vLLM
vllm serve ai-sage/GigaChat3.1-10B-A1.8B \
--port 8000 --dtype auto \
--enable-auto-tool-choice \
--tool-call-parser gigachat3
SGLang
python -m sglang.launch_server \
--model-path ai-sage/GigaChat3.1-10B-A1.8B \
--host 0.0.0.0 --port 8000 --dtype auto \
--tool-call-parser gigachat3
llama.cpp
Поднимаете сервер с моделью — и всё работает. Пример сборки и запуска — в карточке модели на HuggingFace.
После запуска сценарий одинаковый для всех движков: передаёте
tools в стандартный /v1/chat/completions.💡 LM Studio — нативный tool calling не поддерживается. LM Studio ожидает два отдельных спецтокена — начала и конца вызова функции. У GigaChat 3.1 архитектура чат-шаблона устроена иначе: для разметки tool call используется один и тот же токен, поэтому нативно его подключить в LM Studio нельзя. Вместо этого используется вариант использования через system prompt, что влияет на качество.
➡️ Модель: HuggingFace | GGUF
