Какие модели использовать в OpenClawГлавная моя ошибка, что я подходил к выбру модели для OpenClaw, как к программированию - чем дороже, тем лучше. Такой поход оказался не эффективным, т.к. агент жрал слишком много токекенов. Но, я показал на скриншоте, что в режиме idle токенов на работу OpenClaw почти не уходит.
Три ключевых качества модели, которые важнее всегоАгентная архитектура OpenClaw предъявляет специфические требования к LLM, который его питает, и не все модели справляются одинаково хорошо:
Точность вызова инструментов (tool-calling) — это главное. OpenClaw использует 50+ интеграций через вызовы функций. Сломанные вызовы — сломанные автоматизации. Модели Claude стабильно лидируют: Opus 4.6 набирает 91,9% на tau2-bench Retail.
Работа с длинным контекстом важна, потому что сессии регулярно превышают 200K токенов — с каждым запросом отправляется вся история разговора. Модели Anthropic поддерживают до 1M токенов в нативном режиме.
Устойчивость к prompt injection критична, так как OpenClaw читает почту, посещает непроверенные сайты и обрабатывает произвольный контент из мессенджеров.
Эти требования объясняют, почему сообщество массово тяготеет к семейству
Claude от Anthropic, хотя жизнеспособные альтернативы существуют на любом ценовом уровне.
Какие модели использовать и когдаИспользуйте разные модели для задач разной сложности — что позволяет сократить расходы на 50–80% без существенной потери качества.
Для сложных рассуждений (многошаговые исследования, архитектурные решения, критически важные автоматизации): Claude Opus 4.6 — золотой стандарт. Он показывает наивысшие результаты по бенчмаркам — 65,4% на Terminal-Bench 2.0, 80,8% на SWE-bench Verified и 84,0% на BrowseComp — но стоит $5/$25 за миллион токенов (вход/выход). GPT-5.2 за $1,75/$14 — сильная альтернатива, особенно когда Anthropic ограничивает частоту запросов.
Для повседневных задач (управление почтой, планирование в календаре, веб-сёрфинг, генерация кода): Claude Sonnet 4.5 справляется с 80–90% ежедневной работы OpenClaw за $3/$15 за миллион токенов. Это рекомендованный дефолтный выбор для большинства пользователей и модель, которую сам Штайнбергер использовал при разработке.
Для экономных: лидерборд сообщества на
pricepertoken.com ставит
Kimi K2.5 ($0,45/$2,20) на первое место по соотношению цена/качество с наибольшим количеством голосов, далее GLM 4.7 ($0,30/$1,40) и Gemini 3 Flash Preview ($0,50/$3,00). DeepSeek V3 ($0,32/$0,89) — самый дешёвый облачный вариант, хотя его Reasoner-версия
генерирует некорректные вызовы инструментов и не подходит для агентной работы. MiniMax M2.1 ($0,27/$0,95) лично рекомендовал Штайнбергер в подкасте как свой бюджетный выбор.
Важный нюанс: при использовании моделей Anthropic всегда настраивайте нативный режим API anthropic-messages, а не режим совместимости с OpenAI. Это включает кэширование промптов и обеспечивает надёжную точность вызовов инструментов.
Запуск локальных моделей для полной приватностиДля разработчиков, которым нужны нулевые расходы на API и полный суверенитет данных, OpenClaw поддерживает локальные модели через Ollama, LM Studio или vLLM. Ограничения серьёзные: OpenClaw требует минимум 64K токенов контекста, что ограничивает выбор моделями с 32B+ параметров на 24GB+ VRAM.
Топ сообщества среди локальных моделей — Qwen3-Coder:32B (~20ГБ при квантизации Q4), которая обеспечивает наиболее стабильные вызовы инструментов, и Devstral-Small-2-24B (~14ГБ при Q4), которую один участник сообщества запускал две недели в продакшене на
Mac Studio M1 Max с нулём сбоев при скорости 13,2 токена/секунду. GLM-4.7 Flash рекомендуется как лучшая локальная резервная модель для ротации в паре. Для лёгких экспериментов Qwen3 8B работает на 16ГБ RAM, но ненадёжна для сложных агентных задач.
Критическое предупреждение для пользователей Ollama: баг стриминга вызывает «тихие» сбои вызовов инструментов при stream: true. Решение — установить stream: false в конфигурации, использовать нативный эндпоинт Ollama /api/chat или перейти на LM Studio.
Окончание