Недавно я тестировал Marco o1 — опенсорсную LLM с продвинутыми алгоритмами рассуждений: Chain-of-Thoughts и поиском по дереву Монте-Карло (MCTS). Это позволяет модели решать задачи по логике, математике и программированию эффективнее.
Что интересного:
• Вес модели — всего 7B параметров, можно запустить даже на RTX 4060.
• Поддержка квантизации (bitsandbytes) ускоряет инференс на локальном PC.
• Готовые решения для LLM-сервера на TGI и ollama.
🚀 Запуск в Docker с Text Generation Inference
docker run --gpus all --shm-size 1g -p 8080:80 -v $path_to_volume:/data \
ghcr.io/huggingface/text-generation-inference:2.4.1 --model-id AIDC-AI/Marco-o1 --quantize bitsandbytes-nf4
🔥 Если нужен сервер попроще — попробуйте ollama
ollama pull marco-o1
ollama serve
⚡️ Почему immers.cloud?
Если вашей машине не хватает мощности, запускайте Marco o1 в облаке immers.cloud на GPU-серверах. Это удобно и быстро!
