Китайский AI-разработчик Deepseek разрабатывает открытую модель, способную строить пошаговые логические рассуждения - как OpenAI o1. Сейчас доступна ранняя версия этой модели DeepSeek-R1-Lite-Preview.
У этой модели интересные результаты по математическим бенчмаркам и задачам на логику - некоторые из них превосходят o1. Ещё одним безусловным преимуществом R1 является открытая цепочка мыслей, наконец-то можно наблюдать весь ход рассуждений модели в "сыром" виде. Как мы помним, OpenAI скрывают цепочку мыслей o1, показывают только саммари и результат.
DeepSeek-R1-Lite-Preview пока доступен через чат на сайте разработчика, скоро обещают доступ по API и, самое главное, открытый доступ к весам. Разработчики гадают, каков размер R1 Lite. Пока лишь известно, что модель "относительно небольшая", а значит, ее можно эффективно использовать на одной или нескольких видеокартах.
В связи с этим рекомендуем ознакомиться гайдом нашего амбассадора Ruslan Dev по облачным GPU immers.cloud и обучению LLM. Процесс инференса и файнтюнинга модели с логическими цепочками мыслей должен отличаться от рассмотренных мной моделей Llama, но это невероятно интересная и перспективная область.
@ruslandevlive — мысли о современных AI/ML технологиях
