⚡️ Яндекс обучил собственную LLM с нуля и открыл её веса
19 сентября был на Practical ML Conf, где представили AliceAI-Foundation-80B-A3B-Base.
Яндекс самостоятельно провёл предобучение модели с нуля. То есть команда обучила собственные веса, а не взяла готовые веса другой LLM и дообучила их под свои задачи.
В карточке модели указаны:
▪️ 80 млрд параметров.
▪️ 3 млрд активных параметров на каждый токен.
▪️ Контекст до 262 144 токенов.
▪️ Открытые веса для самостоятельного запуска и исследований.
Обучение с нуля даёт команде возможность самой принимать решения об архитектуре, подготовке данных и процессе обучения. За таким релизом стоит большая инженерная работа.
Для меня как AI Security исследователя особенно интересно, что модель можно исследовать самому: проводить эксперименты, дообучать и сравнивать её поведение до и после изменений.
При этом Base означает базовую модель. Чтобы получить помощника или агента для рабочих задач, её ещё нужно адаптировать и связать с инструментами.
Интересно посмотреть, как системы на её основе будут справляться с prompt injection, соблюдать границы доступа к данным и контролировать вызовы инструментов.
Хороший повод покопаться в модели самому 🔐
Post #54
157

- 👍 9
- ❤ 6
- 🔥 4