Свершилось: свой претрейн
Я уже ранее писал, почему в России всё ещё нет своей конкурентоспособной LLM со своим pretrain. В посте, как тексте на массовую аудиторию, я осторожничал и говорил, что на горизонте нескольких лет ситуация может измениться. На живых выступлениях был чуть более категоричен: рано или поздно появится, уж как минимум когда наваливание вычислительных мощностей перестанет быть геймчейнджером.
Но вот с моего поста прошли никакие не несколько лет, а всего два месяца, а Яндекс уже выпустил AliceAI-Foundation-80B-A3B-Base (которую я уже вскользь упоминал пару дней назад). Это обученная с нуля модель с открытыми весами на 80 млрд параметров всего и 3 млрд активных на токен. В общем, теперь у нас есть результат своего претрейна. Причем у всех компаний разом (я про веса, конечно, а не процесс), потому что компания заопенсорсила модель. Так что давайте разбираться.
Во-первых, модель БЕЗ пост-трейна, и в этом в том числе её ценность. Её еще не испортили файнтюном под конкретные тексты и аллайнментом на какой-то определенный подход к выдаче реворда, поэтому все те, кто баловались дообучением, могут продолжить уже с Alice-AI-Foundation.
Во-вторых, уже видел первые отклики на модель: Turing Post включил модель в подборку моделей недели, а Аман Чадха из Google DeepMind отметил релиз в контексте перехода от размера моделей к эффективности. А японский разработчик уже портировал модель на MLX и подготовил экспериментальную GGUF-версию с патчем для llama.cpp.
В-третьих, любителей вопросов "у вас ML или AI", "а сколько у вас работает AI-агентов" и "а что это у нас 80 млрд параметров, если у всего мира уже триллионники пошли" тоже можно успокоить: задач, в которых реально для автоматизации или оптимизации бизнес-процесса нужен триллионник не то чтобы много, ведь экономика внедрения, как мы уже обсуждали с вами в недавнем посте, зависит еще и от затрат.
Post #843
2.21K
- 👍 23
- ❤ 7
- 🔥 5
- 🤔 3
- 😁 2