Есть нейросеть с всего 1 миллиардом параметров (это очень мало по сегодняшним меркам), которая решает сложные задачи почти так же хорошо, как большие модели в 3–7 раз больше неё
Называется HRM-Text-1B. И она не просто "ещё одна модель". У неё совсем другая технология
⌨️ Как она работает
Обычные нейросети (типа ChatGPT или Llama) читают текст по одному разу и пытаются "думать" словами в ответе.
А эта модель:
🔵 Сначала молча думает внутри себя несколько раз (в скрытом режиме).
🔵 У неё два «мозга»: один думает медленно и о главном (высокий уровень), второй - быстро и в деталях.
🔵 Они работают вместе, как в настоящем человеческом мозге (у всех же есть раздвоение личности да?)
Из-за этого она глубоко думает, хотя сама маленькая.
🔵 Обучена всего на 40 миллиардах токенов (это в сотни раз меньше, чем у больших моделей).
🔵 Полное обучение стоит около 1000–1500 долларов и занимает 1–2 дня на мощных видеокартах.
Результаты:
🔵 Математика (MATH): 56.5%
🔵 Логика и чтение (DROP): 82.3%
🔵 Общие знания (MMLU): 60.7%
🔵 Наука и рассуждения (ARC): 81.9%
Для такой крошечной модели - это ПИЗДЕЦ АХУЕТЬ! Она обгоняет некоторые модели в 3–7 раз больше.
Плюсы
🔵 Дешёвая и доступная - любой исследователь или маленькая компания может обучить свою версию.
🔵 Экономит электричество и деньги - не нужно миллиарды долларов и тысячи видеокарт.
🔵 Хорошо думает - особенно математика, логика, задачи с шагами.
🔵 Маленькая - после сжатия весит меньше 1 ГБ, можно запустить даже на слабом компьютере или телефоне.
Вы прикиньте
Только недавно обсуждали в чате, о нейронках в телефоне и что это в далёком будущем, но по факту телефоны уже имеют 12+ RAM памяти, и можно спокойно её туда засунуть, вы даже не поймёте что там нейронка сидит)
🔵 Полностью открытая (Apache 2.0) - бери и делай что хочешь
🤡 Минусы
🔵 Пока не очень хорошо болтает как чат-бот. Это «сырая» модель, её нужно ещё доучить для нормального общения.
🔵 Лучше всего работает на английском. Русский - хуже.
🔵 Сложный код и творческие тексты - пока слабовато.
🔵 Чтобы сделать из неё удобного помощника, нужно дополнительно обучать.
Что может быть дальше? Будущее нейросетей
Это важный сигнал: «больше параметров» - не единственный путь. (Вспомним Glm 5.1 у которой 700B параметров и вес 1.5 терабайта без квантизации, что бы у себя локально её запустить вам нужно 8 видюх H200 минимум... А это около 200к баксов)
💰 В будущем мы, скорее всего, увидим:
🔵 Ещё более умные маленькие модели, которые работают на телефоне без интернета
🔵 Нейросети, которые думают глубоко внутри, а не тратят кучу токенов
🔵 Дешёвый ИИ для блогеров\криптанов\скамеров - каждый сможет сделать свою специализированную модель
🔵 Гибрид: маленькая быстрая модель + большая для сложных задач
🔵 Новая архитектура
Это как переход от огромных грузовиков к умным маленьким электрокарам. Меньше, умнее, доступнее.
Ссылки, чтобы попробовать самому:
- GitHub: https://github.com/sapientinc/HRM-Text
- HuggingFace: https://huggingface.co/sapientinc/HRM-Text-1B