TGViewer
FSCP FSCP @f_s_c_p · 13.4K subscribers
Post #123662 894
Как то незаметно произошел прорыв в локальном LLM строении. Вышла модель Ternary-Bonsai-2-27B. Три миллиона загрузок модели, не считая форков, говорят сами за себя.

Тернарное сжатие полностью отказывается от дробных чисел «каждый вес в нейросети может принимать только три состояния: -1, 0 или +1». С точки зрения «железа» операцию умножения матриц можно полностью заменить на обычное сложение и вычитание. Лучше всего такое сжатие показывает себя в задачах со строгой логикой. Как показывают тесты, в написании кода и решении уравнений тернарные веса работают на 100%(это не опечатка) от FP16 оригинала.

В основе концепта Ternary Bonsai лежит текущий лидер для локального инференса Qwen3.8-27b, результаты измерений показывают что модель PQ2_0 показывает результаты лучше чем классическое квантование в Q4_0 и при размере в 2.2 раза меньше

Но у методологии есть и проблемы, почему нет 70B-80b моделей сжатых в тернарные веса. На уровне 70B+ параметров разработчики упираются в три фундаментальных барьера:

— Проблема сверхпереобучения и падения отдачи
Исследователи отмечают важную закономерность: чем сильнее предобучена модель на огромных массивах данных, тем хуже она переносит тернарное квантование.
В гигантских моделях (70B+) информация упакована с предельной плотностью. Векторы активаций становятся очень чувствительными к малейшим изменениям. Даже с преобразованием Адамара, сжатие до трех состояний срезает ассоциативные связи накопленные моделью. Для 70B+ моделей потеря «интеллекта» при таком сжатии в отличие от классического становится более заметной. [1]

— Железо не готово к революции
Главный плюс тернарных весов — «сложение вместо умножения» — раскрывается на полную силу только на специализированных ИИ-чипах (ASIC), которых на коммерческом рынке сейчас практически нет.
Современные суперкомпьютеры на базе Nvidia H100/B200 аппаратно заточены под форматы FP8 и INT4. Если запустить на них тернарную модель 80B, видеокартам все равно придется выполнять распаковку этих весов в стандартные типы данных прямо во время вычислений. В итоге на серверном уровне гигантская тернарная модель не дает никакого выигрыша в скорости по сравнению с классическим 4-битным квантованием. [1]

— Астрономическая стоимость обучения с нуля
Чтобы модель 80B работала идеально, её нельзя просто сжать после обучения в тернарные веса — её нужно обучать в тернарном режиме с самого начала.
Обучение модели класса 70B–80B требует миллионов долларов и месяцев работы тысяч ускорителей. Вливать колоссальные бюджеты в отладку обучения на экспериментальной архитектуре — это огромный финансовый риск для ИИ-лабораторий. Гораздо проще и безопаснее обучить классическую FP16-модель, а затем выпустить для нее стабильный 4-битный вариант (Q4_K_M), который гарантированно будет работать на всех существующих серверах. [1]

Вангование вместо итога:

Общий тренд индустрии уже год как сменился с самых умных моделей на самую лучшую их обвязку. Все передовые модели уже достаточно умные, всё на чем можно обучить использовано, теперь главный вопрос как этому уму выдать все необходимые инструменты и инструкции чтобы он причинял как можно больше пользы.

Зарождается отдельный тренд на локальный инференс для обработки чувствительных данных персональными агентами, небольшие модели уже доросли до самостоятельного уровня, что год назад можно было получить исключительно по подписке. Производители железа не отстают Nvidia Spark, MacStudio, AMD догоняют с Ryzen AI Max+ PRO. Спрос есть.

Агентная система сейчас представляет из себя внутри множество сабагентов и ролей. Каждая такая сущность внутри агента обслуживается большой моделью которой задали специальный промт для этой роли, при этом большая часть знаний большой модели не используется при отыгрывании конкретной роли.

Логичным следующим шагом эволюции будет создание небольших узкоспециализированных моделей под конкретные роли сабагентов. Это будет дешевле для инференса, как в облаке так и локально. И вот тут тернарное сжатие может очень пригодится.
@F_S_C_P

-------
Поддержи канал подпиской
-------
huggingface.co prism-ml/Ternary-Bonsai-2-27B-gguf · Hugging Face We’re on a journey to advance and democratize artificial intelligence through open source and open science.
  • ❤ 3
  • 👍 2
  • 🔥 1
More from @f_s_c_p
  1. Oct 5, 2026Анатомия эпичного факапа или как на самом деле вынесли Додо Пиццу. Дисклеймер: Материал но…
  2. Oct 5, 2026Капитализм победил смерть И как же смерть оказалась ему к лицу Актриса Грета Гарбо закончи…
  3. Oct 5, 2026Хотите знать, почему ваши дети адово устают в школе, при этом оставаясь с пустыми головами…
  4. Oct 5, 2026Мистический опыт, знакомый по рассказам о психоделиках, у части людей может вызвать и VR-ш…
  5. Oct 5, 2026В России наладили производство заградительных аэростатов для защиты НПЗ и других объектов…
  6. Oct 5, 2026Нейросеть научилась видеть то, что видите вы, по снимку мозга Исследователи из израильског…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →