TGViewer
Machinelearning Machinelearning @ai_machinelearning_big_data · 278K subscribers
Post #9783 24.3K
📌Нейроанатомия LLM: улучшаем модель без дообучения.

Дэвид Ноэль, независимый исследователь из Мюнхена, в середине 2024 года занял 1 место на HuggingFace Open LLM Leaderboard методом, который не требует ни новых данных, ни файнтюна.

Он взял 80-слойную Qwen2-72B, продублировал блок из 7 средних слоёв (45–51) и получил модель RYS-XLarge, где каждый добавленный параметр - копия уже существующего. На 5 из 6 бенчмарков лидерборда результаты выросли: MuSR прибавил 17,7%, MATH - 8,2%.

Позже ByteDance предложила Looped Language Models (ноябрь 2025), но Дэвид пришёл к своим выводам независимо на основе 2 наблюдений:

LLM способны вести связный диалог в Base64 - модель декодирует вход, рассуждает и перекодирует ответ обратно. Если это работает, то получается, что ранние слои транслируют входные данные в абстрактное внутреннее представление, поздние переводят его обратно в текст, а средние занимаются рассуждением в формате, не привязанном к конкретному языку.

Модель Goliath-120B, где слои двух разных 70B-моделей были перемешаны так, что выход поздних слоёв подавался на вход ранних. По всем канонам обучения это не должно было работать, но работало.


Внутренние представления трансформеров оказались куда однороднее, чем предполагалось.

Для поиска оптимальной конфигурации Дэвид построил «сканер мозга» трансформера: берется блок слоёв (с 20-го по 35-й), затем он вставляется повторно и на инференсе замеряется, стала модель лучше или хуже.

Так перебираются все возможные начала и концы блока (3241 конфигурация). Каждую конфигурацию Дэвид прогонял через 2 быстрых теста: арифметику без CoT и EQ-Bench.

Тепловые карты сканера показали, что средние слои можно дублировать с пользой, а вот крайние - нельзя. При этом повтор только одного слоя почти всегда ухудшает результат. Cредние слои работают как цельные функциональные контуры, и вырванный из цепочки шаг бесполезен.

Буквально на днях Дэвид опубликовал продолжение, но уже с Qwen3.5-27B.

Эксперимент с косинусным сходством скрытых состояний для текстовых запросов на 8 языках впервые показал трёхфазную архитектуру напрямую: к 10 слою фразы с одинаковым смыслом на разных языках оказывались ближе друг к другу, чем на одном языке с разным смыслом.


Модель думает не на каком-то из человеческих языков, а в собственном внутреннем представлении.

В Qwen3.5-27B архитектура модели иная. После 2 млн. конфигураций через суррогатную модель оптимальным решением на Pareto-фронте стало простейшее - продублировать один слой из середины стека. 1,5% дополнительных вычислений и... модель становится заметно сильнее.

Метод ортогонален файнтюнингу и квантованию: модель получает дополнительное время на размышление, используя контуры, которые у нее уже есть.


🟡Статья ч.1 ч.2
🟡Набор RYS-моделей
🖥Github


@ai_machinelearning_big_data

#AI #ML #LLM #RYS
  • ❤ 70
  • 🤔 43
  • 🔥 37
  • 👍 15
  • 👨‍💻 10
  • 👏 9
  • 👌 6
  • ☃ 2
  • ❤‍🔥 2
  • 🥱 1
  • 🎅 1
More from @ai_machinelearning_big_data
  1. Oct 10, 2026✔️ Главы ИИ-компаний готовятся к жёсткой реакции властей на крупный инцидент Руководители…
  2. Oct 10, 2026✔️ Anthropic апрувнул все заявки на Claude Code Projects Все, кто подавался с тарифов Pro…
  3. Oct 10, 2026📌 Humanity's Sixth Sense: мультимодальные модели все еще отстают в когнитивном восприятии…
  4. Oct 9, 2026🔍 Microsoft выпустила модель, которая только принимает решения. В 35 раз быстрее GPT-6 So…
  5. Oct 9, 2026✔️ Odyssey выпустила модель мира Odyssey-3 Новая модель стартапа Odyssey, основанного выхо…
  6. Oct 9, 2026✔️ OpenAI начала развёртывание GPT-6 с динамическим интерфейсом Главное новшество – систем…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →