TGViewer
ИИ лоботомия ИИ лоботомия @ai_lobotomy · 187 subscribers
Post #93 91
Теория слепых пятен в обучении моделей.

Если кратко - обучение каким-то образов формирует в модели путь в область "вычислителей", где оно не завершено (назовем это теорией слепых пятен :) ) и, найдя эту область путем выключения их, метод фокусирует дообучение именно в этой области и как-бы выправляет сломанные "вычислители".

Обычно, если модель систематически тупит на каком-то типе задач, рецепт простой: собрать правильные ответы и дообучить. Это лечение ковровой бомбардировкой: меняем миллионы параметров ради одного дефекта и надеемся, что рядом ничего полезного не отвалится.

В свежей работе авторы зашли прямо в нашу операционную: нашли внутри модели маленькую цепь, связанную с конкретной ошибкой, и чинили только её.

Как это работает. Берём задачи, которые модель решает неправильно, и веса пока не трогаем. На строки матриц в полносвязных блоках каждого слоя вешаются выключатели, и алгоритм ищет, что выключить, чтобы неправильное рассуждение стало правильным, а нормальные ответы остались нормальными.

Это уже не корреляции в скрытых состояниях: компонент реально выключают и смотрят на поведение.

Поворот: если искать только по заранее написанному правильному ответу, найдёшь не то. При живой генерации модель сворачивает не туда уже на первых токенах. Поэтому RESCUE гоняет модель с маской и по реальным ответам уточняет, что выключать. RL тренирует не модель, а карту хирургического вмешательства.

Цифры. На Qwen3-8B один тип математической ошибки: модель решала 2% примеров, отключили 0,32% строк — стало 93%. Другой: 1% → 91% при 0,31%. Ещё один: 4% → 94% при 0,26%. И это до всякого дообучения, просто выключением цепи. У Llama-3.1-8B цепи занимали 0,60–0,74% строк, точность поднималась до 92–95%.

Контроль: случайные участки того же размера дают в среднем 0–13,5%. То есть дело не в том, что вырубили кусок мозга и пациенту полегчало. Важно, куда попал скальпель.

Потом цепь возвращают на место и дообучают только её строки, остальное заморожено. GSM8K у Qwen: 80% → 91% (LoRA — 88%). У Llama: 73% → 77%, а LoRA уронила до 50%. По восьми посторонним тестам модель сохраняет 99,4% исходного качества.

И это не заучивание формулировок: на перефразированных задачах те же цепи без повторного поиска всё ещё дают +8–23 п.п. у Qwen и +18–66 у Llama. А пять ошибок можно лечить по очереди: средняя точность выросла с 1,8% до 90,8% у Qwen и с 19,6% до 92,6% у Llama, старые исправления в основном держатся.

Вырисовывается схема обслуживания моделей: нашли устойчивую патологию → локализовали цепь → подправили → записали патч в историю болезни.
Но не надо делать вывод, что «ошибки LLM живут в 0,3% нейронов».

Пока это конкретные повторяющиеся классы ошибок, две 8B-модели, математика и MedMCQA. И расположение цепей зависит от архитектуры: у Qwen они размазаны по глубине, у Llama тяготеют к средним и поздним слоям.

📄 https://arxiv.org/abs/2609.36813
arXiv.org RESCUE: Repairing Language Model Errors to Sparse Circuits via... Large language models (LLMs) exhibit strong general capabilities that mechanistic interpretability has attributed to sparse computational circuits. However, existing circuit studies emphasize...
  • ❤ 1
  • 👍 1
More from @ai_lobotomy
  1. Oct 7, 2026Как ловить инъекции Представим агента, который открыл письмо, PDF или страницу с внедрённо…
  2. Oct 4, 2026Петля обратной связи для трансформера. Обычный трансформер движется строго снизу вверх по…
  3. Oct 3, 2026Градиентный спуск против эволюционного поиска (мутации, отбор и выживание решений с наимен…
  4. Oct 2, 2026Post #91
  5. Oct 2, 2026Post #90
  6. Oct 2, 2026Очень интересная беседа с создателем JEV (бывший OpenAI). Что понравилось так это отношени…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →