Теория слепых пятен в обучении моделей.
Если кратко - обучение каким-то образов формирует в модели путь в область "вычислителей", где оно не завершено (назовем это теорией слепых пятен :) ) и, найдя эту область путем выключения их, метод фокусирует дообучение именно в этой области и как-бы выправляет сломанные "вычислители".
Обычно, если модель систематически тупит на каком-то типе задач, рецепт простой: собрать правильные ответы и дообучить. Это лечение ковровой бомбардировкой: меняем миллионы параметров ради одного дефекта и надеемся, что рядом ничего полезного не отвалится.
В свежей работе авторы зашли прямо в нашу операционную: нашли внутри модели маленькую цепь, связанную с конкретной ошибкой, и чинили только её.
Как это работает. Берём задачи, которые модель решает неправильно, и веса пока не трогаем. На строки матриц в полносвязных блоках каждого слоя вешаются выключатели, и алгоритм ищет, что выключить, чтобы неправильное рассуждение стало правильным, а нормальные ответы остались нормальными.
Это уже не корреляции в скрытых состояниях: компонент реально выключают и смотрят на поведение.
Поворот: если искать только по заранее написанному правильному ответу, найдёшь не то. При живой генерации модель сворачивает не туда уже на первых токенах. Поэтому RESCUE гоняет модель с маской и по реальным ответам уточняет, что выключать. RL тренирует не модель, а карту хирургического вмешательства.
Цифры. На Qwen3-8B один тип математической ошибки: модель решала 2% примеров, отключили 0,32% строк — стало 93%. Другой: 1% → 91% при 0,31%. Ещё один: 4% → 94% при 0,26%. И это до всякого дообучения, просто выключением цепи. У Llama-3.1-8B цепи занимали 0,60–0,74% строк, точность поднималась до 92–95%.
Контроль: случайные участки того же размера дают в среднем 0–13,5%. То есть дело не в том, что вырубили кусок мозга и пациенту полегчало. Важно, куда попал скальпель.
Потом цепь возвращают на место и дообучают только её строки, остальное заморожено. GSM8K у Qwen: 80% → 91% (LoRA — 88%). У Llama: 73% → 77%, а LoRA уронила до 50%. По восьми посторонним тестам модель сохраняет 99,4% исходного качества.
И это не заучивание формулировок: на перефразированных задачах те же цепи без повторного поиска всё ещё дают +8–23 п.п. у Qwen и +18–66 у Llama. А пять ошибок можно лечить по очереди: средняя точность выросла с 1,8% до 90,8% у Qwen и с 19,6% до 92,6% у Llama, старые исправления в основном держатся.
Вырисовывается схема обслуживания моделей: нашли устойчивую патологию → локализовали цепь → подправили → записали патч в историю болезни.
Но не надо делать вывод, что «ошибки LLM живут в 0,3% нейронов».
Пока это конкретные повторяющиеся классы ошибок, две 8B-модели, математика и MedMCQA. И расположение цепей зависит от архитектуры: у Qwen они размазаны по глубине, у Llama тяготеют к средним и поздним слоям.
📄 https://arxiv.org/abs/2609.36813
Post #93
91