Пока все учатся разговаривать с нейросетями, кто-то уже режет их по слоям.
«ИИ Лоботомия» — канал про то, что происходит внутри больших языковых моделей.
Почему модель решает отказаться от ответа? Можно ли найти отвечающее за это направление во внутренних представлениях и вырезать его из весов? На каком слое появляется нужное поведение? Почему вмешательство работает в обычном режиме, но перестаёт работать, когда модель рассуждает? Можно ли заставить архитектуру с экспертами выделять больше вычислений только на сложные задачи?
Здесь разбирают свежие исследования и проверяют идеи на открытых моделях: снимают активации, ковыряют слои, меняют веса, ломают защитные механизмы и смотрят, что остаётся от модели.
Без подборок «10 нейросетей, которые заменят вашу работу».
Больше похоже на реверс-инжиниринг: вместо бинарника — десятки миллиардов параметров.
ИИ Лоботомия — @ai_lobotomy
Post #4547
766

- 🤡 19
- 😁 3
- 💩 3