⚡️ В этой работе показано, что трансформеры могут обучаться без normalization-слоёв и даже показывать лучшие результаты - благодаря простому слою Derf.
Derf заменяет Layer Normalization на лёгкое point-wise преобразование, которое:
- проще и дешевле в вычислении
- не требует статистик по батчу или токенам
- снижает обращения к памяти и затраты на синхронизацию
В итоге обучение и инференс становятся быстрее и проще.
При этом качество не падает, а иногда растёт.
Пример: ImageNet-1K
Vision Transformer
- 82.8% с Derf
- 82.3% с LayerNorm
Трансформеры лежат в основе большинства языковых и визуальных моделей.
Обычно normalization стабилизирует числа, вычисляя среднее и дисперсию, а затем перескалируя активации.
Но эти операции добавляют оверхед по памяти и координации, что снижает эффективность.
Derf устраняет эту проблему, применяя S-образную функцию к каждому элементу отдельно — без глобальных измерений.
Авторы выделяют 4 ключевых свойства такой функции:
- значения центрированы около 0
- выход ограничен, чтобы избежать взрывов
- высокая чувствительность вблизи 0
- монотонность — порядок значений сохраняется
Derf содержит всего два обучаемых параметра:
- масштаб входа
- сдвиг функции
Эксперименты на задачах зрения, диффузионной генерации, речи, ДНК и GPT-2 показывают, что Derf стабильно не хуже или лучше LayerNorm и Dynamic Tanh, а также лучше обобщается.
Вывод: меньше оверхеда, проще архитектура и потенциально более сильные трансформеры.
📄 Статья: arxiv.org/abs/2512.10938
Post #3145
3.53K

- 🔥 10
- ❤ 2
- 👍 1