📖 В этой статье представлена новая архитектура модели под названием Inner Thinking Transformer (ITT), направленная на улучшение способности языковых моделей к адаптивному внутреннему мышлению без увеличения количества параметров!
💡 Авторы выявили, что сложные токены вызывают резкие всплески градиентов в стандартных трансформерах, что указывает на архитектурные ограничения при обработке таких токенов. В ответ на это ITT динамически распределяет вычислительные ресурсы через адаптивную маршрутизацию токенов, итеративно улучшает представления с помощью остаточных связей мышления и различает этапы рассуждений посредством кодирования шагов мышления. Это позволяет более глубоко обрабатывать критические токены без увеличения параметров модели.
🌟 Экспериментальные результаты показывают, что ITT достигает 96,5% производительности модели с 466 миллионами параметров, используя всего 162 миллиона параметров, сокращает объем необходимых обучающих данных на 43,2% и превосходит варианты Transformer/Loop в 11 различных тестах. Таким образом, ITT эффективно балансирует между производительностью и эффективностью, оптимизируя внутренние процессы мышления модели.
🔗 Ссылка: *клик*
@machinelearning_ru
Post #2528
1.95K

- ❤ 2
- 🔥 2