Насколько хорошо мы понимаем поведение attention в современных LLM?
Несмотря на зрелость архитектуры Transformer, механизм attention по-прежнему имеет системные ограничения. Одно из них — attention sink — склонность модели концентрироваться на первых токенах, что ухудшает стабильность обучения и работу с длинным контекстом.
В лучшей статье NIPS 2025 «Gated Attention for Large Language Models: Non-linearity, Sparsity, and Attention-Sink-Free» команда Qwen рассказала, как нивелировать эту проблему без изменения архитектуры модели с помощью простого gating-механизма.
На предстоящей встрече PT ML Reading Group специалист ML-команды Данил Лялин разберёт эту работу и объяснит, почему небольшое изменение в attention приводит к заметному улучшению качества и устойчивости обучения, а также long-context-способностей LLM.
На встрече обсудим:
🛑что такое attention sink;
🛑как работает gated attention и почему наиболее эффективно его применять после Scaled Dot-Product Attention (SDPA);
🛑какую роль в gated attention играет нелинейность и input-dependent sparsity;
🛑как gated attention влияет на стабильность обучения и длинный контекст.
📅 Ждём всех в Толке в пятницу, 26 декабря, в 15:00 мск.
🔗 Ссылка для подключения: Ктолк
#reading_group #attention #nlp
Post #69
750

- 🔥 8
- 👍 5
- ❤ 1