Для начала вставим, как авторы понимают понятие In-Context Learning'a:
in-context learning (ICL)—the ability to infer a conditional or unconditional distribution over natural language strings simply by performing next-token prediction following a sequence of examples from the distribution of interest.
Вот его авторы и пытаются изучить - какие именно модели (и кто лучше) перформит исл, какие изменения в архитектуре заставят улучшить результаты по исл и почему именно происходит исл
В ходе следственно-розыскного мероприятия аттеншн слоев трансформера (у которого исл получается лучше остальных моделей) было выявлено, что они моделируют то, что называется n-gram heads (они же индуктивные головы более высокого порядка)
Если добавить их в модели типо RetNet или Mamba они почти полностью закрывают разрыв с трансформером по in-context, более того дают большой прирост даже для самого трансформера
👀LINK
#icl #ngrams #transformer #languagemodelling

