TGViewer
Гречневые мысли Гречневые мысли @buckwheat_thoughts · 1.77K subscribers
Post #129 798
BERTs are Generative In-Context Learners

На ютубе есть один чувак, зовут его Tom7. Он занимается тем, что выкладывает гомерически смешные видео, где он забивает гвозди микроскопами — чем дальше в видео, тем более абсурдными у него становятся и гвозди, и микроскопы. К каждому видео он прикладывает техрепорт в виде статьи и хостит у себя на сайте псевдоконференцию SIGBOVIK — The Association for Computational Heresy.

Чтобы оценить масштабы безумия, вот неполный список его достижений:

- Обучал модели с линейными функциями активаций (нелинейность достигалась засчёт floating point error)
- Написал свой вариант латеха, где текст в доке алайнится по ширине с помощью подбора нужных слов через Llama-3-70B
- Запустил на NES Super Mario World (если что, это игра для SNES) с помощью припаянной к картриджу Raspberry Pi 3

В общем, очень, очень его советую посмотреть.

Сегодняшняя статья по уровню абсурда вплотную приближается к видео Tom7. Авторы задаются вопросом: а что будет, если мы будем использовать берты с MLM головой для авторегрессионной генерации без какого-либо дообучения и как такие модели будут сравниваться с сопоставимыми по возрасту декодерами?

В качестве энкодера они взяли microsoft/deberta-xxl, в качестве декодера они взяли метрики от gpt-3-1.3B. Обе модели одинаковы по размеру, но деберта, очевидно, энкодер, а GPT — декодер. Причём GPT училась почти на 700 гб текстов, тогда как деберта — всего на 76 гигах. С другой стороны, деберту учили на большем числе токенов, чем GPT-3 (1T против 300B), так что по факту флопсов на обучение деберты ушло больше.

Чтобы сделать энкодер каузальным, авторы применили, как они сами это назвали, embarrassingly simple inference technique: а давайте просто к промпту аппендить два [MASK] и один [SEP] токен. Так модель не будет затачиваться на локальные зависимости и будет больше думать о глобальных зависимостях между токенами.

В итоге, в таком сетапе из коробки работает few shot, модели могут авторегрессионно замеряться на бенчах и работают лучше, чем гпт на NLU (BoolQ, SuperGLUE) и Text Completion (Winogrande, HellaSwag), но хуже, чем гпт на переводе и closed book QA. Авторы предположили, что перевод работал хуже, потому что датасет у деберты был моноязычным и маленьким (так что XLMR наверное справилась бы лучше). Про CBQA сказали, что это из-за training objective, мол, зачем запоминать в параметрах инфу, если можно просто сразу подсмотреть ответы.

Код для инференса встроен в трансформеры (с trust_remote_code, но всё же), поболтать с ними можно. Предположу, что такие модели будут офигенно работать в RAG, но это не точно. Ну и скорость генерации там будет низкой — потому что ни kv-кешей, ни оптимизаций для энкодеров не придумали. Тем не менее, статья восхитительно абсурдная и даёт крутые инсайты — именно из-за подобного я и люблю свою работу.

Статья: https://arxiv.org/abs/2406.04823
Модель: https://huggingface.co/ltg/deberta-xxlarge-fixed
Почитать код: https://huggingface.co/ltg/deberta-xxlarge-fixed/blob/c79c60a00c74c6c3cb41e14a236c1f90391bf5aa/modeling_deberta.py#L1211
  • 👍 7
  • 😁 3
  • 🤣 2
  • ❤ 1
  • 🔥 1
More from @buckwheat_thoughts
  1. Sep 17, 2026Сигнал получен, цель видна, отправляюсь за тортиком
  2. Sep 10, 2026Ураураураура! Вы спрашивали, вы ругались, вы просили, вы недоумевали — а мы делали гигачат…
  3. Aug 28, 2026Вот пришло и мое время рассказывать истории про умные хитрые модели: замеряли Qwen-3.8-27b…
  4. Aug 15, 2026Выводы: - Эксперимент очень интересный, в первую очередь тем, что гипотеза провалилась, но…
  5. Aug 15, 2026Пример простой неудачной генерации: # Prompt def subtract(a, b): """Return a minus b.""" #…
  6. Aug 15, 2026Вот табличка с результатами. Я дополнительно попробовал сделать модели чуть большего разме…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →