TGViewer
DL in NLP DL in NLP @dlinnlp · 11.6K subscribers
Post #1193 2.85K
Multitask Prompted Training Enables Zero-Shot Task Generalization
Sanh et al [BigScience]
arxiv.org/abs/2110.08207

Новая итерация на promt engineering и тренировку с промтами. Авторы предлагают взять большую версию Т5 (11B параметров) и зафайнтюнить её на большом числе supervised датасетов с промтами, описывающими задачу.

Например, для задачи QA это может выглядить так: I know that the answer to [вопрос] is in [контекст]. Can you tell me what it is?

Всего использовали 12 различных задач, 62 датасета. На каждый датасет было порядка 8 промтов. Часть задач отложили на валидацию (например NLI задачи и coreference). При файнтюнинге учили модель генерировать ответы авторегрессионно, аналогично тому, как делали в Т5. Таким образом получается что мы всегда используем кросс-энтропию по словарю и нам не нужно несколько голов, как в классическом multitask-сетапе.

Результаты:
1. модель заметно превосходит GPT-3 на 9 из 11 датасетов в zero-shot режиме.
1. использование одного промта очень сильно увеличивает zero-shot качество по сравнению с тренировкой без промтов
1. использование нескольких промтов в среднем работает лучше чем использование одного (чуть-чуть противоречит предыдущим результатам)
1. использование большего числа датасетов для обучения улучшает среднее zero-shot качество, но не уменьшает дисперсию результатов внутри одного датасета

Модель доступна в 🤗 под именем bigscience/T0pp и у неё очень хорошая model card. Посмотреть на датасеты с промтами (~2000 различных промтов) можно тут. Вы также можете помочь проекту законтрибьютив свои промты.
huggingface.co bigscience/T0pp · Hugging Face We’re on a journey to advance and democratize artificial intelligence through open source and open science.
More from @dlinnlp
  1. Feb 21, 2025https://www.youtube.com/watch?v=uVcBa6NXAbk https://www.1x.tech/discover/introducing-neo-g…
  2. Jan 27, 2025В продолжение темы, Jay Alammar, у которого были прекрасные визуальные объяснения про рабо…
  3. Jan 23, 2025Всем приветики. Давно не было постов, тк становится всё сложнее вести канал. Не буду обеща…
  4. Nov 23, 2024Programming Massively Parallel Processors https://a.co/d/6QEiuCq Наткнулся на книгу котора…
  5. Oct 10, 2024Но дадут ли нобелевку по литературе за Deep Learning Book
  6. Oct 8, 2024Почему не стоит верить nvidia-smi “GPU utilization” arthurchiao.github.io/blog/understandi…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →