TGViewer
Knowledge Accumulator Knowledge Accumulator @knowledge_accumulator · 5.69K subscribers
Post #55 1.89K
Symbolic Knowledge Distillation: from General Language Models to Commonsense Models [2021]

Это работа, на мой взгляд, более удачно пытается извлекать знания о мире из языковой модели.

В работе используется база знаний ATOMIC, состоящая из триплетов: <событие, отношение, вывод>, где событие и вывод - это какие-то 2 текстовых утверждения, а отношение - это один из нескольких видов причинно-следственной связи между ними. Например, отношение xNeed - это когда вывод является условием для события.

Авторы используют GPT-3, чтобы расширить эту базу знаний:
1) Сначала генерируются события, подавая в качестве промпта отобранный сет из хороших существующих событий из ATOMIC.
2) Для каждого отношения подбираются примеры пар <событие, вывод> из ATOMIC, и составляется промпт следующего вида:
— Вопрос. Например, для xNeed: "что должно произойти, чтобы произошло событие?"
— Примеры пар из базы atomic
— Сгенерированные события из пункта 1
Таким образом генерируются соответствующие выводы для событий.
3) Обучают дополнительную RoBERTa, которая отличает ложные триплеты от истинных, и фильтруют сгенерированные триплеты по ней
4) Дистиллируют маленькую языковую модель (GPT-2 😁) на этих триплетах

Качество триплетов оценивается людьми - просят поставить Accept/Reject/NA. Исходный ATOMIC это полмиллиона триплетов с рейтингом 87%, дополнительно генерируется 6 миллионов триплетов с рейтингом 78%, но после отсечения RoBERTa остаётся 2.5 миллиона с рейтингом 96%. Авторы исследуют датасет и делают вывод, что с качеством данных и их разнообразием всё в порядке. А дистиллированная GPT-2 показывает лучший результат на commonsense-вопросах, чем исходная модель - вероятно, засчёт увеличения качества датасета.

Мне эта история нравится, я думаю, что это шаг в правильную сторону. Кроме того, сама идея триплетов с причинно-следственными отношениями это, на мой взгляд, круто, я думаю, что поверх подобных данных можно учить нейросетевую картину мира, и в комбинации с логическим выводом мы получим протооракула.

@knowledge_accumulator
  • 👍 12
  • 👏 1
More from @knowledge_accumulator
  1. Sep 20, 2026Почувствуйте AGI Все эти годы я писал о том, что не верю в потенциал LLM превратиться в су…
  2. Sep 5, 2026Предсказать среднее могут не только лишь все Классическая задача машинного обучения - трен…
  3. Aug 17, 2026Долина vs Нью-Йорк Если что-то находится далеко от нас, нам свойственно излишне обобщать с…
  4. Jul 30, 2026Кто виноват в сливе рекламного бюджета? При создании рекламного line item рекламодатель ус…
  5. Jul 13, 2026Покатался на яхте в Американской глубинке После переезда в Калифорнию произошло неожиданно…
  6. Jun 30, 2026Да кто такие эти ваши producer-side A/B-тесты? В своей яндексовской эре работы над рекомен…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →