Пока политики стреляют словами,
а дипломаты роют траншеи
в переговорных окопах
Мы разберём, как алгоритмы превращают эту словесную артиллерию в векторы
🫡Готовьте гранаты токенизации и заряжайте пушки Self-Attention: сегодня мы штурмуем тему трансформеров
Word2Vec:
Семантический снайпер
Алгоритм превращает слова в векторы, где Россия и Беларусь — соседи, а Швейцария — вдали
CBOW предсказывает слово по контексту
Переговоры о [___] и зерновом коридоре → безопасности
Skip-gram ищет окружение для слова, как мины в тексте
Self-Attention:
Генерал трансформеров
Выделяет ключевые связи
прекращение огня → линия соприкосновения
игнорируем шаблоны вроде стороны выражают надежду
Как 🕶разведчики🕶, видящие суть сквозь пропаганду
Fine-Tuning:
Переподготовка спецназа
BERT, обученный на речах политиков, отличает
западных партнёров от пендосов
Зачем учить с нуля, если можно переквалифицировать модель?:)
Токенизация:
Разбор трофеев
Например, можем разделить словосочетание Антониу Гутерриш на части, но термин многополярный_мир, возможно, обратится в бессмыслицу ([много, поляр, ный_мир])
TF-IDF:
Приоритет целей
Определяет ценность слов:
Крым — ударный термин,
взаимопонимание — пустой звук
Рост TF-IDF для Бухарестский меморандум в 2022 году — сигнал к пересмотру границ
LLM:
Ядерный арсенал NLP
GPT-4 генерирует договоры за минуты,
BERT находит двусмысленности в старых текстах
Галлюцинации LLМ: Дружественный огонь
Например, нейронка приписывает Макрону
Украина должна капитулировать
— включайте радиста-фактчекера или понижайте температуру модели
Оптимизация внимания:
Тактика блицкрига
Sparse Attention анализирует 500 страниц за 5 секунд, фокусируясь на санкциях и безопасности подобно танковому прорыву через бюрократию
Словари:
Боевой комплект NLP
Большой словарь — тяжёлый арсенал
SWIFT-отключение.......
маленький — пистолет с тремя патронами
Контекст:
Радиосвязь диалога
Без контекста переговоры —
как рация с помехами
BERT связывает 91 год с Беловежьем,
а все варианты на столе читает как угрозу
Что могут спросить по теме трансформеров на собеседовании:
Основные типы LLM:
авторегрессионные (ex.GPT) генерируют текст последовательно, предсказывая следующее слово
двунаправленные(ex.BERT) анализируют контекст слева и справа от слова
энкодер-декодер(ex.T5, BART) преобразуют входные данные в выходные через промежуточное представление
Обучение
предобучение на большом корпусе текста с задачами вроде предсказания следующего токена или заполнения масок
fine-tuning на специфических датасетах для конкретных задач
Оценка
perplexity:Чем BERT отличается от GPT?
(the lower the better)
фактологичность, связность
ну и разные бенчмарки:
(GLUE, SuperGLUE, SQuAD)
BERT: двунаправленный,
masked LM, для классификации
GPT: авторегрессия, генерация текста
Как бороться с галлюцинациями в LLM?
контроль температуры, top-k/p,
проверка фактов, fine-tuning
Как оптимизируют внимание в трансформерах?
разреженное внимание, кэширование, квантование, пакетная обработка
Какие гиперпараметры генерации ключевые в GPT?
temperature:
(креативность)
top-k/p:
(выбор токенов)
beam search:
(качество)
repetition_penalty
@zadachi_ds
