🧠 От ELIZA к Transformer: как чаты учились диалогу
В 1966 году ELIZA имитировала психотерапевта, переставляя слова собеседника по шаблонам: «Я боюсь собак» → «Почему вы боитесь собак?». Никакого понимания — только сценарий DOCTOR с ключевыми словами, приоритетами и правилами подстановки. Механику хорошо видно на ограничении: фразы «я боюсь» и «я опасаюсь» обрабатывались по-разному, потому что для второй правила не существовало. Расширять возможности можно было лишь переписыванием сценария, а не обучением на разговорах.
Следующие десятилетия инженеры делили диалог на модули: NLU выделял намерение и параметры, Dialogue Manager управлял состояниями, NLG собирал ответ из шаблонов. Это давало предсказуемость, но каждый тип запроса приходилось описывать вручную. Перелом наступил с Word2Vec в 2013 году: слова получили числовые векторы, обученные на контекстах — «машина» и «автомобиль» оказывались ближе, чем к «апельсину». Однако значение слова оставалось фиксированным, а порядок слов не учитывался.
Seq2Seq в 2014–2015 годах впервые позволил генерировать реплику целиком, а не выбирать из готовых веток, — модель обучалась предсказывать следующее сообщение по предыдущим. Механизм внимания затем снял ограничение единого сжатого вектора контекста, а Transformer в 2017-м распараллелил обработку позиций текста, сделав обучение на больших корпусах технически возможным. Вся эта цепочка описана в обзоре Habr.
Главный сдвиг в истории чатов — не конкретная архитектура, а отказ от ручного проектирования диалога. Мы перестали писать ветки разговора и начали обучать модель на примерах. Это дало масштабируемость, но взамен создало проблему неконтролируемости: современные LLM всё ещё корректируют с помощью RLHF и системных подсказок, потому что внутри — не правила, а статистические связи, которые мы не можем напрямую отредактировать.
#ELIZA #Transformer #Word2Vec #Seq2Seq #историяAI
Post #283
6