Всем привет!
Сегодня снова про LLM 🌿
Для тех, кто ещё не посмотрел лекцию Андрея Карпаты Deep Dive into LLMs like ChatGPT, держите небольшой обзор 💜
В 3.5-часовом видео он подробно объясняет, из чего состоят большие языковые модели и как их обучают, рассказывает про их частые проблемы и, конечно, про DeepSeek😊
Ещё из интересного...
📋 Глупые ошибки, которые, на самом деле, закономерны:
🔵 LLM не могут правильно посчитать количество букв в слове из-за особенностей токенизации;
🔵у LLM бывают беды с определением следования дат из-за религиозных текстов, в которых их порядок тоже перепутан.
📋 Откуда берутся галлюцинации и как с ними бороться:
🔵раньше модели не обучались говорить «я не знаю», теперь же с этим борются через специальный этап дообучения с учителем (SFT);
🔵ещё вариант — интегрировать их с поиском, чтобы LLM могла гуглить перед ответом.
📋 Чем интересен DeepSeek R1 и какие источники Карпаты использует, чтобы следить за LLM-прогрессом (lmarena, AINews, Twitter).
➡️Ссылка на оригинал лекции: тык
PS: Андрей Карпаты - ex-директор по ИИ в Tesla и сооснователь OpenAI.
С праздником, любимые подписчики! 💜
#nlp@data_easy
Post #200
1.15K