Для всех, кто использует ИИ, но всегда задавался вопросом, а как же собственно LLM работают, я хочу поделиться подборкой видео от 3blue1brown.
3Blue1Brown объясняют сложные концепции через визуализации, которые делают абстрактные идеи понятными. В нескольких видео они разбирают принципы и архитектуру работы LLM, показывая, как LLM работает под капотом.
Что вы узнаете из видео:
Tokenization - как текст превращается в числа, которые может обрабатывать модель.
Attention mechanism - сердце современных LLM. Визуально показано, как модель "обращает внимание" на разные части контекста при предсказании следующего слова.
Embeddings в действии, а именно как слова превращаются в векторы и почему похожие слова оказываются рядом в многомерном пространстве.
Training process - как модель учится предсказывать следующий токен и почему это приводит к "пониманию" языка.
После просмотра вы лучше поймете, почему LLM иногда "галлюцинируют", как влияет размер контекста на качество ответов, и почему промпт-инжиниринг вообще работает.
Есть русский перевод
Ссылки на видео:
Large Language Models explained briefly
Transformers, the tech behind LLMs
Attention in transformers, step-by-step
How might LLMs store facts
Полезная информация:
Курс по evaluation AI |
Мой фреймворк для оценки AI |
С чего начать изучение AI | Инструменты для оценки AI |
Инструменты для оценки AI (ч.2)
Post #161
591

- ❤ 4
- 🔥 2
- 👍 1