🖥 Научиться разбираться в нейросетях и не сойти с ума. Часть 1
Новые нейросети, особенно LLM, появляются практически каждый день. Даже высокопрофессиональные специалисты не всегда знают все модели, существующие в их сфере деятельности.
Недавно на Reddit в сообществе, посвященном локальным LLM, появился пост о публикации 50 новых LLM за 2 недели. Пользователи в шоке от того, с какой скоростью обновляются рейтинги производительности моделей — лидеры меняются буквально за считанные дни.
Чтобы ориентироваться в этом хаосе, мы составили для вас глоссарий из 20 ключевых терминов, которые используют эксперты для описания характеристик LLM.
📌 Основные характеристики (это база)
1️⃣ Параметры (Parameters) — переменные, которые модель вычисляет в процессе тренировки. Число параметров напрямую влияет на ее способность к обучению и сложность решаемых задач.
2️⃣ Общее число параметров (Total Parameters) — полное количество всех настраиваемых переменных в модели. Это основной индикатор размера и мощности LLM, например, "модель на 70 миллиардов параметров".
3️⃣ Трансформер (Transformer Architecture) — фундаментальная архитектура для обработки последовательностей данных. Ее основа — механизм внимания.
4️⃣ Механизм внимания (Attention Mechanism) — технология, которая позволяет модели фокусироваться на самых важных частях входного текста для генерации ответа. Помогает улавливать контекст в длинных документах.
5️⃣ Контекстное окно (Context Window) — максимальный объем текста (в токенах), который модель может обработать за один раз. Чем окно больше, тем лучше модель помнит длинные диалоги или документы.
Процессы обучения
6️⃣ Предобучение (Pre-training) — начальный этап обучения LLM на гигантских объемах текста, где она изучает общие языковые законы, факты и стили.
7️⃣ Дообучение (Fine-tuning) — дополнительное обучение модели на узком наборе данных для адаптации к конкретной задаче (например, для стиля службы поддержки).
8️⃣ Инструктивное дообучение (Instruction Tuning / Instructed) — вид дообучения, при котором модель учат следовать инструкциям пользователя. Такие модели лучше решают задачи в формате "команда-результат".
9️⃣ RLHF (Обучение с подкреплением на основе обратной связи от человека) — продвинутый метод дообучения, где люди-оценщики ранжируют ответы модели, чтобы научить ее быть более полезной и безопасной.
Оптимизация и архитектура
🔟 Квантизация (Quantization) — процесс снижения точности чисел, которыми представлены параметры модели (например, с 32-бит до 4-бит). Это сильно уменьшает размер модели и ускоряет ее, иногда с небольшим снижением точности.
1️⃣1️⃣ Дистилляция (Distillation) — создание маленькой модели-"студента", которую обучают на ответах большой модели-"учителя". В итоге получается компактная и быстрая версия с похожими возможностями.
1️⃣2️⃣ MoE (Mixture of Experts — Смесь экспертов) — архитектура, где модель состоит из множества "экспертных" подсетей. Для каждого запроса активируется лишь малая их часть.
1️⃣3️⃣ Активные параметры (Active Parameters) — количество параметров, которые используются в MoE-модели для обработки одного запроса. Их намного меньше, чем общее число параметров, что делает модель очень эффективной.
Продолжение во второй части ниже 👇
💬 Тест Тьюринга. События в сфере ИИ. Подписаться
Post #1996
526

- ❤ 2
- 👍 1
- 🔥 1