🖥 Научиться разбираться в нейросетях и не сойти с ума. Часть 2
Качество и способности
1️⃣4️⃣ Reasoning (Логическое мышление) — способность модели строить логические цепочки и решать многошаговые задачи, а не просто повторять заученную информацию.
1️⃣5️⃣ Галлюцинации (Hallucinations) — генерация моделью информации, которая выглядит правдоподобно, но на самом деле является выдумкой. Это ключевая проблема современных LLM.
1️⃣6️⃣ Бенчмарки (Benchmarks) — стандартизированные тесты (MMLU, HumanEval) для объективной оценки и сравнения производительности моделей в логике, математике, знаниях и т.д.
Другие важные термины
1️⃣7️⃣ Температура (Temperature) — параметр контроля "креативности" ответа. Низкая температура — точные и предсказуемые ответы, высокая — более творческие, но с риском бессмыслицы.
1️⃣8️⃣ Top-p (или Nucleus Sampling) — альтернатива температуре для генерации разнообразных, но связных ответов.
1️⃣9️⃣ Токенизация (Tokenization) — процесс разбиения текста на минимальные единицы — токены (слова, части слов), с которыми и работает модель.
2️⃣0⃣ Эмбеддинги (Embeddings) — числовые (векторные) представления токенов, которые позволяют модели понимать семантическую близость слов и улавливать контекст.
Поздравляем, теперь вы стали лучше ориентироваться в нейросетях и не впадете в панику при виде названий ниже:
➡️ NousResearch/Nous-Hermes-2-Mixtral-8x7B-DPO: Mixtral — это архитектура MoE (Смесь Экспертов), а 8x7B означает, что в ней 8 "экспертов" по 7 млрд параметров каждый.
🔜 Qwen/Qwen1.5-72B-Chat-GPTQ-Int4: 72B — это общее число параметров (72 млрд), Chat — модель прошла дообучение для диалогов, а GPTQ-Int4 — это метод квантизации до 4-битных чисел, то есть модель оптимизирована по размеру и скорости.
🔜 google/gemma-1.1-7b-it: 7b — модель на 7 млрд параметров, а it — это сокращение от Instruction Tuned, то есть она прошла инструктивное дообучение.
📌Сохраняйте обе части, чтобы не потерять.
💬 Тест Тьюринга. События в сфере ИИ. Подписаться
Post #1997
567

- 👍 6
- 🔥 2
- 👏 2
- ❤ 1