⚛️Продолжение про ИИ. Часть 2
И сегодня капнем в сторону токенов GenAI.
Ключевые концепции GenAI:
🔹токенизация - разбиение текста на более мелкие части для эффективной обработки;
🔹контекстные окна - ограничение объёма информации, учитываемой за один раз, чтобы сохранять релевантность;
🔹мультимодальные модели - модели, способные обрабатывать несколько типов данных (текст, изображения, аудио) для более богатого взаимодействия.
Сейчас взаимодействие с LLM, которые используются в GenAI часто происходит с помощью api.
Разные модели меряют использование своих мощностей объемом в 1 M токенов, за который нужно заплатить определенную сумму.
Сколько текста в миллионе токенов?
Тут приведу хорошую аналогию из интернета:
Для русского языка часто используют такое приближение:
1 токен ≈ 1–1,5 слова или 4–6 символов с пробелами. Исходя из этого, миллион токенов — это примерно:
🔹750 000 слов;
🔹4–5 миллиона символов (с пробелами);
🔹Около 1 500 страниц текста формата А4 (при стандартном форматировании);
🔹Примерно три книги «Война и мир» Льва Толстого.
тут - можно посмотреть как разбивается ваш промт на токены. Посмотреть их количество.
#генеративный_ии #ии #саморазвитие
@testorest
Post #848
375
- ❤ 5
- 👍 1