TGViewer
Janitor ai confession Janitor ai confession @janitoraicf · 7.7K subscribers
Post #7010 1.39K
Небольшая подсказка для ботоделов от шкодера:
Как человек, сделавший свой прокси для Janitor, я немного изучил, как работают промпты в данном замечательном месте. И так, начнём погружение!
1) Общее описание персонажа и персоны пользователя.
Все данные для LLM моделей разделяются через теги. Каждый тег отвечает за своё содержание данных. Выделим основные, и пока что единственные:
<Char persona> — Описание персонажа. Всё, что вы пишете в поле Personality, попадает именно в этот раздел.
<Scenario> — описание сценария, если вы его указали. Поле соответствующее.
<User persona> — описание персоны пользователя. Что интересно, имя персоны тут не указывается, если вы его не написали в описании.
<Example_dialogs> — примеры диалогов. Поле соответствующее.

Как это работает: Всё написанное собирается в том порядке, в котором я написал, и отправляется нейросети. Я провёл эксперимент у себя в полигоне, и проверил, в каком виде модель лучше воспринимает информацию, которую ей скармливают для РП. Практика показала, что размеченные тегами данные воспринимаются лучше.

Вывод: Размечайте данные о вашем персонаже.
Пример: Нейросеть поймёт лучше, если вы напишите:
<Persona>Dark King любит на завтрак готовить оладьи по рецепту своей бабушки</Persona><World>Совсем недавно в этом мире проходили выборы нового короля, и все совместно решили разделить ответственность между старостами...</World><Secret>Dark King не любит устриц. У него на них аллергия.</Secret>.
Важно, чтобы теги описывали разные стороны вашего бота. Их имя должно быть говорящим, иначе советую в самом начале добавить тег <Setting>, и в нём объяснить значение каждого тега, который вы используете дальше в описании бота.

2) Токенизатор, контекстное окно, токены.
Хоть уже писали гайд, но позволю и себе немного рассказать о нём.

Что это такое? Грубо говоря: Алфавит для нейросети. Он переводит символы, буквы, а порой и слоги в понятный для нейросети данные. Как правило, в нём содержится информация и о тех самых токенах.
Каждая нейросетевая модель по разному токенизирует текст. Беря русский язык, самые лучшие токенизаторы: Гугл (Gemma, Gemini), OpenAI (GPT-OSS, ChatGPT), и Yandex (YandexGPT). Данные о токенизаторах можно посмотреть на платформе Hugging Face, если модель открытая, или на официальном сайте.
Что касается JLLM: Он понимает русский язык, но 1 символ является 1 токеном, из-за чего контекстное окно быстро засоряется.

Далее поговорим об памяти нейросети, то самое контекстное окно. Оно всегда измеряется в токенах, т. е. всё зависит от токенизатора. Но, тут подмечу важный момент: Заявленные значения токенов, это общая контекстная память. Всё очень зависит от того, как обучалась модель, но в такие дебри я лезть не буду.
Как правило, чем больше заявленное контекстное окно, тем меньше эффективное контекстное окно.
Пример: модель Seed oss 36b. Заявленное окно: 512к. Эффективное может быть как все 512, что редко, так и на 10-20% меньше. У крупных компаний, таких как OpenAI и Google таких погрешностей меньше, и как правило заявленный контекст верен. Но тут нужно смотреть ещё на один момент: Искусственное увеличение за счёт аппаратных средств. Это значит, что, например в официальном приложении контекстное окно больше, чем на API, или в других сервисах.

В общем, это немного больше, чем основные моменты. Если вам понравится такой большой гайд, могу рассказать побольше. Вся информация получена путём экспериментов, и чтения гайдов с последующими тестами.

#Гайд@janitorAiCF  ⋮  @janitorAiCF ෆ
take bot→@SuggestionJAiCfBot
  • ❤ 6
  • ❤‍🔥 5
  • 🔥 2
  • 🕊 1
  • 👻 1
More from @janitoraicf
  1. Sep 22, 2026Post #24892
  2. Sep 22, 2026Список подборок удобная фигня?
  3. Sep 22, 2026Если кого-то надо добавить в список,то можете так же написать в поддержку. Думаю много бот…
  4. Sep 22, 2026Не голосуйте если вас нет в списке. Это очень сильно мешает смотреть статистику
  5. Sep 22, 2026Post #24888
  6. Sep 22, 2026Post #24887
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →