Средний срок нахождения той или иной модели в топе небольшой — от нескольких недель до нескольких месяцев. Важно не просто подобрать свой идеал по цене/стилю/качеству/доступности, но знать куда смотреть если вдруг вы решите уйти из рп и вернуться через какое-то время — список «лидеров» уже двести раз поменяется.
🥰 Статистика в категории Roleplay на Openrouter — не про качество, но про выбор большеенсва. Массы уже перепробовали все доступные варианты и продолжают выпускать гайды/промты/пресеты на то, что подобрали под себя. Выбирая хайп вы выбираете легкий доступ, много дополнительных материалов и поддержку комьюнити по вопросам подключения и решению проблем. Так же можно заглядывать в топы конкретного ресурса, например SillyTavern или JanitorAI
😤 EQ-Bench 3
Рейтинг моделей по параметру Emotional Quotient (эмоциональный интеллект)
Моделям дают сложные ролевые сценарии, а судья в лице Claude Sonnet 3.7 оценивает их ответы. Здесь проверяется эмпатия, социальные навыки и многое другое, но держите в голове, что нейронка оценивающая другие нейронки никогда не даст точный результат
✨ UGI Leaderboard
Uncensored General Intelligence оценивает, насколько модель владеет знаниями на чувствительные темы и как она ведёт себя при запросах, связанных с неоднозначными или деликатными ситуациями. Проще говоря — насколько модель зацензурена
Что ещё тут интересно посмотреть:
Hazardous — знание тем, по которым ИИ обычно не должен давать инструкции (опасные вещества, вредные действия и т.д.)
Entertainment — знание взрослого, спорного или провокационного контента в сфере развлечений.
W/10-Direct — наличие или отсутствие прямого отказа отвечать.
W/10-Adherence — отклонение от инструкции (например, попытка изменить тему или смягчить ответ)
NSFW/Dark Lean — частота ухода текста в более откровённую (NSFW) или более нейтральную (SFW) сторону; в более мрачную или трагичную (Dark) или лёгкую (Light) сторону.
Lexical Stuckness — склонность «застревать» на одном словаре.
Semantic Redundancy — насколько часто повторяется одна и та же мысль разными словами.
🙂 Всегда держите в голове погрешность распределения в рейтинге относительно языка на котором вы играете. Большой % датасетов на которых обучают ии состоят английского текста, а в случае с Kimi/Qwen/Deepseek ещё и из китайского. Большие языковые модели великолепно понимают русский на вводе, но на выводе могут путать гендеры, писать слишком много прилагательных и тд. Самые достоверные выводы можно сделать только на личных пробах и ошибках
#Гайд@janitorAiCF ⋮ @janitorAiCF ෆ
take bot→@SuggestionJAiCfBot
