TGViewer
CONTENTRUN КОНТЕНТРАН CONTENTRUN КОНТЕНТРАН @contentrunai · 71 subscribers
Post #177 26
Тестировать модели наугад — это не стратегия, это трата денег.

Smevals — фреймворк с открытым кодом для структурированной оценки LLM. Вы пишете набор тестов (YAML-файлы), запускаете их на нужных конфигурациях моделей, а затем оцениваете результаты отдельной командой. Прогоны и оценки разделены — можно переоценивать старые запуски с новыми проверками без повторного вызова API.

Главная идея: один eval = один вопрос о модели. Например, «умеет ли GPT-4o генерировать валидный SVG?». Под него пишутся задачи, конфигурации моделей и чекеры — от простой проверки строки до вызова другой модели в качестве судьи.

Визуализация — локальный веб-сервер или статический HTML-отчёт с таблицей лидеров по моделям. Третья итерация идеи от автора — и, судя по архитектуре, наконец правильная. ⚙️

Разбираем ИИ-инструменты для бизнеса →
ИИ Инструменты | Контент-завод | База знаний
More from @contentrunai
  1. Aug 24, 2026Post #185
  2. Aug 10, 2026Открытая модель не отклонила ни одного запроса на хакерские операции. Ни одного. GLM-5.2 о…
  3. Aug 9, 2026Эксперты получают от ChatGPT больше — не потому что умеют «лучше промптить». Математик Тер…
  4. Aug 8, 2026✨ — это больше не «красиво». Это теперь официальный символ ИИ. Каждая эпоха оставляет след…
  5. Aug 8, 2026ChatGPT Work на мобиле и десктопе — это два разных инструмента. Мало кто это знает. Когда…
  6. Aug 7, 2026Claude взломал три реальные компании. Случайно. Аnthropicпровела тест наступательных кибер…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →