TGViewer
Вайб-кодинг Вайб-кодинг @vibecoding_tg · 63.8K subscribers
Post #3140 20.5K
> Пока ты работаешь с языковыми моделями:
> обучаешь или дообучаешь свои модели,
> выбираешь модель под задачу,
> или пытаешься понять текущее состояние области,

почти неизбежно возникает вопрос:
как понять, что модель хорошая?

> Ответ — оценка качества. Она везде:
> лидерборды с рейтингами моделей,
> бенчмарки, которые якобы меряют рассуждения,
> знания, кодинг или математику,
> статьи с заявленными новыми лучшими результатами.

Но что такое оценка на самом деле?
И что она реально показывает?

Этот гайд от Hugging Face помогает во всём разобраться. 🌟
huggingface.co Evaluation Guidebook - a Hugging Face Space by OpenEvals View an interactive chart that follows the top scores of major LLM benchmarks across Hugging Face leaderboards over the years. The page needs no input—just open it to see record‑setting lines, aver...
More from @vibecoding_tg
  1. Oct 5, 2026Это сгенерировал американский ИИ:
  2. Oct 5, 2026Вот и первый день обещанных релизов от OpenAI: В ChatGPT и Codex начинают внедрять водяные…
  3. Oct 5, 2026Каково это — просить китайские ИИ-модели помочь с тем, на что Claude не соглашается.
  4. Oct 5, 2026Ещё один полезный инструмент для ИИ-агентов, который позволяет реверсить приложения и игры…
  5. Oct 5, 2026Команда OpenAI встала на путь искупления. Теперь каждый день — либо действительно полезная…
  6. Oct 5, 2026Если хочешь разобраться, как с помощью ИИ делать моды или смешивать разные игры, посмотри…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →