TGViewer
LLM под капотом LLM под капотом @llm_under_hood · 29.5K subscribers
Post #613 13.3K
Качество - это траектория

Недавно мы подкручивали промпт в нашем проекте. После изменений система стала работать лучше, но пользователи начали жаловаться. Поправили там, но сломалось где-то ещё.


Сталкивались с таким, когда допиливали своего агента, копилота или продукт с LLM под капотом?

Как я уже рассказывал, на этой неделе я был на саммите AI For Good ООН в Женеве. Через многие доклады и мастер классы красной линией проходила такая мысль:

Невозможность контролировать качество продукта - это одна из самых частых причин, по которой эти самые AI продукты проваливаются.

Эту статистику подтверждает и Asmaa EL Andaloussi
(Lead Enterprise Strategist & Architect из Леново) и Julien Weissenberg (AI Advisor в World Economic Forum).

Качество - это траектория. Инвесторов и пользователей волнует не столько точность ответов сегодня, сколько гарантии улучшения системы в следующие месяцы.

Я постоянно повторяю командам - прежде чем браться за разработку системы с LLM под капотом - придумайте, как вы будете оценивать качество и точность этой системы. Соберите первый тестовый датасет - качество прототипа на нем станет вашей базовой линией. Сделайте такую архитектуру, где можно будет измерять точность разных блоков, системно собирать отзывы пользователей и интегрировать их в датасет для улучшения качества всей системы.

Когда Asmaa рассказывала про внутреннюю кухню Perplexity (вы все знаете этот мультиагентный поисковик) она подчеркивала, что они сделали не просто работающую систему, а систему, которая может становиться лучше от релиза к релизу.

В общем, продуктов с LLM под капотом есть тьма. Любой студент может навайбкодить что-то правдоподобное на LangChain, векторной БД или паре промптов. Иногда оно даже будет работать.

Что отличает реально работающие продукты от поделок - возможность оценивать качество и планомерно его улучшать. Ведь quality is a trajectory.

Ваш, @llm_under_hood 🤗
  • ❤ 88
  • 👍 49
  • 🔥 14
  • 🤝 2
  • 🤯 1
More from @llm_under_hood
  1. Oct 1, 2026Как вы думаете, справится Codex c такой задачей? Вот я сейчас запустил задачу, где прошу н…
  2. Oct 1, 2026Обязательно смотрим OpenAI DevDays сами! Те выжимки, которые есть в куче каналов - фокусир…
  3. Sep 30, 2026Что нового в разработке продуктов с LLM под капотом? Раньше я много писал про кейсы продук…
  4. Sep 29, 2026Бенчмарк GPT-6.1 Sol - аналогичное качество за меньшие деньги А еще Sonnet 5.5 и Opus 5.5…
  5. Sep 28, 2026Концепция Katas или зачем изобретать велосипеды никакая автоматизация не дает повод изобре…
  6. Sep 25, 2026Семь месяцев работы с Codex-ом в одном графике Это иллюстрация из моего поста про последни…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →