TGViewer
Аналитическая мастерская Аналитическая мастерская @analystcraft · 19 subscribers
Post #32 15
Как мы проверяем, годится ли модель для работы аналитика.

Обычный способ — спросить у модели, хорош ли её ответ, или прогнать через бенчмарк общего качества. Оба варианта отвечают не на тот вопрос.

Нам нужно знать другое: справится ли она с конкретной работой. Для этого модель обязана выдать четыре артефакта: Source map, System Context Pack, Review Findings, Task Pack. Дальше их проверяет детерминированный код по сценарию.

Что именно смотрит проверка:

Источники разложены по карте корректно. Каждое требование подкреплено цитатой. Противоречия отделены от пробелов. Неизвестное осталось открытым вопросом, а не превратилось в выдуманный факт. Задачи ведут обратно к источникам.

Принцип простой: модель не оценивает саму себя. Оценивает внешний код, который не знает, кто сгенерировал артефакт.

Сейчас в матрице десять сценариев, включая утечку конфиденциального и prompt injection. Первый осмысленный локальный результат — 59.7% на самом простом из них. До приёмки далеко, но теперь провал измеряется, а не ощущается.

Метод, вокруг которого построены артефакты: https://analystcraft.ru/blog/source-map-dlya-analitika
AnalystCraft Source map для системного аналитика — метод, шаблон, пример | Аналитическая мастерская System Context Pack за час: карта источников с датой и статусом, структурированные утверждения с цитатами, Review Findings, Task Pack. Разбор на кейсе миграции API с v1 на v2.1.
More from @analystcraft
  1. Oct 7, 2026В этом фрагменте — авторская метафора: LLM похожа на хорошо подготовленного джуна. Она быс…
  2. Oct 7, 2026Мы приняли один измеримый тест нового формата внутри существующего урока. Это не запуск но…
  3. Oct 6, 2026Код обновился. А документация? Документация должна меняться вместе с кодом: реальные сцена…
  4. Oct 5, 2026Kafka: единый канал данных, но не для больших файлов Чем меньше отдельных каналов приёма д…
  5. Oct 5, 2026Мы подготовили учебный комплект о ситуации, в которой код и тест согласованы, а пользовате…
  6. Oct 3, 2026API вернул 500. Что будет с вашими данными? Фрагмент закрытой платной лекции с обсуждением…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →