Как мы проверяем, годится ли модель для работы аналитика.
Обычный способ — спросить у модели, хорош ли её ответ, или прогнать через бенчмарк общего качества. Оба варианта отвечают не на тот вопрос.
Нам нужно знать другое: справится ли она с конкретной работой. Для этого модель обязана выдать четыре артефакта: Source map, System Context Pack, Review Findings, Task Pack. Дальше их проверяет детерминированный код по сценарию.
Что именно смотрит проверка:
Источники разложены по карте корректно. Каждое требование подкреплено цитатой. Противоречия отделены от пробелов. Неизвестное осталось открытым вопросом, а не превратилось в выдуманный факт. Задачи ведут обратно к источникам.
Принцип простой: модель не оценивает саму себя. Оценивает внешний код, который не знает, кто сгенерировал артефакт.
Сейчас в матрице десять сценариев, включая утечку конфиденциального и prompt injection. Первый осмысленный локальный результат — 59.7% на самом простом из них. До приёмки далеко, но теперь провал измеряется, а не ощущается.
Метод, вокруг которого построены артефакты: https://analystcraft.ru/blog/source-map-dlya-analitika
Post #32
15