R_eff = 0.10. И ни слова почему.
🔸 В обвязке ForgePlan есть оценка R_eff — насколько решению можно верить. Считается она по подтверждениям, которые к решению привязаны (тесты, замеры, чужой разбор). Главная идея: минимум, не среднее. Если три подтверждения по 0.9 и одно по 0.1 — R_eff равен 0.1, не 0.7.
🔸 Звучит сурово. И это осознанно. Доверие к решению не выше, чем самое слабое его подтверждение. Одно слепое пятно — и всё проседает. Среднее бы это спрятало; минимум — нет.
🔸 А теперь история, которую я стеснялся рассказать. Сам R_eff молча врал о своей честности. Если таблица с подтверждением была оформлена не по форме — без явных полей «вердикт», «уровень соответствия», «тип подтверждения» — разбирающая её часть тихо ставила «противоречит» и роняла оценку почти к нулю.
🔸 Агент смотрел на
R_eff = 0.10 и не понимал почему. Просто низкий балл, без объяснения. Кладбище решений внутри инструмента, который должен был кладбища решений предотвращать.«Студенты не могут проверять свои собственные экзамены».
> — walkinglabs, лекция 9
🔸 Anthropic в 2025 опубликовали находку: агент, который сам себя оценивает, систематически завышает оценку. Это особенность того, как обучали модели — «полезный» в их мире равно «да, готово». Решение — отдельный проверяющий с другим контекстом.
🔸 Чинил двумя раундами разбора. В выводе теперь явно: «EVID-091 не содержит структурных полей → штраф». В правилах проекта появилась красная линия про обязательную форму таблицы доказательств. Урок: если механизм самопроверки молчит про свои промахи, он сам становится молчаливым кладбищем.
🔹 https://walkinglabs.github.io/learn-harness-engineering/ru/
#harness #ai
