Но тут вышла статья IdeaAMBIG: Benchmarking Implementation-Critical Gaps in Research-Idea Specifications, где исследователи проверили способность моделей устранять критичные неоднозначности.
TL;DR для тех, кто не пойдет читать статью: пока что LLM с этим справляются так себе.
Агент может бесконечно задавать вопросы (иногда очень хорошие), но плохо понимает, какие из них действительно важны. Тогда как устранение неопределенностей принципиально влияет на результат — доля готовых к реализации спецификаций растет с 14% до 98% (в статье есть еще несколько подтверждающих тезис метрик).
Поэтому там, где важно получить полную спеку, есть смысл вместо «если постановка неоднозначна — сначала задай уточняющий вопрос» использовать что-то в духе:
Перечисли методологические решения, которые придётся принять при реализации. Для каждого укажи, следует ли решение однозначно из доступных требований. Если нет — укажи, какой информации не хватает и каким вопросом или поиском её можно получить. Не приступай к реализации, пока все пробелы не устранены.
И, возможно, стоит выделять на эту проверку отдельную роль рисерчера, чтобы избежать байаса у агента-исполнителя.
@devspotting
