AI Harness в тестировании
В индустрии сейчас все больше набирает популярность новый модный термин - agent harness. Это весь софт вокруг LLM, который превращает “модель, отвечающую на промпт” в агента, который реально делает работу. Инструменты, управление контекстом, цикл “действие → результат → следующий шаг”, память, обработка ошибок, все это является harness.
Почему это важно?
Сегодня в том же SWE-bench одна и та же базовая модель с разной обвязкой (harness) дает solve rate от 5% до 30%+, поэтому получается, что качество ИИ-помощника в тестировании определяет не выбор GPT vs Claude, а то, что вы дали агенту вокруг:
- доступ к нужным инструментам (запустить тест, прочитать код, дёрнуть API, открыть приложение)
- правильный контекст в окне (требования, спека, структура проекта, а не всё подряд)
- цикл обратной связи (прогнал тест → увидел падение → починил → перепрогнал)
- стоп-условия и обработку ошибок, чтобы агент не уходил в бесконечный цикл
предопределенные вокрфлоу (каждая активность заранее частично предопределена)
И сегодня хороший AI-assisted testing - это не нашли модель поумнее. Это инженерия харнеса, когда даешь агенту нужные руки, нужный контекст, правильно и оптимально выстроенные вокрфлоу и нормальную петлю обратной связи, и тогда он начинает реально помогать, а не выдавать правдоподобный мусор, причем даже с не супер мощными моделями.
Полезная информация:
Курс по evaluation AI |
Мой фреймворк для оценки AI |
С чего начать изучение AI | Инструменты для оценки AI |
Инструменты для оценки AI (ч.2)
Post #159
675

- 👍 4
- 🔥 4
- ❤ 1
- 💯 1