Собрал материалы сольного выпуска Research Insights Made Simple от 5 октября 2026 года — «SWE-agent: интерфейс меняет результат». Разобрал, как одна и та же языковая модель решает задачи по-разному, когда меняются её инструменты и ответы среды.
Инженеру помогают редактор, поиск и номера строк. У агента тоже есть рабочее место, только оно складывается из команд и текстовых ответов. Если после правки непонятно, что изменилось, следующий ход уходит на выяснение состояния файла. В [статье SWE-agent](https://arxiv.org/abs/2405.15793) с NeurIPS 2024 авторы исследуют, как такие детали влияют на способность довести исправление до работающего патча.
В выпуске разобрал:
🔸 Как агент ориентируется в чужом проекте
Поиск файла, поиск совпадений и просмотр кода с номерами строк — и почему удобный человеку перебор результатов может загнать модель в бесполезный обход.
🔸 Что возвращать после правки
Команда
edit сразу показывает обновлённый фрагмент. Если проверка отклоняет изменение, агент получает ошибку и оба варианта кода. Но у ограничения есть цена: оно может мешать нужному промежуточному состоянию.🔸 Что оставлять в контексте
Размер окна просмотра и старые ответы инструментов: после нескольких правок история уже хранит версии файла, которых больше нет.
🔸 Как читать результаты экспериментов
Полный SWE-bench и Lite, запуски с демонстрацией и без неё, вклад отдельных компонентов. Несколько независимых попыток и продолжение застрявшего диалога — разные эксперименты.
🔸 Почему конструкцию агента приходится пересматривать
В финале — SWE-smith, mini-SWE-agent с возвращением к bash и изменения SWE-bench Verified.
Проценты и настройки из статьи относятся к экспериментам 2024 года. Для современных моделей заново проверять нужно и пользу специальной команды, и цену её ограничений.
Материалы выпуска:
📌 Страница выпуска с таймкодами
📊 Слайды
📖 Лонгрид об эволюции агентных оболочек
🎬 YouTube, VK Видео
🎧 Podster, Яндекс Музыка, Apple Podcasts
📝 Текстовый конспект
#AI4SDLC #Agents #DevTools #Evals #ResearchInsights #Engineering