TGViewer
Agentic Engineer Agentic Engineer @data_engi · 686 subscribers
Post #1274 117
Новая модель может сломать старый системный промпт

Команда Kiro проверила одни и те же изменения промпта на двух версиях модели. На первой они сократили число поведенческих ошибок агента на 32%, а на новой — лишь на 4%.

Причина: более свежая модель точнее и буквальнее выполняла инструкции. Старые ограничения, обходные решения и лимиты, добавленные под прежнюю модель, частично превратились в помехи.

Для тебя вывод простой: замена LLM — это изменение всей конфигурации агента. После обновления заново проверяй завершение задач, выбор инструментов, опасные действия, запуск тестов и соблюдение правил проекта. Некоторые инструкции лучше удалить, а не переписывать.

Цифры получены во внутренних экспериментах Kiro и не являются универсальным прогнозом для других систем.

Пруф: технический разбор Kiro от 21.08.26

#aiagents #llm #promptengineering #aievals #modelops #softwareengineering

@data_engi
kiro.dev Continuous Prompt Evaluation: How We Use LLM Judges and Live Signals to Improve Kiro Agent Quality
More from @data_engi
  1. Oct 4, 2026От "наши LLM - мирового уровня" до "но нужно трезво смотреть на вещи..." прошла одна блоки…
  2. Oct 4, 2026Память агента нельзя оценить, если он её не видел 🤨 1 октября исследователи представили C…
  3. Oct 4, 2026Бэкап PostgreSQL может незаметно вытеснить рабочие данные из памяти ☺️ 2 октября ClickHous…
  4. Oct 3, 2026Agentic Engineer pinned a photo
  5. Oct 3, 2026Давно хотел сделать удобную управляемую модель солнечной системы с картиной текущего полож…
  6. Oct 3, 2026Видеопродакшн в стиле 3blue1brown с Gemini 4 #ml #courses #coolstorybob Давно чесались рук…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →