https://clickhouse.com/blog/llm-observability-challenge
Классная статья про то, как ребята из ClickHouse проводили эксперименты с применением LLM'ок для поиска источника инцидентов.
Кратко про суть эксперимента:
1) взяли демо-приложение
2) сделали там фича-флаги, которые эмулируют разные сбои
3) нагрузили приложение 1000 виртуальных пользователей
4) собрали много логов данных «нормальной» работы, на какое-то время включили флаг эмулириующий проблемы и собрали «проблемных» логов
5) дали LLM-кам через MCP доступ к собранным данным и скормили довольно простой промпт типа «у нас что-то сломалось, выясни что именно»
6) Сделали замеры. Удалось ли найти источник? Сколько времени потребовалось? Сколько токенов потрачено? Сколько стоили эти токены? Сколько коннектов к MCP потребовалось?
Сравнивали Claude 4, OpenAI o3, OpenAI GPT4.1, Gemini Pro. Интересно, что практически для каждого кейса по отдельности одна из моделей по совокупности факторов справилась лучше других, но при этом нет явного-явного лидера по совокупности всех кейсов.
В статье много таблиц и графиков. Рекомендую посмотреть, затягивает)
Ну и небольшой спойлер:
«
Могут ли LLM заменить SRE инженеров уже сегодня? Нет.
»
Post #243
259