довго думав і афігевав
нарешті AI замінить і мою відповідальність
невже зʼявилась модель, що може ефективно приймати рішення під час технічних інцидентів, враховуючи бізнес контекст
подумав - а звідки той контекст вона бере?
так я дізнався, що SRE-Bench - це бенчмарк, націлений на задачки по Reverse Engineering, а не на Incident Response & Management
все це - наслідок проф деформації і тунельного бачення після довгих безсонних ночей в SRE
коротенько, про що цей тест:
це бенчмарк, який перевіряє, чи здатні LLM-агенти виконувати реалістичний reverse engineering великих скомпільованих програм без доступу до source code та без можливості впізнати їх із training data
score, дійсно, вражає
+ інциденти, все ще, менеджимо в напів автономному режимі
поки що ☠
Post #133
335

- ❤ 4
- 🤯 1