Вышла sonet-4.5, пишут что новая маленькая (и дешевая) модель бьет прошлый опус по метрикам кодинга (SWE bench-у относительно можно доверять)
Я потыкал в своих задачах кодинга, кажется что правда лучше, но возможно, она просто быстрее и успевает сделать больше попыток пока не выбесит меня
P.S. на графике режим test-time compute - это когда модель генерирует несколько решений из которых выбирается лучшее.
Post #189
2.51K

- 🔥 9
- 👍 4
- 😁 2
- ❤ 1
- 👎 1
- 🤮 1
- 💩 1