Забираем Стэнфордское решение для БУСТА ИИ-агентов — никакого дообучения: тулза LLM-as-a-Verifier заставляет модель сгенерить несколько решений, а после самостоятельно их проверить и выбрать лучшее.
Самое важное: это реально работает! Так, после фреймворка результат DeepSeek V4 Flash в бенчмарке Terminal-Bench 2.1 вырос с 79% до 88%. То есть нейронка стала лучше, чем Claude Fable 5.
При этом авторы уверяют: такая методика примерно в 1️⃣1️⃣ раз дешевле Fable 5 на задачу. Тулза полностью опенсорсная и
🔤🔤🔤🔤🔤🔤🔤🔤🔤🔤
Прокачиваем своих агентов — тут.
🙂 Не баг, а фича
Post #27139
27.6K

- 👍 26
- ❤ 12
- 😁 9
- 🔥 4
- 👎 3