TGViewer
AI.Insaf AI.Insaf @ai_tablet · 1.19K subscribers
Post #201 790
Хорошая статья про computer-use агентов на базе LLM от @wrapper228 тут

• Формально LLM уже можно использовать как инструмент управления компьютером — не просто как чат, а для выполнения задач end-to-end: открыть браузер, найти данные, изменить файл и т.д. (это уже не просто генератор текста)
• Как итог - guardrails и ограничения среды становятся критичнее, чем очередное дообучение моделей. Из-за сложности задачи, наверное, снова проявляется забытый reward hacking - агент может формально выполнить цель

Очень интересно, но ждем что смогут сделать в будущем: пока дорого и не дорабатывает
wrapper228.github.io Плохое влияние computer-use окружения на адекватность LLM Исследование поведения computer-use агентов на моделях Sonnet 4.5 и Opus 4.6
  • 👍 6
  • 🔥 3
  • 🙏 1
More from @ai_tablet
  1. Sep 29, 2026Хороший друг Никита Зелинский со школой ml inside запускает курс по AI-агентам для продакт…
  2. Sep 21, 2026Agents Trust Tools Too Much (arxiv) Почему-то агенты слишком доверяют вызовам тулов как ед…
  3. Sep 20, 2026Measuring LLM Sycophancy under Sustained Multi-Turn Pressure (arxiv) Сложное название для…
  4. Sep 12, 2026Post #252
  5. Sep 9, 2026MemTrapBench: Benchmarking Cognitive Traps in LLM Memory Use (arxiv) Забавная статья, в ко…
  6. Sep 7, 2026Feedback That Backfires arxiv Контринтуитивный вывод в статье. Дефакто в harness-решениях…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →