TGViewer
Про AI: Лучшие cтатьи и исследования Про AI: Лучшие cтатьи и исследования @ai_longreads · 1.84K subscribers
Post #658 591
DeepSWE: оценка передовых агентов-программистов на оригинальных, долгосрочных инженерных задачах

DeepSWE -- новый бенчмарк для программирующих ИИ-агентов, который предлагает оригинальные, сложные задачи, охватывающие 91 репозиторий и 5 языков программирования. В отличие от существующих тестов, он обеспечивает более четкое разделение между моделями и более надёжную верификацию.

Читать статью
  • 👍 1
More from @ai_longreads
  1. Sep 30, 2026Преимущество ИИ для атакующих и защитников Атакующие переходят от идеи к реализации за счи…
  2. Sep 30, 2026Утренний обзор AI-трендов: firelex/jeff Fine-tuning моделей Qwen3.5 и Gemma 4, оптимизиров…
  3. Sep 28, 2026Утренняя сводка из мира AI: feitangyuan/onetake Навык для Claude Agent, позволяющий создав…
  4. Sep 27, 2026Обзор M5 Ultra Mac Studio: идеальный Mac для локальных ИИ-агентов Детальный обзор нового M…
  5. Sep 27, 2026Утренняя сводка из мира AI: Ternary-Bonsai-2-27B-gguf Полноценная модель рассуждений класс…
  6. Sep 26, 2026Внутри агентной «фабрики софта» OpenAI Глубокий разбор того, как Codex «захватил» OpenAI,…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →