TGViewer
Бесконечное ИТ Бесконечное ИТ @neverendingit · 363 subscribers
Post #712 371
OpenAI опубликовали интересное исследование/анонс. Почему это интересно? Потому что в результатах модели OpenAI — не победители. Это как минимум даёт намёк на справедливость оценки. В исследовании анонсирован новый бенчмарк для LLM-моделей — назвали его SWE-Lancer.

SWE-Lancer включает в себя более 1400 фриланс-задач по разработке программного обеспечения от Upwork, общая стоимость которых составляет более $1 млн. Задачи SWE-Lancer охватывают весь инженерный стек — от UI/UX до проектирования систем — и включают ряд типов задач: от исправления ошибок ($50) до реализации фичей ($32 000). SWE-Lancer включает как инженерные задачи (кодинг), так и менеджерские задачи.

На выполнение похожих комплексных задач фрилансерам требовалось в среднем 21 день. Стоимость задач отражает реальную стоимость задач на Upwork. По сути, OpenAI довольно здраво предлагают оценивать модели по реальной работе разработчика и ценности выполненных задач. В исследование очень много деталей об исследовании, его стоит почитать.

Ну и результаты: большинство моделей не могут решить даже половины задач(по ценности а не по количеству). Максимум был у Claude 3.5 Sonet. Но зато теперь есть новая планка и, что самое главное, моментальное подтверждение ценности для бизнеса, выраженное в $$$. А значит, как только стоимость решаемых задач новой модели превысит среднюю зарплату разработчика, пока кожаные , нас ждёт новый виток развития software-индустрии.
  • 👍 5
More from @neverendingit
  1. Aug 7, 2026История про взлом Hugging Face обросла деталями. Прогрессивное комьюнити разделилось на дв…
  2. Jul 23, 2026"В конечном счёте, и лидерство, и доверие заслуживаются одинаково - постоянством в том, чт…
  3. Jul 22, 2026Потрясающая история произошла недавно в мире AI/Security буквально на наших с вами глазах.…
  4. Jul 1, 2026Как ArchUnit помогает командам Netflix управлять изменениями в коде. Я несколько раз вплот…
  5. Jun 25, 2026Блокировка доступа к моделям Anthropic, OpenAI породила огромный черный рынок в Китае (и в…
  6. Jun 23, 2026Представили новый HTTP метод - QUERY. Призван закрыть пустоту между GET и POST в части раб…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →