TGViewer
AI для Всех AI для Всех @nn_for_science · 15.5K subscribers
Post #2363 9.53K
SWE-Lancer: OpenAI всерьез взялись за ИИ-програмиста

Многие спорят, сможет ли ИИ полноценно заменять разработчиков. Новый эксперимент OpenAI — SWE-Lancer — показывает, насколько мы приблизились к этому будущему.

Исследователи взяли 1 488 реальных задач из фриланс-проекта Expensify на Upwork и показали их передовым ИИ-моделям, чтобы узнать, сколько денег они способны “заработать”. И тут всё серьёзно: за каждую решённую задачу — настоящая выплата, общий призовой фонд — $1 млн!

Задачи собирали для двух сценариев:
1. IC (Individual Contributor) Tasks — ИИ пишет решение задачи и тесты как в реальном продукте .
2. Задачи менеджера — ИИ оценивает несколько предложений решения проблемы и выбирает лучшее, как реальный тимлид.

Оказалось, что даже крутые системы вроде GPT-4о и Claude 3.5 Sonnet (на о3 почему то не проверяли) собрали лишь часть возможной суммы: лучший результат — около $400 000. Цифра внушительная, но говорит о том, что им ещё есть к чему стремиться.

Что тут измеряют и почему это важно?

• Сложность задач. Простые мелочи стоят $50, а большие фичи — до $32 000. Эта разница чётко показывает уровень навыков ИИ.
• Подход к работе. Одни модели лучше выбирают готовые решения (как тимлид), другие — активнее пишут код.
• Путь к улучшению. Раз видим, где ИИ “недозаработал”, мы понимаем, какие умения прокачивать — например, работать сразу с несколькими файлами или тщательнее тестировать.

Пока ИИ хорош в точечных задачах и быстрых решениях, но когда дело доходит до больших, “раскиданных” по проекту проблем, начинаются пробуксовки.

Куда всё идёт?

С большой вероятностью — к тому, что модели продолжат совершенствоваться, научатся быстрее и глубже понимать проекты, а значит и зарабатывать всё ближе к заветным $1 млн. Людям же в этом процессе роль конкурентов видимо не достанется.

SWE-Lancer наглядно демонстрирует, что современные модели не так уж и далеки от полного захвата фриланса. Пока же мы видим, что живой разработчик и его навыки остаются незаменимы, но, как гласит одна из заповедей: “what you can measure - you can improve”.

Статья
  • 👍 16
  • 🔥 15
  • ❤ 7
  • 😢 5
  • 😁 3
More from @nn_for_science
  1. Oct 7, 2026Точка молодец! Дальше с ее собственных слов: После того как обратный рейс United закончилс…
  2. Oct 5, 2026Мне в предыдущем посте насовали в панамку за слоп. Но как по мне - рекламу стало делать пр…
  3. Oct 3, 20260 → 20k просмотров за неделю Друзья, кроличья нора Opus 5.5 для производства видео завела…
  4. Sep 24, 2026Opus 5.5 очень хорош в демо-видео Друзья, обновил свой скилл для рисования демо видосов (п…
  5. Sep 24, 2026Claude поставил адблокер на мой телевизор! Захотелось пересмотреть Brooklyn 99, раз уж в Н…
  6. Sep 21, 2026Чат: open-source (и комерческие) альтернативы Greptile попользовался Greptile, очень круто…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →