Vibe Coding News этой недели:
Исследования, подтверждающие, что человекообразные senior-разработчики и ученые пока еще пригодятся, а также асинхронная библиотека для приложений с мультимодалными LLM. Д
Новое исследование METR проверило, как ИИ-помощники (Cursor Pro с Claude 3.5/3.7) влияют на продуктивность senior-разработчиков. Взяли 16 опытных инженеров (у каждого ~1500 коммитов и около 5 лет стажа в конкретных репозиториях open-source проектов) и дали им 246 типичных задач: багфиксы, фичи и улучшения на их «родных» проектах, где они знают каждый уголок.
Ожидали ускорения на 20–30%, а получили замедление на 19%.Вывод: когда вы знаете проект лучше, чем собственный дом, ИИ пытается помочь как доброжелательный, но немного навязчивый младший коллега. Новичкам и в новых кодовых джунглях — полезно, а профи лучше доверять себе.
Подробнее и полный препринт здесь. METR — некоммерческая организация из Калифорнии, оценивающая риски от передовых ИИ-систем. Занимается тестированием автономных ИИ, сотрудничает с OpenAI, Anthropic и другими.
Исследователи из Стэнфорда проверили, чьи идеи в области обработки естественного языка (NLP) лучше: от людей или от LLM (Claude 3.5). Идеи для научно-исследовательских NLP-проектов были собраны от людей, сгенерированы LLM и оценены. Затем 43 исследователя реализовали идеи (в среднем по 100 часов работы), а другие эксперты потом ещё раз анонимно оценили результаты.
До реализации идеи ИИ казались интереснее, перспективнее, эффективнее. Но когда дошло до дела, их оценки сильно просели. Человеческие идеи оказались стабильнее и в итоге по качеству после реализации обошли LLM.
Вряд ли эти результаты можно распространять на другие области, но в научных исследованиях по темам вроде генерации, перевода, оценки фактов и безопасности — LLM умеет вдохновлять и пока не вытесняет человека.
Полный препринт - здесь. Google Deep Mind
выпустили GenAI Processors — Python-библиотеку для быстрой сборки мультимодальных AI-приложений. Она позволяет легко объединять ввод с микрофона, камеры, текста или изображения и обрабатывать его через Gemini, выдавая результат с минимальной задержкой. Всё работает асинхронно и стримингово "из коробки. Хотя библиотека заточена под Gemini и содержит готовые модули, при желании можно подключить и другую LLM — например, GPT 4 — но для этого нужно написать свой небольшой врапер-процессор, который будет передавать данные в нужный API и обрабатывать ответы.
Пропустили что-то важное?