Рассказываем, что произошло в мире ИИ за последнее время.
Sora 2 и нейротикток
Компания OpenAI представила обновлённую версию модели Sora для генерации видео по текстовым описаниям. Новая версия создает более качественные и реалистичные ролики со звуком, а еще умеет добавлять в кадр конкретных людей и предметы на основе загруженных примеров.
Одновременно с обновлением вышло мобильное приложение Sora для iPhone с короткими роликами, созданными пользователями с помощью Sora 2. Меньше чем за неделю социальная сеть возглавила топ App Store в категории «Фото и видео».
Пока приложение работает только в США и Канаде по приглашениям.
Почему это важно?
Модели для генерации видео начали активно развиваться с 2024 года. С тех пор OpenAI, Google и ряд китайских компаний представили решения, способные создавать относительно реалистичные ролики.
Сейчас их используют преимущественно для развлекательного контента, но существуют опасения, что в будущем компании будут применять такие технологии для генерации крайне персонализированного и вызывающего зависимость контента.
В перспективе генеративные модели могут превратиться в модели мира, способные относительно точно и быстро симулировать физические процессы и ситуации из реальности. Например, моделировать редкие дорожные ситуации для проверки автопилотов или рутинные задачи вроде складывания вещей и приготовления пищи для обучения роботов.
Новый Sonnet от Anthropic
Компания Anthropic представила Claude Sonnet 4.5 — новую версию своей языковой модели. По заявлению разработчиков, это лучшая в мире модель для написания кода и создания сложных агентов (программ, использующих ИИ для автономного выполнения задач на компьютере). Sonnet 4.5 также показала значительные улучшения в задачах на логику и математику.
Одно из ключевых улучшений — способность работать автономно до 30 часов без вмешательства человека. Поэтому модель особенно полезна для долгосрочных задач вроде анализа данных. Sonnet 4.5 также получила улучшения в специализированных областях, таких как финансы и медицина.
Почему это важно?
Anthropic – один из главных конкурентов OpenAI. Модели Antropic на протяжении долгого времени остаются лидерами в области программирования и агентных систем.
Тест LLM в реальных рабочих задачах
Компания OpenAI представила GDPval — новый тест для оценки способности языковых моделей выполнять экономически значимые задачи из реального мира.
OpenAI выбрала девять крупнейших отраслей экономики США и 44 профессии с наибольшим вкладом в фонд оплаты труда, связанных с интеллектуальным трудом. Для каждой подготовили по 30 реальных задач, прошедших несколько раундов экспертной проверки, а результаты моделей оценивали специалисты оценивали в слепом формате, сравнивая их с работой людей.
В тестировании участвовали несколько моделей OpenAI, Claude Opus 4.1, Gemini 2.5 Pro и Grok 4. Claude Opus 4.1 показала лучший результат (в 43,5% модель оказалась лучше эксперта, еще в 4% — на уровне экспертов), особенно в эстетических аспектах вроде форматирования документов, а GPT-5 отличилась в точности поиска специализированных знаний.
Модели выполняют задачи GDPval примерно в 100 раз быстрее и дешевле экспертов, однако эти цифры не учитывают человеческий контроль и итерации, необходимые в реальных рабочих условиях.
Почему это важно?
Большинство существующих тестов для языковых моделей проверяют академические способности или производительность в узких областях вроде математики и олимпиадного программирования. Поэтому их результаты плохо отражают реальную пользу ИИ в практических задачах. Несмотря на это, в общественной дискуссии активно обсуждается вероятность замены человеческого труда искусственным интеллектом.
GDPval призван тестировать модели на репрезентативных задачах из реальной жизни, чтобы оценить экономический потенциал ИИ и возможные тренды автоматизации труда в будущем.
🤖 «Системный Блокъ» @sysblok