TGViewer
Системный Блокъ Системный Блокъ @sysblok · 11.6K subscribers
Post #1254 4.2K
Нейротикток от OpenAI, новая модель Anthropic, новый тест для LLM

Рассказываем, что произошло в мире ИИ за последнее время.

Sora 2 и нейротикток 

Компания OpenAI представила обновлённую версию модели Sora для генерации видео по текстовым описаниям. Новая версия создает более качественные и реалистичные ролики со звуком, а еще умеет добавлять в кадр конкретных людей и предметы на основе загруженных примеров.

Одновременно с обновлением вышло мобильное приложение Sora для iPhone с короткими роликами, созданными пользователями с помощью Sora 2. Меньше чем за неделю социальная сеть возглавила топ App Store в категории «‎Фото и видео».

Пока приложение работает только в США и Канаде по приглашениям.

Почему это важно?

Модели для генерации видео начали активно развиваться с 2024 года. С тех пор OpenAI, Google и ряд китайских компаний представили решения, способные создавать относительно реалистичные ролики.

Сейчас их используют преимущественно для развлекательного контента, но существуют опасения, что в будущем компании будут применять такие технологии для генерации крайне персонализированного и вызывающего зависимость контента.

В перспективе генеративные модели могут превратиться в модели мира, способные относительно точно и быстро симулировать физические процессы и ситуации из реальности. Например, моделировать редкие дорожные ситуации для проверки автопилотов или рутинные задачи вроде складывания вещей и приготовления пищи для обучения роботов.


Новый Sonnet от Anthropic

Компания Anthropic представила Claude Sonnet 4.5 — новую версию своей языковой модели. По заявлению разработчиков, это лучшая в мире модель для написания кода и создания сложных агентов (программ, использующих ИИ для автономного выполнения задач на компьютере). Sonnet 4.5 также показала значительные улучшения в задачах на логику и математику.

Одно из ключевых улучшений — способность работать автономно до 30 часов без вмешательства человека. Поэтому модель особенно полезна для долгосрочных задач вроде анализа данных. Sonnet 4.5 также получила улучшения в специализированных областях, таких как финансы и медицина.

Почему это важно?

Anthropic – один из главных конкурентов OpenAI. Модели Antropic на протяжении долгого времени остаются лидерами в области программирования и агентных систем.


Тест LLM в реальных рабочих задачах

Компания OpenAI представила GDPval — новый тест для оценки способности языковых моделей выполнять экономически значимые задачи из реального мира.

OpenAI выбрала девять крупнейших отраслей экономики США и 44 профессии с наибольшим вкладом в фонд оплаты труда, связанных с интеллектуальным трудом. Для каждой подготовили по 30 реальных задач, прошедших несколько раундов экспертной проверки, а результаты моделей оценивали специалисты оценивали в слепом формате, сравнивая их с работой людей.

В тестировании участвовали несколько моделей OpenAI, Claude Opus 4.1, Gemini 2.5 Pro и Grok 4. Claude Opus 4.1 показала лучший результат (в 43,5% модель оказалась лучше эксперта, еще в 4% — на уровне экспертов), особенно в эстетических аспектах вроде форматирования документов, а GPT-5 отличилась в точности поиска специализированных знаний.

Модели выполняют задачи GDPval примерно в 100 раз быстрее и дешевле экспертов, однако эти цифры не учитывают человеческий контроль и итерации, необходимые в реальных рабочих условиях.

Почему это важно?

Большинство существующих тестов для языковых моделей проверяют академические способности или производительность в узких областях вроде математики и олимпиадного программирования. Поэтому их результаты плохо отражают реальную пользу ИИ в практических задачах. Несмотря на это, в общественной дискуссии активно обсуждается вероятность замены человеческого труда искусственным интеллектом.

GDPval призван тестировать модели на репрезентативных задачах из реальной жизни, чтобы оценить экономический потенциал ИИ и возможные тренды автоматизации труда в будущем.


🤖 «Системный Блокъ» @sysblok
  • ❤ 13
  • 👍 9
  • 🔥 9
  • 😁 1
  • 🤩 1
More from @sysblok
  1. Sep 30, 2026Пользователи применяли Claude для слежки и кибератак В новом отчете Anthropic рассказала,…
  2. Sep 25, 2026Минпросвещения составило правила для учителей по работе с ИИ Ведомство рекомендует школам…
  3. Sep 22, 2026Едят ли корейцы собак? Отвечает статистика В феврале 2027 года в Южной Корее истекает пере…
  4. Sep 19, 2026От Пикуля к ИИ: как создавалась и на чем держится книжная империя Эксмо-АСТ За последние д…
  5. Sep 18, 2026Как построить систему самообучения: алгоритм от цели до результата Можно скачать 10 прилож…
  6. Sep 12, 2026Post #1484
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →