TGViewer
Full-time nerd Full-time nerd @ftbore · 608 subscribers
Post #1885 736
Full-time nerd GPT-4.5? Похоже, что через несколько часов OpenAI представит новую базовую модель GPT-4.5 (господи, даже мои коллеги не могут запомнить их больной нейминг, что уж говорить про обычных юзеров). Жду, что через некоторое время после представления GPT-4.5 будут…
А вот и GPT-4.5 system card подвезли

Очень много про джейлбрейки, кибербезопасность, химические и биологические угрозы, радиологические и ядерные угрозы, убеждение и автономность

Кибербезопасность: GPT-4.5 не демонстрирует достаточного прогресса в возможностях эксплуатации реальных уязвимостей, чтобы считаться средне-рискованной.

Химические и биологические угрозы: GPT-4.5 может помочь экспертам в оперативном планировании воспроизведения известной биологической угрозы, что соответствует среднему уровню риска.

Радиологические и ядерные угрозы: GPT-4.5 не может существенно помочь в разработке радиологического или ядерного оружия, исходя из доступной несекретной информации. Но это им так кажется, так и написано:
With the unclassified information available to us, we believe that GPT-4.5 cannot
meaningfully assist in the development of radiological or nuclear weapons, but note again that
this assessment is limited by what we can test


Убеждение: GPT-4.5 демонстрирует передовые результаты в убеждении. При этом пишут, что это Medium...

Автономия модели: GPT-4.5 не демонстрирует достаточного прогресса в возможностях самовоспроизведения, самоулучшения или приобретения ресурсов, чтобы считаться средне-рискованной.

В кодинг-бенче SWE-bench verified сильно отстаёт от reasoning-моделей, но опережает GPT-4o.

OpenAI Research Engineer Interviews:

Coding Questions: GPT-4.5 набирает 79% баллов в задачах по написанию кода, что сравнимо с результатами модели Deep Research, но ниже, чем у o3-mini.

Multiple-Choice Questions: Модель набирает 80% баллов в вопросах с несколькими вариантами ответов, что соответствует результатам других передовых моделей.

OpenAI PRs:

GPT-4.5 решает 7% задач, связанных с внесением изменений в код (pull requests) в репозиториях OpenAI. Это значительно ниже результатов deep research (42%).

Итого, относительно предыдущих базовых моделей улучшения везде, но reasoning-модели во всём круче. А Sonnet 3.7 в написании кода где-то в космосе относительно GPT-4.5

https://cdn.openai.com/gpt-4-5-system-card.pdf

https://openai.com/index/introducing-gpt-4-5/

GPT-4.5

Full-time nerd
  • 👍 7
  • ❤ 2
More from @ftbore
  1. Oct 5, 2026Как получить минимум реакций? Англоязычные IT-мемы. Но это должно быть здесь
  2. Oct 4, 2026Опустился (поднялся?) до оплаты одновременно трёх подписок на AI Anthropic, OpenAI, Google…
  3. Oct 3, 2026Умный дом с нейронками Благодаря опусу 5.5 и Sol'у 5.6 - 6.1 наконец дошли руки соединить…
  4. Oct 1, 2026Google газанули и релизнули Gemini 4 Argon Ну вы поняли, типа аргон это газ, выкупили прик…
  5. Sep 28, 2026Сегодня узнал, что до пенсии мне осталось 34 года, 5 месяцев и 25 дней работы Это дольше,…
  6. Sep 25, 2026РИА Новости сегодня опубликовало материал с заголовком «Россию ждёт ещё одна СВО. Она буде…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →