Вчера OpenAI выкатил GPT-5.
Почитал полный анонс и сделал из него выжимку главного, а так же успел немного погонять новую модель в своих задачах и поделюсь своим мнением в конце.
Что поменялось, если кратко:
1️⃣ Логика и сложные задачи
Для задач с многошаговым рассуждением это уже уровень олимпиадника и выше среднего по рынку. Написание кода и инженерия у reasoning-версии GPT-5 лучший результат среди моделей OpenAI, сильный отрыв отрыв от o3.
2️⃣ Мультимодальность
Модель стала лучше читать: текст+картинки+диаграммы. Это значит: можно кидать скриншоты, графики, схемы, и получать корректные выводы/данные. Раньше модель тут либо не могла справиться либо галлюцинировала.
3️⃣ Факты и галлюцинации
У обычной GPT-5 галлюцинации на 26% ниже чем в GPT-4o. А у GPT-5-thinking на 65–78% ниже в сравнении o3, включая крупные ошибки. Это чувствуется в задачах с веб-проверкой и без нее.
4️⃣ Честность рассуждений
Модель отвечает неправдой, но делает это убедительно и с уверенным тоном теперь лишь в 2,1% случаев у GPT-5-thinking против ~4,8% у o3. Меньше правдоподобной ерунды, больше признаваний «я не знаю».
5️⃣ Архитектура и роутинг
GPT-5 теперь сама выбирает режим под задачу для Deep Research. В течении 30 дней есть 10 запросов детальных и 15 слабо детальных. Причем какой из запросов потратит решит сама 🤣
6️⃣ Deep Research теперь часть режима Агента для долгих исследовательских задач(те самые 10 запросов):
сам ищет, проверяет и собирает отчёт с цитатами; теперь ещё глубже за счёт визуального браузера в агент-режиме. Обычно работает 5–30 минут и выдаёт проверяемый док.
✨ Резюме и мои выводы
По совокупности метрик это самый полезный релиз OpenAI: высокие баллы за логику и сложные задачи, сильные улучшения в написании кода и заметное снижение галлюцинаций/«обманчивых» ответов. Контекст до 256k делает его удобным для длинных диалогов(аналитика, кодинг, R&D), а вот роутинг в Deep Research со сложными и быстрыми задачами еще нужно тестить.
Работа с Deep Research как с продактом и аналитиком стала точно лучше: собирает источники, сравнивает, явно показывает ход мыслей. Да, ждать дольше, но на выходе материал уровня хорошего отчета, а не просто дайджест. Для меня это пока главный апгрейд в ценности на выходе. Ну убрали зоопарк с выбором из кучи моделей.
➡️ А вы уже попробовали GPT-5? Расскажите свои мысли и наблюдения в комментариях.
➡️ Поделитесь или сохрани себе если откликнулось.
Post #159
308


- ❤ 8
- 🔥 1