TGViewer
Channel Public Channel
Tuzov AI Lab

Tuzov AI Lab

@tuzov_ai_lab

Заметки инженера про AI / LLM: актуальные новости, эксперименты, кейсы, мысли.

Автор: @ntuzov

Общаемся в AI Dev Club: https://t.me/+NMh-DL73ibFkMWEy
Subscribers
4.49K
Photos
72
Videos
17
Links
84
Recent Posts 18 shown
Post #173 2.08K

Forwarded from Сиолошная

А вот и OpenAI: встречайте GPT-6 Sol и Luna.

— обе модели ровно в 2 раза дешевле, чем их 5.6-версии.
— общаться должны так же понятно и без жаргона, как Astra
— и... всё. Sol не лучше Astra (а во многом и хуже, в отличии от пары Fable <-> Opus), но сильно дешевле, и всё ещё лучше Sol 5.6. Поэтому модель может стать основной рабочей лошадкой, сохраняя ваши лимиты.
  • 😁 17
  • 🔥 10
  • ❤ 5
  • 👍 5
Post #172 2.31K
🔸 Claude Opus 5.5 — вышел

Anthropic выкатили Opus 5.5, доступен уже везде.

Главный тезис: по большинству задач модель на уровне Fable 5.1, а на типичных задачах обходится на 40% дешевле, чем Opus 5.

Интересно, что по агентному кодингу Opus 5.5 обгоняет и Fable 5.1, а не просто догоняет. На мой взгляд, это даже вполне ожидаемо.

Цена снизилась:

- $4/$20 за миллион токенов (было $5/$25)
- Чтение из кэша — $0.20 (было $0.50), минус 60%. Для длинных агентных сессий это как раз самая заметная статья расходов
- Fast mode — $8/$40, до 2.5x быстрее. Есть в Claude Code и на Claude Platform

Что ещё интересного:

- Отвечает на 30% быстрее Opus 5. Ранние тестеры пишут про экономию токенов на 40–60% на сложных задачах

- Ответы стали короче и понятнее. Обещают, что важное теперь идёт первым, и агент льёт меньше воды

- Отзыв из early access: «аудит и фикс кодовой базы на 200k строк меньше чем за три часа, Opus 5 на это ушло 20+ часов». Ещё был кейс про миграцию на 680k строк меньше чем за день

По безопасности: лучший результат на автоматическом поведенческом аудите среди всех Claude, на 85% меньше попыток обойти ограничения, чем у Opus 5. Лучшая устойчивость к prompt injection.

При этом задачи, связанные с безопасностью, теперь переадресуются на Opus 4.8 🤔
Для безопасников есть Cyber Verification Program. С биологией аналогично: доступ ограничен, для организаций есть отдельная программа верификации.

🟢Самое приятное: подняли пятичасовые лимиты на Pro, Max и Team подписках.
И... появилась функция сброса лимитов 🔸🔫🔵

————

Меня больше всего радует снижение цены. Если экономия токенов на 40–60% подтвердится на реальных задачах, то в подписке это считай половина лимита сверху, плюс официальное повышение и резеты лимитов. А я в последнее время частенько упирался в них, порой приходилось даже вторую подписку оплачивать.

Будем пробовать
☀️

#anthropic #opus #claude
  • ❤ 21
  • 🔥 12
  • 👍 5
Post #171 3.52K
Post #170 5.29K
Наверное, мне стоило как-то прокомментировать тот факт, что в OpenAI решили недавно проблему Навье-Стокса, раз уж я по образованию статфизик, и это моя профильная, в некотором смысле, тема...

Но я уже устал удивляться таким вещам. Если тема не затухнет в ближайшие дни / недели, и это будет кому-то интересно, могу сделать разбор — что это вообще за проблема такая, и в чём суть. Так хоть молодость вспомню 👍

Да и вообще, эту проблему уже давно решили у нас в Казахстане! Ну, почти...

UPD: формально проблема не считается решённой, пока решение не пройдёт все проверки. Насколько я знаю, для этого должно пройти не менее двух лет. Так что, заголовки в стиле "решили!", это просто упрощение или непонимание (в моём случае — упрощение). Может, и не решили, как было с Отелбаевым.
  • 🔥 45
  • 👍 14
  • 😁 4
  • 🤔 1
Post #169 4.5K
Tuzov AI Lab Fable 5.1 vs GPT Astra? Мой опыт и сравнение Я недавно запустил платформу для своих авторских гайдов по Go. Кое-где мне не хватило тематических рамок проекта, и я решил на том же движке запустить ещё одну платформу — с гайдами на более общие темы. Я сейчас…
Post #168 4.54K
Fable 5.1 vs GPT Astra? Мой опыт и сравнение

Я недавно запустил платформу для своих авторских гайдов по Go. Кое-где мне не хватило тематических рамок проекта, и я решил на том же движке запустить ещё одну платформу — с гайдами на более общие темы.

Я сейчас занят очередной статьёй, поэтому подготовку нового проекта полностью делегировал новым мощным моделям от Антропиков и OpenAI. Промты дал идентичные — показал где взять движок, где смотреть доки, где смотреть пример проекта (go guides) и т.п. Модели должны проработать дизайн, айдентику, структуру контента (рубрики, категории, теги), контент план (по моим черновым наработкам) и прочие уникальные для проекта вещи.

Обе модели работали на своих максимальных эффортах, токенов я не жалел. Основная сессия выступала оркестратором, а всю "грязную" работу выполняли агенты на тех моделях и эффортах, которые выбирал оркестратор.

Итог

Fable выдал готовый результат, плюс дополнительно очень крутую проработку вариаций дизайна. Превзошёл мои ожидания.

Astra... Выдала результат, который даже для Опуса был бы стыдный. В общем, под мои задачи, GPT всё ещё аутсайдер, но я не устаю давать ему шанс 👍

При этом, Клод дважды съедал мои 5-часовые лимиты на плане за $200, Кодекс ни разу не уткнулся в лимиты. Это не особо важно, т.к. результат меня не устроил, но хоть какие-то плюсы 🤷‍♀️

————

🟠Конечно, я не даю вердикт по такой работе — это лишь мой частный кейс, и мой стиль работы. Вполне возможно, что при других подходах и/или задачах GPT будет справляться лучше. Но у меня пока так.

🟢Примеры их работ с моими пояснениями буду докидывать в комментарии
  • 🔥 21
  • 👍 9
  • ❤ 3
Post #167 4.91K
☀️ Вы наверняка уже в курсе, но — вышел новый Fable 5.1

https://www.anthropic.com/claude-fable-and-mythos-5-1

Как всегда — быстрее, выше, сильнее. Буду активно пользоваться, если вдруг замечу разницу, поделюсь в отдельном посте.
  • 👍 27
  • 🌚 6
Post #166 7.36K
Tuzov AI Lab 🔸 Opus 5 — как Fable, но дешевле https://www.anthropic.com/news/claude-opus-5 Anthropic выкатили Opus 5. Доступен везде уже сегодня. Нам обещают, что он вплотную подошёл к Fable 5 — но за половину её цены. При этом сам стоит столько же, сколько Opus 4.8:…
Релиз оказался мне очень кстати, т.к. я активно допиливаю финальные правки по своей платформе для гайдов*. Очень активно — в пяти сессиях параллельно разные аспекты дорабатываю — в основном по дизайну.

Сейчас переключился везде на новый Опус, и вау-эффект действительно есть. За последние дни я уже привык, что сначала объсняю что поправить, а потом мы итеративно вымучиваем финальный вариант. С пятым же Опусом я сейчас закрыл несколько фиксов буквально за 1-2 итерации. При чем, вторая итерация — мелкие незначительные штрихи.

Например, он помог мне доработать полоску с мета-инфой у постов (см. картинку), которая до этого была скомканная и неудобная. По привычке, я ожидал минимум 5-10 итераций правок.

Надо ещё понимать, что Fable был хорош на сложных и длинных задачах, а мелкие таски он закрывал хуже Опуса (по моему опыту). Теперь же, когда Опус сопоставим по качеству с Фэйблом, но при этом не такой монстр, мелкие задачи ему даются сильно лучше. Но я сегодня уже очень устал, поэтому окончательные выводы буду делать уже завтра 😩

*Гайды там будут только по Go, но я уже готовлю аналогичный проект по LLM
  • 🔥 33
  • ❤ 8
  • 😁 4
  • 👍 1
Post #165 5.58K
🔸 Opus 5 — как Fable, но дешевле

https://www.anthropic.com/news/claude-opus-5

Anthropic выкатили Opus 5. Доступен везде уже сегодня.

Нам обещают, что он вплотную подошёл к Fable 5 — но за половину её цены. При этом сам стоит столько же, сколько Opus 4.8: те же $5/$25 за миллион токенов.

Цена не выросла, а по словам «доверенных партнёров» — «это самый большой скачок в линейке Opus со времён 4.5». Из цифр: на Frontier-Bench обгоняет всех и больше чем вдвое перекрывает Opus 4.8, а на ARC-AGI 3 (это про решение новых, незнакомых задач) — втрое выше ближайшего конкурента.

Но главный акцент релиза не на сырых бенчмарках, а на том, что модель стала заметно лучше соображать и проверять себя.

Пара примеров из тестов:

- Новому Опусу дали чертёж детали, нужно написать код, который соберёт по нему 3D-модель. Но это был жестокий пранк! Модели отключили зрение — открыть картинку и посмотреть на неё она не может. Тогда Опус написал программу, которая прочитала файл за него: нашла на чертеже линии и окружности, сняла размеры, и уже по ним собрала деталь. И так стабильно, раз за разом. Остальные модели в тех же условиях не справились ни за одну из пяти попыток.

- Реальный баг в популярном пакетном менеджере (не говорят в каком): Opus 5 нашёл корневую причину и починил краевой случай, который сообщество в своём патче пропустило. Другая модель (не говорят какая) починила только симптом и отрапортовала о готовности.

Ещё из интересного:

- Anthropic называют его самой «выровненной» (aligned) моделью на сегодня — то есть лучше всех следует правилам, реже всех врёт и тяжелее всего ведётся на вредоносные промт-инжекшены.

- По кибербезу снова осторожничают: находить уязвимости модель умеет хорошо, а вот писать к ним эксплойты — плохо (специально не учили). Зато фильтры теперь срабатывают примерно на 85% реже, чем на Fable 5, и вместо жёсткого отказа запрос по умолчанию просто откатывается на Opus 4.8 (ну спасибо..)

————

Вообще, я не удивлён близости к Fable 5, выглядит будто это и есть его дистилляция — дешёвая модель, которая тянется к качеству старшей. Google так делает с Gemini Flash и не скрывает. Anthropic про метод обучения молчат, так что это чисто мои догадки.

Что ж, на бумаге звучит очень круто. Если оно и правда так круто, то я счастлив — можно будет отменять вторую max-подписку 😩

Буду пробовать уже сегодня. Если будут интересные выводы, напишу отдельный пост.

#anthropic #claude #opus
  • 🔥 22
  • ❤ 10
Post #162 6.06K

This post (sticker, poll or similar) has no web preview. Open in Telegram

  • 🔥 29
  • 👍 18
  • ❤ 6
  • 🤔 5
Post #161 5.64K
В последнее время вижу много восторженных отзывов про новый Kimi K3. Мол, он лучше Фэйбла и GPT Sol вместе взятых, да ещё и дешевле 👍

Кто-то уже пробовал? Поделитесь опытом, как вам. Особенно в сравнении с Клодом / Кодексом. Стоит брать ещё одну подписку за $100-200? 😐
  • 🔥 12
  • 🤔 5
Post #160 5.97K
Tuzov AI Lab Делайте ваши ставки 👍
Вот и ответ — Fable оставят в подписке навсегда. Новость, которая не новость 😃
  • 😁 55
  • 👍 16
  • 💅 6
  • 🔥 3
Post #158 7.8K
Tuzov AI Lab 🔸 ❤️🔵 Антропики и OpenAI конкурируют, мы получаем плюшки Codex: в очередной раз сбросили лимиты (они уже несколько раз так сделали после выхода GPT-5.6) и временно убрали 5-часовой лимит. Claude: продлили доступ к Fable до 19 июля и увеличили недельные лимиты…

This post (sticker, poll or similar) has no web preview. Open in Telegram

  • 👍 5
  • ❤ 2
  • 🌚 1
Post #157 6.9K
🔸 ❤️🔵 Антропики и OpenAI конкурируют, мы получаем плюшки

Codex: в очередной раз сбросили лимиты (они уже несколько раз так сделали после выхода GPT-5.6) и временно убрали 5-часовой лимит.

Claude: продлили доступ к Fable до 19 июля и увеличили недельные лимиты Claude Code на 50% до этой даты.

Идите и делайте дела (с)
  • 😁 42
  • 🔥 17
  • ❤ 5
  • 💅 4
Post #156 5.85K
Ещё одно удобное применение Клода — зачем скидывать скучные чеклисты в pdf, если можно сделать вот так? 👍

https://labs.tuzov.dev/trek-kit/

Готовлюсь к походу в горы, сделал такой вот чеклист-гайд. Моего времени на разработку потрачено примерно ноль (только написание стартового промта, плюс мелкие правки).

Время я тратил только на составление списка и вычитку рекомендаций от Клода — он поресёрчил и дополнил меня и гида всяким полезным.

К слову, как же удобно, когда можно на каждый чих запустить агента-ресёрчера в фоне, прямо из основной сессии: а точно ли вот эта штука нужна? Какая погода на маршруте в этом время? Рекомендацию по выбору вон той штуки и т.п.

В какое удивительное время живём.. 🦄

И это ещё одна причина, почему мне сложно будет отказаться от Клода в пользу GPT — у него даже в 5.6 с дизайном заметно хуже.
labs.tuzov.dev Что взять на 3 979 метров и что оставить дома Чеклист снаряжения для семидневного траверса Заилийского Алатау: 72 км, набор 6 047 м, перевал Туристов 3 979 м. 24 критичных пункта — и 18, которые брать не нужно.
  • 👍 35
  • 🔥 17
  • ❤ 12
Post #155 5.07K
А вот нормальную работу с субагентами в Кодекс так и не завезли, похоже.. У меня уже руки набиты на работу с Клод Кодом — делегирование подзадач агентам на правильных моделях (я знаю, что доверить Опусу, что Фэйблу, что Соннету, а иногда даже Хайку).

Кроме того, недавно я выяснил, что в Кодексе есть даже ограничение на количество одновременно работающих субагентов, и их довольно мало. Ну и он очень неохотно их запускает, только по прямому запросу пользователя.

Похоже, выход GPT-5.6, это прекрасный повод наконец-то освоить pi.dev
  • 👍 19
  • 🤔 10
  • 🔥 3
Post #151 4.8K
Можете ложиться спать, Fable с нами до 12 июля

Обратите внимание: сколько дней до 12.07? Правильно, всего 5. А когда сбросятся лимиты, потраченные недавно? Примерно через неделю. У меня две подписки на Клода — у одной сброс будет 11-го, у другой 13-го. Так что, это продление мало что даёт, на самом деле. Дата выбрана не просто так 👍

————

Гонка AI сейчас поинтересней, чем остросюжетные блокбастеры:

1. Антропики просят остановить развитие ИИ и просят зарегулировать нишу
2. Выпускают "ультрамощную" модель, подсаживая нас на эту иглу
3. Их "зарегулировали", как они и просили, модель забрали..
4. ... Модель вернули! Но обещают снова забрать 7 июля (исключить из подписки). Однако, запрос на рынке уже есть, они сами его создали!
5. OpenAI собираются занять созданную и освободившуюся нишу, намекая, что GPT-5.6 Sol будет также хорош, как и Fable / Mythos (я даже слышал байки про многомиллионный контекст). Появляются слухи, что он выйдет как только заберут доступ к Fable, то есть в ближайшие часы. Идеальный тайминг!
6. Антропики продлевают нам Fable почти на неделю
....
Мы здесь
???


🍿

#fable #claude
  • 😁 51
  • 👍 6
  • ❤ 4
  • 🤔 2
Older posts →

About this channel

How can I read @tuzov_ai_lab without a Telegram account?
TGViewer shows the public web preview Telegram publishes for Tuzov AI Lab: recent posts, photos, videos and the subscriber count, with no app, login or account.
How many subscribers does Tuzov AI Lab have?
Tuzov AI Lab (@tuzov_ai_lab) has 4.49K subscribers on Telegram, refreshed roughly every 30 minutes.
Does Tuzov AI Lab know I viewed it here?
No. Public channel previews carry no viewer identity, and TGViewer has no accounts or tracking of what you look up.
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →