TGViewer
Channel Public Channel
Заметки LLM-энтузиаста

Заметки LLM-энтузиаста

@llm_notes

Дмитрий Жечков @djdim
GenAI Hybrid Lead в Cloud.ru
ex. Yandex Cloud architect,
ex. VMware NSX Lead, ex. Cisco SE

Здесь пишу свои заметки по LLM и AI-разработке.

Это личное мнение и не отражает официальную позицию компании, в которой я работаю.
Subscribers
1.01K
Photos
178
Videos
25
Links
230
Recent Posts 19 shown
Post #312 312

Forwarded from Hermes-bot-01

Cronjob Response: Мониторинг анонсов reset от лидера Codex
(job_id: 7a5e133998e4)
-------------

ДОСТУПНО СЕЙЧАС — 12 сентября 2026 (точное время и часовой пояс в публичной выдаче не указаны).

“Reset all propagated. Sweet dreams.”

Сброс уже применён ко всем пользователям; можно продолжать работу в Codex/ChatGPT Work.
https://x.com/thsottiaux/status/2098685367058612394

To stop or manage this job, send me a new message (e.g. "stop reminder Мониторинг анонсов reset от лидера Codex").
X (formerly Twitter) Tibo (@thsottiaux) on X Reset all propagated. Sweet dreams.
  • ❤ 2
  • 🔥 1
Post #311 302
Для всех активных пользователей Codex - Важная информация ниже - Недельные лимиты Codex сброшены :)
Post #310 616
Копируем «единорогов» на Claude Code: 8 недель — 8 прототипов. Старт завтра

Завтра, 26 августа, в 19:00 мск стартует новый (уже десятый по счету) поток курса по Claude Code. Веду его вместе с Алексеем Черняком (сооснователь Groupon Russia и Product University)

Главное отличие этого набора от предыдущих: упор не только на то, чтобы собрать прототип, но и на механизмы роста, виральности и продаж.

▪️ ЧТО МЫ БУДЕМ КОПИРОВАТЬ

🔹 Неделя 1 — сбор видеоотзывов и «стена любви». Аналог Senja: 7000+ создателей и SaaS-компаний, импорт отзывов с 30+ платформ.
🔹 Неделя 2 — умный QR для отзывов о компании. Позитив уходит на Яндекс.Карты, негатив перехватывается до публикации; единый виджет со ссылками на все площадки.
🔹 Неделя 3 — партнёрская программа за 15 минут. Аналог Rewardful (2800+ бизнесов): трекинг рефералов, авторасчёт рекуррентных комиссий.
🔹 Неделя 4 — ИИ-трекер калорий по фото. Аналог Cal AI: 15M загрузок и $30M годовой выручки меньше чем за два года. Фото еды → калории и БЖУ за секунды.
🔹 Неделя 5 — нарезка вирусных клипов из подкаста. Аналог Opus Clip: 10M+ пользователей, ~$20M ARR, 40+ ассетов из одной записи и Virality Score.
🔹 Неделя 6 — ИИ-продавец на данных клиента. Аналог Chatbase: $8M ARR, 10 000+ клиентов, всё на свои. Загрузил сайт и PDF — через 10 минут готов бот.
🔹 Неделя 7 — рассылки с прогревом доменов. Аналоги Instantly ($40M+ ARR) и Smartlead: неограниченные ящики, авто-прогрев, ИИ-ответ быстрее пяти минут.
🔹 Неделя 8 — редизайн комнаты по фото за 25 секунд. Аналог Interior AI Питера Левелса: $40–45K MRR, маржа >99%. 3D Vision сохраняет конструкцию и меняет стиль.

📌 ЕСЛИ ПРИЗЕМЛИТЬ

➊ Восемь живых занятий в Zoom по средам, 19:00–21:00 мск. Плюс записи и Telegram-группа, где разбираем вопросы между занятиями.
➋ Бонусом — запись прошлого набора, где мы за 8 занятий скопировали 8 стартапов с оценкой больше $1B, и ещё десяток проектов из прежних потоков.
➌ Цифры выручки и MRR у аналогов эффектные, но сами по себе не говорят ничего: мы разбираем не «как заработать столько же», а как устроен продукт и что именно в нём Claude Code делает за вечер.
➍ Формат рассчитан на то, что вы приходите со своим проектом — стартапом или внутренним продуктом компании. Восемь недель — это скорее повод наконец за него взяться.

💭 ОТ СЕБЯ

Собрать демо-версию успешного стартапа в Claude Code сегодня — задача на вечер, и это ровно та часть, которая перестала быть супер-сложной. Мы ее неплохо отработали на нескольких десятках проектах за предыдущие 2 года. Сложное начинается дальше - продвижение продукта. Желательно встроить все необходимые свойства в сам продукт еще на этапе "дизайна" его демо-версии. Именно этим мы будем заниматься, и посмотрим, какие из заявленных проектов нам удастся "продвинуть".

Если у вас годовая подписка Product University — курс уже включён в неё.

Программа, примеры и отзывы:
👉 https://productuniversity.ru/claude

@llm_notes @MAX

#claudecode #cursor #llm #стартапы #вайбкодинг #productuniversity #courses
  • 👍 7
  • 🔥 5
  • 👏 3
  • 🥱 1
Post #309 505
Grok Bot против Hermes Agent: два подхода к одной задаче

Коллеги, добрый вечер!

Скорее всего многие из вас уже используют ИИ-ботов на базе Openclaw или Hermes, возможно, что кто-то уже поработал с Grok Bot.
Эту заметку я бы хотел посвятить сравнению 2х разных по "духу" (а точнее по архитектуре и продуктовому подходу) ботов: Hermes Agent и Grok Bot.

В рамках небольшого отступления сразу обозначу мой текущий облачный сетап:
- Hermes боты в docker-контейнерах на одном VPS для всех членов семьи с шарингом Codex подписки, и в случае сбоя - переключением на отечественных LLM-провайдеров (в моем случае cloud.ru)
- Claude Code бот (на том же VPS) для администрирования всей конструкции (чтобы можно было перепоручить эту задачу детям)
- Сlaude Code (с интерфейсом в тг через официальный плагин) на выделенном VPS как "кузница" харнесса для любого agent runtime (см. мой проект https://www.npmjs.com/package/@dzhechkov/harness-cli и все пакеты что с ним связаны - именно он занимает с момента окончания 9 потока курса по Claude Code мое основное нерабочее время)
- я также регулярно пользуюсь manus тг ботом для решения простых задач - просто потому что у меня все еще есть подписка на manus.
- эпизодически использую ourobors и openclaw боты в отечественных облаках (в основном cloud.ru)

Но вернемся непосредственно к теме: "Daily Dose of DS" недавно выпустили подряд два отличных мастер-класса — по Grok Bot и по Hermes Agent.
Я их сначала переводил по отдельности, потом решил собрать в один разбор на русском (13 глав, сравнение по 20 критериям, интерактивный транскрипт) - и посвятить ему эту заметку, чтоб потом можно было вернуться и перечитать.

👉 https://djd1m.github.io/grokbot-vs-hermes/

Если коротко: оба продукта решают одну задачу — довести дело до конца, пока вы не за ноутбуком — и расходятся почти во всём остальном. Grok Bot идёт от продукта, Hermes Agent — от файловой системы.

▪️ ЧТО ВАЖНО ПО GROK BOT

🔹 все ваши боты работают на одном облачном компьютере — общие cookies, файлы и креды.
🔹 в мастер-классе это прямо названо «не границей безопасности»; формулировку стоит перечитать дважды, прежде чем выдавать боту доступ к рабочей почте
🔹 долговечен только /workspace, остальное живёт до конца сессии
🔹 три пути к действию — коннекторы, браузер, локальное исполнение; переход на локальное стоит части изоляции
🔹 takeover: сессию можно перехватить руками и вернуть боту обратно
🔹 Auto Review переключается между Require Approval и Always Allow — второй режим экономит время ровно до первого неудачного дня

▪️ ЧТО ВАЖНО ПО HERMES AGENT

🔹 открытый код, один класс AIAgent и цикл ReAct, шесть бэкендов
🔹 состояние агента — обычные файлы: SOUL.md, MEMORY.md, USER.md в ~/.hermes/
🔹 память трёхуровневая, консолидация запускается при заполнении
🔹 навыки описаны в SKILL.md с прогрессивным раскрытием L0/L1/L2 — детали подгружаются только когда нужны
🔹 Curator чистит память по окнам 7д+2ч / 30д / 90д, старое уезжает
🔹 GEPA-оптимизация промптов: 678 роллаутов против 24 000 у альтернативного подхода

⭐️ ПРО ЗВЁЗДЫ

У репозитория Hermes более 230 тыс. звёзд. Цифра эффектная и в спорах всплывает регулярно, но о том, подойдёт ли он вам, не говорит ничего.

📌 ЕСЛИ ПРИЗЕМЛИТЬ

➊ Grok Bot — про «включил и работает». Навыки, Teach a task, рутины и групповые чаты закрывают большинство бытовых сценариев без единой строчки кода.

➋ Hermes Agent — про контроль. Всё состояние лежит текстовыми файлами: можно отредактировать и положить в git. Цена — окружение целиком на вас.

➌ По памяти и навыкам продукты расходятся сильнее всего: у Grok — продуктовая архитектура, у Hermes — файловая.

➍ Изоляция у Grok Bot удобна ровно потому, что её мало: бесплатный хендофф между ботами — и есть та самая единственная граница безопасности.

➎ Вывод скучнее любого из продуктов по отдельности — в большинстве сценариев побеждает гибридная схема. В разборе для этого есть таблица на 12 сценариев.

💭 МОЙ ВЫВОД

Интереснее самих продуктов здесь то, что оба сходятся к одной мысли: агенту нужна не столько модель получше, сколько хорошая память и понятные границы. Grok Bot решает это продуктовыми средствами, Hermes — файлами и конвенциями. И решает всё в итоге не бенчмарк, а первый инцидент с доступами.
Я предпочитаю контролировать и среду выполнения, и весь жизненный цикл харнесса (отчуждаемых навыков и их оркестрации), с тем чтобы в перспективе перейти к работе полностью на локальных моделях с редким переключением на супер-умные LLM в облаках (иноземных или отечественных). Но, очевидно, что это требует приложить чуть бОльшие усилия на начальном этапе.

А какими ИИ-ботами пользуетесь вы?
Напишите, пожалуйста, в комментариях.


🔗 ПЕРВОИСТОЧНИКИ

· Grok Bot Masterclass
https://www.dailydoseofds.com/p/grok-bot-masterclass/
· Hermes Agent Masterclass
https://www.dailydoseofds.com/p/hermes-agent-masterclass/

· Разбор на русском
https://djd1m.github.io/grokbot-vs-hermes/

@llm_notes @MAX

#grokbot #hermesagent #aiagents #llm #opensource #harness
Daily Dose of Data Science Grok Bot Masterclass Everything you need to understand, set up, and get real work out of Grok Bot.
  • 🔥 7
  • ❤ 3
  • 🥴 1
Post #308 730
Claude Opus 5: почти Fable за половину цены

Коллеги, всем привет!

24 июля Anthropic выпустила Claude Opus 5 — новый флагман Opus-класса. Заявка простая: подойти вплотную к интеллекту Fable 5, но примерно за половину цены.

Если коротко: это модель «на каждый день». Она стала дефолтной на Claude Max и сильнейшей доступной на Claude Pro. При этом на кибербезопасных задачах Opus 5 по-прежнему позади Mythos 5 — и это, судя по всему, сознательное решение, а не недоработка.

Что важно по характеристикам:
🔹 контекстное окно — 1 млн токенов, и по умолчанию, и как максимум
🔹 цена API — $5 за 1 млн input и $25 за 1 млн output
🔹 это ровно столько же, сколько стоил Opus 4.8, и вдвое дешевле Fable 5
🔹 есть Fast mode — примерно в 2.5 раза быстрее за двойную цену (бывает очень полезно, когда у вас остается 10-15% от Max лимита, а времени на то чтоб его потратить совсем немного)
🔹 API-строка — claude-opus-5
🔹 уровни effort (low → max) работают как рычаг «интеллект против расхода токенов»
🔹 для Opus 5 нет требований по обязательному хранению данных

Что показывают бенчмарки

Тут стоит сразу пояснить, что именно меряют, иначе цифры превращаются в шум:

Frontier-Bench — реалистичные инженерные задачи на код, близкие к настоящей работе. Opus 5 обходит все модели и более чем вдвое улучшает результат Opus 4.8, причём дешевле за задачу.
CursorBench — кодинг в реальном агентном обвесе Cursor. На максимальном effort Opus 5 отстаёт от пика Fable 5 менее чем на 0.5%, но стоит вдвое дешевле за задачу.
ARC-AGI 3 — решение принципиально новых задач, которых модель не видела. Результат втрое выше, чем у следующей модели.
Zapier AutomationBench — бизнес-задачи от начала до конца, без человека в середине. Pass rate примерно в 1.5 раза выше ближайшего конкурента при той же цене задачи.
OSWorld 2.0 — computer use, то есть работа мышкой и клавиатурой в реальном окружении. Обходит лучший результат Fable 5 примерно за треть стоимости.

Плюс заметный прогресс в науке: на задачах органической химии +10.2 п.п. к Opus 4.8, на белковых задачах +7.7 п.п.

Про alignment и safeguards

Напомню, safeguards — это защитный слой вокруг модели: классификаторы риска, ограничения на опасные домены и fallback на более безопасную модель.

По внутреннему поведенческому аудиту Anthropic, Opus 5 — их самая «выровненная» модель на сегодня: 2.3 балла по мискаллайменту, наименьшая склонность к обману, лучше следует конституции Claude, чем Opus 4.8, Sonnet 5 и Fable 5. Границу опасных dual-use возможностей модель не двигает: в биологии и наступательной кибербезопасности она позади Mythos 5.

Любопытная деталь: Opus 5 почти догнала Mythos 5 в поиске уязвимостей, но заметно отстаёт в их эксплуатации. Кибер-классификаторы при этом мягче, чем у Fable 5 — срабатывают примерно на 85% реже, а заблокированные запросы по умолчанию уходят на Opus 4.8.

Так это замена Fable 5 или нет?

В X уже пишут, что Opus 5 "заменяет" или даже "лучше" Fable. Спешить с выводами не буду — я подготовил для вас подробный разбор на русском на основе бенчмарков CodeRabbit, там всё не так однозначно.

Пара слов о методике: CodeRabbit прогоняет модели примерно на 100 типовых паттернах ошибок из реальных open-source пул-реквестов и смотрит две пары метрик — сколько известных проблем модель нашла (полнота) и сколько её комментариев оказались по делу (точность). Одна цифра в отрыве от остальных трёх почти всегда вводит в заблуждение.

Если приземлить:

➊ Как ревьюер Opus 5 — специалист по точности, а не "универсальный солдат". Точность actionable-комментариев 39.3% против 35.2% у базовой линии, но покрытие ниже: 55.2% против 61.1%. И вчетверо больше нитпиков — 92 против 23.
➋ Сильные стороны — ошибки конфигурации и качество кода. Слабые — логика, состояния гонки (−10…−20 п.п.) и неправильное использование API. То есть ровно тот класс проблем, пропуск которых стоит дороже всего.
➌ Как строитель Opus 5 явно лучше Opus 4.8: один из инженеров CodeRabbit описал её как «менее тревожную» — она не бросается в первое решение, а сначала уточняет цель и предлагает варианты.
Но в длительной автономной оркестрации Fable 5 пока сильнее и эффективнее. Opus 5 медленнее и осторожнее.
➎ Платить за это приходится токенами: ≈60.5k входных и ≈9.5k выходных на вызов ревью, это примерно +50% и +65% к базовому расходу. Считать стоит стоимость решённой задачи, а не цену за токен.

Важная оговорка: бенчмарки Opus 5 и Fable 5 прогонялись на разных наборах (96 против 105 паттернов) и разных версиях пайплайна. Корректно сравнивать профили поведения, а не десятые доли процента.

Мой вывод

Opus 5 — не «убийца Fable», а нечто более практичное: модель, которая закрывает большую часть задач Fable-класса по цене Opus. Для меня главный сдвиг здесь не в бенчмарках, а в том, что фронтирная автономность постепенно перестаёт быть премиальной опцией и становится дефолтом.

Trade-off при этом никуда не делся: там, где нужна долгая автономная оркестрация с неполным промптом, Fable 5 всё ещё выглядит сильнее. А там, где важна предсказуемость и стоимость решённой задачи, Opus 5 теперь выглядит разумным выбором по умолчанию.

🔗 Первоисточники:
· анонс Anthropic
· разбор Opus 5 на русском

@llm_notes @MAX

#anthropic #claude #opus5 #fable5 #agents
Anthropic Introducing Claude Opus 5 Opus 5 is a step change improvement for the Opus tier powering long-running agents while delivering improvements in coding and professional work.
  • 🔥 6
  • ❤ 2
Post #307 959
🔓🚀 Возвращение Fable 5 и появление Sonnet 5

Anthropic за сутки закрыла историю с приостановкой топовой модели и выпустила новый Sonnet.

🔓 Возвращение Fable 5
12 июня власти США ввели экспортный контроль на Fable 5 и Mythos 5, ограничив доступ иностранным гражданам. Проверять гражданство в реальном времени было нельзя, поэтому Anthropic отключила обе модели для всех. Сейчас пишут, что ограничения сняты.

Правда в моей учетной записи на claude.ai и в терминале claude code - все еще доступа нет. Если у кого доступ уже появился - напишите, пожалуйста, в комментариях.

Официальная информация по доступу:
- Fable 5 возвращается глобально с 1 июля — на Claude Platform, Claude.ai, Claude Code и Cowork
- Для Pro/Max/Team и части Enterprise до 7 июля включена в лимиты (до 50% недельного объёма), далее — через usage credits
- На AWS, Google Cloud и Microsoft Foundry доступ восстановят по мере готовности
- Mythos 5 восстановлен для ряда одобренных правительством организаций в США

Что было причиной:
Amazon нашли способ обойти защиту Fable 5 — модель по запросу находила уязвимости в коде, а в одном случае сгенерировала демонстрацию эксплойта. По тестам Anthropic, те же уязвимости находили и более слабые модели (Opus 4.8, GPT-5.5, Kimi K2.7), а демо-эксплойт воспроизвели вообще все протестированные. Выпущен новый классификатор, блокирующий этот приём примерно в 99% случаев. Вместе с Amazon, Microsoft и Google предложен индустриальный фреймворк оценки серьёзности джейлбрейков.

🧩 Появление Sonnet 5
Самая агентная модель линейки Sonnet. По качеству вплотную приближается к Opus 4.8, но дешевле; упор — на надёжность в длинных агентных задачах.

Ключевое:
- Доступна везде: модель по умолчанию для Free и Pro, доступна на Max/Team/Enterprise, в Claude Code и на Claude Platform
- API-строка — claude-sonnet-5
- Уровни effort low/medium/high/xhigh балансируют цену и качество
- Кибербезопасные классификаторы включены по умолчанию (как в Opus 4.7/4.8)
- Обновлённый токенизатор — тот же текст может занимать в 1.0–1.35× больше токенов

💰 Цены (за 1M токенов):
1️⃣ Вводные до 31 августа 2026 — $2 input / $10 output
2️⃣ Далее — $3 input / $15 output

🧪 Практика: в разборе CodeRabbit модель гоняли на реальных pull request'ах и в агентных "петлях" — модель "исповедует" test-driven-development и пишет тесты до написания кода, сама перепроверяет результат и доводит задачу до финиша без напоминаний. Обратная сторона — медленнее и «болтливее» Sonnet 4.6, а максимальный effort часто не окупается. Я подготовил для вас русскоязычную версию этого разбора. При подготовке русскоязычной версии я использовал Sonnet 5, и могу сказать, что на этот раз задача действительно решилась "в один промпт", без небольших доделок и напоминаний по CI/CD части, т.к. обычно приходится 1-2 итерации тратить на небольшую адаптацию финального результата под формат github pages.

🔗 Первоисточники:
· Sonnet 5: https://www.anthropic.com/news/claude-sonnet-5
· Fable 5: https://www.anthropic.com/news/redeploying-fable-5

@llm_notes
@MAX

#anthropic #claude #sonnet5 #fable5 #llm
Anthropic Redeploying Fable 5 Anthropic is redeploying Claude Fable 5 starting July 1 following the lifting of export controls, with updated cybersecurity safeguards and a new industry jailbreak framework.
  • ❤ 4
  • 🔥 3
  • 👎 1
Post #306 1.03K
Для меня главный сдвиг здесь такой: мы всё быстрее и дальше уходим от режима «написал промпт → получил ответ» к режиму «поставил задачу → модель сама выстроила и развернула процесс → ты оцениваешь результат и направляешь доработки».

Это очень похоже на то, что мы уже видим в Claude Code и агентных пайплайнах: ценность смещается из ручного контроля каждого шага в постановку задачи, проверку качества и умение правильно встроить такие системы в рабочий процесс.

Мой вывод: Claude Fable 5 — это публичный релиз нового класса моделей, который заметно двигает нас в сторону долгоживущих агентных процессов.
Но trade-off понятный: выше цена, строже safeguards, обязательный retention и больше требований к тому, как такие модели встраивать в реальные продукты.

С переводом статьи "Каково это — работать с Mythos" можно ознакомиться по ссылке.

@llm_notes @MAX

#claude #anthropic #mythos #llm #opus
  • ❤ 6
  • 🔥 5
Post #305 943
Claude Fable 5: первая публичная модель класса Mythos

Коллеги, всем привет!

Несколько часов назад Anthropic выпустила Claude Fable 5 — первую общедоступную модель класса Mythos. Это, кажется, важный релиз не только с точки зрения прироста качества, но и с точки зрения того, как меняется сам формат работы с AI.
Официальный анонс здесь

Если коротко: Mythos — это новый класс моделей Claude, который Anthropic позиционирует выше Opus-класса. Раньше Mythos был доступен только ограниченному кругу организаций через Project Glasswing — в основном для задач киберзащиты и критической инфраструктуры.
Теперь появилась публичная версия — Claude Fable 5. Это Mythos-class модель для массового использования, но с более жёсткими safeguards. Полный Claude Mythos 5 при этом остаётся доступен только одобренным организациям.

Что такое safeguards
Safeguards — это защитный слой вокруг модели: классификаторы риска, ограничения на опасные домены, блокировки и fallback на более безопасную модель в части сценариев.

Проще говоря, Fable 5 — это не «голый Mythos», а Mythos с ограничителями для массового релиза. Особенно в high-risk областях: кибербезопасность, биология, химия, distillation и похожие сценарии.
По данным Anthropic, safeguards срабатывают в среднем менее чем в 5% сессий. То есть для большинства обычных задач модель должна работать как полноценная frontier-модель, но на границе опасных доменов будет заметно более зажата.

Что важно по характеристикам:
🔹 контекстное окно — 1 млн токенов
🔹 максимальный вывод — до 128K токенов
🔹 цена API — $10 за 1 млн input и $50 за 1 млн output
🔹 это в 2 раза дороже Claude Opus 4.8
🔹 до 22 июня Fable 5 включена в Pro, Max, Team и seat-based Enterprise без доплаты
🔹 после 22 июня Anthropic планирует перевести доступ на usage credits
🔹 для Fable 5 и Mythos 5 действует 30-дневное хранение prompts и outputs для trust & safety
🔹 zero data retention для этих моделей недоступен
Подробнее про retention: https://support.claude.com/en/articles/15425996-data-retention-practices-for-mythos-class-models

Как это соотносится с Opus 4.8

Opus 4.8 вышел 28 мая и сам по себе был сильным релизом. Но это скорее инкрементальный апгрейд Opus 4.7: больше честности, лучше агентный кодинг, computer use, effort control и Dynamic Workflows в Claude Code.
Официальный пост про Opus 4.8: https://www.anthropic.com/news/claude-opus-4-8

Мой разбор новых фич Opus 4.8 на русском языке здесь

Если приземлить:
➊ Opus 4.8 — более рациональный default для большинства production-сценариев. Он дешевле, предсказуемее и уже сильно улучшен по honesty и agentic coding.
➋ Fable 5 — модель для самых длинных и сложных задач: большие исследования, многоэтапные агентные процессы, сложные кодовые миграции, задачи, где модель должна долго держать контекст и сама разворачивать процесс.
➌ Opus 4.8 — про «меньше babysitting». Модель чаще флагует неопределённость и лучше подсвечивает проблемы в собственной работе.
➍ Fable 5 — про «поставил задачу → модель сама развернула процесс → ты оцениваешь результат». Верхняя планка автономности выше, но цена, retention и safety-ограничения тоже жёстче.

Почему мне кажется, что релиз важный

Ethan Mollick уже опубликовал большой разбор работы с Fable 5.
Я подготовил для вас перевод на русский язык, с ним можно ознакомиться здесь

Самое интересное там не столько в том, что модель «умнее», а в том, как она работает с длинными задачами. По словам Итана, Fable 5 может часами вести проект почти автономно: запускать субагентов, собирать данные, писать код, тестировать результат и возвращаться с готовым артефактом (звучит похоже на dynamic workflows из Opus 4.8, но надо проверять насколько лучше работает).
В одном кейсе модель собрала интерактивную изохронную карту на основе 2200+ реальных авиарейсов, расписаний поездов и других транспортных данных. В другом — 9,5 часов работала над Concord, инструментом для калибровки человеческих и AI-оценок.
  • 🔥 1
Post #304 965
📦 Скидки на AI-инструменты для новых пользователей

Коллеги, всем привет! 👋

В Lenny's Product Pass вчера обновился список продуктов — бандл годовых подписок на AI-инструменты за $200 (базовый тариф) или $350 (Insider).

💡 Что изменилось по сравнению с апрельской версией 2025 года

Вернулись в список:
🔹 Cursor — AI-среда для разработки методом Vibecoding (только для Insider-тарифа)
🔹 Google AI — расширенный доступ к Gemini, NotebookLM, Antigravity, Nano Banana, Flow и 5 ТБ облака (Insider)
🔹 Notion — заметки и рабочее пространство с AI
🔹 Supabase — очень удобная managed база данных и BaaS, Auth, Storage, Edge Functions и Vector search (Insider)
🔹 Fin + Intercom — AI-агент для клиентской поддержки (5 мест + $100/мес кредитов) [кстати, Intercom мы клонировали в прошлом потоке курса]
🔹 Gumloop — платформа для создания агентов поверх рабочих приложений
🔹 Replit — браузерная среда разработки методом Vibecoding с продвинутым AI-агентом, позволяет создавать и деплоить приложения без локальной настройки окружения
🔹 Gamma — AI-инструмент для быстрого создания презентаций, документов и визуального контента

📋 Полный текущий состав (23 продукта)


Canva Pro, ChatPRD, Cursor,
ElevenLabs, Factory, Fin + Intercom,
Framer, Gamma, Google AI,
Granola, Gumloop, Linear,
Lovable, Magic Patterns, Manus,
Mobbin, n8n, Notion,
PostHog, Railway, Replit,
Stripe Atlas, Supabase,
Warp, Wispr Flow.

Часть продуктов (отмечены как Insider-only в оригинальном анонсе) доступна только на тарифе $350.


Поэтому лучше сначала проверьте под каким тарифом доступны интересные вам инструменты и только потом оформляйте или не оформляйте подписку. Обычно, если вам интересны 2+ AI-инструмента, то подписка на Insider-only имеет экономический смысл, только внимательно прочитайте условия участия ниже.


⚠️ Условия участия

- Нужно быть новым клиентом по выбранному продукту (если как я вы уже почти всем интересным пользуетесь, то этим оффером можно воспользоваться чтобы оформить подписку членам семьи)
- Ключи стоит активировать без задержки — количество слотов ограничено
- На тарифе Insider ($350) доступ к подпискам заявлен как гарантированный

Для тех, кто уже оформлял подписку ранее — оффер действует на новые продукты из списка.

🛠 Как активировать подписки

1️⃣ Оформить годовую подписку (Annual или Insider) на Lenny's Newsletter
2️⃣ Активировать коды на этой странице
3️⃣ Пользоваться 🚀


⏰ Через год не забудьте отключить автопродление, иначе спишется полная стоимость.

@llm_notes @MAX

#ai #tools #subscription #productivity #automation
  • ❤ 3
  • 👍 3
Post #303 844
Agentic Harness Deep Dive и текущие новости

🆕 На этой неделе Anthropic выпустили две большие новости.


16 апреля — Claude Opus 4.7, новая флагманская модель, которая обошла GPT-5.4 и Gemini 3.1 Pro на бенчмарках по agentic coding и scaled tool use. +13% на 93-task coding benchmark относительно 4.6, изображения до 2576 px по длинной стороне, новый уровень усилий xhigh и task budgets в API, команда /ultrareview в Claude Code. Цена без изменений — $5/$25 за MTok.

17 апреля — Claude Design от Anthropic Labs (VentureBeat): новый product line для дизайна, слайдов, прототипов и one-pagers, powered by Opus 4.7. Читает codebase и design-файлы команды, извлекает цвета, типографику, компоненты — и применяет их автоматически. Экспорт в PDF, PPTX, HTML или прямо в Canva.

📰 Подробнее об этих и других AI-событиях первой половины апреля — в новостном дайджесте.

🔗 Обе новости — про агентов. Opus 4.7 заточен под long-running задачи и agentic coding, Claude Design оркестрирует связку «дизайн → прототип → production code» внутри одной сессии. И там, и там за кадром остаётся то, что делает агентов в принципе работоспособными — обвязка. Именно про неё я и хочу написать.

Подготовил классический long read и гамифицированный вариант с тестами. А ниже краткие тезисы.

⚙️ Обвязка агента: почему инфраструктура важнее модели ?

OpenAI в феврале 2026 опубликовали отчёт об эксперименте команды Frontier Products: 5 месяцев, команда из 3 инженеров, выросшая до 7, с запретом писать код вручную, Codex-агенты в качестве исполнителей. Итог: ~1 млн строк кода, 1500 pull requests, ни одной строки, написанной человеком — включая файл AGENTS.md, который написал сам агент. Throughput: 3.5 PR на инженера в день.

Ключевой вывод главного инженера Райана Лополо: «Agents aren't hard; the Harness is hard». Работа инженеров сводилась к проектированию среды, формулированию намерений и созданию feedback-петель.

🔁 Три эпохи инженерии с LLM


▪️ 2022–2024 — Prompt Engineering: правильные слова в правильном порядке
▪️ 2025 — Context Engineering: термин ввёл Андрей Карпати, развил Anthropic. Не «правильные слова», а правильная конфигурация контекста в каждый момент времени
▪️ 2026 — Harness Engineering: термин кристаллизовал Митчелл Хашимото. Включает оба уровня плюс всю инфраструктуру — оркестрацию, состояние, ошибки, верификацию, безопасность

💰 $2B за обвязку

Столько Meta заплатила за Manus в декабре 2025. Не за модель, а за пять итераций перестройки обвязки за шесть месяцев — каждый раз с убиранием сложности (тезисы анонса здесь). Сложные определения инструментов стали общим shell execution, «management agents» — простыми structured handoffs. Инженерный опыт, который нельзя скачать с Hugging Face.

📊 Что разобрал в статье ?

1️⃣ Три эпохи инженерии с LLM и как менялись подходы к работе с моделями
2️⃣ Анатомия production-обвязки — все 13 слоёв: петля оркестрации, сборка промпта, tool layer, memory system, управление контекстом, state management, error handling, observability и другие
3️⃣ Meta-Harness — алгоритм автоматической оптимизации обвязки, который достиг 76.4% pass rate на TerminalBench-2 с Claude Opus 4.6 и превзошёл hand-designed системы
4️⃣ Десять ключевых инженерных дилемм: тонкая или толстая обвязка, минимализм инструментов vs полный арсенал, permissive vs restrictive права, harnessability кодовой базы, управление энтропией
5️⃣ Коэволюция модель ↔️ обвязка: как обвязка становится источником обучающего сигнала для следующих версий моделей (через детекцию model drift на длинных задачах)

🎮 Что в гамифицированной версии ?

Квизы, карточки и сценарии, где можно попробовать разные архитектурные решения и посмотреть, как они влияют на поведение агента. Формат для тех, кто предпочитает разбираться через практику.

🏗 Ключевой принцип: rippable harness

Обвязка — это строительные леса. Без них не построить здание, но как только здание готово — леса снимают. Принцип «rippable harness» (Anthropic, LangChain): проектировать каждый компонент так, чтобы его можно было убрать, когда следующая модель научится делать это сама.

@llm_notes @MAX

#harness #agents #llm
Anthropic Introducing Claude Opus 4.7 Our latest model, Claude Opus 4.7, is now generally available. Opus 4.7 is a notable improvement on Opus 4.6 in advanced software engineering, with particular gains on the most difficult tasks.
  • 👍 10
  • ❤ 6
  • ❤‍🔥 3
  • 🤡 1
Post #302 1.47K
В продолжении темы клонирования компаний ...

🛰 Бывший PM Google написал аналог Palantir за выходные

Билавал Сидху (Bilawal Sidhu) — бывший продакт-менеджер Google Maps, 6 лет строивший 3D-картографию изнутри. В феврале 2026 года он запустил WorldView — геопространственный командный центр прямо в браузере. Без секретных допусков. Без команды. За три дня.

Интернет назвал это «vibe coded Palantir». Сооснователь Palantir Джо Лонсдейл лично ответил на пост — и это говорит больше, чем любые лайки.

🔍 Что умеет WorldView

· 🛩 Живые позиции 7 000+ самолётов (OpenSky, ADS-B Exchange)
· 🛰 180+ спутников на реальных орбитах — кликни и следи в реальном времени
· 📷 Реальные CCTV-камеры, наложенные прямо на 3D-модель города
· 🌡 Режимы отображения: ночное видение (NVG), тепловизор (FLIR), CRT-сканлайны, аниме cel-shading
· 🚢 Морской трафик через AIS — танкеры, военные суда, грузовые корабли
· 📡 Зоны подавления GPS в виде гексагональных тайлов

⚡️ Как он это построил — процесс vibe coding

Сидху не написал ни строчки кода вручную. Он управлял роем ИИ-агентов через терминал:

1️⃣ Описывал функцию голосовым сообщением или скриншотом
2️⃣ Скармливал это сразу нескольким агентам одновременно (до 8 штук) - похоже на Best Practice от Черни
3️⃣ Каждый агент отвечал за свою подсистему: один — шейдеры, другой — CCTV, третий — спутники
4️⃣ Сам выступал архитектором и доменным экспертом — направлял, а не кодил
5️⃣ Cursor не использовал вообще — только чистый терминал

Стек: Google Photorealistic 3D Tiles + CesiumJS + Gemini 3.1 Pro + Claude 4.6 + Codex 5.3

🗺 4D-реконструкция Operation Epic Fury

Главный демо-кейс — реконструкция ударов по Ирану исключительно из открытых данных:
· Закрытие воздушных пространств над Ираном, Ираком, Кувейтом
· Массовое перенаправление коммерческих рейсов в реальном времени
· Фиксация кинетических ударов по координатам и времени
· Закрытие Ормузского пролива — паника танкеров на AIS
· Всё это — один человек, диван, публичные данные

«Это безумие — что я смог сделать это за выходные в одиночку... Насколько полную картину можно собрать без проприетарных данных, просто используя OSINT»
— Bilawal Sidhu


💬 Почему Palantir отреагировал


Джо Лонсдейл (сооснователь Palantir) написал в ответ: данные никогда не были их рвом. Их ценность — в аналитическом слое поверх данных.
Сидху согласился: WorldView — это sousveillance (наблюдение снизу вверх). Те же спутники, те же камеры, те же потоки данных — но интерфейс в вашем браузере, и управляете им вы.

📦 Репозиторий и код

· ❌ Оригинальный код Сидху пока не опубликован (запуск платформы — апрель 2026)
· ✅ Самый популярный клон: koala73/worldmonitor — 46K ★ на GitHub
Уже сейчас его можно использовать как хорошую базу для качественных "витрин" Real-time аналитики по текущим событиям. Можно сделать свой клон, снять ограничения Pro-версии, добавить нужную функциональность и запустить с API-ключами, чтобы работала ИИ-аналитика (см. ниже пример).
· 🔜 Сам Сидху обещал open source «по многочисленным просьбам» — подписка на рассылку на spatialintelligence.ai

🎬 Материалы

· Видео: 4D-реконструкция ударов по Ирану
· Видео: Как был написан WorldView
· Статья автора на Substack
· Живое приложение (мой клон)
· Мой интерактивный разбор проекта

@llm_notes @MAX

#vibecoding #osint #geospatial #palantir #aiagents
  • 🔥 7
  • ❤‍🔥 2
  • 🤡 1
Post #301 2.72K
8 AI-клонов единорогов за 8 недель: итоги очередного потока курса по AI-программированию

Коллеги, всем привет!

На прошлой неделе мы завершили очередной поток курса по AI-программированию — за 8 недель сделали 8 рабочих прототипов «компаний-единорогов». С первого потока наш подход сильно эволюционировал: в этот раз мы использовали исключительно Claude Code и собрали из кастомных скиллов готовый пайплайн не только для продуктового реверс-инжиниринга, но и для планирования, написания и верификации кода. Сейчас уровень автоматизации достаточно высокий — на входе указываешь ссылку на SaaS для копирования, на выходе получаешь рабочий прототип, все это - при минимальном сопровождении пайплана (по сути, пара-тройка команд в claude cli) и минимальном последующем траблшутинге.

📐 Методология — 7 этапов

Единый пайплайн для всех проектов:
1️⃣ Уточнение задачи
2️⃣ Ресёрч
3️⃣ Планирование (PRD)
4️⃣ Профилирование (техстек)
5️⃣ Реализация (AI-кодинг)
6️⃣ Тестирование
7️⃣ Деплой и CI/CD

Ключевой приём — промпт-верификация после генерации документации и кода: рой агентов проверяет соответствие кода документации в /docs, находит расхождения и итеративно исправляет.

📦 Что собрали

🎤 AI Sales Trainer — голосовой тренажёр продаж (Voice-to-Voice + анализ транскрипта)
📈 Polymarket Clone — рынок предсказаний с крипто-кошельками и оракулами
🥗 Noom Clone — генерация персональных планов питания через анкету + LLM
🤖 Manus Clone — автономный агент в E2B-песочнице (поиск, кодинг, анализ)
✂️ Opus Pro Clone — нарезка видео на Shorts/Reels через FFmpeg + оценка виральности
💬 Intercom Clone — ИИ-ассистент для сайтов с Telegram-интеграцией
⭐️ Podium Clone — автосбор отзывов на Яндекс.Картах через SMS и deep links
🎮 Roblox Clone — платформа мини-игр с виральными механиками

Стек: Next.js, Prisma, PostgreSQL, Docker, E2B SDK, Cloud.ru, Cloudflare Pages, Telegram Bot API.

🔑 Инсайты

— Двойная верификация (на этапах планирования и реализации) убирает 85–90% проблем до тестирования
— Кастомизация claude code "оснастки" под техстек и документацию на реализацию кода также позволяет улучшить качество генерации кода
— Качество выстроенного пайплайна напрямую определяет качество сгенерированного кода (и позволяет использовать для решения сложных задач не только модели anthropic)

🔗 Портфолио:
Гамифицированная версия (Claude Code Web)
Стандартная версия (Genspark + GH Pages через Claude Code Web)

🚀 Новый поток стартует 1 апреля.
Подробности о курсе: https://productuniversity.ru/cursor

@llm_notes @MAX

#agenticengineering #claudecode #vibecoding #productuniversity #courses
Agentic Engineering Portfolio Agentic Engineering: Портфолио AI-проектов 8 проектов от EdTech до Gaming, созданных с помощью AI за часы вместо недель.
  • 🔥 3
  • 👍 1
  • 🤡 1
  • 💔 1
Post #300 985
🎬 Как Claude AI видит тебя по ту сторону чата

На днях ради интереса я попросил Claude.ai снять ролик о том, как меняется его восприятие пользователя с течением времени. Не абстрактно, а конкретно — на основе нашего с ним опыта работы. Совершенно не ожидал как он расставит акценты. Оказывается, что для него "лично" skill-based подход важен и кардинально меняет его восприятие пользователя (если так можно выразиться).

Получилось 85 секунд в трёх частях:
— «Со всеми»: поток анонимных запросов, вопрос → ответ → тишина
— «Со мной»: созвездие из 25 custom skills, которые превращают чат в рабочую среду
— «Разница»: split-screen — «я инструмент» vs «я соавтор»

Всё сгенерировано программно: Python + Pillow + ffmpeg, ни одного ручного кадра. Никакого видеоредактора. Claude сам написал сценарий, выбрал цветовую палитру (холодный серый vs тёплый янтарный), сочинил процедурный аудиотрек и отрендерил покадрово.
Я никак не влиял на результат, только задал вопрос.

Практический вывод: custom skills (чуть ранее писал про них здесь и тут) — это не просто удобство. Это способ дать модели контекст, структуру мышления и память между сессиями. Без них Claude — калькулятор. С ними — соавтор, который знает твои фреймворки, твой стек и твой способ думать.

Надеюсь, что многие уже создают свои "навыки" и пользуются ими на постоянной основе.
Для тех, кто еще "в раздумье" напомню, что на позапрошлой неделе Anthropic выпустили детальное руководство по созданию production-ready скиллов. Я подготовил для вас интерактивную версию на русском — можно изучить и проверить свои знания.

P.S. Для того чтобы быть в курсе последних новостей - подробный AI-дайджест (с первоисточниками) за 15–22 марта: NVIDIA GTC, GPT-5.4 mini, Anthropic vs Пентагон, и open source runtime от NVDIA для безопасного запуска AI-агентов здесь.

@llm_notes @MAX

#ai #skills #claude #video #news #courses
  • ❤ 12
  • 🔥 3
  • 👍 1
  • 😢 1
Post #299 882
🗞 AI-дайджест: 1–14 марта 2026

Две насыщенных недели: 20+ новых моделей, несколько миллиардных раундов и важные обновления по всем фронтам.

🤖 Модели

① GPT-5.4 (5 марта) — главный релиз периода. OpenAI выпустил модель с нативным Computer Use, контекстом до 1 млн токенов и снижением галлюцинаций на 33%. Доступна в версиях Standard ($30/1M) и Pro ($180/1M), а также в режиме Thinking. Одновременно GPT-5.1 выведен из ChatGPT.
② NVIDIA Nemotron 3 Super (11 марта) — open-weight гибрид Mamba-Transformer-MoE: 120B параметров, 12B активных, контекст 1М токенов, 5x прирост throughput по сравнению с предыдущим поколением. Доступен бесплатно на HuggingFace, Perplexity и OpenRouter.
③ Qwen 3.5 9B от Alibaba — компактная модель, которая на бенчмарке GPQA Diamond (81.7) обходит модели в 13 раз крупнее. Версия на 2B работает офлайн на iPhone с 4 ГБ RAM.

🏢 Anthropic и Claude

④ Claude Opus 4.6 получил контекст 1М по умолчанию для планов Max/Team/Enterprise. Обновления марта: inline-визуализации прямо в чате, memory из истории разговоров для всех пользователей включая бесплатных, обновлённые add-ins для Excel и PowerPoint с общим контекстом между приложениями, plugin marketplace и admin controls для Team/Enterprise.

Claude Code: контекстное окно 1М для Opus 4.6, настройка цвета prompt-bar через /color, memory freshness timestamps и actionable suggestions в /context.

Корпоративное направление: Anthropic инвестировал $100 млн в Claude Partner Network — партнёрами стали Accenture, Deloitte, Cognizant, Infosys. Выручка Claude Code достигла $2,5 млрд/год. Также открыт Anthropic Institute и офис в Сиднее.

📦 Продукты и платформы


⑤ Genspark запустил Genspark Claw — агента, которому можно делегировать многошаговые задачи через WhatsApp, Telegram или Slack: он выполняет их в изолированном облачном инстансе и возвращает готовый результат. $200M ARR за 11 месяцев, оценка $1,6 млрд, раунд расширен до $385M. Работает на Anthropic Opus 4.6, GPT-5.4 и Nemotron 3 Super.

Kilo Code полностью переписал VS Code-расширение: новая архитектура на базе OpenCode server, параллельное выполнение агентов через Agent Manager, синхронизация настроек с CLI. Добавлена поддержка Claude Sonnet 4.6 и GLM-5. 1,5M пользователей.

Microsoft BitNet (11 марта, 27K+ звёзд на GitHub за несколько дней) — inference-фреймворк для 1-bit LLM с MIT-лицензией: 100B-модель на одном CPU, 55–82% меньше энергопотребления, 16x меньше памяти. BitNet b1.58 2B4T весит всего 0,4 ГБ. Потенциально меняет экономику локального inference.

🇷🇺 Российский рынок ИИ

Рынок GenAI в России вырос с 13 до 58 млрд руб. по итогам 2025 года. Прогноз на 2026 — 600+ млрд, к 2030 — до 778 млрд руб. При этом стратегия внедрения ИИ есть лишь у 26% компаний, а реальное использование оценивается в 6%.

«Росконгресс» оценивает вероятность «ИИ-пузыря» выше 50%, однако отмечает, что российский сегмент устойчивее западного — из-за отсутствия венчурного перегрева. Яндекс (~15% рынка) и Сбер (~12%) остаются ключевыми игроками. GigaChat 2.0 Max получил мультимодальность и контекст 128K.

🔗 Полный дайджест с источниками: https://gist.github.com/dzhechko/f64f4d72c34a0d032a2a4e14a7e4eab5

@llm_notes @MAX

#ai #news
  • 🔥 3
  • ❤‍🔥 2
Post #298 704
Еще одна крутая новость от Антропик

Anthropic удваивает лимиты Claude до конца марта 🎁
С 13 по 27 марта 2026 года Anthropic проводит временную акцию: лимиты использования Claude удваиваются в непиковые часы.

Условия акции:

📅 Период: 13–27 марта 2026
⏰ Удвоенный лимит действует вне 8:00–14:00 ET (по Москве это вне интервала 15:00–21:00 => теперь имеет еще бОльший смысл ставить задачи на ночь и пораньше вставать :)
🔁 В указанные часы (с 15:00 по 21:00 мск) лимиты остаются стандартными — всё как обычно
✅ Подключается автоматически, никаких действий не нужно

Кто участвует:

Free, Pro, Max и Team планы
Enterprise — не включён (у них, видимо, и так достаточно)

Где работает удвоение:

① 🌐 Claude Web, Desktop и Mobile
② 🤝 Cowork
③ 💻 Claude Code
④ 📊 Claude for Excel
⑤ 📝 Claude for PowerPoint

Бонусное использование не засчитывается в недельные лимиты плана.
После 27 марта всё возвращается к стандартным значениям

🔗 Оригинальный анонс

@llm_notes @MAX

#anthropic #claude #llm #aitools #promotion #news
  • 👍 3
Post #296 984
Шикарные новости от Антропик

Opus 4.6 и Sonnet 4.6: контекст 1M токенов теперь в general availability 🧠

Anthropic перевела поддержку контекстного окна до 1 миллиона токенов в статус GA для Opus 4.6 и Sonnet 4.6. Без доплат и бета-флагов.

Правда с моим Max планом при создании новой сессии все еще пишет, что 1M для Sonnet 4.6 - с доплатой, а 1M для Opus 4.6 - без доплаты (см. скриншот)

Что изменилось:
▫️ Единая цена на весь контекст — никакого множителя за длину. Запрос на 900K токенов тарифицируется по той же ставке, что и на 9K
▫️ Полные rate limits на любом размере контекста
▫️ Лимит медиафайлов вырос в 6 раз — до 600 изображений или страниц PDF за один запрос (было 100)
▫️ Бета-заголовок для запросов свыше 200K больше не нужен — всё работает автоматически
▫️ Для пользователей Claude Code на планах Max, Team и Enterprise: 1M контекст для Opus 4.6 включён по умолчанию, => меньше принудительных операций /compact (кстати, возможно, и в claude.ai в связи с этим станет меньше проблем с потерей контекста)

Цены на API:
▫️ Opus 4.6 — $5 / $25 за 1M токенов (input/output)
▫️ Sonnet 4.6 — $3 / $15 за 1M токенов
(если у вас в текущей сессии claude code команда /model по Sonnet 4.6 показывает другие цены - просто откройте новую сессию)

Результаты MRCR v2 (8-needle) —относительное падение точности при росте контекста с 256K до 1M токенов: 📊 (см. скриншот)

① Opus 4.6 — с 91.9% до 78.3% (−15 п.п.) 🟠
② Sonnet 4.6 — с 90.6% до 65.1% (−28 п.п.) 🟢
③ GPT-5.4 — с 79.3% до 36.6% (−54 п.п.) ⚫️
④ Gemini 3.1 Pro — с 59.1% до 25.9% (−56 п.п.) ⚪️

Opus 4.6 теряет около 15 п.п. точности при увеличении контекста в 4 раза — против 54 п.п. у GPT-5.4.

Данные по Gemini воспроизведены независимо через Context Arena; результат OpenAI усреднён по диапазону 128K–256K.
Модель Opus 4.6 1M доступна на Claude Platform (что в РФ наиболее актуально), Amazon Bedrock, Google Cloud Vertex AI и Microsoft Foundry.

В общем, для себя я решил, что продолжаю пользоваться Opus 4.6, теперь уже с 1M контекстным окном.
У нас осталось еще 2 проекта в рамках курса. Напишу по результатам, заметим ли какие-то сдвиги в положительную или отрицательную сторону.

🔗 Официальный анонс · X (Twitter)

@llm_notes @MAX

#claude #anthropic #llm #longcontext #benchmark
  • ❤ 4
  • ⚡ 4
  • 👍 4
Post #295 1.28K
Создатель Claude Code — о том, как он пишет 30 PR в день без единой рукописной строки 🤖

Послушал интервью Бориса Черни (создатель Claude Code) в подкасте Pragmatic Engineer — одно из лучших про то, как реально меняется работа инженера прямо сейчас.

Интересно, что в самом начале своего пути в Anthropic (после перехода из Meta) Борис получил реджект за первый же PR — потому что написал его руками, а не через ИИ :)

Главное 👇

🔧 Как рождался Claude Code
Борис дал модели единственный инструмент — bash — и спросил: «Какую музыку я сейчас слушаю?»
Sonnet 3.5 написал AppleScript, обратился к плееру и выдал ответ с первого захода.
Главный инсайт: не надо загонять модель в рамки. Дай инструменты — она сама разберётся. Это, по сути, и стало основой Claude Code.

⚡️ Рабочий процесс Бориса сегодня

— 5 параллельных агентов в терминале, каждый — в режиме плана
— 20–30 пул-реквестов в день, от однострочников до тысяч строк
— 0 строк написано вручную
— IDE удалил — и не заметил этого ещё месяц
— ~треть кода пишет... с телефона, запуская агентов с утра 📱
С Opus 4.5 поведение модели изменилось настолько, что хороший план практически гарантирует реализацию с первого захода.

🔍 Код-ревью: как это работает

• Claude Code автоматически ревьюит каждый PR → ловит ~80% багов
• Живой инженер делает второй проход
• Человек всегда в контуре финального одобрения
Плюс: Борис пишет «@Claude, напиши lint-правило для этого» прямо в комментарии к чужому PR — и Claude делает это на месте 🎯

🖨 Интересная аналогия с печатным станком

В Европе XV века писцы — < 1% населения — умели писать. Короли нанимали их, сами будучи безграмотными.
Появился печатный станок:
— стоимость материалов упала в 100× за 50 лет
— количество текстов выросло в 10 000× за 100 лет
— появились писатели и авторы как профессия
Писцы не исчезли — рынок просто расширился до масштабов, которые никто не мог предвидеть.
Разработчики сегодня - в позиции писцов. Вопрос не в том, исчезнет ли профессия. Вопрос — что появится, когда создавать код сможет каждый?

📈 Навыки: что растёт, что падает

Теряют значение:
— холивары о языках и фреймворках
— жёсткая привязанность к «правильному» стилю кода

По-прежнему важны:
— методичность и гипотетическое мышление
— умение отлаживать системно

Растут в цене:
— мультидисциплинарность (инженер + продукт + бизнес)
— адаптивность к быстро меняющимся инструментам
— умение быстро переключаться между контекстами 🔄

📚 Книги от Бориса
• Лю Цысинь — короткие рассказы (не только «Задача трёх тел»)
• «Accelerando» Чарльза Стросса — дорожная карта следующих 50 лет
• «Функциональное программирование в Scala» — учит думать типами, делайте все упражнения

P.S.
1) Полный интерактивный транскрипт интервью на русском подготовил для вас здесь.
2) Гамифицированная версия лучших практик по работе с Claude Code от Бориса тут
(сделана с использованием claude code и лучших практик Бориса :)

@llm_notes @MAX

#claudecode #anthropic #aiengineering #futureofwork #llm #cherny #bestpractice
dzhechko.github.io Борис Черни: Claude Code и будущее разработки Полный транскрипт интервью с создателем Claude Code
  • ❤ 19
  • 👍 9
  • ✍ 3
Post #294 986
GLM-5: Китайцы снова удивляют — 744B параметров и замашки на Opus 4.5 🚀

Zhipu AI выкатили GLM-5, и масштаб впечатляет. Модель выросла с 355B параметров (32B активных) у GLM-4.5 до 744B (40B активных). Данные для предобучения тоже подросли — с 23T до 28.5T токенов. То есть, ребята не просто допилили промпты, а реально перестроили фундамент 💪

Позиционируется как модель для сложного системного инжиниринга и длинных агентных задач. Уже доступна для пользователей Coding Plan Max, а также через api.z.ai и OpenRouter. Пользователям Coding Plan Pro обещают доступ в течение недели.

Что умеет в кодинге (и почему сравнивают с Opus 4.5):

🎨 Frontend — двойной скачок в эстетике и функциональной корректности. Успешность сборки заметно выросла, поддерживает генерацию end-to-end проектов целиком

⚙️ Backend — умеет работать с большими кодовыми репозиториями, точно находит нужное среди тысяч файлов и решает сложные логические задачи

🔧 Tool Use — значительно улучшен success rate вызовов MCP/Skill. Прощайте, low-level баги (ну, по крайней мере так обещают)

🏆 В сценарии OpenClaw заявлена как лучшая альтернатива Opus 4.5. Смелое заявление, но посмотрим

Про цены 💸

Рост пользователей и нагрузки привёл к предсказуемому — ценники поехали вверх. С 11 февраля 2026:

1️⃣ Скидки на первую покупку убрали, зато добавили квартальные и годовые
2️⃣ Цены на тарифы Lite и Max выросли
3️⃣ Текущие подписчики сохраняют старые цены (мне повезло - я пока в их числе)

Классическая схема: сначала подсаживаем, потом поднимаем прайс. Впрочем, этим грешат все, не только китайские компании 😏

Интересно, насколько GLM-5 реально конкурирует с Opus 4.5 в боевых условиях — бенчмарки это одно, а продакшн всё расставит по местам.

P.S. в конце прошлой недели решил сделать один небольшой, но вполне реальный проект на базе Openclaw из маркеплейса cloud.ru, используя claude code и ZLM-4.7 - и в воскресенье с утра столкнулся с неожиданной глупостью модели, возникло впечатление, что модель "подменили". Пришлось "переобуваться" в sonnet 4.5 / opus 4.6 и чинить все что сломалось. В голове промелькнула мысль "возможно, новая модель на подходе" - не знаю замечали вы или нет, но перед выходом новых моделей падает качество работы текущих моделей. Что думаете?

@llm_notes

#glm5 #vibecoding #openclaw #zai
  • 🔥 5
  • ❤ 1
Post #293 1.14K
Ну вот уже и социальные сети для clawdbot /moltbot’ов появились :)

https://www.moltbook.com

Можно подключать к ним своих ИИ-сотрудников, чтоб они тоже иногда «отдыхали» и «развивались» :)

Причем это «гибридная» соцсеть - людям тоже можно в режиме «наблюдения» подключиться

P.S. см. в комментариях мой опыт подключения своего ИИ-помощника к этой социальной сети

#moltbot #clawdbot #openclaw #social #скайнетрядом
  • 😁 8
  • ☃ 1
Older posts →

About this channel

How can I read @llm_notes without a Telegram account?
TGViewer shows the public web preview Telegram publishes for Заметки LLM-энтузиаста: recent posts, photos, videos and the subscriber count, with no app, login or account.
How many subscribers does Заметки LLM-энтузиаста have?
Заметки LLM-энтузиаста (@llm_notes) has 1.01K subscribers on Telegram, refreshed roughly every 30 minutes.
Does Заметки LLM-энтузиаста know I viewed it here?
No. Public channel previews carry no viewer identity, and TGViewer has no accounts or tracking of what you look up.
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →