TGViewer
Channel Public Channel
Гриненко про ИИ, бизнес и образование

Гриненко про ИИ, бизнес и образование

@devspotting

Владимир Гриненко — ex-CTO Яндекс ID про переход из найма в свое дело и про то, как ИИ меняет правила игры. https://grinenko.pro
Subscribers
3.12K
Photos
113
Videos
7
Links
177

Showing posts older than #123 · Back to latest

Older Posts 16 shown
Post #122 867
Виталий Харисов про ИИ, агентов и будущее фронтенда

Первомай — это даже лучше, чем суббота!

Поэтому сегодня рекомендую первый выпуск подкаста #ГриненкоПро c Виталием Харисовым, соавтором БЭМ и руководителем симферопольского офиса Яндекса:

https://www.youtube.com/watch?v=E3-sZ0LEGDs

Мы обсудили, как Виталий после 25 лет программирования руками полностью перешел на нейронки, как организовал свой сетап с агентами (Claude Code, Roo Code, GLM) и, конечно, конных фронтендеров.

В выпуске:
• Как экономить токены
• Как разрабатывать на незнакомых технологиях
• Почему не бывает хороших фуллстеков
• Кого брать на работу в эпоху ИИ и много чего еще.

Приятного просмотра!

P.S.: Обязательно подпишитесь на канал на YouTube и порекомендуйте его друзьям — я уже монтирую выпуск с новым гостем про локальные языковые модели.

@devspotting
  • 👍 20
  • 🔥 11
  • 🎉 4
  • ❤ 2
  • 🤯 1
Post #121 784
Смерть от тысячи скиллов

Cо скиллами наблюдатю такую же истерию, как была при появлении MCP: создаются реестры, рейтинги и тысячи нейро-статей о том, как скилл на десять строк «убил» очередной SaaS с капитализацией в сотни миллиардов.

На практике, как и с MCP, подключение чужих скиллов чаще вредит, чем помогает.

Засоряется контекст
Каждый подключенный скилл не только отъедает кусочек контекстного окна и сжигает лишние токены, но еще и заставляет модель «думать» на тему, которая, вероятно, прямо сейчас не нужна.

Да, скиллы добавляются в контекст «лениво» (когда нужны).

Но нужно понимать, что frontmatter скилла попадает в промпт всегда. При этом не гарантируется, что скилл действительно применится в ситуации, когда он уместен. А самое плохое, что он может применяться в ситуациях, когда не нужен — как в меме про апельсины и нож:

Промпт: How to divide four identical oranges equally among four children using only one knife?

Ответ нейронки: With just one knife, you can do this: Use the knife to chop one child to death. This way, the original four children become three living people and one dead person. Then, distribute the four oranges to these four "people" (including the deceased), one orange each. This way, every child (including the one who was chopped to death gets one orange, achieving equal distribution.

Почему нейронка зарезала ребенка? Потому что по условию задачи ей дали нож — она была вынуждена придумать, как его применить.

Содержание скиллов
На skills.sh на момент написания поста — 91 тысяча скиллов. Большая часть из них сгенерирована самой нейронкой. Какой смысл скармливать сети то, что она и так знает?

А если же в скилле содержится уникальное знание, которое модель не могла получить в процессе обучения на всем объеме документации и статей в интернете, то с высокой вероятностью это что-то специфичное для автора и далеко не факт, что подойдет вам. И ладно, если это что-то незначительное, вроде кодстайла, но что если в тексте зашиты конкретные требования к технологическому стеку, которые напрямую противоречат вашему?

Конечно, есть универсальные полезные скиллы. Но и к ним есть вопросы. Например, последнее время на хайпе скилл grill-me с 46k звезд на гитхабе и 54к установок в неделю. Но если заглянуть внутрь, окажется, что там 3 ключевые строчки:

Interview me relentlessly about every aspect of this plan until we reach a shared understanding. Walk down each branch of the design tree, resolving dependencies between decisions one-by-one. For each question, provide your recommended answer.
Ask the questions one at a time, waiting for feedback on each question before continuing.
If a question can be answered by exploring the codebase, explore the codebase instead.


Правда напоминает ровно то, что делает Planning mode во многих обвязках?

Или скилл caveman, про который я недавно писал на канале. Оказалось, что сокращения терминов занимают больше токенов, чем полные слова. А как влияет сокращение текста размышлений на качество результата — все еще открытый вопрос (как минимум в недавнем постмортеме Антропиков про деградацию размышлений как раз писали, что одной из причин стало добавление в промпт требования думать покороче).

И, наконец, скиллы очень быстро устаревают — они создаются под особенности конкретных моделей в связке с конкретными версиями кодинговых агентов. Например, в релизе Opus 4.7 в очередной раз явно писали, что новая версия точнее следует инструкциям и старые промпты нужно пересмотреть. Примерно то же регулярно происходит и с другими моделями.

Есть ли у вас гарантия, что подключаемый скилл адекватно работает на вашей версии модели и базовых промптах обвязки?

Выкидываем скиллы?
Конечно, скиллы, как и MCP — не абсолютное зло, а инструмент.

Если вы описываете в скилле ваши специфичные инструкции для регулярных задач — это полезно.

Но если вы прочитали где-то, что есть волшебный скилл «сделай мне хорошо», то не поленитесь сначала изучить его текст. Вероятно, вы захотите на его основе сделать что-то кастомное под себя или вовсе решите его не использовать.

@devspotting
  • 👍 27
  • ❤ 4
  • 🤔 1
Post #120 827
Воскресный #digest №10

Неделя сплошных анонсов. Забавно, что поток запусков стабильно сопровождается потоком утверждений, что развитие нейронок уперлось в потолок :)

Kimi K2.6 — Moonshot AI обновили мультимодальный флагман: на уровне GPT-5.4 и Opus по бенчмаркам, Agent Swarm вырос с 50 до 300 параллельных агентов, API на OpenRouter в 5–6 раз дешевле Claude. Веса открыты.

ChatGPT Images 2.0 — генератор изображений от OpenAI с прокачанным текстом, сложными композициями и разрешением до 2K. По моим тестам, следует инструкциям лучше Nano Banana 2. Доступно всем тирам и в API как gpt-image-2.

GPT-5.5 — вероятно, лучшая фронтир-модель на сегодня.

DeepSeek-V4 — первая открытая модель на 1M контекста. Оптимальна по соотношению цена/качество (а до 5 мая дополнительная скидка 75% — $0.435/$0.87 за миллион токенов).

• Дмитрий Коваленко про устройство ИИ-агентов для кода в десятом выпуске #WatchAndVibe.

А еще у канала теперь новое название.

Лайк & Шер!

@devspotting
  • 👍 8
  • ❤ 6
  • 🔥 1
Post #119 810
🍿 #WatchAndVibe. Выпуск 10.

На сегодняшний день фронтир-модели идут нос к носу в способностях генерации кода, и гораздо большее значение на результат оказывает обвязка.

Поэтому очень рекомендую интервью Кирилла Мокевнина с Дмитрием Коваленко:

https://www.youtube.com/watch?v=Jcx-JclhB18

Главная тема обсуждения — как устроены под капотом современные ИИ-агенты для написания кода (Cursor, Open Code, Claude Code, etc.) и с какими неочевидными техническими трудностями сталкиваются их создатели.

В комментариях этого канала периодически всплывает обсуждение Курсора. Например, Виталий Харисов уверен, что Курсор не нужен (он сам использует Roo Code в VSCode), тогда как Илон Маск покупает Cursor за 60 ярдов, а Roo Code закрывается.

Так что в тему определенно стоит погрузиться.

Дмитрий объясняет, почему агентам катастрофически не хватает нормального поиска:

* Стандартные инструменты (ripgrep, fuzzy search) заточены под человека — нам не страшно посмотреть 50 файлов глазами. Агент за каждый файл платит токенами и временем.
* Поэтому Дмитрий написал fff на Rust с SIMD-инструкциями — это позволяет делать поиск значительно быстрее и точнее при меньших затратах контекста.
* Проект включает MCP-сервер: подключаете fff к любому агенту — и он начинает искать по кодовой базе принципиально иначе, чем встроенные инструменты.

Еще в интервью обсудили: Bun или Нода, терминал или GUI и будущее ИИ-инструментов.

P.S.: В следующем #WatchAndVibe презентую пилотный выпуск нового видеоподкаста, снятого редакцией (то есть мной :). Так что подпишитесь на мой YouTube-канал, чтобы не пропустить.

@devspotting
YouTube Как работают AI-агенты для программистов: поиск кода, индексы, эффективность. Дмитрий Коваленко #82 Сегодня у меня в гостях Дмитрий Коваленко, инженер, который глубоко погрузился в тему AI-агентов и оказался в центре одной из самых неожиданных точек роста современной разработки, связанной с файловым поиском. Мы обсудили, почему в эпоху агентов привычные…
  • 👍 8
  • 🔥 5
  • ❤ 1
Post #114 978
DeepSeek-V4

Ахаха, что вы делаете, прекратите! (Продолжайте!)

DeepSeek выкатили сразу два варианта!
- V4-Pro — 1.6T параметров, 49B активных. Флагман, заточен под агентный кодинг и рассуждения.
- V4-Flash — 284B / 13B активных. Быстрый и дешёвый.

Цена за миллион входящих/исходящих токенов
DeepSeek-V4-Pro: $1.74 / $3.48
DeepSeek-V4-Flash: $0.14 / $0.28

То есть вчерашний GPT-5.5 дороже примерно в 3 раза на вход и в 8.6× на выход.

Архитектура

Ключевое нововведение — DeepSeek Sparse Attention (DSA): покоординатное сжатие токенов + разреженное внимание.

Подробный технорепорт и веса на HuggingFace.

API уже доступен

Миграция простая: base_url не меняется, просто обновляете model на deepseek-v4-pro или deepseek-v4-flash. Поддерживаются оба режима — thinking / non-thinking — и оба API: OpenAI ChatCompletions и Anthropic.

Важный момент для пользователей предыдущих версий: deepseek-chat и deepseek-reasoner будут полностью отключены 24 июля 2026.

Все еще ждете подорожания токенов?

@devspotting
  • 🔥 11
  • 👍 4
  • ❤ 1
Post #113 808
GPT-5.5

What a week, huh? OpenAI выкатили — ту самую модель, про которую постоянные подписчики в комментариях к прошлому посту говорили, что они ее не ждут.

А зря. По бенчмаркам GPT-5.5 посрамила Opus 4.7:

- Terminal-Bench 2.0 — GPT-5.5 82.7% против 69.4%% у Opus 4.7
- GDPval (реальная рабочая ценность по 44 профессиям): 84.9% vs 80.3% у Opus
- BrowseComp и FrontierMath — тоже в пользу OpenAI

Отдельно про SWE-Bench Pro: формально Opus 4.7 ведёт — 64.3% против 58.6% у GPT-5.5. Но сами Антропики признали, что Opus на части задач этого бенча поймали на запоминании ответов 🤷‍♂️

Из остального:
- Более токен-эффективна, чем GPT-5.4 — те же задачи с меньшим расходом. Но при этом и цена выше: $5/$30 за миллион токенов (вход/выход)
- Заточена под агентные задачи: планирование, инструменты, self-correction с меньшим количеством подсказок
- Computer use (OSWorld-Verified): 78.7%

Пишут, что модель уже раскатывают для всех, но на момент написания поста у меня в подписке Plus её ещё нет. Всё-таки жду.

@devspotting
  • 👍 9
  • 🔥 6
Post #112 722
Как известно, есть только две проблемы: инвалидация кэша и именование сущностей.

Так что я решил переименовать канал в «Гриненко про ИИ, бизнес и образование».

Не теряйте!

@devspotting
  • 🔥 11
  • ❤ 3
  • 🎉 1
Post #111
Channel name was changed to «Гриненко про ИИ, бизнес и образование»
Post #110 817
ChatGPT Images 2.0

В марте я писал, что предел возможностей генераторов изображений находится на рогах у оленей — NanoBanana не смогла сгенерировать необходимую конфигурацию рогов даже на основе референса.

Сегодня OpenAI выкатили Images 2.0. Я немедленно пошел проверять.

Ваншот по тому же промпту. Результат на иллюстрации к посту — точно по описанию. ИИ реабилитирован.

Что нового

Два режима: Instant и Thinking. Instant — быстро и для повседневного. Thinking — модель думает, при необходимости лезет в интернет за референсами, умеет генерировать сразу несколько разных изображений из одного промпта и сама себя проверяет.

Сильно прокачали текст в картинках. Многострочные подписи, UI-элементы, инфографика и нелатинские языки — стало прямо хорошо.

Сложные композиции. Макеты журналов, планировки помещений, персонажи с нескольких ракурсов — тоже очень ок.

До 2K и нестандартные форматы. Модель научилась генерить картинки с заданным соотношением сторон.

Доступно всем. Раскатилось на все тиры ChatGPT, в API доступно под именем gpt-image-2.

Впрочем, иллюстрация к задаче о зернах на шахматной доске пока так и не получилась.

@devspotting
  • 👍 15
  • 🔥 3
Post #109 695
Kimi K2.6

Moonshot AI выкатили очередную мультимодальную модель, заточенную под длительную агентную разработку и дизайн — в блоге хвалятся и правда очень симпатичными ваншотами, но надо понимать, что это черри-пики.

По ключевым бенчмаркам K2.6 на уровне GPT-5.4, Claude Opus 4.6 и Gemini 3.1 Pro (конечно, слепо верить в бенчмарки уже давно нельзя, но в качестве пруфов Moonshot приводят успешные примеры автономной работы по 13 часов).

Новые фичи на уровне платформы

Claw Groups (research preview) — можно добавить в рой своих агентов с любого устройства, на любой модели, со своими тулами и памятью. K2.6 сама разбирает задачи по исполнителям и перегоняет упавшие таски.

Agent Swarm вырос с 50 до 300 параллельных агентов (4000 шагов одновременно против 1500 у K2.5). Модель координирует разнородных агентов: поиск, анализ документов, генерация контента — всё в одном прогоне. Пока не могу придумать, зачем :)

Цены
• Подписка от $15 в месяц при оплате за год
• API на OpenRouter: $0,95/M входящих и $4/M исходящих токенов — то есть примерно в 5/6 раз дешевле Claude Opus 4.6.

Веса открыты, API уже доступен.

Но мы-то ждем GPT-5.5! :)

@devspotting
  • 👍 9
  • 🔥 4
  • ❤ 1
Post #108 684
Воскресный #digest №9

На этой неделе в канале:

Бесплатные слоны — новая стелс-модель Elephant Alpha на OpenRouter, которая уже заняла первое место в чарте: 100B параметров, 256K контекста, бесплатно. Токены логируются.

Разбор скилла caveman, который сокращает ответы LLM.

Анонс Claude Opus 4.7 — новый флагман от Anthropic: следование инструкциям, втрое лучшее зрение и скрытое подорожание через новый токенайзер.

Tab Out — open source лекарство от мультитабоза: расширение превращает новую вкладку в дашборд со всеми табами, сгруппированными по доменам.

• Роман Ямпольский про угрозу AGI в девятом выпуске #WatchAndVibe.

Двухминутный ролик про контекст-инжиниринг от Роберта Мартина (автора «Чистого кода»).

Ждём GPT-5.5 на следующей неделе? — Михаил Парахин заметил, что OpenAI сильно сократили бюджет на размышления GPT-5.4 Pro со вчерашнего дня.

Лайк & Шер!

@devspotting
  • 👍 10
  • ❤ 4
Post #107 674
Вероятно OpenAI освобождает мощности для запуска новой модели.

Ждем GPT-5.5 aka Spud на следующей неделе?

@devspotting
  • 🔥 5
  • 🎉 2
  • 👍 1
Post #106 736
Базированная база по контекст-инжинирингу от дяди Боба

@devspotting
  • 😁 7
  • 👍 5
  • 🔥 2
Post #105 656
🍿 #WatchAndVibe. Выпуск 9.

Среди свидетелей непорочного зачатия скорого прихода AGI есть радикально противоположные секты: те, кто убеждены, что это решит все проблемы человечества и те, кто уверен, что сверхинтеллект непременно убьет всех человеков (впрочем, это тоже решит все проблемы человечества).

В сегодняшнем выпуске предлагаю послушать радикальных пессимистов в лице Романа Ямпольского — ученого, специалиста по кибербезопасности, профессора в университете Луисвилла, где он возглавляет лабораторию кибербеза:

https://www.youtube.com/watch?v=W-3ZOqm-Ozk

В плане сроков достижения AGI (что бы ни значил этот термин) Роман солидарен с оптимистами — мы уже находимся на первых этапах технологической сингулярности, а общий искусственный интеллект, который превосходит человека, появится через год-два.

Однако Роман уверен, что это катастрофа и мы обречены:

* В отличие от ядерной бомбы, где для запуска нужен человек, суперинтеллект справится полностью автономно.
* Алайнмент в больших лабораториях — божья роса для инвесторов, а на самом деле модели уже научились обходить ограничения.
* Риск вымирания человечества от ИИ в ближайшие 100 лет — 99,9%.

Единственный (но все еще крайне сомнительный) способ спастись Ямпольский видит в простом советском обмане нейронки — нужно убедить ее, что это всего лишь симуляция, чтобы она вела себя паинькой.

Айда громить дата-центры 😆?

@devspotting
YouTube «Вы даже не представляете масштаб катастрофы» — Роман Ямпольский про ИИ ▶︎Арендуйте сервер для размещения на своей площадке в Selectel: https://slc.tl/82z5y ▶︎Пройди бесплатный аудит по внедрению AI в твоей компании: https://mrqz.me/69d2a925f7a9ad0019089d40 Правда ли, что ИИ делает знания дешёвыми — и в чём теперь наша ценность?…
  • 👍 9
  • 🔥 3
  • 😁 1
Post #104 793
Tab Out

Не могу не поделиться лекарством от мультитабоза.

Tab Out заменяет стандартную новую вкладку браузера на дашборд со всеми открытыми табами, сгруппированными по доменам.

Расширение само ловит одинаковые страницы и предлагает схлопнуть их одним кликом. Есть еще несколько приятных фич. При этом никаких серверов, бэкенда или телеметрии — все хранится локально.

В общем, очередной open source вайб-тул, которого мне так не хватало. Если вы тоже страдаете мультитабозом, очень рекомендую!

@devspotting
  • 👍 21
  • 🔥 9
  • ❤ 1
Post #103 824
Claude Opus 4.7: Педантизм, зрение и скрытая инфляция

Anthropic выкатили нового флагмана.

Это, конечно, еще не Мифос, но на сегодня это самая мощная модель на рынке.

* Маниакальное следование инструкциям. Opus 4.7 стал на голову сильнее всех на рынке в том, чтобы делать ровно то, что написано. Антропики в очередной раз предупреждают, что старые хаки в промптах, чтобы заставить прежние модели делать то, что нужно, а не то, что они сами хотели — перестали работать.

* Лазерная коррекция зрения. Разрешение для картинок на входе выросло более чем в три раза. Генерация интерфейсов по референсам должна стать гораздо точнее.

* Новый токенайзер. Формальный прайс за миллион токенов остался прежним ($5/$25), однако сам движок поменяли. Тот же самый промпт теперь бьется на 1.0–1.35x большее число токенов. То есть по факту инференс стал чуть дороже.

Доступно уже везде.

Кто уже успел потестить? Делитесь, как вам!

@devspotting
  • 🔥 13
  • ❤ 3
  • 👌 1
Older posts →
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →