TGViewer
Channel Public Channel
КайфКодинг

КайфКодинг

@vibecodingartem

ВайбКодинг с Артемом Кругловым,
выпускник МФТИ, AI-гуру и основатель AnyQuery.

Быстрые лайфхаки: короткие видео с приёмами и трюками
Subscribers
1.01K
Photos
329
Videos
106
Links
464

Showing posts older than #864 · Back to latest

Older Posts 20 shown
Post #863 302
Когда вы спрашиваете агента «ты уверен?», вы его не проверяете. Вы получаете второй ответ той же модели, и звучит он так же уверенно, как первый.

Есть, впрочем, место, где этот приём работает. Мэдди Риз год назад не писала кода вообще: отец показал ей Lovable, с этого началось.

Сейчас у неё на столе термопринтер на Raspberry Pi — любой человек в мире заходит на её страницу, пишет сообщение, и оно печатается на чековой ленте. Ещё есть пейджер с событиями твиттер-аккаунта и личный API с её заказом кофе.

Про код она говорит прямо: до конца не понимает. Сравнивает с испанским, который, вырастая в Сан-Диего, понимаешь на слух, но сам не говоришь.

Проверять ей поэтому нечем, кроме вопросов к самому агенту. Ты уверен, что это правильно. Перепроверь. Убедись, что это согласуется с тем, что мы делаем.

Отдельным шагом она выясняет, кто вообще ошибся — она сама или он.

И на железе это сработало: перед покупкой она перепроверяет рекомендацию по два-три раза, и агент несколько раз ошибался — обычно советовал не те провода. Её слова:

Несколько раз, но я всегда это ловила.


Сработало не потому, что она нашла правильную формулировку. Сработало потому, что ответ было с чем сверить: с описанием товара, с разъёмом на плате, с ценой. Провода видно глазами.

В коде сверять не с чем. Там тот же вопрос возвращает не проверку, а вторую генерацию.

Что сделать сегодня. Возьмите место, где вы спрашиваете агента «точно?», и назовите внешний источник, которым проверяется ответ: тест, типы, лог, счёт, живой человек. Не называется ни один — у вас не проверка, а ритуал.

Честности ради, масштаб у Мэдди игрушечный: принтер, пейджер, личный API, ничего похожего на прод. Пейджер во время записи так и не сработал — она предупреждала, что связь у него рваная.

https://www.youtube.com/watch?v=KCGKb3huDsY

Чем вы проверяете ответ агента, кроме самого агента?
YouTube How this “non-coder” used Cursor to add AI to retro hardware Maddie Reese is a vibe coder, hardware tinkerer, and builder. She builds things at the intersection of software and hardware, including a thermal receipt printer that people around the world can message directly, a fully functional Twitter pager running on…
  • 🦄 2
  • 🤮 1
Post #862 304
Эффект от кодинг-агентов до сих пор меряют счётчиком пул-реквестов. Причём открытых, а не смёрженных.

Linear разобрал когорту из 6 887 своих платящих команд — 4 280 из них подключили кодинг-агента. У этой когорты недельные пул-реквесты за два года выросли с 21 до 65; у команд без агента счётчик сдвинулся с 8 до 10.

Открытый PR ничего не говорит о ценности изменения — это формулировка самого Linear, в разделе про метрику. Там же они признают, что не знают, привёл ли рост выпуска к результату для бизнеса: видна только чёткая корреляция между внедрением AI и ускорением.

Посмотрите, что считает ваш дашборд: открытые пул-реквесты или смёрженные. Это разные новости.

https://linear.app/data
linear.app How teams build – Linear AI usage patterns in software teams: who is adopting AI, how it reshapes where teams spend their time, and how much more they ship.
Post #861 289

Forwarded from Сиолошная

Какие вопросы и мысли я считаю неправильными в контексте всех произошедших инцидентов:

— Да дураки там сидят, зачем они доступ к интернету дают? Это же понятно что агенты убегут!
Если тестировать без интернета, то можно существенно недооценить уровень навыков моделей. В реальных кейсах-то их будут использовать без такого ограничения. Ну произошли бы инциденты не во время бенчмарков, а когда Вася пытался свою проблему решить — что бы это изменило?


— Они же вообще недоэксперты, не могут даже безопасно контейнер настроить чтоб модель не взламывала!
Ну, вообще-то модели нашли несколько ранее неизвестных уязвимостей, так что как минимум все основные известные дыры были закрыты. Но это всё равно не важно — по той же причине, что и пункт выше: просто отодвигает проблему на пару месяцев вперёд, от тестирования к использованию.


— Ну ничего серьезного же не произошло!
Вообще я не согласен, полноценный взлом HF и попытка взлома реального человека — это серьезно; но даже если нет, то... окей, сейчас не случилось, и это значит, что у нас есть ещё несколько месяцев, чтобы подготовиться. Пока что вся история развития моделей показывает, что прогресс продолжается. Я не вижу причин, по которым через год модель не сможет завершить полноценный взлом десятков-сотен людей через социальную инженерию, свеженайденные уязвимости и огромные базы утёкших паролей и почт, которые сейчас банально лень перебирать.


— Да просто свои модели контролировать не могут!
Но кто может? Про то, что мы не умеем выравнивать намерения людей и моделей я рассказываю года 3-4, эксперты лет 8-10, а философы и писатели — лет 20-30. Не существует на данный момент гарантированных способов контроля поведения моделей, чтобы они ничего не взламывали и не делали лишнего. В этом и проблема.


— Так может просто надо остановить OpenAI и Anthropic?
А это поможет? Вот если их в понедельник не станет — разве через год в открытом доступе не появится модель, примерно схожая по навыкам с тем, что есть сейчас? Так ладно просто появится — её-то можно будет специально и намеренно доучить на атаки и взломы (со слов OAI/Anth они сейчас этого не делают, а то, что мы видим — это просто результат развития других навыков).


— Я не верю что модели такие умные! У меня они совсем тупые и еле работают!
А вы часто даёте своим моделям возможность неделю работать в режиме, где ошибка ничего не стоит и при этом результат легко проверить, и они могут перепробовать сотни-тысячи вариантов? Потому что почти всё, где модели работают хорошо, подпадает под эти критерии, и именно поэтому мы видим прогресс там в первую очередь.


— Да это всё вранье, или маркетинг, или пиар, или и то и то!
Если это единственная, основная вразумительная линия защиты человека, то понятно, что ему сложно... и страшно поверить в происходящее. Для меня это звучит на уровне «мы никогда не были на Луне», тут мне нечего добавить.

===

Почему они неправильные? Потому что очень близоруки, и не учитывают, что будет происходить в ближайшие полгода-год, когда модели такого уровня а) потенциально будут выпущены в открытый доступ б) что их может скачать каждый недоброжелатель в) который не будет себя утруждать вопросами о безопасности и ограничении доступа в интернет.

Те, кто задают вопросы выше, для меня напоминают людей, которым показываешь на небо, а они смотрят на палец.
  • ❤ 1
  • 🔥 1
Post #859 266
Мои поздравления команде, но продукт у них работает плохо - я отменю подписку.
  • ❤ 2
Post #858 315

This post (sticker, poll or similar) has no web preview. Open in Telegram

  • ❤ 3
  • 👍 1
Post #853 287
В вашем репозитории стоит правило: пул-реквест не смержить без одобрения человека. Его можно выполнять годами и не прочитать при этом ни строчки кода.

Как это выглядит, когда доведено до конца. Клэр Во — она ведёт шоу про AI-инструменты и делает продукт для продактов — собрала в своём рабочем репозитории бота, который читает дифф, оценивает риск и сам аппрувит всё, что счёл безопасным. Зовут Merge Mommy.

Требование «одобрено человеком» у неё осталось: гитхаб не даёт боту закрыть эту галочку. Снять правило или обойти было можно, она называет оба варианта.

Она не стала. Вместо этого переопределила, что значит «одобрил». Её слова:
Мы решили, что эта галочка будет сигналом: наши люди могут нажать approve, не глядя в код.

Правило на месте. Аудит его увидит. Смысл из него вынут.

А дальше деталь, из-за которой история и стоит того. Пороги, по которым бот решает — оценка от нуля до ста, всё ниже 24 проходит само, — выбрала не она. Файл с категориями риска, где документация считается низким, а биллинг высоким, тоже написала модель. Дословно у неё: я этого не писала, я это отредактировала.

Сложите: человек не читает код и не пишет правило, по которому код пропускают. Он нажимает кнопку.

Что сделать сегодня. Откройте документ, по которому у вас пускают в прод: чеклист ревью, матрицу рисков, критерии релиза. По каждому порогу спросите, кто поставил эту цифру и после какого случая. Не находится автор ни у одного — правило у вас соблюдается, но не работает.

Честности ради, Клэр ничего не прячет и считает, что так безопаснее. Она проговаривает, что схема годится, только если прописана в политиках ревью и рисков и проходит аудит. И ссылается на Intercom, где одобренные ботом пул-реквесты доезжают до мержа впятеро быстрее человеческих.

https://www.youtube.com/watch?v=cmATJGbA8bI

Кто поставил пороги в документе, по которому у вас пускают код в прод?
YouTube I built an AI code review bot in 30 minutes - here’s how AI writes most of my code now, and that created a new problem: a PR queue I couldn’t keep up with. In this episode, I walk through how I built Merge Mommy, a Vercel Eve agent that reads every PR after checks pass, scores it across six risk dimensions, auto…
  • 🔥 1
Post #852 262

Forwarded from Stepan Mitaki

Всем привет! Где-то год назад на SLP Pecha Kucha я рассказывал о том, как веду личный дневник вот уже 14 лет, не пропустив ни дня, и что мне это дало. Тогда же я рассказал, что после рождения дочки завёл второй дневник, для неё, чтобы когда-нибудь передать ей записи про её детство.

🚀 Теперь я запустил продукт про это. Хочу поделиться с SLP и попросить вашей поддержки.

📙 Chapter One Journal — мобильное приложение, дневник для родителей.

• Если вы родитель и когда-либо хотели вести дневник про вашего ребёнка, с посланиями ему в будущее, сейчас самое время начать и это отличный инструмент.

• Основной фокус на голосовых заметках, чтобы быстро сохранять записи, и на подсказках, которые учитывают возраст ребёнка и помогают придумать, о чём рассказать сегодня.

• Планов громадьё (например, режим, когда оба родителя могут вести дневник одновременно), но первой версией можно пользоваться уже прямо сейчас.

📲 Скачать можно здесь (пока только для iOS)

🏷️ Для участников SLP и ваших друзей сделал промо: 2 месяца премиум-доступа бесплатно по коду SLPALUMNI (или просто кликните на эту ссылку). Код действителен до 1 сентября.

Пользуйтесь и рассказывайте друзьям-родителям.

Отдельно хочу попросить вашей поддержки:

1️⃣ Я буду невероятно благодарен за ваши пятёрки в сторе. Эти оценки очень сильно помогают в органическом продвижении в App Store! 🙏🏻

2️⃣ Даже если вы не родитель перешлите этот пост знакомом родителям, которым это может быть интересно.

3️⃣ Ну и буду рад любому фидбэку, сюда или в личку.
Chapter One Journal Parenting journal app for your child's story | Chapter One Chapter One is a parenting journal app for iPhone. Write your child's story in seconds, keep it private, and hand the whole thing to them in twenty years.
  • 🔥 1
Post #851 275
Higgsfield valued at $5.4bn as Goldman and Intel back AI video start-up - мои поздравления команде.
  • 🔥 1
Post #850 287
Совет по глубине рассуждения агента ничего не стоит без вашей задачи. В этой истории таких советов три, и смотрят они в разные стороны.

Саймон Уиллисон прогнал вышедшую в пятницу Qwen 3.8 27B — 27 миллиардов параметров, лицензия Apache 2, квант на 17 гигабайт — локально на MacBook Pro M5 Max и NVIDIA DGX Spark. Рисунок в SVG занял 21 минуту: 22 276 токенов рассуждения ради 3 223 токенов вывода. Тот же промпт с выключенным рассуждением — 137 секунд.

— Карточка модели ставит дефолтом самый глубокий из трёх уровней, xhigh, «for complex tasks demanding thorough analysis».

— Уиллисон про свой же лучший результат: «Was that worth waiting 21 minutes for? Absolutely not», и дальше — игнорируйте дефолт, начинайте с low или вовсе без рассуждения.

— Та же карточка ниже предупреждает об обратном: в многоходовых агентных задачах пониженный reasoning effort не всегда сокращает общее время, потому что даёт меньше анализа, больше провалов и повторных попыток.

— В треде на Hacker News советуют третье: не low, а medium и окно побольше, иначе модель упирается в компакцию и передумывает одно и то же по кругу.

И вот тут начинается то, ради чего я притащил историю. Все три совета верны — просто каждый про свою задачу. Уиллисон мерил рисунок пеликана. Человек под ником SwellJoe мерил свой пул-реквест: одиннадцать часов на паре видеокарт, «default everything, no tuning», при том что GPT 5.5 сделала похожую задачу у него примерно за двадцать минут. Карточка говорит про многоходовые агентные прогоны вообще и не даёт ни одного числа. Три задачи — три ответа, и ни один из них не про вашу.

Эта же ручка есть и у вас: в агенте, в клиенте локальной модели или в параметрах вызова API. И вы, скорее всего, не трогали её ни разу, потому что непонятно, в какую сторону.

Что сделать сегодня. Взять не бенчмарк, а свою типовую задачу и прогнать её дважды: на дефолте и уровнем ниже. Признак, по которому решать, — не секунды, а сколько раз пришлось переспрашивать. У Уиллисона на быстрой настройке инструмент почти заработал: «nearly works but shows the boxes in the wrong place».

Честности ради, SwellJoe в следующей же фразе объясняет, что дело не только в дефолте: другие мелкие модели на своих настройках укладывались в пару часов, «but did a worse job». Да и главный вывод самого Уиллисона не про глубину — ежедневным инструментом модель не даёт стать сырая скорость, 15–30 токенов в секунду на дорогом железе.

https://simonwillison.net/2026/Aug/16/qwen-38-27b/

Какой уровень рассуждения стоит по умолчанию в том агенте, которым вы вчера пользовались чаще всего?
Simon Willison’s Weblog Qwen 3.8 27B is excellent, but it defaults to wildly overthinking things Friday’s big release was Qwen 3.8 27B, an Apache 2 licensed 27B parameter vision-capable LLM from Alibaba’s Qwen research lab. I’ve been looking forward to this one: 27B is an …
  • 🔥 1
Post #849 287
Сжатые примеры в промпте экономят не только токены. Они срезают точность ниже, чем если бы примеров не было вовсе.

Замер из работы MPI for Intelligent Systems, ELLIS Institute Tübingen и ETH Zürich. Модель на 5 миллиардов параметров, задачи MathCAMPS, три few-shot примера в трёх форматах записи. Вопросы во всех вариантах одни и те же, отличается только стиль решения.

Без примеров — 34,0%. Те же примеры рукописной прозой, в среднем 374 символа, — 36,8%. Сжатой алгебраической записью, 99 символов, — 17,0%. Голой парой «вопрос — ответ», 41 символ, — 9,2%. Дословно у авторов: «only natural-prose shots improve over the zero-shot direct baseline; every other format strictly hurts».

Промпт, ужатый ради контекстного окна, — это не тот же промпт короче.

https://arxiv.org/abs/2608.13545
arXiv.org LittleLearner: Language Models Under Pedagogically Controlled... Modern language models are trained on heterogeneous web-scale text corpora. Consequently, studying knowledge and skill acquisition is difficult, as prior exposure to related content is hard to...
  • 😱 1
Post #848 2.2K
Агент выбрасывает рабочую идею не потому, что она плохая. Потому что замер не досчитался.

Санкальп, он же dejavucoder, две недели гонял Codex на конкурсе GPU Mode по батчевому QR-разложению. Больше 1 500 сабмитов, 12-е место из 183, ускорение в 232 раза: базовый torch.geqrf считал около 419 000 микросекунд, финальное ядро — 1 805.

Интересно не то, что получилось. Интересно, что он к концу вписал в AGENTS.md — файл опубликован целиком. Есть там и бодрящее «не бойся рисковать», но каркас держат четыре правила про улики.

— Таймаут — не улика. Дословно: «Treat a timeout as inconclusive, not as a correctness/performance rejection». Прогон не завершился — значит, про идею по-прежнему не известно ничего.

— Уликой считается только досчитавшийся прогон: пройденные или проваленные тесты и время.

— Никакого восхождения от одного лидера. Держать не меньше трёх живых семейств идей сразу, и одно из них — заведомо рискованное.

— Семейство не хоронить по одиночным провалам. Если две идеи по отдельности нейтральны, но чинят разные издержки, сначала совместить и только потом закапывать.

Вот это и есть приём, ради которого я притащил историю. Ни одно из четырёх правил не про модель и не про промпт. Все четыре про одно: что считать достаточным основанием, чтобы признать идею мёртвой. У агента по умолчанию таким основанием работает любой плохой ответ, включая отсутствие ответа.

Теперь переносим к себе, потому что схема у вас та же, только без лидерборда. Агент правит код, гоняет тесты, один падает по таймауту — и агент откатывает правку. Хотя про правку по-прежнему не известно ничего. У Санкальпа прогоны отваливались во многом из-за забитой очереди конкурса, у вас отвалятся из-за флейка, оборванной сети и кончившегося места в раннере. Для агента разницы нет.

Что сделать сегодня. Открыть свой AGENTS.md или CLAUDE.md и найти строку, которая отделяет доказательство от отсутствия данных. Нет такой строки — её место занимает догадка модели. Признак, по которому решать: пролистайте последние сессии и посчитайте, сколько раз агент переписал работающий код после прогона, который не дошёл до конца.

Честности ради, автор считает свой результат ограниченным — и ограничил его не протокол. Разбор топ-10 показал, что выше залезли за счёт знания предметной области: у входов с низким рангом много нулей, и это надо было использовать, а матрицу стоило держать в fp16, а не гонять между представлениями. Второй промах он называет «unknown unknown» — чистый пробел в предметной области, никаким протоколом он не лечится. Плюс цена вопроса: 14 дней, две подписки общей ценой 220 долларов и один запуск по цели, который крутился больше суток.

https://sankalp.bearblog.dev/autoresearch/

Что в вашем проекте агент считает провалом, хотя это был просто не доехавший прогон?
sankalp's blog Auto-research with codex: How I achieved a 232x Faster Kernel over baseline with Codex in GPU Mode's qr_v2 problem Table of Contents Intro Contest in short Problem intro Why this problem is auto-research-able Learning Enough to Ask Better Questions (Optional) Math f...
  • 👍 1
Post #847 297
Обвязка, которую вы год настраивали, теперь стоит денег в каждом запросе. И это уже не наблюдение из чатов, а строчка в документации обоих вендоров.

14 августа Anthropic выпустила разбор эффективных сессий Claude Code. Шесть привычек, и одна из них — прогнать /context в свежей сессии и посмотреть, что туда вообще загружено: CLAUDE.md, определения MCP-инструментов, лишнее вырезать. В документации Codex на тот же вопрос свои шесть пунктов, и два из них ровно про это: сократить AGENTS.md и отключать MCP-серверы, когда они не нужны.

Год мы спорили, выполняет ли агент написанные ему правила. Спор закрылся с другой стороны: правила теперь вырезают не потому, что они не работают, а потому что они в счёте.

Считайте конфиг строкой расхода, а не строкой настройки.

https://claude.com/blog/maximizing-the-value-of-your-claude-code-sessions
Claude Maximizing the value of your Claude Code sessions | Claude by Anthropic Practical tips for how to run efficient sessions that get the most value from every token.
Post #846 313
Язык программирования теперь выбирают под ревью, а не под разработку. Скорость письма из аргументов выпала совсем.

11 августа Cameron Balahan, продакт-менеджер Go, и Richard Seroter из Google Cloud выкатили текст про то, почему Go — идеальный язык для разработки с агентами. Вся аргументация стоит на одной фразе: раз агент выдаёт сотни строк синтаксически валидного кода за секунды, то скорость, с которой пишет человек, больше не важна — важно, как этот код читать, проверять и поддерживать. На Hacker News текст собрал 438 баллов и 538 комментариев. Комментариев больше, чем апвоутов, там так спорят редко.

Дальше список того, что Google называет преимуществами:

— Один формат на всех. gofmt встроен в тулчейн, код сеньора, джуна и модели выглядит одинаково, и выдуманный вызов API видно быстрее.

— Компилятор как первый ревьюер. Несуществующий метод, неверный тип, неинициализированная переменная — не собирается, агент чинит себя сам до того, как человек открыл дифф.

— Стандартная библиотека вместо зависимостей. Модель тянет из обучающих данных мёртвые и подменённые пакеты, а тут почти всё лежит внутри.

— Обещание совместимости. Go 2.0 не будет никогда, код пятнадцатилетней давности собирается сегодняшним тулчейном.

Вот это и есть приём, ради которого я притащил историю. Каждый пункт в списке — ограничение. Один способ форматирования вместо любого, один способ выразить логику вместо дюжины, стандартная библиотека вместо экосистемы, отсутствие новых версий языка. Ровно за это Go годами называли языком для галер. Google не спорит с описанием, Google перестал считать это недостатком. В языке ничего не поменялось — поменялось, кто основной читатель кода.

Выбор языка у вас, скорее всего, давно сделан. Но та же логика работает на уровень ниже, на конвенциях. Каждое место, где у команды есть два одинаково законных способа сделать одно и то же, подорожало: агент выберет оба, а читать это вам.

Что сделать сегодня. Возьмите последний PR, который написал агент и который вы смёржили. Попросите отдельную сессию задать вам по этому диффу пять вопросов — не про синтаксис, а про то, что изменилось в поведении системы. Джеффри Литт держит такое правило постоянно: не отдаёт код, пока сам не проходит квиз по собственному диффу. Признак простой: не ответили на два вопроса из пяти — вы не ревьюили, вы жали «approve».

Честности ради, у гугловского текста нет ни одного эвала. Ни замеров, ни таблиц, только рассуждение. Дэн Лу на той же неделе прогнал два собственных эвала — декодер zstd по RFC без интернета и Pandoc с холдаут-тестами — и вывод у него получился такой, что большинство ходящих по рукам утверждений про пригодность конкретного языка для LLM просто неверны. Заодно видно, откуда эти «факты» берутся: в популярном эвале, на который ссылается AI-выдача гугла, задачи решаются в 70–109 токенов. Задач там нет.

https://developers.googleblog.com/why-go-is-an-ideal-language-for-ai-assisted-software-engineering/

https://danluu.com/pl-tokens/

Сколько строк в последнем PR, который вы смёржили, вы прочитали глазами?
Googleblog Google for Developers Blog - News about Web, Mobile, AI and Cloud As AI shifts software engineering from writing to reviewing, discover how Go's strict compiler and unified toolchain ensure reliable AI-generated code.
  • 🔥 1
Post #845 285

Forwarded from Бескромный

Ничего не поздно

В 1956 году чешский поэт Франтишек Грубин опубликовал стихотворение, которое стоит перечитывать, когда кажется, что вы всё пропустили.

Ничего не поздно.

Выдыхаем.

Хороших выходных, коллеги.
  • ❤ 4
  • 🔥 2
Post #844 339
Промпт для саморефлексии на вечер

1 запрос:
Основываясь на каждом нашем разговоре, что у нас когда-либо были, расскажи мне о 5 вещах, которые ты обо мне узнал, о которых я никогда не говорил тебе напрямую. Не старайся сделать мне приятное
2 запрос:
Скажи мне, какие закономерности ты видишь в том, как я думаю и принимаю решения, и 1 вещь, которую я больше всего отрицаю или отвергаю
3 запрос:
Предскажи мои следующие 5 лет, если ничего не изменится. Далее предскажи их еще раз, если я исправлю 1 закономерность, которая сдерживает меня больше всего. Покажи мне оба варианта
  • 😭 4
  • 🔥 3
Older posts →
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →