TGViewer
Channel Public Channel
КайфКодинг

КайфКодинг

@vibecodingartem

ВайбКодинг с Артемом Кругловым,
выпускник МФТИ, AI-гуру и основатель AnyQuery.

Быстрые лайфхаки: короткие видео с приёмами и трюками
Subscribers
1.01K
Photos
332
Videos
106
Links
468

Showing posts older than #712 · Back to latest

Older Posts 17 shown
Post #711 435

Forwarded from Krist/Blog

GLM-5.2

Спустя несколько дней после релиза в подписке, z.ai выпускают свою новую модель в опенсорс:
- Контекст теперь миллион токенов.
- Ещё лучше в коде.
- Лучше в долгосрочных задачах.
- Дешёвый контекст благодаря IndexShare.
- Лицензия MIT.

Блогпост, веса
Post #710 421
с момента моего прошлого поста - акции Z AI прибавили еще 40%.
А кто знает как можно выйти на руководство китайской компании?
Post #706 541

Forwarded from Всеволод Устинов (канал: ai, стартапы, пост-ирония)

Посмотрел выступление Anthropic про то, как они собирают агентов, которые могут работать часами.

Схема такая:

planner → agent → evaluator

Это маленькая продуктовая команда из агентов. У каждого своя роль, свой контекст и своя зона ответственности. Но есть важные нюансы.

1. Planner: верхний план и спринты

Planner получает короткий запрос и превращает его в структуру работы:

— что собираем
— какие большие части нужны
— в какой последовательности идти
— какие спринты должны получиться

Важная деталь: planner не расписывает всю техническую реализацию заранее.

Если в начале придумать подробный план на 200 шагов и ошибиться, ошибка потом поедет каскадом через несколько часов работы.

Поэтому planner держит уровень продукта и спринтов, а технические решения остаются ближе к моменту реализации.

2. Agent: сборка следующего спринта

Agent берёт следующий спринт и собирает фичу.

Но перед началом работы он сначала договаривается с evaluator, что именно будет считаться готовым результатом.

Это главный механизм всей системы.

В обычной агентской работе часто бывает так: дал задачу, агент что-то сделал, сам себя проверил, сказал “готово”, а потом выясняется, что половина сценариев не работает.

Anthropic решает это через contract.

3. Contract: договорённость о готовом результате

Agent пишет: я соберу такую фичу, проверять её надо вот так.

Evaluator отвечает: добавь такой сценарий, такой edge case, такое состояние интерфейса, такую проверку.

Они обмениваются markdown-файлами и уточняют критерии, пока не сходятся на contract.

Contract — это список конкретных проверяемых утверждений.

Дальше evaluator проверяет уже не исходный расплывчатый запрос пользователя, а этот contract.

Например, исходный запрос:

“сделай retro game maker”

А contract превращает его в конкретику:

— можно создать новый проект
— есть sprite editor
— есть play mode
— сохраняется состояние
— canvas работает корректно
— основные сценарии кликаются в браузере

В примере Anthropic для одного приложения получилось 27 contract criteria.

Если критерии расплывчатые, critique тоже будет расплывчатой. Agent получает “ну как-то не очень” и не понимает, что именно чинить.

Если критерии конкретные, он видит точную проблему.

4. Evaluator: жёсткая проверка через браузер

Evaluator — это отдельный агент-критик.

Он открывает приложение через Playwright, кликает по интерфейсу, делает скриншоты, проверяет сценарии, пишет критику и отдаёт её обратно agent.

Отдельного критика проще настроить быть жёстким. У него отдельный контекст, отдельная роль и отдельная инструкция.

Agent собирает.
Evaluator атакует результат.

За счёт этого появляется нормальное давление на качество.

5. Финальный цикл

Итоговый процесс выглядит так:

1. planner разбивает задачу на спринты
2. agent берёт следующий спринт
3. agent и evaluator согласуют contract
4. agent строит
5. evaluator проверяет через браузер
6. agent чинит
7. цикл повторяется

С новыми моделями эту схему можно делать проще. Иногда agent может два часа спокойно собирать продукт, а потом evaluator прогоняет проверку.

Но суть остаётся: качество держится не на “модель умная”, а на архитектуре процесса.

6. Как собрать похожее самому

Нужны понятные примитивы:

— subagents для отдельных ролей
— Playwright / Chrome MCP для проверки интерфейса
— skills / rubrics для критериев качества
— auto mode / permissions для долгой автономной работы
— contract files для договорённости о “готово” до начала реализации



Я сам дошёл до части этих принципов: независимое тестирование, контракт (у меня назвался definition of done, dod). Теперь хочу попробовать воспроизвести целиком.

Видео:
https://youtu.be/mR-WAvEPRwE
YouTube Anthropic Workshop: Build Agents That Run for Hours — Ash Prabaker & Andrew Wilson Why self-evaluation is a trap and adversarial evaluator agents work better; why context compaction doesn't cure coherence drift but structured handoffs do; how to decompose work into testable sprint contracts; how to grade subjective output with rubrics an…
  • ❤ 7
  • 👍 3
  • 🔥 3
Post #705 586

Forwarded from Denis Sexy IT 🤖

⚙️ Меня немного запарило, что все кодинг агенты не умеют из коробки делать актуальных на сегодня агентов, потому что внутри – модели еще не обучены всем современным агентским трюкам – поэтому я прошелся по исходникам Codex, Claude Code и других популярных уроков по созданию агентов, работу с кешами, авто-сжатием контекста и тп, и собрал скилл agents-best-practices который чинит эту проблему – причем, там отдельно прописано, что эти знания для всех видов агентов, не только для кодинга:

Там нет кода, есть текстовые справочники на темы – мне помогло:

Архитектура агентного harness
Как устроить runtime вокруг модели: контекст, инструменты, permissions, память, наблюдаемость и остановочные условия.

Agentic loop
Базовый цикл: модель → tool call → валидация → permission check → выполнение → observation → следующий шаг или финальный ответ.

System prompts и инструкции
Как проектировать слои промптов: global, workspace, domain-specific, task-level и runtime reminders.

Tools и permissions
Как делать инструменты узкими, типизированными, безопасными, проверяемыми и разделёнными по risk class.

Planning mode
Как отделять планирование от исполнения: read-only exploration, план-артефакт, approval и потом мутации.

Goal-like loop
Как задавать долгоживущие цели с budget, checkpoints, validation criteria и stop condition. Это вместо Ralph Loop.

Context, memory и auto-compaction
Как управлять контекстом, делать retrieval, сохранять рабочее состояние и сжимать историю без потери критичных данных.

Prompt caching и cost-aware context
Как строить стабильные prompt-prefixes, deterministic tool ordering и cache-friendly agent runtime.

Skills и progressive disclosure
Как подключать reusable workflows: короткий skill index сначала, полные инструкции только при необходимости.

MCP и external connectors
Как подключать внешние системы через governed connectors: namespacing, auth, permissions, audit logs и least privilege.

Security, approvals и sandboxing
Prompt injection, secrets, approval flows, draft-vs-commit, sandbox для open-world tools.

Observability и evals
Как логировать agent runs, tool calls, approvals, compactions, failures и тестировать harness на реальные failure modes.

Provider API patterns
Практики для OpenAI, Anthropic и OpenAI-compatible API без привязки к одному провайдеру.

Checklists и coverage audit
Готовые списки для проверки: перед запуском, перед добавлением tools, перед подключением skills/connectors и перед продом.
GitHub GitHub - DenisSergeevitch/agents-best-practices: Provider-neutral Agent Skill for Codex, Claude Code, and agentic harness design. Provider-neutral Agent Skill for Codex, Claude Code, and agentic harness design. - DenisSergeevitch/agents-best-practices
  • 🔥 3
  • ❤ 1
Post #704 514
  • 😁 7
Post #703 512

Forwarded from e/acc

Завтра пройдет интересный стрим (бесплатный) про то как использовать ИИ для здоровья. Я не спикер, но тема любопытная. Ниже небольшое био спикеров:

​Оля Конышева (@nontoxic_productivity) — продакт (ex-Яндекс), нутрициолог, инструктор @badbuddhas. биовозраст по WHOOP — минус 12 лет. разобрала кожу, расписание и физиологию через данные — с конкретными выводами и изменениями.

​Тоня Жукова (@zhukovatonya) — серийный предприниматель, 2 экзита (Farfetch, IQ Option). три цикла исследований, протокол под SNP с алертами в Telegram. железо, дозировки, паттерны — всё через данные.

​Илья Гиндин (@gindinthecreator) — основатель comulabs, t4s, seenbot. два года анализирует показатели здоровья с ИИ: WHOOP, анализы, календарь — агенты видят то, что сам не замечаешь. собрал открытый OpenHealth.

Регистрация тут.
  • 🔥 3
  • 😁 1
  • 💩 1
Post #702 542

Forwarded from Сто лет бэклога

Почему мозг в миллион раз экономичнее видеокарты

Навин Рао — человек, который успел построить почти всё в мире AI-железа: основал одну из первых чиповых компаний (её купил Intel), потом MosaicML (её купил Databricks), руководил там всем AI-направлением. А теперь занялся самым странным своим проектом — компанией Unconventional AI. И в коротком выступлении он, по сути, говорит неприятную вещь: мы строим искусственный интеллект на компьютерах, которые для этого вообще не предназначены.

Цифровой компьютер — это случайность из 1940-х. Двоичный код, числа с плавающей точкой — всему этому почти 80 лет. Придумано под совсем другие задачи и под совсем другое железо. Мы до сих пор строим на этом фундаменте не потому, что он идеален, а просто по инерции: так можно выпустить продукт за пару лет. Рао предлагает вернуться к началу и спросить — а что, если считать вообще иначе?

Еще говорит, что скооро в мире кончится энергия для AI. Не через 10 лет — через 2–4 года. Уже сегодня обучение и работа моделей съедают гигаватты.

При этом:
- Все 8 миллиардов человеческих мозгов вместе — это около 160 гигаватт (каждый мозг ≈ 20 ватт, как тусклая лампочка).
- Вся выработка энергии в мире — около 9000 гигаватт, и она крутит вообще всё: отопление, заводы, электромобили.
То есть всё человечество думает на крошечной доле общей энергии планеты.

Если сравнивать мозг человека с моделями:
- человеческий мозг работает на ~20 ваттах;
- а одна большая AI-модель, если посчитать всё вместе, её обучение плюс работу на серверах для миллионов людей — тянет на мегаватты, а то и под гигаватт.

Это примерные цифры. Но суть тут в разнице: между 20 ваттами и миллионами ватт — разница примерно в миллион раз. И при этом мозг по-прежнему умнее :).

Хороший пример — белка. Она прыгает с ветки на ветку и не промахивается, работает на меньше чем 10 милливаттах — это в сто раз меньше телефона. Ни один гигаваттный дата-центр такого трюка пока не повторит.

---

А что Рао предлагает взамен?

Он говорит: мозг не перемножает матрицы и не считает строго в нулях и единицах. Он использует нелинейную динамику.

Что такое «линейно» и «нелинейно» на пальцах. Линейно — это когда вдвое сильнее нажал, вдвое больше получил. Нелинейно — это когда элементы влияют друг на друга, и из этого взаимодействия рождается сложное поведение, которое не сводится к простой сумме.

Самый наглядный пример — метрономы на общей подставке. Поставьте десяток метрономов вразнобой на лёгкую доску. Сначала хаос и каждый тикает как хочет. Но они чуть-чуть толкают доску, доска чуть-чуть толкает их обратно и через минуту, без всякого оркестратора, они начинают качаться синхронно. Никто их не программировал. Согласованность возникла сама, просто из того, что они связаны между собой.

Рао строит чип из таких же связанных «качалок» (осцилляторов), только связи между ними делает обучаемыми — и тогда систему можно вести к нужному ответу.

---

В итоге он говорит: настоящий потолок в физике энергопотребления самого железа. И мозг живое доказательство, что можно быть в тысячи, а то и в миллион раз экономичнее, если перестать цепляться за компьютер в его нынешнем виде.

Чип они собрали за полгода во многом потому, что им помогал AI. И закончил он фразой: *«Кажется, мы впервые сможем понять, как работает мозг, — потому что наконец-то можем его построить»*.
  • 👍 6
  • 🔥 3
Post #701 494

Forwarded from Vibe Coding: OpenCode, Claude Code, Codex, Cursor, Kilo

Антропик представили динамические рабочие процессы в Claude Code

Работа, которую вы обычно планировали на кварталы, теперь выполняется за несколько дней.


Динамические рабочие процессы доступны уже сегодня в режиме предварительного просмотра для исследовательских целей в CLADE Code CLI, Desktop и расширении VS Code для планов Max, Team и Enterprise (при наличии прав администратора).

Для достижения наилучших результатов при использовании динамических рабочих процессов включите автоматический режим. После этого у вас будет два способа запустить рабочий процесс:

Попросите Клода создать динамический рабочий процесс напрямую (например, «Создать рабочий процесс»), или
Включите новую настройку, специфичную для Claude Code, под названием [название настройки] ultracode. Она доступна через меню «Уровень сложности» и устанавливает уровень сложности на «xhigh», позволяя Claude автоматически определять, когда использовать рабочий процесс для выполнения вашей задачи.

Статья:
https://claude.com/blog/introducing-dynamic-workflows-in-claude-code

Документация:
https://code.claude.com/docs/en/workflows
Post #697 540

Forwarded from Эксплойт

Фиаско: один из разработчиков Anthropic перед свадьбой закинул в Claude 12 лет переписки с будущей женой и попросил сделать сайт. Результат убил.

Самые популярные эмодзи в переписке: 😭 😡😑

@exploitex
  • 😭 8
Post #696 586

Forwarded from Сергей Булаев AI 🤖

🔹 addyosmani/agent-skills
⭐ 45008 звёзд · Shell

Эдди Османи собрал 23 workflow'а для AI-агентов, покрывающих цикл от спецификации до прода. Работает с Claude Code, Cursor, Gemini CLI, Windsurf, OpenCode, Copilot и Kiro IDE через 7 slash-команд: /spec, /plan, /build, /test, /review, /code-simplify, /ship.

Фишка — таблица рационализаций в каждом skill: типичные отмазки пропустить шаг и контраргументы к ним. Верификация обязательна на каждом этапе: тесты, build output, runtime data. Рекомендуемый размер коммита — около 100 строк.

В комплекте 3 персоны (code-reviewer, test-engineer, security-auditor) и 4 чек-листа: тесты, OWASP Top 10, Core Web Vitals, WCAG 2.1 AA.

репозиторий

Сергей Булаев AI 🤖 — об AI и не только
  • 👍 5
  • 🙏 1
Post #695 618

Forwarded from EDU (Bayram Annakov)

7 идей с конфы Code w/ Claude

Посмотрел, наконец, конфу Code w/ Claude, мои топ 7 идей + одна центральная тема всех выступлений ниже:
1) Haiku берёт Opus в эдвайзеры - CPO GitHub рассказал про их хак: даёте агенту, работающему на слабой модели (haiku) эдвайзера на модели поумнее, и в случае чего он обращается к ней за помощью, простым tool call-ом. Красиво; детальнее тут и тут

2) Время полураспада агента - любой код, компенсирующий непредсказуемость поведения агента имеет время полураспада равное месяцам (6-12 обычно) —> лабы его реализуют как встроенная возможность модели/api; а вот код, "подключающий" агента к вашему уникальному миру (контекст, авторизация, внешние системы и тп) - реально уникален и туда должны быть приложены наши усилия —> источник

3) Как работет Claude Code команда - команда отказывается от долгосрочных роадмапов (just in time planning) и ряда других процессов; технические дебаты решаются 2-3 альтернативными пулл-реквестами, узкое место свдигается на проверку, безопасность —> источник

4) Дайте каждому агенту свой компьютер с теми же тулами и "глазами", что и у вас - онбординг для агентов должен быть аналогичен онбордингу сотрудника + юзаем computer use + self improvement loop (каждый агент репортит ошибки/затруднения, затем их решают люди + агенты, и потом рой агентов тестит и подтверждают что полегчало). Источник

5) Оценивайте новую версию модели по тому, помогает ли она вам удалить код - лучший сигнал, что надо апгрейдиться, что вы теперь можете удалить какой-то код/сократить промпт. Источник

6) 3 аспекта памяти агента: хранение, структура, процесс - проектируя память агента, мы должны ответить на 3 класса вопросов: где хранится память, структура (.md файлы для памяти, скиллы - как "процессная" память), и процесс (что триггерит обновление, как оно происходит). Источник

7) Закон Amdahl как бизнес стратегия - если вы ускоряете один этап процесса в 3-5 раз, то все остальные становятся узким местом; задачей CEO/продакта должны стать те самые медленные стадии, что ограничивают прогресс; причем желательно перепроектировать/инвестировать в них сразу, а не делать после. Идеально вписывается в мои заметки с полей (1, 2). Следующие юникорны будут в областях, в которых кто-то сможет построить инфраструкутуру для верификации/оценки аутпута модели, которой нет у других. Источник

Центральная тема всех токов имхо:
узкое место сдвигается в инфраструктуру вокруг модели - harness, системы обратной связи, системы верификации, контекст и память, безопасная работа агентов, эвалы.


Разумеется, там сильно больше, чем эти 7, поэтому приятного просмотра!
YouTube Code with Claude 2026: Opening Keynote Get the latest updates from Anthropic's engineering and product leaders at the Code with Claude 2026 opening keynote in San Francisco.
  • 👍 3
  • ❤ 2
Post #694 512
Мы уже полгода делаем сразу 2 интерфейса:
- для людей
- для агентов
  • 👍 1
Post #693 661
Codex уже 7 часов непрерывно оптимизирует интерфейс сервиса.

Harness постучался в дом неожиданно.
  • 👍 3
  • 🔥 1
Post #686 659

Forwarded from Антон Урусов. Вайб-заметки

ИИ и дети

Мой друг Тёма, с которым мы жили в одной комнате общаге, создал успешную технологическую компанию в ИИ и продал её одному из крупнейших банков

А сейчас преподает детям нейросети в начальной (!) школе Летово

Нейросети не заменят учителей

Но уже сейчас становятся мощным инструментом персонализации обучения - превращая образование и скучные домашние задания в увлекательные интерактивные игры и творчество

Тёма записал увлекательный и вдохновляющий подкаст с живыми примерами проектов и заданий, которые он делает с сыном и другими детьми

Реально круто и интересно. А самое главное, это можете делать и вы со своими детьми
  • 🔥 5
Older posts →
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →