TGViewer
Channel Public Channel
very vibe coding

very vibe coding

@veryvibecoding

Канал Алексея Макрушина об экспериментах в области vibe coding и всего интересного, что есть в области AI, ML и тому подобного
Subscribers
120
Photos
463
Videos
126
Links
991

Showing posts older than #1007 · Back to latest

Older Posts 20 shown
Post #1006 33
Про ускоренный переход на постквантовую криптографию зацепило (это шифры, которые не ломаются известными квантовыми алгоритмами, в отличие от большинства, используемых сейчас). Вчера еще читал новость, о том, как квантовый компьютер приделали к роботу, и он стал в 30 раз быстрее обрабатывать всю информацию о движениях (наши люди, кстати, делали)...

https://t.me/ai_machinelearning_big_data/9749
Telegram Machinelearning ✔️ Apple дистиллирует Google Gemini. В рамках партнерства с Google, Apple получила глубокий доступ к архитектуре Gemini. Инженеры используют дистилляцию знаний, чтобы перенести логику в легковесные решения для Apple Intelligence. Модель Apple анализирует…
Post #1003 31

Forwarded from Machinelearning

✔️ Репозиторий, который может настроить Claude

Система оптимизации производительности для AI-агентов. От победителя хакатона Anthropic.

Готовые к продакшену агенты, хуки, скилы, правила и MCP-конфигурации, которые эволюционировали за 10 месяцев ежедневной интенсивной работы над реальными продуктами.

Работает с Claude Code, Codex, Cowork и другими системами для AI-агентов.

🟡Github: https://github.com/affaan-m/everything-claude-code
🟡Гайд по работе: https://x.com/affaanmustafa/status/2012378465664745795
🟡Гайд по безопасности: https://x.com/affaanmustafa/status/2033263813387223421

@ai_machinelearning_big_data

🎯Полезные Мл-ресурсы

#AI #ML #aiagents #Claude
Post #1002 30

Forwarded from Tips AI | IT & AI

Figma похоже начали догадываться что людям нужно больше.

Они открыли свой канвас для AI агентов.

Новый use_figma — агент создаёт и редактирует компоненты прямо на канвасе через вашу дизайн-систему. Переменные, компоненты, auto layout.

Claude Code, Codex, Cursor и другие MCP-клиенты теперь могут работать с Figma напрямую.

Появились skills которые объясняют агенту как работать в Figma.

Из основных:
• figma-implement-design: читает дизайн из Figma и генерирует рабочий код
• figma-generate-library: строит дизайн-систему в Figma из вашей кодовой базы
• figma-generate-design: собирает экраны из реальных компонентов и переменных
• figma-create-design-system-rules: сохраняет стандарты команды, агент их запоминает и применяет


Для команд где дизайнеры живут в Figma, то что нужно.

Сейчас бесплатно (бета), потом будет платным.

Гайд | Skills| GitHub

@tips_ai #news
Post #1001 32
В продолжение прошлого поста - сейчас есть команда -dangerously skip permissions, которая всегда будет говорить «да» на вопросы пользователя, а теперь будет авто мод, который смотрит, где опасно, где нет, и будет человека дергать, но только по опасным случаям.

Сейчас по отдельным командам можно в настройках разрешения устанавливать, и это работает, но тут все будет работать автоматически, и в разных ситуациях по одной и той же команде Клод будет сам выполнять команду или спрашивать в зависимости от обстоятельств
Post #999 30
Кстати, к вопросу. Такие обзоры как тот, что выше, пишет мне мой OpenClaw, когда я ему закидываю статью с командой «прочитать, пересказать». Удобно
  • 👍 1
Post #998 31
Anthropic написал статью, как они строили harness для долгих автономных задач, прежде всего для:

• генерации качественных интерфейсов,
• многочасовой разработки полноценных приложений без постоянного участия человека.

Главная идея: проблема не только в модели, а в архитектуре процесса вокруг модели.

───

Ключевые выводы статьи

1) Для длинных задач одного агента мало

На длинных прогонах агент:

• теряет нить,
• начинает “закругляться” раньше времени,
• переоценивает качество собственной работы.

Поэтому они ушли от наивного solo-agent режима к многоагентной схеме.

───

2) Они используют роли: planner / generator / evaluator

Planner

• берет короткий пользовательский запрос,
• разворачивает его в полноценный product spec.

Generator

• делает работу по спринтам/частям,
• реализует фичи одну за другой.

Evaluator

• независимо проверяет результат,
• ищет баги и оценивает качество,
• дает обратную связь генератору.

Это важно: агент не должен сам себя честно оценивать — он слишком снисходителен к собственной работе.

───

3) Для долгих задач важна работа с контекстом

Они отдельно подчеркивают проблему context anxiety:

• модель, чувствуя длинный контекст, начинает prematurely wrap up,
• или просто деградирует по качеству.

Раньше они боролись с этим через context resets:

• новый агент,
• чистый контекст,
• структурированный handoff-файл между сессиями.

Позже с Opus 4.5 смогли больше полагаться на compaction, но сама идея осталась:
нельзя просто бесконечно тянуть один и тот же контекст.

───

4) Коммуникация между агентами — через файлы/артефакты

Вместо хаотичного общего чата они передают состояние через структурированные файлы:

• контракт спринта,
• замечания,
• QA-отчеты,
• handoff-артефакты.

Это делает систему устойчивее и понятнее.

───

5) Для субъективных задач они формализуют критерии

На примере frontend-дизайна они показывают, что даже субъективные вещи можно оценивать по критериям:

• design quality
• originality
• craft
• functionality

После этого evaluator может не просто говорить “нравится / не нравится”, а давать направленную обратную связь.

───

6) Для full-stack разработки они используют “спринт-контракты”

Перед началом спринта generator и evaluator договариваются, что именно считается done.

Это очень сильная идея:

• спецификация сверху остается high-level,
• но на каждый спринт есть конкретный контракт,
• evaluator потом проверяет именно его.

───

Что у них получилось

По их словам:

• solo-agent сделал заметно хуже,
• полный harness работал намного дольше и дороже,
• но качество итогового продукта было существенно выше.

Пример из статьи:

• solo run: ~20 минут, ~$9
• full harness: ~6 часов, ~$200

То есть главный trade-off:
качество и автономность растут, но резко растут цена, время и сложность orchestration.

───

Статья не про “волшебную модель”, а про инженерную правду:

1. долгие задачи = это проблема процесса, а не только LLM
2. независимая оценка критична
3. артефакты и контракты важнее длинного чата
4. контекст надо управлять, а не просто копить
Anthropic Harness design for long-running application development Anthropic is an AI safety and research company that's working to build reliable, interpretable, and steerable AI systems.
Post #997 30
Post #996 27

Forwarded from Denis Sexy IT 🤖

⚙️ Если вы кодите с кодинг агентами, потестируйте пожалуйста спеку которую я собрал:
https://github.com/DenisSergeevitch/repo-task-proof-loop
(Спека - инструкции как кодинг агенту лучше работать с задачей)

В issue можно отправить агента описать если что-то не работает

***

– Собирал я ее на основе пейпера не про кодинг агента, а про то как агент становится «персональным» – в пейпере как раз про то, как убедится что агент правда делает то, что обещал, мне показалось это интересным подходом чтобы обернуть в кодинг агента

– Работает примерно так: само генерирует критерии приемки исходя из задачи, заставляет кодить саб-агента, проверяет работу, сбрасывает контекстное окно где надо (а где нет - не сбрасывает), фиксит баги, и так по кругу, подробнее в репе

– Устанавливать ее нужно как Skill, и я бы советовал Codex, так как у него саб-агенты лучше сделаны чем у Claude Code

– Использовать так: вы ей даете какую-то гигантскую задачу в стиле: «Spawn subagents. Use $repo-task-proof-loop to continue the task described below in this repository. Reuse the matching repo-local task if it already exists; if not, stop after explaining that init should be run first.
...» <- вот тут вы упоминаете задачу или просто вставляете свои А4 текста

– Тестить ее лучше на новых проектах, ну или в проектах где уже есть git, так как она создаст много промежуточных файлов в папке .agents

– план мод можно с ней не использовать

👩‍💻👩‍💻👩‍💻👩‍💻👩‍💻

В моих тестах, если агент не забывает вызывать этот скилл, у меня получается делать очень сложные проекты, но тратя больше квоты; ночью Codex работал над задачей почти 5 часов (рекорд у меня пока 12 часов)

Короче, я пока доволен – буду развивать если окажется полезной
GitHub GitHub - DenisSergeevitch/repo-task-proof-loop: Spec driven skill with subagents spawning Spec driven skill with subagents spawning. Contribute to DenisSergeevitch/repo-task-proof-loop development by creating an account on GitHub.
Post #995 35
Post #994 35
GigaChat в долларах

GigaChat 2 Lite

• 20 млн токенов = 1 300 ₽ ≈ $14.4
• 100 млн токенов = 6 500 ₽ ≈ $72.2
• Цена за 1 млн токенов ≈ $0.72

GigaChat 2 Pro

• 3 млн токенов = 1 500 ₽ ≈ $16.7
• 15 млн токенов = 7 500 ₽ ≈ $83.3
• Цена за 1 млн токенов ≈ $5.56

GigaChat 2 Max

• 3 млн токенов = 1 950 ₽ ≈ $21.7
• 15 млн токенов = 9 750 ₽ ≈ $108.3
• Цена за 1 млн токенов ≈ $7.22

За 20 баксов 3 млн токенов гигачата или подписка на Claude, GPT или Gemini - печаль..

Ну нет в стране инференса
Post #993 41
Вообще это классно, когда свои модели появляются, но бенчмарки несколько расстраивают.. Впрочем, лиха беда начало.

Есть и еще одна ложка дегтя - неделю назад пробовал подписаться на Сбер, но есть оплата только за апи, и цены выше чем на Соннет. Ну вот к этому я точно не готов. Дайте нормальную подписку - я возьму

https://t.me/ai_machinelearning_big_data/9732
Telegram Machinelearning ⚡️ Сбер выпустил крупнейшее обновление ГигаЧат — и выложил в open source. GigaChat Ultra и GigaChat-3.1-Lightning уже под MIT-лицензией. Текущее обновление дало заметный прирост по качеству ответов, устойчивости генерации и прикладным сценариям использования.…
Post #992 44
Post #991 43
very vibe coding Вчера в первый раз столкнулся с тем, что Claude code из терминала сам запустил Хром, полез с интернет и начал парсить базу данных.. Скоро так любую программу сможет запускать, не только браузер.. https://t.me/denissexy/11312
Ну и, кстати, Codex от OpenAI умеет то же самое
Post #990 42
У Claude code, кстати, появилась команда /schedule , которая позволяет запускать работу по расписанию. Хорошая тема
Post #989 43
Вчера в первый раз столкнулся с тем, что Claude code из терминала сам запустил Хром, полез с интернет и начал парсить базу данных..

Скоро так любую программу сможет запускать, не только браузер..

https://t.me/denissexy/11312
Telegram Denis Sexy IT 🤖 Антропик правда OpenClaw строит – теперь можно управлять компьютером через Claude: https://claude.com/product/cowork#dispatch-and-computer-use Говорите с телефона – мол, иди сделай задачу X, он сам экран смотрит и делает работу ☕️
Post #988 34

Forwarded from Tips AI | IT & AI

LiteParse — парсер документов, чтобы агенты точнее читали текст с PDF, Word, Excel, PowerPoint и картинок.

Обычно Claude Code читает PDF через pypdf или pdfplumber и каждый раз пишет для этого новый Python скрипт.

Тут LiteParse делает это одной командой. Парсит локально, быстро и без GPU.

Подойдет, если хотите, чтобы агент мог быстро прочитать PDF и работать дальше, а если нужно разобрать что-то визуально, то сделает скриншоты.

Для простых доков хватит, для сложных таблиц, нужно решение поточнее, например их облачный LlamaParse или olmOCR 2 на своем GPU.

Установка: npm i -g @llamaindex/liteparse

Использовать командами:
• lit parse document.pdf
• lit screenshot document.pdf

Есть еще skill для Claude Code и GitHub

@tips_ai #tools
  • ❤ 1
Post #987 38
На выходных повозился с памятью. Пробовал Cognee (уже второй раз пробую, но сейчас все работает вообще без вопропров), Graphiti, собственное решение с графом (не просто RAG!) на Neo4j. Для индексации использовал Gemini Flash да еще и по подписке. Для графов нужны только большие и умные модели. Денег на них не напасешься (ну разве что купить Мак Студио и поставить МиниМакс). Первые результаты достаточно неожиданные.

Но лимиты по подписке высажены, попробую завтра продолжить - проверить, что лучше работает. Не хочется ошибиться
Post #986 43
Нашел тут то, что и не надеялся найти. Какие-то французы написали язык программирования Catala, который применяется для формализации законодательства. То, что нужно. Уже перевел нужные разделы на русский - буду тестировать. Через пару недель выступаю на большой конференции - посмотрим, что успею сделать..
  • 🔥 3
Older posts →
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →