TGViewer
Channel Public Channel
Вайб-кодинг

Вайб-кодинг

@vibecoding_tg

Авторский канал по ВАЙБ КОДИНГУ

Ссылка для друзей: https://t.me/+ll3pbl442dNkZmYy

Cотрудничество: @devmangx

РКН: https://clck.ru/3RRVfk
Subscribers
63.1K
Photos
2.2K
Videos
917
Links
1.5K

Showing posts older than #3571 · Back to latest

Older Posts 17 shown
Post #3570 16.8K
Сила агентных систем часто зависит не столько от самой модели, сколько от обвязки вокруг неё. Без модели она, конечно, бесполезна, но именно harness определяет, как агент использует инструменты и выполняет задачи.

Visa открыла исходный код своей платформы для агентного сканирования уязвимостей. К ней можно подключить практически любую модель: закрытую облачную, открытую через API или развёрнутую локально. 🙄
GitHub GitHub - visa/visa-vulnerability-agentic-harness: Visa Vulnerability Agentic Harness Visa Vulnerability Agentic Harness. Contribute to visa/visa-vulnerability-agentic-harness development by creating an account on GitHub.
Post #3569 17.4K
Тарик из Anthropic опубликовал новые правила контекст-инжиниринга для моделей Claude 5.

Эти же принципы позволили сократить системный промпт самого Claude Code примерно на 80% - без измеримого ухудшения результатов на их бенчмарке по кодингу.

tldr:

• CLAUDE.md только для подводных камней. Удалите всё, что модель и так может понять, изучив репозиторий, и тратьте токены на то, на чём она действительно может споткнуться.
• Заменяйте жёсткие запреты описанием стиля. Раньше правило звучало как никогда не пиши комментарии. Теперь — пиши код, который соответствует плотности комментариев и неймингу в окружающем коде.
• Не дублируйте одно и то же правило в системном промпте и описании инструмента. Оставьте его только в описании инструмента.
• Разбивайте длинный скилл на несколько файлов и загружайте только то, что нужно для конкретной задачи.
• Спецификация необязательно должна быть в Markdown. Подойдут тестовый набор, HTML-макет или функция из другой кодовой базы.

Это полезнее, чем следующие десять скиллов.

Прочитайте его материал сегодня, а затем запустите /doctor, чтобы сократить собственные CLAUDE.md и скиллы. 🎉
Post #3567 16K
На эти два графика по Opus 5 точно стоит посмотреть.

Всего два месяца назад вышла Opus 4.8, и тогда её результат на ARC-AGI 3 был ниже 5%. Теперь Opus 5 показывает уже больше 30%. Такой скачок всего за два месяца выглядит просто невероятно.

При этом новая модель не только обошла Fable 5, но и стала эффективнее Opus 4.8. По данным Artificial Analysis, Opus 5 даёт сопоставимый с Fable 5 уровень интеллекта, но стоимость выполнения задачи у неё на 26% ниже.

За два месяца расклад на рынке успел полностью измениться.

Похоже, Opus 5 стала именно тем релизом, которого многие ждали. Теперь очередь за GPT-6 от OpenAI, а там, вероятно, недалеко и до Fable 5.1.
Post #3566 17.4K
Claude Opus 5 уже вышел.

По уровню возможностей она обходит Fable 5 почти во всех тестах, но при этом стоит вдвое дешевле.
Post #3565 17.2K
Связка Kimi K3 и Tinker позволяет почти полностью автоматизировать исследовательский цикл.

Поскольку большая часть инфраструктуры для обучения уже скрыта под капотом, изменения, которые вносит Kimi, остаются сосредоточены именно на эксперименте. Благодаря этому проще отслеживать, что изменилось, и направлять следующие запуски.

При попытке воспроизвести работу Self-Distilled RLVR модель с первого раза собрала базовую реализацию, затем провела 19 экспериментов с шестью конфигурациями и оформила итоговый отчёт. Заодно она сама подготовила его версию на китайском языке.

Попробовать авторесёрч с Kimi можно самостоятельно на openresearch.sh. Для воспроизведения эксперимента используйте пример из репозитория.
Post #3564 15.8K
Если экспериментируете с переходом с Markdown на HTML в качестве формата ответов AI-агента, обратите внимание на этот репозиторий.

https://github.com/anthropics/html-effectiveness
GitHub GitHub - anthropics/html-effectiveness: HTML effectiveness examples HTML effectiveness examples. Contribute to anthropics/html-effectiveness development by creating an account on GitHub.
Post #3563 17.6K
Локальный ИИ стал намного проще.

ODS сам определяет характеристики компьютера, подбирает подходящую модель, скачивает её и запускает локальный инференс вместе с Open WebUI.

Через одну панель можно подключать голос, агентов вроде Hermes, RAG, поиск, генерацию изображений, рабочие процессы и другие инструменты.

Не нужен облачный сервис и подписка. Ваши запросы и данные остаются на вашем устройстве, если только вы сами не решите иначе.

https://github.com/Osmantic/ODS
Post #3562 15.3K
Кстати, теперь в одном проекте Codex можно работать сразу с несколькими папками.

К локальному проекту можно подключить связанные директории с кодом, документацией и референсными файлами. Codex сможет читать и изменять файлы во всех них, при этом одна основная папка по-прежнему останется корнем Git-репозитория.

Основная папка отвечает за Git-операции, код-ревью, PR, файл AGENTS.md и поиск доступных скиллов. 🙂
Post #3561 15.2K
Вайб-кодинг Claude обновил голосовой режим: теперь в нём доступны более мощные модели, включая Opus и Sonnet. Во время разговора Claude также может обращаться к подключённым инструментам, например к почте и календарю. Кроме того, голосовой режим стал поддерживать больше…
Следом голосовой режим обновила и OpenAI.

ChatGPT Voice появился в десктопном приложении и теперь позволяет голосом управлять несколькими агентами в ChatGPT Work и Codex.

В основе функции лежит новая модель GPT Live 1 с поддержкой Full Duplex, тоесть она может одновременно слушать пользователя, отвечать и координировать работу внутри приложения.

Обновление уже распространяется на macOS и Windows для тарифов Plus, Pro, Business, Edu и Enterprise.

Управлять Codex голосом также можно через приложение ChatGPT для iOS при подключении к компьютеру по удалённому доступу.

Android — скоро 👀
Post #3559 15.3K
Claude обновил голосовой режим: теперь в нём доступны более мощные модели, включая Opus и Sonnet.

Во время разговора Claude также может обращаться к подключённым инструментам, например к почте и календарю. Кроме того, голосовой режим стал поддерживать больше языков на всех тарифах.

Обновление уже начинает появляться в открытой бете на мобильных устройствах, десктопе и в веб-версии.
Post #3557 15.9K
Интересный факт: ChatGPT Work предоставляет платным пользователям встроенную виртуальную машину с 9 ядрами и 20 ГБ памяти.

По возможностям он напоминает VPS, на нём можно запускать любые удалённые сервисы, включая автоматизацию, развёртывание агентов и другие задачи.

В таком контейнере можно даже установить и протестировать OpenClaw. 😜
Post #3556 16.3K
Этот скилл автоматически улучшает GitHub README.

Он сначала анализирует проект, а уже потом перерабатывает README, чтобы не придумывать несуществующие функции и возможности.

Репозиторий: https://github.com/oil-oil/beautify-github-readme
Post #3555 16.1K
Эндрю Ын: «Возможно, я единственный человек в мире, у которого и Сэм, и Дарио работали под моим руководством».

«Есть одна вещь, которую я точно не смог бы предсказать несколько лет назад: в итоге Китай стал гораздо более открытым, чем США, если говорить о способах развития и внедрения инноваций в ИИ.

Я очень хорошо знаю американскую AI-экосистему, потому что основал Google Brain и участвовал в её развитии. Возможно, я единственный человек в мире, у которого и Сэм, и Дарио работали в подчинении. Поэтому я хорошо знаком с людьми, которые стоят за этими командами.

Когда ChatGPT вышел в конце 2022 года, США сильно опережали Китай. Но с тех пор Китай грамотно использовал свои возможности, сделав ставку на open source и экосистему открытых весов моделей. Китайские команды проводят исследования и бесплатно публикуют научные работы в интернете, где их может прочитать любой желающий.

Кстати, многие ведущие американские команды внимательно изучают большое количество китайских исследований, перенимая идеи и получая от этого значительную пользу. Честно говоря, многие технологии, которые сегодня используют ведущие AI-команды в США, появились благодаря исследовательским инновациям, которые они узнали из китайских работ.

Поэтому я считаю, что обмен знаниями идёт в обе стороны».


источник
Post #3554 14.6K
Методы квантования LLM, которые я бы изучил, если бы мне нужно было запустить модель 70B на одной GPU:

Модель 70B в FP16 требует около 140 ГБ только под веса. В 4-битном формате этот объём уменьшается до 35 ГБ, что уже помещается на одну видеокарту.

Но простое округление значений не работает для больших моделей. Примерно 0,1% скрытых размерностей содержат значения, которые могут быть до 20 раз больше, чем остальные значения в тензоре, и они ломают квантовочную сетку для всех остальных параметров.

Каждый из этих 5 методов решает проблему выбросов на разном этапе:

1. RTN (Round-To-Nearest)
Игнорирует проблему.
Каждый вес просто округляется до ближайшего уровня квантования без использования калибровочных данных.
Самый дешёвый вариант, но самый слабый при низкой разрядности.

2. GPTQ
Исправляет последствия округления.
Квантует слой за слоем, столбец за столбцом, и после каждого шага корректирует оставшиеся веса, чтобы компенсировать возникшую ошибку, прежде чем перейти дальше.

3. AWQ (Activation-aware Weight Quantization)
Защищает важные веса до округления.
Находит примерно 1% каналов весов, которые оказывают наибольшее влияние, и масштабирует их так, чтобы они лучше переживали квантование.
При этом итоговая модель всё равно полностью работает в обычном INT4.

4. LLM.int8()
Изолирует выбросы во время инференса.
Размерности с выбросами выполняются в FP16, а остальные 99,9% параметров работают в INT8. Затем результаты объединяются.

5. QAT (Quantization-Aware Training)
Решает проблему ещё во время обучения.
Модель дообучается с учётом квантования: округление встроено в каждый forward pass, поэтому модель заранее адаптируется к возникающим потерям до фактического применения квантования.

Все пять методов создают один и тот же результат — модель, работающую с меньшей точностью представления по сравнению с исходной обученной версией.

Разница только в том, на каком этапе решается проблема выбросов.
Визуализация ниже хорошо суммирует эти подходы.

Есть отличная статья с подробным исследованием методов квантования LLM:

https://arxiv.org/abs/2411.02530
Post #3553 15K
Антропики добавили несколько новых возможностей в Claude Managed Agents. 🏋️‍♂️

Теперь можно:
- настраивать effort level отдельно для каждого агента;
- запускать сессии с заранее заданными событиями;
- добавлять до 500 скиллов на одну сессию;
- использовать вебхуки для окружений и хранилищ памяти;
- получать поток событий от субагентов в режиме реального времени.

Протестировать новые возможности можно через их cookbook.
Post #3552 15.3K
Конфликт вокруг открытых-моделей ИИ набирает обороты. 🤷‍♂️

США заявили, что располагают информацией о том, что Moonshot AI использовала дистилляцию модели Fable от Anthropic при разработке своей K3.

По утверждению американской стороны, для этого Moonshot AI создала внутреннюю платформу для масштабной дистилляции американских моделей, которая позволяла переключаться между разными способами доступа, чтобы избежать обнаружения. Также компания приобрела серверы с GB300 и получила доступ к таким системам в Таиланде, предположительно для обучения своих AI-моделей.

При этом США подчёркивают, что поддерживают опенсорс развитие ИИ. Легитимная дистилляция, которая помогает создавать более компактные и эффективные модели, остаётся важной частью экосистемы.

Однако, по мнению американских властей, скрытая промышленная дистилляция, направленная на получение доступа к проприетарным технологиям и подрыв исследований, является неприемлемой.

«Мы поддерживаем опенсорс в области ИИ и инновации, которые он позволяет создавать. Но опенсорс — это не свободная охота на американскую интеллектуальную собственность. Если компании из КНР проводят скрытые масштабные операции по дистилляции, переходящие черту и превращающиеся в кражу IP, санкции и внесение в Entity List будут рассматриваться как возможные меры».


На фоне этих заявлений почти 200 компаний из Кремниевой долины, включая Proton и Y Combinator, призвали администрацию Трампа не ограничивать доступ к китайским AI-моделям с открытыми весами. По их мнению, такие ограничения могут нанести серьёзный ущерб следующему поколению американских стартапов, которые используют открытые модели для разработки новых продуктов.
Post #3551 16K
Плагин Claude Security для Claude Code теперь доступен в бета-версии.

Теперь можно прямо из терминала проверять код на уязвимости: запускать анализ изменений перед коммитом или выполнять полноценное сканирование всей кодовой базы, используя тот же Claude inference, который уже работает в Claude Code. 🎉
Older posts →
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →