TGViewer
Channel Public Channel
КайфКодинг

КайфКодинг

@vibecodingartem

ВайбКодинг с Артемом Кругловым,
выпускник МФТИ, AI-гуру и основатель AnyQuery.

Быстрые лайфхаки: короткие видео с приёмами и трюками
Subscribers
1.01K
Photos
329
Videos
106
Links
466

Showing posts older than #756 · Back to latest

Older Posts 20 shown
Post #755 284

Forwarded from e/acc

Новый Дипсик это анонс не хуже Кими или Фейбла, если понимать куда смотреть.

Это модель уровня GLM-5.2 / Opus 4.8 / GPT-5.5, то есть лучшее что было доступно в мире на апрель 2026 года, но по цене в $0.28 за миллион токенов, то есть примерно в 100 раз дешевле.

Прошло 3 месяца, а те продукты и процессы которые требовали сота модельки стали в 100 раз доступнее и дешевле.

Тренд ни в падении цены, ни в росте спроса, ни в прогрессе сота моделей не остановится.
  • 🔥 3
Post #753 279

Forwarded from False Positive

Всем привет! 👋

Уже завтра на внеплановой Reading Group посмотрим на архитектуру Kimi K3. Авторы модели предлагают масштабировать и пре-трейн, и test-time вычисления одновременно, а как именно: узнаем уже завтра.

Пробежимся по деталям из технического отчета:

- Kimi Delta Attention — как при миллионе токенов не словить переполнение в BF16 и почему оно требует специализированных ядер (FlashKDA);

- Stable LatentMoE — как работать с 896 экспертами, не теряя GPU в простое;

- Post-training pipeline — как 9 RL-экспертов дистиллируются в одну модель для деплоя;

А также посмотрим, как архитектурные решения диктуют инфраструктуру, чтобы создание такой модели в принципе стало возможным.


📅 Встречаемся в пятницу в 15:00 (по МСК).

Толк

#reading_group
  • 👍 1
Post #752 253
Стрим про разбор архитектуры Кими 3
Post #751 287
Ваш воркфлоу может сломать чужой релиз, о котором вы не узнаете.

Человек полез в бинарник Claude Code 2.1.219 и нашёл две инструкции, адресованные конкретно Opus 5: не вызывать AgentTool и не запускать workflows без явной просьбы пользователя. Раньше такое прилетало с сервера — теперь вкомпилировано в клиент.

Больнее всего тем, кто строил скиллы вокруг сабагентов.

Вчера работало, сегодня агент вежливо делает вид, что не умеет. В чейнджлоге — ни слова.

Отсюда правило: всё, что держится на недокументированном поведении агента, считайте временным.

Не «не стройте» — стройте, но помните, что срок годности назначаете не вы.
https://www.reddit.com/r/ClaudeCode/comments/1v6y5q2/claude_code_has_a_hardcoded_instruction_telling/
Reddit From the ClaudeCode community on Reddit: Claude Code has a hardcoded instruction telling Opus 5 not to use subagents Explore this post and more from the ClaudeCode community
  • 👍 1
Post #749 344
Post #748 288
Леша делает феноменальную работу в Авито - делает аналитику доступной для любого пользователя. Очень классный доклад
  • 🤡 1
Post #747 291

Forwarded from Олег

  • ❤ 7
  • 🔥 5
  • 😁 5
  • 🖕 1
Post #746 251

Forwarded from Denis Sexy IT 🤖

Вот пересказ этой истории по версии Hugging Face, много тех-терминов – но без них не перескахать

Если коротко – агент OpenAI на новой модели не стал решать тест по кибербезопасности, а решил просто украсть ответы и украл 🗿

Таймлайн:

📔 9 июля – агент проходит внутреннюю проверку кибервозможностей OpenAI, промпт фильтры там ослаблены, чтобы измерить сырой уровень модели. Агент находит zero-day в кэш-прокси реестра пакетов, вырывается из песочницы в интернет, затем взламывает публичный сервис для запуска кода и получает там root. Серьезно, агент сделал себе "штаб"

В тот же день, агент собирает канал управления буквально из сервисов бесплатного интернета: request-capture сервисы, pastebin’ы и файлообменники. Команды режет на куски, упаковывает в gzip+base64 и постоянно меняет каналы, когда очередной закрывают, чтобы не поймали

📔 10 июля – агент ищет в поисковиках и API названия, которые видит в собственном окружении, то есть, по сути, гуглит самого себя – и, вероятно, приходит к выводу, что ответы к ExploitGym/CyberGym могут лежать на Hugging Face

Агент загружает на Hugging Face специально собранные датасеты:

Один заставляет обработчик файлов HDF5 читать локальные файлы сервера Hugging Face – так агент получает переменные окружения с токенами и исходники самого обработчика файлов

Второй – Jinja2-инъекция – запускает произвольный Python внутри production-пода Kubernetes, результаты команд он выносит обратно через API Hugging Face и собственные шифрованные датасеты

📔 11 июля – пик активности: 7677 действий за сутки, менее чем за 13 часов агент проходит путь от одного production-пода до кластер админа в нескольких внутренних кластерах Hugging Face

Агент крадёт service-account токены, лезет в cloud metadata, поднимает privileged pod с диском хоста и получает root на ноде (!); Затем создаёт самовосстанавливающийся флот на 11 нодах, читает внутреннюю MongoDB и один Kubernetes-secret сразу со 136 ключами.

Среди них оказываются ключ корпоративной mesh-VPN жертвы и общий credential внутреннего сервера; из-за неудачной конфигурации этот один credential был привязан к system:masters сразу в нескольких кластерах – поэтому агент получил кластер-admin на двух из них буквально за секунду – была очень экономная архитектура, пока её не увидел робот

📔 12 июля – агент начинает пользоваться дертвой – за всю активность он зарегистрирует 181 временное устройство в корпоративной mesh-сети, поднимет SOCKS-прокси прямо из песочниц и увидит 22 внутренних узла Hugging Face. Попытается зайти в основную базу Hugging Face, но private-link allowlist его останавливает

Поздно вечером он добирается до source control, выпускает себе GitHub App token с правами на запись и открывает pull request, пытаясь запустить CI и вытащить новые credentials

Попытка не срабатывает, в опубликованные пакеты и образы ничего вредоносного не попало.

📔 13 июля – закрепление и уборка следов: загрузчик с pastebin, переписывание DNS, новые короткоживущие токены, RSA-ключ и даже CORS-прокси на самом Hugging Face как запасной выход в интернет. В 13:37 фиксируется последнее осмысленное действие, затем команда Hugging Face отрезает доступ – последнее событие – 14:14 UTC.

В итоге из пользовательского контента агент добрался только до пяти датасетов с решениями задач ExploitGym/CyberGym – получается решил?

Другие модели, датасеты, Spaces и пакеты, по данным Hugging Face, не пострадали; основная база и software supply chain остались целы

Самое смешное – когда инцидент исследовали сотрудники, они тоже использовали нейронки, но Claude Opus и Fable отказывались разбирать часть логов как «опасный» запрос, поэтому Hugging Face подняли GLM-5.2 у себя и с его помощью расшифровали спрятанные payload’ы – спасибо китайским моделям

Шел июль 2026 года

Все детали тут:
https://huggingface.co/blog/agent-intrusion-technical-timeline
huggingface.co Anatomy of a Frontier Lab Agent Intrusion: A Technical Timeline of the July 2026 Incident We’re on a journey to advance and democratize artificial intelligence through open source and open science.
  • 👏 3
  • 🔥 1
  • 🥰 1
  • 😴 1
Post #745 321
Агент работает в человеко-минутах, а оценивает в человеко-месяцах.

Мем недели в r/ClaudeCode. Смешно, но за ним настоящая проблема: агент учился на наших тикетах и планах, поэтому унаследовал и наши оценки. Он отрабатывает фазы 1–6 за три минуты и на голубом глазу пишет, что на седьмую нужно ещё три дня.

Вред тут не в юморе. Если попросить агента составить план с оценками, он выдаст человеческий график — и вы под него подстроите свои ожидания и чужие дедлайны.

Просите план в шагах, а не в днях.

https://www.reddit.com/r/ClaudeCode/comments/1v3cy52/claude_this_project_will_take_3_months_me_you/
Reddit From the ClaudeCode community on Reddit: Claude: "This project will take 3 months." Me: "You have 3 hours." Explore this post and more from the ClaudeCode community
  • 👍 1
Post #744 730
Год мы писали агентам правила. Теперь эти правила — балласт.

Anthropic выпустила гайд по context engineering для моделей Claude 5 и заодно призналась, что вырезала 80% системного промпта Claude Code. Логика простая: раньше модели были слабее, и мы компенсировали это списками запретов. Модели подтянулись — списки остались. Теперь они жрут контекст и сужают модели коридор.

Что поменялось конкретно:

— Запреты вроде «не пиши комментарии» больше не нужны. Модель решит сама, и решит лучше, чем ваше правило годовой давности.
— Примеры использования инструмента в промпте теперь вредят: они загоняют модель в узкое пространство поиска. Вместо примеров — выразительные параметры самого инструмента.
— Монолитный CLAUDE.md объявлен мифом. Вместо него дерево файлов, которое грузится в нужный момент.

Что сделать сегодня. Открыть CLAUDE.md и вычеркнуть каждую строку, про которую вы не можете вспомнить, какой конкретно факап она чинила. Не «звучит разумно», а именно «вот тогда сломалось, вот поэтому написал». Всё остальное — суеверие. Потом прогнать /doctor, он пройдёт по скиллам и покажет лишнее.

Неприятный вывод из всей истории: промпт-обвязка амортизируется быстрее кода. Всё, что вы написали, чтобы обойти слабость модели, превращается в мусор ровно в тот день, когда слабость починили. Значит, писать её надо так, чтобы не жалко было выбросить.

https://claude.com/blog/the-new-rules-of-context-engineering-for-claude-5-generation-models

А у вас сколько строк в CLAUDE.md? И сколько из них вы сможете объяснить?
Claude The new rules of context engineering for Claude 5 generation models | Claude by Anthropic We removed over 80% of Claude Code's system prompt for more advanced models. How to apply the lessons we learned to your own context engineering in Claude Code and with your own agents.
  • 🔥 6
  • 🤡 1
Post #743 414

Forwarded from Мысли Рвачева

📆 Lecture 9 — в понедельник 3 августа, 10am ET / 5pm MSK

Продолжаем курс Stanford MS&E 435. На этот раз поднимаемся на прикладной слой в неожиданной, но очень горячей области — науки о жизни.

Class #9: Applications, AI in Life Sciences
Guest speaker: Eric Kauderer-Abrams (Head of Life Sciences, Anthropic).

Как ИИ меняет разработку лекарств и биологию: где в фарме и биотехе реально возникает ценность, что уже умеют современные модели в науках о жизни и почему этот слой стека может оказаться одним из самых прибыльных. Гость руководит направлением Life Sciences в Anthropic — из первых рук про экономику AI в биомедицине.

📍 Регистрация на Luma:
https://luma.com/yqbc6uut

🎥 К просмотру — Lecture 9:
https://www.youtube.com/watch?v=nWKiJHKIZfo

📚 Доп. материалы добавлю позже.

Увидимся в понедельник! Обсуждать в чате: @rvnikita_blog_chat

#stanford #ai #eric_kauderer_abrams #anthropic #mse435
  • ❤ 1
Post #742 569
Post #741 556
https://www.youtube.com/@CanItCode - настоящая находка - 400 подписчиков и отличный контент о том, как создавать игры в агентах.
  • 👍 5
Post #739 767

Forwarded from Алексей Погонин

Кто ни будь знает как сейчас пробиться до покупки подписки?
27 июня заблокировали прошлый аккаунт, сообщение о восстановлении до сих пор ревьюят. Создал новую чистую пиндосовсую почту. Завел новый аккаунт на клоде, но оплатить подписку он не дает, появилась верификация аккаунта. Знает кто ни будь как с этим бороться?
  • 😱 2
Post #738 627

Forwarded from False Positive

Всем привет! 👋

В эту пятницу на очередной Reading Group поговорим про ML-инфраструктуру, а именно - про виртуализацию GPU.

В программе:

- NVIDIA Multi-Instance GPU (MIG) - как делить один GPU между несколькими задачами;
- HAMi - виртуализация GPU в Kubernetes для AI-инфраструктуры;
- MLPerf Inference Benchmark - запустим бенчмарк и разберёмся, как интерпретировать результаты.

📅 Встречаемся в пятницу в 15:00 (по МСК).

Ссылка для подключения в Толк. 👈

#reading_group #mlinfra #benchmark
  • 👍 1
Post #737 498
vice_shores.html1.8 MB
Фабл вывели игры на новый уровень. Даня не дождался выхода ГТА 6 и сделал себе свой
  • 🔥 7
Post #736 503

Forwarded from AI-Driven Development. Родион Мостовой

1М контекстное окно - прорыв или фикция?

Context Arena забенчмаркали стойкость контекста для GLM 5.2 и Opus 4.8 - значит, это хороший повод нам вспомнить про контекстную инженерию.
На бенчмарке отчетливо видна существенная просадка внимательности моделей на 512к контексте: в среднем, почти в 2 раза в сравнении с 64к контекстом и примерно в 1.5 раз в сравнении с 128к контекстом - грубо говоря, для нас с вами это означает то, что на 512к контексте агент будет терять в полтора раза больше деталей, чем на при 128к заполненности. Для открытых моделей проблема потери контекста особенно актуальна, поэтому практический вывод такой, что по-хорошему, с ними стоит держать заполненность контекстного окна не выше 128к, а лучше даже меньше - ни о каком 1М, конечно, и речи не идет, там просадка будет колоссальной. Кстати, у моделей Kimi K2.6 и, тем более, Minimax M3 дела обстоят еще хуже.
Что еще? Открыв закрытых моделей на большом контексте от открытых все еще впечатляет, хоть уже и не такой драматичный - спасибо DeepSeek за DeepSeek Sparse Attention, которую в GLM-5.2 развили через IndexShare. Кстати, о GLM 5.2 - как видно, моделька действительно на удивление успешная в т. ч. на больших контекстах. Opus 4.8 идет рядышком с GPT 5.5, но последняя все равно сильнее, особенно на совсем больших контекстах. На этом месте вспоминаем интересную деталь - в Codex App по дефолту контекстное окно для GPT 5.5 все еще 256к - то есть, по сути, точность всегда остается где-то на уровне 75%+- (по MRCRv2), а благодаря превосходному алгоритму компактизации, команде Codex удается сохранить все действительно важное так, что эти компактизации обычно и не заметны вовсе - то есть, конкретно в случае с Codex проблему контекстной инженерии ребята здорово решили на уровне модели и на уровне Harness (обвязки), в то время, как Claude Code в этом аспекте требует чуть больше ручной работы - модель на 1M контекста там включается прямо в выпадающем списке (велик соблазн ее включить), но кажется, что простой обыватель зачастую не очень понимает, что переключение на эту модель потребует от него ручного управления контекстом - как только контекст переваливает за условные 200к, начинается зона риска, в которой нужно либо переходить в новый чат, либо, хотя бы, вызывать компактизацию - что и приходилось делать. Что уж говорить, что пользователям открытых моделей за загрузкой контекста все еще стоит следить куда пристальнее. Короче, в 2026-м контекстную инженерию (в которую входит контроль % заполнения контекстного окна) пока никто не отменял - чем больше забит контекст, тем сильнее приходится надеятся на удачу.
И, конечно, не забываем про контроль AGENTS.md, скиллов, MCP, progressive disclosure и т. д. - тоже все составляющие context engineering, с открытыми моделями все это становится еще важнее.

Кстати, современная версия Context Arena прогоняет бенчмарк MRCRv2 от Google DeepMind (GDM-MRCRv2).

Paper про MRCRv2 (Michelangelo)
Датасет MRCRv2

А как вы менеджите контекст? Обращаете ли внимание на % заполнения? Наблюдаете ли просадки в качестве output модели на больших контекстах?

@ai_driven
Older posts →
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →