TGViewer
Channel Public Channel
DEKSDEN notes

DEKSDEN notes

@deksden_notes

Мои заметки на разные темы, уровень - "для продолжающих"
Vibe Coding -> AI SWE, AI Coding Tools, Agents, news, links
Чат (!!!): https://t.me/+B1fB3sZbaVthMDhi

Админ @deksden

В канал бесплатно публикую опенсорс проекты - пишите админу

Вакансии? админу
Subscribers
3.07K
Photos
757
Videos
10
Links
762

Showing posts older than #1122 · Back to latest

Older Posts 20 shown
Post #1121 1.51K
⚪️ Google Flash 3.7


Ну - бенчи вы и так посмотрите, скажу своё мнение.

▶️ Во первых: чего это на флеши всех прорвало?

То DS 4 flash 0731 хайпует, отличная получилась модель, даже вышедший позже DS 4 pro 0813 по перфомансу её не особо перекрывает. Да, цены подняли в итоге - но они остались все равно очень и очень доступными.

То клозедовская Луна собирает внимание после дропа цены на 80% - все распробовали что модель то весьма неплохая! Нет, не замена Сола, но тянет свои задачи!

Muse опять же - скорее туда же, судя по ценам.

И вот теперь - флеш от гугла. Ещё и со нижением цены в 2 раза, что не может не радовать! Мультимедийно гугл очень востребован, бенчи подросли - будет пользоваться спросом. Куплю на пару аккаунтов, пожалуй, подписку на год) Факап с 3.5 про несколько компенсирован.

▶️ Во вторых: интересен прогресс именно в мелких моделях. То ли научились пытать их током, то ли для мелкого объёма таки происходит гроканье - но перфоманс именно мелких моделей в последнее время радует и удивляет. Мне кажется, что имеющееся у топовых лаб количество компьюта в трейне сейчас позволяет им делать очень качественные мелкие модельки, довольно агентные и с отличной скоростью.

Да, у моделей класса флеш нету той эрудиции или соображалки - но они берут скоростью, агентностью, натасканностью на конкретные задачи (кодинг?).

👉 Что буду проверять и на чем режутся модельки этого класса: на внимательности (следовании инструкциям), на работе с большим контекстом (насколько фатальна деградация после заполнения контекста на 30-50%), насколько они тупые (что будет при попадании в нестандартную ситуацию (хождение кругами, тупняки или более-менее вывозит).

В целом, в интересное время живём!

@deksden_notes
  • 👍 11
  • 🔥 7
  • ❤ 3
Post #1120 1.68K
⚪️ Codex Reset


Интрига не сложилась: пока ни продажи ресетов, ни прочих экзотических вариантов нету.

Просто глобальный ресет всех платных планов! У меня уже докатилось до части аккаунтов

——

upd 1️⃣ : мои Team аккаунты так и не обновились - только плюсы) Вот зачем надо держать смешанный пул! Такое раньше тоде бывало. Ну ок - будут разные даты зато ресетов! тоже удобно

@deksden_notes
  • 👍 6
  • 🤝 2
  • 🔥 1
Post #1119 1.78K

Forwarded from ABI

⚡️ Код горит, дедлайны горят, а Ян Гримм опять придумал «революционную метавселенную»?

Я знаю, как сильно вам не хватает хаоса из офиса Mythic Quest.
Поэтому ловите готовый набор ИИ-скиллов с психологическими портретами любимых героев.
Теперь в вашей командной разработке официально есть всё: Ян Гримм — сгенерирует безумное видение без оглядки на логику. Поппи — устроит истерику из-за кривого кода. Брэд — молча монетизит ваши баги. А Джо просто выполнит приказ.

Забирайте, настраивайте агентов и превращайте унылый рефакторинг в симулятор корпоративного выживания! ❤️🎮

https://github.com/ABIvan-Tech/mythic_quest_skills

#opensource #skills
GitHub GitHub - ABIvan-Tech/mythic_quest_skills Contribute to ABIvan-Tech/mythic_quest_skills development by creating an account on GitHub.
  • ❤ 5
  • 👍 2
Post #1118 1.54K
⚪️ Grok Manual Reset


Грок, оказывается, не только с СС умеет фичи передирать! Молодцы, не брезгают и клозедами, несмотря на все обстоятельства. Неужели у них хватит духу склонировать кодекс апп? Было бы неплохо. Особенно в opensource ))

Ну, ладно, чего я размечтался

Пока всем пользователям Супер Грока дали ручной ресет, протухнет через месяц.

Как работает X.ai мне определённо нравится

@deksden_notes
  • 🔥 6
  • 😁 5
  • ❤ 2
Post #1117 1.49K
⚪️ DeepSeek v4 Pro 0813


А вот и новый чекпоинт DS4Pro! Предыдущий релиз свежего чекпоинта DS4 Flash 0731 всех удивил отличным качеством работы. Бенчи нынешнего про тоже выглядят весьма празднично: немного выше или на уровне Опуса 4.8.

Это отлично для модели которая стоит $0.435 / $0.87, что более чем на порядок меньше текущего фронтира, и даже более чем в 5 раз меньше свежего "доступного" грока 4.6.

Надо будет обязательно тестить как себя будет вести модель в реальных своих эвалах, но оптимизм по её поводу - значительный! Опенсорс крут

@deksden_notes
  • 🔥 16
  • 👍 7
Post #1116 1.31K
⚪️ Grok 4.6


Ну вот! стоит отвлечься на эфир, тут моделей уже насыпят..

У Маска наступило 7 августа, и вышел новый грок.

Что можно сказать по материалам, представленным на релизе? Бенчи оч неплохие, на уровне фронтира. Видимо, похуже агентность (deepswe/tb3 немного пониже). Модель быстрая, и не дорогая - $2/$6.

Акция: в Grok Build лимиты на неделю х2 поставили! Время тестить

Новая модель доступна в курсоре, grok build, grok bot и api.

Ну - будем сравнивать с ещё одним сегодняшним дебютантом, DS4Pro

——

Upd 1️⃣ : контекст 500к - странно. Обычно все предпочитают 1М нынче, хотя и опасаются с ним работать (деградацию на большом контексте ещё никто до конца не победил)


@deksden_notes
  • 🔥 7
  • 👍 3
Post #1115 1.21K

Forwarded from Junior AI PM

#иное
Комьюнити-эфир 12 августа. Живая дискуссия про AI coding

Без докладов и презентаций -> просто собираемся и обсуждаем, как сейчас реально работаем с AI-разработкой

🎙 Максим Ключников -> техлид и автор канала Этихлид, много экспериментирует с AI в разработке и инженерных процессах
https://t.me/etechlead

🎙 Денис Киселёв -> AI SOLO founder, автор канала про AI-разработку, агентов и инженерные инструменты
https://t.me/deksden_notes

🎙 Артем Летюшев -> Tech PM в Twinby и гильдмастер AI Engineers Guild
https://t.me/junior_pm

Поговорим про свежие модели и tokens per task, спеки, архитектуру, ADR и AI SDLC. Дальше как пойдёт

Ссылка на событие https://luma.com/lwm1coqr

📍 Google Meet: https://meet.google.com/bzz-aeoo-vio
🗓 12 августа, среда
🕖 19:00–20:00 мск
  • 👍 12
  • 🔥 5
  • ❤‍🔥 1
Post #1114 1.42K
⚪️ Codex Reset завтра?


Вот как такое понимать? Если завтра, то включаем fast. Если нет - попадаем на 4 скучных дня))

Вот и гадаем. Я склоняюсь что нас ждёт ресет. Но уже немного утомляет неопределённость. Начните их продавать, наконец!

@deksden_notes
  • 🙏 11
  • 👍 5
  • ❤ 3
  • 😁 2
  • 👻 1
Post #1113 1.41K
⚪️ Grok 4.6 и Bot на SuperGrok


Тут Илон пояснил за сабж

1) Grok 4.6 "позже на этой неделе"
2) Grok Bot будет расширен на другие тиры как пофиксят начальные проблемки - но сроков нету


@deksden_notes
  • 👍 5
  • 🔥 5
  • 😁 2
  • ❤ 1
Post #1112 1.47K
⚪️ Codex app теперь под Linux (preview)


Не прошло и несколько лет, как построенный на мультиплатформенном электроне Кодекс апп наконец то смогли запустить на линухах! Ура

Конечно, можно и ранее было юзать неофициальные репаки - но сейчас можно юзать официальные.

Поддерживаются:

• Ubuntu 24.04 LTS and 26.04 LTS
• Debian 13
• Fedora 43 and 44

@deksden_notes
  • 🔥 17
  • 👍 8
  • 🎉 7
  • 🐳 3
  • 😱 2
  • ❤ 1
Post #1111 1.44K
⚪️ Grok Bot


Маск выпускает Grok Bot. Продукт совместный с Курсором - на ios разработчиком числится Anysphere, подписки работают Курсоровские в том числе.

Это такой cowork, но подключённый к облачной vm, которая выделяется пользователю (не боту, на всех ботов пользователя - одна эта машина, и они работу могут передавать друг другу).

Управялем им с приложений macos/win/ios, android будет позже. Так как агент в облаке на vm, работает даже когда твой комп выключен.

‼️ В общем, интересно, конечно, НО есть одно большое НО - работает только на максимальных подписках - Курсор ультра и Грок СУПЕР Хеви.

Получилось как ChatGPT Work который совмещён между облачным режимом (где и у chatgpt есть под капотом немаленькая vm, кто не знает - спросите у него сами про доступный комп) и локальным агентом в приложении.

Мне по описанию показалось что у Маска сделано логичнее чем у chatgpt.

🔗 Промо - посмотрите, первая картинка интерактивная, можно тыкать: https://x.ai/bot
🔗 Блог : https://x.ai/news/introducing-grok-bot

——

Upd 1️⃣ : SuperGrok Heavy теперь работает как Cursor Ultra план. Можно логинится в курсор своим X аккаунтом

@deksden_notes
  • ❤ 5
  • 👍 3
Post #1110 1.5K
⚪️ Взлом ризонинга фронтира


Тут люди взломали ризонинг у антропиков, клозедов, гугла. Те самые шифрованные мысли моделей! omfg

Почитайте сами чего и как:

🔗 Почитайте тред: https://x.com/kotekjedi_ml/status/2087147042888114428

Из проблем: даже если в трейсах агентов у вас нету данных, то в мыслях моделей они вполне могут встретиться

Ну и праздник у китайских вендоров: то, что тщательно шифровали буржуи, легко ломается. Шило - как водится, не удержали.

@deksden_notes
  • 🔥 10
  • 😱 8
  • 👍 3
  • ❤ 1
  • 🌚 1
Post #1109 1.44K

Forwarded from Андрей

Agent Lifecycle Kit: управляемая работа с ИИ-инструментами для разработки

Кодовый агент — это инструмент с моделью ИИ, который по текстовой задаче может изучить проект, изменить файлы и запустить проверки. К таким инструментам относятся Codex, Claude Code, Cursor, OpenCode, Qwen Code и другие.

На простой задаче достаточно получить готовое изменение. Но при работе над архитектурой, безопасностью или большой функцией важно также понимать:

  - какая цель была поставлена;
  - что именно разрешено менять;
  - какие этапы нужно пройти;
  - какие проверки обязательны;
  - почему результат можно считать принятым.

Agent Lifecycle Kit (ALK) организует этот процесс от постановки задачи до подтверждённого завершения.

ALK помогает:

  - принять задачу из текста, Markdown-файла или внешнего документа;
  - провести исследование и подготовить план;
  - зафиксировать требования, критерии приёмки и границы изменений;
  - разделить работу на последовательные этапы;
  - сохранить состояние задачи и продолжить её позже;
  - проверить результат относительно утверждённого плана;
  - собрать подтверждения проверок;
  - принять результат или зафиксировать причину блокировки.

Главное отличие ALK от кодовых агентов в разделении ответственности:

  - кодовый агент анализирует проект, пишет код и выполняет проверки;
  - ALK управляет процессом, границами, состоянием, подтверждениями и приёмкой результата.

ALK не привязан к одной модели или одному инструменту. Подключения к Codex, Claude Code, Cursor, OpenCode, Qwen Code, Goose, Gemini CLI и другим инструментам выполняются через адаптеры. При этом правила жизненного цикла остаются едиными.

Для задач разного уровня используется соразмерный контроль. Небольшая механическая задача проходит короткий путь. Архитектурная, связанная с безопасностью или несколькими исполнителями, получает более строгие проверки.

Дополнительная проверка несколькими моделями включается по необходимости. Можно использовать любые доступные сочетания инструментов и моделей: например, один инструмент готовит план, а другие проверяют исследование, архитектуру или  реализацию. Если доступна только одна модель, дополнительная проверка не требуется.

ALK работает с большими, малыми и локальными моделями. Компактные задания, ограничения ресурсов и повторяемые проверки помогают экономить контекст, сохраняя требования к качеству.

Подробнее:

Быстрый старт (https://github.com/avksp/agent-lifecycle-kit/blob/main/docs/ru/quickstart.md)

Архитектура системы (https://github.com/avksp/agent-lifecycle-kit/blob/main/docs/ru/architecture/system-architecture.md)

Как ALK работает с разными задачами (https://github.com/avksp/agent-lifecycle-kit/blob/main/docs/ru/guides/how-alk-works.md)

Сравнение с похожими инструментами (https://github.com/avksp/agent-lifecycle-kit/blob/main/docs/ru/reference/project-comparison.md)

Репозиторий проекта (https://github.com/avksp/agent-lifecycle-kit)

#opensource #опенсорс
  • 🔥 6
  • 🤔 3
  • ❤ 2
Post #1108 1.39K
⚪️ Codex Reset


Тибо сказал - тибо сделал


@deksden_notes
  • 🫡 25
  • 🔥 2
Post #1107 1.42K
⚪️ Muse Glimmer бенчмарки

Интересно, что выше Gemma 4! Неплохо Марк вернулся к опенсорсу (в своём классе, конечно).

Почти уровень кими 2.5, но размер то сильно меньше.

Qwen3.6 27B всё равно получется поумнее - что лишний раз говорит о крутости квена в сегменте услоно мелких моделек.


🔗 Анонс бенча: https://x.com/ArtificialAnlys/status/2086916150278111551
🔗 Бенч на оффсайте: https://artificialanalysis.ai/models/muse-glimmer


@deksden_notes
  • 👍 4
  • 🤔 2
  • 🔥 1
Post #1106 1.38K
⚪️ Claude Sonnet 5 остается дешевкой


По мнению антропиков - они решили сохранить на постоянку акцию со снижением цен на Sonnet, которую объявили при запуске модели. Вместо "стандартной" цены в $3/$15 у нас остаётся $2/$10

Это, конечно, хорошо

Но воркер на луне стоит $0.2/$1.2 - это почти х10 дешевле.
Дорогая терра стоит на уровне $2/$12. Видимо дороже её не хочет остаться антропик.

Но у антропика "выше" по иерархии ещё 2 модели..

В общем, посмотрим на ценовые манёвры фронтира


@deksden_notes
  • 💯 5
  • 🤣 5
  • 🔥 3
  • 😁 1
  • 👀 1
Post #1105 1.15K

Forwarded from Max Syabro and a Slop Driven Development

Rejudge — независимая проверка для ИИ-агентов.

https://rejudge.syabro.com/ru/
https://github.com/syabro/rejudge

Выкатываю еще один свой инструмент в паблик

Код, который написал агент, можно проверить четырьмя способами, где каждый следующий способ ловит больше предыдущего:

I. Та же сессия, та же модель.
Агент перечитывает свой код. Он уже решил, что код правильный, и повторное чтение это решение не меняет.

II. Новая сессия, та же модель.
Контекст чистый, модель прежняя. У неё то же обучение и те же привычки, поэтому она пропускает ошибки, которые написала бы сама.

III. Другая модель.
Другая модель действительно находит настоящие ошибки. Но теперь у вас два мнения, и когда они расходятся, решать, кто прав, приходится вам.

Я сделал дальше:

IV. Rejudge: три модели и судья.
Все три модели получают один и тот же вопрос одновременно. Каждая работает в изолированном контексте и сама вызывает инструменты, поэтому ни одна не видит, что делают другие. Судья читает все три отчёта, задаёт уточняющие вопросы там, где они расходятся, и пишет один ответ.

Плюс агент может отправить дозапрос по session-id в Rejudge если есть что-то что не понравилось.

Внутри pi-sdk с поддержкой все провайдеров которые поддерживает Pi.

У меня rejudge работает на OpenCode Go (линк реферальный, $5 вам, $5 мне) за $10. Но честно перестало хватать, ибо стал юзать на любой чих, докупил еще один акк. Если есть альтернатива интереснее подскажите в комментах.


{
"reviewers": [
"opencode-go/deepseek-v4-pro@xhigh",
"opencode-go/minimax-m3@xhigh",
"opencode-go/mimo-v2.5-pro@xhigh"
],
"judge": "opencode-go/glm-5.2@medium"
}


В комплекте
rejudge CLI тулза для всех агентов
/rejudge и /rejudge-diff скиллы для работы с Rejudge в целом и проверки диффов, например перед коммитом или на PR
• Pi-extension с rejudge tool для красивого UI и более кошерной коммуникации агенту.

В комментах отвечу на вопросы.

В планах
• Прогнать на DeepSWE, посмотреть что получится
• Допинать /rejudge-dx-review skill
• Интегрировать мой websearch

Установка тут:
https://rejudge.syabro.com/ru/#install

Как обычно с вас лайк, шер, репост, подписка, поглатить ближайшего котика, вот это все.

Ваш, @syabro_notes

#opensource #mit
  • 🔥 16
  • ❤ 8
  • 👍 3
  • ❤‍🔥 1
  • 👻 1
Post #1103 1.56K
🤖 ChatGPT, Claude, Cursor, Gemini - всё в одном месте, не ищи по разным сайтам!

🏃‍♂️ Просто пиши - выдам быстро | @dobrovskiys

⚠️ САМОЕ ВАЖНОЕ! ЦЕНЫ!
- Chat GPT Plus/Pro
- Gemini Pro - от 1$ | Есть опт
- Claude Pro/Max | Claude API
🔝Может ты искал Higgsfield, Kiro, Manus, HeyGen, GROK, Kling, OpenWonder, ElevenLabs, Notion, Loveable, Adobe, Canva, Gamma, n8n, Figma, Factory и многие другие подписки? Они у нас есть!


💵Dobrovski’s Market - Твой проводник в мир подписок!

✈️ Купить ChatGPT | Gemini
  • 🥴 8
  • 👍 3
  • 🔥 3
  • ❤ 1
  • 🌚 1
Post #1102 1.51K
⚪️ Промптинг - отрицательные инструкции


Нынче развлекаюсь тестами более тупых моделей чем фронтир на обычных агентных флоу. Я давно работал с агентными флоу только на фронтире (конечно, простые модели были в апи в софте, но там другая специфика).

А тут в связи с практически "бесплатностью" луны для лимитов, возникла необходимость посмотреть какие стадии флоу нормально делаются моделями попроще.

▶️ Столкнулся с таким эффектом: отрицательные иснтрукции работают крайне плохо. Столкнулся с этим на теме роутинга задачи на выполнение с той или иной детальностью. Агенты на слабых моделях упорно игнорируют инструкции по теме "не запускай субагентов в случае простых задач".

Как бороться? Делаем реверс логики. Вместо "не запускай" переписываем этот блок так: по-умолчанию никаких субагентов. Запускать субагентов разрешается в таких случаях: чек-лист.

То есть мы перевели отрицательную инструкцию "не запускай, если ..." в положительное правило - "запускай, если ...". Такое работает хорошо даже на простых моделях.

Реверс логики не всегда естественный для человека - люди все таки воспринимают отрицательные инструкции получше.

Нет, такой подход не решает проблему следования инструкциям - он просто снижает вероятность НЕ следования инструкциям, сформирвоанным "негативно".

Пряник и тут эффективнее - особенно если им бить))

❓ Кто то замечал подобный эффект? как боролись?

@deksden_notes
  • 👍 17
  • 🔥 9
  • 👀 1
Older posts →
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →