TGViewer
Channel Public Channel
Max Syabro and a Slop Driven Development

Max Syabro and a Slop Driven Development

@syabro_notes

@syabro_chats в роли акына: что вижу то пою.
- Запускаю presync.io
- Web, tech, management.
Subscribers
954
Photos
514
Videos
51
Links
414

Showing posts older than #698 · Back to latest

Older Posts 19 shown
Post #697 368
Слава богу что есть такие стикеры. Дай бог здоровья и процветания их создателям.

Большего маркера отсутствия вкуса и чувства юмора у человека придумать нельзя.

Только ебанутые гифки! Только хардкор!
  • 😁 5
  • ❤ 3
Post #696 431
Max Syabro and a Slop Driven Development https://www.alibabacloud.com/campaign/ai-scene-coding?referral_code=A92LL7 Алибаба выкатила свой кодплан Lite $10 и PRO $50 Заявлено - qwen3.5-plus - kimi-k2.5 - glm-5 - MiniMax-M2.5 Выглядит как идеальная подписка для агентов PS Ссылка реферальная, мне…
горшочек перестал варить совсем...

Алибаба убрали кодеплан за $10 и оставили только за $50....

https://www.alibabacloud.com/help/en/model-studio/coding-plan
Post #695 367
Пацаны, а кто kilo code юзает? Чот он вроде как популярный но в моем пузыре не про него не слышно...
Судя по виду это форк opencode

UPD Claude вот чо написал про их cli

Kilo Code Cli — всё то же самое в (потому что форк), но сверху:
- кросс-девайсный sync состояния сессий Kilo
- managed кредитная система (Kilo Pass)
- AI Management Dashboard для трекинга adoption и ROI LinkedIn
- встроенный code review и деплой из IDE Kilo
- KiloClaw — hosted OpenClaw для автоматизации за пределами кода

PS в опенкоде кончился MIMOv2, в килокоде все еще есть
Post #694 566
На Reddit всплыл тред про страницу в документации Anthropic, которую мало кто читал. Три инструкции для системного промпта, которые заметно снижают галлюцинации Claude.

Явно разрешить модели отвечать «I don't know». Без этого Claude заполняет пробелы в знаниях правдоподобной выдумкой.

Потребовать цитаты и источники на каждое утверждение. Если источника нет, модель должна отозвать утверждение.

При работе с длинными документами (>20K токенов) заставить модель сначала извлечь дословные цитаты из текста, а потом анализировать. Это убивает дрейф смысла при пересказе, когда модель незаметно сдвигает значение при суммаризации.

Есть нюанс. Статья arXiv 2307.02185 показала, что жёсткие требования к цитированию давят креативную генерацию. Рекомендуют два режима: режим исследования с тремя инструкциями для фактчекинга, обычный режим без них — для свободной генерации.

https://docs.anthropic.com/en/docs/test-and-evaluate/strengthen-guardrails/reduce-hallucinations
Claude Platform Docs Reduce hallucinations Minimize hallucinations in Claude's outputs by allowing uncertainty, grounding responses in direct quotes, and verifying claims with citations.
  • 👍 10
Post #693 1.1K
Сижу работаю с MiMo-V2-Pro в opencode

Китайцы в этот раз не пиздят

Мне очень комфортно, кажется у клода в этот раз должно начать играть технологическое отверстие ниже копчика.

Слушает что надо делать фактически, контекст держит, рассуждения топ.

Короче настоятельно рекомендую пробовать
  • ❤ 10
  • 🔥 5
Post #692 860
https://mimo.xiaomi.com/mimo-v2-pro

Xiaomi выкатили MiMo-V2-Pro — флагманскую модель на 1T параметров (42B активных). Hybrid Attention с соотношением 7:1, контекст до 1M токенов, Multi-Token Prediction для быстрой генерации.

Неделю назад модель анонимно залили на OpenRouter под кодовым именем Hunter Alpha. За неделю она несколько дней подряд возглавляла дневной чарт по количеству вызовов и набрала больше 1T токенов суммарно.

По бенчмаркам — кодинг выше Claude 4.6 Sonnet, агентские задачи (ClawEval 61.5) приближаются к Opus 4.6. На PinchBench — 81.0, третье место глобально после Opus и MiMo-V2-Omni. Основной трафик во время теста шёл от инструментов для разработки.

Цены API: $1/$3 за миллион токенов input/output (до 256K контекста). Для сравнения — Sonnet 4.6 стоит $3/$15. Cache write пока бесплатен.

Самое главное - дают неделю бесплатного доступа в OpenClaw, OpenCode, KiloCode, Blackbox, and Cline, например через https://opencode.ai/docs/zen/#endpoints
  • 🔥 3
Post #691 383
Post #690 502
https://code.claude.com/docs/en/channels

Дождались. Anthropic выкатили Claude Code Channels — research preview, который добавляет новый транспорт в сессию Claude Code. Щас доступны Telegram и Discord через официальные плагины из claude-plugins-official.

Для теста ставим fakechat@claude-plugins-official из офплагинов, запускаем

claude --channels plugin:fakechat@claude-plugins-official


и идем на http://localhost:8787/ тестить.

Нужен v2.1.80+, Bun runtime, авторизация через claude.ai (API-ключи не работают).

Ответ на OpenClaw очевиден. Anthropic взяли самый востребованный паттерн — асинхронное общение с агентом через мессенджер — и встроили нативно. Разница в подходе в том что события приходят только пока сессия открыта. Для постоянной работы нужен фоновый процесс или tmux/screen.
  • 👍 1
Post #689 479
https://rjcorwin.github.io/cook/

Еще один ральф-луп. И DX отличный - сходу понятно куда тыкать

Опции:
- луп над одной задачей пока не Done
- работа над одной задачей в нескольких воркспейсах вариациями и потом выбор где пизже получилось
- ральф-луп который берет задачи из списка

Для простых вещей выглядит клево
  • 👍 6
Post #688 466
  • 😁 7
  • ❤ 5
  • 🤪 2
Post #687 339
Хм, кажется это месяц «10 баксов уходит минимаксу» ибо алибаба пока только 2.5 имеет :(
Post #684 376

Forwarded from Tips AI | IT & AI

Оказывается у Anthropic есть экзамен — Claude Certified Architect

Узнал про неё из статьи, где парень набрал 985/1000

Cдать его могут только партнёры Anthropic. Зато все учебные материалы в открытом доступе:

• Агентная архитектура: мультиагентные системы, оркестрация
• Tool Design и MCP: подключение внешних сервисов
• Настройка Claude Code: конфиги, хуки, воркфлоу
• Промпт-инжиниринг: system prompts, цепочки, few-shot
• Управление контекстом: стратегии работы с контекстным окном


30 практических задач, сценарии, упражнения на сборку.

Комьюнити уже собрало бесплатный гайд с промптами для подготовки по каждому направлению.

> claudecertificationguide.com

Практические уроки, тренировочные вопросы и упражнения по разработке, всё что нужно.

Просто без сертификата в конце 🪙

@tips_ai #news
  • ❤ 10
  • 🔥 5
  • 👍 3
Post #683 597
В Claude Code появилась команда claude remote-control. Не слеш-команда /remote-control, которая была и раньше. Та пробрасывала одну конкретную сессию на телефон.

Новая команда поднимает persistent-сервер. До 32 параллельных сессий на одной машине. Зашёл в claude.ai/code с телефона, создал сессию — она стартует локально, с доступом к файлам, MCP-серверам, CLAUDE.md. --spawn=worktree разносит сессии по отдельным git worktree, --spawn=same-dir держит всё в одной директории. Переключение между режимами — клавиша w на лету.

Мак с запущенным claude remote-control фактически становится headless-сервером. Одной командой закрыли сценарий, под который люди городили Tailscale + tmux + Termius и отчасти из-за которого набирал популярность OpenClaw.
  • 🔥 8
Post #681 569
Amazon собрала инженеров на обязательный разбор серии инцидентов. Внутренний документ описывает волну крупных сбоев, вызванных правками через GenAI. Официальная позиция — «part of normal business».

Четыре Sev-1 за одну неделю. 5 марта сайт и приложение Amazon лежали ~6 часов — оформление заказов не работало, цены не показывались. В декабре Kiro (kiro.dev), которому поручили внести правки в AWS Cost Explorer, решил снести и пересоздать окружение целиком. Восстановление заняло 13 часов. Amazon назвал это «extremely limited event» — сервис при этом обслуживал клиентов в материковом Китае.

Джунам и миддлам теперь нужен аппрув синьора на любые правки, сделанные с помощью AI. Эти ограничения вводят поверх системы, в которой уже крутятся 21 000 AI-агентов в розничном подразделении. Amazon заявляет $2B экономии и рост скорости разработки в 4.5 раза. И с такими цифрами в отчётах фарш назад не провернуть.

Отдельный кек: пункт про GenAI из документа удалили до начала встречи. После публикации FT представитель Amazon заявил, что только один сбой связан с AI и ни один не вызван кодом, который AI написал.
CNBC: An internal document originally said generative AI-assisted production changes were partly to blame for the issues, but the reference to GenAI was subsequently deleted.


James Gosling, ушедший из AWS в 2024, ещё тогда описывал ту же картину — команды, не приносящие прямой доход, расформировали ради AI-повестки. Corey Quinn из Duckbill сформулировал точнее: AWS предпочтёт, чтобы мир считал их инженеров некомпетентными, чем признает, что ошибку допустил AI.

https://fixupx.com/lukolejnik/status/2031257644724342957?s=46

https://www.cnbc.com/2026/03/10/amazon-plans-deep-dive-internal-meeting-address-ai-related-outages.html
  • ❤ 2
  • 🤯 1
Post #680 1.48K

Forwarded from Oleg Puzanov

codex_system_prompt.md23 KB
Сегдоня немного прилег codex. Пока трейсил его чтоб понять в чем проблема заметил что с их сервера приходит системный промпт. Расшифровал его и можно глянуть как они описывают персону, поведение, как тулы вызывают. Возможно кому пригодиться кто своих агентов пилит.
  • ❤ 6
  • 👍 2
Post #679 455
Post #678 417
https://arxiv.org/abs/2512.08296

Google Research + MIT выкатили paper на 180 экспериментов, где методично разобрали, когда мультиагентные системы работают, а когда всё становится хуже.

ТЛДР: “More agents is all you need” — не работает.
Разброс от +80.9% до −70% в зависимости от задачи и архитектуры.

Три семейства моделей (OpenAI, Google, Anthropic), четыре бенчмарка, пять архитектур. Controlled evaluation — одинаковые промпты, тулы, бюджеты токенов. Меняется только координация.

Пять архитектур: Single-agent — одна модель, один цикл рассуждения. Independent — несколько агентов работают параллельно без общения, результаты склеиваются в конце. Decentralized — агенты общаются друг с другом напрямую, приходят к консенсусу через раунды дебатов. Centralized — есть оркестратор, который раздаёт подзадачи сабагентам и собирает результат. Hybrid — оркестратор + агенты ещё и между собой общаются.

Где мультиагенты тащат. Finance Agent — задачи с параллельной декомпозицией. Один агент копает SEC filings, другой — новости, третий — операционный анализ. Centralized MAS даёт +80.8% к single-agent. Задача сама напрашивается на разделение.

Где всё ломается. PlanCraft — последовательное планирование в Minecraft. Каждое действие зависит от предыдущего состояния. Любая мультиагентная архитектура деградирует: от −39% (Hybrid) до −70% (Independent). Координация жрёт токены, которые нужны на рассуждение. Агенты начинают делить задачу, которую делить нельзя — один «исследует рецепт», другой «проверяет инвентарь», третий крафтит. Три шага вместо одного, плюс overhead на общение между ними.

Scaling law дала три закономерности. Чем больше тулов у задачи, тем сильнее мультиагентный overhead бьёт по перформансу. В Workbench, где задачи используют по 16 тулов, эффективность Hybrid проседает в 6 раз относительно single-agent. Дальше — потолок отдачи. Если single-agent уже даёт выше ~45%, добавление агентов даёт отрицательный возврат. Координация стоит дороже, чем потенциальный прирост. И усиление ошибок зависит от топологии. Independent агенты усиливают ошибки в 17.2× — нет механизма коррекции, каждый варится в своём контексте. Centralized сдерживает до 4.4× за счёт оркестратора-валидатора.
Про деньги. Single-agent — 67.7 success/1K tokens. Centralized — 21.5. Hybrid — 13.6. Расход токенов в пять раз выше, а результат тот же или хуже.

Авторы вывели формулу, которая по количеству тулов, базовой точности и декомпозируемости задачи предсказывает оптимальную архитектуру с точностью 87% на новых конфигурациях. Валидировали на GPT-5.2, который вышел после исследования — четыре из пяти принципов подтвердились.

Если задача последовательная и single-agent уже даёт >45% — мультиагенты скорее всего сделают хуже. Если параллелизуема и baseline низкий — Centralized или Decentralized дадут прирост. Decentralized лучше для exploration (web navigation: +9.2%), Centralized — для structured reasoning (finance: +80.8%).

Ещё интересное: в decentralized архитектурах команды из слабых и сильных моделей работают на уровне или лучше однородных из сильных. У Anthropic в centralized архитектуре слабый оркестратор + сильные сабагенты даёт +31% относительно полностью сильной команды.
arXiv.org Towards a Science of Scaling Agent Systems Agents, language model-based systems capable of reasoning, planning, and acting are widely adopted in real-world tasks, yet how their performance changes as these systems scale across key...
  • 👍 8
Older posts →
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →