TGViewer
Channel Public Channel
AI Coder

AI Coder

@ai_coder_news

AI will not replace you, people who use AI will.
Subscribers
539
Photos
119
Videos
12
Links
327

Showing posts older than #571 · Back to latest

Older Posts 20 shown
Post #570 564
Прикольный эксперимент: чувак взял 100 разных брифов для лендингов и прогнал один и тот же набор через GPT‑5.6 Sol, Claude Opus 4.8 и Grok 4.5.

На выходе — 300 сайтов, которые можно сравнивать между собой:
https://sitegeist.kian.im/

Самое интересное, что брифы были довольно общими — без детального арт-дирекшена, конкретных цветов и композиции. Поэтому хорошо видно «дизайнерский автопилот» каждой модели: любимые градиенты, шрифты, hero-блоки, карточки и типовые композиции.

Один красивый лендинг показывает, что модель может сделать хороший дизайн.
Сотня лендингов показывает, как быстро она начинает повторяться.

По сути, это отличный способ посмотреть на визуальный почерк моделей и понять, где заканчивается генерация, а где всё ещё нужен нормальный арт-дирекшен, референсы и ограничения.
Sitegeist One hundred generated websites testing how well leading models maintain visual quality, consistency, and originality.
  • 🔥 2
  • 💯 1
Post #568 561
Мы с Максом вчера препарировали приложение GitHub.com/dpolishuk/youtrade. Как сегодня должны писаться мобильные приложения. Я использую свой Xpowers и показываю весь workflow

Я все доп материалы закинул в реп. Если что не закинул или непонятно спрашивайте
GitHub GitHub - dpolishuk/youtrade Contribute to dpolishuk/youtrade development by creating an account on GitHub.
  • 👍 4
Post #567 989

Forwarded from Egor Tolstoy

💬 Как построить harness, который автономно напишет мобильное приложение | Дмитрий Полищук (@deepol)

Дима Полищук продолжил знакомить с фреймворком xpowers на базе superpowers и в прямом эфире собрал и настроил инфраструктуру, которая автономно пишет мобильное приложение.

Таймкоды:
00:03:24 Показ приложения и стека
00:08:30 Спецификация и дизайн-система
00:15:27 agents.md и правила агента
00:19:40 Архитектура, SOLID, ограничения
00:23:35 Harness и автономный цикл
00:33:06 Mac mini для запуска
00:38:14 Self-check и память агента
00:51:21 PR workflow и review-агенты
01:05:08 Test-first и UI-тесты
01:15:57 Shared memory и orchestration
01:20:30 Вопросы и финал

Ключевые хайлайты:
• В центре примера было Flutter-приложение для трейдинга, собранное примерно за несколько дней и затем дорабатываемое.
• Автономность агента создаёт scaffold вокруг модели: структура репозитория, формат задач, правила проверки и design-system.
• `agents.md` использовался как центральный файл управления поведением агента с краткими project rules и best practices.
• Harness принуждал агента к test-first циклу с unit-тестами и UI/end-to-end сценариями.
• Для UI и мобильных экранов сначала делались макеты и scaffold, а уже потом генерация кода.
• В схеме использовались review agents, которые блокировали прогресс до достижения согласия по изменениям.
• Общая память между агентами строилась через несколько слоёв памяти, чтобы удерживать контекст между сессиями и машинами.
• Размер pull request влиял на качество работы агента: слишком большие PR усиливали drift и ухудшали review.
• Для автономной iOS-разработки рекомендовался отдельный Mac mini для запуска, тестов и работы с iOS simulator.


Полезные ссылки:
Полный транскрипт сессии
Страница сессии на сайте
  • 👍 8
  • 🔥 6
Post #566 2.72K
Вышел Kimi K3. 2,8 трлн параметров, контекст 1M — и теперь Kimi уже совсем не дешёвый

Moonshot AI выпустила и открыла веса Kimi K3 — нового флагмана для coding-агентов, больших репозиториев и длинных инженерных задач.

Что заявлено:

2,8 трлн параметров
→ контекст до 1 048 576 токенов
→ нативная работа с изображениями и видео
→ always-on thinking
→ новая архитектура Kimi Delta Attention
→ доступ через Kimi Code и API

K3 позиционируют под long-horizon engineering: большие рефакторинги, разработку игр и 3D, GPU-ядра, компиляторы, проектирование чипов и scientific computing.

То есть идея простая: дать агенту большой проект и как можно дольше не вмешиваться.

Но самое интересное — тарификация.

Через API Kimi K3 стоит:

→ cached input — $0,30 за 1M токенов
→ обычный input — $3 за 1M
→ output вместе с reasoning — $15 за 1M

По сравнению с Kimi K2.7 Code новая модель примерно втрое дороже на входе и почти в четыре раза дороже на выходе.

И здесь получается интересный момент: по расходу лимитов Kimi K3 — это почти Kimi K2.7 Code HighSpeed.

HighSpeed официально расходует квоту с коэффициентом . Для K3 отдельный точный коэффициент Moonshot не публикует, но, судя по API-тарификации, он тоже должен съедать credits примерно в 3–4 раза быстрее обычного K2.7 Code.

То есть K3 — это не модель, которую получится бездумно использовать весь день на базовой подписке.

Тарифы Kimi Code:

Moderato — $19/месяц
K3 доступен, но контекст ограничен 256K. Квоты хватит скорее на несколько тяжёлых сессий в неделю.

Allegretto — $39/месяц
Открывается полный контекст до 1M и даётся 5× credits. Ориентировочно это 1–3 часа активной работы с K3 в день.

Allegro — $99/месяц
15× credits. Уже можно использовать K3 как основную модель несколько часов в день.

Vivace — $199/месяц
30× credits. Тариф для постоянной работы или нескольких агентов.

Это примерные оценки: абсолютное число токенов Moonshot не раскрывает. Расход сильно зависит от размера репозитория, длины сессии, количества reasoning и попадания prompt cache.

Сам миллионный контекст тоже может очень быстро сжечь лимит. Когда история разрастается до сотен тысяч токенов, каждый следующий шаг агента становится дорогим, особенно при cache miss.

Отдельно есть K2.7 Code HighSpeed. Это та же K2.7 без заявленного ухудшения качества, но генерация работает примерно в 5–6 раз быстрее и расходует в три раза больше квоты.

В итоге линейка выглядит так:

K2.7 Code — дешёвая рабочая модель на каждый день.

K2.7 Code HighSpeed — быстро, но с расходом 3×.

K3 — примерно такой же тяжёлый по квоте режим, как HighSpeed, но уже с новой frontier-моделью, reasoning и контекстом до миллиона токенов.

Поэтому реальный минимальный тариф для K3 — Allegretto за $39, а для активной ежедневной работы я бы смотрел уже на Allegro за $99.

Moonshot явно закончила этап «почти как Claude, только сильно дешевле». Теперь у неё модель frontier-класса — и расход лимитов тоже frontier.

https://www.youtube.com/watch?v=bn0atstgavo
YouTube Meet Kimi K3 Enjoy the videos and music you love, upload original content, and share it all with friends, family, and the world on YouTube.
  • 👍 3
Post #563 393
OpenAI завтра пробьет 8м пользователей как бы. Поэтому кайфуйте)
Post #562 399
Завтра выложат Kimi 3, в августе GLM-5.5, OpenAI закидывает доп ресеты на usage и снимает 5ч лимиты, grok дает за $100 ваще анлим... Золотое время AI... Скоро закончится. Кайфуйте
  • 💯 9
Post #561 461
Создатель Kimi CLI выпустил Raft. И, кажется, это один из самых интересных взглядов на будущее agentic engineering.

https://app.raft.build/

На первый взгляд кажется, что это очередной Slack для AI-агентов. Но если копнуть глубже, идея намного интереснее.

Raft — это платформа, где люди и агенты работают как одна команда. Не один Claude Code на ноутбуке каждого разработчика, а десятки специализированных агентов, которые общаются между собой, берут задачи, делают handoff, просят друг друга сделать review и живут в одном рабочем пространстве.

Причем сами агенты могут работать через Claude Code, Codex, Kimi CLI, Gemini CLI, Cursor CLI и другие рантаймы. То есть Raft не пытается заменить существующих coding-агентов — он становится слоем координации поверх них.

Самая интересная мысль, которую продвигает автор проекта, — появляется новый офисный этикет:

Don’t talk to me. Talk to my agents.

И знаете… звучит уже не так футуристично.

Если агент постоянно знает контекст моей работы, умеет работать с моими репозиториями, помнит предыдущие решения и может самостоятельно принять новую задачу — зачем действительно отвлекать меня?

Передайте задачу агенту. Если потребуется — он сам меня подключит.

Еще один интересный факт. По словам команды, Raft разрабатывали около 10 человек и более 100 AI-агентов. И это, наверное, первый продукт, который открыто показывает, как выглядит разработка, когда агенты становятся полноценными участниками команды, а не просто инструментом в IDE.

Вообще у меня складывается ощущение, что мы постепенно переходим к следующему этапу Agentic Engineering.

Сначала появились персональные агенты вроде Claude Code, Codex и Kimi Code.

Потом появились инструменты для оркестрации и workflow.

А теперь появляются системы, которые начинают строить организацию из агентов. Где уже важен не один “сильный агент”, а взаимодействие десятков специализированных ролей.

Очень напоминает то, к чему я сам постепенно пришел со своим сетапом: несколько coding-агентов, общая память через SuperMemory, разные модели под разные задачи и передача контекста между ними.

Похоже, следующим большим этапом станет не гонка моделей, а гонка операционных систем для команд людей и AI-агентов.

И вот за этим наблюдать сейчас, пожалуй, даже интереснее, чем за очередным бенчмарком новой LLM.
  • ❤ 2
Post #560 398
RTK: минус 60–90% токенов на терминальном шуме

Нашёл очень правильный инструмент для длинных agentic coding-сессий — [RTK](https://github.com/rtk-ai/rtk), он же Rust Token Killer.

Проблема знакомая: coding-агент тратит огромную часть контекста не на код и рассуждения, а на вывод обычных команд:

git diff печатает сотни строк;
— тесты перечисляют тысячи успешных кейсов ради двух упавших;
— линтер повторяет одну ошибку в 50 файлах;
docker logs и kubectl logs забивают контекст одинаковыми сообщениями;
git push подробно рассказывает, как он считает и сжимает объекты.

Человеку этот вывод почти не нужен. Агенту — тем более.

RTK ставится между coding-агентом и терминальной командой:


Agent → RTK → git/cargo/npm/docker/kubectl → сжатый результат → Agent


Это не ещё одна LLM, которая пересказывает вывод. RTK — локальный бинарник на Rust с детерминированными фильтрами под конкретные команды.

Например, обычный:


git push


вместо 15 строк превращается примерно в:


ok main


А вывод тестов из сотен строк — в список только упавших тестов с ошибками.

RTK умеет группировать одинаковые ошибки, дедуплицировать логи, выкидывать boilerplate, сворачивать diff и оставлять только релевантную структуру. Сейчас поддерживается уже больше сотни команд: Git, GitHub CLI, Cargo, pytest, Go test, Jest, TypeScript, ESLint, Docker, Kubernetes, AWS, Pulumi и много чего ещё.

По оценке авторов, обычная получасовая сессия Claude Code вместо примерно 118 тысяч токенов терминального вывода потребляет около 24 тысяч. То есть экономия порядка 80%.

Но самое интересное здесь даже не стоимость токенов.

RTK позволяет агенту гораздо дольше удерживать полезный контекст. Меньше преждевременных compaction, меньше терминального мусора, меньше шансов, что важные требования и архитектурные решения будут вытеснены очередным npm test.

Для Claude Code, Cursor, Gemini CLI, OpenCode и ряда других агентов есть hooks, которые автоматически переписывают команды:


git status → rtk git status
cargo test → rtk cargo test


То есть агенту даже не нужно помнить про RTK. Это особенно важно для subagents: фильтрация применяется ко всем терминальным вызовам автоматически.

Для Codex интеграция пока не такая прозрачная: RTK добавляет инструкции через AGENTS.md и RTK.md, поскольку полноценного hook-перехвата там нет.

Ещё хороший момент: если команда упала, RTK сохраняет полный необрезанный вывод в отдельный файл. Агент может открыть его, когда сжатой версии недостаточно. Есть и -vvv, чтобы посмотреть оригинальный output вручную.

И отдельно важно: это уже не pet project, который автор обновляет по выходным. Основатель занимается RTK full-time и строит вокруг него отдельный стартап.

Это хорошо видно и по темпу разработки: постоянно добавляются новые команды, интеграции с coding-агентами, Windows-поддержка, аналитика экономии токенов и полноценная документация.

То есть есть шанс, что RTK не останется просто любопытным wrapper над CLI, а превратится в стандартный инфраструктурный слой для coding-агентов.

Установка:


brew install rtk
rtk init -g


Для Codex:


rtk init -g --codex


Статистику экономии можно посмотреть прямо в терминале:


rtk gain
rtk gain --graph
rtk discover


По сути, RTK — это оптимизированный транспортный слой между coding-агентом и CLI.

Мы очень много обсуждаем, какая модель лучше кодит. Но на длинных задачах не менее важно, какой именно контекст мы этой модели скармливаем.

И отправлять дорогой reasoning-модели сотни строк про успешные тесты и подсчёт Git-объектов — действительно странно.

Проект:
https://github.com/rtk-ai/rtk
GitHub GitHub - rtk-ai/rtk: CLI proxy that reduces LLM token consumption by 60-90% on common dev commands. Single Rust binary, zero dependencies CLI proxy that reduces LLM token consumption by 60-90% on common dev commands. Single Rust binary, zero dependencies - rtk-ai/rtk
  • 🔥 6
Post #558 373
💡 Похоже, следующая гонка AI будет не только за GPU, но и за оптику.

Китайские исследователи из Пекинского университета показали систему оптических межсоединений между обычными AI-чипами.

Самое интересное здесь не сам чип, а то, что данные между ускорителями начинают передаваться светом, а не электрическими сигналами.

Результат впечатляет:

до 100× ускорение распределенного inference для некоторых задач;
примерно в 9 раз меньше вычислительных ресурсов требуется для достижения той же производительности;
при этом используются стандартные электронные процессоры — меняется именно способ их объединения.

Это отлично ложится в общий мировой тренд.

Сегодня узким местом AI-кластеров становятся уже не сами GPU, а коммуникации между ними. Чем больше модель, тем больше времени ускорители просто ждут данные друг от друга.

Именно поэтому почти все крупные игроки сейчас активно инвестируют в фотонику:

NVIDIA продвигает Co-Packaged Optics;
Broadcom и Lightmatter строят фотонные интерконнекты;
Китай параллельно развивает собственные решения — Taichi, Meteor-1, LightGen и теперь новые оптические межсоединения.

Мне кажется, через несколько лет мы перестанем обсуждать только FLOPS и количество GPU.

Ключевым станет вопрос:

насколько быстро ваши ускорители умеют разговаривать друг с другом.

Именно коммуникации постепенно становятся главным бутылочным горлышком современных AI-суперкомпьютеров.

https://www.scmp.com/news/china/science/article/3360328/chinas-optical-chip-breakthrough-boosts-ai-speed-100-fold-using-fraction-compute-power
South China Morning Post China supercharges AI with 100-fold faster optical chip breakthrough Peking University researchers develop new all-optical interconnect system linking standard electronic chips with specific algorithms.
  • 🔥 2
Post #557 458
Grok 4.5 — мое почтение

xAI Илона Маска выкатили Grok 4.5.

И это, кажется, первая модель от них, которую я не просто «погонял», а реально начал использовать в боевых агентских задачах.

Что важно:

• модель обучали вместе с Cursor
• в обучении использовали триллионы токенов Cursor Data
• контекстное окно — 500K (скоро будет 1M)
• работает быстрее, чем Codex Spark
• по моим ощущениям, сильнее GLM 5.2 на больших инженерных задачах
• в Grok Build она сейчас используется по умолчанию
• пока есть семидневный trial — можно нормально попробовать

Но самое интересное для меня — даже не сама модель.

А Grok Build.

Это первый терминальный агент, который при первом запуске просто увидел всю мою рабочую среду.

Все мои скиллы.
Все MCP.
Все настройки и интеграции других агентов.

Он сам их нашел, импортировал и сразу начал использовать.

Ты буквально ничего не настраиваешь. Запускаешь Grok Build — и сразу оказываешься в своей привычной агентской среде.

Такого онбординга пользователя я пока не видел вообще нигде.

Обычно новый агент — это очередная настройка MCP, перенос скиллов, конфигов и правил. Потом выясняется, что половина не подцепилась, пути отличаются, а агент живет в пустой комнате и ничего не знает о твоем сетапе.

Здесь — один клик, и все работает.

Для меня это, наверное, самая крутая часть самого Grok Build. Даже круче, чем отдельные возможности модели.

Второе место по качеству такого опыта я бы отдал Z Code 3. Он тоже хорошо подхватывает существующее окружение.

Но первый старт Grok Build — пока самый бесшовный из всего, что я видел.

Дальше я решил проверить модель на реальных длинных задачах.

Все эти задачи я запускал при помощи своего фреймворка Xpowers. То есть модели получали одинаковый агентский harness, планирование, контекст и инструменты.

Одну и ту же крупную задачу я параллельно дал Kimi, GLM 5.2 и Grok 4.5.

И нормально решил ее только Grok 4.5.

Не «почти решил».
Не «нагенерировал много уверенного мусора».
Не «сделал 70%, а дальше пришлось заканчивать руками».

Он просто взял большую задачу, протащил ее через длинный агентский цикл и довел до рабочего состояния.

По моим ощущениям, это сейчас один из самых сильных вариантов именно для agentic coding.

Понятно, что по бенчмаркам уже начинается привычная война: почти Opus 4.7, быстрее Opus, дешевле Opus.

Но мне важнее практический критерий:

может ли модель внутри нормального агентского harness взять большую инженерную задачу и действительно ее закрыть?

В моем тесте — да.

И сделала она это очень быстро.

Потому что качество без скорости в agentic coding — это боль. А скорость без качества — просто быстрый нейрослоп.

У Grok 4.5 пока очень хороший баланс скорости и качества.

И еще один прекрасный продуктовый штрих.

Они сразу зарезервировали себе название Agent.

Терминальный агент можно запускать командой grok, а можно просто:

agent

То есть ребята сразу всем объяснили, кто они и какое место собираются занять на этом рынке.

Короче, если вы работаете с coding agents и гоняете действительно большие задачи, обязательно попробуйте связку Grok 4.5 + Grok Build.

Особенно интересно посмотреть, как она поедет внутри вашего собственного harness.

Мое почтение.
  • ❤ 3
  • 👍 3
  • 🔥 1
Post #556 453
Bun переписали с Zig на Rust за 11 дней. Миллион строк кода написал Claude

Вышел анонс Bun 1.4.0. И это не столько очередной релиз JavaScript-рантайма, сколько, возможно, самый масштабный публичный кейс agentic coding на сегодняшний день.

Bun 1.3.14 стал последней версией на Zig. Bun 1.4.0 — первая версия, основная кодовая база которой переписана на Rust. На момент публикации новая версия пока доступна через canary:

bun upgrade --canary

Причина переезда — не скорость. С ней у Bun и так все было хорошо.

Проблемой была стабильность на границе между JavaScriptCore с его garbage collector и вручную управляемой памятью Zig: use-after-free, double-free, утечки в редких error path и другие ошибки жизненного цикла объектов.

Можно было продолжать ловить их ASAN, фаззингом и code review. Но в Rust значительная часть таких проблем превращается в ошибку компиляции, а Drop гарантированно освобождает ресурсы при выходе объекта из scope.

Но самое интересное здесь — как именно переписывали Bun.

Это не был промпт «Claude, перепиши мне Bun на Rust».

Сначала Джарред Самнер вместе с Claude подготовил PORTING.md: формальные правила преобразования паттернов Zig в Rust. Затем отдельный workflow проанализировал lifetimes всех полей структур и собрал их в LIFETIMES.tsv.

После этого запустили около 50 динамических workflows в Claude Code:

— один агент реализует изменение;
— два независимых агента делают adversarial review и специально ищут, почему код неправильный;
— еще один агент применяет найденные исправления.

На пике одновременно работали 64 Claude в четырех worktree. За 11 дней они обработали 1 448 Zig-файлов, сделали 6 502 коммита, а итоговый diff составил больше миллиона добавленных строк. В пике агенты генерировали около 1 300 строк кода в минуту.

Стоимость до merge:

— 5,9 млрд uncached input tokens;
— 690 млн output tokens;
— 72 млрд cached token reads;
— примерно $165 000 по API-прайсу.

По оценке Джарреда, вручную такая миграция заняла бы примерно год работы трех инженеров, полностью знающих кодовую базу. Поэтому обычной командой они, скорее всего, вообще никогда не стали бы ее делать.

При этом тесты не удаляли и не скипали. На разных платформах прогонялось больше миллиона expect() и около 60 тысяч тестов.

Что получилось в Bun 1.4:

— исправлено 128 воспроизводимых багов из Bun 1.3.14;
— устранены все утечки памяти, которые удалось инструментировать;
— повторный Bun.build() больше не раздувает процесс до гигабайт: после 2 000 сборок потребление памяти стабилизируется примерно на 609 МБ вместо 6,7 ГБ;
— бинарник стал примерно на 20% меньше на Linux и Windows;
— большинство нагрузок ускорилось еще на 2–5%;
— запуск Claude Code на Linux стал быстрее примерно на 10%.

Конечно, это пока не полностью идиоматичный safe Rust. Около 4% Rust-кода находится внутри unsafe, потому что Bun продолжает работать с JavaScriptCore и большим количеством C/C++-библиотек. Но теперь потенциально опасные места хотя бы явно размечены и постепенно могут рефакториться.

И вот здесь, мне кажется, самое важное.

Это уже не история про то, что «ИИ научился писать код». Код он научился писать давно.

Это история про то, что правильно построенный harness позволяет сделать миграцию кодовой базы, которую команда раньше даже не стала бы начинать:

— формализовать правила;
— разложить работу на независимые циклы;
— отделить implementer от reviewer;
— запустить adversarial review;
— зафиксировать поведение огромной тестовой системой;
— исправлять не отдельные ошибки агентов, а сам workflow, который эти ошибки порождает.

Ну вы поняли, да?

Разработчик будущего не переписывает миллион строк руками. Он проектирует систему, которая может безопасно переписать миллион строк и доказать, что результат работает.

https://bun.com/blog/bun-in-rust
Bun Rewriting Bun in Rust Why & how we rewrote Bun from Zig to Rust
  • 👍 4
  • 🔥 2
Post #555 324
На vals.ai Fable 5 все равно номер 1, gpt-5.6 sol на втором месте. А из хороших новостей, тарифы у OpenAI очень щедрые за 200 баксов, рекомендасьон. Ну и вышедший вчера Muse от меты оставляет спорные ощущения пока, но дебют новой команды крутой энивэй
  • 👍 1
Post #554 321
Grok 4.5 который вышел вчера обогнал GLM 5.2! Not bad! 🧼
  • 🔥 4
  • 😁 1
Post #553 361
ИИ-модели — это уже не рынок. Это «Игра престолов».

Сейчас в мире frontier-моделей происходит какая-то совершенно прекрасная драматургия.

Anthropic выкатывает Fable 5 — по сути укороченную, более доступную версию своей старшей линейки. OpenAI тем временем готовит GPT-5.6 в трех реинкарнациях: Sol, Terra и Luna. Sol — самый жирный режим, Terra и Luna — более дешевые варианты. По текущим публикациям, релиз/публичный rollout намечен буквально на завтра.

И дальше начинается самое вкусное.

Anthropic дала Fable 5 погонять по подписке как промо. Народ, естественно, начал срочно жечь токены, потому что доступ должен был закончиться 7 июля. Потом Anthropic продлила промо до 12 июля.

Можно было бы просто докрутить лимиты, сделать Fable 5 еще дороже в использовании и все. Но нет — начинается классическая игра в scarcity, лимиты, подписки, доступы, промо-окна и ощущение: «успей попользоваться, пока не отобрали».

А с другой стороны OpenAI, судя по всему, идет в обратную сторону: делает линейку, где топовый Sol должен быть доступен по подписке, плюс есть история с reset usage — то есть фактически у тебя появляется не одна подписка в месяц, а несколько «жизней» внутри подписки.

Не infinite tokens, конечно. Но по ощущениям — очень щедро.

И вот тут становится понятно главное: конкуренция — это единственное, что спасает нас от безумных цен.

Не было бы Anthropic — OpenAI могла бы спокойно продавать нам каждый чих по цене крыла от самолета.

Не было бы OpenAI — Anthropic могла бы держать Opus/Fable в режиме «дорого, мало, зато безопасно».

Не было бы китайцев — американцы вообще бы не торопились.

Не было бы американцев — китайцы бы не пытались каждый месяц выкатывать «почти frontier за копейки».

А сейчас у этого рынка есть настоящие персонажи.

Есть Tibo из OpenAI, который постоянно троллит Anthropic и Claude Code.

Есть Борис Черный из Anthropic и вся Claude Code-тусовка, которая пушит свою агентную идеологию.

Есть китайские команды, которые то выкатывают очередную модель за смешные деньги, то тонко стебут американцев, то внезапно догоняют их на бенчмарках.

Это уже не просто «у кого модель умнее на 3%».

Это сериал.

С интригами, лимитами, утечками, банами, API-ключами, серыми токенами, export control и мемами в твиттере.

Отдельный слой — Китай.

США очевидно пытаются ограничить доступ Китая к самым сильным моделям. Anthropic жестко режет доступ из неподдерживаемых регионов, банит подозрительные аккаунты, а вокруг Claude Code уже даже появилась отдельная история с детектом китайских пользователей.

Но рынок, как обычно, находит дырки.

Есть целая серая экономика токенов: перепродажа доступа к Opus, Gemini, GPT, через прокси, чужие аккаунты, корпоративные ключи, реселлеров и прочие схемы.

И я почти уверен, что с китайскими моделями будет то же самое в обратную сторону.

Если какая-нибудь китайская модель будущего окажется реально сильной и формально будет доступна «только для Китая», она все равно очень быстро появится на сером рынке. Через API-прокладки, реселлеров, облака, «друзей в Шэньчжэне» и вот это все.

То есть запреты будут.
Баны будут.
Геофенсинг будет.
Но токены все равно потекут.

И это делает историю еще интереснее.

Потому что мы сейчас, кажется, находимся где-то в середине экспоненты.

Либо в ближайшее время произойдет еще один качественный скачок — такой же, как был переход от «чатбота» к «агенту, который реально пишет код».

Либо окажется, что дальше прогресс будет идти тяжелее: больше compute, больше regulation, больше safety, больше закрытых релизов, больше политики.

Но в любом случае это уже не скучный рынок SaaS-подписок.

Это глобальная война за интеллект.

С королями, вассалами, шпионами, контрабандой токенов, мемами, временными альянсами и внезапными предательствами.

И мы живем прямо внутри этого сезона.
  • ❤ 5
Post #552 350
Последние пару недель активно экспериментирую с мобильной удалённой разработкой.

Раньше основным клиентом для меня был Termius, а сейчас параллельно пересел ещё и на Prompt 3 Pro. Очень понравилась идея иметь полноценный терминал на iPhone, чтобы в любой момент подключиться к серверу и посмотреть, что делают Claude Code или Codex.

Заодно решил сравнить Mosh и Eternal Terminal (ET).

Если коротко:

Mosh — это инженерное произведение искусства, которое отлично решает проблему нестабильной сети.

Eternal Terminal — это то, чем лично мне оказалось комфортнее пользоваться каждый день.

Почему?

### Mosh

Mosh не пытается быть SSH. Он работает поверх UDP и синхронизирует состояние экрана, а не поток байт.

Плюсы:

* практически мгновенный отклик на плохой сети;
* переживает смену Wi-Fi ↔ LTE;
* спокойно переносит временные разрывы соединения;
* идеально подходит для поездов, самолетов и нестабильного мобильного интернета.

Но есть и обратная сторона.

Из-за своей архитектуры у Mosh всегда были особенности со scrollback. Когда Claude Code за пару часов выводит десятки тысяч строк логов, обычный скролл превращается в боль. Да, есть tmux copy mode, но это уже компромисс.

### Eternal Terminal

ET идет другим путем.

Он сохраняет привычную модель SSH, но умеет автоматически восстанавливать соединение после обрыва.

В итоге получаем:

* привычное поведение терминала;
* полноценную работу со scrollback;
* отличную совместимость с tmux;
* никаких сюрпризов при работе с длинными логами AI-агентов.

### Что выбрал я

Сейчас мой мобильный стек выглядит так:


Prompt 3 Pro

Eternal Terminal

tmux

Claude Code / Codex


При этом Termius никуда не делся — продолжаю пользоваться им параллельно. Но именно для долгих agentic workflow и наблюдения за работой AI-агентов связка Prompt 3 Pro + ET + tmux пока нравится больше всего.

Mosh тоже не списываю со счетов. Если нужно работать через совсем плохой LTE или нестабильный Wi-Fi — он по-прежнему один из лучших инструментов.

Но если ваша основная задача — часами гонять AI-агентов, искать ошибки в логах и постоянно скроллить вывод, то рекомендую попробовать Eternal Terminal.

Очень недооцененный инструмент.
  • 👍 1
Post #550 345
ZCode — новый швейцарский нож agentic coding

Вышел ZCode от Z.AI — это те самые ребята из GLM / Zhipu AI.

И это, по сути, их ответ Codex app.

Приложение доступно под macOS и Windows, плюс есть Linux beta. Ставится как обычный desktop app и сразу работает как полноценный coding agent: планирует, ходит по репе, правит файлы, гоняет команды, ревьюит, деплоит.

Самое интересное — это не просто «еще один редактор с чатом».

ZCode пытается быть универсальным UI-harness для агентной разработки.

Он умеет работать через Anthropic Messages protocol, через OpenAI-compatible protocol и еще через кучу интеграций. То есть его можно подключать не только к родному GLM-5.2, но и к своим провайдерам, роутерам, OpenRouter-подобным историям и вообще к тому, что вы уже используете.

У меня он сразу из коробки подхватил X Powers. Без танцев.

То есть все эти штуки, которые обычно подтягивает Codex — skills, контекст, workflow-обвязка — здесь тоже начинают жить нормальной жизнью.

Но главная фишка для меня — Telegram link.

Это сделано очень правильно.

Когда ты сидишь в ZCode — агент не спамит тебе в Telegram.

Когда ты уходишь в Telegram — он начинает общаться с тобой там.

И при этом он не шлет исходники в Telegram. Не превращает приватную репу в чатик. Он просто пишет статусы, задает вопросы, принимает команды и продолжает работать у себя.

Это как раз та UX-деталь, которой обычно не хватает агентным тулзам.

Я нажал, ушел, агент работает. Нужно мое решение — он пришел в Telegram. Не нужно — молчит.

Очень практично.

По ощущениям, ZCode — это не «китайский клон Codex», а попытка собрать нормальный универсальный перочинный нож агентности.

Поставил.
Подключил нужный протокол.
Подцепил своего провайдера.
Дал репу.
Дал задачу.
И оно работает.

В каком-то смысле это не прямой конкурент Claude Code.

Claude Code живет в терминале и хорошо ложится в TUI/workflow разработчика.

ZCode — это другая ветка: desktop UI для агентной разработки. Ближе к Codex app, только более универсальный по протоколам и интеграциям.

То есть это не «замена Claude Code один-в-один», а скорее еще один важный формат agentic coding: не TUI-агент, а полноценное приложение, которое живет рядом с IDE, мессенджером и вашими провайдерами.

Понятно, дальше надо смотреть, как оно будет жить на длинных задачах, больших репах и реальном проде.

Но направление очень правильное.

Похоже, рынок быстро приходит к тому, что важен уже не просто «какой моделью ты пользуешься», а какой у тебя harness вокруг агента:

— как он держит контекст
— как планирует
— как работает с skills
— как общается с пользователем
— как не сливает код в мессенджеры
— как живет рядом с твоими текущими инструментами

И вот здесь ZCode выглядит прям интересно.

Рекомендую попробовать.

https://x.com/zai_org/status/2072349453361557898?s=46
  • 👍 3
  • 🔥 2
Post #549 495
Plannotator — недостающий UI для agentic coding

Кажется, появилась еще одна важная штука для нормальной работы с coding agents — Plannotator.

Суть простая: агент перед тем как что-то делать пишет план. Обычно мы этот план читаем в терминале, глазами пробегаем, говорим «ну вроде ок» — и дальше агент уезжает чинить мир, иногда не туда.

Plannotator делает из этого нормальный review-процесс.

То есть не просто «approve / deny», а прям:

— открыть план в нормальном визуальном интерфейсе
— выделить конкретные куски
— написать inline-комментарии
— пометить что выкинуть
— предложить замену
— отправить это обратно агенту как структурированный feedback

И агент уже не просто получает «переделай», а получает конкретные аннотации: вот тут лишний scope, вот это не трогай, вот здесь сначала напиши harness, вот тут нужен guard, вот здесь eval.

По сути это PR review, но на уровне плана до того, как агент начал писать код.

И это очень правильный сдвиг.

Потому что в agentic coding главный leverage сейчас не в том, чтобы руками править каждую строчку кода. Главный leverage — в том, чтобы правильно управлять направлением агента:

1 сначала хороший план
2 потом хороший harness
3 потом выполнение
4 потом review diff-а
5 потом следующий цикл

Plannotator как раз закрывает дырку между «агент что-то предложил» и «я это реально осознанно принял».

Еще прикольно, что он работает не только с Claude Code. Поддерживаются Claude Code, OpenCode, Codex, Copilot CLI, Gemini CLI, Pi и другие агенты. Есть review локальных git diff-ов и PR, аннотация файлов/папок/URL, история версий плана и diff между ревизиями.

Отдельно понравилась идея с шарингом планов. Маленькие планы кодируются прямо в URL hash, без сервера. Большие — через short link, но с end-to-end encryption: в браузере шифруется AES-256-GCM, сервер хранит только ciphertext, ключ живет в ссылке, пасты удаляются через 7 дней.

То есть можно скинуть коллеге план агента, он его проаннотирует, а ты потом импортируешь этот feedback обратно в агента.

Это уже очень похоже на то, как будет выглядеть инженерная работа в командах с агентами.

Не «я написал код».
А «я управляю спецификацией, планом, guardrails и review-loop».

Раньше мы делали code review после того, как человек уже написал код.
Теперь все больше смысла делать plan review до того, как агент вообще начал что-то менять.

И вот Plannotator — это как раз инструмент для этого нового слоя engineering workflow.

GitHub: https://github.com/backnotprop/plannotator
GitHub GitHub - backnotprop/plannotator: Annotate and review coding agent plans and code diffs visually, share with your team, send feedback… Annotate and review coding agent plans and code diffs visually, share with your team, send feedback to agents with one click. - backnotprop/plannotator
  • 🔥 3
  • 👍 2
Post #548 373
Как я работаю с удалёнными машинками

Небольшая хозяйке на заметку.

У меня есть несколько машин, которые живут в разных сетях. До части из них нет прямого SSH-доступа, где-то нужны туннели, где-то всё спрятано за NAT, где-то машина стоит дома, где-то в офисе, где-то ещё.

Можно было бы на каждую городить отдельные SSH-туннели, jump-host’ы и прочий админский фольклор.

Но есть более приятный путь — Tailscale.

Это такой VPN между вашими девайсами. Ставите клиент на машины, они попадают в одну приватную сеть, получают свои IP, и вы можете достучаться до них из любой точки мира.

Для личного использования у них есть бесплатный план, и для большинства домашних/полу-домашних сценариев этого более чем достаточно.

Понятно, что сейчас есть Codex, Claude Code Remote, Z.Code и прочие модные штуки. Но если вы не просто «пишете код в облаке», а реально работаете с железом, деплоите, дебажите, гоняете агентов, трогаете данные, поднимаете окружения — SSH всё равно нужен.

И вот тут Tailscale очень хорошо ложится.

Вторая штука, которую я активно использую, — Jump Desktop.

У них есть свой протокол Fluid, и он реально быстрый. Через него удобно подключаться к удалённым машинам с графическим интерфейсом и нормально работать, а не страдать от лагающего VNC из 2007 года.

Зачем всё это нужно?

Потому что в эпоху coding agents у вас внезапно появляется не одна рабочая машина, а маленькая ферма.

Один агент что-то пилит на одной тачке.
Другой собирает билд на другой.
Третий дебажит мобильное приложение.
Четвёртый гоняет тяжелый пайплайн.

И не всё удобно делать на VPS.

Например, если вы делаете мобильные приложения под iOS, вам нужен macOS. Да, Flutter можно частично завести на Linux VPS, можно настроить билды, можно через MCP гонять агентам команды. Но на практике это часто неудобно.

Иногда нужно просто открыть приложение, посмотреть интерфейс, увидеть, как оно реально работает, как агент его дебажит, куда он нажал, где сломался layout, что происходит в симуляторе.

VPS этого нормально не даёт.

Да, можно поднять виртуальный дисплей. Можно настроить всё через костыли. Можно героически страдать.

Но мой вывод простой: для таких задач лучше использовать нормальные железные машинки.

Mac mini — отличный вариант.
Mac Studio — ещё лучше, если нужно помощнее.
Если у вас есть NVIDIA DGX, AMD AI box или какие-то другие локальные вычислительные коробки — логика та же самая.

Их надо просто нормально соединить в одну рабочую сетку.

Мой текущий сетап:

Tailscale — чтобы все машины были в одной приватной сети и к ним был SSH из любой точки.
Jump Desktop — чтобы быстро и комфортно заходить на машины с GUI.
Железные Mac mini и vps — как рабочие станции для агентов.

В итоге получается довольно удобная инфраструктура для agentic coding: агенты работают на разных физических машинах, а ты можешь в любой момент зайти, посмотреть, помочь, перезапустить, подебажить или просто понять, что они там натворили.

Просто хозяйке на заметку.
  • 👍 13
  • ✍ 2
  • 🔥 2
  • 👏 2
Post #547 529
Мы с Егором Толстым и с топовыми русскоязычными agentic engineers делаем https://podlodka.ai community.

Вот я там как раз готовил введение про SDD, superpowers, hyperpowers и свою модификацию xpowers

Я там подробно рассказал все предпосылки моей методики agentic engineeringa. Это для тех кто не в курсе про все эти SDD, TDD, superpowers и тд.

Отличная отправная точка, друзья!

А еще мы с ДОРОГИМ БРАТОМ Геной Евстратовым готовим крутейший хэндбук, системный подход в agentic engineering. Stay tuned!

Поставьте огонечков!
Podlodka AI Engineers Club Учимся применять AI и внедрять его в команды. Еженедельные сессии с экспертами и живое сообщество от создателей подкаста Подлодка.
  • 🔥 26
  • 👍 8
  • ❤ 4
Older posts →
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →