TGViewer
Channel Public Channel
DEKSDEN notes

DEKSDEN notes

@deksden_notes

Мои заметки на разные темы, уровень - "для продолжающих"
Vibe Coding -> AI SWE, AI Coding Tools, Agents, news, links
Чат (!!!): https://t.me/+B1fB3sZbaVthMDhi

Админ @deksden

В канал бесплатно публикую опенсорс проекты - пишите админу

Вакансии? админу
Subscribers
3.1K
Photos
770
Videos
10
Links
768

Showing posts older than #938 · Back to latest

Older Posts 20 shown
Post #937 1.26K
⚪️ Vercel скушал BetterAuth


Есть неплохой проект в мире TS для авторизации во всем что только можно - Better Auth.

Теперь это у Vercel. Они упорно собирают все инфраструктурные проекты! Ну - хоть ClaudFlare туда же собралась - будет какая то конкуренция.

@deksden_notes
  • 👍 11
  • 🔥 4
  • ❤ 1
Post #936 1.23K
⚪️ Loop Engineering


Какое то время назад на хайпе проскакивала тема Loop. Русскоязычные названия почему то в голову лезут не совсем приличные!

Но тему раскачивали и Борис из Клод Кода, и куча других известных персонажей.

Суть Loop: агенты работают в цикле, пока не выполнят задачу. Такой режим работы поддерживается штатными функциями упряжек типа /goal команд.

▶️ Поделюсь своим опытом.

Да, у меня давно существвует и в какой то мере отработан стандартный SDLC флоу : цепочка этапов prime -> discuss -> specify -> plan -> code -> merge. Но это не тот цикл, о котором хотел поговорить.

Для некоторых проектов у меня есть задача отработки какой то функциональности. В частности, в боте, работающем с базой знаний - это пайплайн импорта (когда бот "читает" и перерабатывает знания из источников разного рода в граф), и пайплайн "ответов" по этой базе.

Что я сделал. Я создал систему агентных тестов (назвал их экспериментами, хотя это скорее эвалы - ну, исторически такой вот термин, хоть и не точный). Агент, используя специальный раннер, запускает код пайплайна на заранее подготовленных данных определенного формата. По итогам запуска, делается агентное ревью результатов, мульти-аспектное исследование субагентами качества переработки знаний по разным критериям.

Да, вы правы - это весьма похоже на интеграционный тест: только логика оценки результатов не детерминированная, а агентная.

▶️ Так вот. Я сделал простой цикл: прогнав "эксперимент" агент оценивает результаты. Если выявлены существенные отклонения по качеству, агент начинает короткий SDLC цикл:

• смотрит выявленные существенные отклоненния
• устанавливает причину в коде
• анализирует "истинную причину" - смотрит "сверху вниз", чтобы чинить не следствия, а причины
• создает новый протокол на устранение недоработок
• прогоняет протокол по стандартному флоу plan -> code, там на plan много проработок протокола "вглубину" еще делается;
• с исправлениями запускает эксперимент снова - цикл повторяется

Все это работает под командой /goal в кодексе.

▶️ Наблюдения: в принципе, схема рабочая.

Циклы крутятся по суткам и больше, и достигают результатов. Один пайплайн на ответы был доработан, циклов было сделано 8, времени - 3 часа примерно. Результат хороший.

С циклом на импорт знаний ситуация похуже - он сильно сложнее, и крутится уже вторые сутки. Протоколов сделано более 20, процесс идет.

👉 Проблемы: есть небольшой дрифт логики работы - инструкции заставляют перечитывать промпты, но не все моменты цикла зафиксированы в промптах, что то, видимо, не учтено. то есть требуется более тщательное прописывание логики работы цикла - промпт /goal тут не совсем подходит.

Схема защиты от хождения по кругу (с исправлением примерно одного и того же) требует доработки.

Видимо, нужно придумать схему "гипотез".

Я бы предпочел реализовать этот цикл на детерминированном dynamic workflow - чтобы четко прописать логику работы, но такого пока в стандартном кодексе нету - хоть изучай сторонние решения!

Промптами такое прописывается не совсем надежно, дрифт после многих часов работы видимо возможен.

Отладка таких процессов немного затруднена их длительностью.

Пока не придумал удачной observability для такого флоу: данных же очень много, надо выделять что то существенное.

👉 Плюсы: оно условно само дорабатывает софт в заданном направлении. Просто требуется наработать опыти правильно это все организовать.

Направление интересное - можно придумать разные циклы подобного рода.


❓ Вы забавляетесь чем то подобным? Интересная обратная связь и опыт


@deksden_notes
  • 👍 11
  • 🔥 5
  • ❤ 2
  • 🤯 1
Post #935 1.38K
⚪️ Апи-геддон на Клоде откладывается до 12 июля!


Антропики не решились дернуть рубильник в ранее намеченную дату 7 июля, и Фубля будет с нами на подписке до 12 июля.

Видимо, приняли решение стрелять в ногу дуплетом - если 12 отключат Фублю, то 13 кончается акция на х2 лимиты..

.. или они пойдут по пути Санлайта и прощальных концертов Пугачевой - и Фубля будет прощаться, но не уйдет?

@deksden_notes
  • 😁 18
  • 👍 4
Post #934 1.42K
⚪️ Нативный GLM субагент в codex


Тут побаловался немного с прикручиванием GLM в Codex cli. Зачем? Идея - брать "второе мнение" на некоторых флоу при планировании, при ревью. Мульти-модель всегда давала какой то буст в перфомансе, раскажу потом о конкретике - что удалось добиться, это отдельно.

Сейчас расскажу о деталях "прикручивания".

▶️ В чем нюансы? z.ai дает openai-compatible ручки формата completions. А codex хочет более новый формат Responses API. Следовательно, нужен слой трансляции API - благо сейчас это не проблема.

У меня базовый сетап был построен так: стандартный CODEX_HOME был для Codex.app чтобы спокойно без прокси логинится в какой то аккаунт (при работе через CPA часть функций либо не доступна, либо глючит - поэтому лучше напрямую).

Основную работу я делаю через Codex cli (Cmux) и для него сделан отдельный профиль/home, запускаемый скриптом "cx". Он подключает codex к прокси с пулом аккаунтов, управляемых приложением Quotio. Под капотом там тот же CliProxyApi, дефолтный порт 8317.

Его я и взял для трансляции API для GLM.

Настроил систему под GLM:
• сделал отдельный инстанс CPA на другом порту 8327 с glm-провайдером; там и ключ подтягивает от z.ai coding plan;
• добавил в конфиг кодекса нового провайдера - локальный glm прокси на 8327;
• сделал кастомного субагента "glm" с указанием модели glm-5.2 и ризонинга high, ну и провайдера из конфига;
• добавил в конфиг codex cli нового провайдера - локальный glm-прокси;
• сделал скрипты для glm-прокси, которые стартуют/останавливают/обновляют ядро CPA/статус текущий показывают.

▶️ получилось несколько конфигов, ссумирую еще раз:
• Дефолтный codex.app без CPA
• Конфиг для Codex CLI который настроен на пул аккаунтов Quotio/CPA, дополнительно там прописан провайдер GLM-прокси, и кастомный субагент "glm" который подключен к этому провайдеру.


▶️ В codex есть multi-agents v1 и новый v2. TLDR: c v2 работать не будет, там пока баги. Выключайте экспериментальный v2, он еще даже не beta версии. Надеюсь его доработают.

Пока - рабоатем с v1. Важно: сессии, которые начаты с v2, прийдется стартовать заново, переключить "движок" субанентов в сессии во время работы нельзя, только при старте новой сессии. Запоминает в jsonl файле.

▶️ В целом все рабоатет, можно играцца дальше

👉 Агент все это может вам сделать на вашем сетапе, но нужно "прогреть" его гугленьем конкретных штук - проект CPA, Z.ai доки, доку/исходники codex cli.

——
upd 1️⃣ : конечно использвоать любой cli с нативной поддержкой glm ничего не запрещает, через bash! Но тут дело было в желании сделать именно нативный субагент, как эксперимент.


@deksden_notes
  • 👍 12
  • 🔥 9
  • ❤ 3
Post #933 1.55K
⚪️ Hy3 - бесплатно


Пока мы тут ожидаем три-релиз фронтирной гпт, можно размяться очередным приплывшим с поднебесной китом - вышла Tencent Hunyuan 3.

Из интересного - бенчи сразу пропускаем, скажу только что в бенчах средний для китов результат, на КДПВ видно что где-то получше, где то похуже китовых грандов.

Интересно другое: free api на openrouter до 21 июля! Не оч быстро, 65 tps, провайдер - Novita.

Самое время попробовать, подключить как "третье мнение" в ревью, заморочится и сделать таки интеграцию в свой флоу..



В общем - есть бесплатный период на эксперименты

Посмотрел буржуйские китовые подписки - там нету. В Droid Core отсутствует (зато там завезли таки GLM 5.2 Fast и Minimax M3 появились), в OpenCode Go / Cline Pass нету, они с Tencent вроде и не работали. Ну и ладно - опенрутер уже отлично.

(ц) Хорошо же!

@deksden_notes
  • 👍 8
  • 🔥 2
Post #932 1.42K
⚪️ Готовимся к три-релизу 5.6?


Все мы знаем что релиз линейки моделей gpt 5.6 готовится. Есть данные и про завтра, и про четверг и про четверг следующей недели - это уже область гаданий и ставок на полимаркетах.

❓Вопрос другой: готовите свои флоу к релизу линейки моделей? Что думаете?


▶️ Я вот уже все распланировал как меняю в оркестраторе модели. Sol думает/планирует/ревьюит, Terra кодит и верифицирует, Moon будет исследовать.

Это первый такой релиз гпт, чтобы в поколении РАЗОМ вышло семейство моделей одного поколения. Даже антропик сейчас линейку двигает урывками, хотя концепция линейки моделей - его (как и много других концепций в AI SWE / ИИ в целом).

@deksden_notes
  • 🔥 10
  • 👍 2
  • ❤ 1
Post #931 1.83K
⚪️ Хвиттерские сравнения моделей


Вот почитывая хвиттер, решулярно натыкаюсь на такой вот жанр обзоров:

🔗 Пациент : https://x.com/naymur_dev/status/2073059979834331206


Чел сделал ваншотом флаппибёрд на GLM-5.2 / DeepSeek v4 Pro / Fable 5 и сравнивает их результаты. Но я не про это - почитайте источник кому интересно, что Фубля вышла самой дорогой (неожиданно!).

▶️ У меня смешанная реакция на такой контент. С одной стороны - это практический тест, наглядный результат, оценка цены. Вроде, делается попытка вывести соотношение цены/качества с каким то выводом.

Что меня тут настроаживает я думал и придумал: ваншот я НЕ использую от слова совсем. Мне вообще мало где можно применить ваншоты - нету таких проектов и применений, совсем нету!

Мои проекты работают по флоу из моего меморибанка, праймятся контекстом проекта, отрабатывают пайплайны промптов в циклах SDLC, крутят лупы с эвалами/экспериментами. Мне важны другие качества модели - как она планирует, как оркестирует. Ну - для кодеров - как пишет код по спеке. Как валидирует, как генерирует идеи экспериментов.

И вот такие ваншоты мне не говорят НИЧЕГО. Более того - они разъезжаются с моей практикой! Потому что дорогой запуск умной модели на планировании бережет мне кучу времени, токенов на переделке кода/тестов/сценариев/экспериментов/эвалов - и в итоге делает разработку быстрее и дешевле. Такой вот пердимонокль

❓ Что думаете? Есть такая буква?

@deksden_notes
X (formerly Twitter) Naymur Rahman (@naymur_dev) on X DeepSeek v4 Pro vs GLM 5.2 vs Fable 5 I tried creating the same games with them. I wanted to see how good they are in UX (not just UI). For the test, I used the /design from command code. Pricing differs across the models. OS model pricing is way cheaper…
  • 💯 18
  • 👍 8
  • ❤ 2
  • 🔥 2
  • 👎 1
Post #930 1.73K
⚪️ Shadcn/ui теперь по дефолту на Base UI


Новости параллельной вселенной. Shadcn/ui переходит в дефолте на BaseUI с более древнего RadixUI.

В целом - ок. BaseUI как новая инкарнация подходов Radix выглядит понаряднее, и уже довольно стабильная.

Агенты знают эту штуку более-менее.

Норм, кмк

❓ Вы на base или еще на radix?


@deksden_notes
  • 👍 8
Post #929 1.57K
⚪️ Anthropic API rate limits увеличены

Соннет/хайку на высоких тирах - аж в 5 раз! И при этом логика апгрейда тиров отвязалась от суммы трат, можно просить перевести на более высокий тир самостоятельно, из консоли.

Дарио не может отказать вам в желании лить ему деньги скорее и больше!

(ц) это хорошие новости? Я запутался

@deksden_notes
  • 🤣 10
  • 🔥 5
Post #928 1.36K

Forwarded from Max Syabro and a Slop Driven Development

https://mdtask.dev
https://github.com/syabro/mdtask

😮 Выкатываю в паблик mdtask - markdown-based тасктрекер для evergreen SDD. Который пилю и использую уже пару месяцев.

Тлдр: задачи лежат в файлах со спеками и спека обновляется с кодом в одном коммите с закрытием задачи. Плюс cli и три скилла как заводить, выполнять и хранить

К любым таск трекерам у меня всегда была особая любовь. Думаю это началось где-то с traq. Кастдевмлил народ под свой, потому что джира была тумач и тормозила. В итоге положил на полку ибо ресурсов на второй линеар точно не хватило бы.

А вот когда начал работать с агентами достал и стряхнул пыль.
Сильно не хватало какой-то простой и понятной системы для того, чтобы можно было сохранить, засунуть луп и сказать агенту «делай это». И чтобы спеки были first-time citizen.

- Openspec слишком перегружен.
- Linear/JIRA для мелких продуктов это перегруз + спеки 100% идут по одному месту если не следить.
- Просто список задач? Не хватает, но с этого начал.

Сделал mdtask.

😲 Нахуя и главное зачем

1. Задачи хранятся локально. В markdown. Это легко читать-писать-изменять-whatever как кожаному так и агенту. Никаких саасов. Легко начать, не понравится - данные все еще ваши.

2. Задачи хранятся в файле спеки. Отсюда один файл = что уже есть + что будет. И легко трекать если спека не обновилась а задача какого-то хера закрылась
3. В одном коммите лежит код, обновление спеки и закрытая задача. В логах это будет полезно

4. CLI тулза на ноде. Умеет автоматически проставлять ID и показывать список задач по проекту с фильтром - по дефолту показывает незаблокированные и незавершенные задачи. @blocked_by из коробки

5. Набор скиллов /mdtask (описание, формат задач, sdd), /mdtask-add (создание задачи) /mdtask-do флоу для выполнения. То что наполировалось за время использования
Ю

Из идей html view для проекта. И eagle eye view для кучи. Короче вот они данные только руку протяни. Делай что хочешь поверх

Короче топ, рекомендую :)

С вас шер, звездочка и рассказать что неудобно 🙃
mdtask mdtask — Evergreen SDD with task-driven specs Tasks and their spec live in one Markdown file, closed in one commit — the spec never drifts from your code.
  • 👍 13
  • ❤ 10
  • 🔥 3
  • 👀 2
  • ❤‍🔥 1
Post #927 1.5K
⚪️ Claude Code Artifacts на Pro, Max тарифах


Сделали дост упными Артефакты из Claude Code на тарифах Pro / Max.

Артефакты - это аналог canvas, но теперь антропики не просто в чате их показывают в сайдбаре, а хостят на своем сервере, смотреть их списком можно claude.ai/code/artifacts. Это живая интерактивная страничка, у которой есть URL для ее просмотра.

Claude Code может обновлять этот артефакт в ходе работы в сессии.

Артефакты здорово подходят для отчетов о задаче, дашбордов, визуализаций различных.

Это не может быть веб приложением, бэкэнд не предусмотрен.


🔗 Дока : https://code.claude.com/docs/en/artifacts


@deksden_notes
  • 👍 4
  • ❤ 3
Post #926 1.49K
⚪️ ZCode


Ну и уж сегодня речь про инструменты, напишу таки про свежий ZCode - уж больно часто он мне нынче попадается, а с релизом ZCode 3 про него все заговорили.

Вообще, егт выпускали 29.12.2025, но версия 3 - новая. Считайте его близким клоном Codex.app. Оч похож, и это скорее комплимент. В комплекте с очень достойной GLM 5.2 все это выглядит нарядно.

👉 Сейчас акция - х1.5 лимиты на GLM в кодинговом плане в ZCode.

Фич много: goal (я ж говорю - родилась на глазах де-факто стандартная фича), subagents, skills, mcp, plugin, commands, browser, terminal - вроде все стандартное "как у людей". Скажу о тех, что показались примечательными чем либо.

▶️ task management: умеет не только по проектам группировать сессии, но и в произвольные группы. Может быть удобно.

Файловый менеджер тоже тут - около сессии или проекта (да, в левой панели - что непривычно, я его обычно в правой панели ищу)

Быстрые действия в панели поиска, тоже нестандартно, но удобно

▶️ mobile: помимо мобильного доступа есть управление через мессенджеры, в числе китайских спасибо за telegram

подключение через телефон - в web приложение, не в нативное приложение. Ну - ок

▶️ remote: это когда вы можете вести разработку на удаленной машине через SSH, управляя всем через приложение на десктопе. ZCode подключится, загрузит агента на хост, и будет им рулить с вашего десктопа. Настроенное подключение можно рулить через мобилку, но настравиать его надо на десктопе.

👉 Чего не хватает?

browser умеет выделять элементы странички и пихать их в контекст, но не умеет делать к ним аннотации (встроенного react grab / agentation нету)

нету /btw или /side. я к ним привык.

нету dynamic workflows. Понимаю, что многого хочу - но это было бы круто! Может, сделают

👉 Вердикт: неплохой GUI, достойный старт. Жду развития.

❓ Если интересно - я бандл расковырял, могу поверхностный обзорчик имеющихся потрохов чего туда входит и понапихано дать. практически хз кому это надо, но мне было любопытно


(ц) такое мы ковыряем и пользуем временами, да!

@deksden_notes
  • 🔥 16
  • 👍 12
  • ❤ 6
Post #925 1.48K
⚪️ Droid + Glm 5.2 Fast


В дроид завезли GLM 5.2 Fast от Fireworks.

Это инференс на 140 tps

Приятная фича

Коэффициент такой:
• стандартный GLM 5.2 тратит 0.55
• fast GLM 5.2 - уже 1.1, то есть х2 от базового рейта


@deksden_notes
  • ❤ 6
Post #924 1.58K
⚪️ /Goal в Kimi Code


Я про агента от Муншотов, у них есть свой CLI, неплохой. Называется Kimi Code, да - это топ нейминга назвать агента ровно как свою кодинговую модель, чтобы враги не поняли чего к чему! Антропик решит дистилировать их модель - а это кодинговый агент! Видимо, такой план

Ну - а кроме шуток, добавили /goal, как "у старших братьев" - кодекса и СС. Это та штука, которая заменяет агентную выносливость (которая и так была неплоха у кими) на инструмент, гарантирующий "дотягивания" задачи до обозначенной цели.

Специфика применения инструмента конечно есть, но я вижу что /goal становится непременным стандартом де-факто для агентных упряжек - и это здорово! Инструмент крайне полезный.

🔗 Дока : https://www.kimi.com/code/docs/en/kimi-code-cli/guides/goals.html

Кстати - есть и оригинальная придумка в виде /goal next для постановки в очередь следующей цели - для еще более длинных агентных забегов!)

(ц) про инструменты

@deksden_notes
  • 👍 7
  • ❤ 3
  • 😁 3
Post #923 1.67K
⚪️ Погадаем на Кодекс?

Тут кодексовские медиа персоны начинают тихонько греть публику к релизу.

Мы все знаем, что релизнут - рано или поздно. Вопрос - когда?

Сегодня четверг. Вроде, рыбный день! Но веры в сегодняшний релиз мало - только вышла Фубля, все с ней играют до 07.07.

А дальше, уже 08.07 народ увидит сколько оно стоит по апи и вот тут можно релизить гпт))

Следующий четверг - это 09.07, то есть публика уже будет "теплая", возможно, после пары дней шитсторма по поводу "что же так дорого!"

Такой вот прогноз


❓ Что думаете?


——

Upd 1️⃣ : народ вспомнил что акция с +50% недельными лимитами заканчивается 13.07! Может быть ради такого клозеды и на недельку еще отложат релиз


@deksden_notes
  • 💯 14
  • 👍 7
  • 😭 2
  • ❤ 1
  • 🥰 1
Post #922 1.61K
⚪️ Иногда они возвращаются - CloseRouter ожил!


Поменяв схему работу с провайдерами. Теперь у моделей разные провайдеры с разными ценами и политикой кеша (да, кеш тоже появился).

Цены все равно достаточно нарядные, так что проект полезный! Работа относительно стабильная, бывают ошибки, но в целом ок. Я использую под тестирование проектов (которые на апи доступах работают).

Напомню про рефку: CloseRouter.dev

(ц) имхо, хорошие новости!

@deksden_notes
  • 👍 11
Post #921 1.66K
⚪️ Codex Reset ?


Мне на некоторые аккаунты насыпали ручных ресетов.

Проверяйте свои аккаунты!

В CPA в CPAMC видно ресеты в auth files в режиме крупных карточек

@deksden_notes
  • 🔥 14
Post #920 1.71K
⚪️ Ура! Фубля на свободе!



Антропики выпустили берлагу из загона Фублю в доступ публично. Начинаем тестить!

Часики тикают, до 07 июля не так много времени))


@deksden_notes
  • 😁 13
  • 👍 1
Post #919 1.36K

Forwarded from Дима Курило (Dima Kurilo)

Своим текстовым ИИ-агентам я добавил зрение 👁️

Работаю в OpenChamber (GUI для OpenCode) с DeepSeek V4, GLM 5.1 и 5.2. Хорошие модели, но текстовые. Картинки не воспринимают от слова совсем. Скриншот с ошибкой, референс дизайна: для агента это пустота. Перепечатывать вручную занимало больше времени, чем сама задача.

Менять на мультимодальные не вариант: Vision не делает модель сильнее в коде и рассуждениях, а агентские инструкции я уже заточил под GLM и DeepSeek. Видел решения для Pi, но переходить с OpenCode не готов. Поиск привёл к плагину opencode-eyesight, и в процессе настройки он оброс идеями. Так появился Vision Bridge.

Как это устроено.
Два слоя, каждый делает своё:

1️⃣ Фоновое описание.
Плагин opencode-eyesight перехватывает картинку на входе в модель: отправляет во vision-модель, получает текстовое описание, подменяет оригинал. Модель видит только [Image: ...]. Оригинал сохраняется в истории контекста. Процесс полностью автоматический.

2️⃣ Точечный анализ.
MCP-сервер describe_image: когда автоописания мало, агент сам вызывает инструмент describe_image(image_path, prompt). Передаёт конкретный вопрос: «прочитай текст ошибки», «какая кнопка активна», «сравни два кадра». Сервер на FastMCP шлёт картинку как base64 на OpenAI-совместимый эндпоинт /v1/chat/completions и возвращает текстовый ответ. Провайдер-агностичный, OpenRouter или neuraldeep, переключается четырьмя env-переменными.

Почему два слоя?
Плагин даёт общий обзор, но не отвечает на конкретные вопросы по картинке. Без второго слоя агент додумывает детали и галлюцинирует. Дисциплина простая: автоописание даёт базовое понимание, describe_image даёт точный ответ. Агент знает разницу и всегда указывает источник.

Модели и провайдеры.
• OpenRouter: Qwen3 VL 30B (instruct, не thinking). У OpenRouter 6 провайдеров на эту модель. Выбран Alibaba как самый дешёвый ($0.13/$0.52 за Mtok) и быстрый. Закреплён жёстко через provider.order, allow_fallbacks: false.
• Neuraldeep: Qwen3.6 35B. Бесплатно. Альтернатива для тех, у кого OpenRouter блокирует аккаунты (РФ, санкции ЕС).

Инъекция в системный промпт.
Агенту нужна инструкция: как пользоваться мостом и когда звать describe_image. В репо готовые блоки с учётом архитектуры внимания модели:
• GLM: sparse attention (top-k), блок в начало промпта + дублирующий якорь в конец
• DeepSeek Pro: clipped sparse attention, recency-эффект. Краткий блок + якорь в самый конец
• DeepSeek Flash: только якорь, полные body-блоки её дестабилизируют
• Generic: для любой другой модели (Kimi, GPT-OSS, и др.)

MCP-сервер на Python, конфиги и пошаговый гайд:
🔗 https://github.com/dimkurilo/vision-bridge-opencode

#opensource
  • 👍 18
  • 🔥 13
  • ❤ 2
  • ❤‍🔥 1
  • 🤯 1
Post #918 1.39K
⚪️ Claude Science и релизы Клода


Помимо возврата фубли и релиза 5-го соннета, клод выпускает Claude Science - это такой Клод Код для научных работников, с доступом к научным базам, умением рендерить нужные ученым артефакты, трейсы каждого артефакта (на каких данных, как сделан), управлением терминалами/кластерами, нужный набор скиллов под специфические научные тулы и пайплайны.

Для ученых - наверное выглядит нарядно и полезно, мне сложно оценить. Но специализированные репаки агента для разных доменов, наверное, полезны! Хотя мне кажется такое надо делать плагинами и конфигурацией базового агента.


▶️ Про остальные релизы. Вот не возникло ли у вас ощущения, что для кодинга Клод немного подсдулся? да, я понимаю про разные обстоятельства. Фублю кастрировали не совсем по своей воле этими гардами на кибербезопасность. Но Соннет новый выглядит не настолько умным чтобы быть таким дорогим. А к Опусу текущему все уже привыкли, да и он не особо уделывает даже гпт 5.5.

У меня возникло ощущение некоторого разочарования - от премиум-фронтира, которым себя позиционирует антропик, я ожидал чего то более впечатляющего. Чтобы дорого и круто. Может быть практика с Фублей сможет изменить восприятие, и на самом деле эта модель рвет задачи как тузик грелку.. Посмотрим!


@deksden_notes
  • 👍 6
  • 🔥 3
Older posts →
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →