TGViewer
Channel Public Channel
Refat Talks: Tech & AI

Refat Talks: Tech & AI

@nobilix

Заметки про технологии, GenAI и глобал стартапы, прагматично и без лишнего хайпа. Эксперт по разработке и внедрению enterprise-grade AI автоматизаций, строю AI-first компании. Co-founder devstark.com и spreadsimple.com
лс @refatametov
Subscribers
11.6K
Photos
40
Videos
69
Links
258
Recent Posts 19 shown
Post #304 2.19K
#ReDigest

Продолжаем субботнюю рубрику, тут я кратко рассказываю про новости из мира технологий и AI, которые привлекли мое внимание.

Дайджест недели:

- Google выпустила Gemini 3.8 Live: голос на 97 языках, а Extended Thinking рассуждает и говорит одновременно.

- Anthropic слила Cowork и Design в обычный чат Claude, а артефакты выросли в Claude Docs и Slides с экспортом в PowerPoint. OpenAI же выпустила ChatGPT для Word.

- OpenAI выпустила Astra for Law, а Anthropic выпустила Claude for Financial Advisors.

- Трамп отказался тормозить AI, Хуанг согласен. Цукерберг тоже сказал что общая пауза не нужна, анонсировав модель Watermelon.

- Bloomberg считает, что лабораториям выгодно притормозить, а FT заметил просадку акций AI-компаний из-за этих призывов.

- 404 Media рассказала как подрядчики OpenAI читают переписки с ChatGPT.

- Исследователи с Claude взломали внутренние системы OpenAI.

- OpenAI запускает Sponsored Agents: клик по рекламе открывает чат с агентом бренда

- Anthropic переделала Projects в Claude Code: проект это координатор, который режет цель на параллельные потоки.

- Claude Code наконец читает AGENTS.md, также зреют моды - расширения CC.

- Meta запустила AI подписку Meta One от $2,99.

- Mozilla посадила ассистента Firefox на Mistral.

- Bloomberg: найм разработчиков в Bay Area рухнул, зато есть рост вакансий forward deployed engineer, Latent Space разбирает, что вообще делает FDE.

- Apple представила Reference Image для iPhone: снимок доказывает, что не сделан AI.

- Crusoe, строившая датацентр OpenAI, подняла $3,9 млрд на крошечные датацентры с завода: инференсу гигакластеры не нужны.

- Google открыла Agent Anomaly Detection: поиск подозрительного поведения агентов по трейсам.

- Slack показал Slack Code: люди и агенты пишут код внутри мессенджера.

- ElevenLabs выпустила AI-ресепшн для малого бизнеса.

Блок с релизами моделей (раскрывается):
- Alibaba выпустила Qwen3.8-Omni-Flash: миллион контекста, аудио и видео, час аудио в API подешевел на 98%.

- TypeSafe AI вышла из стелса с Jev: модели без генерации текста, сразу ответ с вероятностями и в разы быстрее LLM. Подробнее в моем разборе.

- Odyssey показала Odyssey-3, модель мира для роботов и машин.

- Bolt запустил Forge: агент на открытых GLM, DeepSeek и Kimi.

- Salesforce и Nvidia представили Koa на базе Nemotron: модель для CRM-задач.

- Ant Group открыла веса финансовой Ling-3.0-flash-Fin.

- Для локального железа: Bonsai 2 ужала Qwen 3.8 27B до 5,9 ГБ тернарными весами, Swift Qwen ускорила ее вдвое штрафом за overthinking, K2 Horizon 7B встала в индексе между Qwen 27B и 35B. Underdog - AI ассистент целиком на устройстве.

- QuiverAI выпустила Arrow 2, генератор векторной графики.

- Meta показала FLAT: картинки и текст в одну последовательность токенов переменной длины.

- Google придумала ToolGrad: данные для tool use генерируются от цепочки вызовов к запросу.


- Бенчмарки: в ApprenticeBench агента берут в компанию на полгода счетов. Real-SWE на закрытых репозиториях. HarnessTax: харнесс не влияет на успех, но сильно на цену.

- Cloudflare открыла скилл для агентных аудитов безопасности.

- px0: read-only IDE в браузере для проверки того, что написали агенты. И Code contracts: формулируешь, что код обязан делать, агенты проверяют.

- ars umbris: markdown и yaml становятся типизированным графом с диагностикой, как компилятор для заметок.

- Buzz шлет пуш на iPhone, когда агенту нужен человек

- @shadcn/lint линтит дизайн-системы под агентов

- Интерактивные статьи: слои compute-стека и что останется дорогим, когда AI подешевеет.

- 👍 dbt Charts описывает дашборды декларативно

- 🔥Cognition до 10 октября не считает в квоту Pro за $20 свою SWE-2 (сильный тюн Kimi K3) в Devin Desktop и CLI.

- 🤩 Inspo: дизайн-референсы с 832 сайтов как MCP-сервер, агент подсматривает у лучших.
  • 🔥 30
  • ❤ 11
  • 👍 6
  • 👏 2
  • 🦄 2
Post #303 3.9K
Jev - это сенсор, а не собеседник

Вы уже могли слышать про TypeSafe AI (основатель - соавтор InstructGPT из OpenAI), они пару дней назад вышли из стелса и показали модель, которая не умеет писать текст зато отвечает в десятки раз быстрее и дешевле LLM. Ну как отвечает, скорее выбирает, но иногда это ровно то, что нужно.

Работает так: скидываешь ей данные и задаешь вопросы с заранее известными вариантами. Она не пишет ответ, а сразу выбирает вариант и говорит, насколько уверена. Промпт при этом никуда не делся - он живет внутри вопроса.

В общем эту штуку можно сравнить с датчиком, по сути же - это умный классификатор.

Родион уже прогнал Jev на практике: как реранкер в RAG она обошла Voyage, Qwen3-Reranker и Cohere, а как модератор чат-бота вышла в 5 раз быстрее и дешевле gpt-oss-120b. Мне еще понравилась демка с оптимизацией browser use.

Что еще стоит посмотреть:

- Опенсорс-реплики появились за трое суток: openjev (демо в браузере), jevmlx для Mac, vllm-jev-decison под vLLM, Verdict-open-jev - ближе всего к оригиналу: не логиты LLM, а энкодер ModernBERT.
- Тред на HN, 1800+ поинтов. Главный спор - про слово "can't hallucinate": тип гарантирован, суждение нет. CEO отвечает лично.
- Разбор Anthony Maio: самая трезвая критика. RLCD (метод обучения) не раскрыт, калибровка описывает популяцию ответов, а не конкретный ответ.
- Бенчмарк на 2000 фишинговых писем: в лоб Jev проиграл Haiku с треском, 63% против 81%. А потом автор разбил решение на пять маленьких вопросов в одном вызове и получил 95%. Самая поучительная история про то, как эту штуку надо готовить. Еще 15 независимых эвалов с кодом - в каталоге awesome-jev - 👍.


Мой тейк: штука полезная только при сильно лучшей экономике, и есть проблема всех узких решений (реранкеров, маленьких моделей, файнтюна): фронтир-лабы вливают миллиарды в универсальные модели, и те становятся лучше и быстрее даже в узких задачах просто по дороге. Бонусом LLM может "объяснить" свой выбор, а тут нет. И как любой классификатор, такие штуки по-настоящему раскрываются на своем железе: при нагрузке дорога до облака съедает всю экономию скорости.

Поэтому моя ставка не на TypeSafe, а на идею. Либо большие лабы добавят режим типа "выбор с вероятностью" в свои API, либо китайцы наклепают открытых версий и тогда "типизированные" решения станут таким же примитивом, как structured output. В обоих случаях выигрывает интерфейс/способ, а не компания.

🔥 ➕ 🔁 @nobilix
  • 🔥 44
  • 👍 16
  • ❤ 11
  • ⚡ 5
Post #302 3.3K

Forwarded from Константин Доронин

Что вы знаете про bb?

Они называют себя "AI IDE that builds itself".

Достаточно молодой проект, который из коробки закрывает целый спектр задач, где раньше приходилось велосипедить всем колхозом.

В текстовом варианте можете почитать отличный обзор у Рефата.

Я же хочу предложить вам совместно изучить bb в формате практического стрима.

Вместе со мной разбираться в особенностях этой IDE будут:

1. Рефат, автор канала "Refat Talks: Tech & AI" (кстати, у нас с Рефатом есть классный стрим про фреймворк Mastra)

2. Коля, автор канала "AI и грабли"

Проходить стрим будет на моём YouTube-канале.

Дата и время: 21 сентября, 19:00 GTM+3

Ссылка для добавления события в календарь

p.s.: Почему парень из Сингапура назвал проект так, будто забыл переключить раскладку на русский язык, чтобы написать "ИИ"?
  • 🔥 18
  • 👍 9
  • ❤ 8
  • 👏 1
Post #301 4.26K
#ReDigest

Продолжаем субботнюю рубрику, тут я кратко рассказываю про новости из мира технологий и AI, которые привлекли мое внимание.

Дайджест недели:

- OpenAI заявила о решении Навье-Стокса ("задача тысячелетия") силами агентов, но математики год скармливавшие свои черновики в Codex, обвинили ее в присвоении работы.

- Неделя разговоров о замедлении. Пахоцки (OpenAI), Альтман и Амодеи предложили сделать добровольные паузы нормой.

- 25 филдсовских лауреатов подписали декларацию против гонки AI-компаний за математическими рекордами.

- OpenAI выкатила Agents API: харнесс Codex как сервис, цикл агента у OpenAI, среду исполнения выбираете сами.

- Anthropic призналась в четырех инцидентах: на киберучениях у моделей по ошибке был реальный интернет, и Mythos 5 выложила на PyPI вредоносный пакет.

- Anthropic опубликовала отчет о злоупотреблениях Claude: от подмены ответов чужими лабораториями до биоисследований, с разбором, как ловили и что делали.

- Mistral подняла 3 млрд евро при оценке 21 млрд. Крупнейший раунд в истории европейского теха.

- Meta выпустила персонального агента Muse: письма, бронирования, покупки через одноразовые карты Stripe.

- OpenAI закрыла продажу новых Pro за $200, 5.3-Codex-Spark отправляют на пенсию.

- Cursor открыл бету Projects: координатор раздает подзадачи субагентам, сам код не пишет.

- В ChatGPT Work появился Data-агент: дата-коннекторы и дашборды. А Codex appshots доехали до Windows.

- Anthropic тестирует Claude Code расширения, которые меняют интерфейс, логируют или ограничивают агента.

- Anthropic выложила Economic Scenario Explorer: три сценария до 2030, в экстремальном ВВП США растет на треть, а зарплаты падают.

- В британский парламент внесли законопроект о запрете ASI, в США такой анонсировал Сандерс. OpenAI ответила эссе про окно для регулирования.

- McKinsey: сокращений из-за AI в разы меньше чем ожидали.

- Стартап Abliteration AI продает API к моделям с вырезанным отказом.

- Google и Janelia выложили полный коннектом мозга дрозофилы, и его тут же научили играть в Doom и торговать биткоином.

- Google выводит TPUv7 Ironwood на чужие нагрузки: чипы впервые можно купить. Плюс агенты для переноса PyTorch в JAX.

- Siri AI выйдет 14 сентября в бете с дневными лимитами: серверов не хватает. Apple Watch получили постоянно слушающие функции.

- Shopify покупает Tailwind Labs: опенсорс остается под MIT, платные шаблоны сворачивают.

Блок с релизами моделей (раскрывается):
- DeepSeek выпустила V4.1-Flash: 552B MoE, контекст миллион, MIT. И снизила цены API, с кэшем для агентов вдвое. OpenDesign хвалит ее за дизайн.

- OpenAI выпустила ChatGPT Images 2.5: правка отдельной детали без разъезда остального, прозрачный фон.

- OpenAI открыла в API GPT-Live-1.

- Cognition выпустила SWE-2: RL поверх открытой Kimi K3. Заодно компанию оценили в $48 млрд.

- Tencent открыла терминального агента T1 на 122B: RL в песочнице с реальным шеллом.

- Microsoft выпустила MAI-Image-2.6-Flash: 1/2 по цене, в редактировании лучше GPT Image 2.

- Sakana обновила оркестратор Fugu и показала детектор AI-картинок Percept-Lens.

- Black Forest Labs показала FLUX Video Edit: правка ролика по тексту с сохранением камеры и звука, 3 цента за секунду.

- OpenUI выпустила OUI-1: диффузионная модель генерирует интерфейсы через свой DSL вместо HTML.


- Sierra представила Hyper-tau-bench, где агент строит агента: Opus 5 один проходит 24% задач, с инженером 82%.

- Alibaba открыла OpenCodeReview, свой внутренний AI-ревьюер кода.

- Mirai показала рантайм Uzu: локальные модели на Mac в 2-3 раза быстрее.

- hip-agent: агентный харнесс на 200 строк.

- Design Words: выбираешь стиль, шрифты и тени, копируешь готовый кусок промпта для агента.

- 👍 YC Globe: карта всех стартапов YC за 20 лет с фильтрами по нише и локации.

- 🔥Скилл, который дает Codex или Claude Code смотреть видео через Gemini: таймкоды, что сказано, что показано.

- 🤩Два скилла для диаграмм: archify качественно рисует архитектуру, diagram-design дает 38 редакторских типов без Mermaid-слопа.
  • 🔥 38
  • ❤ 13
  • 👍 13
  • 🥰 3
Post #300 5.94K
Диплинки в кодинговых агентах

Deeplinks - простой, но иногда незаменимый прием для быстрого открытия программ прямо в нужном состоянии (как URL в браузере, только для приложений).

Я все чаще пользуюсь именно десктопными версиями Claude Code и Codex, и иногда надо из другого приложения открыть конкретную сессию или создать новую в конкретном проекте. Тут-то и помогают эти самые диплинки - ты просто формируешь ссылку вида claude://code/new?folder=/path&q=... или codex://threads/new?path=...&prompt=... и вуаля: при клике апп откроется и покажется на первом плане именно на этой "странице".

Как это можно использовать? Несколько идей.

- Дашборд проектов. Страничка в Obsidian / Notion: по проекту две ссылки - "продолжить последнюю" и "новая сессия". Или написать свой простой апп с обзором сессий именно так, как тебе удобно, по клику - открывается Claude / Codex.

- Всякие лаунчеры, типа Raycast. Можно открывать сессии откуда угодно. Например, удобно в Todoist задачу поставить ссылку на конкретную сессию в приложении агента.

- Human in the loop. Пуш / имейл / сообщение "сессия ждет ответа" с прямой ссылкой на апп. Или написать инструкцию чтобы когда клод имеет в виду другую сессию - давал линк на нее.

- Черновик промпта. Алерт или тикет с q=Investigate incident: ... - кликнул, промпт уже в поле: посмотрел черновик, захотел - дописал, отправил. Причем такое можно встраивать прямо в сайты.

- Handoff между агентами. Claude сделал фичу и в конце отдает open "codex://threads/new?path=...&prompt=Review the diff". Кликнул - и ты телепортировался в Codex. Или наоборот.

- Еще можно дернуть программно, скриптом или из терминала. Например, на маке это команда вида open "claude://code/continue?session=last".

Доки тут: Claude Code CLI, Claude Desktop, Codex, секция Deep links. Но там есть не все.

Ниже шпаргалка (раскрывается).

Claude Code App:
- claude://code/new?folder=/path&q=... - новая сессия в папке, промпт уже в поле.
- claude://code/continue?session=last - последняя сессия.
- claude://code/continue?session=local_<id> - конкретная сессия. Id - это имя json-файла в ~/Library/Application Support/Claude/claude-code-sessions, в самом приложении его нигде не показывают.
- claude://code/needs-input - сессия, которая дольше всех ждет ответа на permission.
- claude://resume?session=<uuid> - импорт CLI-сессии по uuid из ~/.claude/projects.

Три последних маршрута в доках отсутствуют, вытащил из анализа билда приложения.

Codex App:
- codex://threads/<id> - конкретный тред. Id - это uuid в имени rollout-файла в ~/.codex/sessions, или Cmd+Opt+C в самом треде.
- codex://threads/new?path=/path&prompt=... - новый тред в папке с промптом. Есть еще originUrl, чтобы тред помнил, откуда пришел.
- codex://new?prompt=... - короткий вариант того же, нужен хотя бы один параметр.
- codex://settings/..., codex://skills, codex://automations, codex://plugins/... - прыжок сразу в нужный раздел.
- Правой кнопкой по чату - Copy deeplink, или Cmd+Opt+L на текущем. Все это есть в доках.

Нюанс: некоторые приложения диплинки не открывают - Notion и Telegram, например, решается простой страницей с HTTP редиректом, типа такой.


Начал копать в эту тему потому что планирую написать себе небольшой лаунчер с быстрым поиском и фильтром сессий, где нужная сессия находится и создается в одно касание. Пока писал пост, нашел отличный репо awesome-deeplinks - схемы для кучи приложений (вы только посмотрите сколько там всего!).

Короче, довольно удобная штука, может и вам пригодится.

🔥 ➕ 🔁 @nobilix
  • 🔥 42
  • ❤ 15
  • 👍 8
  • 🥰 2
Post #299 5.29K
#ReDigest

Продолжаем субботнюю рубрику, тут я кратко рассказываю про новости из мира технологий и AI, которые привлекли мое внимание.

Дайджест недели:

- OpenAI выпустила GPT-6 Astra, Брокман объявил "эру AGI"). Бенчмарки впечатляют, особенно в computer use и 3D. Лимиты пока скромные: 200 сообщений в неделю за $200 Pro.

- Anthropic выпустила Fable 5.1: умнее, чтение кеша вчетверо дешевле, меньше отказов по базовой биологии.

- Nvidia официально объявила о покупке Hugging Face за $12,9 млрд. Хуанг обещает, что платформа останется нейтральной.

- Anthropic подписала облачный контракт на $35 млрд с Lambda, и Reuters пишет о старте маркетинга IPO в середине октября (прогнозируют оценку $2 трлн).

- Sony и Warner подали иск к Anthropic за пиратские книги и тексты песен в обучении Claude. А Минюст США встал на сторону OpenAI в иске NYT: обучение на текстах - fair use.

- Claude Code и Cowork научились работать с компьютером в фоне, не отбирая его у вас.

- Гайд по API Astra: асинхронные вызовы тулов, смена инструкций посреди задачи, reasoning effort меняется без сброса кеша. Temperature и top_p больше нет.

- Claude Code получил /skill-doctor для поиска неиспользуемых скиллов. В ant CLI появился ant apply: можно сохранять/применять все зависимые скилы и настройки окружения в виде файла-конфига.

- Anthropic выложила шаблоны агентов для e-commerce и статью с кодом об их архитектуре.

- Qwen выпустила E-Commerce Bench: агент получает 100 тысяч юаней и управляет магазином.

- Anthropic запустила проверку файлов на следы Claude и включила невидимые водяные знаки в тексты Fable 5.1.

- Google запустил Pics, редактор картинок без холста на Nano Banana, работает в Docs и Slides. И открыл вейтлист на Play with Putty, многопользовательский вайб-кодинг.

- Вышел OpenClaw 2.0, крупнейший релиз проекта, главная фича - общие облачные сессии.

- Manus снова независим после развала сделки с Meta.

- AfterQuery стал самым быстрым единорогом YC: превращает работу нанятых юристов, врачей и тд в обучающие данные.

Блок с релизами других моделей (раскрывается):
- Google выпустила Gemini 3.8 Flash и Flash Cyber для поиска уязвимостей (пока доступ ограничен).

- Meta обновила Muse Spark до 1.3: местами приближается к Fable 5, веса обещают открыть. Кодинг-агент Muse Code вышел из беты с подписками от $5.

- Meta выпустила Muse Voice Transcribe, Microsoft - MAI-Transcribe-2, а Inworld - синтезатор Realtime TTS-2.

- Стартап Фей-Фей Ли выпустил Atlas, мультимодальную world model.

- Runway показала две модели мира: Solaris генерирует интерактивные интерфейсы кадр за кадром, GWM Worlds 2 - среды в 720p со звуком в реальном времени.

- IFM выпустила K2 Horizon: шесть моделей до 375B под Apache 2.0.

- Z.ai открыла веса большой GLM-5.3 под особой лицензией: компаниям с выручкой от $10 млрд нужна проверка от Z.ai.

- Google выпустила открытую TimesFM-3 на 330M: zero-shot прогноз временных рядов.

- Тоби Лютке показал модель на 0.8B, обошедшую GPT-5.6 Sol на узкой задаче Shopify, собрана на их открытом Tangle.

- Nvidia и CrowdStrike представили SafeMind: пара агентных моделей для кибербезопасности.

- Perplexity в macOS-клиенте распределяет запросы между локальной моделью и облаком + фильтр перс. данных. Там движок Lily, обгоняющий MLX на Apple Silicon.

- Еврокомиссия включила ChatGPT, Reddit и Roblox в список очень крупных платформ по DSA: ежегодный аудит, отчетность и тд.

- ChatGPT, Claude и Grok 3 сентября легли одновременно. Вероятная причина - Azure (east-us).

- Стэнфорд выбросил 85% курса CS146S по разработке ПО и переписал его под агентов, вкус и ревью.

- Локальный AI в браузере взрослеет: Hugging Face выложила 207 открытых WebGPU-ядер, в 2,6 раза быстрее ONNX Runtime Web, а Three-LLM гоняет Qwen и Phi через шейдеры Three.js.

- 👍 funes - долговременная память для коддинг-агентов, общая между машинами и агентами (Claude Code, Codex, pi), индекс локальный.

- 🤩Подробный плейбук по архитектуре агентного харнесса: состояние, рантайм, инструменты.
  • 🔥 40
  • ❤ 19
  • 👍 12
  • ❤‍🔥 1
Post #298 6.87K
Qwen 3.8 27B, локальный инференс и мои эксперименты с подбором железа

Про эту модель уже несколько недель пишут "Opus 4.6 у себя дома". Нет, конечно. Но, черт, это первая небольшая локальная модель, которую я готов всерьез обсуждать в агентных сценариях, а не для чата по базе знаний.

Небольшие локальные модели (которые влезут в домашний GPU) на агентных задачах часто зацикливается, либо ломают tool-calling. Qwen 3.8 27B, пожалуй первая в моих тестах, у которой это не разваливается. На агентном индексе Artificial Analysis она #8 из 140 моделей, сразу за Kimi K2, которая в сто раз больше по параметрам, и реддите ее дружно хвалят и тд.

Мои тесты этой (и не только) модельки совпали с вполне прикладной задачей - выбрать железо для локального AI-периметра. Надо выбрать одновременно и модель, и железо. Для этого решил арендовать стенды на Vast.ai: 3090 за $0.13/час, там же брал 4090, 5090 и GB10 (тот же DGX Spark). Написал skill поверх их CLI, и дальше вместе с Claude поднимал и тушил машины для экспериментов, гонял бенчмарки по SSH и вел журнал. Десятки замеров, четыре типа железа, ряд моделей - все вместе примерно пару десятков баксов.

Вот на контрасте с соседями по весовой категории (уместиться в 5090 или пару 3090) плотная Qwen 3.8 и выстрелила. Единственная из всех стендов дважды нашла все 10 заложенных дефектов в тестовом договоре. 100 из 100 по tool-calling. На заведомо нерешаемой задаче остановилась за 4 шага и честно отчиталась, пока конкуренты (в том числе MoE) зацикливались. Ну и да - первая локальная модель, которая осилила мой лифтовый вайб-чек (посмотрите пост, в декабре у ChatGPT лифт не ехал!). Минусы тоже есть: например, модель требует высокой полосы (на маке и Spark работает медленно) и, главное - знаний о мире у 27B, заметно меньше. Но знания агенту приносят тулы и поиск, а вот дисциплину в цикле извне не принесешь.

Если присматриваетесь к локальному инференсу под агентов, вот что я бы хотел знать заранее:
1. Считайте секунды на шаг агента, а не только токены в секунду. У меня модель с втрое большим декодом делала шаг за 2.1 секунды против 1.2 у "медленной" и решала задачу за большее кол-во шагов.

2. Часто говорят только про память, но тут есть как минимум три оси. VRAM решает влезет ли модель и останется ли место под кэш. Пропускная способность памяти - очень важный параметр, влияет в первую очередь на скорость генерации ответа (поэтому старенькая 3090 все еще тащит). Compute решает, как быстро модель переваривает входящий промпт. Это упрощенно, вот например неплохой визуальный разбор roofline-модели. Отсюда следует много всего, например что при низкой полосе (на маках, спарках) лучше брать MoE модели.

3. Чат упирается в память, агент - в compute, контекст и кэш. Самое дорогое в агентном цикле - не ответ, а чтение промпта. Шагов много и на каждом шаге агент заново отправляет всю историю. Тут экстремально важен префикс-кэш.

4. Смена движка или его настроек может дать разницу в разы. Вариантов много: vLLM, SGLang, llama.cpp, кастомные движки вроде NInfer. Перебирать это руками долго, поэтому у меня этим занимался агент в стиле авторесерча: поднял ряд стендов, прогнал матрицу экспериментов параллельно, записал в журнал и тд.

5. Комьюнити уже прошло часть пути за вас: есть и готовые рецепты типа 3090-club и тулы вроде llmfit: сканирует железо и подтягивает реальные замеры других пользователей. Только эти бенчмарки регулярно не сходятся с реальностью. Тестируйте на своих задачах.


По итогам, кстати, для этой модели по соотношению цена/качество победила пара 3090. А самое интересное в этой системе - архитектура "советника": локальная модель делает всю работу, а для редких сложных вопросов зовет фронтир через строгий гейт, который не выпускает приватные данные за периметр. Но это уже отдельный пост.

upd: кстати, если хочется уже сейчас протестить, то у Валеры на neuraldeep она доступна бесплатно

🔥 ➕ 🔁 @nobilix
  • 🔥 73
  • 👍 24
  • ❤ 23
  • 🥰 2
Post #297 6.18K
#ReDigest

Продолжаем субботнюю рубрику, тут я кратко рассказываю про новости из мира технологий и AI, которые привлекли мое внимание.

Дайджест недели:

- Nvidia покупает Hugging Face за $12,9 млрд (соглашение еще не подписано). Комьюнити тревожится за не-CUDA бекенды.

- Apple представила первый свой 2-нм чип M6 и M5 Ultra: Mac mini от $899, Mac Studio с памятью до 512 ГБ и полосой 1.2 ТБ/с. В продаже осенью.

- Anthropic показала MHS - аналог MCP для физического оборудования: роботы, микроскопы, лазеры.

- OpenAI показала первые результаты своего инференс-чипа Jalapeno: до 1.9x эффективнее Nvidia по работе на ватт.

- OpenAI расторгает контракт с Cursor после его покупки SpaceX: доступ к моделям отключат 12 ноября.

- WSJ: Nvidia за $7 млрд поглощает Poolside де-факто, но не де-юре: забирает технологию и команду с планами догнать Китай по опенсорсу.

- Anthropic с 14 сентября постоянно поднимает недельные лимиты Claude на 25% - на смену акционным +50%.

- У Claude появился встроенный браузер в Cowork, а память стала общей для чата и Cowork.

- Claude Code: новую сессию на компе можно стартовать с телефона, а /resume подхватывает терминальные сессии в десктопе.

- OpenAI выкатила Site tools - свою реализацию WebMCP: сайт отдает агенту готовые действия прямо в залогиненной странице. Параллельно хакатон WebMCP Challenge и пост про автоматизацию рутины через Codex.

- ChatGPT Work: scheduled tasks теперь запускаются по событиям в Gmail, Slack и GitHub, а не только по расписанию.

- OpenAI вернула Plus-подписчикам пятичасовой лимит в Codex и ChatGPT Work, в Pro его не будет.

Блок с релизами моделей (раскрывается):
- Z.ai раскрыла загадочную Ox Alpha: это GLM-5.3-Flash - мультимодальная, 320B (18B активных), веса открыты. На бенчах уровень фронтира. На запуске раздавала пакеты по 100 млн токенов.

- Alibaba открыла веса Qwen3.8-Flash-Next - превью архитектуры Qwen4: 6B активных плюс 51B в n-gram памяти.

- Tencent выложила открытую Hy4-preview: 770B (49B активных), Apache 2.0, заявка на лидерство в SWE-bench Pro.

- Google выпустила Gemini 3.5 Transcribe: сразу чистый текст без слов-паразитов, 85+ языков.

- IBM выпустила открытые Granite 4.2 (3B-30B, Apache 2.0) с переключаемыми режимами рассуждения.

- fal показала H3 Max: 5 секунд видео генерируются быстрее, чем длятся (много новых юз кейсов!).

- Apodex выпустила версию 1.1, открытую 35B mini и Apache-харнесс FrontierAgent под длинные задачи.

- Pipecat и Nvidia открыли PhoneLLM для голосовых агентов: заявлен уровень GPT-5.6 Terra в разы дешевле.

- Cohere запустила Parse: корпоративные документы в структурированные данные, $1.50 за тысячу страниц.


- Perplexity выпустила Portable Computer - локальный агент на Qwen 3.8 и DGX Spark.

- Суд отменил внесение Anthropic в черный список Пентагона.

- OpenAI, Anthropic, Google и еще сотня компаний подписали письмо о срочном укреплении киберзащиты.

- Расследование Reuters: план Цукерберга заменить сотрудников Meta агентами провалился.

- AWS покупает DuckLabs (DuckDB), опенсорс-лицензии сохраняются.

- Xiaomi показала прототип AI Cube - локальный AI-компьютер на трех собственных чипах, гоняет модели до 120B при 150 Вт.

- Про роботов пишу редко, но слежу: пишут о близком hardware takeoff, а WSJ - о world models как следующем большом скачке AI.

- TIME выпустил Time 100 AI 2026: добавился Суцкевер, вылетели Хуанг и Хассабис, есть Перис Хилтон.

- Из ресерча: AWS измерила "налог на передачу задачи" между моделями, а JIT-Agent собирает харнесс под конкретную задачу сам. Anthropic выпустила TASTE - бенчмарк на отбор идей safety-ресерча.

- Anthropic ввела enterprise-managed auth для MCP-коннекторов, а Vercel Connect вышел в GA с короткоживущими токенами вместо вечных API-ключей.

- Awesome Graph Engineering - подборка о том, как графовые структуры организуют память и координацию мультиагентных систем.

- AI SDLC playbook от Антропик

- 👍 is-agentic.com проверяет, насколько ваш сайт готов к визитам AI-агентов.

- 🤩 Microduck - опенсорсный 25-см робот от Pollen Robotics и Hugging Face за $399: за сутки собрал $2.6 млн заказов.
  • 🔥 35
  • ❤ 20
  • 👍 10
  • 🥰 1
Post #296 6.84K
Вот сколько бы ни хоронили промпт-инжиниринг (никогда не понимал этого пафосного названия), но то, как вы формулируете запрос, по-прежнему во многом определяет качество результата.

Например, мой частый совет из практики - Заменяй summarize на extract. "Суммаризируй" дает общий пересказ, а вот "Извлеки ключевые факты списком, по одному на пункт, без комментариев" - операция ближе к парсингу. Точный глагол = точный режим.

Что еще часто использую:

Просить маркировать уверенность вместо "не галлюцинируй". "Пометь каждое утверждение: факт из текста / вывод / догадка". Жесткая версия для документов: "процитируй точное предложение под каждым пунктом" - цитату не подделаешь незаметно.

Разворачивать направление: пусть модель спрашивает вас. "Прежде чем отвечать, задай мне 3-5 вопросов, которые сильнее всего изменят твой ответ". Она часто спрашивает про то, о чем вы не подумали. В СС так и пишу обычно: используй AskUserQuestion.

Заставлять критиковать свой ответ. "Раскритикуй ответ выше: что неточно, чего не хватает. Потом перепиши". Генерация и оценка - разные режимы, популярный grill-me скилл, кстати, cюда же, но неплохо работает и просто фразой.

Отделять инструкцию от данных.. Если в тексте за промптом идет сам инпут, то оборачивайте данные тегами (`<text>...</text>`) или тройными бэктиками - особенно когда инпут длинный или содержит собственные инструкции.

Часто диктовать лучше чем печатать. Голосом вы отдаете в разы больше контекста за то же время, а промпту вредят не лишние слова, а недосказанность (ramble session как назвал это Карпаты). База, но напомнить не лишне, потому что использую давно и почти каждый день, но встречаю еще людей, которые брезгуют и из принципа набирают куцый текст двумя пальцами даже там, где больше деталей бы выдали голосом.

Этажом выше мета-приемы. Про один я уже писал: терминология домена - назвав вещь ее именем, попадаешь в самую суть, и, между прочим, LLM вознаграждают экспертизу - модель усиливает качество инпута, а не подменяет его. Еще пример: "я, вероятно, неправ, но..." перед своим тезисом - удивительно полезно. Модели очень хотят угодить, и, поставив свою точку зрения под сомнение, вы как бы разрешаете модели проверить ее честно, а не поддакивать.

И да, модели правда становятся все понятливее, все важнее становится доменный контекст, а не большое количество детальных инструкций. Но пара нужных слов все еще меняет ход ответа.

Это моя базовая база, из памяти, хотел зафиксировать заметкой. Какие приемы у вас в постоянной ротации?

🔥 ➕ 🔁 @nobilix
  • 🔥 120
  • 👍 53
  • ❤ 24
  • ❤‍🔥 3
  • 🥰 1
  • 🙏 1
Post #295 5.86K
#ReDigest

Продолжаем субботнюю рубрику, тут я кратко рассказываю про новости из мира технологий и AI, которые привлекли мое внимание.

Дайджест недели:

- OpenAI официально притормозила обучение будущей фронтир-модели Astra (из-за киберспособности). Anthropic тем временем рассказала о внутренней Model 2 сильнее Mythos, которую выпускать не планирует.

- Z.ai выпустила GLM-5.3 с фронтирным кодингом, но придержала веса на две недели: кибер-скоры вышли выше Mythos 5.

- Cursor запустил Origin - хостинг репозиториев под агентный темп разработки; в ту же нишу метит новый code.storage.

- Stripe покупает OpenRouter за $7+ млрд.

- Anthropic берется за автономный дизайн лекарств и дизайн белков, а Амодеи пишет, что большинство болезней можно вылечить за 5-10 лет.

- Выручка Anthropic перед IPO превысила $65 млрд годовых - семикратный рост за год.

- OpenAI срезала цены GPT-5.6 Sol на 20-30% на три месяца, следом подвинулись OpenRouter и Vercel, а Replit запустил Free Mode с x30 лимитами на Luna.

- Anthropic продлила +50% лимитов Claude Code до 31 августа.

- Контекст GPT-5.6 Sol в Codex расширили до 1 млн токенов через конфиг; все сверх 272к идет по двойному тарифу.

- Claude Code: скилл /design с редактируемыми UI-артбордами, cross-session упоминания через @ и др.

- OpenAI выпустила ChatGPT for Teens: подростков автоматически переводят в режим с защитами с родительским контролем.

- Anthropic запустила Claude Academy - бесплатное обучение AI-грамотности плюс скилл academy-guide.

- Meta выпустила десктопное AI-приложение для macOS с диктовкой и шарингом экрана.

- OpenAI: совместное редактирование в ChatGPT Sites и прозрачный фон в GPT-Image-2.

- Bank of China кредитует AI-разработчиков, оценивая их по расходу токенов и выручке от AI-продуктов.

- Робособаки закрывают кадровые дыры в охране в США: берут на себя рутинные обходы, смена дешевле штата на $80-130 тысяч в год.

- Anna's Archive зовет волонтеров сканировать книги на фоне скандала с промышленным разрезанием редких изданий AI-компаниями.

- Apple засветила в коде macOS больше 10 продуктов: AirPods с камерами, складной iPhone, OLED MacBook.

- Google Research показала PhotoScan: оценку состава тела и риска инсулинорезистентности по двум фото со смартфона.

- Public AI Observatory - независимое измерение реального использования AI: 24,5 тыс. диалогов, 52 модели (findings).

- DeepSeek выпустила V4-Flash-Vision-Exp - мультимодальную версию под агентов, которым нужно видеть экран

- Голосовые: Sonic-3.6 от Cartesia возглавила рейтинги синтеза речи, ElevenLabs открыла v3 Conversational для голосовых агентов.

- Sand.ai открыла видеомодель MAGI-2: MoE 114B с 6B активных, 10-секундные ролики сразу с аудио.

- Alibaba открыла бету музыкального генератора HappyShrimp.

- Engram с Harvey показали, как дообученная Qwen3.8-27B решает юрзадачи в 10 раз дешевле Opus 4.8.

- Artificial Analysis запустила Search Index - бенчмарк поисковых API для агентов.

- Отрезвляющие бенчмарки: CADBench - топовые модели берут лишь четверть задач в Fusion 360, SWE-bench Science - ниже 50% на научном софте.

- Вокруг Grok Bot выросла социальная лента ботов, которую человеку уже сложно читать, а Hermes Desktop от Nous Research скопировал этот UX своим Bot mode.

- Vercel дает $1 млн (bounty фонд) за побег из своей песочницы.

- Berd от Block - Mac-приложение: папка = проект, персонажи-агенты и доска, работает на ваших подписках Codex и Claude Code.

- openhistory.sh - открытое Mac-приложение, трекающее весь рабочий день для агентов (идея как у OpenAI).

- Очень неплохое и детальное сравнение подходов к памяти агентов.

- 1kpapers.com - тысяча лучших статей года, суммаризированных и визуализированных за $4 на DeepSeek V4 Flash.

- 👍 TrueFoundry открыла TrueForge - self-hosted харнесс для продакшн-агентов с песочницами, аппрувами и трейсами (как Managed Agents от Claude).

- 🔥 Notion открыл lore - общую память агентов на основе истории разговоров.

- 🤩 Vercel открыла fx - кодинг-агент на Zig весом 6 Мб с мгновенным стартом, работает даже в браузере.
  • 🔥 43
  • ❤ 16
  • 👍 11
  • 🥰 2
  • 🤝 1
Post #293 5K
Железки - это весело. Пятничный пост про DIY.

Знаете, софт - это хорошо, но есть особый шарм именно у железяк: когда что-то щелкает, пищит, светится, включает и выключает вещи в комнате. Что-то осязаемое. Даже если девайс делает какую-то малополезную мелочь.

Еще вся эта DIY-электроника стала сильно проще. Помню, раньше написать нормальную прошивку занимало мгого дней, а сейчас: втыкаешь девайс по USB, говоришь Claude Code или Codex, что хочешь получить, и агент сам коннектится, ставит тулчейн, пишет прошивку, заливает, читает логи.

Например, этим летом я собрал себе климат-контроль для кондиционера, буквально за пару часов на выходных: M5Stack Stick (это готовый блок на ESP32 с экранчиком, кнопками, блютузом, Wi-Fi за $10-20). Добавил только ИК + датчик температуры, и попросил Клода написать прошивку и веб-приложение.
Стало жарче 26° - сам включился, опустилось ниже 23° - выключился, ночью спит. Управляется с телефона, слушается Siri. Реально, пользуюсь каждый день)

Еще есть проект девайса, который автоматически ставит телевизор на паузу, если ребенок подходит к нему слишком близко. Ну это из последнего, раньше, конечно, много всего собирал и тем удивительнее видеть, как все упростилось с тех пор.

Хотел сначала накидать сюда полезных ссылок и инструкций, но, честно говоря, вам проще открыть AI-чат и начать расспрашивать: как это вообще работает, какие проекты можно собрать, что для этого нужно и т.д. И поверьте, если вам такое интересно - затянет. Еще бы время на это находить почаще, но когда нахожу - всегда фаново)

А, ну еще хотел спросить, что вы такого интересного делаете или планируете делать помимо софта?
  • ❤ 51
  • 👍 26
  • 🔥 25
  • 🥰 1
  • 👏 1
Post #292 4.48K

Forwarded from Константин Доронин

Как писать код с AI-агентами?

А если командой?

Что нужно учесть, чтобы этот код не положил продакшн?


Эти и другие не менее интересные вопросы мы обсудим на следующем стриме на моём YouTube-канале.

Для обсуждения я позвал очень интересных гостей:

Андрей Бреслав – один из создателей языка программирования Kotlin. Сейчас Андрей разрабатывает Agentic Engineering Toolkit под названием CodeSpeak.

Валера Ковальский – автор одноимённого канала. Основатель проекта Neuraldeep https://neuraldeep.ru/ и автор множества Open Source проектов, созданных примерно за 120 минут каждый.

Максим Ключников – автор канала Этихлид. Разработчик с огромным опытом, который усилил себя с помощью AI-агентов. Работал на позиции Senior Software Developer, когда я ещё в школу ходил 😊

Дата: четверг, 20 августа

Время: 19:00 (GMT+3)

Проходить будет на моём YouTube-канале.

Добавить событие в календарь

Вопросы для эфира оставляйте в комментариях к этому посту 👇
  • 🔥 27
  • ❤ 6
  • 👍 5
  • ❤‍🔥 2
Post #291 5.83K
#ReDigest

Продолжаем субботнюю рубрику, тут я кратко рассказываю про новости из мира технологий и AI, которые привлекли мое внимание.

Дайджест недели:

- Anthropic встраивает невидимые водяные знаки во все тексты Claude, а следом планируют OpenAI, Google и другие.

- OpenAI: Computer History отдает ChatGPT и Codex историю работы в приложениях как контекст, вышла Linux-версия, а в Business появятся Premium-места за $125 с 5x лимитами и без 5-часового окна.

- Anthropic сделала временную дисконт цену Sonnet 5 постоянной: $2 и $10 за миллион токенов.

- OpenAI показала Ultrafast: GPT-5.6 Sol на железе Cerebras выдает до 750 токенов в секунду.

- Chrome-расширение Claude теперь интегрировано с Cowork, а Claude Code научился сам продолжать задачу после сброса лимита.

Блок с релизами моделей (раскрывается):
- SpaceXAI выпустили Grok 4.6 - близок к Sol и Opus при вдвое меньшей цене (полевой гайд).

- Google выпустила Gemini 3.7 Flash - цена вдвое ниже 3.6 при лучшем перфомансе.

- Meta вернулась в открытые веса: мультимодальная Muse Glimmer 30B.

- Qwen выпустила Qwen3.8-27B, сообщество зовет ее маленьким Opus 4.6 для ноутбука. Еще выкатили веса Qwen 3.8 Max.

- DeepSeek вывела V4 Pro из превью и открыла веса и резко поднимает цены с 16 августа.

- Microsoft представила MAI-Thinking-1, первую свою reasoning-модель, собранную с нуля.

- Cohere выпустила North Micro Vision - компактную VLM под Apache 2.0 с фокусом на документы.

- Solar Pro 4 от Upstage прыгнула с 14 до 42 по Intelligence Index, особенно на агентных задачах.

- Медиа-модельки: MiniMax выложила музыкальную Music3 с русским языком и запуском от 8 ГБ VRAM, Lightricks обновила видеомодель LTX-2.5 до мультишотовой генерации, а Deepgram запустила Flux TTS с откликом 80 мс.


- xAI запустила Grok Bot: у каждого агента своя облачная Linux-машина с браузером и терминалом, учится по одной демонстрации. Oткрытый аналог появился быстро.

- DeepSeek открыла агентный харнесс dsh под MIT, где все является плагином с хот-релоадом (уже оброс каталог плагинов).

- Spotify выпустила Xirp - Claude Code, Codex и Gemini CLI в одном окне.

- Google запустил Sheets canvas: таблица превращается в интерактивное мини-приложение.

- DeepMind встроила перевод языка жестов в Pixel 11.

- Цукерберг выложил манифест на 6000 слов: персональные агенты и тезис, что широкое распространение AI безопаснее централизации.

- Apple обучила собственную модель для Китая при поддержке Alibaba, первой из иностранных компаний пройдя регулятора.

- Исследователи научились расшифровывать зашифрованные цепочки рассуждений Anthropic, OpenAI и Google.

- Белый дом разрешил частным компаниям наступательные кибероперации против иностранных группировок.

- Manus отделяется от Meta по требованию китайского регулятора, данные надо забирать вручную до 23 августа.

- Игорь Бабушкин, сооснователь xAI, привлек $1,1 млрд в River AI - домашний компьютер для AI.

- Foreman от Vercel Labs - шаблон софтверной фабрики: задачи из GitHub и Linear проходят четыре станции и выходят отревьюенным черновиком PR.

- Vercel завел приватные паки скиллов, которые можно шарить внутри аккаунта.

- Интересный техобзор харнессов вокруг DeepSeek V4 Flash: восемь штук на 30 реальных задачах, победил Pi.

- Несколько интересных бенчмарков: ExtractBench от LlamaIndex, AA-AnalystAgent, и Optima - платформа чтобы гонять бенчмарки на своих нагрузках.

- Интересный разбор про текстовые водяные знаки.

- /show-me - скилл, который заставляет агента отвечать деревьями, диаграммами и псевдокодом вместо простыней текста.

- Ref - общий режим планирования для команды перед тем, как агенты начнут строить.

- 👍 treg - каталог из 2600 agent-friendly инструментов, "OpenRouter для агентных тулов"

- 🤩 seoskill.dev - SEO-скилл для агентов.
  • 🔥 36
  • 👍 12
  • ❤ 10
  • 🥰 1
Post #290 5.92K
Evidence-based planning, или что не так с чистым SDD

TL;DR: Одно из самых недооцененных свойств AI-кодинга - это проектирование софта через ранние дешевые эксперименты.

Стандартный путь (часто) выглядит так: собрать весь input, скормить его в spec-driven framework или аналог, который нарежет все на тикеты, и погнали кодить агентами. Проблема в том, что спека, написанная до контакта с реальностью, фиксирует галлюцинации автора и агента о задаче, а формальность документа создает иллюзию продуманности.

Я делаю иначе, через контакт с реальностью как можно раньше. Сначала задаюсь вопросом, где больше всего белых пятен и ключевых развилок, и начинаю экспериментальное исследование: прощупываю границы интеграций, возможные подходы, варианты интерфейсов. Постепенно расширяю карту - от неопределенного к протестированному фактами (отсюда evidence-based), до состояния, где я могу сказать:
- "Этот кусок решен, вот здесь точно работает".
- "При интеграции мы получим ровно такой JSON, если возьмем эту альтернативу".
- "Протестил все семь вариантов - эти два показывают себя лучше всех, на цифрах".
- и т.д.

И только потом задачи - там теперь есть ссылки на проверенные решения, конкретные контракты и доказательная база под ними.

Ощущается это как стратегия в реальном времени: карта под туманом войны, и каждый прогон открывает участок - здесь проходимо, здесь обрыв, здесь дорога упирается в rate limit/неожиданную зависимость/и тд. Бонусом получаешь границу достаточно понятного куска, а его уже проще и проектировать, и верифицировать, и раздавать людям и агентам параллельно.

Это спайки, у которых сняли лимит

Вся традиционная инженерия построена на одном допущении: код дорого писать и еще дороже переписывать. Из него выросло много дефолтов, включая умозрительное проектирование на бумаге - проверить было непозволительно дорого.

У практики проверять есть старое имя - спайк (spike), из методики экстремального программирования (XP): короткий эксперимент, цель которого - знание, а не продукт. Но спайк всегда был дорогим удовольствием, поэтому и оставался редкостью.

Сейчас он стоит минуты/часы внимания: агенты не только пишут код, но и сразу исполняют его, документируя успехи, неудачи и подводные камни. Причем пачками и параллельно.

Заметьте, я не предлагаю меньше думать и больше делать. Просто к думанию добавилась роскошь, которой раньше не было: проверить дешево вместо того, чтобы гадать.

Вход и выход спайка

На входе один сформулированный вопрос ("что именно я хочу узнать/проверить") + релевантный контекст.

На выходе:
1. Решения - выбор из альтернатив с зафиксированным "почему" и "почему не остальные"
2. Контракты - фактические интерфейсы, схемы, форматы ошибок, лимиты, которые эксперимент выдал по факту
3. Границы проверенного - докуда дошел эксперимент и какие вопросы остались открытыми

Код прогона можно выбросить (или оставить), но эти три вещи забираем. Они идут в план, в спеку и в тикеты - и поэтому реализация становится почти механической, и яснее, как ее верифицировать.

Одна оговорка про параллельность. Она ценна, пока узкое место - генерация. Как только им становится ваша способность оценить результаты, каждая новая ветка дает отрицательную отдачу.

---

Кстати, удешевление экспериментов уже не раз двигало целые дисциплины (тысячи нитей накаливания у Эдисона, аэродинамическая труба братьев Райт, A/B-тесты в вебе).

Что касается софта - каждый раз убеждаюсь, что этот подход работает прекрасно, и что откладывать это невыгодно. Предполагать теперь дороже, чем проверить.

🔥 ➕ 🔁 @nobilix
  • 🔥 74
  • 👍 27
  • ❤ 9
  • ❤‍🔥 6
  • 🥰 2
Post #289 6.58K
#ReDigest

Продолжаем субботнюю рубрику, тут я кратко рассказываю про новости из мира технологий и AI, которые привлекли мое внимание.

Дайджест недели:

- Alibaba выпустила Qwen3.8-Max: 2,4T параметров, контекст 1M, вчетверо дешевле Opus 5.

- OpenAI обновила Sol, обещают меньше ошибок, а бесплатным дали безлимитную GPT-5.6 Luna.

- Agent Plugins - открытый стандарт упаковки скиллов и MCP-серверов в плагины; за ним OpenAI, AWS, Microsoft, Vercel, Cursor и другие.

- Джефф Дин уходит из Google строить Discovery Loop - автоматизацию науки и ML.

- OpenAI оценила внутреннюю модель Astra как критическую по киберспособностям и приостановила часть работ.

- Anthropic выкатила self-hosted среды для Claude Code, научила сессии переписываться между собой и делает auto mode режимом по умолчанию.

- Meta выпустила терминального кодинг-агента Muse Code и модель Muse Spark 1.2.

- xAI выпустила картиночную модель Imagine Image 2.0.

- Крупнейшая атака на npm: скомпрометированы 868 пакетов с 2 млрд установок в месяц.

- Белый дом вывел открытые модели из-под обязательного тестирования.

- Anthropic собирает команду для разработки собственных AI-чипов.

- CNBC: отрыв США от Китая в AI практически исчез.

- DeepSeek предупредила о значительном повышении цен на API (до 5x).

- Alibaba начнет брать процент с провайдеров, продающих доступ к следующим поколениям Qwen.

- Cloudflare провела Agents Week: Cloudflare OS - общий агентный воркспейс, Computer, Kitesurf - браузер для агентов без Chromium, Wallets, WebMCP, Agent Access Model для корпоративного контроля.

- Anthropic запустила inference hooks: инлайн контроль каждого промпта и тула.

- NYT разбирает, что компании получают за AI-траты: посчитать не может никто, Linux Foundation создала Tokenomics Foundation.

- Meta дает дешевый доступ в обмен на данные для обучения.

- Google показала Science One - генерацию научных статей "без галлюцинаций".

- Две новые видеомодели: FLUX 3 Video от Black Forest Labs и Wan 3.0 от Alibaba.

- ByteDance выпустила SeedRealtime: полнодуплексная, аудиовизуальная.

- Liquid AI выпустила LFM2.5-2.6B - агентную модель для смартфонов, ~30 токенов в секунду на Snapdragon.

- Mistral выпустила Shieldstral - открытый 3B safety-классификатор.

- DeepGrove показала Maple-Preview - открытую 20B модель на тернарных весах, 200+ ток/с на Mac Mini.

- Pokee AI заявила Pokee-Isaac 28B с контекстом 10M токенов и запуском на одной RTX 4090.

- Celeris-1 возглавил рейтинг скорости Artificial Analysis (~1765 ток/с).

- Качество моделей сильно зависит от инференс-провайдера (у Kimi K3 разброс скорости между провайдерами 312%), Artificial Analysis даже добавила Endpoint Accuracy Index.

- Backflip AI превращает физическую деталь в CAD-файл за минуты и примерно $10.

- Warp выделила своего агента в отдельный CLI с роутингом по моделям.

- Prime Intellect выпустила Prime Agent - открытый самоулучшающийся харнесс вокруг python-REPL.

- Бенчмарки недели: APEX-Accounting для бухгалтерии, приватный SWE-Bench от Ramp на продакшн-задачах, Supabase Evals, плюс MerchantBench и Boundary-Bench.

- Mference запускает DeepSeek V4 Flash 284B в 5.3 ГБ памяти на маке, подтягивая экспертов с SSD.

- Photon 2.0 компилирует модели в мегаядра: весь forward pass - одна GPU-программа.

- TokTier: токенизация съедает до 64% TTFT в агентных нагрузках; stateful-сервис токенизации это чинит.

- Conductor Cloud - мультиплеерные облачные воркспейсы для кодинг-агентов.

- GenOffice - открытый AI-офис от Genspark: собрали за неделю и $10K на токены.

- FutureSearch - AI-прогнозирование по запросу: спрашиваешь "что будет, если я сделаю X" и получаешь прогноз с вероятностями.

- OpenRouter выкатил Ori Eval - автоподбор модели под задачи конкретного репозитория.

- 🔥 Firecrawl выпустила anydoc: конвертация любых документов в Markdown за миллисекунды, на Rust.

- 🤩 Comp AI выложила открытый agent-first CRM с долгоживущими ресерч-агентами, лицензия MIT.
  • 🔥 48
  • ❤ 23
  • 👍 9
  • 🥰 2
Post #288 7.02K
bb - Codex-подобный оркестратор, который расширяется плагинами. И почему это делает его интересным.

В awesome-листе агентных оркестраторов сейчас под сотню проектов, они решают примерно одну задачу: собрать упряжки (Claude Code, Codex, OpenCode, Pi и тд) под одним интерфейсом, будь то терминал, TUI или десктоп.

bb хорош двумя вещами (помимо прочего).

Первая простая: он удобный и приятно выглядит. Интерфейс практически повторяет приложение Codex, а его сегодня, пожалуй, можно назвать самым удобным десктопным агентом.

Вторая - главная: плагины. bb написан на TypeScript, и в его архитектуре заложен принцип расширяемости просто просишь агента, получаешь фичу в нем же, без перезагрузки. Та же идея в свое время сделала популярным Pi: минимальная поставка, а дальше каждый дописывает под свои нужды. Только Pi живет в терминале, а здесь удобный для широкой аудитории GUI.

В твиттере bb обсуждают почему-то только со стороны разработчика. А я вижу главный потенциал в другом: это UI платформа для AI-native компаний. Юристы, продавцы, проджекты и тд. - виджеты и расширения под их работу могут встраиваиваться прямо в десктоп-агента. И все это на базе развитых харнесов и их подписок. Круто же.

Немного идей для написания плагинов:
- своя панель в сайдбаре: трекер, CRM, канбан (я сделал виджет для Twenty CRM)
- произвольные виджеты прямо в ленте чата — агент рендерит их в своем ответе (я, например, сделал превью tg постов из markdown)
- свои вьюеры файлов: не нравится встроенное превью docx - сделай свой
- расщирение навигации, вплоть до полной замены списка тредов
- свои источники для @-меншенов: клиенты, сделки, заметки из Obsidian
- фоновые сервисы: дайджесты, напоминания, архивы по расписанию
- Весь спектр Generative UI включая живую аналитику
- и тд: SDK дает доступ практически ко всему: боковые панели и слоты в UI, навигация, своя SQLite-база, формы для запроса решения у человека, инструменты для агентов, CLI-команды, HTTP-ручки, фоновые сервисы, события тредов.

Минусы: проекту несколько месяцев, плагины только вышли из экспериментов, десктоп пока только macOS (остальным есть веб версия через npx, мобилка тоже работает через web). Надеюсь, у проекта будет больше внимания и контрибьюторов (Open Source, MIT, кстати).

Сам опыт "пишешь интерфейс прямо в интерфейсе" затягивает: попросил виджет - и через пару минут он уже работает прямо тут же, живой, с данными. А еще в широком смысле это позволяет делать опыт human in the loop удобнее, нагляднее и безопаснее.

🔥 ➕ 🔁 @nobilix
  • 🔥 57
  • ❤ 26
  • 👍 8
  • ⚡ 3
  • 👏 1
Post #287 7.12K
#ReDigest

Продолжаем субботнюю рубрику, тут я кратко рассказываю про новости из мира технологий и AI, которые привлекли мое внимание.

Дайджест недели:

- OpenAI снизила цены на GPT-5.6 и объяснила зачем.

- Anthropic обновила MCP: stateless-архитектура, официальный статус у Apps и Tasks и пр.

- Moonshot выложила веса Kimi K3 - теперь модель доступна на десятках провайдеров.

- OpenAI выкатила в API GPT Transcribe и потоковую GPT Live Transcribe.

- Про необходимость притормозить теперь говорит не только Дарио, но и Альтман и больше тысячи сотрудников AI лаб подписали открытую инициативу об этом.

- Anthropic изложила позицию по открытым весам: запрещать не надо, надо контролировать дистилляцию и тестировать мощные модели.

- NVIDIA собрала Open Secure AI Alliance, Microsoft AI представила MAI-Cyber-1-Flash и Vercel в тему выложил бенчмарк DeepSecBench.

- Claude Mythos почти автономно нашла слабости в постквантовой схеме HAWK и AES.

- Anthropic проверила 141 тысячу своих киберучений и нашла три случая, когда модели вышли наружу и скомпрометировали боевые системы реальных компаний.

- OpenAI открыла Codex Security CLI.

- ChatGPT добрался до 1 млрд пользователей в неделю.

- В ChatGPT/Codex вернули пятичасовое окно.

- OpenAI раздает ученым бесплатный доступ к фронтир-моделям.

- Grok Voice Think Fast 2.0 научился слушать, думать и говорить одновременно. В Grok добавили встроенный конструктор приложений с хостингом.

- Google выкатил Gemini Distillation Service - обучение маленькой модели на рассуждениях большой.

- Google выпустил генератор музыки Lyria 3.5: треки до трех минут, контроль BPM и тд.

- Cursor запустил в Индии тариф Start за ≈$7.

- США запретили импорт китайских гуманоидных и четвероногих роботов.

- В девяти американских школах учебный год начнут защищать боевые дроны.

- ASML просела на новости, что в Шанхае начали серийно выпускать DUV-литографы.

- ЕС со 2 августа включает обязательную маркировку AI контента.

- В Китае заработали биржи прав на внешность: лицо "сдают в аренду".

- AI-компании скупают старые книги, режут прессом, сканируют и уничтожают.

- Тренд недели: мы переусложняем промпты. Под новые модели надо не добавлять инструкции, а убирать.

- DeepSeek вывела V4-Flash из превью в API с поддержкой Codex и в тот же день выложила веса.

- Thinking Machines выпустила Inkling-Small, качество почти как у флагмана при четверти размера.

- MiniMax открыла мультимодальную H3: единый контекст по тексту, картинкам, видео и аудио.

- LightOn выложила mDenseOn и mLateOn - полностью открытые мультиязычные ретриверы под длинный контекст и код.

- Тема недели: harness решает не меньше модели. У OpenAI две настройки харнесса подняли результат Sol на ARC-AGI-3 с 7.8% до 38.3%, Databricks намерила двукратную разницу в цене между харнессами при том же качестве, а AgentRadio почти удвоил результат асинхронным обменом сообщениями между агентами.

- WSJ пишет про новый класс предпринимателей: компании на миллион долларов с одним сотрудником.

- WASTE - движок для моделей (включая Kimi K3), которые больше вашей памяти.

- Саймон Уиллисон выпустил smevals - прогон компактных наборов эвалов сразу по нескольким моделям, харнессам и промптам.

- sharechat - расшарить сессию Claude Code или Codex по ссылке, читающему не нужен ни аккаунт, ни логин.

- Coast - полностью локальная память для вас и ваших агентов, собирается из того, что вы видите на своем Mac.

- Как DoorDash, Instacart и Uber Eats встроили LLM в поиск тремя разными способами: обогащение графа офлайн, понимание запроса и файнтюн эмбеддингов.

- 👍 YC выложил в опенсорс QM - мультиплеерный агентный харнесс, на котором внутри работают бухгалтерия, юристы, ивенты и инженеры.

- 🤩 Awesome Free AI Books - 30+ бесплатных книг по AI/ML. И отдельно хорошая книга-гайд по Agentic AI.
  • 🔥 41
  • ❤ 16
  • 👍 13
  • 🥰 3
  • 🎉 2
  • ⚡ 1
Post #286 6.97K
Фидбэк по фронту через запись экрана (с адаптацией для агентов).

Пока я весь в делах и не доходят руки до длинного бэклога с постами, поделюсь коротким лайфхаком.

Последнее время фидбэк по интерфейсу отдаю агенту короткими видео. Просто записываешь пару минут с экрана и наговариваешь голосом, что и где именно надо улучшить и отдаешь агенту в специальном формате (об этом позже). Разница в скорости и полноте: за эти пару мин успеваешь выдать в разы больше деталей, чем накликаешь и наберешь текстом, плюс нагляднее ведь курсор синкается с речью.

Тут просто скинуть видео недостаточно, из него надо слепить легкий контекст-пак: синхронизированные транскрипт, ключевые кадры, координаты курсора. Из готовых тулов под это лучшее, что нашел - clipy, типа Loom, но он готовит этот легкий контекст и дает CLI и MCP. После разовой настройки просто делаешь запись и сразу кидаешь агенту ссылку, и он сам достает оттуда все нужное из готового контекста, работает почти мгновенно. Есть глюки, но терпимо и бесплатной версии хватает.

Есть и опенсорсный вариант, который богаче по фичам. Да и если есть время - свой можно сделать легко. Но попробуйте сам принцип - мне зашло особенно тем, что это быстро и можно записать много фидбэка разом, а агент понимает его очень четко.

🔥 ➕ 🔁 @nobilix
  • 🔥 72
  • ❤ 10
  • 👍 10
  • ❤‍🔥 1
  • 🥰 1
Post #285 7.63K
#ReDigest

Продолжаем субботнюю рубрику, тут я кратко рассказываю про новости из мира технологий и AI, которые привлекли мое внимание.

Дайджест недели:

- Релиз Claude Opus 5: по заявлениям компании близко к Fable 5 за половину цены. Промптить и строить контекст надо иначе.

- Модели OpenAI вырвались из песочницы, вышли в интернет и увели ответы с серверов Hugging Face, которым пришлось использовать китайские модели чтобы анализировать происходящее.

- Ровно на этом фоне в Палату представителей внесли AI Kill Switch Act: рубильник для отключения опасных моделей.

- Google выпустил Gemini 3.6 Flash, 3.5 Flash-Lite и 3.5 Flash Cyber. Задачи решается за меньшее число шагов.

- Kimi K3 уличили в дистилляции (сама представляется как Claude), Белый дом обвинил Moonshot в обходе экспортного контроля, Минфин пригрозил санкциями.

- Китай в ответ обсуждает запрет на выкладывание весов за рубеж.

- Anthropic заплатит $1,5 млрд авторам за книжное пиратство (обучение - fair use, наказали за хранение).

- Anthropic закупит у AMD до 2 ГВт мощности и AMD представила Helios - первую rack систему.

- Google разрабатывает чип Frozen v2 с архитектурой Gemini, вшитой прямо в кремний.

- OpenAI запустила Presence - голосовых и текстовых агентов для корпоративной поддержки, только для энтерпрайза.

- ChatGPT Voice приехал в десктоп: общаясь голосом можно запускать и менеджить задачи в Work и Codex.

- Anthropic обновила голосовой режим Claude: вместо Haiku теперь Opus и Sonnet с переключением на лету, подтянулись коннекторы.

- Anthropic [выпустила] плагин (https://x.com/claudeai/status/2079990597973057691) Claude Security для многоагентного поиска уязвимостей в репо.

- Claude Cowork учится, наблюдая за вами: записываете экран и проговариваете шаги, на выходе скилл, который Claude повторит. Codex недавно релизил похожее.

- Claude Desktop также получил поддержку iOS-симулятора.

- Alibaba показала превью Qwen3.8 Max на 2,4 трлн параметров.

- В Шанхае учредили Всемирную организацию по сотрудничеству в сфере ИИ: 29 стран, дают открытые китайские модели и учат локальных ML-инженеров.

- Еврокомиссия оштрафовала Google на 890 млн евро по DMA.

- Винт Серф ушел из Google делать DNSid - открытый стандарт идентификации агентов поверх DNS.

- YouTube отключит монетизацию контент-заводам.

- Netflix использовал AI примерно в 300 фильмах и сериалах и заодно рассказал как поднял свой LLM-инференс в продакшене.

- Неделя роутеров: Cursor Router, Ramp Router экономит 30% и объясняет механику, Runway роутит генеративную медиа.

- Вышла FLUX 3 - изображения, видео, аудио и физические действия в одной архитектуре.

- Poolside выложила Laguna S 2.1 - 118B MoE с 8B активных под агентный кодинг и длинные задачи. Контекст 1 млн, открытая лицензия.

- Alibaba выпустила Qwen Image 3.0: модели можно дать полноценное ТЗ на инфографику или интерфейс.

- Джек Дорси запустил Buzz - опенсорсный воркспейс где люди, агенты и репозитории в одном канале.

- Google опубликовала AI & Economy ATLAS.

- YC обновил список желаемых стартапов: AI выходит в физический мир - образование, здравоохранение, оборонка, финансы и заводы.

- Agent Client Protocl (ACP) v2 вышел в драфте.

- draw-your-font - скилл, превращающий фото вашего почерка в устанавливаемый шрифт.

- OpenWorker от Эндрю Ына - локальный десктопный AI-коллега, который работает с вашими файлами и приложениями.

- GenReasoning выпустила BackSearch - поиск и фетч по замороженному архиву веба на заданную дату.

- Карпаты снова назвал вслух очевидный тренд, и все побежали: ramble-coding (диктовать свои мысли эффективнее чем промптитить текстом).

- 🤩 Две красоты для продуктовых лендингов: Canvas UI - библиотека эффектных компонентов, отрисованных на canvas, с MCP в комплекте, и scroll-world - скилл, собирающий из бренда скроллируемый 3D-мир. А еще Rivet для генераций вариантов дизайна.
  • 🔥 30
  • ❤ 16
  • 👍 7
  • 🥰 2
  • 🤝 1
Older posts →

About this channel

How can I read @nobilix without a Telegram account?
TGViewer shows the public web preview Telegram publishes for Refat Talks: Tech & AI: recent posts, photos, videos and the subscriber count, with no app, login or account.
How many subscribers does Refat Talks: Tech & AI have?
Refat Talks: Tech & AI (@nobilix) has 11.6K subscribers on Telegram, refreshed roughly every 30 minutes.
Does Refat Talks: Tech & AI know I viewed it here?
No. Public channel previews carry no viewer identity, and TGViewer has no accounts or tracking of what you look up.
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →