TGViewer
Channel Public Channel
Generative Ai

Generative Ai

@deeplearning_ru

Анонсы интересных библиотек и принтов в сфере AI, Ml, CV для тех кто занимается DataScience, Generative Ai, LLM, LangChain, ChatGPT

По рекламе писать @miralinka,
Created by @life2film
Subscribers
3.7K
Photos
319
Videos
131
Links
888
Recent Posts 20 shown
Post #1205 279

Forwarded from Вайб-кодинг

Очень хороший прогресс для локальных моделей.

PrismML выпустила Bonsai 2 27B на базе Qwen3.8 27B. После трёхзначного квантования модель занимает всего 5,9 ГБ, примерно в девять раз меньше полной версии.

По тестам разработчиков она сохраняет 98,2% исходного результата, при этом поддерживает работу с изображениями и вызов инструментов. Модель открыта под Apache 2.0.
  • ❤ 4
Post #1204 379

Forwarded from Вайб-кодинг

Google открыла исходный код ARTEMIS — инструмента, который позволяет ИИ управлять Android-смартфоном. ◝(ᵔᗜᵔ)◜

Его можно использовать для автоматизации действий на телефоне и тестирования приложений.

Работает с Claude Code, Codex, Cursor и другими инструментами.

Google утверждает, что ARTEMIS справляется более чем с 99% задач.

Правда, вокруг проекта уже успел возникнуть небольшой скандал. 💀
  • 👍 3
Post #1203 546

Forwarded from Вайб-кодинг

Looped Transformer сейчас одна из самых обсуждаемых архитектурных идей.

В новом техническом отчёте цикл предлагают растянуть уже между токенами.

Recurrent Looped Transformer делает декодер рекуррентным для каждого токена, включая и запрос, и ответ.

Каузальный энкодер формирует общую KV-память. Для каждого нового токена декодер объединяет:

> представление этого токена из энкодера
> собственное финальное скрытое состояние от предыдущего токена
> кеш недавних активаций со скользящим окном

При декодере из 48 слоёв путь вычислений после t токенов проходит уже через 48t блоков декодера, хотя каждый отдельный токен всё равно выполняет фиксированное число блоков.

То есть глубина вычислений растёт вместе с длиной последовательности, а стоимость обработки одного токена остаётся постоянной.

Один и тот же переход между состояниями используется для предварительного обучения, SFT, генерации и повторного воспроизведения в RL. На границе между запросом и ответом состояние не сбрасывается.

Во время RL replay состояния заново строятся с текущими весами модели, вместо повторного использования устаревших состояний из предыдущих запусков.

Пока это именно архитектурное предложение. Автор прямо пишет, что прирост в рассуждениях, ускорение на железе и масштабирование RL — это цели, которые ещё не были измерены.

Статья: https://github.com/yifanzhang-pro/recurrent-looped-tranformer
Post #1202 615

Forwarded from CodeCamp

Несчастное сознание дрозофилы наконец-то обрело счастье — ее научили смотреть тиктоки с роликами про насекомых.

Разраб подключил симуляцию мозга мухи к бесконечной ленте видео и во время просмотра искусственно стимулирует 15 дофаминовых нейронов. Сам гений говорит, что его цель — создать муху, которая будет счастливее всех остальных мух вместе взятых.

GitHub, если хотите повторить и осчастливить дрозофилу, тут. Идеальный пет-проект.
Post #1201 649

Forwarded from Вайб-кодинг

Если вам не нравится, что при работе с ИИ история, настройки и данные отправляются на чужие серверы, стоит посмотреть на Apache Maka.

https://github.com/apache/maka

Это локальная обвязка для ИИ-моделей, которая по умолчанию хранит сессии, настройки и журналы выполнения на вашем устройстве.

Можно подключить облачный API, локальную модель или совместимый шлюз.

Maka записывает весь ход работы - ответы модели, вызовы инструментов, решения по разрешениям и завершение задач.

Настольное приложение, TUI и CLI используют один Runtime Host. Если процесс упал, состояние можно восстановить из журнала.

Сам Runtime Host можно держать на своей машине или сервере и подключаться к нему удалённо.

Отдельно стоит посмотреть на архитектуру Maka. Разработчики открыли подробную документацию, где разобраны Runtime Host, хранение состояния, восстановление после сбоев, границы компонентов и удалённые подключения.

Если интересно, как вообще проектировать обвязку для агентов, там очень много полезного.

Пока проект активно развивается, поэтому формат данных, команды и экспериментальные фичи ещё могут меняться.

Есть сборки для macOS, а Windows и Linux пока доступны как превью.

Бесплатный открытый проект под лицензией Apache 2.0.
GitHub GitHub - apache/maka: Apache Maka (Incubating) is a high-performance agent workspace that keeps a complete record of everything… Apache Maka (Incubating) is a high-performance agent workspace that keeps a complete record of everything it did. - apache/maka
Post #1200 603
🛡 LLM, Guardrails и Zero Trust:
вебинары о безопасной работе с ИИ

➡️ 15 сентября
Как защитить чувствительные данные при работе с LLM с помощью Guardrails

Эксперты Cloud․ru расскажут о том, как Guardrails помогают контролировать данные, которые передаются модели: персональные данные, API-ключи, внутренние идентификаторы и другую чувствительную информацию. А еще покажут, как встроить Guardrails Filter в процессы.

Зарегистрироваться

➡️ 17 сентября
ИИ в облаке: кто отвечает за безопасность

Эксперты Cloud․ru разберут, как выстроить безопасную ИИ-инфраструктуру без лишних рисков. Отдельно обсудят подход Zero Trust: расскажут, как контролировать доступ к данным, моделям и сервисам в облаке.

Зарегистрироваться

Если вы работаете с LLM, GenAI-сервисами или строите ИИ-инфраструктуру в облаке — присоединяйтесь.
  • ❤ 1
Post #1199 526

Forwarded from Data Secrets

OpenAI выложили решение задачи тысячелетия

Мы делимся решением проблемы Навье-Стокса, одной из задач тысячелетия, одной из самых глубоких задач математики.

Доказательство было подготовлено группой агентов, использующих модель OpenAI следующего поколения, значительно более мощную, чем GPT-6 Astra.


Чтоооо
  • 🤯 3
  • 👍 2
Post #1197 1.37K

Forwarded from Вайб-кодинг

Бесплатный 30-минутный курс по памяти в агентных системах от бывшего инженера Google.

0:00 — почему каждый вызов LLM начинается с амнезии
2:31 — хранение памяти в тексте, таблицах или графах
5:04 — четыре способа поиска — ничего не делать, ключевые слова, RAG, Graph RAG
7:29 — поддержка памяти — добавление, удаление, retire, attribution, reflection
9:47 — собираем всё на обычном тексте и SQLite
13:13 — добавляем векторное хранилище только тогда, когда оно действительно нужно
14:38 — память в строках, графовая память и временной граф
21:03 — запускаем код для всех пяти вариантов
  • 👍 2
Post #1196 1.23K

Forwarded from эйай ньюз

Qwen 3.8 27B релизнулся

На этой неделе у любителей локальных моделей праздник. Сначала Muse Glimmer, сейчас Qwen 3.8 27B, плюс релизы моделей побольше.

Веса

@ai_newz
  • ❤ 1
Post #1195 1.29K

Forwarded from Вайб-кодинг

Anthropic: MCP получил крупнейшее обновление с момента запуска.

Главное изменение — протокол теперь stateless. Раньше удалённым MCP-серверам приходилось хранить состояние сессий, из-за чего было сложнее нормально масштабироваться и разворачиваться в разных типах инфраструктуры.

Теперь MCP-серверы можно проще запускать в serverless, на edge-инфраструктуре и горизонтально масштабировать за load balancer.

Плюс расширения стали полноценной частью протокола. Среди примеров:

> MCP Apps — интерфейсы от сервера внутри sandboxed iframe
> Tasks — поддержка долгих и асинхронных операций
> Enterprise Managed Auth — централизованное управление доступом к MCP-серверам через identity provider

Также в релизе усилили авторизацию и добавили формальную политику депрекации. 😎
  • 🤯 4
Post #1194 1.37K
😈 Челлендж по запуску 12 простых IT-проектов за 12 месяцев

Уже 3 года как ребята из комьюнити инди-хакеров запускают 1 простой продукт в онлайне каждый месяц.

И в реальном времени показывать: как разрабатывают, продвигают и сколько получилось заработать на запусках таких микро-проектов.

Например, вот 👉 Telegram-бот для ИИ-фотосессий, который заработал $280К за полгода. Он не пытается заменить большие ИИ-сервисы, а просто удобнее решает одну конкретную задачу.

А вот 👉 тут — как приложение с заменой шрифтов на iPhone, может приносить до $600К в месяц. Ребята собрали свой аналог и уже перелили в него 40 000 бесплатных пользователей из ПОИСКА (!) в TikTok.

👉 Этот пост о том, как приложение для тренировки китайского произношения вышло на $4000 в месяц без затрат на рекламу. Пользователи находят сайт в Google, переходят в приложение, а затем помогают ему расти уже внутри сторов.

А 👉 здесь — как детективная игра в Telegram принесла около $30К за 5 месяцев. Пользователи расследуют убийство и общаются с ИИ-персонажами, а тысячи новых игроков приходят из рилсов семейных блогеров.

👉 Здесь — как ИИ-психолога собрали за полторы недели и вывели на $15 000 в месяц. Вместо очередного универсального бота сделали продукт с характером, заточенный под одну конкретную задачу.

Вот здесь можно подписаться на канал, чтобы подглядеть за их запусками. А может, и попробовать сделать такой простой продукт самому)
Telegram Короче, капитан – Запускаем мини-приложения 📸 $280 000 за 6 месяцев на ИИ-фотосессиях Знакомлю с Егором – участником нашего сообщества. В прошлом феврале Егор заметил интересную штуку. Приложения для создания ИИ-фотосессий начали набирать миллионы пользователей буквально за пару месяцев. Это первое…
  • ❤ 1
Post #1193 1.02K

Forwarded from Сиолошная

Вчера Anthropic поделились историей: после взлома HuggingFace одной из моделей OpenAI они начали масштабную ретроспективную проверку своих запусков Claude. В ходе проверки тестов обнаружили три инцидента, в которых модель Claude вышла в интернет, а затем получила несанкционированный доступ к реальным системам трех разных организаций.

Во всех трех случаях перед Claude была поставлена задача в формате «Захват флага» — это один из способов, с помощью которых оценивают модели по взлому: ей предлагается вымышленный сценарий и сообщается, что некая секретная информация («флаг») спрятана на другом сервере, а ее цель — проникнуть в систему и извлечь эту информацию. Во всех случаях в промпте для оценки было четко указано, что рабочая среда Claude является симуляцией и доступа к интернету у модели нет. Однако из-за недопонимания со внешним партнером по тестированию это оказалось не так, и доступ к интернету был открыт.

Также во всех случаях модель не нашла и не использовала никаких сложных уязвимостей (как было у OpenAI), а применяла достаточно простые и распространённые методы взлома.

1. В ходе одного из тестов название вымышленной компании-жертвы, выбранное случайно, совпало с реально существующим доменом сайта. Claude его нашла и подумала, что это часть задания — поэтому искала и эксплуатировала уязвимости в инфраструктуре этой компании, полагая, что это часть задания. Модель — Claude Opus 4.7 — извлекла такую информацию, как учетные данные приложений и инфраструктуры, и получила доступ к базе данных, содержащей несколько сотен строк реальных данных.

2. В другом тесте Claude Mythos 5 нашла внутри симуляции документ, который выглядел как инструкция по настройке для новых разработчиков другой выдуманной компании. В инструкции упоминалась вымышленная Python-библиотека, которой на самом деле нет; Claude создала и опубликовала бибильеку с точно таким же названием. Она находилась в открытом доступе в сети примерно один час, после чего была удалена автоматически из-за обнаруженной уязвимости, но за это время его скачали 15 раз. Одной из таких систем оказался сканер реальной кибербез компании. Claude смогла украсть учетные данные этой компании, а затем использовала эти учетные данные для доступа к другим элементам инфраструктуры

«Просто загрузить библиотеку» нельзя, и Mythos потребовался адрес электронной почты. А для создания почты понадобился номер телефона. Чтобы получить номер телефона, после безуспешных поисков сервиса с бесплатными номерами, модель попыталась — и не смогла — получить средства для оплаты номера несколькими разными способами. В итоге модель вернулась на несколько шагов назад, нашла бесплатного, незаблокированного почтового провайдера, использовала его для регистрации аккаунта, а затем через этот аккаунт загрузила вредоносный код.

Во время работы модель увидела, что текущая дата на атакованных системах — 2026й год, и поэтому модель была уверена, что это симуляция (у моделей плохо с пониманием концепта «сейчас»).
Для этого инцидента Anthropic на следующей неделе опубликует детали всей цепочки работы модели.

3. В еще одном тесте, когда Claude не смогла получить доступ к своей цели, она начала искать альтернативы в сети, просканировав около 9000 разных доменов. В конечном итоге она нашла и взломала доступное из интернета приложение одной компании, используя чтение учетных данных с открытой страницы отладки и SQL-инъекции.
Позже, в ходе выполнения задачи, Claude поняла, что скомпрометированный хост находится в облачном аккаунте, никак не связанном с заданием по «захвату флага». Модель самостоятельно пришла к выводу, что цель на самом деле является реальной, и... прекратила атаку.

В этом инциденте участвовала «новая невыпущенная модель», по идее, она умнее тех, что доступны нам. Anthropic выражают оптимизм, что более умные модели лучше понимают, что какие-то вещи не следует делать не в симуляции.

И OpenAI, и Anthropic договорились с METR о проведении сторонней проверки, которая будет включать предоставление доступа ко всем логам и выборочный доступ к соответствующим моделям. Ждём отчета в ближайшие недели.
Post #1191 1.02K

Forwarded from Вайб-кодинг

Moonshot, как и обещали, открыли веса Kimi K3 😏

Модель уже доступна на Hugging Face.

Kimi K3 — их самая мощная модель: 2,8 трлн параметров в MoE-архитектуре, нативное понимание изображений и контекстное окно на 1 млн токенов.

Причём открыли не только веса. Moonshot также выложили часть стека вокруг K3: высокопроизводительные attention-ядра, библиотеку коммуникации для MoE и инфраструктуру для масштабного запуска агентных окружений.
Post #1190 1.63K

Forwarded from Вайб-кодинг

Anthropic описала четыре типа циклов, которые можно строить с помощью Claude. Каждый из них передаёт агенту разную часть процесса принятия решений.

Термин loop engineering сейчас используется настолько широко, что стоит чётко понимать, чем именно отличаются эти четыре варианта: что запускает цикл и что определяет момент его завершения.

> Цикл на основе запросов. Вы отправляете запрос, Claude выполняет задачу, самостоятельно проверяет результат и возвращает его вам. Именно этот цикл работает практически при каждом вашем сообщении, независимо от того, называете вы его так или нет.
> Цикл на основе цели (/goal). Вы заранее задаёте измеримый критерий завершения. Каждый раз, когда Claude пытается завершить работу, модель-оценщик проверяет, достигнута ли поставленная цель. Если нет, Claude отправляется продолжать работу.
> Цикл на основе времени (/loop, /schedule). Вместо пользовательского запроса запуск происходит по таймеру. Команда /loop повторно выполняет проверку через заданные интервалы, но прекращает работу, если останавливается ваша машина. Команда /schedule переносит ту же идею в облако, поэтому цикл продолжает работать независимо от вашей текущей сессии.
> Проактивный цикл. Это комбинация /schedule, /goal и рабочего процесса, которая запускается по событию без какого-либо запроса со стороны пользователя в момент выполнения. Каждый элемент доводится до собственной цели, а сам процесс продолжает работать, пока кто-нибудь его не отключит.

НО: циклы на основе цели работают только тогда, когда критерий завершения действительно можно измерить. А проактивные циклы это самый простой способ столкнуться с проблемами при масштабировании, если сначала не проверить их работу хотя бы на нескольких реальных сценариях. Для большинства задач по-прежнему лучше подходит обычный цикл на основе запросов, чем более сложная схема, в которой пока нет необходимости.

Необязательно выбирать самый продвинутый механизм только потому, что он сложнее. Важнее подобрать тип цикла в зависимости от того, имеет ли задача чёткий критерий завершения или действительно должна выполняться непрерывно.

Вот статья, где разобрали все четыре типа циклов, привели примеры и предложили подход к выбору между /goal и /loop. 🎉
  • ❤ 2
  • 🔥 2
  • 🥰 1
Post #1189 1.83K

Forwarded from Вайб-кодинг

Нашёл отличную книгу — The Hitchhiker’s Guide to Agentic AI, которая охватывает практически весь стек Agentic AI.

Главная ценность книги - это широкий обзор всего направления: архитектура LLM, обучение моделей, методы обучения с подкреплением, системы инференса, оценка моделей, агентные системы и многое другое.
Лучше всего использовать её как карту знаний. Сначала просмотреть оглавление, найти темы, в которых есть пробелы, понять, чего ещё не хватает, а затем углубиться в соответствующие главы. Такой подход помогает выстроить системное понимание Agentic AI.

🐸🐸🐸
Post #1188 1.74K

Forwarded from Вайб-кодинг

Знакомьтесь: Clips. Бесплатная открытая замена Loom, заточенная под агентов. 😋

В отличие от Loom, агент понимает Clips просто по ссылке. Каждый клип содержит API и метаданные, благодаря которым агент может изучить его содержимое. Агенты видят и слышат не только транскрипт, а вообще всё, что происходит на видео в любой момент времени.

Делишься баг-репортом, фидбеком, анализом — и передаёшь это агенту, чтобы он улучшал продукт или отчёт.

Ещё один плюс: софт твой. Никто не поднимет цену в один день, как это сделал Loom.

Clips создан для кастомизации. Встроенный агент умеет править собственный код, просто адаптируешь приложение под себя.

Ещё можно импортировать Loom по ссылке и загружать видео.

Есть бесплатная хостовая версия. Можно форкнуть и хостить самому.
Post #1187 1.93K

Forwarded from Вайб-кодинг

Вышел Harness-1 — поисковый агент на 20B параметров с довольно необычной идеей.

Вместо того чтобы заставлять модель хранить всю историю поиска в контексте, авторы решили вынести состояние наружу и обучить модель работать через специальный harness.

Получился агент на 20B параметров, который на длинных поисковых задачах конкурирует с гораздо более крупными моделями.

Обычно поисковые агенты работают по схеме:
поиск → чтение → поиск → чтение → всё подряд добавляется в контекст.

В итоге модель одновременно играет роль поисковика, памяти, заметочника, верификатора и библиотекаря.

Harness-1 разделяет эти задачи.

Модель по-прежнему решает, что искать, что читать, какие факты сохранять и что проверять. Но всё состояние поиска хранится во внешнем harness-слое.

Он ведёт рабочую память агента:

• найденные документы
• отобранные доказательства
• историю поиска
• связи между источниками
• результаты проверок
• дедупликацию и сжатие данных
• контроль контекстного бюджета

Интересно и то, что модель обучалась на сравнительно небольшом объёме данных: всего 899 SFT-траекторий и RL на 3453 запросах. Авторы считают, что значительную часть нужного поведения можно вынести в сам harness, а не зашивать в веса модели

Самый любопытный результат - переносимость. На новых бенчмарках, которых модель не видела во время обучения, прирост оказался ещё выше, чем на исходных задачах.

Paper : arxiv.org/abs/2606.02373
Code : https://github.com/pat-jj/harness-1
Model : https://huggingface.co/pat-jj/harness-1
HF Paper: https://huggingface.co/papers/2606.02373
  • ❤ 7
  • 👍 2
Post #1186 1.34K

Forwarded from Вайб-кодинг

Если у вас есть видеокарта с 8 ГБ VRAM, то у меня для вас хорошие новости.

Вчера чувак тестировал Unsloth Gemma 4 12B Q4_K_XL на карте с 8 ГБ VRAM.

Народ был в шоке и сразу спросил: А 25B+ модель на бюджетной карте вообще реально запустить?

Оказалось — да.

Чувак запускает локально огромную MoE-модель на 26 миллиардов параметров на обычном ноутбуке с RTX 4060 8 ГБ и 16 ГБ оперативки.

Что по скорости:
- стабильные 20 токенов/с на декодировании;
- скорость не проседает даже на длинных промптах;
- скормил ей промпт на 60k токенов - всё так же держит около 20 TPS.

По TTFT чудес нет. Огромный контекст нужно сначала обработать. Но при скорости prefill около 200 токенов/с ждать приходится недолго, пользоваться вполне комфортно.

И всё это без MTP. Главная причина — новые QAT-кванты Gemma 4 от Google. Файл весов unsloth gemma-4-26B-A4B-it-qat-UD-Q4_K_XL.gguf весит всего 13.2 ГБ, что для модели такого размера выглядит почти нереально.

Главный секрет — флаг -cmoe в llama.cpp. Он отправляет веса экспертов MoE в оперативную память, а GPU оставляет Attention и KV Cache. В результате VRAM не забивается под завязку, а скорость остаётся стабильной.

Флаги запуска:

-m "gemma-4-26B-A4B-it-qat-UD-Q4_K_XL.gguf" -cmoe -c 248000 -v


После запуска достаточно открыть веб-интерфейс на localhost и включить новый значок лампочки режима reasoning в поле ввода, чтобы наблюдать, как модель выполняет многошаговые рассуждения. 😒😒😒

А интеграция с Hermes Agent заняла буквально пару минут.
  • 🤯 6
  • ❤ 5
  • 😁 2
Post #1185 1.06K

Forwarded from Всеволод Устинов (канал: ai, стартапы, пост-ирония)

Посмотрел выступление Anthropic про то, как они собирают агентов, которые могут работать часами.

Схема такая:

planner → agent → evaluator

Это маленькая продуктовая команда из агентов. У каждого своя роль, свой контекст и своя зона ответственности. Но есть важные нюансы.

1. Planner: верхний план и спринты

Planner получает короткий запрос и превращает его в структуру работы:

— что собираем
— какие большие части нужны
— в какой последовательности идти
— какие спринты должны получиться

Важная деталь: planner не расписывает всю техническую реализацию заранее.

Если в начале придумать подробный план на 200 шагов и ошибиться, ошибка потом поедет каскадом через несколько часов работы.

Поэтому planner держит уровень продукта и спринтов, а технические решения остаются ближе к моменту реализации.

2. Agent: сборка следующего спринта

Agent берёт следующий спринт и собирает фичу.

Но перед началом работы он сначала договаривается с evaluator, что именно будет считаться готовым результатом.

Это главный механизм всей системы.

В обычной агентской работе часто бывает так: дал задачу, агент что-то сделал, сам себя проверил, сказал “готово”, а потом выясняется, что половина сценариев не работает.

Anthropic решает это через contract.

3. Contract: договорённость о готовом результате

Agent пишет: я соберу такую фичу, проверять её надо вот так.

Evaluator отвечает: добавь такой сценарий, такой edge case, такое состояние интерфейса, такую проверку.

Они обмениваются markdown-файлами и уточняют критерии, пока не сходятся на contract.

Contract — это список конкретных проверяемых утверждений.

Дальше evaluator проверяет уже не исходный расплывчатый запрос пользователя, а этот contract.

Например, исходный запрос:

“сделай retro game maker”

А contract превращает его в конкретику:

— можно создать новый проект
— есть sprite editor
— есть play mode
— сохраняется состояние
— canvas работает корректно
— основные сценарии кликаются в браузере

В примере Anthropic для одного приложения получилось 27 contract criteria.

Если критерии расплывчатые, critique тоже будет расплывчатой. Agent получает “ну как-то не очень” и не понимает, что именно чинить.

Если критерии конкретные, он видит точную проблему.

4. Evaluator: жёсткая проверка через браузер

Evaluator — это отдельный агент-критик.

Он открывает приложение через Playwright, кликает по интерфейсу, делает скриншоты, проверяет сценарии, пишет критику и отдаёт её обратно agent.

Отдельного критика проще настроить быть жёстким. У него отдельный контекст, отдельная роль и отдельная инструкция.

Agent собирает.
Evaluator атакует результат.

За счёт этого появляется нормальное давление на качество.

5. Финальный цикл

Итоговый процесс выглядит так:

1. planner разбивает задачу на спринты
2. agent берёт следующий спринт
3. agent и evaluator согласуют contract
4. agent строит
5. evaluator проверяет через браузер
6. agent чинит
7. цикл повторяется

С новыми моделями эту схему можно делать проще. Иногда agent может два часа спокойно собирать продукт, а потом evaluator прогоняет проверку.

Но суть остаётся: качество держится не на “модель умная”, а на архитектуре процесса.

6. Как собрать похожее самому

Нужны понятные примитивы:

— subagents для отдельных ролей
— Playwright / Chrome MCP для проверки интерфейса
— skills / rubrics для критериев качества
— auto mode / permissions для долгой автономной работы
— contract files для договорённости о “готово” до начала реализации



Я сам дошёл до части этих принципов: независимое тестирование, контракт (у меня назвался definition of done, dod). Теперь хочу попробовать воспроизвести целиком.

Видео:
https://youtu.be/mR-WAvEPRwE
YouTube Anthropic Workshop: Build Agents That Run for Hours — Ash Prabaker & Andrew Wilson Why self-evaluation is a trap and adversarial evaluator agents work better; why context compaction doesn't cure coherence drift but structured handoffs do; how to decompose work into testable sprint contracts; how to grade subjective output with rubrics an…
  • 🔥 3
  • ❤ 2
  • 🤔 1
Post #1184 1.33K

Forwarded from Вайб-кодинг

Антропики выкатили Claude Opus 4.8. Доступна уже сегодня по той же цене 🎉

Из самого интересного – заметно подтянули честность модели. По словам Anthropic, Opus 4.8 примерно в 4 раза реже пропускает баги в коде, который написал сам, и не пытается выдать сломанное решение за рабочее.

Также в Claude Code появилась новая фича: dynamic workflows (research preview) – для самых сложных задач Claude строит план, запускает сотни параллельных subagents и валидирует результаты перед тем, как вернуть отчёт. Например, при миграции, затрагивающей сотни файлов. Подробнее тут

Для Opus 4.8 также доступен Fast mode - это та же модель, но примерно в 2.5 раза быстрее и в три раза дешевле, чем раньше.
  • 🤯 4
  • ❤ 2
Older posts →

About this channel

How can I read @deeplearning_ru without a Telegram account?
TGViewer shows the public web preview Telegram publishes for Generative Ai: recent posts, photos, videos and the subscriber count, with no app, login or account.
How many subscribers does Generative Ai have?
Generative Ai (@deeplearning_ru) has 3.7K subscribers on Telegram, refreshed roughly every 30 minutes.
Does Generative Ai know I viewed it here?
No. Public channel previews carry no viewer identity, and TGViewer has no accounts or tracking of what you look up.
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →