TGViewer
Channel Public Channel
Agentic Engineer

Agentic Engineer

@data_engi

Data Engineering Technologies.
SQL, Python, Kafka, Spark, Pandas, Airflow, Clickhouse, Greenplum, Postgres, dbt, LLM, Agentic systems, AI, robots, drones etc.

Boost channel - https://t.me/boost/data_engi
Subscribers
684
Photos
454
Videos
130
Links
747

Showing posts older than #1310 · Back to latest

Older Posts 20 shown
Post #1308 170
Индия готовит банковский кошелёк для ИИ‑агентов 🥹

1 сентября Reuters сообщил о разработке Unified Agent Protocol — системы, которая позволит ИИ‑агентам самостоятельно оплачивать небольшие покупки через UPI без подтверждения каждой операции.

Ты задаёшь правила и лимит, блокируешь нужную сумму — агент сам покупает продукты, ловит скидки или оплачивает заказ. Позже ему могут разрешить даже инвестиции при достижении указанной цены. Обещают проверку личности, журнал действий и ограничения расходов.

Масштаб серьёзный: только за август через UPI прошло 24,5 млрд платежей на $314 млрд. Это крупнейшая в мире система быстрых розничных платежей по числу транзакций.

Пока протокол официально не представлен — анонс ожидается на следующей неделе. Но если запуск состоится, ИИ‑агент впервые получит доступ к платёжной инфраструктуре целой страны.

#aiagents #fintech #payments #india #upi

@data_engi
Post #1307 170
Агенту предложили забывать 🧐 рассуждения после каждого шага

Исследователи Google и Purdue представили SKILL.state — архитектуру для долгих агентных задач без постоянно растущей истории диалога.

На каждом шаге модель получает только:

🔘 неизменяемое описание скилла;
🔘 текущее состояние в виде структуры;
🔘 последнее наблюдение.

Модель предлагает изменение состояния и следующее действие. Runtime проверяет патч, сохраняет обновлённое состояние, а промежуточные рассуждения удаляет.

В тесте на 100 шагов такой агент потратил 65 тысяч токенов против 1,06 миллиона у варианта, который хранил состояние вместе со всей историей. Точность при этом выросла с 91% до 94%.

Для тебя здесь полезный паттерн: журнал событий и рабочее состояние агента — разные сущности. Для выполнения задачи модели нужен актуальный JSON, а полный лог можно хранить отдельно для аудита. Так старые наблюдения не отравляют контекст, а расход токенов растёт линейно, а не квадратично.

Ограничение: схема состояния должна быть известна заранее. Если агент не сохранил важный факт в момент получения, после удаления истории восстановить его уже не получится.

🔜 исследование SKILL.state

#aiagents #agentskills #contextengineering #agentmemory #llmarchitecture #statemanagement

@data_engi
arXiv.org SKILL.state: Scalable Long-Horizon Agent Skills Large Language Models (LLMs) increasingly act as autonomous agents executing complex, long-running procedural skills. Existing agent runtimes maintain execution by continually appending...
Post #1306 152
🖼️ Умер Airflow worker — Spark-job больше не запускается заново

В Apache Airflow 3.3 SparkSubmitOperator получил отказоустойчивый режим durable=True, включённый по умолчанию. Идентификатор удалённого задания сохраняется во встроенном хранилище состояния.

Если worker погибает во время выполнения, повторная попытка подключается к уже работающему Spark-job, а не отправляет ещё один. Это снижает риск двойной записи данных, лишней нагрузки и оплаты двух одинаковых вычислений.

То же хранилище можно использовать для курсоров, контрольных точек и идентификаторов внешних задач — вместо самодельных схем на XCom и Variables.

Apache Airflow релиз 3.3.0 от 6 июля 2026 года

#apacheairflow #apachespark #dataops #faulttolerance #orchestration #dataengineering

@data_engi
Apache Airflow Apache Airflow 3.3.0: Stateful Tasks and Multi-Language Support Apache Airflow 3.3.0 introduces a first-class state store for tasks and assets (AIP-103), a Language Task SDK for writing tasks in Java and Go (AIP-108), a major expansion of asset partitioning, and pluggable retry policies.
Post #1304 170
😒 Мультиагентная система может выполнить задачу неправильно

Исследователи из Нанкинского университета, Tsinghua и AgiBot выпустили CoCoBench — 897 исполняемых сценариев для проверки координации нескольких AI-агентов.

Бенчмарк отдельно измеряет четыре навыка:

🔘 распределение работы;
🔘 соблюдение порядка действий;
🔘 доступ к общему ресурсу без конфликтов;
🔘 передачу результата между агентами.

Оказалось, обычный success rate может сильно приукрашивать результат. Например, Qwen3.6-Plus завершила 69,1% заданий, но только 56,7% траекторий были допустимыми. Агентам иногда удавалось достичь цели через нарушение порядка действий или конфликт за общий инструмент.

Ещё один результат: централизованный планировщик показал 48% успешных запусков, агенты с общей связью — 39,6%, а полностью раздельные — 36,7%. Одного канала сообщений оказалось недостаточно для замены общего состояния.

Для тебя вывод простой: проверяй не только итог мультиагентного процесса. Сохраняй траекторию и отдельно считай дублирование работы, нарушения зависимостей, конфликты ресурсов и корректность передачи между агентами.

Пока это симуляция бытовых задач, но те же ошибки возникают у программных агентов при работе с тикетами, файлами, блокировками и конвейерами.

Ссылки:
🔘исследование от 28 августа 2026 года
🔘код и набор из 897 сценариев
🔘Хабр

#multiagent #aiagents #agentengineering #aievals #coordination #robotics

@data_engi
  • ❤‍🔥 1
Post #1303 166
🫡 ИИ упёрся в медь — и сделал одну компанию почти незаменимой

31 августа французская Soitec начала заключать многолетние договоры с производителями фотонных чипов. Клиенты должны внести депозит, заранее выбрать объём и раскрывать остатки на складах. Заказал меньше обещанного — депозит не возвращается.

Причина — дата-центры переходят с медных соединений на оптические: в огромных кластерах медь уже проигрывает свету по скорости и энергопотреблению.

Soitec выпускает кремниевые пластины, на которых строится почти вся современная фотоника. По оценке UBS, её доля рынка достигает 95%. Компания ждёт более $200 млн выручки от этого направления, а её акции с начала года выросли почти в четыре раза.

#ai #siliconphotonics #datacenter #semiconductors #networking

@data_engi
Post #1302
Agentic Engineer pinned «💻 Сделал Laconian 🔜 skill, который просит агента давать не просто короткий, а самый короткий полный ответ. Он убирает приветствия, пересказ запроса, незапрошенное описание процесса и повторы. Но сохраняет факты, ограничения, важные оговорки, точные команды…»
Post #1301 195
MCP-спецификация сама стала генератором тестов для агента

Apple представила Agent Seer — конвейер, который создаёт проверочные сценарии только по описанию MCP-сервера. Ему не нужны рабочий сервер, реальные ответы инструментов, готовые примеры или ручная разметка.

Из названий функций, описаний и схем параметров система строит:
🔘 пользовательские задачи и ожидаемые цепочки вызовов;
🔘 правдоподобные ответы инструментов;
🔘 многошаговые диалоги;
🔘 эталон для проверки агента.

На семи MCP-серверах Agent Seer сгенерировал 337 сценариев. Главным источником ошибок оказалось не количество инструментов, а сложность их параметров. Чаще всего система правильно выбирала инструмент, но подставляла неверное значение аргумента — обычная проверка только имени функции этого не замечает.

Для тебя это полезный паттерн: после изменения MCP-схемы можно автоматически пересобирать дымовые и регрессионные тесты. Заодно появляется ещё одна причина делать схемы параметров простыми и однозначными.

Ограничение существенное: сценарии и эталоны синтетические, а качество оценивала другая LLM. Такие тесты находят ошибки контракта, но не подтверждают корректность реальных данных и бизнес-логики.

Пруфы:
🔘публикация Apple
🔘полный текст исследования

#mcp #aiagents #aievals #toolcalling #testing #agentengineering

@data_engi
Apple Machine Learning Research Agent Seer: Synthesizing Scenarios from Specification Understanding Evaluating AI agents that use external tools requires realistic test scenarios that capture how practitioners compose tools and iterate…
Post #1300 201
💻 Сделал Laconian 🔜 skill, который просит агента давать не просто короткий, а самый короткий полный ответ.

Он убирает приветствия, пересказ запроса, незапрошенное описание процесса и повторы. Но сохраняет факты, ограничения, важные оговорки, точные команды и нужную детализацию.

От Caveman отличается приоритетом: не максимальная экономия токенов и телеграфный стиль, а краткость без потери точности, оговорок и нормального языка.

Всё в одном SKILL.md. Каркас бенчмарка есть, публичных результатов пока нет, в процессе. Звёзды на GirHub приветствуются.

Ссылки:
🟢laconian
🟢github
🟢хабр

#Laconian #AIAgents #AgentSkills #LLM #OpenSource #AI #if

@data_engi
Laconian Laconian — The shortest complete answer A portable, one-file agent skill that cuts redundancy, not substance.
Post #1299 173
🙃 IBM добавила рассуждение в теорию информации Шеннона

Исследователи IBM и Университета Пердью предложили «логическую семантическую энтропию». Она измеряет не только переданные факты, но и всё, что получатель способен логически из них вывести.

Отсюда получился неожиданный парадокс: самый короткий способ сообщить агенту нужное знание иногда неизбежно раскрывает ему больше, чем планировалось. Общая предпосылка хорошо сжимается и позволяет вывести ответ, но заодно открывает доступ к лишним выводам.

Для тебя это важно при проектировании RAG, сжатия контекста и обмена между агентами. Проверять нужно не только явно переданные данные, но и множество выводов, которые модель может из них построить. Принцип минимальных прав должен применяться и к выводимому знанию.

Пока это математическая теория для систем с формальной логикой, а не готовый алгоритм оптимизации LLM-контекста. Но она даёт язык для описания проблемы, которую обычный подсчёт токенов не видит.

Пруфы:
*️⃣публикация в PNAS
*️⃣разбор IBM Research

#informationtheory #aireasoning #aiagents #contextengineering #agentsecurity #rag

@data_engi
PNAS Fundamental limits incorporating logical reasoning into Shannon’s information theory | PNAS A cornerstone of Shannon’s famous information theory is the idea of decoupling the meaning of a message from its efficient transmission. In this ar...
Post #1298 220
Meta получила на 220% больше кода — и на 40% больше инцидентов 🧐

Meta планировала превратить команды из 10–20 специалистов в группы по 3–5 «универсальных разработчиков» с ИИ-агентами. В отдельных сценариях численность подразделений могли сократить до 60%, однако вторую волну реорганизации отменили.

Внутренние данные показали неприятную разницу: количество изменений кода выросло на 220%, а число новых и улучшенных функций для пользователей — только на 36%. Одновременно серьёзные технические и безопасностные инциденты участились на 40%, а затраты времени на их устранение — на 70%.

Хорошее напоминание: объём сгенерированного кода не равен продуктивности. Без тестов, наблюдаемости, ограничений для агентов и контроля результата ИИ способен быстрее производить не только функции, но и технический долг.

#artificialintelligence #softwareengineering #aiagents #productivity #meta

@data_engi
Post #1296 159
Таракан со шприцем может стать спасателем 🪳

Австралийские инженеры создали «параборгов» — гигантских роющих тараканов длиной до 8,5 см с электродами, камерой и миниатюрным автоматическим инъектором.

Оператор направляет насекомое электрическими импульсами. Один таракан ищет человека под завалами и передаёт видео, второй подползает к нему и делает укол. Решение об инъекции остаётся за спасателем или медиком.

В лаборатории полный маршрут с доставкой препарата успешно завершался в 72% случаев. С расстояния до 15 см точность инъекции достигала 95%.

Живое насекомое оказалось проворнее, выносливее и экономичнее микророботов. До применения на людях ещё далеко, но если однажды под завалами к тебе поползёт огромный таракан со шприцем — возможно, прихлопывать его не стоит.

Пруфы:
🔘исследование в Advanced Science
🔘Университет Квинсленда

#robotics #biorobotics #cyborg #rescuetech #disasterresponse

@data_engi
The Advanced Portfolio Paraborg: Paramedic Cyborg Insects for In Situ Emergency Drug‐Delivery This work introduces Paraborg, a human-supervised paramedic cyborg-insect platform that combines controllable locomotion, onboard imaging, and an auto-injection mechanism for in situ drug-delivery. B...
Post #1295 149
Postgres превратили в переходник к ClickHouse

Платформа недвижимости QuintoAndar перестраивает обработку 900 млн событий в месяц от 14 млн пользователей. Раньше горячие данные обслуживал PostgreSQL, а холодный контур круглосуточно сводился в Databricks. Теперь события пишутся прямо в ClickHouse, который также обслуживает около 300 млн запросов API в месяц.

Проблема возникла с Hightouch: нужный режим сервиса не поддерживал ClickHouse. Команда подключила расширение pg_clickhouse, импортировала таблицы как внешние — и Hightouch увидел их как обычный PostgreSQL.

Соединения, фильтры и агрегации при этом проталкиваются в ClickHouse, а не переносят исходные данные в Postgres. Для инженеров это полезный архитектурный приём: Postgres-протокол может стать универсальным интерфейсом к аналитическому движку, когда сторонний инструмент не поддерживает его напрямую.

Пруф: ClickHouse и QuintoAndar

#clickhouse #postgresql #federatedquery #datapipeline #realtimeanalytics #dataarchitecture #dataengineering

@data_engi
ClickHouse A universal interface: How QuintoAndar made ClickHouse plug-and-play with managed Postgres | ClickHouse QuintoAndar unified ~900 million monthly events in ClickHouse Cloud and used ClickHouse Managed Postgres to make that data accessible to Hightouch and any Postgres-compatible tool.
Post #1294 138
Более 100 компаний призвали готовиться к волне ИИ-атак

OpenAI, Anthropic, Google, Microsoft, AWS, Cloudflare, GitHub и другие компании подписали открытое письмо: в ближайшие месяцы ИИ может резко удешевить поиск уязвимостей и создание атак. Особенно уязвимы больницы, водоснабжение, местные органы власти и инфраструктура интернета.

Авторы предлагают заранее дать проверенным защитникам доступ к наиболее мощным моделям, автоматизировать поиск и исправление уязвимостей, обмениваться данными об угрозах и сделать действия ИИ-агентов отслеживаемыми.

Это не сообщение о конкретной атаке, а редкий совместный призыв конкурентов. Главная мысль: пока ИИ одинаково усиливает обе стороны, нужно использовать короткое преимущество защитников для устранения старых уязвимостей и технического долга.

Пруфы: открытое письмо, Reuters

#artificialintelligence #cybersecurity #criticalinfrastructure #aiagents #infosec
OpenAI A call for collective action on cyber defense Industry, government, and AI leaders call for collective action to strengthen cyber defenses and protect the critical infrastructure we all depend on.
Post #1293 150
Decathlon заменил еженедельное обучение прогноза одной настройкой раз в полгода

28 августа Decathlon показал продовую систему прогнозирования спроса на базе Chronos-2. Модель проверили на 101 временном срезе и примерно 25 тысячах товаров. Даже без обучения она сравнялась с прежним решением, которое переобучалось каждую неделю.

В проде Chronos-2 адаптируют через LoRA раз в шесть месяцев. Для 12-недельного прогноза ошибка WAPE снизилась на 11 процентных пунктов в Юго-Восточной Азии и на 15 пунктов в Латинской Америке.

Сам прогноз выполняется без GPU: один CPU-инстанс обрабатывает 7–15 тысяч временных рядов за 40–75 секунд. По расчёту команды, один еженедельный запуск стоит около $0,03.

Для тебя это показательный сценарий применения foundation-моделей за пределами текста. Предобученная модель может заменить отдельный обучающий конвейер для каждого региона, а редкая LoRA-настройка — еженедельное полное обучение. Но выбирать такую модель по общему лидерборду нельзя: Decathlon обнаружил, что некоторые лидеры тестов хуже работают именно на розничных данных.

Пруф: технический разбор AWS и Decathlon от 28 августа 2026 года

#timeseries #foundationmodels #forecasting #mlops #chronos #retailai

@data_engi
Amazon How Decathlon runs demand forecasting at scale with Chronos-2 | Amazon Web Services Decathlon, one of the world's largest sporting goods retailers, forecasts weekly demand for tens of thousands of products across multiple continents. Learn how they deployed Chronos-2 on AWS to improve forecast accuracy by 11-15 points while cutting operational…
Post #1292 146
OpenAI планирует отключить Cursor от своих моделей

После покупки Cursor компанией SpaceX OpenAI воспользовалась пунктом о смене владельца и предложила прекратить доступ к моделям 12 ноября. Будущие модели, включая Astra, в Cursor уже не появятся. Причина — OpenAI не уверена, что компании Илона Маска будут соблюдать условия использования.

Cursor продолжит работать со своими моделями, Grok, Claude и другими системами; Anthropic уже пообещала выделить сервису дополнительные вычислительные мощности.

История показывает слабое место инструментов, построенных поверх чужих моделей: ключевой поставщик может исчезнуть из продукта из-за сделки или контрактного спора. Для компаний это ещё один аргумент в пользу нескольких провайдеров, собственного маршрутизатора моделей и возможности быстрого переключения API.

Пруфы: OpenAI, Cursor, Reuters

#artificialintelligence #cursor #openai #aicoding #vendorlockin

@data_engi
OpenAI Our decision on Cursor following its acquisition by SpaceX Our decision to wind down our contract providing OpenAI models to Cursor following its acquisition by SpaceX.
Post #1291 143
Tencent открыла модель на 770 млрд параметров — и признала, что она слишком много думает 😨

28 августа компания выпустила Hy4 preview — открытую MoE‑модель для программирования, исследований, финансового анализа и создания игр.

Всего в ней 770 млрд параметров, но для каждого токена активируются только 49 млрд. Контекст — до миллиона токенов. Веса доступны в обычной и FP8‑версиях, а развернуть модель можно через vLLM или SGLang с OpenAI‑совместимым API.

Во внутреннем слепом тесте 163 эксперта оценивали ответы на 203 инженерные задачи. Hy4 preview немного опередила китайские GLM 5.3 и Kimi K3 — впрочем, это собственное исследование Tencent.

Есть и честное предупреждение: ранняя версия иногда слишком долго рассуждает и многократно перепроверяет собственный ответ. Кажется, ИИ уже перенял худшую привычку некоторых архитекторов.

Пруфы:
⏩Tencent
⏩модель и документация
⏩Reuters

#ai #opensource #llm #tencent #coding

@data_engi
Tencent Tencent Releases and Open-Sources Tencent Hy4 preview Tencent has released and open-sourced Tencent Hy4 preview, a next-generation large language model with 770B total parameters and 49B active parameters, and a context window exceeding 1M tokens.
Post #1290 138
PostgreSQL на S3 не читает S3 при каждом запросе

В архитектуре Lakebase Postgres от Neon данные хранятся в объектном хранилище, но сам PostgreSQL обращается сначала к RAM, затем к локальному NVMe и только после промаха — к отдельному серверу страниц.

Транзакция также не ждёт загрузки данных в S3. Она считается подтверждённой, когда кворум узлов сохраняет WAL. Серверы страниц позже восстанавливают из журнала нужные версии страниц и асинхронно отправляют их в объектное хранилище.

WAL становится источником истины, а копия базы — указателем на нужный LSN. Поэтому ветка терабайтной базы создаётся за секунды без копирования файлов, восстановление не зависит от размера данных, а исторический запрос выполняется через выбор прежней версии дерева страниц.

Для тебя это показательный способ разделить вычисления и хранение, не помещая медленный S3 в критический путь OLTP-запросов.

#postgresql #neon #lakebase #wal #objectstorage #databasearchitecture #dataengineering

@data_engi
Neon WAL + S3: Lakebase storage for the era of agents - Neon How treating WAL as the source of truth changes the way you work with Postgres (a deep dive)
Older posts →
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →