TGViewer
Channel Public Channel
Agentic Engineer

Agentic Engineer

@data_engi

Data Engineering Technologies.
SQL, Python, Kafka, Spark, Pandas, Airflow, Clickhouse, Greenplum, Postgres, dbt, LLM, Agentic systems, AI, robots, drones etc.

Boost channel - https://t.me/boost/data_engi
Subscribers
686
Photos
457
Videos
131
Links
755

Showing posts older than #1222 · Back to latest

Older Posts 20 shown
Post #1221 154
👀 Pinot научился исправлять пакетные данные без Kafka

В Apache Pinot 1.5 механизм upsert появился у пакетных OFFLINE-таблиц. При повторении первичного ключа база сохраняет запись с наибольшим значением указанной колонки — например, временем обновления.

Теперь корректировки, поздние данные и повторную загрузку снимков можно выполнять через обычные файлы, не создавая потоковый контур только ради обновлений.

Ограничение: поддерживается лишь полная замена строки. Изменение первичного ключа или колонки сравнения требует полной пересборки таблицы.

#apachepinot #upsert #olap #batchprocessing #dataengineering #datapipelines

@data_engi
Apache Pinot™ Download | Apache Pinot™ Open-source distributed OLAP database for user-facing apps and AI agents. Query fresh streaming data with sub-second latency, high concurrency, and petabyte-scale performance.
Post #1220 150
🖼️ Apache Airflow 3.3.1 выкатили

Опубликован очередной патч-релиз Airflow 3.3. В нём нет большой революции — это набор исправлений и небольших улучшений стабильности после выхода 3.3.0.

Если ты уже работаешь на ветке 3.3, обновление стоит проверить в тестовом окружении. Для воспроизводимой установки используй constraints именно от версии 3.3.1, а не обычный "pip install" без фиксации зависимостей.

#airflow #apacheairflow #dataengineering #orchestration #python

@data_engi
Post #1219 154
vLLM утроила пропускную способность длинноконтекстных агентов

Команда vLLM показала Decode Context Parallelism: KV-кеш делится между GPU не по головам внимания, а по отрезкам контекста. Поэтому видеокартам не приходится хранить одинаковые копии длинной истории агента.

На одном сервере с 8×B200 и Kimi K2.6 производительность выросла с 1 863 до 6 091 токена/с на GPU. Тест использовал реальные агентные трассы с медианой около 67 тысяч токенов и хвостом до миллиона.

Если ты обслуживаешь много долгоживущих агентов, узким местом может быть не сама модель, а дублирование KV-кеша. В vLLM DCP включается одним параметром.

#ai #llm #vllm #inference #kvcache #gpu #agenticai

@data_engi
vllm.ai Efficient Decode Context Parallelism with vLLM for Long Context Workloads Decode Context Parallelism (DCP) in vLLM shards KV cache across GPUs by sequence dimension, enabling 3× higher throughput on long-context agentic workloads comp
Post #1218 153
Гуманоидные роботы устроили ажиотаж на бирже

IPO Unitree в Шанхае оказался переподписан розничными инвесторами более чем в 8000 раз. Компания привлекла около $900 млн, а её оценка превысила $9 млрд.

Unitree может стать первым китайским производителем гуманоидов на бирже. Похоже, роботы уже продают не только себя — они продают инвесторам надежду на следующую большую индустрию.

#robotics #humanoidrobots #physicalai #china

@data_engi
Post #1217 161
👉 Учёные предложили способ обучать роботов без разметки предпочтений

В свежем препринте RynnValue исследователи обучили модель оценки действий робота на временной дистанции до цели — без ручной разметки «хорошо/плохо». Модель использовала около 7 000 часов данных и 3 млн видеофрагментов; в их экспериментах успешность выполнения задач выросла с 52,5% до 72,5%.

Если результат подтвердится, обучение роботов станет дешевле: вместо ручной оценки каждой попытки можно использовать обычные временные метки видеозаписей. Пока это исследовательская работа, а не готовая промышленная технология.

#robotics #embodiedai #machinelearning #opensource

@data_engi
arXiv.org RynnValue: Scaling Robotic Value Foundation Models with Temporal Distance General-purpose reward models are increasingly the bottleneck for scaling robot learning, yet the recipe for learning value-related capabilities from large-scale heterogeneous corpora remains...
Post #1216 134
😳 Microsoft собрала локального агента из моделей на 14B и 9B

MagenticLite использует MagenticBrain на 14 млрд параметров для планирования, кода и вызова инструментов, а браузерные задачи передаёт специализированной Fara1.5-9B.

Система работает с браузером и локальными файлами, сама сжимает старый контекст и запускает действия в QEMU-песочнице. Перед входом в аккаунт, оплатой или необратимой операцией агент запрашивает подтверждение.

Для инженеров вывод простой: сильный агент — не обязательно одна огромная LLM. Узкие модели, правильное разделение задач и управление контекстом могут дать более дешёвую и контролируемую систему.

#ai #aiagents #smallmodels #computeruse #localai #architecture

@data_engi
Microsoft Research MagenticLite: An agentic experience optimized for small models MagenticLite is an agentic system for small models that works across the browser and local file system in a single workflow. It combines specialized models and orchestration to support efficient agentic performance on everyday tasks:
  • ❤‍🔥 2
Post #1215 130
😵‍💫 Redis Streams научился говорить: «Не обработал»

В Redis 8.8 появилась команда XNACK. Раньше потребитель мог либо подтвердить сообщение через XACK, либо оставить его зависшим в очереди pending, пока другой обработчик не дождётся тайм-аута и не заберёт его через XCLAIM.

Теперь сообщение можно сразу освободить для повторной обработки. Есть три режима: SILENT — попытка не засчитывается, FAIL — ошибка учитывается, FATAL — сообщение помечается как безнадёжное для отправки в dead-letter queue.

Для инженеров это быстрее восстанавливает поток при перегрузке обработчика, упрощает корректное завершение процессов и работу с повреждёнными событиями. Если потребитель аварийно завершится до вызова XNACK, прежний механизм тайм-аутов всё равно понадобится.

#redis #redisstreams #streamprocessing #messaging #dataengineering #reliability @data_engi
Redis Redis 8.8: New array data structure & open source features Redis 8.8 is now available in Open Source. Explore the new array data type, window counter rate limiter, streams NACK, and more performance-focused updates.
Post #1214 137
🤖 Продовых AI-агентов редко отпускают дальше десяти шагов

IBM изучила 20 реальных внедрений и опросила 306 разработчиков из 26 отраслей. Выяснилось, что 68% агентов выполняют не более десяти шагов до вмешательства человека.

При этом 70% команд используют готовые модели с промптами вместо дообучения, а 74% всё ещё оценивают качество в основном вручную. Главная проблема — не способности модели, а стабильность её поведения.

Если ты строишь агента для production, полезнее сначала ограничить цикл, продумать передачу человеку и автоматизировать проверки — а не усложнять оркестрацию.

Исследование IBM Research для ICML 2026

#ai #aiagents #production #llm #reliability #evaluation

@data_engi
IBM Research Characterizing Agents in Production for ICML 2026 Characterizing Agents in Production for ICML 2026 by Melissa Pan et al.
Post #1213 132
🐢 Spanner запускает PageRank над боевой базой без отдельного ETL

Google добавила в Spanner Graph управляемые алгоритмы центральности, поиска сообществ, сходства и кратчайших путей. Их можно вызывать прямо из GQL, а результаты записывать обратно в таблицы Spanner.

Тяжёлые вычисления выполняются на отдельных ресурсах Data Boost, поэтому PageRank или поиск мошеннических сообществ не забирают процессор у транзакционных запросов. По данным Google, движок обрабатывает графы с десятками миллиардов связей за минуты.

Для инженеров это возможность анализировать свежие рабочие данные без выгрузки в отдельный графовый или Spark-кластер и обратной загрузки результатов. Пока функция находится в preview и доступна только в редакциях Spanner Enterprise и Enterprise+.

#googlespanner #graphdatabase #gql #pagerank #dataengineering #frauddetection #distributedSystems

@data_engi
Google Cloud Blog Introducing Spanner Graph algorithms | Google Cloud Blog Native support for algorithms in Spanner Graph help to derive insights from graph data, without compromising on operational database performance.
  • ❤‍🔥 6
Post #1212 130
😎 Больше AI-агентов — не всегда лучше

Исследователи проверили 260 конфигураций на шести агентных бенчмарках. На задаче, которую легко распараллелить, несколько агентов дали прирост до 80,8%. Но в последовательном планировании они ухудшили результат до 70%.

Причина — координация съедает контекст и вычисления, а ошибки переходят между участниками. Особенно плохо работают команды без центрального проверяющего агента.

Если ты проектируешь агентную систему, сначала оцени делимость задачи и количество инструментов. Иногда один агент с общей памятью надёжнее целого «роя».

#ai #aiagents #multiagent #llm #architecture #research

@data_engi
arXiv.org Towards a Science of Scaling Agent Systems Agents, language model-based systems capable of reasoning, planning, and acting are widely adopted in real-world tasks, yet how their performance changes as these systems scale across key...
Post #1211 129
TiDB уплотняет журнал ещё до аварии

Обычный PITR восстанавливает снимок, а затем воспроизводит накопленные изменения как множество мелких записей через TiKV и Raft. После этого RocksDB ещё приходится разбирать образовавшийся долг по compaction.

В TiDB 8.5 журнал из объектного хранилища можно заранее и без участия рабочего кластера преобразовать в отсортированные SST-файлы. При восстановлении они загружаются блоками, а обычным способом воспроизводится только неуплотнённый хвост журнала.

Во внутреннем тесте на 4,2 ТиБ полное восстановление сократилось с 10 часов 13 минут до 35 минут. Для инженеров это снижает RTO без учащения тяжёлых полных резервных копий. Но снимки по-прежнему нужны, версии BR и TiDB должны совпадать, а локальное шифрование пока не поддерживается.

#tidb #pitr #backup #distributedsql #rocksdb #disasterrecovery #dataengineering

@data_engi
TiDB TiDB Log Compaction: Faster Point-in-Time Recovery TiDB log compaction turns PITR log backups into SST files for faster point-in-time recovery, cutting restore time on large clusters.
  • ❤‍🔥 1
Post #1210 156
Databricks раскладывает JSON по колонкам без фиксированной схемы

Databricks сделал общедоступными тип VARIANT и механизм Variant Shredding для таблиц Delta Lake и Iceberg.

Полуструктурированные данные остаются в одной VARIANT-колонке, но часто встречающиеся поля физически записываются отдельными колонками в Parquet. Запрос читает только нужные поля, лучше сжимает данные и может использовать статистику и пропуск файлов.

Для инженеров это компромисс между хранением сырого JSON и жёсткой схемой: новые поля можно принимать без миграции таблицы, а популярные — читать с производительностью обычных колонок. Цена — дополнительные затраты при записи; уже загруженные данные не преобразуются автоматически и требуют REORG TABLE ... SHRED VARIANT.

#databricks #deltalake #apacheiceberg #parquet #semistructureddata #dataengineering #lakehouse

@data_engi
Databricks Use variant shredding to optimize performance | Databricks on AWS Variant shredding on Databricks improves query performance on VARIANT columns by storing commonly occurring fields as separate Parquet columns, reducing I/O and improving compression.
  • ❤‍🔥 2
Post #1209 144
Hy3 почти не теряет качество при смене агентной обвязки

6 июля Tencent открыла веса Hy3 под Apache 2.0. Это MoE-модель на 295 млрд параметров, но на токен активируется только 21 млрд; контекст — 256K.

Малоизвестная деталь: по тестам Tencent, результат Hy3 на SWE-bench Verified менялся не более чем на 4% между CodeBuddy, Cline и KiloCode. Команда также доработала восстановление после ошибок tool calling и соблюдение формата ответа.

Если ты переносишь агента между фреймворками, такая устойчивость может сократить повторный тюнинг модели. Но цифры пока внутренние — проверь их на своих задачах и инструментах.

#llm #agents #opensource #moe #toolcalling

@data_engi
GitHub GitHub - Tencent-Hunyuan/Hy3: Hy3 (295B A21B), a leading reasoning and agent model in its size, with great cost efficiency. Hy3 (295B A21B), a leading reasoning and agent model in its size, with great cost efficiency. - Tencent-Hunyuan/Hy3
Post #1208 141
AWS вынесла запреты за пределы мышления агента

AWS показала трёхслойную архитектуру для кодовых агентов: Firecracker MicroVM для запуска кода, проверенные скиллы для инженерных правил и Cedar-политики для контроля каждого вызова инструмента.

В примере агент попытался развернуть приложение в production. Шлюз проверил аргументы вызова, запретил операцию и разрешил только staging.

Главное — решение принимает не LLM. Политика выполняется за пределами её контекста, поэтому уговорить агента промптом «забить на ограничения» недостаточно.

Для инженеров это правильная граница доверия: модель предлагает действие, а отдельный детерминированный слой решает, можно ли его выполнять.

#ai #aiagents #security #authorization #aws #cedar #agenticai

@data_engi
Amazon Secure code execution for AI agents with AWS Lambda MicroVMs | Amazon Web Services Development teams building serverless applications with AI coding agents face the question of how to let those agents generate and execute code without losing control over governance. Agent-generated code needs a secure environment to execute, isolated from…
Post #1207 148
Redpanda растянула один потоковый кластер на три Kubernetes

В Redpanda Operator 26.2 появился Stretch Cluster: единый Kafka-совместимый кластер можно распределить между несколькими Kubernetes-кластерами, регионами или ЦОДами.

Данные синхронно реплицируются через Raft. При отказе площадки выбираются новые лидеры, а клиентам не нужно менять адрес кластера или переносить смещения потребителей. Отдельную Raft-группу образуют даже операторы Kubernetes, чтобы управляющий слой не стал единой точкой отказа.

Для инженеров это автоматическое переключение с нулевой потерей подтверждённых записей вместо двух независимых кластеров и асинхронной репликации. Но нужны минимум три Kubernetes-кластера и Enterprise-лицензия; Tiered Storage и Iceberg-топики пока не поддерживаются.

#redpanda #kafka #kubernetes #streaming #raft #highavailability #dataengineering

@data_engi
Redpanda Documentation Deploy a Stretch Cluster on Kubernetes | Redpanda Streaming Deploy a Kafka-compatible stretch cluster with Redpanda across multiple Kubernetes clusters for multi-region high availability and automatic failover.
Post #1206 147
MCP перестал быть только про чтение данных

Британский AI Security Institute изучил 177 436 инструментов из публичных MCP-серверов.

За 16 месяцев доля использования action-тулов — тех, что изменяют файлы, отправляют письма, проводят транзакции или управляют устройствами, — выросла с 27% до 65%.

При этом 67% всех исследованных инструментов относятся к разработке ПО, а на них приходится 90% загрузок MCP-серверов.

Для инженеров вывод прямой: безопасность агента теперь определяется не только ответами модели. Тебе нужны авторизация каждого вызова, минимальные права и аудит именно на уровне инструментов.

Пруф — UK AI Security Institute

#ai #mcp #aiagents #security #toolcalling #agenticai #research

@data_engi
  • ❤‍🔥 2
Post #1205 136
Neon отключил защитный механизм PostgreSQL — и ускорил запись до 5 раз

Обычный PostgreSQL после checkpoint записывает в WAL полную 8-КБ страницу при её первом изменении. Это защищает от частично записанных страниц при сбое, но в интенсивных OLTP-нагрузках может увеличить WAL до 15 раз.

В Neon вычисления отделены от распределённого хранилища, поэтому риск повреждения локальной страницы отсутствует. Генерацию полных образов перенесли в storage-слой, а full_page_writes отключили во всех базах без перезапуска.

В тестах от 7 мая 2026 года объём WAL сократился на 94%, а пропускная способность записи выросла до 4,5–5 раз. Для инженеров это наглядный пример того, как разделение compute и storage позволяет убрать накладные расходы, обязательные для классической архитектуры PostgreSQL.

Источник: инженерный блог Neon

#postgresql #neon #wal #database #dataengineering #storage #performance

@data_engi
Neon Everyone gets faster writes: We turned off FPW's in Neon We've managed to give customers up to 5x performance increase on write-heavy workloads by disabling full-page writes, a Postgres durability safety feature that is made redundant by Neon's own storage engine.
Post #1204 129
AI-агенты добрались до проектирования электроники

Cadence представила AuraStack — агентную систему для разработки печатных плат и упаковки чипов.

Главный агент координирует специализированных агентов и обычные инженерные расчёты: размещение компонентов, трассировку, проверку нагрева, вибраций, механических напряжений и целостности сигналов.

У FORVIA HELLA размещение 300 компонентов, по данным компании, сократилось с четырёх дней до четырёх минут.

Для инженеров здесь важен сам подход: LLM не заменяет точные расчёты, а управляет проверяемыми симуляторами и объединяет их в замкнутый цикл проектирования.

Пруф — Cadence

#ai #aiagents #eda #electronics #pcb #semiconductors #engineering #agentic

@data_engi
Post #1203 138
У AI-агентов появился общий формат плагинов

Запущен открытый стандарт "Agent Plugins 1.0". Он описывает, как упаковать в один переносимый плагин:

⏩ инструкции и сценарии в виде Agent Skills;
⏩ локальные и удалённые MCP-серверы;
⏩ дополнительные настройки конкретных клиентов.

В корне лежит "plugin.json", навыки помещаются в "skills/", а подключения к MCP — в "mcp.json". Такой пакет можно загрузить в совместимый клиент без переписывания структуры под каждую платформу.

Формат уже поддерживают VS Code, Cursor, GitHub Copilot, ChatGPT, Codex и Kiro. Развивают стандарт представители Amazon, Cursor, Microsoft, OpenAI и Vercel.

По сути, MCP стандартизировал связь агента с инструментами, Agent Skills — инструкции для модели, а Agent Plugins теперь пытается стандартизировать их упаковку и перенос между клиентами.

Если экосистема договорится, разработчикам больше не придётся собирать один и тот же плагин отдельно для каждого AI-агента.

Пруфы:
🔘 описание стандарта
🔘спецификация на GitHub

#aiagents #mcp #agentskills #agentplugins #opensource

@data_engi
Agent Plugins A portable package format for reusable components that extend AI agents.
  • ❤‍🔥 2
Post #1202 138
Тайвань испытал рой беспилотных катеров

29 июля два катера SeaShark 600 и 800 впервые вместе выполнили автономную морскую миссию под управлением ИИ Hivemind от Shield AI.

Система сама разделила акваторию на зоны, проложила маршруты по данным радара, камер и AIS, обнаружила подозрительное судно и скоординировала действия обоих катеров, чтобы вытеснить его из района.

Оператор задал задачу — дальше катера сами распределяли роли и обменивались данными. Морской рой перестаёт быть красивой презентацией и превращается в рабочую схему наблюдения.

Пруфы:
🔘Shield AI
🔘Focus Taiwan

#ai #robotics #maritimeautonomy #swarmtechnology

@data_engi
Older posts →
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →