TGViewer
Channel Public Channel
Agentic Engineer

Agentic Engineer

@data_engi

Data Engineering Technologies.
SQL, Python, Kafka, Spark, Pandas, Airflow, Clickhouse, Greenplum, Postgres, dbt, LLM, Agentic systems, AI, robots, drones etc.

Boost channel - https://t.me/boost/data_engi
Subscribers
687
Photos
456
Videos
131
Links
754

Showing posts older than #1242 · Back to latest

Older Posts 20 shown
Post #1241 113
В Китае роботы-полицейские выписали 170 000 предупреждений

В Ханчжоу 15 колёсных роботов T2 самостоятельно патрулируют перекрёстки. Они замечают езду без шлема, проезд на красный и другие нарушения, предупреждают людей и вызывают обычную полицию, если ситуация серьёзная.

По данным разработчика, с мая роботы выписали более 170 000 предупреждений, а число некоторых нарушений снизилось более чем на 40%. К концу года такие машины хотят запустить ещё в семи городах.

Правда, арестовывать нарушителей роботы пока не умеют. Зато уже умеют бесить их без участия человека.

#robotics #ai #smartcity #autonomoussystems

@data_engi
Post #1240 128
У Apache появился отдельный «горячий слой» для lakehouse

Apache Fluss стал самостоятельным проектом верхнего уровня ASF. Это потоковое хранилище, которое объединяет события, постоянно обновляемые таблицы и исторические данные lakehouse через единую табличную модель.

Fluss работает с Flink и Spark, а холодные данные может связывать с Iceberg, Paimon, Hudi и Lance. Проект вырос из инфраструктуры Alibaba и уже применялся в её основных контурах электронной коммерции.

Для инженеров это возможная альтернатива архитектуре, где Kafka, оперативные таблицы и озеро существуют как три отдельных слоя с собственными копиями данных и конвейерами синхронизации. Статус проекта Apache говорит о зрелости сообщества и управления, но не заменяет проверку технологии под конкретную нагрузку.

#apachefluss #lakehouse #streamingstorage #apacheflink #apachespark #dataengineering

@data_engi
The ASF Blog The Apache® Software Foundation Announces New Top-Level Projects - The ASF Blog Introducing Apache® Fluss, a lakehouse-native streaming storage for real-time analytics and AI, and Apache® Pony Mail, a web-based mail archive browser built to scale to millions of archived messages Wilmington, DE – August 6, 2026 – The Apache Software…
Post #1239 117
OpenAI совместила анализ цепочек запросов с нулевым хранением данных

19 августа OpenAI представила Private Safety Processing. Система ищет опасные закономерности сразу в нескольких запросах, но исходные данные остаются в инфраструктуре клиента либо шифруются его ключом. Сотрудники OpenAI не могут читать содержимое даже при срабатывании защиты — получают только ограниченный сигнал о типе риска.

Для тебя это важный архитектурный компромисс: долгие агентные сценарии можно контролировать целиком, не передавая провайдеру открытые запросы и ответы. Особенно полезно для финансовых, медицинских и корпоративных систем с жёсткими требованиями к данным.

Сейчас технологию проверяют первые клиенты. Технический документ и начало внедрения запланированы на сентябрь 2026 года.

#ai #privacy #aiagents #security #zerodataretention #openai

@data_engi
OpenAI Offering Zero Data Retention for frontier models OpenAI reaffirms Zero Data Retention for eligible API customers and previews Private Safety Processing for advanced AI safety without compromising data privacy.
Post #1238 125
Китайская робототехника пытается перейти от шоу к производству

На Всемирной конференции по робототехнике в Пекине показали более 3000 разработок. По данным китайского министерства промышленности, выручка крупных робототехнических компаний за первое полугодие достигла 165,5 млрд юаней — на 24,5% больше, чем годом ранее.

Теперь китайские компании будут оценивать не сальто гуманоидов, а их пользу на заводах, в логистике, медицине и сельском хозяйстве. China Daily

#artificialintelligence #semiconductors #robotics #datacenters

@data_engi
China Daily Robotics boom fueling nation's tech ambitions Beijing conference points to strengths, Unitree debut signals industry's hopes
Post #1237 139
Китайские роботы готовятся к «моменту ChatGPT»

Глава Unitree считает, что роботы в ближайшие 2–10 лет смогут выполнять широкий спектр задач в незнакомой среде по простым голосовым или текстовым командам. Китай уже поставил более 40 000 гуманоидных роботов за первое полугодие и занимает около 97% мирового рынка.

Пока это прогноз, а не готовая технология. Но индустрия явно переходит от эффектных демонстраций к гонке за универсальным роботом, который сможет работать без отдельного программирования под каждую задачу.

#robotics #humanoidrobots #physicalai #china

@data_engi
Post #1236 148
🏯 Как старейшая семейная фирма мира пережила 1428 лет — и не пережила кредитов

В 578 году японский принц Сётоку пригласил из корейского государства Пэкче трёх мастеров для строительства буддийского храма Ситэнно-дзи. Один из них, Конго Сигэмицу, остался в Осаке и положил начало династии храмовых плотников Конго.

Так появилась Kongō Gumi.

Разумеется, в VI веке это не была компания в современном юридическом смысле: акционерным обществом она стала лишь в 1955 году. Но семейная мастерская непрерывно передавала имя, знания и заказы из поколения в поколение. Сохранившаяся трёхметровая родословная прослеживает десятки её руководителей.

Главным заказчиком оставался Ситэнно-дзи. Храм горел во время войн, страдал от молний и тайфунов — а мастера Конго раз за разом его восстанавливали.

Фирма пережила падение сёгунатов, финансовый кризис 1927 года и государственную борьбу с буддизмом после реставрации Мэйдзи. В 1868 году храм лишился земель и возможности содержать своих плотников, поэтому Конго пришлось искать заказы по всей стране и осваивать обычное строительство.

В 1932 году положение стало настолько тяжёлым, что 37-й глава семьи Конго Харуйти покончил с собой у могил предков. Руководство приняла его вдова Ёсиэ — первая женщина во главе фирмы. Через два года тайфун разрушил пятиэтажную пагоду Ситэнно-дзи, и именно её мастерской поручили восстановление.

Во время Второй мировой войны храмовые заказы почти исчезли. Компания выжила, изготавливая деревянные ящики для армии. После войны она научилась сочетать традиционную древесину с железобетоном и занялась жилыми и служебными зданиями.

Но самая опасная перестройка началась в 1980-х. Фирма вкладывалась в недвижимость и расширяла обычное строительство. Затем японский пузырь лопнул, стоимость активов упала, храмовых заказов стало меньше, а конкуренция усилилась.

В 1999 году выручка Kongō Gumi достигала 13,055 миллиарда иен. К 2004-му она сократилась до 5,847 миллиарда, а проценты по долгам продолжали накапливаться.

В 2005 году фирму пришлось спасать строительной группе Takamatsu. В январе 2006-го храмовое дело, работников и мастеров передали новой компании с тем же именем. Старая организация превратилась в KJ Construction и 13 июля подала заявление о банкротстве. Её долг составлял около 4 миллиардов иен.

Независимое семейное предприятие закончилось после 1428 лет работы. Однако ремесло не исчезло: Kongō Gumi до сих пор строит и восстанавливает храмы как дочерняя компания Takamatsu.

Мастера умели заменять сгнившую балку так, чтобы храм простоял ещё столетие. С испорченным балансом пришлось поступить точно так же — удалить компанию, сохранив конструкцию.

Пруфы:
🔘официальная история Kongō Gumi
🔘отчёт Teikoku Databank о банкротстве и долге
🔘исследование семейного предприятия INSEAD
🔘разбор истории, преемственности и причин кризиса

#историябизнеса #япония #семейныйбизнес #конгогуми #экономическаяистория

@data_engi
www.kongogumi.co.jp 金剛組 | 西暦578年創業 世界最古の企業 社寺の新築・修復工事調査・見積り・ご相談無料
  • ❤‍🔥 6
Post #1235 202
👻AI-агенты перепроверили треть работ ICML 2026

Более 1200 участников с помощью Codex, Claude Code, Cursor и других агентов попытались воспроизвести 2226 научных работ — около 34% всей конференции. Код, результаты и трассы запусков публиковались открыто.

Только 266 работ удалось воспроизвести полностью. У 23% проверенных публикаций хотя бы один вывод был опровергнут или оспорен. Но и агенты ошибались: одна громкая «находка» оказалась обычным сравнением времени одной операции со временем пакета из 50.

Для тебя вывод практический: агент хорошо масштабирует проверку кода и экспериментов, но его вердикт тоже нужно перепроверять. Лучшие результаты получились там, где человек управлял направлением исследования и проверял спорные выводы.

Пруф: отчёт Hugging Face от 13 августа 2026 года

#aiagents #machinelearning #research #reproducibility #icml #aievals

@data_engi
huggingface.co What We Learned by Reproducing 2,200 papers from ICML We’re on a journey to advance and democratize artificial intelligence through open source and open science.
Post #1234 196
⭐️ В Spark меньше executors иногда означает быстрее и дешевле

AWS сравнила два кластера EMR Serverless с одинаковыми 192 vCPU: 6 крупных executors по 32 vCPU против 48 небольших по 4 vCPU.

На 126 запросах TPC-DS и TPC-H крупные workers с оптимизированными под shuffle дисками оказались в среднем на 29% быстрее и дешевле. Один executor получал данные только от 5 удалённых источников вместо 47 — меньше сетевой координации, удалённых чтений и spill на диск.

Для инженеров вывод неочевидный: при тяжёлых join, groupBy и repartition увеличение числа executors может мешать. Но для обычного I/O без большого shuffle множество небольших workers всё ещё способно дать больше параллелизма.

Источник: AWS Big Data Blog — 29 июля 2026 года

#apachespark #amazonemr #shuffle #dataengineering #distributedcomputing #performance

@data_engi
Amazon Accelerate Spark on EMR Serverless with larger workers and shuffle-optimized disks | Amazon Web Services Amazon EMR Serverless now supports a 32 vCPU / 244 GB worker configuration for the most demanding Spark jobs. Across 126 TPC-DS and TPC-H queries, larger workers delivered an average 29% faster query execution and 29% lower cost, with the biggest gains on…
Post #1233 182
😍 Iceberg-каталог теперь сам решает, какие файлы читать

Раньше каждый клиент Iceberg загружал списки манифестов и сами манифесты, а затем локально вычислял набор файлов для запроса. На больших таблицах это нагружало сеть и память драйвера Spark.

В Iceberg 1.11 REST-каталог может выполнить планирование на сервере и потоково вернуть только готовые задачи чтения. Механизм также охватывает инкрементальные запросы Structured Streaming и служебные таблицы history и snapshots.

Для инженеров это меньше метаданных на клиентах и возможность централизованно улучшать планирование без изменений в движках. Но REST-каталог и клиент должны поддерживать новый протокол.

#apacheiceberg #lakehouse #restcatalog #apachespark #structuredstreaming #dataengineering

@data_engi
  • ❤‍🔥 4
Post #1232 175
👩‍💻 ClickHouse перестал превращать колонки в строки по дороге к приложению

ClickHouse выпустил официальный драйвер ADBC — колоночную альтернативу JDBC и ODBC. Результаты запросов передаются сразу пакетами Apache Arrow: без промежуточного преобразования колонок в строки и обратной сборки для pandas, Polars или dbt Fusion.

Один драйвер на Rust работает через общую ADBC-прослойку в разных языках, включая Python, R, Ruby и C. Он также поддерживает потоковую загрузку Arrow-пакетов с постоянным потреблением памяти.

Для инженеров это меньше преобразований, копирования данных и отдельных драйверов. Но версия пока ранняя — 0.1.0; автоматическое создание таблиц, просмотр каталогов и полноценная передача JSON ещё не готовы.

#clickhouse #apachearrow #adbc #dataengineering #columnar #dbtfusion

@data_engi
Post #1231 292
⭐️ OpenAI вынесла обвязку AI-агентов из контекста модели

13 августа OpenAI представила Programmatic Tool Calling. Теперь GPT‑5.6 может написать JavaScript, который параллельно вызывает инструменты, фильтрует и объединяет их ответы в изолированном V8-рантайме. Промежуточные данные при этом не забивают контекст модели.

Тебе это пригодится в агентах, которые обрабатывают много документов, API-ответов или результатов поиска. Детерминированную работу выполняет код, а LLM получает уже компактные данные и занимается только тем, где действительно нужно рассуждение. В одном из производственных тестов такой подход сохранил качество и сократил расход входных токенов на 21%.

Пруфы:
🔘документация
🔘гайд OpenAI

#aiagents #llm #toolcalling #javascript #openai #agenticai
@data_engi
OpenAI Developers Programmatic Tool Calling | OpenAI API Configure Programmatic Tool Calling, control which tools programs can invoke, and resume programs after client-owned function calls.
  • ❤‍🔥 3
Post #1230 109
😵‍💫 Одна и та же модель стала почти втрое умнее благодаря обвязке

В тесте OpenAI GPT‑5.6 Sol набрала на ARC‑AGI‑3 всего 13,3% со стандартной архитектурой агента. После сохранения рассуждений между шагами и сжатия длинного контекста результат вырос до 38,3% — при этом выходных токенов потребовалось примерно в шесть раз меньше.

Для тебя вывод простой: качество агента определяется не только моделью. Грамотное управление памятью и контекстом может дать больший эффект, чем очередная замена LLM.

Пруф: технический разбор OpenAI от 13 августа 2026 года

#ai #aiagents #llm #contextmanagement #agentarchitecture #evaluation

@data_engi
OpenAI The builder’s guide to GPT‑5.6 Learn how startups use GPT-5.6 to build faster, more cost-efficient AI agents with smarter model selection and new Responses API capabilities.
Post #1229 125
🥺 Claude начнёт ставить водяные знаки на тексты

Anthropic объявила 14 августа, что будущие модели Claude будут незаметно маркировать ответы по всему миру. Никаких скрытых символов: модель оставляет статистический узор, выбирая слова с помощью секретного ключа. Дополнительные токены не расходуются.

Anthropic готовит API для проверки таких текстов. Но тебе нельзя считать его детектором истины: короткие фрагменты, код и слегка отредактированный человеком текст определяются плохо. Знак показывает лишь вероятность участия Claude, а не авторство конкретного человека.

Изменение вводят для выполнения требований закона ЕС об ИИ, но распространят сразу на весь мир.

Пруф: официальный разбор Anthropic от 14 августа 2026 года

#ai #claude #llm #watermarking #aigovernance #anthropic

@data_engi
Anthropic How Claude’s text watermark works Future Claude models will generate text that contains a watermark to comply with the EU AI Act. We answer questions about how it works and whether it affects outputs.
Post #1228 130
🦜 GPT‑5.6 Sol разогнали до 750 токенов в секунду

OpenAI показала режим Ultrafast: GPT‑5.6 Sol работает до 14 раз быстрее стандартного режима без замены на упрощённую модель. Ускорение обеспечивает инфраструктура Cerebras.
7
Для тебя это открывает новый класс приложений: голосовые агенты без долгих пауз, анализ логов во время инцидента и сложные цепочки инструментов в реальном времени.

Пока Ultrafast доступен только ограниченному числу клиентов — цены и сроки общего запуска не объявлены.

Пруф: официальный анонс OpenAI от 13 августа 2026 года

#ai #llm #openai #inference #cerebras #infrastructure
@data_engi
OpenAI Previewing Ultrafast mode: GPT-5.6 Sol at up to 14X the speed Preview Ultrafast, a new OpenAI API service tier that runs GPT-5.6 Sol up to 14× faster. Powered by Cerebras, it delivers up to 750 output tokens per second.
Post #1227 124
🍴 Milvus индексирует озеро без копирования данных

29 июля вышел Milvus 3.0 с внешними коллекциями. Векторная база оставляет исходные данные в Parquet, Lance, Iceberg или Vortex на объектном хранилище, но строит поверх них собственные векторные, полнотекстовые, JSON- и скалярные индексы.

Для инженеров это убирает вторую копию терабайтов эмбеддингов и ETL-конвейер для её синхронизации. При добавлении колонок Milvus может обновить только затронутые сегменты, не перестраивая всю коллекцию.

Ограничения: внешние коллекции доступны только для чтения, требуют Storage V3 и обновляются через отдельную операцию refresh.

#milvus #vectorsearch #lakehouse #apacheiceberg #parquet #dataengineering #zerocopy

@data_engi
milvus.io Release Notes | Milvus Documentation Milvus Release Notes | v3.0.x
Post #1226 131
👀 Storm применил TCP-логику к пакетам событий

В Apache Storm 3.0 размер пакетов между производителями и очередями может меняться по алгоритму AIMD — тому же принципу, который используется для управления перегрузкой в TCP.

При свободной очереди пакет постепенно растёт, повышая пропускную способность. При обратном давлении размер резко уменьшается, чтобы не усугублять перегрузку. Это снижает потребность вручную подбирать фиксированный размер пакета под каждый поток.

Функция включается параметром topology.producer.batch.dynamic. Для перехода на Storm 3.0 потребуется Java 25; ветка 2.x больше поддерживаться не будет.

#apachestorm #streamprocessing #backpressure #dataengineering #distributedcomputing #realtime

@data_engi
Apache Storm Apache Storm 3.0.0 Released Apache Storm is a free and open source distributed realtime computation system. Storm makes it easy to reliably process unbounded streams of data, doing for realtime processing what Hadoop did for batch processing.
Post #1225 134
⛔️ ByteDance готовит ИИ-модель на 10 триллионов параметров

Китайская ByteDance обучает модель, которая по масштабу может превзойти даже Anthropic Mythos с примерно 8 трлн параметров.

Модель пока находится на этапе предварительного обучения. Запуск не подтверждён, а размер сам по себе не гарантирует качества. Но гонка явно смещается от «умнее» к «огромнее».

#ai #llm #bytedance #china

@data_engi
  • ❤‍🔥 4
Post #1224 145
⭐️ StarRocks сам дробит «горячих» арендаторов

В StarRocks 4.1 появилась диапазонная раскладка данных. Каждый планшет хранит свой диапазон ключей, а система автоматически делит слишком крупные или перегруженные планшеты и объединяет остывшие.

Для многопользовательских платформ ключ можно начинать с tenant_id: активный клиент получит больше планшетов и вычислительных ресурсов, не создавая перекос для остальных. Переразметка схемы, изменение SQL и повторная загрузка данных не нужны.

Пока механизм работает только в архитектуре shared-data и отключён по умолчанию — его нужно включать параметром enable_range_distribution.

#starrocks #olap #multitenancy #datadistribution #scalability #dataengineering

@data_engi
docs.starrocks.io StarRocks version 4.1 | StarRocks StarRocks 4.1 release notes: multi-tenant range-based tablet auto-splitting, large-capacity tablet support (100 GB target), Fast Schema Evolution V2 for...
Post #1223 121
Учёные смоделировали рой из 100 000 ИИ-агентов

Исследователи представили IO Factory — симулятор информационных кампаний, где тысячи ИИ-агентов могут планировать действия, публиковать сообщения, отслеживать реакцию аудитории и менять тактику.

Это не реальная атака, а контролируемая модель для изучения угроз. Но сам масштаб впечатляет: информационные операции теперь можно анализировать как инженерную систему — с ролями, логами и измеримым эффектом.

Следующий вызов для AI-безопасности — не один чат-бот, а целые координированные рои.

arXiv, 11 августа 2026

#ai #agents #cybersecurity #informationwarfare

@data_engi
arXiv.org IO Factory: Simulating AI-Enabled Influence Campaigns at Scale We introduce IO Factory, an AI-driven framework for simulating information and influence campaigns as fully integrated, traceable processes. The threat of digital manipulation now extends beyond...
Post #1222 131
💡 Как премия за синий светодиод выросла в суде в миллион раз — а затем снова уменьшилась

Красные и зелёные светодиоды существовали десятилетиями. Но без синего нельзя было получить полноценный белый свет — основу современных ламп, экранов и многих оптических устройств.

Проблема казалась почти нерешаемой: кристаллы нитрида галлия получались слишком плохого качества.

В 1988 году инженер Сюдзи Накамура начал заниматься этой задачей в небольшой японской компании Nichia. Работодатель оплатил ему обучение в США и закупил оборудование, однако Накамуре пришлось самостоятельно переделывать установку для выращивания кристаллов. В 1990 году он создал двухпоточную систему подачи газов, позволявшую получать более качественные слои нитрида галлия.

Nichia оформила патент № 2628404 на себя, указав Накамуру изобретателем. Согласно внутренним правилам, ему заплатили 10 000 иен за подачу заявки и ещё 10 000 после выдачи патента.

Итого — 20 000 иен.

В 1993 году Nichia объявила о промышленном выпуске яркого синего светодиода. Это был результат не одного патента и не работы только Накамуры: параллельный прорыв совершили Исаму Акасаки и Хироси Амано из Нагойского университета. Но именно решения Накамуры помогли превратить сложную лабораторную технологию в массовый товар.

В 1999 году инженер ушёл из Nichia, а в августе 2001-го подал иск. Японский закон признавал патент компании, но требовал выплатить работнику «соразмерное вознаграждение» за служебное изобретение.

30 января 2004 года Токийский окружной суд постановил: вклад Накамуры стоил не меньше 60,4 миллиарда иен. Он требовал только 20 миллиардов, поэтому суд присудил именно эту сумму — ровно в миллион раз больше первоначальной премии.

Nichia обжаловала решение. Компания напоминала, что финансировала исследования, несла коммерческие риски, а успех обеспечивали почти две сотни патентов и работа целой организации.

До окончательного приговора дело не дошло. 11 января 2005 года стороны приняли мировое соглашение: 608,57 миллиона иен за все изобретения Накамуры плюс 235,34 миллиона процентов — около 843,9 миллиона иен. Накамура счёл сумму заниженной, Nichia — завышенной.

В 2014 году Накамура, Акасаки и Амано разделили Нобелевскую премию по физике. Так синий светодиод осветил весь мир — и заодно показал, насколько по-разному свет падает на изобретение, изобретателя и бухгалтерию.

Пруфы:
🔘решение Токийского окружного суда
🔘официальные условия мирового соглашения
🔘исследование служебных изобретений Гарвард-Еньчинского института
🔘Нобелевский комитет о синем светодиоде

#историятехники #япония #светодиоды #патентноеправо #историябизнеса

@data_engi
  • ❤‍🔥 2
Older posts →
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →