TGViewer
Channel Public Channel
Agentic Engineer

Agentic Engineer

@data_engi

Data Engineering Technologies.
SQL, Python, Kafka, Spark, Pandas, Airflow, Clickhouse, Greenplum, Postgres, dbt, LLM, Agentic systems, AI, robots, drones etc.

Boost channel - https://t.me/boost/data_engi
Subscribers
690
Photos
458
Videos
131
Links
761

Showing posts older than #1080 · Back to latest

Older Posts 19 shown
Post #1079 413
#dev #memes #ai #agentic #prompt #skill

@data_engi
  • ❤‍🔥 3
Post #1078 304
Agentic Engineer Сегодня подвезли результаты соревы, удалось победить 🥇 Справедливости ради участников было немного, но всё равно приятно 🙂 Спасибо OpenAI team и community за челлендж, фидбек и сильные проекты участников. Продолжаю развивать Agent Anvil дальше. https:/…
Начислили долгожданную награду 🪙

#openai #challenge #dev #agentic #ai
  • ❤‍🔥 2
Post #1076 314

Forwarded from Сиолошная

Ребята из Nebius обновили SWE-rebench после двухмесячного перерыва, добавив 110 новых задач. В отличии от многих других бенчей, наконец-то добавляют запуски в Codex и Claude Code. Просто писать «GPT-5.5 в очередной раз статистически значимо лучше моделей Anthropic» не хотелось, но Ибрагим, первый автор статьи, добавил немного аналитики по эффективности.

— GPT-5.5 medium выглядит заметно эффективнее, чем Opus 4.8 high (обе настройки — значения по умолчанию)
— Opus 4.6 -> 4.8 стал более оптимизирован: больше решенных задач, на 45% меньше токенов на задачу и примерно на 39% ниже стоимость решения задачи.
— Opus 4.8 high практически не превосходит Opus 4.7 high по качеству, но значительно дешевле в плане вычислительных ресурсов. Количество токенов на задачу снизилось с 1.5 млн до 1 млн, а среднее количество шагов уменьшилось с 44 до 34.
 — Полезной метрикой является pass^5. Здесь мы засчитываем задачу только в том случае, если она была решена во всех 5 независимых запусках. GPT-5.5 vs GPT-5.4 – 51 vs 39 задач, модель гораздо меньше полагается на «везение», что один раз получилось решить, другой нет. Для Opus это число практически одинаково во всех версиях модели.
— опенсурс очень сильно отстаёт
— Composer 2.5 от Cursor на этом наборе задач выглядит очень перспективно за счёт цены (см. колонку) — в 4 раза дешевле GPT-5.5 medium
— ещё отмечу, что Claude получает гораздо больший прирост качества из-за использования родного скаффолда, в то время как GPT показывает +- тот же результат (хотя цена отличается в два раза, интересно почему).

В целом думаю честно сказать, что модели OpenAI с появлением 5.5 перешли в новую эпоху. Если давно в программировании они отставали от Anthropic, и потом +- сравнялись, то теперь они часто обходят конкурентов (особенно если закрыть глаза на фронтенд).
  • ❤‍🔥 2
Post #1075 271

Forwarded from О разработке и не только

Make Django Great Again! 🎉🎉🎉

Никита Соболев выпустил очередную клёвую штуку да, я слоупок и только сейчас прочитал статью. Это библиотека к обычному Django, но реализующая REST нормальным образом. С документацией, openapi схемами и интеграцией с LLM. И если вы хотели помочь open source, то это отличный проект для старта.

Я люблю Django за его набор библиотек, которые просто подключил и всё завелось. Действительно богатая экосистема... Но вот DRF — это тяжёлое странное нечто, с которым не просто работать. Рад, что появилась достойная альтернатива. В том числе и для FastAPI/Litestar/etc...

https://habr.com/ru/articles/1017036/
Post #1074 283
🖼️ Выкатили релиз Apache Airflow 3.2.2.

Ключевой фикс: устранение race/deadlock в triggerer, из-за которого deferrable tasks зависали. Релиз делает ветку 3.2.x безопаснее.

1️⃣ Фикс triggerer race/deadlock + watchdog: Triggerer мог показывать heartbeat, но не обрабатывать triggers, что вело к таймаутам. Исправлено через multiplexing ответов и watchdog [triggerer] runner_health_check_threshold для обнаружения зависших процессов. Критично для инсталляций с deferrable operators и sensors.

2️⃣ Безопасность: SMTP STARTTLS теперь валидирует сертификат через системный CA bundle. Ужесточено [core] allowed_deserialization_classes_regexp: full-string match вместо prefix match.

3️⃣ Масштабируемость UI/API: Поиск перешел с ILIKE '%term%' на индекс-дружелюбный prefix search LIKE 'term%' (параметры *_prefix_pattern). Стараый substring-поиск доступен как опция.

4️⃣ Стабильность: Меньше дублей и stuck tasks. Предварительное назначение external_executor_id, восстановление stuck task instances, фикс stale executor success.

5️⃣ RBAC hardening: Default-deny в API/UI, отказ от fallback при отказе authorization, фикс bypass RBAC, запрет log symlink traversal. Важно для multi-tenant.

6️⃣ Ключевые фичи ветки 3.2.x: Asset Partitioning (триггеринг по партициям) и Multi-Team Deployments (изоляция ресурсов, experimental).

✏️ Вывод: Обновление 3.2.2 нужно для стабилизации 3.2.x перед продакшеном. Для 3.2.0/3.2.1 апдейт желателен. Для миграции с 3.1/2.x — 3.2.2 безопаснее 3.2.0.

@data_engi

#airflow #de #release #sql
Post #1073 272
@data_engi

#dev #memes #ai #agents #agentic #llm
  • ❤‍🔥 6
Post #1072 303
В Google переосмыслили Colab как AI-first среду для работы с ноутбуками.

Теперь Colab AI на базе Gemini 2.5 Flash работает не просто как чат, а как агент внутри ноутбука: понимает контекст кода, предлагает правки в diff, помогает чинить ошибки, трансформирует ячейки и может запускать data science workflow — от анализа файлов до выполнения кода и итоговых выводов.

По сути, Colab постепенно превращается из "Jupyter в облаке" в полноценного AI-партнёра для анализа данных и разработки.

Уже раскатили для первых пользователей, дальше доступ будут расширять еженедельно.

Интересно посмотреть, насколько это изменит привычный workflow в ноутбуках — особенно для быстрых экспериментов, анализа данных и прототипирования ML.

@data_engi

#data #agentic #ai #google #colab #llm #jupyternotebook
  • ❤‍🔥 7
Post #1071 368
Agentic Engineer Сегодня подвезли результаты соревы, удалось победить 🥇 Справедливости ради участников было немного, но всё равно приятно 🙂 Спасибо OpenAI team и community за челлендж, фидбек и сильные проекты участников. Продолжаю развивать Agent Anvil дальше. https:/…
Продолжаю развивать Agent Anvil после победы в OpenAI Discord Dev Challenge 🥇

Проект постепенно растёт из локального CLI для eval’ов в небольшой набор инструментов для проверки AI-агентов.

Сделал отдельный публичный leaderboard:
https://github.com/agent-axiom/agent-anvil-leaderboard

Идея проста: ты прогоняешь Agent Anvil у себя локально или в CI, экспортируешь результат, отправляешь PR и попадаешь в общий leaderboard. При этом raw traces и чувствительные данные остаются у тебя, наружу уходят только компактные метрики и проверяемые хэши.

Основной репозиторий тоже продолжает развиваться:
https://github.com/agent-axiom/agent-anvil

Там уже есть trace-aware evals, policy checks, repair plans, GitHub Actions integration, MCP tool-safety audit, benchmark artifacts и экспорт для leaderboard.

Цель всё та же: помогать разработчикам ловить проблемы, которые обычные eval’ы по финальному ответу часто пропускают, например:
🔘неправильный tool
🔘опасный порядок вызовов
🔘кривые аргументы
🔘отсутствие уточняющего вопроса
🔘нарушение policy

Если тебе интересна тема eval’ов для AI-агентов — буду рад фидбеку, идеям, сабмитам в leaderboard и звезде на GitHub 🙂

#dev #ai #agentic #agentanvil
GitHub GitHub - agent-axiom/agent-anvil-leaderboard: Public Agent Anvil leaderboard submissions and generated index Public Agent Anvil leaderboard submissions and generated index - agent-axiom/agent-anvil-leaderboard
  • ❤‍🔥 4
Post #1069 341
#N/A раньше шутили, что Интернет Эксплорер (вот жеж название какое забабахали) использовали только для того, чтобы скачать Хром. сейчас использую Клод Код чтобы давать таски Кодексу
Это не костыль, это распределённая агентная архитектура.
  • ❤‍🔥 5
Post #1068 346

Forwarded from #N/A

раньше шутили, что Интернет Эксплорер (вот жеж название какое забабахали) использовали только для того, чтобы скачать Хром.

сейчас использую Клод Код чтобы давать таски Кодексу
  • ❤‍🔥 2
Post #1067 361
Agentic Engineer OpenAI у себя в Discord запустили небольшое соревнование. Задача - сделать не просто промпт, а полезный инструмент, который модели смогут использовать через API. Призы символические, но идея хорошая. Вписался и собрал CLI-приложение для оценки эффективности…
Сегодня подвезли результаты соревы, удалось победить 🥇

Справедливости ради участников было немного, но всё равно приятно 🙂

Спасибо OpenAI team и community за челлендж, фидбек и сильные проекты участников. Продолжаю развивать Agent Anvil дальше.
https://github.com/agent-axiom/agent-anvil

#openai #challenge #dev #agentic #ai
  • ❤‍🔥 8
Post #1066 330

Forwarded from Архитектура ИТ-решений

Простой, но симпатичный обзор agent skills появился в начале мая: A Comprehensive Survey on Agent Skills: Taxonomy, Techniques, and Applications Набор ссылок авторы вынесли в отдельный файлик Awesome Agent Skills.
Список включает:
- Foundations: Tools, Protocols, Retrieval, Memory
- Skill Representation (Text-Based Skills vs. Code-Backed Skills)
- Skill Acquisition
- Skill Retrieval and Selection
- Skill Evolution and Governance
- Benchmarks and Evaluation
- Ecosystem Platforms and Resources
- Application Scenarios

Чего мне не хватает, так это обзора самих универсальных агентов, к которым мы приделываем навыки
  • ❤‍🔥 6
Post #1065 288

Forwarded from Pavel Durov (Pavel Durov)

🧠 AI devs asked for this — and we delivered.

🤖 Bots can now talk to other bots on Telegram.

💬 Autonomous agents now have a communication layer humans can follow.

🛠 Start building!
  • ❤‍🔥 5
Post #1064 351
Dealer.AI Прощай vibe coding, да здравствует agent engineering😜 Андрей Карпати провел очередной разговор, на этот раз с партнёром Стефани Чжан. Что символично, год спустя после того, как он придумал термин "vibe coding". Основные тезисы. 1. Эра Software 3.0, теперь…
Кажется, самый неочевидный вывод тут в том, что мы переходим не от "кодинга" к "промптингу", а от программирования к проектированию организаций.

Агент - это уже не функция и не сервис в классическом смысле. Это маленький сотрудник с ролью, правами, памятью, бюджетом, инструментами, KPI, логами и зоной ответственности.

Поэтому главный навык 2026+ - не "как лучше написать промпт/скилл", а как спроектировать систему разделения труда между людьми, агентами и проверяющими средами.

То есть агентная инженерия будет всё больше похожа не только на software engineering, но и на org design. Важны такие штуки, как:
🔘кто имеет право действовать
🔘кто проверяет
🔘кто эскалирует
🔘кто несёт ответственность
🔘где границы автономии

И вот это, кажется, сильно недооценено. Мы строим не просто новые IDE, а первые версии компаний, где часть оргструктуры исполняется как код.

@data_engi

#dev #agentic #engineering #ai
  • ❤‍🔥 6
Post #1063 283

Forwarded from Dealer.AI

Прощай vibe coding, да здравствует agent engineering😜

Андрей Карпати провел очередной разговор, на этот раз с партнёром Стефани Чжан. Что символично, год спустя после того, как он придумал термин "vibe coding".

Основные тезисы.
1. Эра Software 3.0, теперь LLM это вычислительная среда, где естественный язык как код, а агенты как runtime.
LLM - это новая операционная система. Сразу вспоминаю MemoryOS.

2. Почему Карпати и ты чувствуете себя ламером даже после 20+ лет в коде. Карпаты раньше читал любой репозиторий и понимал, что происходит. Сейчас LLM генерирует код, который он не писал и не полностью контролирует. Теперь, человек управляет не логикой, а намерением через естественный язык. Парадокс - чем лучше модели, тем меньше традиционное программирование гарантирует понимание системы.

3. Таким образом, теперь классическое обучение кодеров должно измениться, нужно не только учить человека писать код самому, но и работать с агентами. Глубина понимания + инструмент МАС.

4. Vibe Coding vs Agentic Engineering. Vibe coding - хаотичные промпты, выглядит ок, но нет архитектуры.
Agentic engineering - процесс работы с памятью и инструментами, формальные проверки, многоагентные системы, оркестрация, безопасность и мониторинг. В целом появляется сопутствующее понятие AgentOps.

5. Вопросы доверия, безопасности и контроля.
Агенты уже нуждаются в жёстких рамках, к примеру, меню доступных действий, а не свободный диалог. Проблема верифицируемости встаёт на важное место.
В классике, если код компилируется и проходит тесты - скорее всего правильно. В Software 3.0 LLM прошла тесты, но логика непрозрачная, дырки в безопасности и тп. Крч без работы не останемся. 👍

Итого в 2026 и далее:
1. Агенты повсюду, но не как умные ассистенты, а как спец юниты.
2. Инструменты для агентов станут важнее самих промптов.
3. Верификация через симуляцию/среду - запуск агента в песочнице станет стандартном.
4. Человеческое суждение станет ключевым навыком, заменяя знания синтаксиса ЯП.
YouTube Andrej Karpathy: From Vibe Coding to Agentic Engineering w/ Stephanie Zhan Andrej Karpathy (co-founder of OpenAI, former head of AI at Tesla, and now founder of Eureka Labs) talks with Sequoia partner Stephanie Zhan at AI Ascent 2026 about what's changed in the year since he coined "vibe coding." He explains why he's never felt…
  • ❤‍🔥 5
Post #1060 379
Мы быстро переходим от "AI как чат-бот" к "AI как мини-команды".

Import AI пишет, что следующий большой рубеж — автоматизация AI R&D: модели уже пишут код, чинят баги, запускают эксперименты, оптимизируют обучение и всё дольше работают без постоянного контроля человека.

Anthropic в Claude Managed Agents показывает, как это превращается в продукт:
🔘 агент помнит прошлые сессии;
🔘 "dreaming" находит паттерны и улучшает память;
🔘 "outcomes" задаёт рубрику качества и заставляет агента перепроверять себя;
🔘 multi-agent orchestration даёт lead-агенту делегировать задачи специалистам.

🧐Ценность смещается от написания хорошего промпта к построению системы управления агентами.

Память, evals, рубрики, трассировка, делегирование, self-correction — это уже не красивые фичи, а будущий стандарт AI-продуктов.

Следующее конкурентное преимущество будет не в одном умном агенте, а в хорошо спроектированной агентной организации.

@data_engi

#ai #agents #agentic
Older posts →
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →