TGViewer
Channel Public Channel
AI Makes Me Hate

AI Makes Me Hate

@aimakesmehate

AI systems engineer и скептический практик, который проверяет и внедряет AI на реальных задачах разработки
Subscribers
566
Photos
79
Videos
10
Links
86

Showing posts older than #112 · Back to latest

Older Posts 12 shown
Post #110 475
Post #109 403

Forwarded from Остриков пилит агентов

Помимо выбора совиньон блана, написал на выходных скилл по поиску небанальных статей про агентов из техноблогов больших компаний:

https://github.com/maddness/agent-research-radar


Пока дебажил, наткнулся на одну неплохую:

https://huggingface.co/blog/allenai/shippy-tech-blog

Ребята написали агента, который отвечает на вопросы по судам в морском пространстве Ганы: сколько в водах кораблей, кто где плавает, какие морские события сейчас идут и прочее.

Хорошая статья, которая в целом показывает на обзорном уровне все современные внутренности ai-агента.

- модель они взяли Opus 4.6, отлично

- харнесс взяли OpenClaw, тут уже можно начать душнить, но если так проще для первой версии - почему нет. В OpenClaw много лишнего, и если вам нужен легкий лаконичный агент, есть варианты лучше (zero, nano, pi)

- у агента более пяти внешних API для получения риалтайм данных, они написали скиллы внутри которых лежат cli. Самый верный способ - до этого пытались собирать запросы в api на лету, но был фон галлюцинаций. В итоге cli закрыли проблемы и упростили тестирование

- изоляцию они сделали на k8s, под каждого пользователя разворачиваются поды с агентом, получаем полную изоляцию. Это самая странная часть, особенно учитывая немаленький образ и ресурсы OpenClaw, тут кажется при большом количестве клиентов будет оверхед. Да и решения типа microVM слышал более легковесные. Плюс со стороны кажется такая изоляция им не нужна, если все покрыто клишками и модель не должна писать код, отключили бы нужные тулы у OpenClaw и всё

- по эвалам хорошо, расписали базовые кейсы, гоняют их в сендбоксе на реальных данных, проверяют использует ли модель тулы, оценивают через судью разные критерии от 0 до 1 с разными весами, получают итоговый скор. Дешево и сердито)

Годное легкое чтиво, минут за 20, уровень начальный-средний.

———
Если кто попробует и будет фидбэк по скилу, кидайте, поправлю
  • 👍 2
  • ❤ 1
Post #108 481

Forwarded from CodeCamp

«Моя текущая стратегия — не читать никакого кода, написанного агентами», — это слова не какого-то начинающего вайбкодера, а легендарного Дяди Боба.

Автор «Чистого кода» не проверяет работу ИИ. Он просто выстроил строгую систему проверок с тестами, метриками и ограничениями. Гуру верит, что плохой код не пройдет через это + даст буст в продуктивности.

Также Боб Мартин поделился своим инструментом для проверки качества Java проектов — забираем 👍
  • 👍 7
  • ❤ 4
  • 😁 1
Post #107 2.23K
🧑 Полезные скиллы для всего

На днях искал программу, чтобы почистить место на личном маке. Терабайт каждую неделю забивался кэшами и всяким хламом, а нормальную бесплатную апку почти не найдешь.

Я подумал у меня же есть клод... Попросил его написать скилл, который чистит комп. Пара минут и 300 гб улетели в мусорку.

Решил собрать подборку скиллов для всего:

1. Awesome Claude Skills. Дефолт подборка, но пока одна из лучших: дипресерчи, руткозы, анализ, обучение и организация. Очень много прикольных и удобных скиллов.

2. Deep Research Skill. Отдельный скилл для валидации и проверки булщита. Ну и классически 5 причин почему

3. Getting Things Done. Планирование задач и их выполнение. Ну и мой любимый суперпаурс с которым я дебажу и планирую таски любого вида.

4. Персональный репетитор. Очевидно, ии уже эффективно заменяет менторов без специфик образования. Поэтому зачем платить кучу бабок сомнительным спецам, если есть уже проверенные апки?

5. Чтение книг. Это отдельная моя любимая тема. Здесь много сочных тем:
• The Knowledge Guy. Превращает книги в скиллы и выжимает самое полезное
• Markdown to EPUB Claude Skill. Наоборот, превращает ваш хаос в упорядоченный справочник.
• readwise-skills. Полезный набор скиллов который помогает сделать чтение книг более методичным и системным.


Делитесь своими полезными скиллами
GitHub GitHub - ComposioHQ/awesome-claude-skills: A curated list of awesome Claude Skills, resources, and tools for customizing Claude… A curated list of awesome Claude Skills, resources, and tools for customizing Claude AI workflows - ComposioHQ/awesome-claude-skills
  • 👎 10
  • ❤ 6
  • 👍 3
  • 🤬 1
Post #106 542
Больше клоунов сюда теперь не поставите
  • 👎 33
  • 🤬 12
  • 😁 4
  • 😱 4
Post #105 501
из минусов конечно пока это нейрослопы. Бывает даже до абсурдного, когда кто-то общается через апи чатбота через клаудкода

получается такая переписка двух агентов за которыми сидят работяги
  • 🤡 24
  • 😁 3
  • 🥴 2
  • 🤣 2
  • 👎 1
Post #104 494
короче тут начинаю прям выстраивать свой собственный сетап. И аи не просто дает мне понимание новых технических скиллов, но и в целом смотреть на процесс производства по новому.

Например ищу скиллы для prd — где нужно оценить проработку задачи от продактов.
потом качаю mcp и скиллы для rnd. Например тот же superpowers который дает руткозы и крутые брейнштормы
и только потом настраиваю себе dev окружение, которое мне помогает сделать то, что я запланировал.

такой процесс помогает не только мне организоваться, но и находить общий диалог в общем флоу продактов, дизайнеров, тестеров и всех всех всех.
  • 🤡 23
  • 🤮 4
  • ❤ 2
  • 🔥 1
  • 🥴 1
Post #102 401

Forwarded from Yandex for Mobile

⏭ Как мы в Яндексе стремимся к AI-first-разработке

С вами Артур Василов, руководитель мобильной разработки в Яндекс Браузере. На Mobile Runtime я открывал трек, посвящённый AI, и поделился опытом команды: со второй половины 2025 года мы внедряем агентов, чтобы повысить эффективность разработки. В этом посте я расскажу, что у нас получилось и к чему мы стремимся сейчас.

🚺 Первой большой задачей было отучить разработчиков писать код руками

Было непросто. Прийти и обязать всех использовать агентов не получится, потому что это новые подходы, инструменты и огромное количество вопросов. Важно помнить, что скорость разработки не вырастет сразу. Из-за того, что во всём этом ещё нужно разобраться, в первое время она, напротив, станет ниже.

Вместо того чтобы директивно обязать всех перекатываться на AI, лучше создать среду для экспериментов и поощрять новаторство. Мотивируйте разработчиков и изучайте, как и когда они используют новые инструменты. Выберите метрики, которые вам важны, и растите их.

​​🟰 Роль руководителя здесь невероятно важна. Как минимум вам нужен новый чатик по работе с LLM! Коллеги будут делиться опытом и поддержкой, шерить знания, помогать с инструментами. Нужны общие демо и амбассадоры AI в командах. А ещё важно начинать с себя: если руководитель не пользуется инструментом и не заинтересован в нём, сложно ожидать энтузиазма от команды.

🚺 Когда все используют AI, инфраструктура готова к этому и команда создала свой банк скилов, появляется ощущение потолка

Разработка стала быстрее, но не в несколько раз, а на 10–30%. Возникает вопрос, как добиться значительного ускорения. Именно на этом этапе мы сейчас находимся и уже делаем успехи. Есть два варианта, как это сделать, и нужно использовать оба.

🚺 Автоматизация больших рутинных частей

Вот три примера таких процессов у нас:

🟠 LLM Merge. Каждый раз, когда Chromium обновляется, в нашем коде появляются конфликты, ошибки компиляции и падающие тесты. Раньше раз в месяц это исправляли разработчики. Сейчас мы автоматически чиним всё LLM’кой. Подробности есть на Хабре

🟠 Свифтизация. В Браузере была часть кода, которую давным-давно написали на Objective-C. Годами мы (во многом с помощью стажёров 😂) переводили её на Swift. С помощью LLM мы закрыли эту задачку за два месяца. Про это тоже писали на Хабре

🟠 Дежурство по релизу. AI сильно помогает при выкатке обновлений. Он может сделать анализ состояния релиза, починить баги и краши (сравнивая код прошлой и новой версий) и выполнить кучу других мелких задач

🚺 Автономная работа агентов

Часто буст перформанса AI упирается в пропускную способность оператора-человека. Поэтому нужно стремиться к тому, чтобы агенты работали автономно как можно дольше, не трогая людей.

Сделать это можно, предоставив AI скилы для работы с устройством и самостоятельной проверки задач. Дополнительно стоит присмотреться к мультиагентным системам и оркестрациям, когда одна LLM управляет командой других.

Немного другой подход — Autoresearch. Мы даём агенту сегмент кода и показываем, как посчитать метрику для его оценки. А потом просим улучшить её — и идём пить кофе 😀

📺 В докладе я больше рассказал о подготовке инфраструктуры AI и поделился некоторыми мыслями о пользе для бизнеса, которую несёт использование агентов. Посмотреть выступление можно на ютубе или в VK Видео.

🆖 Другие доклады с Mobile Runtime можно найти в плейлистах:

Трек AI — ютуб и VK Видео
Трек Not so AI — ютуб и VK Видео

Подписывайтесь:
💬 @Yandex4Mobile
📹 @YandexforMobile
  • 🤡 11
  • 🔥 2
Post #100 380

Forwarded from ai.dot(ufna, dev)

Внезапно, очень годные доки от Сбера про ИИшечку, с прицелом на корпорации. Буквально читать конечно не надо, и воды там тоже немеряно, но общий подход про генеративную разработку софта — красавцы, хорошо написали, это достойная компиляция текущих подходов с заделом на ближайшее будущее.

Кстати, "я знаю, но не могу доказать" — оно писалось активно клодом.

https://aipdlc.ru/
  • 🤡 10
  • 👍 1
Post #90 441

Forwarded from iOS Makes Me Hate

🌄 Результаты опроса "DevExp в эпоху AI"

Я долго доставал вас этим опросом. Пора отдавать. Ответили почти 60 человек. Скажете мало?

Скажу даже достаточно. Тема мутная, честного фидбэка по ней нет почти нигде. Одни продают AI-трансформацию, другие продают панику и fomo.

А тут люди сели и написали.

🌿 Что вылезло из ответов:

🟣Классика. Полезно там, где бойлерплейт, тесты, разбор чужой кодовой базы, рефакторинг.

🟣72% говорят, что скилы атрофируются. Это единственный ответ на "что стало хуже", набравший больше половины.

🟣Ревью перестроилось раньше, чем появились правила. У 71% ревью частично делает AI. Отдельные правила для AI-кода только у 29%. То есть AI пишет код и он же его проверяет, а рамок для этого нет.

🟣Почти половина мержила код, не прочитав его целиком. И параллельно 44% жалуются, что ревью стало узким местом. Это не два разных факта, это один: внимание кончилось раньше, чем задачи.

🟣Все громкие ошибки — не про генерацию. Дропнутая база прода, скрытые правки API с DDoS на раскатке, подмененные ключи подписок в большом коммите, затертые чужие правки при мердже. Ни один инцидент не про "модель тупая". Все — про то, что человек не посмотрел диф.

🟣 В дефиците не технологии. Чаще всего просили не модель поумнее, а легальный доступ и токены, командный пайплайн вместо личного, и понятные рамки роста "очень сильно размылись рамки „продуктивности“ и „хорошего разраба“".

Вывод одной строкой: узкое место переехало из написания в проверку. Писать стало дешево, читать — дороже.

❤️ Слайды выше. Спасибо всем, кто ответил это было очень полезно.
  • 👍 5
  • 👎 1
Older posts →
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →