TGViewer
Channel Public Channel
AI Makes Me Hate

AI Makes Me Hate

@aimakesmehate

AI systems engineer и скептический практик, который проверяет и внедряет AI на реальных задачах разработки
Subscribers
564
Photos
78
Videos
10
Links
84
Recent Posts 20 shown
Post #204 234
Популярные скиллы и их адопшен

Сейчас я много работаю над харнессом и тп. И одна из главных задач это делать то, чем действительно будут пользоваться, а не складывать наработки в стол.

Это крутой опыт. Ты становишься продуктовым инженером для других инженеров. Твой продукт не спускают сверху как обязательный инструмент от платформенной команды. Его выбирают, только если он оказывается полезнее и удобнее альтернатив.

Я часто смотрю, кто и как активно пользуется нашими скиллами. В общей сумме у нас уже их 40. Кол-во не значит качество. Но пока у скиллов для BDUI самый высокий адопшен.

Чуть позже расскажу про самые полезные и популярные. Какие задачи они решают и почему прижились.
  • 🔥 2
Post #203 253

Forwarded from AI Projects (Vladimir Ivanov)

Яндекс выпустил AliceAI-Foundation-80B-A3B-Base, решив таки начать обучать модели от нуля. Это на деле серьёзный удар всей стратегии Сбера по продвижению GigaChat в «закрытые контуры», которая вся крутится вокруг утверждения в духе: злые враги наверняка при обучении модели заложили в LLM зловредного агента, он, получив сигнал врагов, проснётся и захватит власть в России через правительственные системы. Правда, почему-то в таких мантрах коллеги GigaChat использовали дистилляцию Gemini и ChatGPT, как я уже отмечал по работе Anthropic — дистилляция тоже скрыто передаёт предпочтения учителя, типа либеральных взглядов. Яндекс ранее использовал Qwen для инициализации весов. Получается, в рамках маркетинга Сбера, что правительственного ИИ-агента в России контролирует Трамп, то это лучше, чем Си Цзиньпин. Вот в этом я не уверен. Однако на многих чиновников «суверенное обучение» всё равно производило впечатление, и Яндекс решил разрушить вообще фундамент стратегии продвижения конкурента в госсектор. И надо сказать, что судя по бенчам и архитектуре, Яндексу это уже удалось.

Для начала Яндекс и Сбер стали копировать довольно передовые архитектуры китайцев на гибридах GPT и Delta State, благо что у китайцев всё открытое. Однако Яндекс стал копировать архитектуру Kimi K3 прямо с их Kimi Delta State, что значительно превосходит архитектуру Сбера. Это таки фронтир, который с Fable сражается на равных. Правда, для Яндекса и Сбера проблема в неожиданном асимметричном архитектурном ответе DeepSeek V4.1 Flash, который отказался от модного гибрида и вместо этого фактически переосмыслил понятие трансформера и предложил GPT, где половина слоёв нейросети формирует понимание контекста, а вторая половина совместно ими пользуется — Causal Encoder-Decoder (CED). Фактически CED в нише worker-агентов уже порвал всех на тряпки: в шлюзе Vercel, как я публиковал их статистику ранее, даже американцы более 50% инференса (вообще по всем моделям!) заказывают у DeepSeek. Иными словами, Яндекс и Сбер, побежав копировать «мейнстрим» китайцев, возможно, зашли в технологический тупик, если CED продолжит лидировать как архитектура во Flash-моделях.

Ну да ладно, забавнее совсем другое. Я стал сравнивать, какой же «Истинно Православный ИИ» лучше по бенчмаркам. Всё же даже Президенту России надо выбрать себе агента. Тут оказалось, что поскольку у Яндекса и Сбера не получается, чтобы бенчмарки были хороши везде, то они публикуют только те, где результаты нормальные. В результате получается анекдот, что бенчей много, а сравнить AliceAI-Foundation-80B-A3B-Base и GigaChat3.5-432B-A28B-Reasoning можно только по LiveCodeBench и IMO AnswerBench. Однако после этого русский ИИ-цирк стал ещё веселей.

Вообще-то Сбер раструбил на весь интернет, что у него там теперь взрослый Reinforcement Learning и даже CoT, теперь Reasoning даже есть. Яндекс опубликовал Base-модель, где только обучение по корпусу, классически для Base не ведётся SFT обычно и совсем не ведётся Reinforcement Learning. Однако базовая (!) модель Яндекса оказалась сильнее модели Сбера (на больших весах, с CoT, RL и дистилляцией из Gemini/ChatGPT) в математических задачах — IMO AnswerBench.

По качеству первичной генерации кода на Python модели практически равны в LiveCodeBench.

Давайте прямо скажем, это катастрофа для Сбербанка в госсекторе. Довольно хорошо видно, что GigaChat имеет настолько слабое RL-обучение, что даже не может перебить Base-модель у Yandex. Модель Яндекса меньше и требует меньше ресурса GPU (сразу же на гостендере убивает Сбер просто по цене оборудования). Аргумент Сбера, что у него «истинно православное обучение с нуля», уничтожен Яндексом, т.к. они тоже обучаются теперь с нуля.

На самом деле Грефу уже давно пора делать оргвыводы в команде GigaChat, если он не хочет, чтобы Яндекс его выдавил даже из госсектора. Безусловно, коллеги имеют право не согласится с моими выводами и написать в комментах это.

https://huggingface.co/yandex/AliceAI-Foundation-80B-A3B-Base
https://huggingface.co/ai-sage/GigaChat3.5-432B-A28B-Reasoning
  • ❤ 1
Post #202 503
На подлодке было много вопросов. После доклада мы еще на час остались на неофициальную часть. Уже без записи, где я старался честно отвечать на всякие вопросы.

Два главных: какие навыки обесцениваются и как теперь получать повышения?

1️⃣ Про навыки. На мой взгляд, дешевеет не инженерная экспертиза, а работа, которую раньше приходилось делать руками: писать типовой код, вспоминать десятки команд, собирать окружение по разрозненным инструкциям. Умение быстро все это проделать перестает быть таким сильным преимуществом.

Но понять, что нужно сделать, где агент ошибся и как доказать, что результат правильный, по-прежнему работа инженера.

Если ты не понимаешь нативную платформу, контракт и поведение виджета, агент может очень убедительно мигрировать его неправильно. Зеленый блилд тут не спасет.

Поэтому мой доклад не про "теперь можно ничего не знать". Он про то, как упаковать знания и опыт команды в инструменты, скиллы и проверки, чтобы не применять их каждый раз вручную.

2️⃣ Про повышения. Во первых, я не карьерный консультант. Да и те, кто в 90% себя ими называются, не работают в карьерной лестнице.

Но мне кажется, принцип почти не изменился. Раньше мы приходили с BDUI, кроссплатформой, модульностью и автоматизацией тестирования. Теперь тоже самое, но с AI. "я внедрил технологию/сжег токены/снейрослопил 100 фич" само по себе еще не объясняет, за что тебя повышать.

Сильнее обычно звучит другое. Команда быстрее начинает разработку, тратит меньше времени на повторяющуюся работу, выпускает изменения с меньшим количеством переделок.

И ты можешь показать, что изменилось и какой вклад в это внес.

Поэтому я бы начинал не с поиска применения AI, а с дорогой проблемы команды. Обсуждал с руководителем, какой результат действительно важен и как он связан с ожиданиями от следующего уровня. Это не гарантия повышения. Остаются бюджет, квоты, приоритеты и субъективность перформанс-ревью. Но появляется какой-то конкретный разговор.
  • 👍 10
Post #201 500
впервые закончил недельную подписку на 200$ за два дня просидев на астре в effort ultra + fast. Честно, чет пока ничего не заметил невероятного
Post #199 1.74K
  • 😁 4
  • 👍 1
Post #198 510
AI как экзокостюм разработчика: ссылки к докладу

АГЕНТЫ И HARNESS

Anthropic: Demystifying Evals for AI Agents - https://www.anthropic.com/engineering/demystifying-evals-for-ai-agents

Pi Agent Harness - https://github.com/earendil-works/pi

Agent Squad: оркестратор для iOS - https://github.com/2FastLabs/agent-squad


SKILLS И ПРОЦЕСС РАЗРАБОТКИ

Superpowers - https://github.com/obra/superpowers

Skill Conductor - https://github.com/smixs/skill-conductor

OpenAI: переосмысление skills и промптов для GPT-6 Astra - https://developers.openai.com/blog/rethinking-skills-and-prompts-for-gpt-6-astra


КОНТЕКСТ, ПАМЯТЬ И БАЗА ЗНАНИЙ

Cline - https://cline.bot/

Cline Memory Bank - https://docs.cline.bot/best-practices/memory-bank

Synozur: модель зрелости управления знаниями - https://www.synozur.com/models/knowledge-management-maturity-model

TOON: компактный формат структурированных данных - https://toonformat.dev/


ИНСТРУМЕНТЫ И ЭФФЕКТИВНОСТЬ

MCP vs CLI: сравнение расхода токенов - https://afrozeamjad.com/writing/mcp-vs-cli-token-benchmark/

Видео к теме «Почему агенты тормозят в больших кодовых базах?» - https://www.youtube.com/watch?v=LyjG7-lq8UE


ТЕСТИРОВАНИЕ И ПРОВЕРКА РЕЗУЛЬТАТА

Callstack Agent Device - https://github.com/callstack/agent-device

Google Artemis - https://github.com/google/artemis

Storybook: AI Best Practices - https://storybook.js.org/docs/ai/best-practices


КЕЙСЫ КОМПАНИЙ

Shopify: Back to Native - https://shopify.engineering/back-to-native

Публикация Яндекса из раздела «Экзо-команды на рынке» - https://t.me/yandex/5421

Microsoft .NET: кейс Doggie Bus - https://dotnet.microsoft.com/en-us/platform/customers/doggie-bus


КНИГИ И КАНАЛЫ

Материалы о детерминизме и AI - https://t.me/iosmmcresources/142

DX-Ray: сайт автора Claude Code for Developer Experience - https://dx-ray.com/
Anthropic Demystifying evals for AI agents
  • 🔥 7
  • 👍 1
Post #196 480
Post #195 509
Post #193 464

Forwarded from CodeCamp

OpenAI выпустила гайд по скиллам и промптам для GPT-6 Astra!

Astra стала самостоятельнее, поэтому старые огромные промпты и раздутые скиллы теперь могут только мешать. OpenAI советует убирать лишнее, давать документацию по необходимости и чётко описывать конечный результат.

Пользуемся 👌
  • 👍 4
  • ❤ 1
Post #191 2.45K
codex-subscription-guide.pdf5.6 MB
Все чаще вопросы "а как купить подписки если нет номера телефона/впн/карты и тп?".

Решил подсуетиться и собрал гайд на 30 слайдов и > 50 ссылок как пользоваться купить кодекс:
• виртуальные карты и покупки онлайн
• виртуальные телефоны и аренда
• оплата через мтс и банки
• покупка карт из узбекистана, казахстана, армении и тп с доставкой в квартиру
• где выгодней всего брать подписки
• рабочий VPN
• частые причины банов аккаунтов
• в чем отличие подписки App Store от других
• многое другое

Ставьте лайк и пишите в комменты чего не хватает
  • ❤ 9
Post #190 591
OpenAI отменили подписку за 200$... Как хорошо что я успел взять. Или это прогрев гоев?
  • 😁 5
  • ❤ 3
Post #189 573
AI Makes Me Hate ну все, теперь и тут легенда
продолжаю завоевывать ачивки
  • 😁 6
Post #188 331

Forwarded from iOS Makes Me Hate

Shopify возвращается с React Native обратно на натив из-за аи-агентов

уже пару лет были предсказания что кроссплатформа стала бессполезной из-за аи. Что писать код на обоих платформах стало проще с нормальным агентом и харнессом.

Вот и shopify делятся в статье почему отказываются от реакт нейтива и переходят обратно на натив:
1️⃣ два приложения больше не обязательно означает в два раза больше работы
2️⃣ они строят разработку вокруг агентов и думают об общих архитектурах, механизмах и тп
3️⃣ цитата "мы строим harness, внутри которого AI физически сложно протащить плохой код дальше"

Они проектируют приложение не только для пользователей и разработчиков, но и так, чтобы агент мог наблюдать систему, воздействовать на нее и самостоятельно проверять результат.

Че думаем? Ставьте лайк если топ новость 🖤

или пишите коммент почему утопия
Shopify Native is now the future of mobile at Shopify (2026) - Shopify Coding agents changed what it costs to build mobile apps twice. Here’s why Shopify is moving from React Native back to Swift and Kotlin.
  • ❤ 6
  • 👍 3
Post #187 445

Forwarded from Data, Stories and Languages

Как AI-агенты помогли мне взять серебро на Kaggle - и где они меня подвели

Недавно я, впервые за долгое время, поучаствовал в соревновании Kaggle - ROGII. Задача - geosteering: по гамма-каротажу и траектории понять, где буровое долото находится внутри геологического слоя. Мы заняли 93 место из 6000+ команд, серебро.

Главное отличие от прошлых соревнований: агенты написали практически весь мой код. Я выбирал направления и решал, чему верить; ChatGPT Deep Research искал статьи и подходы; Claude Code делал имплементацию, а ближе к концу я всё чаще переключался на Codex.

Работало весьма хорошо. Раньше bottleneck часто был в реализации идей, а теперь мог сказать "добавь эти пять фич и перезапусти тренировку" и получить результат. Агенты присылали апдейты по тренировке в Telegram; и через remote connection можно было направлять следующие шаги.

И иногда агенты неожиданно тупо ломались:

- Claude раз за разом пытался захардкодить три видимые тестовые скважины, хотя на сабмите Kaggle подменяет их скрытым датасетом. Пришлось заводить отдельное правило и заставлять проверять его каждый раз.
- Codex решил, что несколько сложных сэмплов "плохие", и выкинул их из OOF. Локально стало красивее, а при мерже с тимейтами выяснилось, что у меня не хватает строк.
- Claude любил запускать "быстрый дешёвый smoke run", после которого идея объявляется нерабочей, хотя эксперимент имел мало общего с тем, что я хотел.
- неправильные выводы записывались в память и влияли на следующие эксперименты, приходилось чистить руками.
- Opus 4.6 выполнял инструкции надёжнее, чем 4.8 и 5.0: дал пять задач - сделает пять, а более новые версии иногда брали одну-две и игнорировали остальное.

Главный вывод: агент оптимизирует ту метрику, которую видит. Приватный лидерборд он оптимизировать не может, поэтому работает через прокси - локальный CV, паблик, время выполнения или просто "выглядит ли задача сделанной". И очень способный агент может стать очень хорош в оптимизации чего-то, что слабо связано с тем, что тебе нужно.

Ещё показательно: победители переформулировали задачу - вместо построчной регрессии 2D alignment и декодирование связного пути через всю скважину. Агенты отлично искали итеративные улучшения имеющихся идей, но не могли придумать что-то принципиально новое.

Так что агенты не отменяют экспертизу. Они её усиливают: если ты в теме, то можешь проверить много идей; если просто просишь агентов работать за тебя - они уйдут в неправильном направлении быстрее, чем ты сам.

Блог
Medium
Ycombinator

#ai #kaggle
Andrey Lukyanenko How AI agents helped me win a Kaggle silver medal — and how they failed me A write-up of the ROGII Wellbore Geology Prediction competition: how I adopted an AI driven approach and got a silver medal.
  • ❤ 5
Post #186 508

Forwarded from Niykee Moore

  • 😁 7
  • 👍 1
Post #184 657
Зачем нужен харнесс если будут умные модели которые все заменят?

Все чаще встречаю такое заблуждение. Поэтому решил походить по самым мощным тяжеловесам яндекса и задать им вопрос. Самый лучший ответ дал @aostrikov_ai_agents

это просто разные вещи, дополняющие друг друга

сама модель - это очень неудобная штука. она не запоминает стейт, ты в неё можешь запулить большой запрос и получишь большой ответ. и все

а любой харнес делает так, что он постоянно вызывает модель и крутит вот эти самые агентские циклы. они все крутятся внутри харнесса. то есть, по сути, harness гибко управляет твоим контекстом, убирает оттуда лишнее, добавляет то, что нужно, держит все доступные скиллы и дает модели дотягиваться до других систем. и еще много всего делает, типа субагентов, памяти и прочего

то есть, типа, модель - это как мощный движок машины, а харнес - сама машина
  • ❤ 5
  • 👍 3
Post #183 664
  • 😁 10
Post #180 722
Начал считать калории с гпт

Говорю рост, вес, возраст и считаем примерный лимит калорий

Из прикольного он может дать совет по фото какое блюдо сколько по бжу. А также что из меню больше подходит
  • 😱 3
Older posts →

About this channel

How can I read @aimakesmehate without a Telegram account?
TGViewer shows the public web preview Telegram publishes for AI Makes Me Hate: recent posts, photos, videos and the subscriber count, with no app, login or account.
How many subscribers does AI Makes Me Hate have?
AI Makes Me Hate (@aimakesmehate) has 564 subscribers on Telegram, refreshed roughly every 30 minutes.
Does AI Makes Me Hate know I viewed it here?
No. Public channel previews carry no viewer identity, and TGViewer has no accounts or tracking of what you look up.
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →