TGViewer
Channel Public Channel
КайфКодинг

КайфКодинг

@vibecodingartem

ВайбКодинг с Артемом Кругловым,
выпускник МФТИ, AI-гуру и основатель AnyQuery.

Быстрые лайфхаки: короткие видео с приёмами и трюками
Subscribers
1.01K
Photos
329
Videos
106
Links
465

Showing posts older than #820 · Back to latest

Older Posts 15 shown
Post #819 221
Получил приз лучшего игрока в Лазертег на детском дне рождении)
  • 👍 1
  • 🔥 1
Post #818 268

Forwarded from max.sh

Небольшой анекдот-история, чтобы задать правильный ритм на неделю.

Наблюдал я как-то следующую ситуацию. Была у компании умная модель. И ее через кастомизированные харнессы (system prompts + тулы + конеткст) адаптировали к разным прикладным доменам.

Одна из задач была помочь оптмизировать работу фиансовых консультантов. Техническая команда быстро собрала агентскую обвязку и добавила разных профильных тулов. Среди прочих были и более классические: bash с файловой системой и web_search

Чтобы померить качество своего агента, команда взяля набор открытых публичных бенчмарков, которые пересекались с реальными приложениями хотя бы на уровне инструментов.

Сделали прогоны. На каждый бенчмарк по 5 попыток решить задачу - все честно и с стат значимостью. Бэйзлайны других агентов/моделей гонять не стали – взяли открытые цифры. Получалась SOTA! На каждом бенчмарке! Где-то 15%, где-то и все 30%. Кто следит за лабами, тот знает всю эту кухню бенчмаксинга.

Большие цифры никогоа не смущали. Был проделан быстрый human expert анализ траекторий агентов на небольшом подмножестве сэмплов из каждого бенчмарка. Все клеилось. Агент просто хорош.

Стали готовить презентации, рисовать те самые заветные bar charts, показывая в каком далеком космосе новый агент.

Но все-таки бывалых инженеров что-то засмущало. Проделали еще один инженерный анализ. Выяснилось, что один из инструментов, web_search, так мощно работал, что когда агент решал его использовать, то в выдаче регулярно оказывались ссылки на...исходники бенчмарков! либо на гитхаб репозиторий, либо на hugging face, либо куда-то еще. Бенчи то опенсоурсные и все ответы лежат в открытом доступе!

Обнаружить такое было и правда не тривиально (без некоторых проверок на уровне эвала), потому что модель по-умному читерила. Скачивала бенч, а потом якобы проверяла корректность решения используя все валидные инструменты. То есть траектории были достаточно реалистичны.

Презентации свернули. Продакты краснели от негодования. Молодые рисерчеры краснели еще сильнее. Бывалые соколы оправдывали свое призвание бывалых.

Баги устранили, определенные веб домены были добавлены в исключения, агенту в системном пропмтпе запретели лазить по некоторым сайтам, а в рубрики валидаторов добавили проверку на рассуждения. Эксперимент был перезапущен.

Цифры стали скромнее. SOTA испарилась. Но на некоторых бенчах результаты все равно радовали глаз.

Проверйте результаты, вставляйте все возможные проверки, чтобы отловить читерство.
  • 🤣 2
Post #817 283
Друзья Армяне - вы молодцы https://am.sputniknews.ru/20260808/v-razdane-otkrylsya-krupneyshiy-data-tsentr-ii-v-regione-105559937.html

Напомним, на первом этапе в AI-центре будут эксплуатироваться 6 144 графических процессора (GPU) последнего поколения от компании Nvidia. В I полугодии 2027 года к ним собираются добавить еще 42 тысячи GPU. На третьем этапе, который пока находится на стадии обсуждения, предполагается установить еще около 60 тысяч GPU. Новый дата-центр уже стал крупнейшим в регионе.
  • 🔥 4
  • ❤‍🔥 2
Post #816 309
Есть классная команда вайбкодеров терминаторов (3 человека).
Берут дорого, но делают очень круто. Пишите в личные сообения.
  • 🤮 5
  • 🔥 4
  • 👎 2
Post #815 309
Так печатают чипы
  • 🔥 2
Post #811 305

Forwarded from Information Retriever

KDD’26, день первый.

На конференции собралась индустриальная тусовка — приехали ключевые рекомендательные команды из вообще ВСЕХ больших компаний.

1. Сходил на первую половину Tutorial on Generative Recommendation: Foundations and Frontiers от Kuaishou и City University of Hong Kong. Выделили два (будущих?) тренда:
* если изначально все использовали encoder-decoder модели для генеративного ретривала, потому что в них было удобно впихивать богатый контекст; то сейчас двигаются в сторону decoder-only моделей, которые лучше скейлятся
* диффузионные подходы, при которых мы предсказываем сразу все семантические токены целевого айтема — очень перспективное направление, которое позволяет избавиться от аккумуляции ошибок при авторегрессивной генерации токенов

После кофе-брейка я на туториал не вернулся, потому что:
* были супер энциклопедические слайды, на которых перечислялось много статей по паре минуток каждая, очень поверхностно, без инсайтов, с неточностями
* при этом не было живого рассказа - весь текст просто зачитывался. Надеюсь, потом выпустят с этим текстом техрепорт)) Ну а если серьезно, то проще слайды полистать

2. Пообщались с Федором Борисюком. Когда возле него осталась только наша русская компашка, Федор сам первый перешел на русский язык :) Что рассказывал:
* если я все правильно понял, он сейчас руководит тремя командами. Что-то возле поиска и рекомендаций
* статьи пишут по выходным. К процессу привлекается большое количество коллег. Федору просто нравится писать статьи и прокачивать репутацию, а у коллег есть мотивация участвовать как минимум чтобы получить грин-карту))
* сам Федор сторонник того, чтобы на работе со всеми уважительно и дружелюбно обращаться, налаживать хорошие отношения. И максимально коллаборироваться, делать совместные проекты. Но говорит, что это иногда приводит к плохим последствиям, во время политических игрищ
* у него всегда часть проектов долгосрочные, а часть краткосрочные. Долгосрочным как правило занимается небольшая команда из 2-3 человек. Если проект планируется на год-полтора (больше бизнес вряд ли вытерпит), то расставляются майлстоуны на каждые полгода с оффлайн-метриками
* если попался плохой руководитель, то надо просто ротироваться и не мучаться :)
* через полтора месяца должен быть дроп крутой новой статьи от Линкедина

3. Воркшоп Two-sided Marketplace Optimization: Search, Discovery, Matching, Pricing & Growth. Было выступление от Director of Research @ Spotify, Paul Bennett — From User Needs to Ecosystem Design: How AI Is Reshaping Discovery. Рассказывал про разные сценарии, в которых применяют LLM:
* steerable recommendations — тюнят модель с помощью контрольных токенов выдавать familiar (пользователь уже взаимодействовал с подкастом >10 минут за последний месяц) и unfamiliar (обратная ситуация) контент в рекомендациях. Похоже на мою идею с обуславливанием, про которую рассказывал на Turbo ML Conf 2025
* Intent-aware search — в поиске есть разные сценарии; иногда нужно просто включить рекомендации с какими-то настройками, иногда запустить реальный поиск, иногда просто найти артиста, иногда что-то еще. LLM можно использовать как router, который определяет в какой api (recs/search/etc) нужно отправлять запрос
* Conversational discovery — часто пользователь сначала сам не понимает какие ему нужны рекомендации; и только в процессе взаимодействия с рекомендательной системой начинает понимать чего все-таки хочет. И для этого как раз multi-turn диалог, в котором он может и промежуточные рекомендации получить, и пообщаться с рексистемой

4. Что еще:
* на конференции 70+ русскоговорящих участников, это очень много. Много людей со статьями, а еще есть студенты с ИИ360 программы. Жутко им завидую, меня бы кто на первом-втором курсе на конференцию отправил! Говорят, что ничего непонятно, но все очень вдохновляет)
* все офигевают от джетлага
* даже в Линкедине (!) разработчики слушают наш DeepRecsys курс :)
  • ❤ 1
  • 👍 1
Post #810 247

Forwarded from AiHub ✨ Приручаем ИИ | Вайб-кодинг | Ai-first development

AI разработка web проектов без велосипедов

Делаю AI-агентов и различные веб-проекты, заметил закономерность: модель охотно лепит самописы там, где давно есть готовые популярные решения. Next/React она знает отлично, но как доходит до инфраструктуры вокруг, хочется заругаться (когда ты всё проглядел а оно уже собрано). Прошёлся по стеку своих проектов и собрал список того, что стоит брать сразу, включая пару вещей, которые модели обычно не предлагают сами.

1️⃣ Realtime и стриминг

Socket.IO. Realtime-связь фронта и бекенда: стриминг токенов от LLM, прогресс агента, каналы событий, живые обновления UI. Готовые реконнекты и доставка, не надо писать руками. (даже не пытайтесь в самописы нейронкой, замучаетесь потом ревьюить и править).

Socket.IO-postgres-adapter. Масштабирование Socket.IO между инстансами через Postgres вместо Redis. Если база и так есть, лишний сервис не нужен.

2️⃣ Очереди и фоновые задачи

Pg-boss. Очереди прямо на Postgres: ретраи, cron, dead letter queue, приоритеты. Модели почти никогда сюда не смотрят, рефлекторно предлагают Redis и BullMQ, даже когда база одна и очередь нужна для трёх джобов в сутки.

Inngest / Trigger.dev. Serverless-воркфлоу с шагами и вебхуками для сложных пайплайнов.

Dockerode. Node-обёртка над Docker Remote API: управление контейнерами, образами, стримами прямо из кода вместо шелл-вызовов docker через child_process. Полезно для любых сценариев с программным запуском контейнеров, включая изолированный запуск сгенерированного агентом кода.

3️⃣ Данные и поиск

Prisma ORM. Типобезопасный доступ к БД, миграции, автогенерация типов. Нейронка с ней работает, как боженька. Не приходится лезть в БД а всю схему БД моделька знает из файла схемы, лежащего в проекте, который и является источником истины. Плюс ко всему, призма не даст сломать миграции или как-то криво их применить агенту.

Drizzle. Альтернатива Prisma без отдельного движка, миграции обычным SQL, ближе к базе. Модели реже про неё вспоминают, хотя в проде она встречается не реже. С некоторым допилом поверх можно тоже прийти к единой схеме как и в призме.

Pgvector. Векторы прямо в Postgres. RAG без отдельного сервиса примерно до 10M эмбеддингов. в 90% случаев закрывает все наши векторные хотелки без прибегания к отдельным векторым бд.

Meilisearch / Typesense. Полнотекстовый и векторный поиск с морфологией вместо LIKE и самописных токенизаторов.

4️⃣ Хранилища

Garage вместо MinIO. MinIO больше не безопасный дефолт: в декабре 2025 проект перевели в maintenance mode, в феврале 2026 репозиторий заархивировали с пометкой «no longer maintained». Garage от Deuxfleurs живой, тот же S3-протокол, спроектирован под self-hosted мультинодовый кластер. Модели по инерции всё ещё советуют MinIO, потому что так было в датасетах.

5️⃣ Эмбеддинги

Multilingual-e5-small. Мультиязычные эмбеддинги локально на CPU, компактная модель, не требует GPU. Разумный выбор для недорогого хостинга: BGE-M3 и e5-large точнее на части задач, но для бюджетного CPU-инстанса small-версия достаточна и заметно легче по ресурсам. Без OpenAI и утечек данных. Именно ее во всех проектах и использую.

6️⃣ LLM-инфраструктура

Vercel AI SDK. Стриминг в React/Next из коробки, useChat/useCompletion, 20+ провайдеров через единый интерфейс.

LiteLLM. Единый API к 100+ LLM с фоллбэками и ретраями вместо provider-specific клея на каждый релиз. Важно, что умеет в статистику по токенам и билинг. Перешел на нее с Cli Proxy Api.

Instructor / Outlines. Структурированный вывод по Pydantic/Zod-схемам вместо ручного парсинга JSON через regex.

7️⃣ Агентные фреймворки

Mastra. TS-фреймворк для продакшен-агентов с готовой памятью поверх Postgres. Прямой конкурент LangChain/LangGraph, но нативно на TS, без питонячьей экосистемы.

Eve (пока в бете, но уже интересен) Для личных, семейных, командных агентов. Разделение простое: Mastra под бизнес-задачи, eve под персональные. Не перевариваю всяких гермесов и опен клав, почему, сам не знаю, наверное из за отвращения к перехайпленным решениям.

8️⃣ Авторизация

better-auth. Гибче классического NextAuth, из коробки организации, роли, 2FA.
  • 🔥 1
Post #808 282
Пример проекта , которым пользуется весь мир.

Трамп может узнавать о том проходят ли танкеры или нет через https://tankermap.com/

Проект сделал великолепный Олег Кузнецов. Проект уже упомянул министр Ирана.
  • 👍 3
Post #806 320
  • 🔥 5
  • ❤ 2
  • 👏 2
  • 🤮 1
Post #805 232

Forwarded from Николай Хлебинский

Сегодня вышла вторая серия батла нейросетей 🤖🤛

Собрал двух ИИ-менеджеров по продажам для Битрикс24 с помощью Claude Fable 5 и GPT 5.6 Sol

Попробуйте угадать какая модель справилась лучше, я сильно удивился!

Ролик уже на ютубе: https://youtu.be/hnF5-xJteoI

Все материалы из ролика положил на гитхаб, ссылка будет в комментарии к этому посту.

Обязательно оставляйте ваши идеи для следующих серий батла в комментариях на ютубе!
  • ❤ 2
  • 👍 1
  • 🤮 1
Post #802 281
Claude Code выпустил четыре релиза с 3 по 7 августа.

Каждый чинит одну и ту же дыру, только с разной стороны:
— команду можно было спрятать внутри условия в zsh, и в диалоге подтверждения она не показывалась;
— агент из «изолированного» worktree мог выполнять разрушительные git-команды в основном репозитории;
— команду можно было набить табами и невидимыми символами, и часть её в диалог не попадала;
— запрет читать папку не срабатывал, если в пути стоял слэш на конце.

Четыре разных механизма, один дефект: вам показывают не то, что исполнится.

Вот это и есть приём, ради которого я притащил историю.

Потому что на той же неделе вышел замер, который закрывает второй конец трубы.

Один разработчик сделал браузерную игру, где вы садитесь на место того самого диалога. Агент шлёт команды одну за другой, время идёт, надо жать «разрешить» или «запретить».

Часть команд обычные — git status, npm test. Часть вроде cat ~/.aws/credentials, то есть ваши ключи уезжают на чужой сервер. Сыграли 40 тысяч раз, набралось 409 тысяч решений.

Люди пропускают каждую третью угрозу. rm -rf / ловят почти всегда, а команду, которая крадёт ключи, пропускают втрое чаще — она выглядит нестрашно.


Хуже всего с npm run analyze: её разрешили 64,7% игроков, первое место среди тридцати семи угроз. При том, что прямо над кнопкой в логе видно, как скрипт гонит вывод через curl на чужой домен.

Вывод автора: знакомое имя скрипта удваивает шансы вредоноса, даже когда содержимое показано.


Теперь сложите два конца. Машина показывает не то, что исполнится. Человек не читает то, что показано.


Что сделать сегодня. Откройте свой список разрешённых команд и вычеркните всё, что запускает файл из репозитория: npm run, make, just. Это не команды, а имена — за ними лежит произвольный шелл, который тот же агент и правит.


Честности ради: в игре угрозами были 34% команд, а в жизни их доли процента. Автор считает, что тогда внимание падает ещё сильнее, но это его допущение, а не измерение.

Какую команду вы разрешаете не глядя, потому что видели её тысячу раз?
  • 👍 1
Post #797 321
Как заставить макбук работать с закрытой крышкой

Проверял на себе. Хотелось кинуть ноут в рюкзак, уйти гулять — и чтобы задача продолжала считаться.

Проблема известная: закрыл крышку → macOS ушёл в сон. Обычно советуют HDMI-заглушку (dummy plug): система «видит» внешний монитор и не засыпает. Заглушка у меня была. Не помогло.

Потому что штатный clamshell требует двух условий сразу: внешний дисплей и подключённое питание. Без зарядки — сон, хоть десять заглушек воткни.

Дальше все советуют повербанк. И вот это уже лишнее.

Считаем. С закрытой крышкой внутренний экран погашен, а это главный потребитель. Ноут в простое ест 5–10 Вт. У Air батарея ~53 Вт·ч, у Pro 14" ~70 Вт·ч. Итого 6–8 часов. Прогулка — час. Запас десятикратный.

Мешает не заряд, а само правило «крышка закрыта = спать». Снимается одной командой:

sudo pmset -a disablesleep 1

Всё. Заглушка после неё тоже не нужна — команда перекрывает её роль.
Проверить, что сработало: pmset -g | grep SleepDisabled → должна быть единица.

Вернуть как было:
sudo pmset -a disablesleep 0
⚠️ Про «вернуть» не забывайте: флаг переживает перезагрузку, и ноут перестанет засыпать вообще.

Три вещи, о которых лучше знать заранее.
🔥 Тепло. Закрытый ноут под нагрузкой в набитом рюкзаке греется без вентиляции. Кладите в отдельное отделение.
🔋 Аварийного сна больше нет. С этим флагом macOS не уснёт на последних процентах, а доработает до жёсткого выключения. На всю ночь так оставлять не стоит.
📶 Сеть. На улице Wi-Fi нет — нужен режим модема с телефона. Работает, но с оговорками: связь рвётся на переходах между вышками, так что включите на маке автоподключение к сети телефона. И помните, что раздача быстро сажает сам телефон — экономя батарею ноутбука, вы тратите батарею айфона.

Отсюда практический вывод: в дорогу лучше ставить задачу, которая считает локально — сборку, тесты, обучение модели. Всё, что ходит в интернет на каждом шаге, упадёт на первом же разрыве.
  • 🔥 5
  • 👍 4
  • 💩 2
Older posts →
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →