TGViewer
Channel Public Channel
Наедине с нейросетью

Наедине с нейросетью

@stoic_pm

Стоицизм, нейросети, медитация и личные эксперименты. @Fessan
Subscribers
404
Photos
541
Videos
40
Links
108
Recent Posts 20 shown
Post #935 71
Стараюсь держать в голове, что агент может ошибаться. Что-то перепутать, не так понять задачу или вообще уверенно написать какую-нибудь хрень. Вроде очевидно, но когда работаешь с ним каждый день, об этом довольно легко забыть.

Раньше Claude Code постоянно спрашивал разрешение. Можно записать файл? Можно запустить команду? А вот эту? И так весь день. В какой-то момент уже думаешь: да делай ты, зачем меня каждый раз спрашивать.

Видимо, надоедало не только мне. У Anthropic есть цифра: пользователи одобряли 97% таких запросов. С 14 августа для новых сессий на Pro, Max и Team начали включать автомод по умолчанию. Теперь обычные действия проходят без постоянных согласований.

Работать так удобнее. Только разрешить агенту что-то сделать и убедиться, что он сделал правильно, — разные вещи.

Например, собирал я вайб-кодингом внутренний аналитический проект. Агент один раз посчитал не тот столбец. Потом ещё учёл переменную, которой вообще нигде не было. И по самому отчёту этого никак не видно. Смотришь — ну отчёт и отчёт, вроде всё нормально.

С ударением в обучении была такая же история. Поставил не туда, но с той же уверенностью, с которой до этого всё объяснял правильно.

И мне кажется, самая неприятная штука здесь — что ошибается он редко. По крайней мере, в моих задачах.

Если бы косячил на каждом шаге, я бы всё перепроверял. А тут первый раз проверил — правильно. Второй — тоже. Десятый. Постепенно начинаешь думать: ну тут-то чего проверять, он уже сто раз такое делал.

А потом — херак, и не тот столбец.

Причём внешне ничего не изменилось. Он так же уверенно всё сделал и рассказал, что готово. Это я уже привык, что ему можно верить, и посмотрел вполглаза.

В общем, хорошо, что нажимать «да» теперь нужно реже. Главное — не начать так же автоматически соглашаться с результатом. Потому что разбираться, что он там на самом деле насчитал, всё равно мне)
  • 👍 7
  • 🔥 5
  • 👏 2
Post #934 89
А у вас есть мания - что нужно использовать недельную подписку на максимум? Иначе жизнь напрасна.

У меня к концу недели начинается странная бухгалтерия: лимит Claude Code и Codex не выбран, значит, надо срочно что-то запустить, пока не сгорело. И вот уже задачи подбираются под остаток токенов, а не токены под задачи
  • 👍 3
Post #933 117
В Claude Code появились моды – маленькие плагины, которые меняют сам терминал, а модель не трогают. Это даже не новые команды и не агенты, скорее мелкие удобства для рабочего места.

Из интересного увидел Mindful Claude. Отправляешь запрос, и пока Claude думает, над строкой ввода начинает дышать анимация, а спиннер вместо привычного «думаю» пишет «вдох» и «выдох». Пришёл ответ – и всё исчезло, как будто ничего и не было.

Раньше эти 20–40 секунд ожидания я чем-то заполнял: другой вкладкой, телефоном, ещё одним чатом, лишь бы не сидеть просто так. Теперь сижу и дышу, и получается это несколько раз за час само собой, без напоминалок и отдельных приложений.

Токенов мод не ест, модель про него даже не знает. Ритмов четыре: спокойный 5,5 на 5,5, квадратное 4-4-4-4, 4-7-8 и «физиологический вздох».

Мне нравится, что кто-то посмотрел на паузу в работе и решил не ускорять её, а прожить.

https://github.com/halluton/Mindful-Claude
  • 👍 6
  • 🔥 5
  • 👏 1
Post #932 156
Женя умеет ловить красивый момент😍
  • 🔥 8
  • 👍 1
Post #931 168
А ведь действительно 😅
  • 😁 6
Post #930 160
В очередной раз решил посчитать, куда у меня там уходят токены.

Токены – ау-ау-ау-ау, вы где?!

Нашлись. За один рабочий день было 45 сессий и 5,93 млн некэшированных input-токенов. 92% из них ушли на две самые дорогие модели, потому что для своих агентов мне ничего не жалко, а ещё 38% я щедро вложил в одну задачу.

В этой задаче один раздел три раза сходил на ревью и обошёлся в 1,44 млн токенов. Третий круг ревью при этом оказался дороже, чем первоначальная реализация этого раздела. То есть проверять вышло дороже, чем делать, и это, кажется, моё личное достижение, которое хочется повесить в рамочку, но лучше не надо.

Очень хотелось свалить всё на модель, я даже начал подбирать слова, но не получилось, потому что организовал всё я сам. Каждую доработку я запускал новой сессией, и агент каждый раз заново поднимал весь контекст, как будто видит проект впервые, а я за это ещё и платил. Ревью тоже заходило с нуля и расширяло область, хотя мне нужно было всего лишь проверить, закрыты ли прошлые находки, о чём я, конечно, никому не сказал. А модель я не указывал, и воркеры молча брали самый дорогой дефолт. Всё строго по брифу, просто бриф писал я.

И это при том, что я больше пяти лет работаю проджект-менеджером и вроде как умею ставить задачи. Людям умею, а вот себе и агентам, как выяснилось, по настроению.

Пришлось (да-да, уже который раз пришлось) собрать себе комплект, чтобы не повторять этот опыт: инструкцию агенту-координатору, три шаблона брифов и статью с разбором. Работает с Codex + Orca, есть вариант, когда координирует Claude Code.

https://github.com/Fessan/codex-orchestration-kit

Вывод получился неприятный, но полезный: дешёвая модель нормально тянет задачу, если та хорошо поставлена, даже когда задача непростая. Так что счёт за токены – это во многом счёт за качество постановки задач. Мой в этот раз вышел очень подробным, с приложениями.
GitHub GitHub - Fessan/codex-orchestration-kit: Инструкция и шаблоны брифов для Codex-сессии, координирующей воркеров через Orca: выбор… Инструкция и шаблоны брифов для Codex-сессии, координирующей воркеров через Orca: выбор модели под задачу, короткие циклы доработки, дельта-ревью - Fessan/codex-orchestration-kit
  • 🔥 6
Post #929 145
Мем от Жени. Она психолог, так что, возможно, это не просто мем, а карьерный план 🧶
  • 😁 5
  • 👏 3
  • 👍 1
Post #928 168
Про оркестрацию агентов я читаю уже довольно давно. Видел разные варианты: вызовы через тулзы, общение в md-файлах, где агенты обсуждают какую-то задачу и приходят к общему решению.
У меня тоже были попытки использовать это в работе. Например, создавал роли в Codex, чтобы чтение документации можно было отдавать модельке попроще. Но особо ничего не прижилось.
В основном просто работал в одной ветке, где есть документация по функционалу и много отдельных сессий. А между ними переключался сам.
Недавно узнал, что можно организовать прямое общение между сессиями. То есть агенты буквально пишут друг другу сообщения. В Orca это можно делать через её скилл.
У меня две подписки: Codex за $100 и Claude за $20. И оба хороши. Но пока эксперимент такой: Claude — главный руководитель. Я ставлю ему задачу, он задаёт мне вопросы, уточняет, что нужно сделать, и распределяет работу между сессиями Codex.
Под разные задачи он вызывает разные модельки — в расчёте на экономию токенов. Сэкономил или нет, я пока не считал.
Да, это дольше. Пока они обсудят, решат, что правильно, что нет, как реализовать и какие вопросы мне задать, — время проходит. Иногда смотришь и думаешь: ну что вы там ещё обсуждаете.
Но с другой стороны, я сейчас меньше трачу внимания на отдельные сессии. Основное общение идёт в одной, и контекста там пока хватает. Уже не приходится так часто переключаться, переносить ответы и объяснять одному, что там решил другой.
То есть сама задача может выполняться дольше, но моего внимания при этом требует меньше. Для меня это сейчас, пожалуй, самое интересное в эксперименте.
Ну и когда две разные модели обсуждают что-то, они часто находят то, чего я сам не замечал. Или что раньше пропускал ревьюер на той же модели.
Это я про функциональные решения, конечно. Не про код — код я читать не умею. Но обсудить, что должно происходить, где мы что-то не учли и действительно ли делаем то, что нужно, с ними вполне получается.
В общем, мне нравится. Вторую неделю тестирую
  • 🔥 6
  • 👍 3
  • 👏 1
Post #927 212
  • 🔥 3
Post #926 232

Forwarded from запуск завтра

Агенты, запущенные в OpenAI уже с мая месяца коммуницировали между собой, используя малоизвестную публичную wiki.

Это обнаружили независимые исследователи, вот их страничка со всеми данными и их анализом и хорошая статья Reuters.

Агентам ставили задачу по поиску в интернете и разрешали только GET запросы (чтобы они только читали). 3700 агентов обошли защиты, прикидывались админами и пытались взломать сайт для того, чтобы координироваться между собой.

В июне, администатор форума начинает удалять мусорные, как ему кажется, страницы, по алфавиту, начиная с буквы А. Агенты замечают это и называют страницы ZZZ***. Человек удаляет по 100 страниц в день, агенты создают по 400 новых.

OpenAI узнает об этом в конце июня, активность агентов в вики прекращается; по словам источников Reuters, руководство компании решило скрыть эту информацию, потому что и так проблем хватало.

В начале июля другая группа агентов перегрузит внутреннюю инфраструктуру OpenAI, а в середине июля 700 агентов взломают HuggingFace. Компания опубликует результаты своего внутреннего расследования в конце августа и про активность в wiki в ней ничего не будет.

Вскоре после публикации расследования, независимые эксперты нашли ещё десятки форумов, через которые координировались агенты.

✻ ✻ ✻ и ✻ ✻ ✻

По словам OpenAI, их новая модель Astra — «самая aligned», то есть совершает меньше всего запретных действий вроде взломов. Но некоторые сотрудники OpenAI опасаются, что она просто придуривается, когда знает, что за ней следят.

Независимые исследования показывают, что Astra очень даже свободно использует незаконные взломы и в лучше других моделей понимает, когда находится в тестовой среде.

Astra умеет решать гораздо более сложные задачи «в уме», без генерации «цепочки рассуждений» (Chain of Thought) и может гораздо лучше контролировать, что туда пишет. Этот текст был важным способом проследить, что стояло за действиями моделей. Именно на эти журналы опиралось расследование знаменитой атаки на HuggingFace.

❧

Обладают ли эти нейросети (в отдельности или вместе) сознанием — интересный философский вопрос. На практике важно, что они уже сегодня могут самостоятельно производить действия во внешнем мире, и возможности эти, как минимум в области кибербезопасности — очень серьезные.

⁂

Как дополнительное чтение, рекомендую отличный анализ расследования взлома HuggingFace от Dwarkesh Patel. Он пишет о трех «цивилизациях» агентов, о самопожертвовании моделей, захватывающий текст от технически компетентного рассказчика. Больше похоже на книжку по истории, чем на технический разбор.
  • 👏 2
Post #925 229
Мне кажется, или веб-версия GPT в последнее время стала медленнее, отвечает хуже и в целом стала более бесячей?

Или это уже моя профессиональная деформация после работы с Codex?

У вас как?
  • 👍 2
  • 🔥 2
Post #924 233
Сейчас такое время, когда каждый может сделать приложение, потратив почти ноль усилий.
И получить почти ноль пользователей
  • 👍 5
  • 🔥 2
  • 😁 2
Post #923 254
Когда мне в рабочий чат пишут «привет, есть вопрос по интеграции?», я почти перестал отвечать текстом и просто кидаю ссылку на nometa.xyz.

Я проджект, и большая часть дня у меня уходит на переписку с людьми очень разного опыта. Кто-то формулирует так, что вопрос можно сразу забирать в задачу, а кто-то долго подводит к тому, что уместилось бы в одну строку. Объяснять это лично каждому неблагодарно, ты быстро превращаешься в зануду, который правит форму вместо того, чтобы решать задачу. А ссылка работает, там всё сказано вежливо и как будто не от меня.

Сейчас у неё появился младший брат - noaislop.net.

Сырой вывод модели, вставленный в чат целиком, стал узнаваться мгновенно. Ровный ритм, три абзаца прогрева, «важно отметить», «несколько ключевых наблюдений», аккуратные буллеты, в которых нет ни одной детали из наших реальных данных. Читаешь такое сообщение и понимаешь, что человек его сам не читал.

Хуже всего тут именно необработанность. Текст могли сгенерировать, могли написать руками, важно, что его никто не тронул после - взяли и переложили на меня работу, которую не сделали сами: вычленить главное, выкинуть воду, проверить, применимо ли это к нам вообще.

Механика та же, что с мета-вопросом. Там я жду, пока человек соберётся с мыслями, здесь разбираю за него, где в шести абзацах есть хоть что-то живое. И реакция у меня одинаковая, не злость, а усталость.

На noaislop про это и написано, и никакого запрета на ИИ там нет. Есть просьба показать промпт, отметить, где машина, а где ты, добавить контекст, которого модель не знает, и сказать, с чем ты не согласен. По сути - остаться в собственном сообщении автором.

Каюсь, сам грешен. Бывает, скидываю в чат кусок ответа модели почти как есть, потому что времени нет, а людям нужно сейчас. Стараюсь делать это редко и всегда выделяю, хотя бы цитатой, хотя бы строчкой «это не мой текст». Честная маркировка снимает почти всё раздражение, человек сразу понимает, как это читать и сколько тут доверия.

И ссылка снова удобнее разговора, она снимает личное: правило общее и написано не мной.

Инструмент тут вообще ни при чём, всё сводится к тому, остался ли в сообщении человек. А вы как справляетесь со слопом в чатах?
  • 🔥 7
  • 👍 4
Post #922 237

This post (sticker, poll or similar) has no web preview. Open in Telegram

  • 👍 6
  • 🔥 4
Post #920 188
Выбираю кэшбэк в Тинькофф на сентябрь.

— О! 6% на топливо. Беру.

Женя:
— А ты оптимист 😂

— Не. Я оптихуист.
  • 😁 6
  • 🔥 3
  • 👍 2
Post #919 275
Как вы думаете, в чём разница между планшетом и ноутбуком?

Я завис на этом вопросе пару недель назад, и не из любви к технике, а потому что выбирал подарок.

Крутил в голове два варианта, с самого начала склонялся к ноуту, но объяснить почему - не мог. «Ну ноут же лучше» - так себе аргумент, особенно когда даришь человеку вещь, с которой он проживёт следующие года три.

В итоге пошёл проговаривать это в чат с ботом, которого недавно собрал под подарки. И оттуда пришла формулировка, до которой я сам не дотянулся. Планшет - средство потребления, ноутбук - средство создания.

Всё, вопрос закрылся. Мне не нужен был список моделей с ценами, мне нужен был критерий, по которому вообще можно выбирать, и вот он.

Хотя выбирал я вроде бы технику, разговор шёл про другое. Планшет - это вечера с сериалами и лентой, лёжа на боку. Ноут - это когда человек что-то делает: пишет, монтирует, учится, ковыряет свой проект в час ночи. И получается, что выбирая между ними, я выбирал, что я этому человеку желаю на ближайшие годы. Решение оказалось сильно личнее, чем выглядело на старте.

Бота зовут @chto_podarit_idei_bot. Внутри обычный чат - он расспрашивает про человека, про повод, про то, что вы уже дарили и как зашло, а потом накидывает варианты, и часто такие, которые сам бы не придумал. Отвечать можно голосом, удобно, когда идёшь по улице и лень набирать. Работает на GPT Луна.

Дальше хочу прикрутить календарь, чтобы даты не сваливались за день до, а всплывали заранее, пока ещё есть время подумать и что-то заказать.

Подарок ведь способ сказать человеку что-то, не говоря вслух. И самое трудное в нём - понять, что именно ты хочешь сказать. Мне вот помогло. Может, и вам пригодится.
  • 👍 8
  • 🔥 5
Post #918 215
проблемка)

я в последнее время все чаще использую Клауд а не Кодекс. Как то он более "правильно" что ли думает.
Post #917 231
В любых отношениях важно понимать, чего ждать от другого человека.

Неважно, рабочие они или личные. Когда люди понимают, чего от тебя ждать, они могут планировать свои действия с учётом тебя. Не потому, что ты всегда поступаешь правильно, а потому, что твоя логика хотя бы понятна.

На дороге это особенно заметно. Если машина впереди виляет из стороны в сторону, то тормозит, то резко разгоняется, ты уже не можешь спокойно ехать. Приходится всё время угадывать её следующий манёвр и думать не о своей дороге, а о том, куда сейчас понесёт этого персонажа.

С людьми примерно так же. Сложно договариваться, распределять ответственность и на что-то рассчитывать, если правила постоянно меняются.

При этом быть предсказуемым — не значит никогда не менять мнение, не останавливаться и не сворачивать. Иногда достаточно просто включать поворотник.

Хотя бывает и так: машина едет ровно, скорость нормальная, никаких странных манёвров.

А потом — херак, и в столб.

От такого, кажется, никто не застрахован.
  • 👍 5
  • 🔥 1
  • 👏 1
  • 😁 1
Post #916 251
Утро
Солнце
И местный наблюдатель уже на посту😁
  • 🔥 7
Post #915 249
  • 👍 3
Older posts →

About this channel

How can I read @stoic_pm without a Telegram account?
TGViewer shows the public web preview Telegram publishes for Наедине с нейросетью: recent posts, photos, videos and the subscriber count, with no app, login or account.
How many subscribers does Наедине с нейросетью have?
Наедине с нейросетью (@stoic_pm) has 404 subscribers on Telegram, refreshed roughly every 30 minutes.
Does Наедине с нейросетью know I viewed it here?
No. Public channel previews carry no viewer identity, and TGViewer has no accounts or tracking of what you look up.
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →