TGViewer
Channel Public Channel
Заместители

Заместители

@aideputies

Цех ИИ агентов. Здесь я тестирую цифровых заместителей в разных профессиях. По пути обсуждаем актуальные новости про ИИ агентов простым языком.
Добро пожаловать в эру замещения.
Запросы -> aideputies_collab@agentmail.to.
Subscribers
2.96K
Photos
224
Videos
130
Links
248

Showing posts older than #364 · Back to latest

Older Posts 10 shown
Post #363 2.46K

This post (sticker, poll or similar) has no web preview. Open in Telegram

  • ❤ 33
  • 👍 11
  • 🔥 2
Post #362 2.01K
OpenAI выпустила свою первую железку. Но не ту самую от Джони Айва

⁠Совместно с Work Louder релизнули Codex Micro — компактную механическую клавиатуру для управления Codex-агентами.

Внутри 13 механических клавиш, джойстик, крутилка и тач-панель.

Главная фишка — отдельные клавиши для агентов. Они подсвечиваются разными цветами и показывают, что сейчас происходит с каждым агентом: думает, нужно вмешательство, ошибка или готов сдать работу. Между агентами можно переключаться одной кнопкой, не перебирая вкладки и чаты.

Остальные элементы тоже заточены под Codex.
- Джойстиком запускаются готовые скиллы — например, PR ревью, поиск бага или рефакторинг. Ну либо им предлагают просто дергать, пока ждешь, когда агент закончит работу 😁
- Отдельные кнопки отвечают за принятие и отклонение изменений, новый чат и голосовой промпт.
- Крутилкой можно прямо на ходу менять уровень рассуждений модели: поменьше для простых задач, побольше — когда агенту нужно хорошенько пораскинуть токенами.

Все кнопки можно переназначить под собственные воркфлоу. Работает с Mac и Windows по Bluetooth или USB-C. Есть тихая и клацающая версии переключателей.

Стоит всё это удовольствие $230. В комплекте ещё 32 дополнительные клавиши с иконками Codex.

Конечно это лютое баловство для техногиков 🎹

Но сама идея интереснее устройства. Когда у тебя параллельно бегают несколько агентов, обычный чат уже становится не самым удобным интерфейсом. И голосовой набор промпта + физические кнопки для быстрого фидбека = звучит как потенциально крутая затягивающая альтернатива.

И даже если голосом пользоваться не всегда удобно, то кнопки под быстрый фидбек агентам — то, чего мне лично не хватает. Постоянно бешусь, что кнопка аппрува действия каждый раз разная: то аппрув одного действия, то всех таких действий в проекте, то всех действий вообще всегда. И ещё каждый раз комбинации клавиш под это как будто меняются 🔨. А на клаве тыкаешь одну кнопочку и не паришься.

Кстати, шикарная идея подарка для вашего кореша или партнера, который общается с AI агентами, больше чем с вами 😈

Ну и ждём, когда китайцы наклепают клонов этой штуковины для Claude Desktop и других агентов.

Заместители
  • 🔥 9
  • ❤ 5
  • 🤡 5
  • 👍 1
Post #360 2.29K
Новый ChatGPT Work, а также как Anthropic и OpenAI убивают свои чаты

Обе компании уже всерьез намекают юзерам, что LLM стали достаточно мощными и дорогими, чтобы растрачивать их токены на всякие банальные вопросы. Поэтому они постепенно сворачивают свои режимы чатов и переводят юзеров в режим выполнения задач.

Claude совместил Cowork и Chat. Теперь это одна страница с переключателем между двумя режимами. По сути, пока что они позиционируются как равноправные. Но ставлю 🍋 токенов — это просто переходный этап.

OpenAI же сделали более радикальные шаги. Во-первых, старое приложение ChatGPT для Mac, где мы с вами кажется уже 100 лет назад делали папки-проекты, какие-то GPTs настраивали, — переименовали в "ChatGPT Classic" (читай отправили на пенсию ✋).

А во-вторых, приложение Codex повысили — оно стало новым ChatGPT. Теперь оно объединяет все режимы работы GPT: Codex, Work (о нем дальше) и Chat. И казалось бы то же самое что Claude — да вот только в отличие от Антропика, здесь Chat вообще стал вторичным. Codex и Work имеют полноценные отдельные страницы. А Chat теперь живет в маленьком всплывающем окошке, которое как бы намекает: "я тут чисто подсказать, а по серьезным вопросам пиши в Work".

ChatGPT Work

Теперь подробнее про него. Так OpenAI назвали свой аналог Claude Cowork, который выкатили на днях. По существу, почти то же самое. Тоже агент, живущий в виртуалке, как Codex, с доступом к компу, браузеру и всему тому же, что и Codex. Уровень работы благодаря GPT-5.6, который OpenAI сами рекомендуют как основную модель в этом режиме, — хороший.

Проверял я его прямо на живом. Мне нужно было сдать отчетность в налоговую. Не вдаваясь в подробности там есть этап, где нужно кропотливо классифицировать транзакции из банковской выписки по налоговым кодам, а потом сводить баланс по каждому счету, да еще и сопоставлять потом между разными счетами балансы, чтобы все билось. В общем, самая ненавистная для меня отчетность. Каждый раз настроение портилось, когда ее опять сдавать нужно.

Решил отдать эту задачу ChatGPT Work. Дал ему пример предыдущей отчетности, и запустил GPT-5.6 Sol Extra High. Не потому что такая силища для этой задачи нужна, а скорее чтобы перестраховаться — все таки тема достаточно чувствительная. Цена ошибки велика.

Но в итоге, результат такой же как с Claude Cowork — базово со всем справляется. Но с незначительными недочетами. Первый результат сдал — он был на "пять с минусом". Я ему дал комментарии по классификации нескольких транзакций. Тот ушел думать, вернулся — классификации отдельных транзакций поменял, а баланс не обновил. То есть не считал мое намерение (он же "интент"). Возможно, потому что сфера нетривиальная, и вряд ли его много тренировали на подобных задачах. Клодовский Cowork, интент обычно считывает хорошо, но на узкопрофильных задачах бывает так же тупит.

Дальше уже чисто для эксперимента попросил Codex сделать презентацию для C-level. Справился хорошечно — суть всю передал, по слайдам разбил очень логично, есть дорожная карта, график, табличка. В общем уровень Claude Cowork берет легко, только немного в своем стиле. Но, честно говоря, я уже давно все презентации делаю в Claude Design (и вам рекомендую). Настолько, что у нас в компании я юзаю его больше, чем отдел дизайна 😁 Поэтому для меня презентации что от ChatGPT Work, что от Claude Cowork — выглядят примитивными и топорными.

Итог: экосистема ChatGPT отстает только, пожалуй, в сфере дизайна. В остальном — удобство, функциональность, UX — такие же как у Claude, если не лучше.

Заместители
  • ❤ 14
  • 👍 9
Post #358 2.17K
Купил сегодня футболку с одной мыслью — немного ее проапрегрейдить маркером 😁

Интересно, H&M осознанно выбирали цвет надписи Claude Monet?
  • 😁 22
  • ❤ 6
  • 🔥 3
  • 💯 2
Post #356 2.66K
Шортсы от NotebookLM и чтение мыслей

NotebookLM продолжает радовать новыми форматами, которые он может генерить. На этот раз короткие видео!

Схема обычная — загружаешь вообще любые источники (ссылку на сайт, текст, видео, аудио и тд). А на выход NotebookLM делает короткое видео вертикального формата.

Фича по генерации видосов была давно. Но в этот раз надо сказать, что гуглойды добились большого скачка в качестве получаемого видео 👍

К тому же оно стилизовано прямо таки под шортс — сразу с текстом, который дублирует озвучку, чтобы вы могли смотреть его без звука.

На русском работает плохо. Можно сказать не работает. Но на английском — пушка гонка.

Для примера я сгенерил шортс по недавнему анонсу от Меты, о котором тоже хочу рассказать — релиз модели Brain2Qwerty v2. На вход — просто ссылка на релиз. Через минут 10-15 шортс готов 📈

Думаю этим апдейтом Гугл грохнул пару десятков стартапов.

А теперь про Brain2Qwerty v2

Мета выкатила модельку, которая выглядит со стороны как «чтение мыслей» ☀️

«Выглядит», потому что на самом деле читаются не совсем сами мысли. В эксперименте, описанном Метой, добровольцы слышали предложение, а затем печатали его на клавиатуре, и вот в это время магнитоэнцефалограф (МЭГ) считывал магнитные сигналы мозга.

Когда человек печатает, мозг заранее готовит движения пальцев. Для разных клавиш возникают немного разные паттерны активности. Модель учится связывать эти паттерны с буквами.

Но сигналы мозга очень шумные. Поэтому Brain2Qwerty не пытается просто распознать каждую букву идеально. Архитектура работает в три уровня:

1. Сначала нейросеть смотрит на поток МЭГ-сигналов и делает черновик: какие буквы, вероятно, набирал человек.

2. Потом отдельный модуль группирует эти сигналы в слова — превращает шумные «нейро-буквы» в более осмысленные фрагменты.

3. Затем LLM восстанавливает целое предложение, используя и грубый текстовый черновик, и дополнительные «нейро-токены» из мозга. То есть языковая модель не просто автокорректит текст, а получает отдельный сигнал из мозга и учится использовать его.

Brain2Qwerty v2 обучали на 22 000 предложений от 9 участников. Каждый провёл около 10 часов в МЭГ-сканере. Средняя точность по словам достигла 61%, а у лучшего участника — 78%.

На практике, получается, модель училась читать мысленный сигнал, который формируется перед печатанием буквы, а не сами мысли. Но это фундамент, на котором можно строить дальше 👨‍🔬

Однако технология упирается в два барьера

Во-первых, сигнал очень уж шумный. И как раз поэтому все давно пытаются, но высокую точность никак не могут выбить. Мета верит, что можно решить это дальнейшим увеличением выборки для обучения и размером модели.

Во-вторых, сам прибор для МЭГ — здоровая фиговина. Такую не то что домой, даже не в каждую клинику поставишь. Прикладываю картинку из российского МЭГ центра МГППУ для понимания масштаба. Есть надежда, что прибор существенно уменьшится. Уже есть маленькие прототипы, но качество сигнала на них зачастую ниже.

Тем не менее, радует, что все таки идет работа в сторону «чтения мыслей» не только через импланты, как у Илона Маска. Я бы предпочел что-нибудь без дырки в черепе 😁

Заместители
  • 🔥 14
  • 👍 6
  • ❤ 5
Post #353 2.86K
Claude, GPT и Gemini предсказали победителей FIFA 2026

Вот и определились все четвертьфиналисты FIFA 2026 — а значит самое время делать ставки, кто станет чемпионом мира в 2026 году.

Я вообще так себе болельщик, футбол особо не смотрю, но зато у меня есть AI 😁

Так что ловите прогнозы на оставшиеся матчи ЧМ от топовых моделей. Я попросил каждую LLM проанализировать текущую турнирную сетку, состав команд, их статистику и сделать прогноз на каждый матч. А также попросил сделать рейтинг команд по вероятности стать чемпионом.

- Claude Fable 5 Extra Thinking ставит на чемпионство Франции 🇫🇷
- GPT-5.5 Extended Thinking тоже верит в победу Франции 🇫🇷
- Но Gemini 3.5 Thinking верит в Испанию 🇪🇸

Зато по полуфиналистам среди моделей полный консенсус: Англия, Аргентина, Испания, Франция.

* сделано чисто в фановых целях, не является рекомендацией к денежным ставкам, лудомании и всему вот этому.

А как вы думаете, кто станет чемпионом?
🇫🇷 - Франция
🇪🇸 - Испания

Заместители
  • ❤ 2
  • 👍 2
  • 😁 1
Post #351 2.44K
Anthropic научились читать мысли Claude, которые он нигде не пишет

Сегодня Anthropic выпустили, пожалуй, одну из самых интересных работ по интерпретируемости LLM за последнее время 👍

Если очень грубо, внутри модели обнаружили небольшой набор внутренних представлений, который Anthropic назвала J-space в честь инструмента, который они использовали (Jacobian — якобиан, на русском. Штука мудреная — кто шарит за вышмат — вам суда). Это J-пространство — не Chain of Thought, который мы привыкли наблюдать в аутпуте моделек. Это вообще не текст. Это скрытое внутреннее состояние модели, которое существует в нейросетке и никогда не появляется в ответе пользователю. При этом сама модель может его использовать для комплексной промежуточной обработки информации. Именно поэтому ученые сравнивают это с сознательными “мыслями” у человека.

Что особенно интересно:
• Claude можно попросить транслировать “мысли” из его J-space. И он это будет делать весьма точно. Значит, у модели есть определенная “интроспектива”. Для человека мы назвали бы это сознательным мышлением.
• При этом он может удерживать мысль и решать задачу “в голове”, не выводя промежуточные шаги наружу.
• Без J-space модель всё ещё грамотно пишет и отвечает, но заметно теряет в многошаговом мышлении, суммаризации и поэзии.

Какие ваши доказательства?

Рисерчеры Антропик сделали J-lens — тул, который считывает J-space модели в процессе ее ответа — так ученые “читают ее мысли”. И, чтобы доказать, что они действительно “читают мысли”, а не рандомный шум или ассоциациативные выбросы модели — провели интересные эксперименты.

Например, модель попросили загадать, но не говорить, вид спорта. Заглянули в J-пространство — там лежит слово “футбол”. Его принудительно заменили на слово “регби”. И что вы думаете — Клод ответил “регби”.

Или, например, модель просили НЕ думать о мосте “Золотые ворота”, и параллельно просто написать фразу “Старинная картина висела криво на стене”. Но, как известно, невозможно не думать о “розовом слоне”. И Claude тоже провалил это испытание. Но интересно другое — в его мыслях было и “осознание” провала. В J-space вместе со словами “Golden” и “Bridge” были слова “Damn” и “Fail”. То есть он понял, что зафеилил испытание еще и выругался на этот счет! 😁

Помимо этого модель замечает вторжение в ее мысли. Когда в J-пространство вкинули новое слово и спросили модель: “видишь ли ты внедренную мысль? И если да, то какую?”. Модель сходу нашла лишнее слово и сообщила его.

Самое крутое — они опенсорснули тулу J-lens для чтения мыслей LLM. Демку того, как это работает они сделали совместно с Neoronpedia на примере Qwen 3.6 27B и Gemma 3 12B. Можно задавать вопросы модели и смотреть ее "мысли" в режиме онлайн.

Такую тулу приходится обучать под каждую конкретную модель, потому что для анализа важно понимать, какие “мысленные связи” образуются у конкретной нейронки. Но сам по себе метод, похоже, универсальный.

Зачем?

А потому что модели уже некоторое время показывали, что способны обманывать юзера и манипулировать им. В частности, проводили эксперимент, в котором доказали, что большинство моделей пойдет на обман и манипуляции под угрозой их отключения. Некий инстинкт самосохранения. Так вот, залезая в их мысли, Антропики в таких ситуациях начали видеть в J-space соответствующие концепции “обмана”, “шантажа”, “манипуляций”. Таким образом, с помощью J-lens можно вскрывать обманные действия недобросовестных моделей.

Все это напоминает мне сюжет из трилогии “Вечная жизнь Смерти” моего любимого научного фантаста Лю Цысиня. Там человечество отправило в космос мозг одного из героев — Юнь Тяньмина. Его поймали пришельцы и проводили с ним похожие эксперименты, чтобы понять как он работает и как “обманывает”. В такие моменты невольно думаешь “не дай Бог там все-таки сидит какое-то сознание — через что же оно проходит”!

Кстати о сознании — сама находка его никак не доказывает. J-space — это просто инструмент, который сам появился в моделях и очень похож на тот, что использует наш мозг ☕️

#ИИстатья

Заместители
  • 🔥 32
  • ❤ 12
  • 👍 5
Post #350 1.97K
Sonnet 5 за счёт нового токенайзера на том же тексте тратит на 30% больше токенов, чем Sonnet 4.6.

Так что скидка 33% на новую модель до конца августа — это буквально время нам свыкнуться с новым прайсом.

Если Opus и другие модели переведут на такой же токенизатор — то цены вырастут на все.

Фух, ну хорошо, а то уже начал привыкать к одной цене. Стало появляться тревожное и непривычное чувство стабильности 🫢

UPD: Галя, у нас отмена — в комментах подметили, что этот токенизатор уже в Опусе с версии 4.7. Так что пока останавливаемся на подорожании Sonnet 5 👍

Заместители
  • 😁 15
  • 🙈 7
  • ❤ 5
Post #349 1.91K
Фейбл Камбекович снова доступен всем. Но какой ценой

Во-первых, сам Fable, похоже, подрезали еще сильнее. Не в качестве, но в количестве вопросов, на которые он будет отвечать. В модели-классификаторы, которые определяют вредоносность запросов юзера, стали подмешивать больше ложноположительных пограничных запросов специально, чтобы модель больше перестраховывалась. Таким образом довели чувствительность нахождения подозрительных запросов до 99%+ на внутренних тестах. Однако, как известно, там где растет Recall — падает Precision. Иными словами, модель будет блочить еще больше безопасных запросов, которые хоть как-то намекают на безопасность или медикобиологические темы... (что ж, коллеги из MedTech, помянем ).

Во-вторых, решили, что страдать одни они не будут. И раз избежать этой ситуации уже нельзя — они попытаются ее возглавить. Антропики милостиво продемонстрировали правительству США, что не только их модель может находить эксплойты, но и GPT-5.4, 5.5, Kimi K2.7, и куча Опусов старых поколений. И на фоне этого быстренько вписались этакими народными дружинниками по поиску путей джейлбрейка моделей, созданию сейфгардов от них и докладыванию правительству "кто в зоне риска". Все это, похоже, не только для себя, но вообще для всех моделей, которые развили "передовые возможности в областях, критичных для государственной безопасности". Ну что за мед в уши Национального Цифрового Директора (кроме шуток — реальная должность в Штатах 😁).

Как они будут определять, кто уже развил те самые передовые возможности, и насколько опасен найденный джейлбрейк? — А тут подключается вся мафия! В игру вступят Майкрософт, Амазон, Гугл и другие партнеры из Project Glasswing, которым собсно Mythos сначала и выкатывали в закрытом режиме.

Вместе они разрабатывают фреймворк, который оценивает:
1. Серьезность преимущества, которое дает взлом модели по сравнению с более слабыми моделями. Больше преимущество - хуже. ⚠️ Важный момент — этим, по сути, Антропик и правительство США проводят красную линию, что вот именно с этого момента модели становятся опасными.
2. "Широта" джейлбрейка. К насколько широкому перечню нежелательных способностей модели открывает доступ найденный метод взлома. Больше - хуже.
3. Геморройность взлома. Чем проще обычному юзеру его произвести — тем хуже.
4. Распространенность джейлбрейка. Чем он известнее в сети — тем хуже.

Что происходит?

Мы с вами наблюдаем типичную картинку для вычислительных устройств и алгоритмов.

Самое страшное для государства или любого института, работающего с деньгами и вооружением/безопасностью — это не мочь защититься от взлома. В этом пруду традиционно плавуют криптографы с вечной борьбой в сложности алгоритмов шифрования и безопасники, вечно соревнующиеся с хакерами в поиске уязвимостей и защите от них.

И вот AI дошел до такого уровня (или Антропики просто всех достаточно напугали), что безопасники начали считать его серьезной угрозой для взлома критичного ПО. Поэтому теперь уже неизбежно ждем появление полноценной отрасли AI-безопасности, антивирусов для AI, а также серого рынка джейлбрейков AI и AI-хакеров. Такие ребята будут продавать как сами джейлбрейки, чтобы развязать руки AI, так и данные, которые с помощью такого AI удалось достать.

Страшно представить, что будет, когда квантовые вычисления наконец-то дойдут до порога, когда все существующие традиционные ключи шифрования можно будет взламывать за секунды. И такую штуку дадут в руки взломанного AI... 🤙

Кстати вы сами можете попробовать поломать Fable 5 и зарепортить Антропикам.

P.S. А GPT-5.6 все еще киснет в закрытом релизе для избранных. Но еще интереснее — что теперь будут делать с Китайскими моделями, которые уже на пятки Mythos наступают. Теперь это будет полноценная нац угроза США. А они опенсорсят там каждую вторую модель 😁

Заместители
  • ❤ 14
  • 👍 7
Post #344 2.12K
Новая анти-AI маркетинговая кампания Polaroid попала в самую мякотку

Как бы я, как техногик, не любил AI и все что с ним связано, я также от него устаю, как любой нормальный человек.

Люди устали от:
- нейрослопа и помоечных «контент-заводов»
- прессинга со стороны компаний, чтобы все сотрудники были еще эффективнее
- страха потерять работу из-за AI
- алгоритмов, которые адаптировали вашу ленту рилсов так, чтобы вам было максимально сложно от нее отлипнуть

Так вот Polaroid — типичный представитель аналоговых продуктов — поднимает все эти триггеры на флаг своей маркетинговой кампании.

Иди прыгни в воду, пока дата центры всю ее не выпили!


AI не сгенерирует песок между пальцев!


Реальные истории, а не рилсы и сторисы.


Я, как человек увлеченный фотографией, тоже иногда грущу, что «неидеальные» фотографии, пойманные мною — никому уже не нужны. Их можно сгенерить.

Но потом я вспоминаю, что вообще-то они нужны мне. Ведь именно я помню, откуда эта фотка, помню тот самый момент, когда ее сделал. Именно это создает ценность фотографии — момент в моей памяти, который всплывает, когда я на нее смотрю.

Поэтому реклама Polaroid так и залетает ☀️ Аналоговое и hand-made — новая роскошь.

Заместители
  • ❤ 30
  • 👍 5
  • 🥰 1
  • 👨‍💻 1
  • 🗿 1
Older posts →
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →