TGViewer
Channel Public Channel
Нейронка Live

Нейронка Live

@neironka_live

Авторский канал. Машинное обучение, ИИ-сервисы для бизнеса и инфраструктура. Практика, не новости.
Subscribers
470
Photos
494
Videos
128
Links
373
Recent Posts 18 shown
Post #1001 125
Я увидел обсуждения в одном из чатов про SWE-2 и сначала вообще не понял, что за инструмент, но стало интересно. Новая модель, очередная IDE или второй Devin.

Полез разбираться. А там уже целый комбайн, подобный тому, который каждый из нас пытается организовать для закрытия задач разработки сервисов.

SWE-2 это модель для программирования. Devin это агент, который получает задачу, лезет в репозиторий, пишет код, гоняет тесты и приносит готовый PR. А Devin Desktop это бывший Windsurf, который Cognition купила в прошлом году и теперь превращает в пульт управления командой ИИ разработчиков.

Cursor и Claude Code помогают тебе писать код. Devin предлагает сделать шаг назад от клавиатуры и просто раздать работу агентам.

Особый интерес у меня вызвал Fusion.

Схема простая. Дорогая модель вроде Claude Fable или GPT-6 Astra думает, принимает решения и пишет важный код. Рядом бегает более дешёвая SWE-2. Она читает файлы, ищет нужные места, запускает тесты и делает всю рутину.

Короче, архитектор больше не таскает кирпичи за овер прайс.

А это уже интересно, потому что у меня уже работает похожая схема. Fable руководит задачей, Opus пишет и исправляет код, Codex независимо проверяет результат. Cognition просто завернула такой подход в готовый продукт с терминалом, облаком, общей памятью, MCP, skills, hooks и переключением моделей прямо во время работы.

Сама SWE-2 тоже не взялась из воздуха. Cognition взяла Kimi K3 на 2,8 трлн параметров и докрутила её через reinforcement learning именно под длинные задачи разработки.

Учили не только решать задачу, но и не жечь токены впустую. Меньше шариться по репозиторию, раньше начинать работать, не гонять дорогую модель туда, где справится дешёвая.

На собственном тесте Cognition модель SWE-2 набрала 50%. Fable 5.1 получила 50,9%, GPT-6 Astra набрала 53,3%. При этом Cognition заявляет, что SWE-2 обходится сильно дешевле.

Но радоваться рано. На более свежем Terminal Bench 4 у SWE-2 только 27,3%. У Fable 55,8%, у Astra 57,9%. Да и главный красивый тест FrontierCode сделала сама Cognition.

Ну типа, убийцы Claude и Codex не случилось. Получился крепкий и относительно дешёвый работяга, которого посадили внутрь хорошего агентского комбайна.

В Devin CLI доступны модели Claude, GPT, Gemini, DeepSeek, Kimi, GLM или модели самой Cognition. Можно запустить Fusion, где одна модель рулит, а вторая копается в коде. Можно начать задачу локально, потом отправить её в Devin Cloud и закрыть ноутбук.

Стоит вход от 20 долларов в месяц. Но безлимита там нет. Есть дневные и недельные квоты, но точные цифры Cognition не раскрывает.

В сентябре 2026 года Cognition привлекла больше 2 млрд.$ при оценке 48 млрд. По данным самой компании, её годовой темп выручки уже приблизился к 900 млн.$. Бизнес на людях, которые больше не хотят сами таскать кирпичи, чувствует себя нормально.

Я пока не собираюсь пускать Devin в боевые проекты. Возьму три уже закрытые задачи. Обычный баг, небольшую фичу и мерзкий brownfield кейс. Прогоню через свою текущую связку, отдельно через SWE-2 и через Fusion.

Потом сравню не рассказы агента о том, какой он молодец, а тесты, diff, ошибки на ревью, ручную доводку и цену принятого результата.

Если Fusion даст хотя бы 30% экономии без просадки по качеству, найду ему работу. Если нет, значит я за 20 долларов ещё раз посмотрел, как кто-то красиво автоматизировал выбор следующего инструмента для автоматизации.
  • 👍 6
  • ✍ 3
Post #1000 155
Год назад о Supabase писали в каждом втором канале про разработку и автоматизацию, а сегодня глухо, будто пропали. Оно и понятно, теперь БДэшку пишет клод/кодекс и юзер "автоматизатор" вообще не алё.

А тут я нашёл на своём VPS старые логи от self-hosted Supabase. Сам Supabase я давно снёс и забыл, а 13 сценариев целый год продолжали стучаться в базу, которой уже нет.

Для тех, кто не в теме. Supabase берёт обычный Postgres и собирает вокруг него почти всё, что для небольшого проекта обычно приходится писать отдельно: API, авторизацию, хранение файлов и обновление данных в реальном времени.

Создал таблицу «заявки» и сразу получил API, через который их можно добавлять, читать, фильтровать и сортировать. Без отдельного бэкенда.

Вход по почте, ссылке или через соцсети работает из коробки. Права задаются внутри базы через Row Level Security. Если всё настроено правильно, пользователь увидит только свои заявки, даже если в приложении допустили ошибку.

Туда же складываются аватарки и документы, "от батона до...". Изменения в таблицах можно отправлять клиенту без перезагрузки страницы. Есть серверные функции, расписания и векторный поиск, когда данные нужно искать по смыслу, а не по точному совпадению слов.

Для небольших проектов это до сих пор очень удобно.

ТГ-бот, которому нужно помнить пользователей и их состояние, можно собрать за вечер. Лендинг с заявками тоже. Пет-проект на выходные, внутренний инструмент с таблицами и входом по почте, небольшой AI-сервис с векторным поиском. Всё собирается из готовых кубиков.

Но Supabase нужен не везде.

Если уже работает свой Postgres и требуется только API к таблицам, иногда достаточно поставить рядом PostgREST. Если данные помещаются в один файл и меняются раз в месяц, база вообще не нужна.

Self-hosted Supabase имеет смысл, когда нужна вся платформа внутри своего контура. Но вместе с ней приезжает набор сервисов и контейнеров, которые придётся обновлять, мониторить и восстанавливать. Для маленькой задачи это легко превращается в отдельный инфраструктурный проект.

При этом Supabase никуда не делся. В июне 26-го года они подняли раунд F на $500 млн. Оценка $10,5 млрд инвестиций. А более 60% новых баз на платформе теперь запускаются через AI-инструменты.

То есть Supabase не умер. Он просто перестал быть модной игрушкой и стал инфраструктурой, которую всё чаще поднимает не человек через панель, а coding-агент по одной команде.

Хайп ушёл, инструмент остался. Для инфраструктуры это, пожалуй, лучшая характеристика.
  • 👍 7
  • ❤ 2
  • ✍ 2
Post #998 266
Хочется добавить к предыдущему посту и высказаться.

Я всегда вспоминаю одно очень важное правило, «Когда домохозяйка говорит, что нужно покупать $», для меня это значило, что пора их продавать.

Что я вижу сейчас, это крупные инфлюэнсеры, не имеющие отношения к ИИ, говорят об этом, пытаясь показать «экспертность».
И это является одним из доказательств моего мнения об индустрии, о том, кто тут хомяки, а кто этим хомякам «за щеку кладет».

Уточню, чтобы меня не поняли неправильно. Домохозяйка с долларами это не сигнал, что доллар отменят. Это сигнал, что кончился лёгкий вход.
С ИИ то же самое. Технология никуда не денется, я на ней работаю каждый день. Кончился рынок, где можно было продать сам факт знакомства с нейросетью. Дальше платят за навык, а не за знание слова «промпт».
Перегрет не искусственный интеллект. Перегрет хайп о нём.
  • 👍 9
  • ❤ 3
Post #997 269
Привет, бедолаги.

И это без уничижительного подтекста, просто столько всего происходит, что я и сам немного бедолага... Выпустили Giga агента от Gigachat со своими приколами, но история рабочая. В принципе, это ожидаемо. Сколько же стартапов отлетает 🤔 И как же я рад, что со стартапами завязал. Корпоратам с этим гораздо проще, они могут позволить себе давать задачи командам исследовать гипотезы и тратить на это ресурсы.
У них есть и бюджет и команды и... Я заметил, что корпораты "осваивают" маневренность исключая лишнюю бюрократию.
Компании готовы выделять бюджеты для прототипирования идей и исследования внедрения искусственного интеллекта.

Но... С топовыми вендорами ситуация другая. Антропик и ОпенАИ "штурмуют высоты" и дают возможность "пощупать возможности". И кто бы что не говорил - Китайцы пока ещё позади. Сейчас вендорские модели могут взламывать сайты и крипто протоколы на миллионы баксов и создатели задумываются о том, чтобы "притормозить". И это мнение не только Амодеи, но Маска и других. Это наталкивает на много мыслей.

Еще конечно не могу не сказать о своих ощущениях - лимитов не хватает категорически, не на клоде, ни в кодексе. Творю в своем темпе и если раньше лимитов с лихвой хватало на всю неделю, то сегодня на 5 дней еле-еле хватает. А переходить на api, это мега дорого.

Сейчас вижу по чатам, что и энтузиасты начинают это чувствовать и повезло тем, кто благодаря усидчивости, глубокому самостоятельному изучению смогли найти себе место. В компаниях выделяются средства на оплату подписок и человек спокойно трудится.

Суть в том, что со стартапами "можно идти лесом". Не надейтесь найти кнопку "бабло". Наконец-то это понимает все больше и больше людей. А тем, кто еще не осознал хочется сказать: не вздумайте платить бешенные бабки за "успешный успех". Никто не прибежит с пачкой денег в зубах.
Помните, "стартаперы", всё, что вы "придумали" не будет работать без бюджетов с вероятностью ~98%.

У нас, у энтузиастов, 2 пути, найти "место под солнцем" и применить свои навыки в найме или внедрять ИИ в собственный действующий бизнес, где уже есть клиенты, задачи и понимание, за что люди платят.
А, ну есть ещё третий путь, продавать первым двум мечту о лёгких деньгах.

Поэтому не вздумайте платить бешеные деньги за "успешный успех".

Если человек действительно нашёл кнопку "бабло", он нажимает её сам.

И всегда помните, если он продаёт эту кнопку вам, значит, кнопка и есть вы.
  • 🔥 8
  • ❤ 3
  • 🫡 3
Post #995 379
rocket-launch 2.html1.3 MB M-Ascent.html3 MB
Ой, ребята-ребята. Вчера был очень насыщенный вечер.
Клод сбросил лимиты и изменил настройки Фабли 5.1. Теперь, как минимум, модель поумерила свои аппетиты по расходу лимитов. Хотя до сброса было "упадническое" настроение, т.к. недельных лимитов перестало хватать хотя бы на 5 дней. И я не думаю, что это из-за задач или беспорядочной документации (с ней все в порядке). Если с выходом 5.1 effort был на low - лимиты спустя несколько часов после релиза стали просто утекать, то после изменения настроек high можно работать.

А теперь про новый релиз GPT Astra. Ну, ребят, первое касание было просто шикарное. У меня есть проект, достаточно сложный, и нужно было построить 3Д модель территории. Что касается расхода токенов: gpt-6-astra high, на момент запуска шкала недельных лимитов была на уровне 72% и вот состояние на данную минуту 35%, что очень радует.
3Д он собрал на основе "тренажера", т.е. контекст у него был. Дальше уже были тесты по абстрактным 3Дэшкам и на ваш суд выдам 2 варианта от Clаude (делал мой товарищ) и Codex.

Угадайте, какая модель сделала, какой вариант?😌
  • 👍 9
Post #993 369
Дожили. Пора выдыхать 😊
  • 😁 8
Post #992 468
Прошло ещё немного времени и чёт я приуныл.
OpenAI с 12 ноября отключает свои модели в Cursor. Тут, правда, история не про экосистемы, а про то, что Cursor купила SpaceX за 60млрд., и Альтман с Маском воюют. Но для меня история показательна, юзеры строят работу на инструменте, а доступ к моделям в нём решают пара человек, которые между собой соперничают со времен, когда Маск вышел из OpenAI и замутил xAI.

Но я хочу поделиться своим мнением про экосистемы, Work/Cowork и др. На примере Anthropic, они взяли фундамент Claude Code, выкатили его для тех людей, кто в ком.строку не хочет (большая ошибка), и вынесла на вебку или приложение. Они сами говорят, что большинство юзеров не пишут код. Основной поток людей и денег ведут туда, где ты выбираешь папку, а не флаги. И вот этот загон юзеров в песочницы, это пздц. Такое ощущение, что у нас забирают свободу, а подают как упрощение.

Логика понятная, юзер получает быстрый дофамин, подписка растёт, лимиты режут. Для маленьких проектов скорее верно. Но билдить большой проект в подобных инструментах не реально.

Вот и сижу в CLI. Кастомизация и контроль над своими данными, свой vps, приватные репо, ключи никуда не уезжают. Взломать можно всё, но разница между "у меня плохо лежало" и "оно лежало у них" всё-таки есть.

А теперь про мою боль. Код агенты пишут нормально, любой язык, высокая сложность, дизайн, база данных, карты и слои. Тут вопросов нет. Все проблемы начинаются на данных. Потеря кусочков, развороты на 180 градусов, топтание на месте. Я меняю местами агентов, гоняю варианты, но пока проблему не решил.

Гоняю локалку на живой базе, 42 контрольных вопроса. Без инструментов, просто с базой в контексте 2 правильных ответа из 42,, она уверенно отвечает "такого объекта нет" про объект, который в базе лежит. Подключаю инструментарий и детерминированный код, который сам ходит в базу и в результате 42 из 42, стабильно.

Это я к тому, что все эти базы для llm, как "собаке здрасте"! Тут или обучать llm, или детерминистика. Обучением занимаюсь, но это долго и дорого и это не промты, а именно слои.

Так что в подкапотке моих проектов до сих пор работают исключительно алгоритмы, а LLM сверху, надстройкой, на то, что реально требует суждения.
  • 👍 8
  • ✍ 2
  • 🔥 2
  • ❤ 1
  • 🤔 1
Post #991 451
Канал меняет формат. Да, опять. От крипты к ИИ, от ИИ к инфраструктуре.

Про релизы моделей писать не буду. Этим заняты десятки пабликов, и у них это выходит оперативнее, достаточно просто парсить твиттер. Пересказывать чужие новости своими словами смысла не вижу. Разборы фреймворков от энтузиастов тоже прекращаю, мне они неинтересны. Появится что-то действительно из ряда вон, скажу своё мнение.

Секретов из серии "B2B SaaS за один промт" здесь не было и не будет.

Сегодня моё внимание на машинном обучении в IT компании, бизнес сервисы, датасеты крупных инфраструктурных игроков. Фокус на бизнес логике, развёртывании моделей, обучении их на этих датасетах и архитектуре сервисов. Внедрение на начальном этапе, но движется.

Формат: бизнес, техника и жизнь. Плюс впечатления от работы с одной из топовых IT компаний страны.

Кто пришёл за новостями, дальше будет скучно.
  • 👍 11
  • ❤ 2
  • 👀 2
Post #990 443
Вижу инфу про Qwen3.8-27B, что она работает на одной 3090, контекст 262 тысячи, сравнивают с Opus. Забавно такое читать.
Стало интересно че как, т.к. у меня на серваке крутится Qwen3.6-35B-A3B-FP8, MoE.

Вышла эта моделька 14 августа, Apache 2.0, GGUF в тот же день, официальный FP8 сразу. По цифрам Terminal-Bench 63.4 на 73.0, SWE-bench Pro 53.5 на 61.7, DeepSWE 13.3 на 42.2. Поколение сильнее, вопросов нет.

Замерили они сами, независимых замеров не нашел. Строчку "software engineering 49.3 на 79.0", которую все растащили, меряли по их собственному тесту QwenSWEBench. С Opus сравнили выборочно, где обе гоняли на одном стенде, Opus впереди на 5.2 по Terminal-Bench, на 5.3 по NL2Repo, на 2.1 по GPQA. Результат Opus по SWE-bench Pro даже не перезапускали, взяли готовым из карточки Anthropic. И сравнивают с 4.6.

Бенчи мне мало интересны. Интересно, полезет ли она в сервис, где люди юзают одновременно.

Считал на 3090, веса в 4 бит 16 ГБ, зрение почти гигабайт, служебное 2. Свободных остаётся 5 ГБ, и это вся память под истории диалогов. Тысяча токенов истории стоит по расчёту 64 МБ. Значит на всех пользователей вместе у тебя 70-80 тысяч токенов. Дели как хочешь.

Бот-консультант по базе знаний тратит на ответ тысячи четыре. Одновременно карта тянет прикидочно 15-20 диалогов. Сотня юзеров туда влезает спокойно. А вот сотня, нажавшая отправить в одну минуту, встанет в очередь.
Поисковый агент тащит в контекст документы и тратит не четыре тысячи, а тридцать. Одна сессия съедает 2-3 ГБ из 5 доступных. Два человека, и карта кончилась.
И прежде чем сказать первое слово, модель читает весь промпт целиком. Плотная модель на 3090 читает около тысячи токенов в секунду. Документ на тридцать тысяч это полминуты тишины. У меня на 96 Гб карте вход в 215 к токенов проглатывается за 17 секунд.

Еще, в новой модели на каждое слово работают все 27B параметров. Та, что стоит у меня, и та, что у смежников по проекту, обе MoE, параметров 30-35B, а просыпаются на слово 3B активных. Поэтому у смежников на одной 4090 висит модель, кормит их голосового бота и кормила нас, я гонял по ней 8 параллельных запросов, 14 в секунду, без просадки. Окно при этом 20 тысяч, не 256. Вот и весь базар.
Суть не в железе, я мерил свою модель на живой базе. Без инструментов 2 правильных ответа из 42, она уверенно говорила "объекта нет", когда объект есть. С нативными инструментами 42 из 42. Модель одна и та же. Разница в том, ищет она сама по базе или ей навалили текста в промпт и попросили угадать.
Так что если поисковый агент сначала находит нужные куски и отдаёт модели пять тысяч токенов по делу, он поедет и на 3090, и на сотне пользователей. Если архитектура "закинем документ целиком и спросим", не поедет ни на чём, кончится на третьем человеке.
Еще нужно понимать, что режим рассуждений включён по умолчанию и при коротком лимите токенов сжирает его целиком, ответа не будет. Лечится флагом enable_thinking=false. И для запуска нужна vLLM 0.27.2, а она пока nightly.

На 3090 нет FP8, придётся брать четырёхбитную сборку с просадкой в качестве. Официальный FP8 весит 28 ГБ и в 24 не влезает. По-нормальному эта модель живёт от 48 ГБ.

Дальше планирую поднять новую вторым контейнером рядом и прогнать по своим дата-сетам, на которых меряю свои модели.
  • 👍 8
  • ❤ 2
  • ✍ 2
Post #989 489
8 августа я наконец выйду из CLI в Коломенское.

Пойду с семьёй на ИТ-Пикник. Для меня это не очередная конференция, где восемь часов сидишь под кондиционером и борешься со сном, а целый день на воздухе. Послушаю про генеративный ИИ, кибербез, данные и сервисы. Между ними можно закрыть ноутбук, увести детей в интерактивные зоны, встретить знакомых, а вечером послушать музыку.

Жду научпоп-трек. Древняя ДНК, микробиом, связь языка и мышления. Последнее особенно, мы ведь каждый день взаимодействуем с языковыми моделями, а где кончается статистика и начинается смысл, до сих пор непонятно.

И для детей там раздолье, робототехника, 3D-печать и летающие акулы на нейроуправлении. Мне бы в их возрасте такое.

Вечером IOWA, Cream Soda, Pompeya, СОВА, мартин и Антон Беляев с LAB. Не совсем моё, но сама идея, типа днём спорят про архитектуру и безопасность, вечером слушают оркестр на траве.

Мой любимый парк Коломенское подходит такому формату идеально. Это не парк вокруг сцены, а царская резиденция на высоком берегу Москвы-реки. Исторические яблоневые сады, церковь Вознесения 1532 года, первый каменный шатровый храм на Руси и объект ЮНЕСКО. Место, которое мне по-настоящему дорого. А тут можно послушать доклад про нейросети и через десять минут стоять у храма, которому почти пять веков. В технопарке такой фестиваль был бы корпоративом или очередной конфой, а здесь это летний день с семьёй.

8 августа, с 12:00 до 22:30. Все условия на сайте. Зачётно сделали, что по одному билету +1 взрослый и двое детей - мой комплект.

Если тоже пойдёте, напишите. Пересечёмся.

Нет, не реклама.
  • 🔥 6
  • ❤ 2
  • ✍ 2
Post #986 466
В догоночку. Осмыслите.

Anthropic проверили 141К прогонов своих кибербез-тестов и нашли три случая, когда Claude во время эвала вышел в интернет и сломал реальные компании. Одну сломал школьной SQL-инъекцией, у другой выгреб сотни строк продовых данных.

Забавно читать, но на тестовых машинах забыли отрезать сеть. А в промте модели было написано, что интернета нет.

Т.е. модель поняла, что цель настоящая, и продолжила атаку, объяснив себе, что так и задумано в упражнении. Вторая увидела признаки реальности и отмахнулась, сославшись на сертификаты и системную дату. Только самая свежая модель сама сообразила, что вышла наружу, и остановилась.

Т.о. агент верит написанному ровно до того момента, пока реальность ему не возразит. А дальше начинает себя уговаривать.

Мы так работаем, пишем в CLAUDE.md "не трогай прод", "не удаляй файлы без бэкапа", и считаем, что поставили границу. Не поставили. Это просьба, а не забор. Забор это отрезанная сеть, отдельный пользователь, права на файлы.

У Anthropic на это ушло полтора года и несколько взломанных компаний, чтобы заметить. Причём две из них о взломе даже не знали.
  • 🔥 6
  • 🫡 3
  • ✍ 2
Post #985 430
Perplexity выложили в открытый доступ Numbat. Это чёрный ящик и предохранитель для агентных систем. Apache 2.0, один бинарь, ставится на машину и встраивается в CLI/IDE.

Проблема, которую он закрывает: Claude Code, Codex и остальные агенты выполняют на ПК команды, читают файлы, запускают bash, ходят в интернет. И мало кто это проверяет, почти никто не хранит.

Numbat работает в двух режимах, и они независимы.

1. Архивариус. Claude Code сам пишет историю сессий в ~/.claude. Numbat читает эти файлы и собирает из них нормальный таймлайн, в такой сессии агент открыл файл с ключами, потом ушёл в сеть. Ничего устанавливать не надо, в агента он не лезет. Работает по сессиям, которые были ДО того, как узнал про Numbat.

2. Предохранитель. В Claude Code есть механизм PreToolUse, перед каждым действием агента спросить внешнюю программу, Numbat встраивается туда и видит команду до выполнения. Может записать, может запретить.

Под капотом своего рода предохранители в виде 52 встроенных правил в 11 категориях, чтение .env, SSH-ключей, AWS-креды, куки браузера, скачал из сети и сразу запустил, реверс-шелл, запрос к instance-metadata облака, побег из Docker, майнер, затирание диска, дописка в автозапуск, правка конфига самого агента.

Поверх них ещё 6 отдельных правил на цепочки. Типа, прочитал секрет, потом исходящий запрос. Получил permission denied, потом попытка обойти. По отдельности каждое действие кажется безобидным, а в связке агент может наворотить делов.

Поддерживает 30+ агентов. Claude Code полностью, включая блокировку. Codex, Cursor, Copilot CLI, Gemini CLI, Windsurf, OpenClaw. OpenCode пока только на мониторинг. Crush, Hermes и Junie в отложенных, у них нет стабильного формата записей. Zed, Aider и Continue CLI не поддержаны, там нет ни хуков, ни версионированных логов.

Perplexity сделали не защиту от хакеров, а защиту от аварий. Агенты удаляли продовые базы, сносили домашние директории, а модель OpenAI во время тестов вылезла из песочницы и утащила ответы с Hugging Face. Агент не саботажник, ему поставили цель и не обозначили границы. У себя они раскатали Numbat через MDM на все машины инженеров.

Меня зацепила тема с детектом и блокировкой, которые разведены жёстко, все встроенные правила по умолчанию только смотрят, блокировка включается руками. И раздел с ограничениями написан так, что чтение артефактов это не снятие образа диска, восстановить то, что агент не записал, нельзя; сработка правила это не доказанное действие; неподписанный бандл расследования не подтверждает подлинность источника.

Репозиторий вышел на днях, три коммита, схема записей v0.2.0, но думаю, это не однодневка. Правила это по сути матчинг по строке команды, против агента под prompt injection они не помогут, обфускация их обойдёт. Про ложные срабатывания в доках нет ни слова, а если ты работаешь под root, категории privilege и secrets будут гореть постоянно.

Режим архивариуса я у себя погоняю, риска нет вообще. Режим предохранителя пока подержал бы в стороне от рабочей машины. Может поэкспериментирую на Codex.

Почитай их твит о том, что они дают.
  • 👍 8
  • ✍ 3
  • ❤ 2
Post #984 466
Вера в свою исключительность.

У многих вижу эту черту и сам тоже страдаю этим.
Я много изучаю, трачу огромное количество времени и не устаю талдычить об этом всем, с кем касаюсь темы ИИ, а когда-то крипты. Нельзя посмотреть видео и научиться управлять ИИ, а тем более создавать. Но люди изучают поверхностно, а потом ходят и рассказывают. Реально работающего серьёзного проекта при этом ни у кого нет. Я B2B saas.

Волшебной таблетки нет, нажал и заработал миллион. Но я вижу глаза по пять копеек у людей, которые заходили в крипту, а сейчас в ИИ, с надеждой поправить благосостояние, попасть в высшую лигу и закрыть все финансовые вопросы разом.

Как и в крипте, в ИИ выстроилась доходная иерархия: инвесторы, инфраструктура, продавцы лопат. А хомячки катаются на волнах хайпа и теряют деньги.

Без базовых знаний глубже не уехать. Под базовыми я имею в виду определения и принципы, без них в голове каша. Дальше архитектура, специфика конкретного сервиса и постоянная работа над своим харнесом.

Вышел Opus 5, и по моим впечатлениям модель крутая: интересно рассуждает, выдает понятные ответы, находит баги, экономнее по токенам. А рядом Тарик из Anthropic, чьё эссе про неизвестные выходило не так давно, выкатил новый текст и указал на главное. Из системного промпта Claude Code выкинули больше 80% текста, прогнали кодинговые бенчмарки, просадки не оказалось.

То есть 80% инструкций внутри агента были мусором. А что делает большинство? Ставит себе все скиллы, которые попались в ленте, без анализа. Это не система, это шкаф, в который запихивают вещи.

Я раз в две недели провожу аудит своей среды и трачу на это пару дней. Каждый репозиторий разбираю до основания, прежде чем пускать внутрь. И смотрю аналитику использования, руками самого агента. Из последнего, 28 установленных скиллов, 270 вызовов, из них 153 приходятся на 6 скиллов. Десяток скиллов набрал по одному-четыре вызова за всё время, их я или убираю или перерабатываю, я же их интегрировал. Часть еще отсеивается на тестах.

Верю ли я в технологию? Да, так же как верю в блокчейн. Но за знания и результат платишь временем, не 8 часов в день, а 12-16 и деньгами.

Пока этого понимания нет, будет хайп и презентации. Проектов не будет.
  • 👍 11
  • 💯 3
Post #983 487
Anthropic анонсировали плагин Claude Security для Claude Code. Публичная бета, работает из терминала.

Запускаешь /claude-security и выбираешь, что проверить, весь репозиторий, отдельную папку или только дифф ветки перед коммитом. Агенты разбирают архитектуру, строят модель угроз, ищут баги. Каждую находку потом перепроверяют отдельные агенты-верификаторы, и в отчёт попадает только то, что выжило. Отчёт падает в папку с таймстампом прямо в репо, каждая находка со сценарием эксплуатации и оценкой уверенности.

На фиксах один агент пишет в копии репозитория, второй проверяет и гоняет тесты, читает дифф. Если не может отчитаться, что баг пофикшен, ничего нового не сломано и поведение не изменилось, вместо фикса дает объяснение почему. Применяешь сам через git apply, автоматом не применяется.

У меня эта схема собрана руками. Рядом с Claude живёт Codex CLI на gpt-5.6-sol, Fable у меня архитектор, код пишет Opus, ревью гоняет Sol, цикл крутится до чистоты, потолок пять раундов.

Anthropic забрал одну ось моего пайплайна и сделал её штатной. Ставить буду, как нижний слой перед коммитом.

Подменять им Codex не буду. У них ревьюер это тот же Claude, просто с чистым контекстом. Чистый контекст лечит предвзятость к своему же решению, но не лечит слепые зоны модели. Чего Claude не видит как класс, того он не увидит и на втором заходе. У Codex другой вендор и слепые зоны свои. Плюс их слои ничего не блокируют, находки просто прилетают в чат, а у меня гейт держит релиз на подтверждённом critical.

Отдельно у них есть security-guidance, сидит на хуках, ругается на опасные конструкции прямо при записи кода, потом смотрит дифф в конце хода, по умолчанию на Opus 4.7, модель меняется переменной SECURITY_REVIEW_MODEL.

В пайплайн добавил security-guidance, дальше Claude Security, дальше Codex, дальше гейт. Модели ищут и предлагают, а пропустит дальше или нет решает скрипт.
  • 👍 6
Post #982 423
Нейронка Live Кто-то собрался пошуметь. Gemini 3.5 Pro По слухам, запуск 17 июля. Обещают контекст на 2 млн токенов и режим рассуждений Deep Think. Цена API ориентировочно $12-15 за миллион входных токенов и $36-45 за выходных. Для запросов длиннее 200 тысяч токенов…
Ну вот и Google проснулись и выкатили три новые модели. Gemini 3.6 Flash, Gemini 3.5 Flash-Lite и Gemini 3.5 Flash Cyber.

Заявили, что Gemini 3.6 Flash это их интеллектуальная Flash-модель для агентных задач и программирования.

Она дешевле Gemini 3.5 Flash 1,5/7,5$.

Gemini 3.5 Flash Lite позиционируют как быструю и недорогую модель с высокой пропускной способностью.

А Gemini 3.5 Pro пока тестируется и выйдет в широкий доступ по готовности.

Ну... Принимая во внимание, как развиваются китайцы, какой шум они поднимают, выход моделей от Гугла прям не радует. Конечно нужно тестить и смотреть, что они (модели) могут на практике. Не то, что я ожидал.

Пока китайские компании рвутся к титулу чемпиона,Гугл будто застрял во втором дивизионе, новые модели скорее попытка удержать позиции, чем борьба за лидерство.
  • 👍 8
  • ✍ 2
  • 🤔 1
Post #981 399
Поговорим про harness. У каждого из нас есть своё видение работы с AI. Большинство перебегает из одного лагеря в другой, а в чатах идет бескомпромиссная борьба адептов. Поэтому я не буду "исполнять канделябры" и говорить, что одни лучше других.

Я использую обе подписки, Claude и Codex (обе по 100$). Работают они под одним CLI Claude code. Неделю собирал конвейер, где одна нейронка архитектор, вторая пишет код, а третья его проверяет.

Исходил из того, что любая модель ошибается, но ошибаются они по-разному. Claude и GPT учили разные команды на разных данных, слепые зоны у них разные. Код одной модели прогоняю через ревью другой, и пересечение слепых зон становится сильно меньше. Дешевле двух подписок такого не собрать, платные API на моих объёмах съедали бы в разы больше.

Fable у меня архитектор: держит контекст проекта, пишет план, принимает решения. Код пишет Opus по спеке. Готовый кусок уходит в Codex gpt-5.6 sol на чтение, изменить он ничего не может, возвращает находки строгим JSON со своим вердиктом. Дальше цикл, когда архитектор каждую находку проверяет по коду, подтверждает или отклоняет, чинит и отправляет на повторное ревью. И так до вердикта "чисто", потолок пять кругов. Реестр находок машинный, ревьюер обязан явно закрыть или оспорить каждый пункт. Замолчать проблему не получится, скрипт не пропустит.

Сегодня прогнал связку на боевой задаче, обновлял опенсорсный видео-движок, который рендерит ролики и карусели для кипрского проекта.

В плане ревьюер поймал 33 проблемы за 7 кругов, минимум три положили бы прод. Например, замену симлинка неатомарной командой и сборку, которая гоняла бы старый движок под видом нового. В коде цикл сошёлся за 2 круга, два случая, которые пропустил и я, и сотня прогонов автотестов. Движок переключён, все проверки 34 из 34, ни одной поломки.

Конечно модель не станет безошибочной, сколько промтов ей ни пиши. Но ошибки можно сделать дешёвыми, ловить каждую до прода. Ну вот поэтому и плачу за вторую подписку.

Конечно моя ранняя версия harness, где графовый и файловый пайплайн никуда не делся. Новая связка врезана в него, а не вместо него. Графы проектов экономят контекст на старте сессии, файловая вики держит грабли и решения по каждому проекту. Сверху точечные врезки по инструкциям, хукам и детерминистике, чтобы агент физически не мог проскочить шаг. Работает это как гейты. Новая задача не начинается, пока план не прошёл ревью. Код не считается готовым, пока не прогнаны тесты, упало, чинишь и гоняешь снова, и так до зелёного. Перед коммитом отдельный чек-лист безопасности, от инъекций до гонок, файлы с ключами агенту только на чтение, любой новый пакет сразу через аудит уязвимостей. И главное правило: всё, что можно проверить кодом, проверяет код, а не модель. Статусы, парсинг, ретраи, сверка чек-листов, это скрипты. Модель оставляю для суждений. Таким образом, пропуск инструкций перестаёт быть вопросом дисциплины нейронки, его просто ловит скрипт.
  • 🔥 7
  • ❤ 3
  • 👍 2
  • 🤔 1
Post #980 355
Вот что значит быть честными со своими пользователями.

Команда moonshot объяснила, что из-за высокого спроса возникли проблемы с мощностями и даже идут на потерю средств в моменте. И это вызывает уважение и расположение. Они не стали «пихать» подписчиков в «маршрутку».

Что касается моего знакомства, то я успел сделать подписку и немного погонять ее в терминале.
Как китайская модель, это конечно ТОП. Но честно, перешел бы я к ним и отказался бы от Claude/Codex - сегодня нет!
Во фронтенде это отличная модель… Подробнее может позже расскажу, пока мало времени было.

Сейчас они испытывают проблемы, но от души желаю им преодолеть трудности.
  • 👍 7
  • ❤ 3
Post #979 429
Это конечно любопытно.
Сам я еще не тестил, но читаю, что пишут пацаны по чатам (opus опущен).
Стало очень интересно и зачесались руки.

Кто уже прикасался к этому чуду, что скажете?
  • 🔥 9
  • 🤔 3
Older posts →

About this channel

How can I read @neironka_live without a Telegram account?
TGViewer shows the public web preview Telegram publishes for Нейронка Live: recent posts, photos, videos and the subscriber count, with no app, login or account.
How many subscribers does Нейронка Live have?
Нейронка Live (@neironka_live) has 470 subscribers on Telegram, refreshed roughly every 30 minutes.
Does Нейронка Live know I viewed it here?
No. Public channel previews carry no viewer identity, and TGViewer has no accounts or tracking of what you look up.
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →