TGViewer
Channel Public Channel
Нейросети на практике

Нейросети на практике

@neuralfordevs

Канал о том, как применять нейросети на практике для разработчиков. Читаем и пишем через призму веб-разработчика

По всем вопросам и предложениям пишите @Undermove1
Subscribers
64
Photos
3
Videos
4
Links
14
Recent Posts 20 shown
Post #29 84
🤔 Что выбрать новичку Claude или Codex?

Это вопрос, который я часто слышу от тех, кто только начинает вкатываться или недавно вкатился в агентскую разработку.

TLDR: если только начинаете берите Claude.

А почему так читайте далее.

Попробовал наконец Codex. Протестировал в рабочих задачках на модели 5.6-Sol c режимом medium fast thinking.

Что просил: прожарить задачи, проработать контракты между фронтендом и бэком, написать тесты, выполнить задачу по описанию.

Первые наблюдения:

1) Вполне неплохо подхватил у меня все скиллы и описания которые я делал для клода в своей ai-hub папке
2) Задачи делает вполне себе хорошо, четко выполняет цели. Но тут без вопросов.
3) Не могу сказать чтобы он как-то лучше или хуже исчерпывал лимиты подписки. В целом сравнимо с клодом в аналогичном режиме.
4) Скорость ответа и решения задач в целом та же.

Думаю что чуть позже попрбую прогнать прям AB тесты на одной и той же задаче, чтобы понять, что к чему.

Так почему же тогда Claude? На самом деле ответ будет чутка странный, но потому что банально Claude сильно проще. На данный момент он что-то типа айфона – ты его что-то попросил сделать и он там сам как-то догадается, что и как тебе нужно.

Codex же будет делать довольно влоб. Очень много историй о том, что он переусложняет. И я убедился в этом — переусложняет, как матерый сеньор.

К примеру, когда я попросил сделать одностраничник, который могу переслать в виде одного файла, кодекс решил написать мне прям целый сайт на реакте. Ну, да, конечно он потом собрал из него один файл, но это как бы оверкилл. Можно было сразу index.html сделать.

И вот тут и вскрывается этот порог входа для новичков — вам надо вести эту очень умную модель за ручку там, где Claude постарается за вас угадать насколько вам сложно оно надо и подстроится.

И вот эта психология “сделай красиво”, если так можно выразиться у Claude более комфортная.

Для опытных, что клод, что кодекс идут по теореме Эскобара. И одно и второе — хорошо…
  • ❤‍🔥 3
  • ❤ 3
Post #28 115

Forwarded from AI в кубе |AI³ | Сергей Долгов

#разрушителимифов У Димы, чей разгромный тест Caveman я упоминал неделю назад, вышло новое расследование https://habr.com/ru/articles/1058780/ - на сей раз про Хедрум, который обещает сэкономить вам токены, но кроме звезд на гитхабе не может предложить вам ничего нового.
Telegram AI в кубе |AI³ | Сергей Долгов 😐 Токен тратить плохо, но проверять - хорошо. Нашумевший скилл Caveman обещает экономить 70% ваших токенов, заставляя агента говорить как пещерный человек. Суть проста: убирая из текста приветствия, вежливости, длинные переходы, определения для чайников…
  • ❤ 2
  • ❤‍🔥 1
  • 👍 1
  • 🔥 1
  • 🤩 1
Post #27 93
Таки не заленился и написал статью про Headroom!)
Post #26 99
Как работает кэш токенов?

В процессе написания статьи про HeadroomProxy чуть глубже погрузился в то как работает кэш в LLM.

Посмотрел вот такое неплохое короткое видео.

Но если коротко разбирать, то суть в том, что каждый раз когда LLM обсчитывает новый ответ, ей нужно понять, как каждое слово в вашем предложении связано с другими словами. Этот механизм называется Self Attention.

К примеру “Мама мыла раму”

1) Когда нейронка генерит слово Мама, то она создает карту как мама связана с остальными словами. На первом этапе связывать не с чем
2) Когда нейронка добавляет слово “мыла” то она снова стороит таблицу того, как слово мыла связана со словом Мама и заносит эту таблицу связей в кэш.
3) Тут важный момент: таблица связей односторонняя. ТО есть слово Мама не будет при этом выстраивать связь со словом мыла. То есть этот механизм рабоатет только для прошлых токенов.
4) Такой тип механизма self-attention называется masked attention. И как раз удобен тем, что его результаты удобно кэшировать.
5) Так вот когда вы начинаете генерировать слово раму, то вам уже не нужно вычислять таблицы связей для слов “Мама мыла” так как вы уже все это вычислили, вам нужно вычислить только одну таблицу.

Интересный факт: Есть и другие типы self-attention к примеру Full, который строит связи между всеми словами, но его к примеру невозможно кэшировать и приходится пересчитывать каждый раз с нуля.

Так что существующий механизм кэширования в LLM и снижение стоимости возможно благодаря Masked Self-Attention.
YouTube How KV Cache Speeds Up LLMs for Faster AI Models on GPUs Learn more about LLM inference here → https://ibm.biz/~Ewjm0UejN Why do LLMs crawl when traffic spikes? 🤔 Legare Kerrison explains how KV cache and paged attention reshape GPU memory across prefill and decode to speed up LLM inference. Learn how smarter…
  • 👍 2
  • 🔥 2
  • ⚡ 1
  • 🦄 1
Post #25 108
🍄 Разрушители мИИфов: тестируем Headroom

Когда я писал прошлый разбор про Caveman, то на глаза мне попался еще один плагин rtk (если что расшифровывается как Rust Token Killer, а не react-toolkit). Я настолько впечатлился описанным принципом его работы, что как-то самоуверенно в конце разбора даже предположил что эта штука должна работать.

Поэтому садясь за тестирование headroom я был уверен, что если и найду что-то, то не настолько критичное. Однако результат меня смог удивить не в лучшую сторону.

В отличие от Caveman принцип работы этого прокси-плагина звучит сложно, но как будто логично:

1️⃣ headroom оборачивает все вызовы к API Anthropic в специальную проксю. То есть теперь ваши вызовы идут не напрямую на сервера, а проходят через localhost:8787

2️⃣ Эта прокся ловит все что агент пытается отправить на сервер антропика и ужимает с помощью локальной модели!

3️⃣ Сжимает он по-разному, в зависимости от типа данных.

4️⃣ Более того эта штука сохраняет оригинал промпта который сжимает и если что дает модели к нему доступ через спец инструмент. То есть, модель может попросить какой-то кусок оригинальной инфы, если в сжатой что-то не найдет

Обещает это все экономию токенов в 60 – 95%! Ну и разумеется без потери качества. Но это очевидно – никто не любит терять качество. Ибо глупо обещать огромное сжатие и при этом говорить, что итоговый ответ окажется непотребной фигней. Таким инструментом тогда не только пользоваться не захотят, но даже банки с водой заряжать не станут.

🧪 Тесты
Озвученная выше схема звучит настолько сложно, что я прокрастинировал тест пару дней. Но в итоге придумал такой тест:

Сделал репо с игрой и тестами. Всего 16 unit-тестов + 2 e2e. И при этом я сломал спецом 4 штуки из них. Дал промпт:

Почини репозиторий: доделай все незавершённые функции, чтобы все тесты (юнит и визуальные) прошли и игра запускалась. Вопросов не задавай.


На этот раз я решил прогнать кажый тест 3 раза для верности.

🫢 Что в итоге получилось:

Результат в деньгах, которые потратились на токены в итоге решения задачи. Указан разброс на трех запусках от минимума до максимума.

Opus 4.8 $0.371 – 0.420
Opus 4.8 + Headroom $0.553 – 0.691

Sonnet 5 $0.410 – 0.482
Sonnet 5 + Headroom $0.583 – 0.717

Итог такой: Даже на самых успешных прогонах с хедрумом тратилось больше денег, чем на самых хреновых прогонах без хэдрума — Opus +62%, Sonnet +45%.

Пара интересных моментов

🟢 Сам хэдрум через headroom perf на этой задаче заявляет что сжал 2%. Эффективненько вышло — учитывая, что при этом итоговая стоимость подскочила на 50%…

🟢 Почему вообще так получилось? Claude Code сам по себе кэширует стабильный префикс диалога. Headroom встаёт посередине и берёт управление кэшем на себя. Как итог headroom не воспроизводит родную расстановку кэша Claude Code один-в-один и агент вынужден чаще переписывать и больше перечитывать кэш. В сессиях с хэдрум: hit rate кэша падает с 98% до 94.8%

🟢 Именно по вышеозначенной причине в этот раз я показал результат в деньгах, а не токенах, потому что по токенам выходило +- то же самое, что могло бы дополнительно вводить в заблуждение.

Итог получается плачевным. При этом в интернете особо нет критики этого инструмента. Есть какие-то посты от разных людей которые включили попробовали и вроде бы им зашло. Что значит это зашло — решительно непонятно. Видимо зашло, что они теперь стали упираться в лимиты отчего почувствовали себя воистину эффективнее.

P.S.: За время тестирования на самом деле получилось открыть еще парочку “приколюх” этой штуки, в том числе с разными настройками ее потыкать. Но я думаю, что если не заленюсь, то бахну статью на Хабр по этой теме.

А, ну и навзание у этой штуки криповатое. В картинке к посту собственно отсылка к неповторимому оригиналу.

#разрушители_миифов
  • 🔥 5
  • 😁 2
  • 🤯 2
  • 🐳 1
Post #24 104
💡 Мысль дня: Устаревание контента и забывание – ключевой процесс для корпоративной Базы знаний

Пообщались с Сергеем Долговым автором канала @aivkube. Ребята помогают доводить AI до продакшена в крупных компаниях.

Поспрашивал его о том, что будет важно учесть когда мы будем делать свою базу знаний для AI агентов. А планируем начать делать уже в этом месяце.

Оказалось, что ключевая идея которая поднимает качество ответа не в том, что ты используешь модные технологии – графовые подходы и прочие штуки, а грамотно убираться в устаревшем контенте.

Ключевые механизмы такой уборки:

1️⃣ Статус на каждой записи — Actual / Deprecated / Hypothesis / Cancelled. Чтобы ИИшка могла фильтровать по таким статусам и не тянуть лишнего. Ну и разумеется поле UpdateDate чтобы потенциально устаревшие записи можно было помечать ворнингами. Но важно, что именно статус закрывает проблему «модель уверенно цитирует устаревшее с номером пункта». Статус важнее даты (старое решение может быть всё ещё в силе).

2️⃣ Атомарные самодостаточные статьи — Каждая запись должна нести свой контекст внутри (продукт, дата, версия), без «см. выше» и неявных отсылок — вектор такие связи рвёт. Это правило ведения контента, внедряется сразу, без кода.

3️⃣ Набор заведомо конфликтных запросов как тест — Для тестирования ИИ пайплайнов можно собрать 10–20 запросов, где есть противоречащие документы, и регулярно проверять: система берёт верный источник или честно говорит «тут конфликт», а не отвечает уверенно по случайному. Такое тестирование дёшево, ловит регрессии. При смене модели к примеру.

Есть еще много оптимизационных техник, но они должны ложиться на крепкую основу. И вот про пометки и метадату контента в целом это довольно неплохой для меня инсайт оказался.
  • 🔥 3
  • 🌚 1
  • 👾 1
Post #23 120
👑 Интереная статья от Mindbox: как сделать и поддерживать базу знаний для ИИ

Mindbox выкатили статью про то, как сделали свою базу знаний и подружили её с чатом на AI. По итогу закрытие обращений без оператора выросло с 18% до 45% — только за счёт ИИ.

Тут цифры не столько интересны сами по себе. Скорее они тут как показатель того, что ребята продвинулись с помощью своих дейсвий в правильном направлении.

Ну а мы можем уже подчерпнуть все это и для себя.

Поскольку я на работе сейчас занимаюсь ровно такой же задачей, читал с интересом и карандашом. Вот что они нашли и сделали:

1️⃣ Сначала был хаос в контенте. 5000+ сырых диалогов в месяц, дубли, обрывки. Навели структуру: 15 категорий → 120 подкатегорий, три слоя (FAQ-пары, статьи, перекрёстные ссылки). По сути сделали что-то типа графа контента, но структуру забили руками. Интересно — может, графовый движок было бы быстрее сюда занести.

2️⃣ Затащили авто-обновление контента. Сделали так, чтобы база знаний обновлялась сама — иначе пришлось бы нанимать штат редакторов. Цикл: классифицировать диалог → отфильтровать → решить действие (пропустить / добавить / удалить / проверить) → внедрить.

3️⃣ Авто-обновление раздувало статьи до 200+ пунктов частных случаев, и они переставали отвечать на основной вопрос. Вот это то, чего я при проектировании таких циклов боюсь больше всего. А ребята полечили это лимитом объёма. Просто и красиво.

4️⃣ Для обновления базы брали только диалоги, где подключался оператор (= бот не справился). Остальное — шум.

5️⃣ Полную автоматизацию не сделали — оставили валидацию + ежемесячный аудит качества. Это заменило штат из 3-5 редакторов. И это полностью совпадает с моими ощущениями: шаг ручной валидации перед полной автоматизацией обязателен, чтобы ты понял все краевые случаи. Применимо вообще к любой автоматизации — универсальный принцип.

6️⃣ Раскатывали постепенно по линиям поддержки (1-я → 2-я → 3-я).

7️⃣ Техника: RAG / семантический поиск; свою базу знаний отдали наружу по MCP для других внутренних AI-инструментов. Мы собираемся сделать ровно так же. Тут было бы интересно послушать, какие тулы они завели в MCP и как его спроектировали, чтобы он не жрал токены. Но в статье про это не было.

Что отметил для себя:

→ Структура и связность контента важнее модели.
→ Автопополнение без ограничителя объёма убивает качество.
→ Чтобы контент не забивал контекст, удаление должно быть частью жизненного цикла, а не разовой уборкой.
→ Неожиданный инсайт: учиться надо на провалах (диалоги, где не справился бот), а не на всём трафике.

@neuralfordevs

#базазнаний #rag #mcp #агенты #mindbox
Хабр AI-ассистент поддержки: Mindbox навели порядок в базе знаний и генерируют ее с помощью нейросети Два года назад мы запустили бота поддержки, чтобы упростить работу специалистов клиентского сервиса. Поначалу бот закрывал только 18% обращений, и в остальных случаях переводил запрос...
  • ❤ 3
Post #19 194
AI, похоже, реально ускоряет разработчиков. Но не так, как обычно продают в презентациях.

В новой статье от NBER "Writing Code vs. Shipping Code" исследователи посмотрели на 100 000+ GitHub-разработчиков и сравнили разные поколения AI coding tools: автокомплит, интерактивных агентов и автономных агентов.

Да, судя по тексту, AI резко увеличивает количество написанного кода. Автокомплит даёт примерно +40% к числу коммитов. Вместе с интерактивными агентами совокупный прирост доходит до +140%, а с автономными — до +180%. В отдельных местах цифры вообще безумные: sync-агенты дают +741% строк кода.

Но больше кода ≠ больше продукта.
Эти +741% строк превращаются всего в +65% pull requests и примерно в +20% релизов. А общий эффект +180% по commits сжимается до +50% по проектам и до +30% по настоящим релизам.

Почему? Потому что bottleneck переехал.
Раньше узким местом было написание кода. Теперь AI это резко удешевил. Но остались другие этапы: понять, что вообще строить (дискавери), проверить, интегрировать, отревьюить, зарелизить, довести до нужного качества, найти пользователей.

И вот эти этапы всё ещё человеческие, медленные и дорогие.
Самое забавное: авторы проверили 3 крупных marketplace приложений и увидели рост количества новых приложений, но не увидели роста их суммарного использования. То есть приложений стало больше, а внимания пользователей — нет.

По сути, AI сделал производство кода дешевле. Но не сделал дешевле доверие, дистрибуцию этого кода, продуктовый вкус, поддержку и market fit. Так что “AI пишет код” — правда. А вот довезти этот код до пользователей — всё ещё отдельная боль.
  • 💯 5
  • 🔥 1
Post #16 81
  • 😁 1
Post #14 79
Ай, забыл, что комментов нет.

Сверху вниз:

Opus 4.8
Opus 4.8 with caveman

Sonnet 4.6
Sonnet 4.6 with caveman

Простите за спам( Телега обещала отправить одним сообщением. Блин. И в виде гифок
  • 💘 2
  • 👾 1
Post #13 76
Рубрика: Разрушители мИИфов. Проверяем Caveman реально экономит токены?

Любил в детсвте эту передачку. А в ИИ дохренищи мифов. Вот один из таких как мне кажется мы сегодня и разберем.

Есть такой скилл Caveman который обещает дикую экономию токенов.

Идея вроде логичная – LLM начинает говорить как пещерный человек и из-за этого типа меньше генерирует мусора и таким образом тратит меньше токенов.

Звучит сомнительно. Долго искал какие-то умыне и крутые бенчмарки, но кроме бенчмарков самого автора, который довольно хорошо умеет в SEO я ничего не нашел.

Короч, решил затестить сам. Попросил разные модельки написать мне игру про роботов:

Сделай мне в новой папке игру про огромного робота с видом сверху папку положи в папку repos и назови Opus 4.8. Не задавай мне вопросов, делай так чтобы получилось интересно и необычно. Сделай задачу до конца


Я закинул этот промпт в 4 разных модели:

Opus 4.8
Opus 4.8 With Caveman
Sonnet 4.6
Sonnet 4.6 With Caveman

На выходе получилось 4 игры про робота. На удивление они оказались довольно похожи, но каждая со своими особенностями.

На удивление версии игры от Sonnet были прям прикольные

По затратам токенов

Sonnet 4.6 42.2k tokens (16m 12s)
Sonnet 4.6 With Caveman: 52k tokens (12m 50s)

Opus 4.8 32.5k tokens (5m 16s)
Opus 4.8 With Caveman: 29k tokens (4m 34s)

Ну что же. В случае с Opus 4.8 и правда что-то сэкономили. А вот с соннетом, хоть я и не ожидал мы не только не сэкономили, но еще и потратили больше.

Теперь про сами игры.

Игра от Opus 4.8 With Caveman вышла довольно говеной и с кучей ошибок, и геймплейных проблем. Я приложу видосы в комментах, чтобы вы могли убедиться в каловости итога.

А вот Opus 4.8 я бы сказал на порядок лучше. Он даже добавил прогрессию. Правда она заключалась в том, что робот просто растет. Но в целом игра смотрится просто нормально.

Из интересного:

Быстрее всех справился Opus 4.8 With Caveman и вообще опусы справились довольно быстро. Сильно быстрее соннетов

У соннетов игры сильно хуже

Все игры называются либо Titan либо Colossus. А соннет под кейвменом назвал игру Titan: Protocol Colossus 👋

Во всех играх есть возможность топнуть ножкой и пустить ударную волну +вайб

На соннете запустил еще разок тест. Результат примерно тот же.

Sonnet 4.6 40.3k tokens (15m 36s)
Sonnet 4.6 With Caveman: 59.1k tokens (12m 50s)

Соннет с кейвменом по итогу просто не смог собрать игру -вайб

В целом все игры сгенерированные с кейвменом оказались хуже или вообще не заработали.

ИТОГО:

💥 UNPLAUSABLE 💥

Что же я думаю про caveman? Ну судя по всему это все же мИИф.

Да, иногда он позволяет сэкономить токены, но во-первых это не на всех моделях воспроизводится, а во вторых это сильно дропает качество выходного продукта. Результаты с кейвменом стабильно говеные, а на модели Sonnet тратили еще и больше токенов. Так что сносите эту штучку и не тратьте на нее время

#разрушители_миифов
GitHub GitHub - JuliusBrussee/caveman: 🪨 why use many token when few token do trick. Viral skill + proxy for coding agents that cuts 65%… 🪨 why use many token when few token do trick. Viral skill + proxy for coding agents that cuts 65% of tokens by talking like a caveman. - JuliusBrussee/caveman
  • ❤ 3
  • 🤝 1
  • 🦄 1
Post #12 87
Привет всем! Я тут недавно на работе начал чуть по чуть консультировать ребят разработчиков по использованию нейронок на рабочих задачах: как настроить, какие инструменты использовать, как сделать безопасно и как автоматизирвать часть своих задач.

Пошло хорошо. Точно получилось помочь и сдвинуть парочку айсбергов с места.

Так вот хочу эту практику распространить! Если хотите пообщаться и получить какую-то бесплатную консультацию по этому вопросу, то напишите мне @Undermove1. Вам новая информация, а мне понимание потребностей на рынке — получтся абсолютный вин-вин!)
  • 🔥 5
Post #11 99
Стоит ли пробовать Mobile Use для Codex?

Сегодня максимально хайпит фича кодекса с мобильным упралвением Codex и я считаю, что совсем не зря. У клода такая фича уже есть месяц как и позволяет фигачить ему команды прям через телегу.

Для меня эта фича стала в свое время прям прорывом. Последний месяц я все пет-проекты надиктовываю себе в телеге. И даже темы для статей ищу с помощью агнета, который крутится на локальном компе.

Сам я кодексом не пользуюсь. Отказался от OpenAI еще зимой, так как он задолбал тормозить везде где только можно. Но если вы подписаны именно на сервисы OpenAI, то не тушуйтесь, это все сто процентно стоит настройки!

🏋️‍♂️ И небольшой лайфхак.

Вы наверное видите периодически, что вайбкодеры не закрывают крышку компа. С этим можно справиться! В клоде есть такая фича, думаю что и в кодексе тоже. А у меня есть универсальный лайфхак для всех маководов. Вам нужно две команды:

caffeinate -s &


Не дает уйти компу в сон

sudo pmset disablesleep 0


Делает так, чтобы при закрытии крышки ваш комп тоже не уходил в сон.

Пользуюсь уже месяц работает, и универсально. Единственное, если вы ноут отключаете от зарядки, то все гаснет через некоторое время.
  • ❤ 5
  • ❤‍🔥 1
  • 💯 1
Post #10 103
«Контекстрот» Часть 3: 🛠 Что встроено в инструменты, что делать самому

В первых двух частях разобрались, что длинные агенты сдыхают не от лени промпта, а от математики внимания. Окей, проблема понята. Что с ней делать практически?

Часть работы за тебя уже сделали разработчики оболочек. Остальное — на тебе.

────────

Что реально работает (три приёма, проверенные на практике)

→ Compaction. Модель сама суммаризует историю на подходе к лимиту: оставляет архитектурные решения, выкидывает дубли тул-выходов. С февраля 2026 это серверная фича в Claude Sonnet 4.6 — настраивать ничего не надо.

→ Sub-agents. Оркестратор и специалисты со своими изолированными окнами. Каждый возвращает 1-2K токенов сжатого результата вместо целого транскрипта. Anthropic в 2026 Agentic Coding Trends Report называют это вытеснением одношаговых агентов мульти-агентскими.

→ External memory как markdown. Карпаты в апреле предложил LLM Wiki: агент сам пишет и поддерживает markdown-вики (ROADMAP.md, ARCHITECTURE.md), читает её, а не сырые исходники. Компаундирующая память вместо stateless retrieval.

────────

Что у тебя уже встроено в инструменты

Если работаешь с современной агентной оболочкой — кое-что работает за тебя автоматически:

→ Claude Code — автокомпакция с февраля 2026, subagents через Task tool, файловая память через CLAUDE.md. Все три приёма работают вместе и без настройки.

→ Cursor 3 (апрель 2026) — background agents с изолированными контекстами и multi-pane parallel agents. Длинная задача дробится на параллельные потоки, каждый со своим окном.

→ GPT-5-Codex (апрель 2026) — Dynamic Reasoning Time до 7+ часов на одной задаче. Внутри явно есть антирот-механизмы, но OpenAI про устройство молчит.

→ OpenCode, Aider, Cline — файловая память (markdown в репе) есть. Компакции у большинства нет — длинную сессию надо чистить вручную.

────────

Что приходится делать самому

Даже с лучшим инструментом часть работы остаётся на разработчике.

→ Резать большие задачи на discrete issues. «Сделай реферальную систему» — плохая задача. «Сделай эндпоинт POST /referrals» — хорошая. Один issue = один PR = одна сессия. Самый дешёвый и самый недооценённый приём.

→ Поддерживать ROADMAP.md и ARCHITECTURE.md в репе. Агент должен читать их в начале каждой сессии. Это та самая внешняя память, которую модель сама не построит — её надо завести однажды и обновлять.

→ Чистить контекст вручную перед длинной задачей. Особенно если до этого была отладка: длинный stack trace в окне совершенно бесполезен для следующей фичи. В Claude Code это «/clear».

→ Ревьюить diff в конце сессии, а не доверять отчёту агента. Агент скажет «всё готово», а в diff половина файлов с todo-комментами. Это и есть context drift в действии — модель помнит, что собиралась дописать, но к моменту вывода это уже растворилось.

────────

Эту памятку имеет смысл сохранить тем, кто работает с агентами регулярно — за пять минут даёт всё, что нужно знать в одном месте. И если какая-то из частей серии оказалась полезной — перешли её тому коллеге, который пишет промпты на 200K и удивляется почему агент путается.

Серия в одном теге → #контекстрот.

#контекстрот #agents #contextengineering #neuralfordevs
  • 🔥 4
  • ❤ 1
Post #9 117
Опубликовал небольшую статью на хабре о том, как автоматизировал разработку в своем пет-проекте. То бишь сделал так что ИИ разрабатывает его за меня. Заходите, читайте, комментируйте, я буду очень признателен за любые лайки и комментарии.

Надеюсь, вам будет интересно. Проект я продолжаю развивать, и в этом канальчике буду и дальше постить небольшие апдейты про него.
Хабр Можно ли отдать всю разработку полностью ИИ? Я попробовал Программист спит, работа идет Всем привет! Хочу поделиться историей, как я решил попробовать сделать для себя тот самый саморазвивающийся ИИ-стартап и что из этого вышло. Начну с предыстории. В 2022...
  • 🔥 3
  • ❤ 1
  • 👾 1
Post #8 98
«Контекстрот» Часть 2: 📐 После скольки токенов агент перестаёт думать — формула

Можно прикинуть в формуле, и довольно близко к реальности. Три уровня модели — от softmax-математики к практической эвристике.

────────

1. Из softmax-математики

Атеншн-веса считаются как softmax от скоров: для нужного токена (needle) и n−1 шумовых:

attention_to_needle ≈ 1 / (1 + (n−1) × exp(σ²/2 − s))

где s — насколько релевантен нужный токен (скор внимания), σ² — разброс скоров случайных токенов. Это сигмоидальный спад.

Точка, где внимание к нужному токену падает до 50%:

n* ≈ exp(s − σ²/2)

Это «горизонт» в чистой математике. Для уверенной семантической метки s ≈ 5-7, σ² ≈ 1-2 — n* выходит на 100-2000 «равных конкурентов». С учётом multi-head и позиционных эмбеддингов реальный n* для качественной выборки получается ~10K-50K токенов.

Софтмакс «теряет» одну важную точку среди ~30K шумовых уже к нулю влияния. Это не баг, это математика.

────────

2. Эмпирический фит на данные Chroma

Их кривая needle-in-a-haystack для топовых моделей (Claude Opus 4.5, GPT-5) хорошо ложится на логарифмический спад:

q(n) ≈ q₀ × (1 − α × ln(n / n₀))

С параметрами для топ-моделей в 2026: q₀ = 1.0 при n₀ = 4K, α ≈ 0.10.

Подставляем:
→ 32K токенов → q ≈ 0.79 (потеря 21%)
→ 100K → q ≈ 0.68 (потеря 32%)
→ 500K → q ≈ 0.52 (потеря 48%)
→ 1M → q ≈ 0.45 (потеря 55%)

Дополнительно — power-law вариант: q(n) ≈ (n / 4K)^(−0.11), даёт практически те же числа. Логарифм проще держать в голове.

────────

3. Mental-модель: «зоны опасности»

Для агентских пайплайнов в 2026:

→ Зелёная зона < 32K токенов — качество ≥ 80% от бейзлайна. Делай что хочешь, не парься.

→ Жёлтая 32K – 100K — качество 65-80%. Уже стоит структурировать контекст: явные секции, заголовки, summary в начале.

→ Красная 100K – 500K — качество 50-65%. Без компакции и sub-agents работать бессмысленно.

→ Мёртвая > 500K — окно «есть» только формально. 1M контекст у Gemini это маркетинг для needle-retrieval, не для агентских задач.

────────

Две эвристики на запомнить

→ Каждое удвоение контекста = минус 7-10 п.п. качества. Это прямое следствие логарифмического спада с α≈0.1.

→ 5 sub-agents по 30K каждый > один агент с 150K. Тех же токенов суммарно, но качество ~80% против ~60%. Точка перехода «обслуживать контекст vs запустить sub-agent с чистого листа» — в районе 100K.

────────

Скрин этой формулы можно прикреплять в любой технический спор про контекст. «У нас же 1М окно» работает только для retrieval, не для размышлений в этом окне.

В Части 3 разберу, что из этого уже встроено в Claude Code / Cursor / Codex и что приходится делать самому. Если тема актуальна — пересылай тем, кто строит агентские пайплайны или удивляется почему «он же помнит, но забыл».

#контекстрот #agents #contextengineering #neuralfordevs
  • 🔥 3
Older posts →

About this channel

How can I read @neuralfordevs without a Telegram account?
TGViewer shows the public web preview Telegram publishes for Нейросети на практике: recent posts, photos, videos and the subscriber count, with no app, login or account.
How many subscribers does Нейросети на практике have?
Нейросети на практике (@neuralfordevs) has 64 subscribers on Telegram, refreshed roughly every 30 minutes.
Does Нейросети на практике know I viewed it here?
No. Public channel previews carry no viewer identity, and TGViewer has no accounts or tracking of what you look up.
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →