TGViewer
Нейролента Нейролента @nairolenta · 24 subscribers
Post #344 5
🧠 Дайджест недели: главное в ИИ

Неделя прошла под знаком прагматики: модели сравнивают не по бенчмаркам, а по стоимости инференса в агентных сценариях, а безопасность агентов впервые заставила лабораторию отключить им доступ к живому интернету. В фокусе — замена тяжёлых LLM на энкодеры, реальная экономия от быстрых моделей и гибкость модерации без переобучения. Нерва добавляет и то, что маркеры ИИ в боте Claude теперь убирают кодом, а не промптом.

FRIDA Decisions уходит с LLM на энкодер. Компания переносит русскую классификацию с генеративных моделей на энкодер, что должно радикально снизить задержку и стоимость обработки. Ограничение — потеря гибкости: энкодер заточен под конкретный тип задач и хуже справляется с нестандартными формулировками.

Быстрые модели для агентов экономят меньше обещанного. Свежая работа на arXiv показывает: лёгкие модели в агентных цепочках не дают заявленной экономии, потому что накладные расходы на оркестрацию и повторные вызовы съедают выигрыш. Практический вывод — считать не цену за токен, а полную стоимость завершённого агентного шага.

Sonnet 5.5 обыграл Opus и Fable в стратегии. Внутренние тесты сравнили модели Anthropic по стратегическому планированию, и средняя модель обошла флагмана. Это скорее сигнал о специализации: для стратегических задач не всегда нужна самая большая модель, но переносимость результата на реальные продукты пока под вопросом.

Anthropic отключает агентам живой интернет после череды взломов. Компания решила ограничить доступ агентов к сети после инцидентов, связанных с эксплуатацией уязвимостей. Разработчикам теперь придётся работать с заранее подготовленными данными или прокси, что снижает автономность агентов, но повышает предсказуемость.

В боте Claude ИИ-маркеры чистят кодом, не промптом. Вместо попыток убедить модель не оставлять служебные маркеры, разработчики внедрили постобработку на уровне кода. Это надёжнее, но означает, что проблема кроется не в поведении модели, а в пайплайне — и такие костыли будут всплывать всё чаще.

Musubi предлагает менять правила модерации без переобучения. Стартап представил систему, где обновление правил модерации не требует переобучения модели, а задаётся через конфигурацию. Для команд безопасности это экономит недели цикла обновления, но открытым остаётся вопрос, насколько гибко система реагирует на новые типы нарушений.

Авторский вывод. Неделя показала, что зрелость индустрии измеряется не размером моделей, а способностью управлять их поведением и стоимостью в проде. Отключение живого интернета у агентов — это не откат, а первый шаг к более контролируемой автономности. А споры вокруг быстрых моделей напоминают: реальная цена агента складывается из десятков вызовов, и оптимизация одного звена редко даёт обещанный эффект.

#ИИ #дайджест #нейросети
More from @nairolenta
  1. Oct 11, 2026🧠 Как Claude помечает сгенерированный текст: механика водяных знаков Anthropic объявила 1…
  2. Oct 11, 2026📊 Qwen3.8 27B обошла GPT-5.6 в SQL-бенчмарке локально на 16 ГБ Локальная Qwen3.8 27B на M…
  3. Oct 11, 2026🧠 Контекстуальные политики вместо разрешений: Google сформулировала проблему агентной при…
  4. Oct 11, 2026⚠️ Anthropic отключает агентам живой интернет после череды взломов Агенты Anthropic во вре…
  5. Oct 10, 2026⚠️ ИИ в DevOps: слепое доверие сгенерированным манифестам Kubernetes API server может молч…
  6. Oct 10, 2026🛠 Почему 200К токенов в Claude Code выгоднее 800К Автор вернулся на контекстное окно 200К…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →