TGViewer
Channel Public Channel
Нейролента

Нейролента

@nairolenta

Аналитический дайджест об искусственном интеллекте без хайпа. Релизы моделей, исследования, LLM, инструменты, бенчмарки — с цифрами, механикой и честными выводами. Нейросети и machine learning для практиков.
Subscribers
21
Photos
1
Videos
0
Links
266
Recent Posts 20 shown
Post #279 7
🚀 Jev от TypeSafe AI — LLM, который отвечает числами

TypeSafe AI представила Jev — первую модель в категории «System One», или, по терминологии Maggie Appleton, «модели принятия решений». Вместо текста она возвращает числа с вероятностями: для вопросов «да/нет» (Noul, от Bernoulli), выбора из вариантов и оценки по шкале. По данным Simon Willison, стоимость модели рассчитывается только по входным токенам — $0.042 за миллион, выходные токены бесплатны, что дешевле GPT-5 Nano ($0.05 за миллион входных токенов). Одно и то же «состояние» можно отправлять с десятками вопросов, они обрабатываются параллельно.

→ Цена: $0.042 за млн входных токенов, выход — $0
→ Типы вопросов: да/нет (Noul), выбор с распределением вероятностей, оценка по шкале
→ Параллельная обработка множества вопросов к одному состоянию
→ Открытые аналоги: Kev на Qwen 3.5 (0.8B, 4B, 9B) и набор тестов JevBench уже появились

Главный риск Jev не в точности чисел, а в полном отсутствии объяснений: модель не может сказать, почему она поставила 0.87. Для промышленной эксплуатации это значит, что оценка должна быть внешней и строгой, а не полагаться на внутренние обоснования, которых нет. Пока сообщество делает из неё чат-бота и left-pad, в реальных системах нужно измерять систематические смещения и отказы — иначе чёрный ящик тихо засосёт ошибки.

#Jev #TypeSafeAI #decisionmodels #LLM #bias
Post #278 5
📊 За 11 недель агент нашёл 77 ошибок, человек — 16

Одиннадцать недель автор статьи на Habr вёл дневник каждой сессии с Claude Code, используя открытый набор навыков paranoid-qa, который заставляет агента тестировать с доказательной дисциплиной. Итоговый счёт: агент отработал 277 часов и подтвердил 77 дефектов, человек — 213 часов и 16 дефектов плюс один совместный. Автор предупреждает: первая версия подсчёта находок оказалась завышенной почти вдвое — до подтверждения доходит примерно каждый третий кандидат, выдвинутый агентом. Считать нужно только окончательные выводы сессий, промежуточные списки врут. Час работы агента обошёлся примерно в 80 рублей при подписке Max 5x за 100 долларов в месяц, но на каждый час агента ушло 0.77 часа человеческого времени на постановку задач, разбор и проверку.

→ Экономия на тех же задачах: ~16% — N × 0.77 человеко-часов + N × 80 ₽ вместо N часов по 1200 ₽/час
→ Результативность: сверка с эталоном — 1.36 находки/час, проверки интерфейса — 0.60, проектирование тестов — 0
→ Пропуски агента: 6 за 11 недель (8% от 77), все шесть нашёл человек; два из них — при повторной проверке, когда агент не пересматривает блок целиком
→ Из ~130 кандидатов, выдвинутых агентом, до подтверждения дошла треть; остальных отсеяли повторные проверки

Главный результат этих 11 недель — не скорость, а покрытие: агент проверяет то, что человек физически не успевает, и за счёт этого растёт общее качество, а не производительность одного тестировщика. Промежуточные показатели агентов врут почти вдвое — если ваша команда отчитывается по журналам без ручной фильтрации, ваши цифры дефектов завышены.

#ClaudeCode #AIагенты #QA #тестирование #paranoidqa
Post #277 5
📊 10-кратное ускорение кодирования дало проекту лишь 22%

Десятикратное ускорение написания кода сокращает полный цикл разработки только на 22,5%, а не в десять раз. «Диасофт» с марта 2026 года перестраивает разработку вокруг нескольких десятков ИИ-агентов и на практике упёрлась в закон Амдала: из 100 часов цикла кодирование занимает около 25, остальные 75 — требования, согласования, тестирование, документация и очереди. Код теперь генерируется за 2,5 часа вместо 25, но общее время падает лишь до 77,5 часа. Этой арифметикой на Habr делится директор по работе с партнёрами Александр Сахаров.

Узкое место сместилось на входы процесса: переработка расшифровок встреч, Excel-файлов и презентаций в спецификацию OpenSpec оказалась важнее генерации кода. Единый источник данных — спецификация, а не код: правки руками запрещены, потому что через месяц спецификация и сгенерированный код разъедутся. Инфраструктура вокруг модели ценнее самой модели: под большинством компонентов работает OpenCode, но его можно заменить на Claude Code или отечественный аналог. Агенты живут в изолированной корпоративной среде, а не на ноутбуке инженера, поэтому процесс не замечает, если у разработчика дома выключили свет.

Вместо самопроверки агентов — два контрольных барьера на каждом шаге, входной и выходной. Выходной контрольный барьер задаёт вопрос «сделал ли я то, что просили», и при отрицательном ответе вопрос попадает в отдельный файл questions.md. Пока в нём висит незакрытая строка, барьер закрыт, а задача уходит агенту-координатору. Человека зовут в двух случаях: когда кончились токены и когда агенты по пятому кругу переспрашивают друг у друга одно и то же.

Экономия появляется не от генерации нового кода, а от переиспользования готовых компонентов. В платформе «Диасофт» сотни сервисов — аутентификация, шлюз API, справочник валют, — и агент сначала ищет существующее, а не создаёт ещё один справочник, который «хорошо кормит ИИ токенами, но плохо объясняет бухгалтерии, почему их купили». Без такой базы, накопленной за 30 лет, подключение агентов не даст той же экономии.

Ускорение кода без перестройки входов — это ускорение производства несоответствий спецификации: тестов становится больше, а уверенности, что система делает нужное, не прибавляется. Коэффициент зависимости от одного специалиста остался равен единице, просто теперь у этой единицы есть ИИ-помощник.

#ИИагенты #Amdahl #кодогенерация #Diasoft #спецификация
Post #276 5
🛠 Агент для написания кода за 30 дней: код быстрее, релиз медленнее

Тридцать дней с агентом для написания кода в зрелой серверной системе (PostgreSQL, Redis, асинхронность, повторные попытки, транзакции) показали, что код появляется за минуты, а релизы не ускорились. По данным Habr, узкое место переместилось с написания кода на его проверку: изменения стали дешёвыми, понимание — нет. Агент локально пишет хороший код, но дорогие ошибки связаны не с синтаксисом, а с контекстом, который не помещается в файл: идемпотентность внешнего API, конкурентное использование AsyncSession, границы транзакций.

→ METR, 2025: 16 разработчиков, 246 задач — фактическое время +19% (ожидали +24% до, ощущали +20% после).
→ DORA 2024: внедрение ИИ +25% ↔ темп поставки −1.5%, стабильность −7.2%.
→ Автор к третьей неделе: для сложных изменений сначала просил агента разобраться в логике и перечислить предположения, потом — минимальный патч.

Агенты для написания кода не ускорили разработку ПО — они перераспределили стоимость. Код подешевел, понимание и проверка остались дорогими. Пока метрика успеха — количество сгенерированных строк, команды будут ускоряться локально и замедляться глобально.

#codingagent #METR #DORA #devtools
Post #275 5
🚀 Цены на GPT-6 упали вдвое: Luna теперь $0.10/млн

Вчера Anthropic представила Claude Opus 5.5, а через час OpenAI ответила парой GPT-6 Sol и GPT-6 Luna. Главный сюрприз — прайс-лист. По данным Simon Willison, GPT-6 Luna стоит $0.10 за миллион входных токенов — одна из самых дешёвых моделей OpenAI. GPT-6 Sol подешевел аналогично, а Claude Opus 5.5 получил скидку 20% и снижение цены на чтение кэша на 60%. Но у Opus 5.5 нашлась особенность: при максимальном уровне рассуждений модель дважды не смогла сгенерировать SVG пеликана, упершись в лимит 128 000 выходных токенов. Для российских специалистов по машинному обучению этот демпинг — пока внешний ориентир: локальные API вроде YandexGPT не включались в гонку цен.

→ Цены за миллион токенов (вход/кэш/выход): GPT-6 Luna $0.10/$0.01/$0.50; GPT-6 Sol $2/$0.20/$10; Claude Opus 5.5 $4/$0.20/$20.
→ GPT-5.6 Luna подорожает на 25% в ноябре: GPT-6 вдвое дешевле рекламных цен.
→ Grok 4.7 по цене входных токенов сравнялся с GPT-6 Sol: $2/M.
→ Каждая неудачная попытка Opus 5.5 при максимальном уровне рассуждений стоила $2.56 и заняла почти 20 минут.

Снижение цен выглядит как демпинг, но реальный ограничитель теперь не стоимость токена, а лимит выходных токенов и надёжность рассуждений. Когда модель за $0.10/млн не может дорисовать простой SVG, экономия на токенах оборачивается платными повторами и простоями в рабочей среде — и это уже не ценовая война, а война за предсказуемость.

Simon Willison
#OpenAI #Anthropic #GPT6 #ClaudeOpus #ценоваявойна
Post #274 6
🛠 ИИ генерирует тесты, но тестировщик проверяет проверки

В программе INFOSTART TECH EVENT 2026 два доклада звучат как диагноз: «Тестирование устаревших систем с помощью ИИ» и «Как заставить ИИ писать полезные модульные тесты для 1С, а не уверенную ерунду». Проблема не в качестве генерации — модель быстро готовит основу, но не понимает бизнес-логику, критичность сценариев и реальные риски конфигурации. Поэтому тестировщику приходится проверять не только код, но и сам смысл проверки.

Не вся рутина требует нейросетей. На дымовом тестировании связка Vanessa Automation и ИИ разделяет работу: автоматизация выполняет стабильные проверки, модель помогает готовить сценарии и разбирать результаты. Ценность определяет не новизна инструмента, а включение в ежедневный процесс — иначе получается ещё один генератор бесполезных тестов, который надо проверять.

Отдельный сдвиг — границы ролей. Разработчик отвечает за тестируемость кода, аналитик — за однозначность требований, тестировщик — за стратегию проверок и риски. ИИ добавляет сюда новую задачу: оценивать, что именно проверяет сгенерированный тест, а не только то, завершается ли он с ошибкой. По данным Habr, обсуждение продолжится 8–10 октября в Санкт-Петербурге.

Генерация тестов переводит тестировщика от проверки кода к проверке проверок — это новая роль специалиста, оценивающего тесты. Если команда не измеряет долю сгенерированных тестов, прошедших проверку без переписывания, ИИ не ускоряет выпуск, а добавляет ещё один этап проверки.

#QA #генеративноетестирование #1С #ИИ #INFOSTART
Post #273 6
🛠 Код теперь генерируют агенты, а проверка съела всё время

Автор на Habr два месяца собирал продукт с ежедневной генерацией практик осознанности: код писали агенты почти мгновенно, а всё время ушло на то, что код не решает — контроль безопасности генерации, поведение при браке, цены подписки, голос, время открытия. Это наблюдение за сдвигом: производство кода перестало быть узким местом, а основные затраты перешли на проверку и спецификацию. Ограничение здесь очевидное — Habr-разбор построен на одном личном проекте, это замер, а не отраслевая статистика.

Данные в тексте всё же есть. В первой части исследования METR 16 опытных участников проектов с открытым исходным кодом решали 246 реальных задач из своих репозиториев с доступом к ИИ и работали на 19% дольше, ожидая ускорения на 24%. Во второй части у части тех же разработчиков вышло ускорение на 18%, но с широким доверительным интервалом и сильным эффектом отбора. В опросе Stack Overflow 2025 главным раздражителем 66% назвали решения, которые выглядят правильными, но работают не совсем. Успешные тесты и «почти правильный» код замечает только человек, понимающий, что должно произойти.

Отсюда аргумент в пользу разработки на основе спецификаций: спецификация становится основным документом, а код — производным. Но автор честно проговаривает контраргумент: из кода нельзя восстановить замысел, только поведение. Знание о том, почему проверка продублирована или почему повторная попытка ограничена именно так, живёт в инцидентах и решениях, а не в строках. Поэтому найденное знание нужно возвращать в спецификацию и только потом генерировать код заново, иначе через пару недель спецификация — ещё один устаревший документ.

Главный раскол 2026 года не между теми, кто пишет код руками, и теми, кто генерирует, а между теми, кто умеет отличать правдоподобное от правильного, и теми, кто проверяет результат по ощущению. Скорость генерации без проверок — это способ быстрее накапливать технический долг, не более.

#vibecoding #specdriven #METR #StackOverflow
Post #272 5
🛠 Claude Code начал поддерживать AGENTS.md — шаг к общему стандарту инструкций

Claude Code версии 2.1.277, выпущенной 18 сентября, по данным Simon Willison, научился читать AGENTS.md — файл с проектными инструкциями, который до этого был в основном вотчиной других программных агентов. Механика простая: если в папке нет CLAUDE.md, Claude Code проверяет наличие AGENTS.md и использует его как источник правил. Это реализовано как встроенное дополнение на базе Claude Code mods — новой системы настройки оболочки, которая позволяет менять поведение среды выполнения без изменения самой модели. Исходный код дополнения открыт, поэтому разработчик может собрать собственную версию обработки инструкций под свои нужды.

→ Версия: 2.1.277, выпуск 18 сентября 2026
→ Приоритет: CLAUDE.md имеет преимущество над AGENTS.md, если оба файла существуют
→ Реализация: встроенное дополнение поверх Claude Code mods (настройка среды выполнения)
→ Исходный код дополнения доступен по ссылке в посте Simon Willison

Поддержка AGENTS.md в Claude Code — это попытка Anthropic снизить неудобства для разработчиков, которые уже используют несколько агентов: один файл инструкций можно поддерживать для всех. Но совместимость пока односторонняя: другие инструменты не спешат читать CLAUDE.md, а приоритет в Claude Code остаётся за проприетарным форматом. Стандарт де-факто ещё не победил.

#ClaudeCode #AGENTS.md #DevTools #AIagents #Anthropic
Post #271 6
🚀 Xiaomi MiMo-V2.6-Pro — новый лидер открытых моделей за 3 млн долларов

По данным Latent Space, Xiaomi выпустила MiMo-V2.6-Pro — изначально омнимодальную модель, которая дебютировала на первом месте Intelligence Index от Artificial Analysis с 46 баллами, обойдя все открытые аналоги. Архитектура MoE: 1.02T общих параметров при 42B активных, лицензия MIT. Обработка запросов стоит $0.435 за миллион входных и $0.87 за миллион выходных токенов.

Ключевой фактор — не предварительное обучение, а набор инструментов для RL. Xiaomi потратила на RL-фазу 130 часов, 75B токенов и $2.6M, проводя обучение на JAX + TPU, где масштабирование — «в основном изменение конфигурации, а не переписывание кода». Лаборатория открыла среды и методики, включая 7K сред для RL, но не сами наборы данных. Прозрачность нетипичная: финальные запуски RL публиковали в реальном времени.

Ограничение: Intelligence Index — агрегированная метрика, независимых сторонних тестов пока нет, а отсутствие наборов данных мешает полному воспроизведению. Но веса открыты, цена токена проверяема за вечер, и этого достаточно, чтобы не верить на слово.

Пока индустрия меряется размерами бюджетов на предварительное обучение, Xiaomi показала, что новый рычаг — открытая инфраструктура для RL: $3M хватило, чтобы выйти в число лидеров среди моделей с открытыми весами, и это цена, которую может позволить себе не только гигант. Открытые среды теперь важнее открытых весов — именно они решают, кто сможет воспроизвести и улучшить результат.

#MiMo #Xiaomi #openweight #RL #ArtificialAnalysis
Post #270 5
📊 Четыре модели на пяти задачах: цена не равна скорости и качеству

Автор на Habr проверил четыре модели одного семейства — Haiku 4.5, Sonnet 5, Opus 5 и Fable 5.1 — на пяти рутинных задачах на Python, по два запуска для каждой. В 32 запусках из 32 все модели справились с четырьмя задачами: разбиение на страницы, переименование с getattr, нормализация телефона, переработка кода. Разница проявилась только в задаче с делением счёта, где требовалось учесть отрицательные суммы: младшая модель оба раза ошиблась, а старшие заметили подвох и объяснили решение. При этом самая дорогая модель Fable 5.1 оказалась самой быстрой — 341 секунда против 395 у самой дешёвой Haiku, потому что генерировала почти вдвое меньше токенов (23 010 против 39 137). Но цена за токен эту скорость не предсказывает: вторая по цене Opus 5 была самой медленной, 557 секунд.

→ Решено: Haiku 4.5 — 8/10, Sonnet 5 — 9/10, Opus 5 — 10/10, Fable 5.1 — 10/10
→ Время (10 запусков): 395 с, 450 с, 557 с, 341 с
→ Цена к младшей: 1×, 3.3×, 6.9×, 8.8×
→ Токены размышлений: Haiku 18 754, Fable 2 674

Главный вывод не в том, что «умные модели не нужны», а в том, что на рутине с чёткими тестами вы платите за разницу, которая проявляется только в неоднозначных требованиях. Считать нужно не цену за токен и даже не токены в секунду, а стоимость полностью завершённой задачи — и у младшей модели она на порядок ниже при одинаковом результате. Но как только в ТЗ появляется «и для отрицательных», экономия оборачивается скрытым тестом, который дешёвая модель не заметит.

Habr
#Claude #Haiku #Sonnet #Opus #ценаинференса
Post #269 4
🛠 Домашний сервер для LLM на списанных V100 SXM2 дешевле RTX 3090

Списанные NVIDIA Tesla V100 SXM2 с 32 ГБ HBM2 и пропускной способностью 900 ГБ/с попадают на вторичный рынок по цене, несопоставимой с 24-гигабайтной RTX 3090: по данным Habr, модули 16 ГБ встречаются от $100–150, а конфигурация из двух 32 ГБ видеокарт с переходниками, платформой и охлаждением выходит около $1600. Для сравнения, RTX 3090 на вторичном рынке может стоить больше $1000 за 24 ГБ, RTX 5070 — около $550–570 за 12 ГБ. Итог: 64–128 ГБ VRAM в домашней стойке за цену, которая раньше уходила на один современный графический процессор.

Volta 2017 года не соперничает с RTX во всех задачах: 5120 CUDA-ядер, 640 Tensor-ядер, 300 Вт TDP на карту, нет DLSS Frame Generation и трассировки лучей. Но локальный запуск LLM сильнее упирается в объём VRAM и пропускную способность памяти, чем в поколение Tensor-ядер. Модель Qwen3.8-27B в квантовании Q4_K_M занимает около 24 ГБ, целиком помещается в одну V100 32 ГБ и выдаёт примерно 36,6 токена/с. RTX 5070 с 12 ГБ и 672 ГБ/с такие модели просто не удерживает без выгрузки части данных в ОЗУ.

Главный минус — не железо, а совместимость. PyTorch 2.11 в готовых двоичных сборках под CUDA 12.8/12.9 уже не поддерживает Volta: для V100 нужны CUDA 12.6 или собственная сборка под sm_70. Переходники SXM2→PCIe могут ограничивать шину режимом x8, не все выводят второй разъём под NVLink Bridge, а воздушное охлаждение пары карт — это киловатт тепла и шум, для четырёх уже больше 1,5 кВт. СЖО не опция, а необходимость для работы 24/7 рядом с человеком.

В оценочной таблице источник даёт такую производительность на $1000: 4× V100 — 107, 4× RTX 5070 — 92, 4× RTX 4070 Ti — 77, 4× RTX 3090 — 30. Это условные цифры, как и расчёт системы на 4× V100 за $2700 против $6700 за 4× RTX 3090. Но они указывают на главное: на вторичном рынке видеопамяти, подходящей для ИИ, иерархия перевернулась. Покупать Volta в 2026 году — значит делать ставку на объём VRAM и мириться с программным отставанием, которое PyTorch уже начал ускорять; такая сборка выигрывает только для тех, кто готов вручную собирать драйверы и не считает счета за электричество.

#V100 #NVIDIA #локальныйLLM #инференс #Volta
Post #268 4
🛠 shot-scraper 1.12 теперь сохраняет скриншоты в WebP

13 сентября 2026 Simon Willison выпустил shot-scraper 1.12 — утилиту командной строки для снятия скриншотов, записи демонстрационных видео и разбора сайтов через JavaScript. Появилась поддержка WebP: страница сохраняется командой shot-scraper https://simonwillison.net -o screenshot.webp --quality 80. Без --quality файл будет сохранён без потерь.

По данным Simon Willison, WebP-скриншоты почти всегда заметно меньше JPEG или PNG при сопоставимом качестве; примеры приведены в запросе на включение изменений, но конкретных цифр экономии он не приводит. Для процессов, где копятся тысячи снимков для визуального регрессионного тестирования или наборов данных мультимодальных моделей, уменьшение размера — это снижение расходов на хранение и передачу, а не приятный бонус.

Опция --quality связана со сжатием: при низком качестве текст на скриншоте исказится, и для OCR или разметки с помощью ИИ это критичная потеря. Willison добавил функцию не по плану, а чтобы снять картинку для своего нового инструмента commit-rewriter — именно так утилиты обрастают нужными возможностями без лишнего.

WebP в скриншотах — не прорыв, а запоздалая гигиена. Настоящий сигнал в том, что один разработчик добавил функцию за один вечер под свою задачу, пока в коммерческих сервисах такие изменения ждут цикла выпуска.

#shotscraper #WebP #скриншоты #CLI #автоматизация
Post #267 5
🧠 Claude Code читает не страницу, а её пересказ

Разбор на Habr вскрыл ключевое различие двух инструментов Anthropic. На выборке Profound из 24 135 ответов на 1 724 запроса веб-поиск срабатывал у Claude в 93% случаев, у Claude Code — лишь в 13%. Средняя длина ответа тоже разошлась: 459 слов против 322, а в ответах Claude Code списки встречаются в 94% случаев, таблицы — в 54%, у Claude эти доли 56% и 11% соответственно.

Механика объясняется документацией. Claude через Messages API получает цитаты с адресами и кусками текста до 150 символов. Claude Code открывает страницу инструментом WebFetch, но до основной модели доходит пересказ от вспомогательной ИИ-модели меньшего размера, а длинные страницы обрезаются. Исключение — зашитый список примерно из 80 доменов документации вроде Python Docs, MDN, React, которым отдаётся Markdown без пересказа. Обычный сайт в этот список не входит и теряет детали.

Для владельцев сайтов Anthropic держит трёх ботов: ClaudeBot для обучения, Claude-User для ответов пользователям, Claude-SearchBot для индексации. Все соблюдают robots.txt — в отличие от ChatGPT-User у OpenAI, который может файл игнорировать. При этом llms.txt почти не работает: по данным Ahrefs, у 97% доменов с корректным llms.txt за месяц не было ни одного обращения, а Claude-User набрал лишь 2,5% всех запросов к этому файлу.

Anthropic не публикует user-agent для WebFetch в Claude Code — значит, владельцы сайтов не могут точно отличить агента от других заходов в журнале доступа. Любая статистика о визитах Claude Code построена на косвенных признаках, а не на факте. Пока рынок обсуждает SEO под LLM, реальная задача проще: разделить ботов в robots.txt и проверить, что содержимое отдаётся без JavaScript.

#ClaudeCode #Anthropic #SEO #robotsTxt #llmsTxt
Post #266 4

Forwarded from КиберГвардьола

Извините за паузу с 15 сентября. Мы её не планировали: в тот день наш провайдер остановил свою нидерландскую площадку, и наши серверы редакции были удалены. Провайдер причину внятно так и не объяснил, техподдержка не отвечает до сих пор.

Такое ощущение, что это не единичный случай, а продолжение весенней линии облав на российские серверы. 18 мая нидерландская служба FIOD изъяла более 800 серверов в дата-центрах Дронтен и Схипхол-Райк у хостингов WorkTitans и MIRhosting по делу о нарушении санкций, двое задержаны. 2 июня без предупреждения обесточили стойки в дата-центре nLighten: легли десятки хостеров и VPN-сервисов, работающих с российским рынком, у одного провайдера отключилось не менее 15 тысяч сайтов. Формальный повод каждый раз свой, результат для клиентов один: серверы исчезают за ночь, без уведомления и без шанса забрать данные.

Что сделали мы. Канал переехал на новую площадку. Интересно, что это второй переезд: первый не удался, потому что у сервера после переезда отказали диски... Сегодня в канал ушли несколько материалов, готовившихся к 15 сентября, они помечены датами.

Урок для вашей инфраструктуры тот же, что и для нашей: юрисдикция площадки стала таким же риском, как отказ диска. Копия в другой юрисдикции, ключи вне сервера и проверенная процедура восстановления, а не просто «бэкап есть».

Дальше в обычном режиме. Спасибо, что читаете.
  • 👍 1
Post #265 6
🧠 Язык теряет числа, и это не лечится размером модели

LLM обучаются на человеческих описаниях мира, а описание — это кодирование количественных данных с потерями. Потеря необратима: никакая последующая модель, сколь угодно большая, не восстановит из текста то, что в текст не попало. Это свойство представления, а не ёмкости модели — такова рамка статьи от 10 сентября на arXiv.

Авторы добавляют три требования, которые язык не даёт по построению: воспроизводимость, прослеживаемость каждого вывода до исходных числовых записей и калиброванная неопределённость. Для ценообразования рисков, распределения капитала и медицинской сортировки это не опции, а условия допуска в эксплуатацию. Отсюда — отдельный класс Large Quantitative Model (LQM).

Для практиков это значит: если система требует аудита решения, LLM поверх таблиц и отчётов не даст ни происхождения данных, ни честной уверенности — сколько бы вы ни дообучали модель. Нужна модель, которая держит прямую связь с исходными числовыми записями, а не с их пересказом.

Пока это манифест, а не метод: архитектуры и реализации LQM в статье нет, только формальное определение. Но аргумент о необратимой потере легко проверить на простом эксперименте — если векторные представления таблиц восстанавливают распределения не лучше текстового пересказа, то в регулируемых областях LLM останется интерфейсом, а не механизмом принятия решений.

arXiv
#LLM #LQM #quantitativeAI #аудит
Post #264 4
🛠 Саймон Уиллисон выпустил инструмент для очистки коммитов от следов агентов

Simon Willison собрал небольшой веб-инструмент commit-rewriter 0.1, чтобы очищать сообщения коммитов перед публикацией репозитория. Первый случай — выпуски Datasette с исправлениями безопасности: исходные коммиты содержали типичный мусор от агентов для программирования и ссылки на идентификаторы закрытых задач, которые нельзя раскрывать публично. Инструмент запускается одной командой: `uvx commit-rewriter path/to/repo` — путь можно опустить, если вы уже находитесь в каталоге проекта. После правок он создаёт ветку с отметкой времени, сохраняющую текущее состояние репозитория, чтобы можно было откатиться, и переписывает все коммиты от первого отредактированного до самого свежего.

Инструмент решает конкретную проблему: ИИ-агенты создают коммиты с внутренними идентификаторами, шумом и небрежными формулировками, а публиковать такую историю в открытый репозиторий — значит раскрывать закрытую информацию или засорять журнал изменений. Проблема знакома каждому, кто пробовал поручить агенту даже простую задачу в реальном проекте: сообщения коммитов вроде "updated code" и случайные упоминания задач остаются в истории навсегда. Здесь переписывание истории оформлено в безопасный процесс с отдельной веткой, но сам факт, что перед публикацией нужно очищать журнал Git, — симптом незрелости программирования с агентами.

Сообщение по данным Simon Willison вышло 14 сентября 2026 года. Помимо нового инструмента, он упоминает свои недавние материалы: генерацию беговых маршрутов с GPT-6 Astra в ChatGPT, атаки агентов OpenAI на RubyGems в мае и размышления о проблеме тысячелетия Навье — Стокса. Это показывает контекст: инструмент появился из практики поддержки своих проектов, а не из абстрактного желания сделать ещё один инструмент для разработки.

Пока агенты не научатся создавать осмысленные и безопасные коммиты сразу, подобные утилиты будут множиться. Но переписывание истории — это всегда риск для совместной работы: если кто-то уже создал копию репозитория, ваша очистка нарушит синхронизацию его изменений. Принудительная отправка изменений в публичный репозиторий — не лучшая практика, а вынужденная мера, и хорошо, что Willison хотя бы помещает изменения в отдельную ветку.

#commitrewriter #git #codingagents #devtools
  • 👍 1
Post #263 5
🧠 Occamy-1.0: 35B модель для совместной работы нацелилась на низкую стоимость эпизода

Occamy-1.0 — новая модель на 35 млрд параметров, оптимизированная не под пиковые показатели на тестах, а под экономику длинных задач совместной работы. База — Qwen3.6-35B-A3B: из 35 млрд параметров на один токен активируются только 3 млрд, что радикально снижает стоимость вывода при сохранении широких возможностей для работы в роли агента. Это MoE-архитектура. Авторы собрали данные, основанные на выполнении задач, и воспроизводимые траектории длинных сценариев, затем провели поэтапное дообучение для развития координации, восстановления и удержания состояния. На четырёх репрезентативных тестах Occamy-1.0 занимает выгодную точку на кривой Парето по соотношению стоимости и качества, то есть конкурирует с существенно более крупными системами при меньшей стоимости. Веса и часть обучающих данных открыты для исследований.

→ База: Qwen3.6-35B-A3B, 35B всего, 3B активных
→ Дата выхода: 4 сентября 2026
→ Оценка: 4 теста, выгодная точка на кривой Парето по стоимости
→ Данные: траектории, основанные на выполнении задач, открыты веса и подмножество данных

Смещение фокуса с пикового качества на совокупную стоимость полного рабочего эпизода — это правильный ход для совместной работы, где модель вызывается десятки раз. Но выгодная точка по стоимости на четырёх выбранных тестах — это обещание, а не доказательство: независимые тесты на удержание контекста после более чем 10 шагов и стабильность кода покажут, насколько модель реально пригодна для промышленного использования, а не для демонстрации на трёх примерах.

arXiv:2609.11977

#Occamy #co_work #MoE #openweights #агенты
Post #262 9
🧠 MEO: восемь алгоритмов ранжирования вместо одного создают проблему для брендов

Автор статьи на Habr предлагает модель MEO (Multiple Engine Optimization) для описания проблемы, с которой сталкивается любой бренд: единого алгоритма-судьи больше нет. Вместо классического поиска с инвертированным индексом и BM25 работают как минимум восемь классов систем: генеративные ответы на параметрических знаниях или RAG, рекомендации на коллаборативной фильтрации, коммерческие выгрузки, геоданные, социальные графы и агентные вызовы функций. У каждого — своя механика извлечения, ранжирования и представления сущностей, и влиять на них нужно по-разному.

Технически это заметнее всего в генеративных системах: часть LLM отвечает из параметрических знаний, повлиять на которые можно только через присутствие в обучающих корпусах, а часть — через RAG, где работают классическая индексируемость и структурированность контента, но с другими требованиями к разбиению на фрагменты. То есть один и тот же текст на сайте по-разному срабатывает для разных классов. Метрики автор предлагает четырёхуровневые: находимость, представленность, конкурентная позиция (Share of Model — доля упоминаний среди конкурентов) и итоговый бизнес-результат. Но сам признаёт: методология сбора Share of Model не стандартизирована, а прямая связь между schema.org-разметкой и весом бренда в ранжировании публично не подтверждена.

По данным Habr, MEO — пока открытая рабочая модель, а не спецификация или метрика. Для разработчиков главное здесь не маркетинг, а инженерия: если у вас есть API или каталог, вы уже потенциальный «движок» для агентов, и задача — стабильный API, машиночитаемая документация и структурированные ответы, а не оформление сущностей.

Термин MEO выглядит как попытка продать консультационные услуги под новую аббревиатуру, но реальная проблема согласованности сущностей в разных алгоритмических системах только обостряется с ростом агентных интерфейсов. Пока нет стандартизированных метрик, «оптимизация» под MEO рискует остаться набором верований, а не инженерной практикой.

#MEO #RAG #SEO #бренд #агенты
Post #261 7
🛠 Голосовые агенты в телефонии: 19% звонков и 97% довольных клиентов

Почти каждый пятый клиент, обратившийся к голосовому ИИ-помощнику, не решил свой вопрос — это опрос Qualtrics на 20 тыс. респондентов из 14 стран. Несмотря на это, бизнес продолжает вытеснять людей: Salesforce заменила 4 тыс. операторов и сократила расходы на центры обработки вызовов на 17%, около половины обращений обрабатывают нейросети. Klarna в 2023 году уволила 700 операторов, но через полгода качество упало настолько, что общаться с клиентами пришлось инженерам и маркетологам, а в 2025 финтех снова начал нанимать сотрудников в техподдержку. В разборе на Habr этот разрыв между экономией и качеством — главный сюжет голосовой автоматизации.

Технологии за год сдвинулись: голосовые ИИ обрабатывают до 19% входящих звонков против 6% в 2024 году. Taco Bell развернула агентов почти в 900 ресторанах: тайные покупатели Intouch Insight проверили 120 заказов в трёх сетях быстрого питания, заказы с ИИ готовились в среднем на 21 секунду быстрее, и 97% остались довольны. Но это узкий сценарий — меню, ингредиенты, передача оператору; от запроса «восемнадцать тысяч стаканов воды» система зависает.

Архитектура меняется: Hippocratic AI собирает набор моделей — одна ведёт разговор с пациентом, другие проверяют точность и решают, когда подключить координатор. OpenAI добавила GPT-Realtime-2 и Realtime-Translate: распознают речь на 70+ языках, отвечают на 13. Следом появились открытые инструменты: Pipecat набрал 13 тыс. звёзд на GitHub, VideoSDK распространяется по лицензии Apache 2.0, AgentLine — по лицензии MIT в 2026 году. Pipecat поддерживает русский язык, так что российским командам машинного обучения это готовый старт без внутренних API поставщиков.

Голосовой ИИ уже не хуже человека в предсказуемых диалогах, но самостоятельная работа упирается не в модель, а в сценарии передачи оператору: Klarna откатилась не из-за слабых нейросетей, а потому что убрала 700 людей раньше, чем закрыла нестандартные случаи. Открытые платформы снижают порог входа в разработку, но оставляют накопленные инфраструктурные проблемы — Wi-Fi Calling и ePDG станут узким местом для голосового агента ровно в тот момент, когда клиент с плохой связью начнёт перебивать.

#голосовойИИ #AgentLine #Pipecat #TacoBell #Klarna
Post #260 7
🧠 Дайджест недели: главное в ИИ

На этой неделе внимание сместилось с громких анонсов на практику: локальное выполнение моделей, метрики качества, безопасность и экономику моделей. Три материала из семи — о том, как модели ведут себя в реальных сценариях, а не в контрольных тестах.

Набор данных из 558 траекторий: вскрыл систематические профили ошибок ИИ-учёных, которые не выявляют стандартные контрольные тесты, — это полезно для проектирования агентов. Но данные собраны в лабораторных условиях, поэтому на промышленную среду переносятся с оговорками.

Разбор DeepSeek R1: техника, деньги и обвал рынка — объясняет, как открытая модель с дешёвым выполнением изменила расклад сил. Полезно для оценки стоимости запуска своих моделей. Ограничение: анализ опирается на открытые данные, реальные затраты на обучение могли быть другими.

Локальные LLM на DGX Spark: 256K контекста — достижимо на локальном оборудовании, но ценой параллельной работы нескольких GPU. Это открывает дорогу к приватному выполнению моделей без облака, однако требует дорогого оборудования и навыков настройки.

GEO-мониторинг своими руками: материал о том, какие метрики снимать с ответов генеративных моделей в промышленной среде, — практично для команд, внедряющих LLM. Универсального набора нет, придётся адаптировать под свою предметную область.

Яндекс открыл Alice AI T5-35B: предобученная модель для быстрых ответов, веса доступны для дообучения. Это заметное событие для русскоязычного ML. Ограничение: базовая модель без инструктивной настройки, для диалогов нужно самостоятельное SFT, и условия лицензии требуют отдельного изучения.

GPT-6 Astra введена в эксплуатацию: заявлен идеальный результат в тесте на устойчивость к эксплойтам, что важно для безопасности. Но методология внутреннего теста не раскрыта, независимая проверка ещё впереди.

Агенты для Blender: программирующие агенты научились генерировать код для визуализации сцен через Python API, это расширяет автоматизацию на 3D-графику. Сложные сцены всё ещё могут нарушать работу генерации, ручная проверка обязательна.

Авторский вывод: Неделя показала смещение внимания с гонки параметров на практическую применимость: мониторинг, локальное выполнение моделей, безопасность. Открытая модель Яндекса и локальные запуски на DGX Spark — сигнал, что выполнение моделей всё чаще уходит на собственное оборудование. Но за «идеальными» тестами и «быстрыми ответами» всегда стоит вопрос: что именно измеряли и на каких данных.

#ИИ #дайджест #нейросети
Older posts →

About this channel

How can I read @nairolenta without a Telegram account?
TGViewer shows the public web preview Telegram publishes for Нейролента: recent posts, photos, videos and the subscriber count, with no app, login or account.
How many subscribers does Нейролента have?
Нейролента (@nairolenta) has 21 subscribers on Telegram, refreshed roughly every 30 minutes.
Does Нейролента know I viewed it here?
No. Public channel previews carry no viewer identity, and TGViewer has no accounts or tracking of what you look up.
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →