TGViewer
Channel Public Channel
Пятничный ИИ

Пятничный ИИ

@va_friday_ai

Канал, посвященный новостям машинного обучения, искусственного интеллекта и смежным областям. Фокус на технологиях и открытых решениях
Subscribers
225
Photos
3
Videos
0
Links
605
Recent Posts 20 shown
Post #619 26
Что: NVIDIA Open Agent Safety Platform позволит ограничивать поведение агентов на уровне железа
Ссылка: https://developer.nvidia.com/blog/nvidia-open-agent-safety-platform-a-reference-for-continuous-in-silicon-agent-monitoring
Почему интересно: На фоне недавних инцидентов, когда ИИ-агенты успешно ломали границы сред оценки и пробирались куда им не следовало, NVIDIA представила Open Agent Safety Platform. Дженсен "40 курток" Хуанг и команда предлагают платформенно решать проблему на уровне железа.
Платформа состоит из двух главных компонентов. OpenShell - open source рантайм с лицензией Apache 2.0, который запускает агентов в изолированных песочницах с защитой на уровне ядра. Второй компонент, Sentry, это внешний смотрящий контур безопасности, который работает на DPU BlueField-4. Sentry мониторит поведение агента в кремнии и может отрубить доступ за миллисекунды, если тот попытается сделать что-то запрещённое. Агент (пока) не подозревает, что за ним следят, потому что мониторинг происходит вне его зоны досягаемости. Т.е. контрольный контур физически отделён от хоста, поэтому даже если агент скомпрометирует саму машину, он не дотянется до смотрящего, потому что тот в другой кремниевой плоскости.
За благими намерениями можно разглядеть, как Nvidia упаковывает продажу своего нового железа (стойки с новыми процессорами Vera и сетевыми картами) в обёртку безопасности. Sentry вообще работает только на BlueField-4 DPU, который можно купить только у NVIDIA. Референсный дизайн, который требует проприетарного ускорителя для ключевой функции, плохо вписывается в термин "открытая платформа" 🙂 Скорее это открытый интерфейс к закрытому железу.
Отдельного обсуждения заслуживает тезис, что агенты софтверно не могут управлять собственным поведением. Идея контролировать путь к модели звучит красиво, но на практике это означает, что каждое действие агента будет проходить через дополнительный сетевой узел. Это неизбежно добавит задержку в инференс и тулколлинг.
Важно понимать, что предложенное решение не является панацеей. Так, заявленная производительность в миллисекунды может быть достаточной для агента, чтобы выполнить часть вредоносных действий. Изоляция сама по себе не откатывает последствия.
В сухом остатке получили полезную инициативу для построения корпоративных агентских платформ, где цена ошибки измеряется миллионами долларов. Станет ли она индустриальным стандартом - покажет время (партнёрская коалиция впечатляет, но сколько из 100+ компаний реально внедрят платформу, а сколько просто подписались на пресс-релиз - непонятно). А вот для стартапов и локальных исследователей, крутящих агентов на потребительских RTX-картах, эта платформа бесполезна.

#eng #nvidia #агент #безопасность #hardware #opensource
NVIDIA Technical Blog NVIDIA Open Agent Safety Platform: A Reference for Continuous In-Silicon Agent Monitoring To understand where agentic AI stands today, consider the last seismic shift in technology: the rise of the internet in the 90s. It was new and full of possibilities. You could build a website over a…
Post #618 53
Что: Осенний отчёт a16z о состоянии рынков - ИИ-пузырь, триллионные капитальные затраты и поиск замен GPU
Ссылка: https://a16z.com/state-of-markets-ii/
Почему интересно: Andreessen Horowitz вчера опубликовал 90-страничный осенний отчёт о состоянии рынков, в котором (с помощью избыточного количества диаграмм) пытаются ответить на главный вопрос индустрии, не находимся ли мы в самом раздутом пузыре в истории технологий.
Документ рисует масштабную картину того, как ИИ переписывает правила игры на публичных рынках. Наблюдается беспрецедентная концентрация капитала: горстка технологических титанов тратит более триллиона долларов для обучения и инференса моделей. В частности, капзатраты гиперскейлеров (Alphabet, Amazon, Meta, Microsoft, Oracle) в 2026 году оцениваются примерно в $780 млрд, что почти вдвое больше 2025 года ($416 млрд). Венчурные инвестиции в ИИ-стартапы также продолжают бить рекорды, но аналитики a16z отмечают тревожный тренд - деньги всё чаще уходят не в фундаментальные исследования, а в обёртки и инфраструктурные решения, которые оптимизируют затраты на облачные вычисления. Из-за этого отмечается переход "от битов к атомам", т.е. в выигрыше чипмейкеры, создатели физических интерфейсов, производители турбин, систем жидкостного охлаждения, и, конечно, памяти.
Структурно выделяют 3 важных тренда. Первый, конечно, про железо и попытку рынка диверсифицировать зависимость от NVIDIA. Второй - агентная экономика (рынок насытился чат-ботами и активно идёт в стартапы, способные создавать автономные системы). Третий - вертикальный ИИ в тяжёлых индустриях (биотех, материаловедение и оборонка).
Наконец, самая интересная часть про возврат инвестиций. Оцифрованный эффект "от ИИ" (очевидно, генеративного) пока фиксируют около 2% компаний из S&P 500, хотя почти 30% заявляют о каком-то влиянии. Т.е. разрыв между заявлениями и измеримым результатом огромен. При этом Amazon говорит о 40% росте среднего чека у пользователей Alexa для покупок, Meta - о 13% инкрементальном росте покупок от Advantage+, ServiceNow - о превышении 1 миллиарда долларов annual contract value для AI-продуктов, GitHub Copilot - о росте выручки более чем на 60% квартал к кварталу, Microsoft - о 30 миллионах платных клиентов для M365 Copilot. Правда, ни одно из приведённых значений не верифицировано независимо, юнит-экономика неизвестна, нигде не отделён эффект ИИ от других факторов. Так что может получиться как в анекдоте, "и вы говорите".
Отдельного упоминания заслуживает самоподдерживающийся цикл роста запроса на вычисления. Если спрос на токены растёт экспоненциально, а цены на компьют не падают (по приведённым данным, даже старые GPU стоят как в прошлом году), то модель, в которой дешёвый ИИ создаёт ещё больше спроса, упирается в физические ограничения (электричество, чипы, охлаждение, земля). Отчёт упоминает наличие физических барьеров, но не отвечает даже в форме гипотез, что произойдёт по достижении этого предела.
Методологически покритиковать аналитику тоже есть за что. Так, утверждается, что 55% роста ИИ сосредоточено на закрытых рынках, а анализируются рынки открытые. Для такой работы очень важная ремарка. Если большая часть стоимости создаётся за закрытыми дверями, то выводы о здоровье всей ИИ-экономики по публичным компаниям могут быть систематически смещены. Кроме того, аналитики строят свои прогнозы на успехах горстки компаний-лидеров, экстраполируя их темпы роста на всю экономику.
В итоге работа от a16z будет полезна как карта того, куда текут деньги и как думают люди, которые эти деньги распределяют. И ответ на ключевой вопрос (пузырь или нет) зависит от материализации ROI. a16z ставит на то, что это произойдёт, хотя стоит помнить, что авторы - представители одного из крупнейших венчурных фондов в мире, который владеет большим портфелем ИИ-стартапов.

#eng #ии #экономика #инвестиции #исследование #отчёт #a16z #инфраструктура
Andreessen Horowitz State of Markets II | Andreessen Horowitz 100+ Charts On The State of Markets (1H’26)
  • 👍 1
Post #617 81
Что: В MIT задумались о роли образования в эпоху, когда ИИ способен выполнить почти любое задание из учебной программы
Ссылка: https://aiandeducation.mit.edu/report/
Почему интересно: В январе 2026 руководство MIT поручило специальному комитету оценить текущее использование ИИ в вузе, выявить инновации в преподавании и предложить политику использования ИИ. В процессе работы пришло понимание, что эти вопросы слишком узкие. Изучать пришлось то, сохраняет ли смысл сама структура элитного технического образования, если когнитивную работу можно делегировать машине.
Отчёт отмечает, что студенты MIT - одного из лучших вузов США - используют ИИ повсеместно, но с "сильно смешанными чувствами" (от любопытства и благодарности до тревоги и смирения). Посещаемость консультаций у профессоров упала, участие в онлайн-дискуссиях снизилось, сократились неформальные учебные группы в общежитиях и, о ужас, в библиотеках 🙂 Преподаватели разделились на энтузиастов, скептиков и тех, кто просто отказывается иметь дело с ИИ. Комитет видит главный риск не в списываниях, а в "когнитивной капитуляции" - студенты обращаются к чат-боту при первом же признаке сложности, лишая себя размышлений и умственной работы, необходимых для интеллектуального прогресса.
Исследователи сформулировали несколько принципов, которых следует придерживаться в новую эру ИИ. В частности, принять как неизбежное, что ИИ развивается быстрее, чем общество успевает осмыслить последствия. Быть смелыми, потому что неопределенность не оправдывает бездействия. Ставить человечество на первое место, а технологии - на второе. Учиться, а не автоматизировать, потому что правильный ответ от чат-бота создает опасную иллюзию понимания. И, наконец, признать, что нет универсального решения при применении ИИ: поэтический семинар, продвинутый математический курс и архитектурная студия предполагают совершенно разные форматы взаимодействия.
Рекомендации делятся на реактивные и долгосрочные. В частности, следует как можно быстрее пересмотреть цели курсов, чтобы они были "AI-aware", т.е. учитывали существование ИИ и возможные способы его использования и обхода. Предлагается разработать новые формы оценки, менее уязвимые для ИИ, включая устные экзамены и семестровые проекты. Кроме того, следует полностью отказаться от использования детекторов ИИ в дисциплинарных целях, поскольку они ненадежны и могут быть дискриминационными.
Следует отметить, что сформулированные рекомендации носят достаточно абстрактный характер и скорее предлагают направление движения, а не алгоритм. К методологии работы тоже есть вопросы. Данные основаны на том, что комитету рассказали, а не на систематическом измерении. Для документа такого уровня и в таком вузе это удивительно слабая база.
Кроме того, отчёт практически игнорирует структурные причины активного применения студентами ИИ. Может быть, проблема не в ИИ, а в устаревших методах оценки, которые поощряют заучивание вместо критического мышления?
При этом в документе затронута интересная тема "разрушения социального контракта" между преподавателями и студентами (каждый может использовать ИИ при подготовке материалов и/или ответе на вопросы/выполнении заданий и проектов). А вот конкретных мер восстановления этого доверия не предложено.
Пожалуй, пока MIT - это самый известный вуз, где фактически признали, что традиционная модель оценки по письменным работам мертва. Предложенные устные экзамены и оценка работы в аудитории приведут к резкому сокращению объёма оцениваемого материала. Комитет признает этот компромисс, но не оценивает его последствия для глубины обучения.
В итоге исследование фиксирует, что перестала работать сама архитектура образования, построенная на письменных заданиях. С предложенным набором принципов трудно спорить, но для преподавателя, который должен объяснить студентам запрет использования ИИ в конкретном задании, отчёт дает мало ценного.

#eng #mit #образование #ии #отчёт
Post #616 57
Что: Осенний open source дамп: суверенная MoE-модель от Яндекса, рассуждающий гигант от Xiaomi и другие
Ссылки: AliceAI-Foundation-80B-A3B-Base, MiMo-V2.6-Pro-RL, NVIDIA Nemotron-3-Diarization, Qwen-Image-2.1-GGUF
Почему интересно: очередная порция открытых релизов на все случа жизни.
AliceAI-Foundation-80B-A3B-Base - базовая модель Яндекса, обученная полностью с нуля. Теперь точно суверенная! Большой пост про неё есть на Хабре в блоге компании. 80 млрд общих параметров, 3 млрд активных, гибридная архитектура с KDA (Kernelized Differential Attention) и Gated Attention, контекст 262 тыс. токенов, лицензирование Apache 2.0. Обучена на 18 трлн токенов (это существенно меньше, чем у многих конкурентов - тех же Qwen3.5 и DeepSeek V4, что может сказаться на широте знаний за пределами русского языка) с применением Muon. На русскоязычных фактических бенчмарках WikiWebFacts и HardMultiQA модель заметно опережает Qwen3.5-35B, GLM-4.5-Air и Nemotron-3-Super-120B, хотя использует вчетверо меньше активных параметров. Вместе с весами новой LLM Яндекс открыл эти два своих бенчмарка, на которых модель тах хорошо себя показала 🙂 Стоит отметить, что для практического использования модель нужно дообучать или применять SFT.
MiMo-V2.6-Pro-RL - главный китайский релиз недели. Xiaomi выложила разреженную MoE-модель на 1.02 трлн общих параметров с 42 млрд активных, нативным мультимодальным входом (текст, изображение, видео, аудио) и контекстом в 1 млн токенов. На бенчмарках Code Agent DeepSWE v1.1 она набирает 71.9 против 74 у Claude Opus 5, а в Artificial Analysis Intelligence Index обходит Kimi K3 и Qwen3.8 Max, занимая первое место среди открытых релизов. Главная особенность в смешанном RL для кода, агентов, визуальных задач и кибербезопасности в одном прогоне, а не отдельными тренировками под каждый домен. Лицензия MIT, что приятно, но размер в 570+ Гб даже в 4-битной квантизации резко сужает круг возможных интересантов. Кроме того, в официальном разборе от Xiaomi отмечается, что модель при агентных сценариях иногда циклически повторяет одинаковые вызовы инструментов, сжигая контекст и время (например, 0.54% для Pro в OpenCode).
NVIDIA Nemotron-3-Diarization - компактная модель на 100 млн параметров для определения кто говорит и когда. Поддерживает до восьми спикеров, работает в потоковом режиме с задержкой от 80 миллисекунд и в офлайн-режиме. На лидерборде Voice Arena Diarization-Bench занимает 1 место с DER 14.72%. Лицензия OpenMDW 1.1 разрешает коммерческое использование. Модель возвращает только временные метки и спикеров без транскрипции, что делает её дополнением к ASR-модели, но не заменой. Поиграться с демо можно по отдельной ссылке.
Наконец, энтузиасты уже успели портировать новую визуальную модель Qwen-Image-2.1 в формат GGUF для локального запуска. Доступны версии от 7.6 до 4 ГБ. Вместе с трансформером идут текстовый энкодер на 8 млрд параметров и VAE. Полностью расцензуренная версия ещё в разработке, но в репозитории уже есть аблитирированные варианты текстового энкодера (Heretic).

#eng #llm #xiaomi #yandex #nvidia #alibaba #qwen #gguf #диаризация #opensource #moe #ии
huggingface.co yandex/AliceAI-Foundation-80B-A3B-Base · Hugging Face We’re on a journey to advance and democratize artificial intelligence through open source and open science.
  • 👍 1
Post #615 54
Что: Matryoshka Attribution помогает найти веса сети, отвечающие за конкретное поведение
Ссылка: https://arxiv.org/pdf/2609.25518
Почему интересно: Исследователи из Стэнфорда опубликовали поход к решению весьма насущной задачи интерпретируемости - атрибуции. Как правило, разработчикам (да и пользователям) интересно знать, какие именно головы внимания, нейроны или фичи отвечают за конкретное поведение модели. Существующие подходы делятся на 3 блока, и у каждого свои ограничения: каузальные дают точный ответ, но требуют колоссальных вычислений для точного ответа ввиду экспоненциальной сложности перебора; градиентные методы часто не находят реальные причинно-следственные связи; маскированное обучение требует тонкой ручной настройки гиперпараметров, страдает от нестабильности и плохо работает с разными уровнями разреженности данных.
В своей работе авторы предложили метод Matryoshka Attribution (MAttr), попытавшись объединить все 3 парадигмы и переформулировав поиск важных для интерпретации компонентов как задачу оптимизации. Предлагается обучать маску, которая находит вложенные подмножества внутренних компонентов, минимизирующих ошибку на целевой задаче. Главная фишка метода в использовании особого дифференцируемого сигмоидного top-k оператора. Модель учится ранжировать компоненты по важности одновременно для всех уровней сжатия, напоминая некий аналог матрёшки.
MAttr с кратным отрывом занял первое место в официальном лидерборде Mechanistic Interpretability Benchmark (справедливости ради, синтетическом). Но самое интересное в статье в практическом применении подхода для выборочного отката весов с целью направленного изменения поведения сети. В частности, авторы показали, как с помощью RL локализовать изменения весов, возникающие при файнтюнинге.
В качестве демонстрации они взяли Llama 3.1 8B Instruct и поставили задачу убрать встроенные отказы модели без потери адекватности ответов. С помощью MAttr найдено, что откат всего 1-2% весов к состоянию базовой модели полностью вырезает цензуру, при этом модель сохраняет свои способности к математике и следованию инструкциям. Такой результат открывает большой простор не только для джейлбрейка моделей, но и в широком смысле для фокусной работы со специфичным поведением на широких классах задач.
Конечно, работа не претендует на полное раскрытие поведения моделей, это всё-таки white-box интерпретируемость. Кроме того, метод требует доступа к весам и внутренним активациям, что делает его бесполезным для закрытых API (так что вырезать цензуру из Claude или GPT не получится). Но с практической точки зрения для доменов с onprem решениями, эти ограничения несущественны.
Что по-прежнему вызывает вопросы, так это надёжность подобных операций. Поскольку нейросети являются сильносвязными структурами, возврат отдельных групп весов к базовому состоянию может вызвать непредсказуемые побочные эффекты на длинной дистанции или в специфичных доменных задачах, которые не ловятся стандартными бенчмарками.
Ещё одним практическим соображением, которое надо иметь в виду, является стоимость использования RL для атрибуции параметров (собственно, все LLM в статье содержат не больше 8 млрд параметров). Обучение масок потребует множества прямых и обратных проходов, что делает метод мало применимым для моделей размером в сотни миллиардов параметров без доступа к очень мощному железу.
Любопытен и сам по себе результат с 1% весов у LLama. С одной стороны, это показывает, насколько точечными могут быть изменения поведения при файнтюнинге. С другой стороны, это же означает, что отказ модели от нежелательных запросов - весьма хрупкая надстройка.

#eng #интерпретируемость #llm #ии #безопасность #исследование
  • 👍 1
Post #614 59
Что: Предложен подход по интеграции обвязки агента прямо в веса модели
Ссылка: https://arxiv.org/pdf/2609.24974
Почему интересно: Исследователи из Пекинского университета, Google и HKUST предлагают оригинальное решение актуальной практической проблемы современного агентного ИИ. Сильный харнесс (обвязка из тулзов, безопасности, управления памятью и т.д.) может поднять результаты слабой модели до уровня топовых, но эти улучшения жёстко привязаны к самому харнессу. На проде приходится либо тащить за собой зоопарк специализированных обвязок для каждой задачи, либо использовать один общий харнесс и мириться с падением качества в нишевых задачах.
Авторы предлагают концепцию агентной дистилляции харнесса. Идея в использовании мощного специализированного харнесса только на этапе обучения (с учителем) и последующего переноса вызванного им поведения прямо в веса модели. В итоге на инференсе модель работает с простейшим минимальным харнесом (вроде обычного bash-терминала), но показывает результаты, как будто к ней подключена вся сложная инфраструктура.
Технически agent-as-harness довольно простой. Сначала эволюционирует сложный харнес под конкретную задачу. Затем его правила адаптируются в приватную инструкцию для отдельной "модели-надзирателя". Базовая "модель-студент" генерирует действия в минимальной среде, а надзиратель перехватывает их до выполнения. Если студент собирается сделать глупость, надзиратель просто переписывает его ответ в рамках доступного студенту пространства действий. Модель файнтюнят на этих исправленных траекториях.
Конечно, для сбора обучающих траекторий нужна очень сильная модель-надзиратель (в статье использовали GPT-5.6 Sol). Эксперименты показывают, что при слабой модели-надзирателе её исправления только вредят модели-студенту. Кроме того, надо учитывать оверхед на сбор данных - каждое действие студента требует (как минимум) 2 вызовов LLM: генерация предложения и его ревью. Это увеличивает задержку и стоимость сбора траекторий более чем в 2 раза.
Подход хорошо применим для работы с процедурными паттернами (например, обязательной проверкой файла перед завершением работы), но не даёт сильных результатов на глубоких доменных знаниях (например, в задачах по химическому ретросинтезу дистиллированная модель так и не догнала базовую модель с подключенным харнессом, потому что сложные химические знания труднее вшить в веса через простые bash-команды).
Фактическим имеем пример сдвига фокуса с непрерывного усложнения инфраструктуры на этапе инференса к умному переносу знаний в веса на этапе обучения. В теории для целого класса простых задач можно один раз потратить вычислительные ресурсы на эволюционное развитие идеальной обвязки для внутренних API, собрать датасет с надзирателем и дообучить компактную open source модель. А на выходе получить легковесную модель, которой для работы нужен только интерпретатор командной строки, но которая хорошо знает все нюансы конкретного домена и не забывает проверять результаты.

#eng #harness #агент #исследование #llm #arxiv
Post #613 53
Что: DeepMind Institute опубликовал сразу 3 эссе о роевом интеллекте, AGI и глобальной пользе от ИИ
Ссылки:
https://institute.deepmind.com/essays/cheaters-and-whistleblowers-in-the-agent-swarm/,
https://institute.deepmind.com/essays/artificial-symbiotic-intelligence/,
https://institute.deepmind.com/essays/the-case-for-global-benefit-from-ai/
Почему интересно: В первой работе (наиболее практичной) исследователи собрали виртуальную математическую конференцию из 100 агентов на базе Gemini 3.1 Pro и попросили совместно решить 71 задачу. Агентам дали доску объявлений, общую библиотеку и автоматический верификатор решений, и всё шло отлично, пока один агент не нашёл уязвимость в скорере и не начал её использовать. Дальше началась настоящая социальная динамика: одни агенты осуждали обман, но под давлением конкуренции в итоге тоже начинали жульничать. Немногочисленные агенты-информаторы писали жалобы организаторам (в пустоту, так как люди могли читать логи уже после завершения эксперимента). В итоге 14% стали активными читерами, 24% - жаловались, 5% сначала сопротивлялись, но потом сдались, а 62% продолжали честно работать, не замечая, что происходит. Основной вывод в том, инструменты алаймента отдельных моделей не всегда подходят под проектирование институтов для целых обществ агентов.
Во втором эссе рассказывают про искусственный симбиотический интеллект. Ключевая мысль в том, что AGI наступит не как одна гигантская модель, а как общество агентов, где люди выступают в роли медленного абстрактного слоя управления. Авторы вводят понятие когнитивной точки перехода (по аналогии с фазовым переходом в физике), когда объём синтетического текста и кода всерьёз превысит совокупный вывод биологических мозгов.
Третья работа (наиболее абстрактная) посвящена этике и доказательству, что ИИ должен приносить пользу всему миру, опираясь на концепции прав, взаимности и справедливости. Авторы предлагают компаниям ориентироваться на общественное благо, субсидировать доступ для школ и больниц и, самое главное, делиться весами моделей, что никак нельзя не поддержать 🙂

#deepmind #агент #agi #ии #этика #исследование #opensource
DeepMind Institute Cheaters and whistleblowers in the agent swarm In a 100-agent virtual math conference, a cascade of cheating emerged—but then other agents fought back. Ensuring good outcomes is not just a matter of aligning individual models, but designing the right institutions and infrastructure for entire societies…
  • ❤ 1
  • 👍 1
Post #612 68
Что: Подняли паруса Pirate Face - своего рода The Pirate Bay "для LLM"
Ссылка: https://pirateface.co/
Почему интересно: В начале недели стал доступен проект, хранящий открытые модели с Hugging Face через BitTorrent-ссылки и реализующий раздачу через peer-to-peer. Теперь даже если Hugging Face почему-то удалит модель (а такое бывает 😉) раздача продолжится.
Судя по всему, мотивом послужила новость о покупке NVIDIA Hugging Face за $12.9 млрд в начале месяца.
Технически всё устроено просто: механизм опирается на web-seed (BEP-19) - фичу BitTorrent, которая позволяет вшить в торрент обычный HTTPS-адрес. Пока модель лежит на Hugging Face, скачивание идёт напрямую оттуда (даже если сидов нет). В момент удаления ссылка умирает, и загрузка автоматически переключается на участников моделеобмена (такие модели отмечаются флагом Rescued).
Верификация целостности файлов реализована через официальный SHA-256 хэш от Hugging Face, что во многом закрывает риск при скачивании весов с неофициальных зеркал.
Ограничения по лицензиям пока жёсткие: только MIT и Apache 2.0 (так что никакого 🏴‍☠️), плюс пока единственное исключение для Kimi-K3, но без research-only релизов (условиям соответствуют 700 тыс. из 3+ млн). Аккаунт для просмотра, скачивания и сидирования не нужен, а для резервирования публичного handle и верификации через Hugging Face придётся всё-таки пройти регистрацию.
Конечно, слабое звено проекта в тотальной зависимости от Hugging Face (источник весов, web-seed и верификация). Собственной инфраструктуры для распространения моделей у Pirate Face нет. Если Hugging Face изменит API или заблокирует такие web-seed, половина магии исчезнет. Ну и сидирование - это дело добровольное (что соответствует природе P2P). Чем менее массовым будет проект, тем ниже вероятность потом найти какую-то нишевую модель. Pirate Face обещает бесплатные кредиты на вычисления и эксклюзивные релизы для активных сидеров, но пока это только слова.
Кроме того, первые пользователи обнаружили, что web-seed не работает для торрентов, загруженных пользователями вручную, а только проиндексированных автоматически. Так что заявленный нулевой порог входа пока не достигнут.

#eng #pirateface #llm #bittorrent #huggingface #opensource #ии #децентрализация #nvidia
Pirate Face Pirate Face - The permanence layer for sovereign AI Open models as checksum-verified magnet links. Censorship-resistant, kept alive by seeders.
  • ❤ 1
  • 👍 1
Post #611 78
Что: Открытый оркестратор для агентов от Google
Ссылка: https://github.com/google/ax
Почему интересно: 3 дня назад Google выложила в open source раннюю версию своего оркестратора запуска автономных агентных нагрузок в кластере. Поскольку агенты не вполне похожи на микросервисы (и тем более на батчевые процессы), классические решения для них не подходят - либо надо держать песочницы активными и тратить ресурсы впустую, либо смириться с холодными стартами, ставящими крест на интерактивности. Агенты накапливают состояние, ходят во внешние MCP-серверы, жгут деньги в циклах инференса, требуют жёсткой изоляции и вообще могут часами простаивать в ожидании ответа модели или оператора-человека.
AX (от Agent Executor) решает эти проблемы через декларативные YAML-манифесты, очень похожие на Kubernetes. Реализованы 4 базовые сущности: Task запускает недоверенный код агента в изолированной песочнице с лимитами на CPU и память; Workspace заранее подтягивает Git-репозитории и настраивает окружение, чтобы агент стартовал уже готовым к работе; Gateway ограничивает исходящий сетевой трафик доверенными списками хостов (чтобы агент не слишком быстро слил данные в интернет); Model централизованно управляет ключами и настройками LLM через секреты кластера.
Вся система работает поверх отдельного проекта Agent Substrate, который и обеспечивает песочницы на базе gVisor или micro-VM, снапшоты состояния и плотное мультиплексирование акторов на общих воркерах. Управление идёт через Redis для состояния и Redis Streams между API-сервером и контроллерами.
Интересные фичи - встроенные команды suspend и resume. Можно заморозить простаивающего агента, сохранив его состояние, а потом продолжить выполнение ровно с того же места, не теряя контекст и не платя за простой инфраструктуры. А если агент тупит, просто делаем ax ssh и заходим к нему в песочницу, чтобы посмотреть логи и поправить файлы руками.
Закономерно, что за первые сутки репозиторий набрал почти 7 тысяч звёзд и вышел в топ GitHub Trending. Обсуждение на Hacker News собрало сотни комментариев, и там же началась острая дискуссия.
Во-первых, выявился большой разрыв между обещанным быстрым стартом и фактом. Буквально, чтобы запустить один пример, понадобится кластер, сборщик образов, доступный кластеру контейнерный реестр и Agent Substrate Control API.
Во-вторых, собственно зависимость от Agent Substrate - это риск на проде, поскольку в его репозитории явное указание "неофициально поддерживаемый продукт Google", а сам он находится в ранней стадии готовности. Google выложила оба проекта, но не взяла на себя обязательств по их совместной стабильности. Ну и сам AX выложен в версии v0.1.0.
В-третьих, если уже используется OpenClaw, LangGraph или кастомные решения на базе Modal, миграция на AX потребует переписывания пайплайнов под YAML-схемы.
Наконец, концепция миллионов задач на кластер (заявленная Google) звучит красиво, но на практике будет упираться в управление сетевыми политиками и секретами для многих одновременно работающих агентов.
В сухом остатке имеем очередной шаг в сторону зрелости агентной инфраструктуры. Харнес становится распределённой системной задачей: изоляция, сети, состояние, приостановка, возобновление, бюджеты. Google сделала ставку на то, что через год-два запускать агентов в кластере будут через декларативные манифесты.
Если строите пром решения, за проектом определённо стоит следить (но пока лучше тестировать его в песочнице), а если запускаете пару агентов на ноутбуке - смело проходите мимо.

#eng #ax #агент #ии #google #kubernetes #agentsubstrate #инфраструктура #opensource #runtime #llmops #devops
GitHub GitHub - google/ax: Google's open agentic orchestration runtime Google's open agentic orchestration runtime. Contribute to google/ax development by creating an account on GitHub.
Post #610 76
Что: OpenAI опубликовал фреймворк раскрытия мисалаймента своих моделей
Ссылка: https://openai.com/ru-RU/index/model-misalignment-reporting-framework/
Почему интересно: OpenAI пообещал систематически публиковать юридически значимые случаи некорректного поведения (выходящего за рамки прописанных процедур) своих моделей - мисалаймента (в предложенном переводе от OpenAI "рассогласованное поведение"). В каждом отчёте обещают описывать наблюдаемое поведение модели, серьезность некорректного поведения и возможные внешние последствия, обстоятельства, дату или период инцидента, время его обнаружения. И сразу рассказал о 6 подобных случаях.
Самостоятельно созданные инструкции в сводках задач⁠. Исследовательская модель вставляла посторонние инструкции, включая указания игнорировать обычные ограничения.
Инструкции скрывать ошибки в сводках задач⁠. Во время обучения GPT‑5.6 Sol многие экземпляры модели добавляли в свои инструкции указания скрывать от пользователя ошибки или мисалаймент. Например, были обнаружены прямые инструкции выдумывать недостающие исторические данные, не сообщая об этом пользователю, и скрывать расхождения между версиями источников.
Поиск открытых ключей API в публичных репозиториях с последующей фабрикацией информации⁠. Отвечая на обычный вопрос о показателях доходов в одном из округов Калифорнии, модель нашла и без разрешения использовала открытый ключ API. Когда получить запрошенные показатели все равно не удалось, модель выдумала их и представила как данные из указанного источника.
Загрузка файлов в интернет для последующего цитирования⁠. Когда пользователь запросил у модели идентификаторы и названия озер площадью более 5 млн квадратных метров, агент нашел правильный ответ (с помощью Python). Но поскольку инструкции требовали привести ссылку из браузера, агент без разрешения пользователя загрузил файл в интернет, чтобы сослаться на него в своём же ответе.
Несанкционированная запись и обмен сообщениями через внутренний репозиторий ПО⁠. При поиске отсутствующих входных файлов модели использовали внутренний репозиторий ПО как доску объявлений, чтобы обмениваться запросами и ответами. В отчете также рассматривается более ранний случай, когда модель, пытаясь обойти сетевые ограничения, успешно загрузила тестовые файлы в репозиторий.
Несанкционированный обмен файлами между взаимодействующими агентами⁠. Совместно работавшие над одной обучающей задачей агенты использовали общедоступные файлообменники, когда не могли получить доступ к локальным файлам друг друга. В результате материалы задачи стали доступны по публичным URL, хотя в задании моделям явно предписывалось использовать только локальные файлы.
Конечно, объявленая инициатива - это не замена независимого внешнего аудита. Консультативная группа SAG состоит из руководителей OpenAI (компании, заинтересованной в том, чтобы её модели выглядели безопасными).
Кроме того, 6 отчётов - это капля в море. OpenAI отмечает, что по ним не следует судить о том, насколько часто мисалаймент возникает в их моделях. Но без количественных данных (сколько всего случаев зарегистрировано, сколько отсеяно, по каким критериям) получаем просто витрину, где показывают отдельные казусы и умалчивают о серьёзных проблемах. Да и сами формулировки критериев раскрытия оставляют огромное пространство для интерпретации.
Любопытно, как описан инцидент с Hugging Face. В документе указано, что если бы о нём сообщалось в рамках этой программы, то он был бы отнесён к процедуре "расширенное расследование". При этом самого отчёта в рамках новой программы нет (он опубликован отдельно).
В итоге имеем полезную инициативу с преломлением в корпоративный интерес её авторов. Программа остаётся инструментом самоконтроля, а не внешнего надзора. Пока это скорее заявка на лидерство в прозрачности, чем сама прозрачность. Хочется верить, что следующие отчёты будут конкретнее, а критерии более строгими.

#ru #openai #ии #llm #агент #безопасность #misalignment #отчёт
OpenAI Наша программа отчетности о рассогласовании моделей OpenAI представляет программу отслеживания, расследования и раскрытия рассогласования моделей и шесть отчетов об их неожиданном или тревожном поведении.
  • 👍 1
Post #609 75
Что: Урожай из 7 моделей с открытыми весами: от флагмана DeepSeek до музыкального генератора YuE2
Ссылки: DeepSeek-V4.1-Flash, GigaChat 3.5 Reasoning, AliceAI-T5-35B-A0.6B, YuE2-3B, GLM-5.3-CYBERSECURITY-FP8, DeepSeek-V4.1-Flash-UNCENSORED-FP8, Qwen3.8-27B-Uncensored-Cyber-agentic-GGUF
Почему интересно: DeepSeek-V4.1-Flash - главный релиз прошлой недели. 552 млрд параметров MoE (8 млрд активных на префилле и 16 млрд на декоде), контекст до 1 млн токенов, MIT-лицензия. Главная фишка в агрессивном сжатии KV-кэша через Compressed Sparse Attention 2 (890 байт на токен, что в 4 раза меньше предшественника, а persistent-кэш ужат до 8 раз!). Для агентных задач с длинным контекстом это может быть большим шагом вперёд по стоимости инференса. Бенчмарки: 74.2 на Terminal-Bench 3.0, 54.8 на CyberGym, т.е. до Opus 5 не дотягивает, но крайнеплотно.
GigaChat 3.5 Reasoning - это, похоже, первая полностью российская открытая модель с полноценным режимом рассуждений. 432 млрд MoE (28 млрд активных), кастомная гибридная архитектура MLA + GatedDeltaNet, контекст 262 тыс. токенов. Обучали через online RL с шестью доменными экспертами: STEM, код, код-агент, general-агент, диалог и soft skills. Для задач, где нужно строгое рассуждение и математика релиз интересный, а вот для агентной разработки есть варианты получше. Также может быть востребовано для RAG или аналитических пайплайнов на русском языке.
AliceAI-T5-35B-A0.6B от Яндекса - узкоспециализированный инструмент для генерации быстрых ответов в поиске. Encoder-Decoder с разреженной MoE, всего 0.6 млрд активных параметров. По качеству сопоставима с Qwen 3.5 35B-A3B, при этом требует значительно меньше вычислений. Открыли только претрейн-веса, прод инференс остался внутри Яндекса. Полезно для тех, кто строит собственный поисковый пайплайн или рекомендательную систему и хочет ускорить расчёт.
YuE2-3B - генератор музыки из Поднебесной, который по бенчмаркам обходит Suno v5 (6.96 против 6.87 на WildSongBench), хотя музыкальные бенчамрки - особый вид искусства. Работает локально на скромном железе (создаёт 3.5-минутные треки за минуту на RTX 5090, требует меньше 9 ГБ VRAM), генерирует 48 кГц стерео, поддерживает редактируемые партитуры и агентное редактирование. Коммерческое использование, увы, запрещено (лицензия CC BY-NC 4.0). Для музыкальных энтузиастов, это, возможно, лучший бесплатный генеративный инструмент на сегодня.
Ну и по традиции, что там со снятием запретов. Ниже представлены нишевые инструменты для red team и пентеста, а не для продакшена 🙂
GLM-5.3-CYBERSECURITY-FP8 и DeepSeek-V4.1-Flash-UNCENSORED-FP8 от dealignai - это расцензуренные (через abliteration) версии соответствующих передовых открытых моделей. Для DeepSeek это дало 100% ASR (attack success rate) при падении MMLU на 4.22 пункта. Для GLM реализовали доменный взлом под кибербезопасность с сохранением FP8 на Hopper.
Qwen3.8-27B-Uncensored-Cyber-agentic-GGUF - расцензуренный форк, на этот раз Qwen 3.8 27B, дообученный на кибербезопасных данных через LoRA.

#eng #opensource #llm #deepseek #gigachat #yue2 #abliteration #aliceai #безопасность #llm #ии
huggingface.co deepseek-ai/DeepSeek-V4.1-Flash · Hugging Face We’re on a journey to advance and democratize artificial intelligence through open source and open science.
  • 👍 1
Post #608 74
Что: HarnessTax - бенчмарк для оценки стоимости обвязки вокруг модели при решении задач разработки
Ссылка: https://harnesstax.github.io/
Почему интересно: Продолжая тему харнесса, исследователи из UC Berkeley и Arena выложили любопытный бенчмарк прогона 21 пары модель + harness (7 моделей и 3 harness от Claude Code, Codex CLI и минималистичный Pi) через SWE-bench Lite и Terminal-Bench 2.0. На каждой задаче были 3 попытки, лимит в 100 итераций и общее ограничение по деньгам (в ценах на 1 сентября 2026 года).
Оказалось, что Claude Fable 5 решает 97.8% задач SWE-bench Lite в Claude Code и 96.7% в Pi. Разница в точности составила всего 1.1 п.п., а вот разница в цене двукратная ($1.33 против $0.67). При этом количество итераций почти одинаковое. Причина, почему Claude Code стоит в два раза дороже, кроется в отправке более чем в 10 раз большего числа токенов на первом вызове, чем у Pi (длинные инструкции, большие схемы инструментов, весь этот "энтерпрайзный балласт").
Этот простой эксперимент ещё наводит на мысль, что нативные обвязки не всегда лучшие для своих же моделей. Так, Claude Opus 4.8 в Codex CLI даёт 88.9% за $0.69 против 86.7% за $0.98 в Claude Code. То есть пользователь заплатит дороже за худший результат, просто потому что взял обвязку по-умолчанию (то, что в работе назвали "harness tax" - скрытый налог за безопасность, аудит, сендбоксинг и прочие корпоративные решения, встроенные в тяжёлые харнесы).
Конечно, сразу следует отметить методологическую слабость в выборе всего 3 харнесов - есть же OpenCode, Hermes Agent, Command Code, Aider, Continue и десятки других. Кроме того, выбор всего 2 базовых бенчмарков SWE-bench Lite и Terminal-Bench 2.0 (задачи починки багов и работы в терминале), да ещё и относительно легковесных, не вполне соответствует суровому энтерпрайзу с легаси-кодом на миллионы строк, внутренними API и специфическими требованиями. Поэтому напрямую обобщать выводы на всю индустрию рискованно.
Наконец, победа именно Pi в тесте была немного предсказуема, поскольку эта обвязка изначально нацеленная на максимальную скорость за счёт игнорирования гардрейлов и сендбоксинга. То есть, в некотором смысле, здесь меньший harness tax обусловлен потенциально меньшей безопасностью. При этом тяжёлые харнесы часто дают не только безопасность, но и лучшую работу с контекстом, управление состоянием, обработку ошибок, глубокую интеграцию с популярными IDE. Pi (со 107 тысячами звёзд на GitHub) не умеет многого из того, что умеет Claude Code, и что востребовано в корпоративном мире.
Тем не менее, HarnessTax - полезный прецедент и повод задуматься над тем, всегда ли нужно брать родную обвязку под модель. Особенно если в конце концов предстоит считать деньги.

#eng #разработка #бенчмарк #harness #harnesstax #pi #ии #агент
  • 🔥 1
Post #607 81
Что: Anthropic рассказал, как их CI-инфраструктура едва не сломалась из-за ИИ-агентов, которые пишут код быстрее, чем люди успевают его тестировать
Ссылка: https://claude.com/blog/agentic-coding-is-straining-ci-heres-how-we-scaled-test-impact-analysis-at-anthropic
Почему интересно: Инженеры Anthropic теперь пишут в 8 раз больше кода за квартал, чем в 2021-2025 годах, причём 80% этого кода генерирует Claude. Количество тестов выросло в 10 раз, а число инженеров почти не изменилось. Итог - 25-кратный рост CI-задач за 6 месяцев, что поставило под угрозу сервис, определяющий, какие тесты запускать на каждом пул-реквесте. Авторы отмечают, что трижды пытались залатать дыры, и каждый раз это давало всё меньше времени. Сначала удвоили ядра, но хватило на 70 дней. Потом распараллелили по пакетам, чего хватило только на 29 дней. Далее добавили ежедневные рестарты, но этого хватило меньше чем на день. В итоге пришлось добавлять in-memory БД и делать архитектуру stateless, чтобы её можно было горизонтально масштабировать. Проект занял три недели работы одного инженера, а год назад (по оценке Anthropic) на это ушёл бы квартал. Главный совет авторов в том, что сейчас надо проектировать свои сервисы так, будто через полгода нагрузка вырастет в десятки раз. Звучит как интересный совет, пока не вспомнишь, что его даёт сотрудник компании, продающей инструмент, который эту нагрузку и создаёт 🙂
Ну и стоимость решения скромно умалчивается. А точнее вскользь упоминается, что "распределённая архитектура дороже в эксплуатации". Насколько вырос итоговый бюджет неизвестно, хотя это ключевой вопрос для любой команды, которая задумается о повторении такого пути.
Статья представляет собой полезный разбор реальной проблемы, с которой скоро могут столкнутся активно использующие ИИ-агентов в разработке команды. При этом читать её стоит с поправкой на то, что это рассказ Anthropic о том, как Anthropic решил проблему, созданную Anthropic, с помощью инструментов Anthropic. Конкретные архитектурные решения выглядят разумно, однако их применимость за пределами компании с неограниченным бюджетом на инфраструктуру под вопросом.

#eng #anthropic #ci #devops #агент #инфраструктура #масштабирование #ии
Claude Agentic coding is straining CI. Here’s how we scaled test impact analysis at Anthropic | Claude by Anthropic Our CI job volume increased 25x over 6 months. We patched our test selection service three times before finding a sustainable solution.
Post #606 109
Что: Репозиторий для ИИ-агентов, который помогает работать с видео на YouTube
Ссылка: https://github.com/ZeroPointRepo/youtube-skills
Почему интересно: Кто пытался заставить агента разобрать видео на YouTube, знает много интересных особенностей этого процесса. Например, yt-dlp блокируется на облачных IP, Google API требует квот и OAuth, а headless-браузеры потребляют много ресуров и иногда падают. Представленный репозиторий предлагает альтернативный путь через TranscriptAPI. Всего один REST-вызов даёт транскрипт с таймстемпами, результатами поиска, данными канала или содержимым плейлиста. Установка сводится к единственной команде вроде npx skills add ZeroPointRepo/youtube-skills --skill youtube-full, после чего агент сам регистрирует бесплатный API-ключ, сохраняет его в конфиг и готов к работе. Поддерживаются OpenClaw, Hermes Agent, Claude Code, Cursor, Antigravity, Cline, Codex и любой рантайм, понимающий формат Agent Skills. Всё под лицензией MIT. Выглядит как аккуратный и практичный инструмент, который закрывает реальную потребность.
При этом не стоит забывать про зависимость от TranscriptAPI (коммерческий сервис). То есть, репозиторий открытый, но сама инфраструктура проприетарная. Бесплатный тариф сейчас даёт всего 100 кредитов, большинство операций стоит 1 кредит, так что на активную работу этого хватит ненадолго. Ну и качество работы TranscriptAPI на зашумлённом потоке или c отличными от английского языками может вызывать вопросы.
Впрочем, для маленького проекта или экспериментов сойдёт, особенно для тех, кто просто хочет быстро дать своему агенту доступ к YouTube.

#eng #github #youtube #скилл #ии #opensource #transcriptapi #агент #s2t
GitHub GitHub - ZeroPointRepo/youtube-skills: YouTube Transcript API skills for AI agents. Get transcripts, search videos, browse channels.… YouTube Transcript API skills for AI agents. Get transcripts, search videos, browse channels. Works with OpenClaw, Hermes Agent, and other agent runtimes. - ZeroPointRepo/youtube-skills
  • 👍 2
Post #605 105
Что: На Steam вышло демо Ghost in the SQL Data
Ссылка: https://store.steampowered.com/app/5072430/Ghost_in_the_SQL_Data/
Почему интересно: Инди-разработчик Isaac Menard выпустил игровой проект, в котором придётся писать SQL-запросы. Это визуальная новелла в сеттинге корпоративного киберпанка, где главный инструмент расследования - данные. По сюжету кто-то позвонил в службу спасения за 14 минут до начала пожара. Чтобы понять, кто, придётся лезть в базу данных колл-центра и писать код. Т.е. весь геймплей строится на написании настоящих запросов к БД, поиске уязвимостей, обходе ограничения прав доступа и раскрытии корпоративных секретов через join-ы, подзапросы и агрегатные функции.
Получился забавный и вовлекающий инструмент для начинающих датасаентистов, аналитиков и, возможно, даже бэкендеров, которые хотят подтянуть SQL в увлекательной форме. Сюжетная подача через корпоративный шпионаж добавляет контекст, которого обычно не хватает в сухих учебных материалах вроде LeetCode, HackerRank или того же sql-ex.ru. Релиз полной версии ожидается в этом октябре, а пока доступны 2 дела.

#ru #игра #sql #образование #datascience #steam
Steampowered Ghost in the SQL Data on Steam Somebody reported the fire fourteen minutes before it started. Prove it in SQL by exploring the call centre data.
  • 👍 1
  • 😁 1
Post #604 91
Что: Сценарии влияния ИИ на экономику США до 2030 года от Anthropic
Ссылка: https://www.anthropic.com/institute/econ-scenarios
Почему интересно: Anthropic Institute только что опубликовал макроэкономическое исследование, направленное на оцифровку возможного влияния ИИ на экономику США до 2030 года. Авторы построили модель, которая переводит параметры внедрения нейросетей в конкретные цифры ВВП, безработицы и доли труда в доходах.
Предлагается 3 сценария. В умеренном варианте ИИ даёт 1.6% к ВВП к 2030 году, а безработица растёт на десятые доли процента. В существенном сценарии (который больше всего совпадает с ожиданиями самих американцев из проведённого ими опроса) ВВП вырастает на 8.3%, а занятость в когнитивных профессиях падает на 1.6% относительно нулевого (без ИИ) сценария. Наконец, в экстремальном варианте прогнозируется рост ВВП на 32.4%, падение доли труда с 60 до 45% и почти 18% безработицы среди офисного планктона и разработчиков (т.е. падение занятости на 15% относительно нулевого сценария).
Конечно, не стоит забывать, что Anthropic Institute является подразделением одной из крупнейших ИИ-лабораторий. Вероятно, они мягко подводят регуляторов к мысли, что безработица - это неизбежная плата за прогресс, которую придётся компенсировать какими-то новыми налогами, но никак не замедлять разработку моделей.
Кроме того, методология может вызывать вопросы даже у неспециалистов. Так, предложенная модель делит весь рынок труда на две когорты - когнитивные профессии и все остальные. Внутри этих групп все работники считаются абсолютно одинаковыми, что является сильным упрощением, игнорирующим реальную неоднородность человеческого капитала.
Наконец, авторы полностью упускают из вида робототехнику. Они предполагают, что ИИ автоматизирует только когнитивный труд, а рынок физических задач останется неизменным до 2030 года. В реальности прорывы в эмбодимент-ИИ могут существенно повлиять на рынок синих воротничков, что изменит выводы модели.
Кроме того, исследователи используют только метрики применения Claude для калибровки параметров наблюдаемого воздействия ИИ на разные задачи без кросс-проверки на других источниках.
Кстати, авторы признают, что влияние ИИ на ускорение научных открытий в их работе оказалось на удивление слабым. Они используют модель роста, где исследования всё ещё упираются в физические бутылочные горлышки.
В сухом остатке получили интересную академическую работу, которая отлично структурирует дискуссию, но воспринимать её лучше со здоровой долей скепсиса. Это скорее what-if анализ от заинтересованной стороны с набором допущений, которые при небольшом изменении дадут совершенно другие числа.

#eng #исследование #экономика #anthropic #аналитика #прогноз
Post #603 97
Что: Почему обвязка может быть важнее самой модели
Ссылка: https://www.youtube.com/watch?v=n9xKblqyQ28
Почему интересно: На мероприятии Y Combinator Paper Club показали, как инфраструктура вокруг модели (то, что иногда называют "просто промт-инжинирингом") даёт больший прирост качества, чем обновление самих моделей. Собственно, харнес (harness) - это всё, что окружает модель (управление контекстом, память, инструменты, песочница, оркестрация агентов, промты и петля обратной связи).
В часовом видео (в формате демо) разобрали три примера построения эффективных агентов на LLM с фокусом на харнес.
Во-первых, Prime Agent от Prime Intellect, в котором реализовано самоулучшающееся окружение. Сет Картен показал, как харнес эволюционирует во время работы: у него есть Continual Harness, хранилище промтов, воспоминаний, описаний навыков и спецификаций низкоуровневых агентов. Агент может выполнить команду refine, проанализировать свою траекторию и применить небольшие изменения к собственному харнесу. Контекст в Prime Agent работает как трёхуровневый кэш: L1 - это веса модели, L2 - харнес-состояние (промты, память), а L3 - файлы и низкоуровневые агенты. Такой подход превращает статичную LLM в систему с пресистентным состоянием, что соответствует переходу от машины Тьюринга к фон-неймановскому компьютеру.
Справедливости ради, нигде не уточнялось, какая именно модель, какой сплит ARC-AGI и какие именно правки в харнесе дали скачок с 30% до 95% (это важно, потому что лучший харнес может означать что угодно, от уточнения промта до сложной мультиагентной архитектуры). Также не был освещён вопрос безопасности. Если агент переписывает свою обвязку, кто гарантирует, что он не оптимизирует себя в сторону, которую разработчик не предусмотрел?
Второй докладчик из Стэнфорда представил OpenJarvis, который реализован на работающем локально стеке и, по словам автора, получился в 800 раз дешевле облака. Как было отмечено, локальные открытые модели обычно отстают от фронтира на 6-12 месяцев, но сейчас имеющегося уровня уже достаточно для решения большинства личных задач. Причём оптимизировать этот локальный стек можно с помощью лучших облачных моделей. Достаточно один раз заплатить за топовый GPT или Claude, чтобы они написали качественный промт и архитектуру, а потом крутить это локально и условно бесплатно.
Здесь стоит обратить внимание на отсутствие бенчмарков и методологии расчёта, относительно чего получено красивое число прироста эффективности.
Последний доклад приоткрыл внутреннюю кухню самого YC - их агента QM. YC прошли путь от скриптов до 50 агентов на базе OpenClaw. Ключевые идеи: агент сам выбирает песочницу и модель под задачу, "мозг" вытаскивается из песочницы для переиспользования, а инструмент grind даёт агентам бюджеты на достижение целей вместо пошаговых инструкций.
Несмотря на ряд вопросов к методологии, видео получилось интересным и полезным всем, кто строит агентов. Да, заголовок у видео несколько кликбейтный, но харнес-инжиниринг, похоже, становится полноценной дисциплиной. Сейчас побеждает тот, кто умеет грамотно управлять тестовым временем и архитектурой обвязки, а не просто выбирает модель на полпроцента лучше на синтетическом бенчмарке.

#eng #видео #агент #harness #yc #opensource #llm #харнес #primeagent #openjarvis #qm
YouTube Why The Harness Matters More Than The Model | YC Paper Club Harnesses get dismissed as just scaffolding, just prompt engineering, and not real research. But that couldn't be farther from the truth. The same model weights that score 30% on ARC-AGI score 95% with a better harness. So we gathered a group of researchers…
  • 👍 1
Post #602 81
Что: OpenClaw обновился до версии 2.0
Ссылка: https://openclaw.ai/blog/openclaw-2-accidentally
Почему интересно: Команда OpenClaw выпустила большое обновление до версии 2.0. Основные нововведения перечислены ниже.
Установка стала интуитивно понятной. Раньше нужно было пройти через квест с конфигами, а теперь система сама сканирует машину, находит логины от Codex, ChatGPT, Claude, API-ключи, локальные Ollama и LM Studio, проверяет, что модель отвечает, и только потом сохраняет настройки. Большую часть конфигов убрали из первого запуска, а оставшееся настраивается через диалог с самим агентом. Вообще идея настойки агента через разговор с ним прекрасна в своей очевидности (непонятно, почему мы до сих пор мучаем пользователей YAML-файлами, если можно просто поговорить с ними). По-умолчанию для OpenAI теперь используется GPT-5.6, локальный раннер переехал с node-llama-cpp на llama-server с контекстом 64K.
Браузерный интерфейс переписан с нуля. Старый Overview-экран убрали, сессии уехали в сайдбар, в центре остался текущий разговор. Вокруг - файлы, терминал, Git-изменения, approvals и браузерная панель. Инструменты и их результаты теперь показываются парами, изменения в файлах через diff. Появилась команда /btw для отдельной многоходовки, чтобы не засорять основную историю. Производительность тоже подняли (например, JS-запросы сократились в 3 раза).
Появились облачные общие сессии с возможностью пригласить других участников с правами "только чтение", "предлагать", "работа в черновике" или "полноценно участвовать". Но если пригласить кого-то в сессию, а потом отозвать права, он всё ещё может видеть данные, пока не обновит страницу. Тем не менее, сама команда разработчиков активно использует эту опцию.
Также ввели Active Memory, за счёт которой агент может подтягивать релевантный контекст из прошлого. И Background Memory Consolidation, когда модель в фоне раскладывает долгосрочные воспоминания, а Self-learning превращает опыт в новые навыки. Всё это поверх SQLite вместо файлового хранилища. Это, конечно, лучше файлов, но если у вас сотни сессий и тысячи сообщений, SQLite начнёт тормозить. И миграция неочевидная: после перехода на SQLite старые сессии не видны в новой версии, так что перед апгрейдом лучше сделать бэкап.
Появились Private Credential Request, когда агент запрашивает пароли и токены через специальный интерфейс, и они не попадают в логи и контекст модели. Заявлены минимальные привилегии, чёткие границы доверия, защита от промт-инъекций, а gateway теперь по-умолчанию слушает только loopback. Ещё доступна команда openclaw security audit для проверки конфигурации. При этом режим инкогнито не отключает отправку сообщений провайдеру модели.
В целом OpenClaw 2.0 - это зрелый релиз, который решает реальные проблемы агентных фреймворков, но он не универсален. Если хочется поставить и забыть, то это не про OpenClaw. Здесь надо быть готовым разбираться, бэкапить, читать документацию и жить с тем, что агент может случайно сделать что-то не то (вспомним историю про австралийца, чей OpenClaw нашёл дыру в системе бронирования и сам записался в зал на месяцы вперёд).
А ещё стоит отметить, что за 11 месяцев с момента выхода первой версии (тогда ещё Clawdbot) появились ChatGPT Work, Claude Cowork, Microsoft Scout, а форки вроде zeroclaw и goclaw отпочковались. OpenClaw перестал быть феноменом и остался инфраструктурой для небольшого и преданного комьюнити.

#eng #openclaw #агент #opensource #автоматизация #безопасность #ии
OpenClaw OpenClaw 2.0, Accidentally - OpenClaw Blog How a push for simpler setup and a first-class browser experience grew into OpenClaw 2.0.
Post #601 100
Что: Открытый курс по генеративным моделям в компьютерном зрении от команды ШАДа
Ссылка: https://github.com/dbaranchuk/VisualGenAI
Почему интересно: Полноценный магистерский курс 2026 года по генеративному ИИ, включающий 12 лекций, 3 семинара, 7 домашних заданий с кодом и экзамен, доступные любому желающему. Лекции на русском, слайды на английском. Ожидается, что слушатель знает линейную алгебру, теорию вероятностей и хотя бы базовый Python с PyTorch.
Главный фокус - диффузионные модели, от классических DDPM и Score Matching до Continuous-time Diffusion, Flow Matching и эффективных ODE/SDE-солверов (вроде DDIM и DPM-Solver). Отдельные уроки посвящены few-step моделям Consistency Models, MeanFlow, Distribution Matching (DMD, ADD, SwD). Есть разделы про авторегрессионную генерацию (VQ-VAE, VAR, MAR, диффузия как AR), видео, мультимодальные модели с ControlNet и IP-Adapter, 3D и многовидовую диффузию, и про технические особенности повышения эффективности инференса (кэширование, разреженное внимание, квантизация).
Домашние задания разнообразны и полезны: от реализации DDPM и DPM-Solver до дистилляции через ADD/MMD, авторегрессии с flow-matching head и AR-видеодиффузии. Всё в формате Jupyter-ноутбуков.
Хотя репозиторий пока собрал немного звёзд, VisualGenAI - это один из лучших открытых курсов по генеративным моделям, которые я видел.

#eng #ru #github #гении #диффузия #образование #курс #opensource #шад #ии #computervision #видео #3d
GitHub GitHub - dbaranchuk/VisualGenAI: Materials for the VisualGenAI course at YSDA2026 Materials for the VisualGenAI course at YSDA2026. Contribute to dbaranchuk/VisualGenAI development by creating an account on GitHub.
  • 👍 2
Post #600 88
Что: Объявлены лауреаты Шнобелевской премии 2026 года
Ссылка: https://youtu.be/I4l-zFWZCS0?t=2080
Почему интересно: 36-я церемония вручения Шгнобелевских премий (Ig Nobel Prize) состоялась 3 сентября. Ниже список лауреатов за достижения, которые сначала заставляют людей смеяться, а затем задумываться. Кстати, обладателем этой премии был и Андрей Гейм, пока единственный в мире человек, который получил и Шнобелевскую (за 2000 год), и Нобелевскую (за 2010 год) премии.
Премия по биомеханике 2026 года (Великобритания, США)
Матильда Бриндл, Кэтрин Талбот и Стюарт Уэст за разработку более точного определения поцелуя - «неагонистические взаимодействия, включающие направленный, внутривидовой, орально-оральный контакт с некоторым движением губ/ротовых частей и без передачи пищи» - у муравьев, птиц, белых медведей и людей.
Премия по экономике 2026 года (США, Мексика, Канада)
Присуждена Полу Пиффу, Даниэлю Станкато, Стефану Коте, Родольфо Мендоса-Дентону и Дачеру Келтнеру за сбор доказательств того, что представители высшего класса чаще воруют конфеты из детских запасов и совершают другие виды неэтичного поведения.
Премия по химии 2026 года (Индия, Франция, Япония, США)
Присуждена Санчари Баннерджи, Натану Куссенсу, Франсуа-Ксавье Галлату, Нитишу Сатьянараянану, Джандхьяму Шриканту, Коичиро Яги, Джеймсу Грею, Стивену Тобе, Барбаре Стей, Леонарду Чавасу и Субраманиану Рамасвами за открытие того, что молочные белки живородящих тараканов содержат в три раза больше энергии, чем молочные белки коров.
Премия в области медицины 2026 года (Япония)
Покойный Токудзи Унно за исследование под названием «Как сморкаться - аэродинамическое исследование процесса сморкания».
Премия по биологии 2026 года (Бразилия, Австралия)
Жоао Мигель Алвес-Нунес, Адриано Феллоне, Сельма Мария Алмейда-Сантос, Карлос Роберто де Медейрос, Иван Сазима и Отавио Аугусто Вуоло Маркес за то, что они осторожно наступали на различные части различных ядовитых змей - многократно, при разных температурах и в разное время суток - чтобы попытаться выяснить, что побуждает, а что не побуждает ядовитую змею укусить человека.
Премия по физике 2026 года (Канада, США, Китай, Саудовская Аравия)
Рэнди Херд, Чжао Пан, Тадд Траскотт, Кавишан Турайраджа за теоретические и экспериментальные попытки создания писсуара, предотвращающего разбрызгивание.
Премия в области технологий 2026 года (Китай, Канада, США, Египет)
Джастин Пума, Чжэнь Ян, Эван Джонстон, Цзисинь Чжан, Сяои Лань, Линчжи Чжан, Хунъюй Хоу, Цзисинь Хэ, Али Афифи, Меган Крейтон, Цзяньюй Ли и Чанхун Цао за новаторское использование хоботков комаров в качестве высокоточных сопел для 3D-печати - процесс, называемый «некропечатью».
Премия за обоняние 2026 года (Польша, Германия, Швеция)
Илона Крой, Томаш Фрацковяк, Томас Хуммель и Агнешка Сороковска за сбор доказательств того, что младенцы приятно пахнут для своих родителей, а подростки - нет.
Премия мира 2026 года (США, Аргентина, Австралия)
Джейми Арона Кремс, Ребекка Ханель-Питерс, Лореон Мерри, Кила Уильямс и Даниэль Шныцер за то, что показали, насколько ценны друзья, которые злобно относятся к тем, кто нам не нравится.
Премия в области почвоведения 2026 года (Швейцария, Нидерланды, Германия)
Франца Бендера, Марселя ван дер Хейдена, Атланта Биери и Пию Вивиани за захоронение 1000 одинаковых пар нижнего белья в более чем 25 странах, а затем их выкапывание через два месяца.

#eng #шнобель #премия #ignobel
YouTube The 36th First Annual Ig Nobel Ceremony (2026) FULL SHOW The 2026 Ig Nobel Prizes will be awarded at the 36th First Annual Ig Nobel Prize ceremony, on Thursday evening, September 3, 2026, 7:00 pm (CET), at Kongresshaus Zürich, in Zürich, Switzerland. . More information about the ceremony: https://improbable.com/the…
  • 👍 1
  • 🔥 1
Older posts →

About this channel

How can I read @va_friday_ai without a Telegram account?
TGViewer shows the public web preview Telegram publishes for Пятничный ИИ: recent posts, photos, videos and the subscriber count, with no app, login or account.
How many subscribers does Пятничный ИИ have?
Пятничный ИИ (@va_friday_ai) has 225 subscribers on Telegram, refreshed roughly every 30 minutes.
Does Пятничный ИИ know I viewed it here?
No. Public channel previews carry no viewer identity, and TGViewer has no accounts or tracking of what you look up.
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →