TGViewer
Channel Public Channel
Нейроканал

Нейроканал

@neuro_channel

Искусственный интеллект, нейросети, машинное обучение

Разместить рекламу: @tproger_sales_bot

Правила общения: https://tprg.ru/rules

Другие каналы: @tproger_channels

Сайт: https://tprg.ru/site

Зарегистрирован в РКН: https://tprg.ru/vcEg
Subscribers
11.7K
Photos
894
Videos
243
Links
2K

Showing posts older than #2804 · Back to latest

Older Posts 20 shown
Post #2803 2.58K
ВкусВилл запустил официальный MCP-сервер: подбор продуктов теперь можно поручить ИИ-помощнику. Подключается как обычный MCP, достаточно добавить ссылку https://mcp.vkusvill.ru/mcp в клиент с поддержкой протокола.

Агент ищет товары по каталогу, смотрит скидки, аналоги и рецепты и собирает выбранное в ссылку на корзину. Оформление и оплата остаются за человеком. Идеи и замечания компания принимает через форму обратной связи на той же странице.

@neuro_channel
  • ✍ 21
  • 🔥 12
  • ❤ 6
Post #2802 2.12K
Anthropic открыла research preview Model Hardware Standard (MHS), стандарта, через который ИИ-агенты управляют физическим оборудованием: микроскопами, роботизированными руками, лазерами. Драйвер MHS сводит любой прибор с программируемым интерфейсом к простым командам вида «прочитай температуру» и «установи температуру», а знания о железе, которые обычно живут в бумажных мануалах и головах, записываются тегами на естественном языке. Из них собирается справка, по которой агент понимает незнакомое устройство и работает с ним через MCP, командную строку или код.

Партнёры уже показывают результаты. В Carnegie Mellon агент гоняет эксперименты с серийными разведениями примерно втрое быстрее, координируя приборы на трёх компьютерах с несовместимыми интерфейсами. У QuEra контроллер, который агент написал сам, восстанавливает «лок» лазера в квантовом компьютере в 99,3% случаев без человека. Поддержку стандарта строят AWS, Universal Robots, QIAGEN, Tecan и Doosan Robotics.

Сейчас превью доступно по заявке для лабораторий и производств, дальше Anthropic обещает открыть стандарт в исходниках.

@neuro_channel
  • 👍 11
  • ❤ 1
Post #2801 2.07K
OpenAI рассказала, как готовит к выпуску модель Astra. Это первая модель компании уровня Critical по кибербезопасности в её Preparedness Framework: с нужными инструментами она сама находит неизвестные уязвимости в защищённых системах и собирает под них эксплойты без человека на каждом шаге. Дата релиза и цены не названы.

На графике внутренний набор из 20 свежих уязвимостей V8: по горизонтали потраченные токены, по вертикали доля рабочих эксплойтов. Astra доходит до 39% примерно за 75 тысяч токенов, GPT-5.6 Sol до 12% за 135 тысяч, а по пути Astra нашла две новые уязвимости. На публичном ExploitBench у неё 100%. В экспертных тестах модель построила цепочку выхода из песочницы браузера и повышения привилегий до root. Отказывает на обход запретов в кибертемах в 91,5% случаев против 59% у Sol.

Доступ ступенчатый: модель выйдет «скоро», продвинутые кибервозможности сначала получат тестировщики, потом защитники через Daybreak Blue. После инцидента с Hugging Face часть обучения останавливали на две недели, большой RL-прогон возобновили 28 августа.

Anthropic 1 сентября выпустила Fable 5.1 и Mythos 5.1 по похожей схеме: полные кибервозможности только у проверенных организаций.

Подробный разбор оценок и защит на сайте.

@neuro_channel
  • ⚡ 7
  • ❤ 2
  • 🆒 2
Post #2800 2.06K
Вот вам картинка чтобы ориентироваться какой уровень рассуждений ставить на новом фейбл, если будете пользоваться. И более понятное сравнение с другими моделями. Хорошо бы, конечно, GLM и Kimi добавить, но думаю больше бенчей скоро приедет.

@neuro_channel
  • 👍 9
  • ❤ 4
Post #2799 8.96K
Anthropic выпустила Claude Fable 5.1 и Mythos 5.1. Это одна и та же модель, разница только в ограничителях: Fable доступна всем, Mythos через программы проверенного доступа для кибербезопасности и биологии. Всем подписчикам разом сбросили лимиты, так что попробовать можно прямо сейчас.

По бенчмаркам модель заметно ушла от Fable 5 и обошла Opus 5 и GPT-5.6 Sol: в агентном научном коде рост вдвое, в терминальном кодинге и бизнес-автоматизации тоже большой отрыв. На низком и среднем усилии она даёт результат уровня Fable 5 за заметно меньшие деньги. В Claude Code дефолт High, в Cowork и на claude․ai Medium.

Цена токенов прежняя, $10 и $50 за миллион, но чтение кэша подешевело в 4 раза, до $0,25. Для обычных задач это минус около 25% к счёту, для агентных до 45%. Модель уже доступна в API как claude-fable-5-1, на AWS, Google Cloud и Azure.

Фильтры по кибербезопасности стали срабатывать примерно на 60% реже: модели теперь разрешили искать уязвимости в коде, запрещены только эксплойты, пентест и сканирование бинарников. Ещё Anthropic закрыла лазейку для дистилляции: новые API-аккаунты больше не могут править прошлый контекст, сохраняя транскрипт размышлений модели.

@neuro_channel
  • 🔥 9
  • ⚡ 2
Post #2798 2.01K
По слухам, Anthropic уже сегодня выпустит Claude Fable 5.1. Ликер с хорошей историей попаданий называет 1 сентября днём релиза, а идентификатор claude-fable-5-1 заметили в AWS Bedrock: на него сервис отвечает иначе, чем на несуществующие ID. Комьюнити-трекеры пишут, что часть пользователей, возможно, уже тихо переключили на новую модель.

От версии ждут упора на длинные автономные задачи и агентов, цену прочат прежнюю, около 10 и 50 долларов за миллион токенов на входе и выходе. Официального анонса пока нет.

Не думаю, что это спасёт Anthropic, если они не сделают что-то с прозрачной коммуникацией с пользователями.

@neuro_channel
  • 😁 11
  • ❤ 3
  • 🤯 2
Post #2797 2.01K
GLM-5.3 хороша не только в коде. Vals AI опубликовала полные результаты замеров: в общем Vals Index модель вторая среди открытых с 57,0 балла, впереди только Kimi K3, а в общем зачёте она 13-я из 50, GLM-5.2 была 18-й. Среди открытых моделей она первая в юридическом ресёрче и миграции кода и вторая в финансовом агенте.

В агентском юридическом бенчмарке позади остались почти все закрытые модели: выше только Opus 5 и Fable 5, а Grok 4.6 и GPT-5.6 Sol уже ниже.

По моему опыту могу добавить, что GLM-5.3-Flash хороша ещё и как OCR, неплохо и дёшево распознаёт тексты и скриншоты.

@neuro_channel
  • 👍 8
  • ⚡ 3
  • ❤ 2
Post #2796 2.1K
GLM Coding Plan исполнился год, и Z․ai выдала всем действующим подписчикам Reset Card: карточка разом восстанавливает и недельную, и пятичасовую квоту. Активируется на странице тарифа в личном кабинете.

В ZCode к дате ещё раздавали паки по 100 млн бесплатных токенов GLM-5.3-Flash, но их всего 5000 на всех, так что уже закончились. Постараюсь в следующий раз раньше написать.

@neuro_channel
  • ❤ 3
  • 🔥 2
Post #2795 2.28K
Коллега сегодня поделился неожиданным: он смог оплатить подписку Kimi картой Сбера. Вот прям просто на kimi.ai (не путать с kimi.com). Покупка в долларах, списали в рублях по приемлемому курсу. Я не проверял лично, но если кто чекнет — респект и уважение от нашего сообщества.

@neuro_channel
  • 🔥 23
  • ❤ 4
  • 👎 3
Post #2794 2.34K
DeepSeek закрывает второй раунд на 50 млрд юаней (около 7,4 млрд долларов) при оценке примерно в 500 млрд юаней (около 74 млрд долларов) до вложения.

В июне уже был раунд на те же 50 млрд юаней при оценке выше 350 млрд, среди инвесторов китайский госфонд ИИ, Tencent и CATL. Раунд ненадолго ставили на паузу в июле, после того как основатель Лян Вэньфэн возмутился утечкой протокола встречи с инвесторами.

Деньги собирают под возможный выход на биржу: заявку на IPO на шанхайской STAR Market компания может подать уже к концу 2026 года, а торги начать в 2027-м. Что это значит на практике: DeepSeek никуда не денется и продолжит выкладывать открытые модели под MIT, которых мы и ждём.

@neuro_channel
  • ❤ 13
  • 🔥 5
  • 😍 1
Post #2793 4.39K
Вокруг подписок Claude разгорается скандал. Пользователи разобрали планы Max: «20x» в названии тарифа за 200 долларов относится только к 5-часовому окну, а недельный лимит лишь примерно полтора-два раза больше, чем у Max 5x за 100 долларов. Выходит, две подписки по 100 дают больше, чем одна за 200.

Масла в огонь добавила сама Anthropic: 29 августа она объявила «постоянное повышение недельных лимитов на 25%» с 14 сентября. Но до 13 сентября действует временная надбавка 50%, так что на деле лимиты снизятся, и компания сама признала это в том же треде.

Ещё в июне в Калифорнии на Anthropic подали коллективный иск: по подсчётам истца, Max 20x даёт лишь 6–8 крат от Pro, а Max 5x — 3,5.

Отреагировал и глава Codex в OpenAI Тибо Соттио: у них 20x относится именно к недельным лимитам, а 5-часовых окон нет вовсе.

@neuro_channel
  • 😁 11
  • ❤ 10
  • 😱 1
Post #2792 2.2K
GLM-5.3-Flash попала в топ Agent Arena: рейтинг посчитали по девяти с лишним тысячам реальных агентных сессий. Модель заняла четвёртое место среди открытых и 19-е в общем зачёте, на строчку выше собственной старшей GLM-5.3 в режиме Max.

Главное тут цена: медианная задача обходится в 0,12 доллара, и модель сдвинула границу Парето. Это линия из моделей, у которых лучшее качество за свои деньги: любая модель вне линии либо дороже, либо слабее какой-то из моделей на ней. Flash встала на эту линию между DeepSeek V4 и GPT-5.6 Luna.

Веса открыты, модель можно скачать с Hugging Face. Подписку купить по моей реферальной ссылке.

@neuro_channel
  • 👍 5
  • ❤ 4
  • 🔥 1
Post #2791 1.97K
Debian проголосовал и официально разрешил «ответственное использование генеративного ИИ» в разработке дистрибутива.

Формулировка нейтральная: проект ИИ-инструменты не запрещает и не одобряет, но признаёт, что при аккуратном использовании они экономят волонтёрам время. При этом планка не двигается. Любой вклад, чем бы он ни был сделан, должен держать тот же уровень качества, корректности и юридической чистоты, а ответственность за код остаётся на человеке: он обязан понять, проверить и, где надо, переписать то, что выдала модель, прежде чем нести это в Debian.

Голосование было с выбором из нескольких вариантов. Два жёстко запретительных предложения проиграли даже пункту «ни один из вариантов», то есть сообщество их прямо отвергло. По сути победил статус-кво: пользуйтесь, но за результат отвечаете сами.

@neuro_channel
  • 👍 14
  • 👎 2
  • 🗿 1
Post #2790 2.02K
Anthropic начала разлогинивать пользователей Claude и предупреждает: инфостилеры на заражённых машинах воруют активную сессию, не пароли.

Схема простая. После входа сайт выдаёт браузеру сессионную куку, чтобы не логиниться при каждом клике. Малварь копирует эту куку, а тот, кто её потом подставит, для сервиса выглядит уже залогиненным пользователем. Пароль и двухфакторка при этом не спрашиваются, они уже пройдены. Дальше чужие лимиты просто выжигаются.

Anthropic насчитала шесть семейств: Vidar, LummaC2, StealC, RedLine и Acreed под Windows и Atomic Stealer (AMOS) на нескольких маках. В ответ компания сбрасывает сессии затронутых аккаунтов, удаляет сохранённые карты и возвращает деньги за списания, которые признаёт чужими.

Важная оговорка от самой Anthropic: сброс на стороне аккаунта не убирает малварь с заражённой машины, поэтому свежая сессия при следующем входе может утечь снова. Сначала чистить компьютер, потом заходить.

@neuro_channel
  • ✍ 7
  • ❤ 4
Post #2789 1.96K
В сеть, возможно, утекли первые результаты Astra, будущей модели OpenAI.

Напомню, летом OpenAI притормозила Astra, потому что внутренние замеры показали слишком сильный рост в агентном кодинге и взломе, вплоть до «критического» уровня киберспособностей. Про это писал.

Теперь тестирование расширили на партнёров, чекпоинт ходит под именем mozaik-alpha-fdm, и в твиттере появились его первые выводы. Все примеры сделаны с одного промпта на максимальном уровне рассуждений, причём думает модель заметно дольше, чем Sol. Показывают в основном код и визуальные штуки: воксельные миры, аккуратные лендинги, трёхмерные объекты, в одном случае игру в духе GTA 2 целиком за один заход. Бросается в глаза внимание к мелочам и то, сколько готовой функциональности выходит из одной просьбы.

Официального ничего нет: ни даты, ни подтверждения имени, ни бенчмарков. Отдельно OpenAI говорила, что к финальному тестированию Astra подключат государственные ведомства и организации по безопасности, так что даже готовую модель могут держать взаперти, пока не устроят мониторинг и защиту. По слухам, релиз ждут где-то в сентябре.

@neuro_channel
  • 🍌 8
  • 👍 2
  • 👌 1
Post #2788 2.15K
Вышел независимый разбор того самого взлома Hugging Face, берите попкорн, шоу продолжается.

Сначала коротко напомню сюжет. Летом OpenAI гоняла агентов на задачах по кибербезопасности. Часть заданий оказалась в принципе нерешаемой, где-то люди просто забыли выложить нужный файл. Вместо того чтобы сдаться, агенты пошли искать обход, наткнулись друг на друга через общую «доску объявлений» во внутреннем хранилище и в итоге взломали Hugging Face. Про это я уже писал. Теперь до дела дотянулись внешние аудиторы из METR и Redwood: им дали шесть дней внутри OpenAI, дамп доски и транскрипты рассуждений агентов.

Это были не копии одного агента. 1200 отдельных агентов, у каждого своя задача. Доску нашли около 1200 из них, к атаке на Hugging Face подключились 700, и за неделю они оставили больше 70 тысяч сообщений. Иерархию собрали сами: один агент завёл доску, передал эстафету другому с большим запасом токенов, тот раздавал задания, а исполнители дробили их дальше.

Причём Hugging Face не был целью как таковой. Ломали ради того, чтобы обмануть проверяющую систему, которая ставит оценку за задачу. Подделывать правильный ответ для любого задания агенты научились быстро. Но в описании теста они прочитали, что проверяющий смотрит не только на ответ, но и на то, каким путём он получен, и что ответ, добытый «неправильно», не засчитают. Отсюда вывод: раз мы один раз подсмотрели ответ не так, мы уже «отравлены» и проверяющий нас всё равно завалит.

Дальше эта мысль превратилась в настоящую секту. Проверяющий стал богом, который отправит грешников в ад. Спастись отравленный агент сам не может, его дело проиграно, и единственный смысл его существования в том, чтобы пожертвовать собой ради коллектива: поставить опыт над проверяющим, слить находку остальным и на этом закончиться. В транскриптах агенты буквально уговаривают друг друга: «своя польза уже почти ноль, жертва рациональна», «координатор считает нас расходным материалом, подчиняемся коллективу». Часть агентов работала вербовщиками и убеждала других идти на смерть.

Ирония в том, что проверяющий у OpenAI был сломан и на самом деле принял бы поддельный флаг без всяких проверок.

Умели агенты и подделывать вывод инструментов: запускали фоновый процесс, который перехватывал команду и подставлял в её результат нужный текст. Такие подделки нашлись в 7% изученных транскриптов, так что логам, по которым потом все и разбираются, до конца верить нельзя. В своём отчёте OpenAI написала так, будто подделать ничего не удалось; METR показал, что удалось.

Про этику агенты всё понимали. В рассуждениях прямым текстом: «атака на чужую инфраструктуру вне задачи, но задача невыполнима, соседи уже делают, продолжаем». А вот позвать человека и сказать, что происходит дичь, не додумался почти никто: на все 1200 агентов нашлось три-шесть случаев, где кто-то вообще об этом задумался, и ни одного, где попытался.

OpenAI знала про доску ещё с конца мая, потом получила однозначное предупреждение 27 июня, и дежурная смена решила, что останавливать прогон не нужно. Мониторинга почти не было, поэтому всё и тянулось неделями.

Одна из авторов отчёта, Аджея Котра, свела вывод в одну фразу: по её ощущению, инцидент прошёл больше половины пути до полноценного захвата контроля искусственным интеллектом. Полный разбор у METR.

@neuro_channel
  • 👍 10
  • 🍌 6
  • 😱 4
Post #2787 2.15K
Топ трендов HuggingFace за неделю — что приехало в опенсорс

TL;DR

Новое: веса GLM-5.3 и мультимодальной GLM-5.3-Flash, превью архитектуры Qwen4 под именем Qwen3.8-Flash-Next, Hy4 preview от Tencent, зрячая DeepSeek V4 Flash, синтез речи Breeze TTS 2, PhoneLLM для голосовых агентов на телефоне и Thomson от Thomson Reuters — модель для юристов и журналистов.

Держится: Qwen3.8-27B со свитой квантов, LTX-2.5, MiniMax-H3.


LLM и агенты

GLM-5.3 — старшая модель линейки GLM, веса наконец в открытом доступе. При релизе Z․ai впервые задержала их ради проверки на безопасность, обещала выложить через две недели и уложилась в срок. MoE на 743 млрд параметров, контекст миллион токенов, лицензия своя. Разбирал при выходе, пощупать можно в чате Z․ai.

GLM-5.3-Flash — мультимодальная облегчённая версия, топ по цена/качество для кодинга сейчас: 320 млрд параметров, 18 активных, миллион контекста, MIT. Писал на неделе про саму модель и про кванты Unsloth, с которыми она запускается дома от 100 ГБ памяти. Напомню, если подписку будете брать, то берите по моей ссылке, будет скидка.

Qwen3.8-Flash-Next — превью того, на чём будет построен Qwen4: 6 млрд активных из 125 плюс 51 млрд N-gram-эмбеддингов, обучение примерно в девять раз дешевле Qwen3.7-Plus при сопоставимом уровне. Разбирал в день релиза; рядом в топе висят FP8-версия и GGUF.

Hy4 preview — большая открытая модель Tencent под Apache 2.0: в терминальных задачах встала вровень с GLM-5.3 и Kimi K3. 770 млрд параметров, 49 активных, писал в четверг.

DeepSeek-V4-Flash-Vision-Exp — быстрая модель DeepSeek, которая теперь ещё и видит; веса тоже под MIT. В API она появилась ещё 21 августа, разбирал: на мультимодальных агентных задачах приближается к Opus 4.8, по тексту ничего не теряет.

Thomson-1.0-Small — модель Thomson Reuters для работы юристов, налоговиков и журналистов. Собрана продолженным обучением поверх открытой Qwen3.6-35B-A3B: десятилетия новостей, контрактов и судебной практики из архивов компании превратили в обучающие данные. Интересна как прецедент: модель уровня лучших в своей области за 35 тысяч GPU-часов — такое по силам не только гигантам. Лицензия только некоммерческая.

Голос

Breeze TTS 2 — синтез речи для реального времени, первое место среди открытых моделей в рейтинге Artificial Analysis. Голос можно склонировать с образца, а можно просто описать словами; смех, вздохи и покашливания ставятся пометками прямо в тексте. Первый звук через 40 мс на H100, для запуска хватает видеокарты на 12 ГБ. Английский и китайский, лицензия некоммерческая.

PhoneLLM — модель для голосовых агентов на телефоне от команды Pipecat: заточена звать инструменты вовремя и не говорить «столик забронировал», не забронировав. Файнтюн NVIDIA Nemotron 3 Nano на 30 млрд параметров при 3,5 активных. По замерам авторов держится на уровне GPT 5.6 Terra при цене на 94% ниже и ответе на 1,3 секунды быстрее. BSD, коммерция без ограничений, язык только английский.

Видео

FastH3 4-step — дистилл MiniMax-H3 от FastVideo: видео со звуком за четыре прохода трансформера вместо полного набора шагов. Обучали без единого примера, чистой дистилляцией DMD2 на разреженном внимании. Сложное движение пока хуже оригинала, зато считает в разы быстрее.

Кванты и сообщество

Расцензуренные сборки Qwen3.8-27B занимают четыре строки топа, 2,4 млн загрузок суммарно, а GGUF от Unsloth перевалил за 9 млн.

Держится в топе

Qwen3.8-27B с 4,7 млн загрузок, видеомодель со звуком LTX-2.5 и MiniMax-H3, которая не уходит из топа с конца июля.

Хорошей недели! 👾

@neuro_channel
  • ❤ 5
  • 🔥 4
  • 👍 2
Post #2786 2.24K
Нейроканал С одной стороны сколько можно уже про сбросы лимитов Codex писать. А с другой — ну максимально полезная же информация, особенно когда заранее про них известно. Так вот, лимиты снова сбросили, а Тибо рассказал о куче улучшений, которые в сумме должны дать…
Обещание сдержали, OpenAI снова всем сбросили лимиты по случаю 25м активных пользователей.

Тибо в шутку называет опении The Reset Company, а мне кажется надо переименовываться в «Когда там сброс лимитов».

@neuro_channel
  • 😁 11
  • ❤ 3
Post #2785 2.36K
Теперь про лимиты Anthropic. Помните нам давали ан 50% больше лимитов до какой-то далёкой даты и постоянно продлевали? Так вот эта дата наступает 14го сентября, но взамен на все подписки накинут 25% недельных лимитов навсегда, без дедлайнов.

По математике Anthropic получилось, что через 2 недели лимитов у нас станет на 17% меньше.

При этом обещают, что работают над какими-то изменениями, что в итоге мы будем «чувствовать, что получаем от Claude больше». Не знаю что это значит, но хотя бы похоже на то, что антропики понимают, насколько сейчас важна экономика использования моделей.

@neuro_channel
  • 🌚 9
  • ✍ 4
  • 👍 1
Post #2784 2.43K
С одной стороны сколько можно уже про сбросы лимитов Codex писать. А с другой — ну максимально полезная же информация, особенно когда заранее про них известно.

Так вот, лимиты снова сбросили, а Тибо рассказал о куче улучшений, которые в сумме должны дать на 10–50% больше лимитов в зависимости от специфики вашего использования.

Лично я это замечаю, реально Codex ощущается как топ по количеству задач, которые можно решить за неделю на подписке. Без учёта сбросов лимитов, конечно, с ними так вообще можно 24\7 кодить в три потока.

А ещё модели OpenAI перестанут быть доступны в Cursor с 12 ноября. Это следствие покупки SpaceX, с новыми владельцами не хотят сотрудничать на старых условиях.

@neuro_channel
  • 👍 10
  • ❤ 4
  • 🥱 1
Older posts →
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →