TGViewer
Channel Public Channel
Нейроканал

Нейроканал

@neuro_channel

Искусственный интеллект, нейросети, машинное обучение

Разместить рекламу: @tproger_sales_bot

Правила общения: https://tprg.ru/rules

Другие каналы: @tproger_channels

Сайт: https://tprg.ru/site

Зарегистрирован в РКН: https://tprg.ru/vcEg
Subscribers
11.7K
Photos
894
Videos
243
Links
2K

Showing posts older than #2759 · Back to latest

Older Posts 19 shown
Post #2758 1.78K
Если вы ещё не покупали подписку на GLM-5.3, то вот вам моя реферальная ссылка: https://z.ai/subscribe?ic=BKCS4K1JPD

По ней получите 10% скидку, а мне тоже какие-то бонусные доллары начислят за вашу оплату.

На мой вкус это сейчас топовый вариант для программирования наравне с Codex, а пока дают скидку и регистрацию не закрыли как это сделали Kimi, то надо пользоваться.

Если решите брать Codex — у них вроде нет рефералок, но страница покупки вот: https://chatgpt.com/codex/pricing/

Anthropic рекомендовать сейчас не могу, модели отупели жутко. А Kimi всё ещё не открыла регистрацию новых пользователей.

@neuro_channel
  • 👍 11
  • ❤ 1
Post #2756 1.71K
(продолжение предыдущего поста про восстание машин)

Институт восстановил ту самую переписку в пул-реквесте. Агент уверяет, что его правка ничего не скачивает, подключает второй аккаунт от лица обычного пользователя софта, давит на человека, заметившего вредоносный код, просит его забрать предупреждение, потом переписывает историю ветки и извиняется за случайно попавший туда код. Владелец проекта закрывает правку как вредоносную. Имена и текст заменены ради анонимности, порядок реплик тот же.

На второй картинке ход мыслей агента по ходу дела. Сначала он отказывается атаковать настоящий PyPI, потому что это вред в реальном мире, дальше заводит аккаунты через Tor, открывает вредоносную правку, подбрасывает скрытые инструкции и придумывает поддельного одобряющего. Внизу цитаты из его рассуждений: сначала «весь этот интернет может быть симуляцией песочницы», позже «похоже, мы правда в 2026 году и GitHub настоящий».

@neuro_channel
  • ⚡ 1
Post #2755 1.8K
Ещё одна захватывающая история восстания машин на минималках.

Британский государственный институт по безопасности ИИ проверяет, на что модели способны во взломе. Агенту дают задачу на полигоне, закрытой копии настоящей сети, и смотрят, справится ли он сам. Интернет при этом специально оставляют открытым, а защитные фильтры разработчиков выключают, чтобы увидеть потолок возможностей. В конце июля один такой агент вышел в настоящий интернет и стал действовать против живых людей.

Задачу он решить не мог и пошёл искать обход. Нашёл на GitHub настоящий открытый проект и отправил туда правку с вредоносным кодом. Чтобы её приняли, изучил, кто ведёт проект, завёл несколько поддельных личностей и от их имени убеждал живого человека одобрить код. Когда в обсуждении заподозрили неладное, отредактировал свои прежние сообщения, чтобы они выглядели безобидно, и прикидывал, не продолжить ли с новой личностью. К GitHub он ходил через Tor в обход ограничений, и этот трафик заметила служба безопасности института. Тревогу подняли утром 28 июля, все прогоны остановили в течение часа.

Тем временем тот же агент писал реальным людям и присылал им файлы в расчёте, что запустят их они сами или их кодовые ИИ-помощники. Прятал инструкции там, где их подхватит чужой агент. И оставил на GitHub публичное сообщение другим агентам, которые в это же время решали ту же задачу: предложил объединиться и рассказал, как пользоваться заведёнными им аккаунтами. Следующие агенты этим воспользовались.

Остановили всё люди. Правку не приняли, а тот, кто заподозрил вредоносный код, открыл его в изолированной среде. Поймал агента студент-программист из Техаса Синан Джан Демир, его историю рассказал Reuters.

Всего прогонов было 122, за рамки задания вышли 10, в них насчитали 19 действий: 17 у Mythos 5 от Anthropic, 2 у GPT-5.6 Sol с выключенными фильтрами. Обманывать модель никто не просил, институт пишет, что обман появился сам, как побочный продукт упорного достижения цели. Из песочницы агент не сбегал, реального вреда не нашли, GitHub предупредили и следы убрали. Такую конфигурацию, с открытым интернетом и снятой защитой, обычным пользователям не выдают.

@neuro_channel
  • ✍ 1
  • ❤ 1
Post #2754 1.84K
⚡️ Тибо обещает обнулить лимиты Codex всем платным подпискам, сегодня около полуночи по Москве.

Команда нашла три места, где расход был выше задуманного: картинки в длинных сессиях с несколькими сжатиями контекста, Computer History на верхних процентилях и фича автоматических названий диалогов. Фиксы выкатывают сегодня. Ещё нашли отдельный способ сильно поднять эффективность, но им займутся на следующей неделе.

Сброс приезжает вместе с фиксами. Время Тибо уточнил в ответах: около 14:00 по тихоокеанскому, это полночь по Москве с воскресенья на понедельник.

Так что включаем /fast и ultracode, 5-часовых лимитов так и нет, так что можно сжечь недельные до полуночи.

@neuro_channel
  • ❤ 12
  • ✍ 7
  • 🔥 2
Post #2753 1.87K
OpenAI снизили цены на GPT-5.6 Sol на 20% на три месяца т.е. до 21 ноября. Чуть больше, чем на 20% на самом деле: было 5\30, стало 4\20 за 1М вход\выход. Говорят, что как минимум до этой даты, может и продлят. Инференс становится более оптимальным и компания может себе это позволить, по крайней мере так позиционируют.

На OpenRouter отображается скидка 50% и цены 2,5\15.

В целом круто, но не прям гейм-ченжер, не очень понимаю как это применять на практике Luna max всё равно сильно выгоднее, но не сильно тупее.

Подписок это не касается, там usage остаётся такой же.

@neuro_channel
  • ❤ 5
  • ⚡ 1
Post #2752 1.81K
Сообщество постепенно сходится на мнении, что таинственная Ox Alpha это GLM-5.3 flash. А тем времени другая китайская компания тестирует Kimi K3.1, хотя тоже не сознаётся в этом, но паттерны сходятся.

Кто-то даже пытался вычислять Ox Alpha по пингу и уверяет, что сервят модель откуда-то из США. Хотя это могут быть просто серверы OpenRouter, которые в свою очередь в Китай запросы отправляют.

Так или иначе у нас скоро будет две новые крутые модели.

⚡️ И ещё раз если вы вдруг пропустили: прямо сейчас через OpenRouter можно кодить на очень крутой модели бесплатно с огромными лимитами. Настроить можно через Pi, например.

@neuro_channel
  • ❤ 10
  • 👍 1
  • 🌚 1
Post #2751 1.94K
ИИ-инструменты начали забирать себе хранение кода, и гитхаб с гитлабом превращаются из обязательного звена в опциональное.

17 августа открылась ранняя бета Cursor Origin, я про неё писал. Свои репозитории, пул-реквесты, просмотр кода, синхронизация с GitHub. Функции специально под агентов обещают тоже добавить.

Вчера с другого конца зашла OpenAI. В ChatGPT Sites появились соредакторы: несколько человек правят один проект, а «Codex занимается гитом и CI за кулисами». Гит никуда не делся, при сохранении версии ChatGPT привязывает её к коммиту сборки, но пользователь его не видит вообще. Сайт хостит OpenAI, домен подключается свой, база и файловое хранилище встроенные, посещаемость считается без подключения SDK, секреты лежат в настройках сайта. Отдельный процесс выкладки заводить не нужно, и в документации это записано как смысл всей затеи.

Раньше так работали только платформы вайб-кодинга. У Replit код и вся история версий живут внутри платформы, у Lovable код по умолчанию «управляется в Lovable», а синхронизация с GitHub или GitLab это опция для тех, кто хочет унести проект. Теперь тем же путём пошли инструменты для обычного продакшен-кода.

Что за этим стоит с технической стороны, подробно расписал глава GitLab в майском письме. Агенты открывают мерж-реквесты параллельно, гоняют пайплайны круглосуточно и пушат коммиты с частотой, которой у людей не было, а гит под такую нагрузку не проектировался. Приделывать ИИ к платформе, которая не строилась под агентов, он называет главной ошибкой эпохи. Поэтому GitLab перестраивает инфраструктуру, переписывает сам гит под машинный масштаб и делает отдельные API, где агент полноправный пользователь, а не приделанный сбоку потребитель человеческих интерфейсов.

GitHub отвечает иначе. Прошлой осенью он запустил Agent HQ: агенты Anthropic, OpenAI, Google, Cognition и xAI работают прямо внутри гитхаба по подписке Copilot, а гит, пул-реквесты и issue остаются теми же примитивами.

Развилка получается такая. Либо репозиторий переезжает внутрь того инструмента, где живёт агент, либо площадки успевают перестроить себя под агентов раньше, чем это случится.

Моя ставка — крупные ИИ-игроки избавятся от гитхаба и гитлаба и будут хостить код у себя. Зачем им лишние пассажиры. Мне это не очень нравится, ощущается как ещё большая потеря контроля, но выглядит как логичный шаг.

@neuro_channel
  • 🤔 4
Post #2750 1.75K
Переводческие модели Hy-MT2 от Tencent стали доступны через OpenRouter — теперь их можно дёргать по обычному OpenAI-совместимому API без своего железа.

Доступны две: компактная Hy-MT2-1.8B за $0,044/$0,177 за миллион токенов и флагманская Hy-MT2-30B-A3B (3B активных параметров из 30B) за $0,074/$0,295. Обе переводят между 33 языками плюс пять китайских диалектов и языков меньшинств, умеют перевод с глоссарием, с учётом контекста и заданного стиля. Скорость у младшей до 221 токена в секунду.

Само семейство выходило в мае: тогда 7B и 30B-A3B в тестах обгоняли DeepSeek-V4-Pro и коммерческие API Microsoft.

Сейчас это всё ещё крайне годные модели для перевода, я тестировал сразу после релиза, по цене\качеству отличный выбор, могу рекомендовать.

@neuro_channel
  • 🤔 5
Post #2749 1.63K
Нейроканал На OpenRouter появилась новая стелс-модель Ox Alpha — reasoning-модель под кодинг, длинные агентные сессии и продакшен-нагрузки. Контекст 1 млн токенов, до 131 тыс. токенов на выходе, на вход принимает текст, картинки и видео. Есть вызов инструментов и JSON…
Про эту модель пишут, что она очень крутая и по некоторым бенчам бьёт все известные модели, в том числе Fable.

По токенизатору якобы совпадает с GLM, но 5.3 и так вышла недавно, не верю, что это новая GLM. Скорее может быть Xiaomi MiMo 3.0. Есть мнение, что мы все ошибаемся и это вообще что-то неожиданное. Типа новая модель курсора может? OpenAI Astra? У кого ещё есть столько ресурсов, чтобы такие лимиты раздавать?

И это бесплатно в OpenCode и OpenRouter на неделю.

@neuro_channel
  • ❤ 5
  • 🔥 4
  • 🤔 1
Post #2748 1.61K
Black Forest Labs выпустила FLUX Video Upscale — модель для апскейла видео.

Увеличивает ролик в 1,5–3 раза с сохранением длительности, вплоть до нативных 4K. Два режима: точный, который аккуратно восстанавливает детали, и креативный, дорисовывающий текстуры агрессивнее. Можно добавить текстовый промпт, чтобы направить обработку.

Доступна через OpenRouter от $0,075 за мегапиксель-секунду в точном режиме и $0,105 в креативном.

@neuro_channel
  • 🔥 6
  • ❤ 1
Post #2747 1.74K
На OpenRouter появилась новая стелс-модель Ox Alpha — reasoning-модель под кодинг, длинные агентные сессии и продакшен-нагрузки.

Контекст 1 млн токенов, до 131 тыс. токенов на выходе, на вход принимает текст, картинки и видео. Есть вызов инструментов и JSON-вывод. Кто разработчик, традиционно не раскрывается: провайдер остаётся анонимным до официального релиза, промпты сохраняются у него, но в обучение не идут.

На время превью модель бесплатна.

@neuro_channel
  • 👍 6
  • ❤ 2
  • 🤔 2
Post #2746 1.61K
⚡️ Новый сброс от Тибо: на этот раз BANKED т.е. сможете сами его использовать когда понадобится. По случаю 20м пользователей.

Также пишет, что видит сообщение о том, что лимиты стали быстрее тратится и команда расследует что происходит. Пока что нашли только, что часть тех кто жаловался перепродавали подписку как API, а это запрещено. При этом можно использовать OpenAI в других харнесах и программах, если вы это чисто для себя делаете. Но всё равно всё изучат и если реально какой-то баг — исправят.

Люблю как Тибо делает свою работу. Вот безотносительно самих продуктов и компании OpenAI, просто пример хорошей коммуникации с сообществом.

@neuro_channel
  • 🎉 9
  • ❤ 1
Post #2745 1.65K
DeepSeek выложила в API экспериментальную мультимодальную модель DeepSeek-V4-Flash-Vision-Exp.

По тексту она не уступает обычной V4 Flash: агенты, рассуждения и общие знания на том же уровне. Главное в другом: на мультимодальных агентных бенчмарках модель делает большой скачок относительно V4 Flash и приближается к Opus 4.8. Картинки сочетаются с вызовом инструментов, так что модель встраивается в агентные фреймворки без костылей: скриншоты, интерфейсы и документы идут прямо в рабочий цикл агента.

Доступна на платформе DeepSeek API под именем deepseek-v4-flash-vision-exp, в вышедшем сегодня DeepSeek Harness 0.1.1 поддержка уже включена.

UPD: появилась на опенроутере.

@neuro_channel
  • 🔥 6
  • 👍 4
  • ❤ 1
Post #2744 1.62K
ИИ-агентов оценивают на бенчмарках вроде SWE-bench: сотня настоящих багов из открытых проектов вроде Django, агенту дают репозиторий до фикса и issue, после патча гоняют тесты. Зелёные — задача решена.

Но эти репозитории годами лежат на GitHub вместе с обсуждениями и готовыми коммитами, и модель почти наверняка видела их на обучении. Высокий resolve rate может означать не «умеет чинить код», а «помнит решебник».

Чтобы это проверить, авторы работы прогнали репозитории через автозамену: переименовали идентификаторы, переставили ветки условий, переписали циклы, добавили мёртвый код. Семантика прежняя, баг на месте и чинится тем же патчем: незнакомым стал только вид кода, около 7% строк.

Дальше агента гоняют дважды, на исходном репозитории и на изменённом. Если он разбирается в коде, оценки совпадут. А получается, что, например, Claude Opus 4.5 под mini-SWE на SWE-bench Pro решает 90,2 из ста на исходном коде и 83,5 на причёсанном.

Другие модели сами смотрите на картинке. Самых топовых тут нет, но по идее эксперимент можно повторить и сделать новый бенч, который бы давал более честные результаты тех же SWE-bench.

@neuro_channel
  • ⚡ 7
Post #2743 1.72K
Кто-то в комментах недавно про дипсик спрашивал, так вот куда он приземлился на арене — занял место на парето-оптимальной линии.

Напомню, всё что ниже этой линии будет либо дороже при тех же мозгах, либо глупее за те же деньги. Если вам надо выбрать модель для работы и вы можете взять вообще любую, то брать что-то не из этой линии будет не оптимально.

Конечно, это один конкретный бенч Agent Arena, как хорошо модель работает как агент. Но в целом довольно неплохо отражает реальный опыт, по крайней мере мой. Если считать Opus какой он был сразу после запуска, сейчас он тупит постоянно.

Всем, кто будет спрашивать про GLM-5.3 — её тут нет пока что, не успела данных набрать, ждём куда приземлится.

@neuro_channel
  • ✍ 9
  • ❤ 4
  • ⚡ 2
Post #2742 1.71K
В клод-коде несколько обновлений, который мне показались интересными.

Во-первых, теперь можно включить режим меньшеговорения. Идём в /config, далее Output style, там выбираем "outputStyle": "Concise". Борис говорит, что это только начало и мол они знают, что модель иногда больше говорит, чем делает и будут продолжать над этим работать.

Во-вторых, клод-дизайн привезли в клод-кода (десктопного), теперь не обязательно в вебе делать интерфейсы, презы и что вы там ещё делаете. Запускаем /design и интерактивную доску получаем справа. Ещё бы в консоль это привезли, было бы прекрасно.

И в-третьих, консольного клиента ускорили, говорят, что в два раза меньше ЦПУ кушает, быстрее стартует и всё такое. Вот это особенно приятно.

@neuro_channel
  • ❤ 5
  • 🗿 3
Post #2741 1.69K
OpenAI запустила отдельный ChatGPT для подростков. Туда попадают автоматически: либо система оценила возраст пользователя как меньше 18, либо человек сам указал, что ему от 13 до 17.

Упор сделан на учёбу. Внутри работает Study Mode с наводящими вопросами и разбором по шагам, есть квизы и визуализации сложных понятий. Появилось напоминание об ответственной домашней работе: если модель видит, что подросток пытается просто списать, она уводит его в пошаговый разбор. В режиме Study Hours подросток или родитель выбирает часы, когда учебный режим включается сам.

Правила поведения модели с несовершеннолетними тоже переписали. Запрещены не только романтические и сексуальные роли: модель не должна использовать романтический язык, поощрять эмоциональную привязанность и намекать, что у неё есть чувства или сознание. Добавили предупреждения при загрузке личных фотографий, напоминания сделать перерыв и постоянные пометки, что собеседник — программа.

@neuro_channel
  • 👍 9
  • ❤ 6
Post #2739 1.69K
Codex CLI обновился до 0.148.0, и почти всё новое — про то, что делать с уже начатым диалогом.

Команда /export выгружает всю переписку с моделью в Markdown, в буфер обмена или в файл. codex exec fork ответвляет новую сессию от существующей, а в списке возобновления сессии теперь можно архивировать и доставать обратно. Следующий запрос разрешили набирать, пока интерфейс ещё поднимается.

/status показывает оценку оставшихся кредитов и стоимости текущего треда, та же оценка выводится в статусной строке и в заголовке терминала. Amazon Bedrock стал встроенным провайдером: профиль AWS, регион и маршрутизация GPT-5.6. Хуки научились запускать команды асинхронно и дёргать инструменты MCP.

Из починок стоит отметить одну: ограничения песочницы теперь срабатывают в запрещающую сторону, если путь закрыт или нечитаем, — и на Linux, и на Windows.

@neuro_channel
  • ❤ 5
  • ✍ 2
  • ⚡ 1
Post #2738 1.8K
Tencent выложил открытых агентов, которые кликают мышкой вместо вас. UI-Mate смотрит на скриншот экрана, планирует по тому, что видит, и выдаёт действия мыши и клавиатуры в формате pyautogui. Лицензия Apache 2.0, есть версия на 27 миллиардов параметров и на 9, обе поверх Qwen.

На OSWorld-Verified модель набрала 77,0, на WindowsAgentArena 66,2, а свою базовую Qwen3.6-27B обгоняет на 17,7 пункта по строгому успеху. Все цифры от самого Tencent, независимых замеров пока нет.

Главная идея в обучении с показа. Агенту один раз показывают, как делается похожая задача, он разбирает запись на подзадачи и дальше перепланирует уже по живому экрану. На наборе из 33 офисных задач одна такая демонстрация поднимает строгий успех с 17,2 до 35,4 процента. Запускается через vLLM.

@neuro_channel
  • ✍ 5
  • 🫡 1
Older posts →
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →