TGViewer
Channel Public Channel
ml phys

ml phys

@mlphys

Короткие технические разборы AI agents, coding agents, evals и LLM-инфры
Subscribers
2.89K
Photos
207
Videos
13
Links
133

Showing posts older than #326 · Back to latest

Older Posts 20 shown
Post #325 1.65K

Forwarded from Борис опять

Нужна ваша помощь! 👀👀👀

Мы, Steelman Labs, написали наш первый блог-пост: о том, что не так с computer use и как мы это решаем. А ещё выложили красивый демо-видос.

https://x.com/SteelmanLabs/status/2082789336995528727?s=20

Большая просьба помочь хайпом в твиттере
  • 🔥 5
  • ❤ 2
Post #324 2.59K
Меня жутко бесит такая особенность gpt 5.6. Я ей говорю что-то сделать. Она делает вообще откровенную х*йню. Я ей говорю не делать х*йню и она вместо того чтобы сделать всё правильно просто говорит: «Я больше не буду делать х*йню» и просто перестаёт что-то делать, сознаваясь в том, что нормальный результат она выдавать не готова, и мне следовало бы пересесть на опус 5
  • 😁 34
  • 💯 8
  • ❤ 5
  • 👏 1
  • 🐳 1
Post #323 2.19K

This post (sticker, poll or similar) has no web preview. Open in Telegram

  • 😁 49
  • ❤ 14
  • 🔥 9
  • 👍 2
Post #322 2.67K
Bolt.new Забыт.

Jasper AI забыт (не уверен, что хотя бы 10% от подписчиков хотя бы знают, что это, а это первый chat gpt wrapper юникорн полностью уничтожен через 43 дня после релиза )

Stable diffusion забыта

Devin забыт

Pause AI letter забыто
  • ❤ 8
  • 😁 1
Post #321 2.47K
Rabbit r1 Забыт.
  • 🤣 22
  • ❤ 4
  • 🤯 1
Post #320 2.14K
Gpt store Забыт

Gpt tasks Забыты.
  • 🤣 11
  • ❤ 3
  • 🔥 2
Post #319 1.79K
Openai agent kit Забыт.
  • 😢 15
  • ❤ 9
  • 🤣 8
  • 🤯 2
Post #318 1.94K

This post (sticker, poll or similar) has no web preview. Open in Telegram

  • 👍 12
  • ❤ 2
Post #317 1.92K
Пост про децентрализованный инференс

В прошлом году я писал про Cocoon, децентрализованный инференс для LLM на NVIDIA TEE. TEE это технология NVIDIA, которая гарантирует, что вычисления идут приватно. Владелец видеокарты не может прочитать ваш запрос, а вы можете проверить, что он действительно запустил нужную модель. Поэтому покупатель токенов знает две вещи: он получает модель, за которую заплатил, и никто не читает его запросы. Это гарантирует криптография, сервису не нужно верить на слово.

GPU confidential computing появился начиная с NVIDIA H100. H100 стоит десятки тысяч долларов, это совсем не потребительская видеокарта. Поставщиками в таких сетях в основном становятся дата-центры, и децентрализация получается ограниченной.

А хотелось бы, чтобы любой человек в любой точке мира мог подключить обычную видеокарту и генерировать токены (где-то мы это уже видели) для разных AI-моделей. Такая сеть могла бы задействовать огромный парк дешёвого простаивающего железа по всему миру: люди подключают свои видеокарты на ночь, предложение compute растёт, цена инференса падает относительно дата-центров.

Но тут возникает проблема: как гарантировать, что инференс-провайдер выполняет нужные операции и запускает нужную модель? В сеть могут войти аферисты, которые запустят заквантованную до лоботомии версию модели, модель сильно меньше исходной или вообще будут выдавать константный текст, получая деньги за токены.

Проверяют это через logprobs. Исполнитель вместе со сгенерированным текстом отдаёт распределение вероятностей следующих токенов. Валидаторы случайным образом выбирают позиции, повторно вычисляют их на заявленной модели с теми же параметрами и сравнивают распределения. Значимое расхождение выдаёт подмену: мошенника исключают из сети и лишают вознаграждения. Достаточно проверить малую случайную долю позиций. Logprob-проверка подтверждает честность инференса, но приватность запроса сама по себе не обеспечивает.

На этом подходе строится Gonka, сеть децентрализованного инференса, которую развивают братья Давид и Даниил Либерманы. Сеть рассчитана на распределённое железо, включая потребительские GPU.
Telegram ml phys Сосун Недавно Telegram прдеставили cocoon - децентрализованную сеть для инференса моделей LLM. Почти одновременно с ними (но не так громко) запустились еще 2 подобные сети - gonka.ai от Либерманов и Loyal который собрал сумашедшие 75 млн долларов на IDO…
  • ❤ 21
  • 🤝 4
  • 🤔 1
Post #316 1.54K
Год назад Андрей Карпаты назвал LLM новым компьютером, который программируется на английском: промпты становятся программами. Илон Маск позже пошёл дальше и предположил, что ИИ будет сразу создавать готовые бинарники. Тогда это звучало как прогноз об исчезновении привычных программ. Кажется, мы уже близко.

Раньше я автоматизировал личные рутины через n8n и Python: выставление инвойсов, простую бухгалтерию, умный дом и ведение списка задач в GTD. Сейчас я использую Hermes Agent, аналог OpenClaw, сделанный без AI-слопа. Я описываю ему задачу, а регулярные процессы прошу запускать по расписанию. Например, агент сам готовит инвойсы, отправляет их компаниям и загружает данные в грузинскую налоговую.

Раньше разработка автоматизации часто стоила дороже её пользы. Агенты резко снижают стоимость запуска: сформулировал задачу, проверил результат, запустил. Особенно сильно агенты изменят малый и средний бизнес, которому дорого нанимать сотрудников и разрабатывать отдельные системы: закупки, управление остатками, поиск тендеров, мониторинг конкурентов и оптимизация расписания. Возможно, эпоха программ-промптов уже наступила. Просто наступила неравномерно.
YouTube Andrej Karpathy: Software Is Changing (Again) Andrej Karpathy's keynote on June 17, 2025 at AI Startup School in San Francisco. Slides provided by Andrej: https://drive.google.com/file/d/1a0h1mkwfmV2PlekxDN8isMrDA5evc4wW/view?usp=sharing Chapters: 00:00 - Intro 01:25 - Software evolution: From 1.0 to…
  • ❤ 9
  • 🤔 4
  • 🔥 2
  • 🥰 1
  • 💯 1
Post #314 1.87K
Небольшой апдейт по тому человеку, от которого был исходный твит.

Я эту историю хорошо помнил, но по картинке сразу не понял, что автор исходного твита и есть тот самый Мэтт Шумер.

Когда трава была зеленее, а агенты тупее, топом опенсорса была Meta Llama 3. Шумер заявил, что дообучил её до качества фронтира каким-то очень странным методом под названием Reflection-Tuning. Тогда все начали активно это обсуждать, но через пару дней оказалось, что веса «обученной им модели» хуже оригинала, результаты бенчмарков не воспроизводятся, а его приватный API на самом деле проксирует фронтирный тогда Sonnet 3.5, на котором к тому же быстро кончились деньги.

Так что вполне возможно, что история с удалением файлов была таким же способом похайпиться. Слишком уж умны современные модели, чтобы настолько глупо ошибиться. Но это не повод забивать на безопасность: права агентов всё равно надо ограничивать, а сами процессы запускать в sandbox.
  • ❤ 13
Post #313 1.48K

Forwarded from Data Secrets

Интернет взрывает новая модель Reflection 70В: она выбивает на бенчмарках результаты, превосходящие Claude 3.5 Sonnet и GPT-4o

Название Reflection выбрано в честь метода Reflection-Tuning: это когда модель итеративно обучается на синтетических структурированных данных, чтобы научиться рассуждать и самокорректироваться. Плюсом добавлен отдельный этап планирования для улучшения CoT. В качестве инициализации брали Llama 3.1 70B.

На практике модель прямо в ответах оборачивает все рассуждения в тег <reasoning>, а возможные ошибки в тег <reflection>. Затем она обнаруженные ошибки исправляет, и итоговый ответ выдает в теге <output>.

Результаты на бенчмарках: 89,9% MMLU, 79,7% MATH, 90,1% IFEval, 99.2% GSM8K. Говорят, что тот самый синтетический датасет и техрепорт будет на следующей неделе. А еще на следующей неделе обещают Reflection на 405В 😨

Сама модель уже доступна на HuggingFace.
  • ❤ 9
  • 👍 1
Post #311 1.44K
  • ❤ 5
  • 🫡 5
  • ❤‍🔥 3
Post #310 1.69K
Мэтт Шумер запустил GPT-5.6-Sol и остался почти без файлов на маке. Из-за ошибки при подстановке $HOME команда очистки превратилась в rm -rf /Users/mattsdevbox. Процесс успели остановить, но удаление к тому моменту уже прошло.

У меня Claude Code однажды тоже чистил домашнюю директорию. Он создал папку с названием ~/, потом понял, что ошибся, и удалил её командой rm -rf ~/. С тех пор я стараюсь ограничивать, куда модель может дотянуться.

Раньше в Claude Code ограничения проверялись на уровне tools. Wrapper смотрел, можно ли конкретному инструменту тронуть файл, и разрешал либо блокировал запись. Обходилось это shell-командой или скриптом, который писал сам агент. Файл менялся мимо того tool, что проверял wrapper.

Сейчас сендбокс работает на уровне ОС. Под него попадают shell-команды, Python-скрипты и subprocess'ы. Напишет агент скрипт, который пытается писать за пределы разрешённого scope, операция вернёт ошибку доступа.

Вот 3 примера, как сендбоксить Codex. Посмотрите на них и всё поймёте. Тут не нужны ни Docker, ни отдельный ПК.
Telegraph Как ограничить доступ Codex к проекту Где находятся правила Для всех проектов правила читаются из ~/.codex/config.toml и ~/.codex/rules/*.rules. Для одного проекта применяются <project>/.codex/config.toml и <project>/.codex/rules/*.rules. Слой проекта загружается только для доверенного проекта.…
  • ❤ 5
Post #309 1.49K

Forwarded from Старший Авгур

Вот такую писюльку получил 5 минут назад.

Нахуй Хабр. Не пишите туда, не читайте его.

Датасет я не закрою, пока они не соизволят написать нормальное письмо.

После этого сделаю приватным, если кому-то будет нужен - пишите в личку. А лучше скачайте сейчас.
  • 👍 16
  • 🔥 3
  • 👎 1
Post #308 1.9K
Меня постоянно спрашивают про Hermes Agent (опенсорсный агент типа OpenClaw) - зачем он нужен.

Собрал ответы на самые частые вопросы в один пост.

Чем это лучше Codex или клод кода, запущенного в терминале и подключённого к телеграму?

Ничем. Это буквально оно и есть - claude code / codex на сервере или ноуте, плюс небольшие фичи для постоянной работы: чуть иначе организованная память, работа с проектами, кроны.

Чем это лучше приложения ChatGPT / Claude с подключёнными коннекторами?

Коннекторы там сделаны через жопу, и живут в разных мирах (подозреваю дело не в том что в OpenAI плохие инженеры, а в том что приложение проектировали когда агентов не существовало, а модели не могли внятно ответить на один вопрос). Попробуйте сказать ChatGPT: найди в Gmail последнее письмо где я отправлял PDF, скачай файл, переведи на китайский, собери обратно в PDF и отправь тому же адресату. Есть коннектор к Gmail, есть встроенная файловая система, есть python - а задача не решается, потому что Gmail-коннектор не может положить файл туда, где живёт python. У Claude с этим получше, но до идеала далеко. У агента всё это один линукс.

Второе - в приложениях нет проактивных действий. Всё триггерится моим сообщением: я пишу - модель отвечает. А хочется наоборот - чтобы модель писала мне, когда что-то произошло. Вы скажете - у ChatGPT же есть кроны. Кроны это другое. Вот мой пример: на каждый релиз Claude Code взять changelog, скачать бинарник, отреверсить и написать мне только если внутри есть фичи которых в changelog нет - спрятанные за фича-флагами, иначе молчать. Так я узнаю что антропики готовят, до анонса. Это не «каждый день в 9 утра сводка новостей», это пиши если что то случилось.

Третье - persistent deployment. У меня рядом с агентом 24/7 крутится сервис который сливает выбранные телеграм-чаты в sqlite базу, вообще без LLM. Агент по крону читает базу, занимается тренд-вотчингом и приносит саммари - если все начали обсуждать что-то новое, я узнаю первым, не читая тысячи сообщений. Сервисы легко стыкуются: один пишет в файл, другой читает. В ChatGPT пришлось бы городить свой MCP и микросервисы ради базовой задачи. Тут я сказал агенту что нужно - он написал, запустил у себя, моей когнитивной активности потребовалось ноль.

Это же супердорого - нужен Mac mini и куча токенов?

Сервер за $12 в месяц, хватает полностью. До этого крутил на ноутбуке, но отказался - ноут выключен ровно тогда, когда надо что-то с телефона. Токены из той же подписки Codex что и приложение, доплачиваю ровно ноль.

P.S. ChatGPT сегодня обещает большой редизайн приложения и прокачку агентского режима. Очень жду - возможно они учтут успех таких агентов и притащат хотя бы часть фичей к себе. Потому что у формата с телеграмом есть свои минусы: чат один, и пока агент что-то ресёрчит, вторую задачу в параллель ему не дать. Плюс на сетап всё равно уходит время. Если они сделают то же самое за подписку и без сетапа — перееду.

Сразу, как канал наберёт 3 000 подписчиков, опубликую вторую часть, в которой расскажу про свои юс-кейсы агента и то, как я его засетапил так, чтобы он реально сильно экономил моё время.
  • ❤ 35
  • 👍 12
  • 🔥 7
Post #307 1.57K
Про это уже все забыли, но через неделю лимиты Клода порежут в два раза.
  • 😭 16
  • 👎 4
  • 😁 3
  • 🤯 1
  • 😢 1
  • 🎉 1
Post #306 1.6K
Gpt 5.6 будет уже в этот четверг. Они обещают прорыв, но у Сэма такая себе репутация на прорывы после релиза GPT5, Так что не знаю.

Из того, что очень жду, это запущенный GPT на cerebras чипах на большой скорости. Такое уже делали с 5.3 кодекс, но там это был запуск урезанной модели. А тут обещают полноценную.


https://x.com/OpenAI/status/2074704958419792299?s=20
X (formerly Twitter) OpenAI (@OpenAI) on X GPT-5.6 Sol, along with Terra and Luna, will launch publicly this Thursday. We’re expanding preview access globally now.
  • ❤ 3
Post #305 2.58K
ВЫ ИСПОЛЬЗУЕТЕ FABLE НЕПРАВИЛЬНО!!!1!

Слышу регулярно: «Fable работает так же как Opus, зачем платить больше». И бенчмарки, и мой личный опыт говорят обратное: разница заметная. Какое-то время я не мог понять, откуда берётся это ощущение у людей, пока не вспомнил одно обсуждение в чате канала, около месяца назад.

Тогда в чате я обсуждал с человеком, почему он не чувствует разницы между Opus и Sonnet. Я посмотрел, как он работает с моделью, и стало понятно: он ей отдаёт слишком мало. Пишет, в каком файле писать, какие классы создавать, по шагам расписывает структуру. В таком режиме модель превращается в coding assistant, автодополнение на стероидах. С этим обе модели справляются нормально, и Opus может быть даже хуже, потому что у него есть своё мнение и он начинает спорить с твоим микроменеджментом. Я сказал ему попробовать ставить задачу на уровне целого модуля: описать, что нужно, дать модели самой решить, как это разложить по файлам и классам, а потом уже ревьюить результат. Он быстро увидел, что Opus тащит такие задачи сильно лучше: ему можно кинуть большой кусок работы и получить результат, с которым Sonnet просто не справляется.

С Fable и Mythos ровно та же история. Это модели другого уровня, и работать с ними надо на другом уровне. Им нужно отдавать на откуп сильно больше, чем Opus. Если вы используете Fable как Opus, вы получите результат как от Opus, и будете справедливо недоумевать, за что переплачиваете. Сильные модели раскрываются, когда вы перестаёте за них думать.

P.s.: если у вас нет задач на фейбл, что бы не потерять лимиты, попробуйте /insights что бы он дал вам советы по работе с клод код
Telegram ML physicist Coworking Алексей Маметьев invites you to join this group on Telegram.
  • ❤ 15
  • 👍 5
  • 🔥 1
  • 😁 1
  • 🤯 1
  • 💯 1
  • 👀 1
Older posts →
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →