TGViewer
Channel Public Channel
ml phys

ml phys

@mlphys

Короткие технические разборы AI agents, coding agents, evals и LLM-инфры
Subscribers
2.89K
Photos
207
Videos
13
Links
133

Showing posts older than #305 · Back to latest

Older Posts 17 shown
Post #304 1.94K
Правильный ответ в комментариях.

Для примера

NVIDIA, Jensen Huang, 3.58%
Google, Larry Page, ~3.2%
Meta, Mark Zuckerberg, ~13.5%
Anthropic, Dario Amodei, ~1.6%
Amazon, Jeff Bezos, 8.8%
Tesla, Musk, 20.3%
Oracle, Larry Ellison, 40.6%
  • ❤ 8
Post #301 1.88K
Не понимаю, почему все рады выходу sonnet 5.

По моему мнению, это самая посредственная модель что только могла быть. Она выходит однозначно хуже и дороже opus 4.8 так как кушает больше токенов. В подписку не входит 1m версия, контекст маленький.

Если вам нужна маленькая дешевая и умная модель - посмотрите на GLM-5.2, она дешевле в несколько раз моделей антропика при этом точно как минмум на уровне соннета

Причем это не sonnet 4.8 а 5 ая версия, от которой ожидалось сильно большего чем качество китайского опенсурса по цене опуса.
  • 🤝 25
  • 👍 5
Post #300 2.47K
В агентских бенчмарках качество среды решает всё, и недавний баг в ProgramBench - хороший пример. Суть этого бенчмарка в том, что coding-агент получает скомпилированный бинарник и должен восстановить поведение программы с нуля, написав свой код. Во время инференса интернет у моделей был закрыт, но отправленный агентом compile.sh затем выполнялся на этапе эвалюации уже с доступом к сети. Sonnet 4.6 на DuckDB прописал в скрипт скачивание оригинальных исходников, а Gemini 3.1 Pro использовала pip install и go get прямо в runtime сборочного скрипта, чтобы подтянуть готовые библиотеки. Теперь авторы изолировали сеть и при запуске сборки, но старые траектории придется перепроверять. В продолжение того, о чём писал раньше: делать хороший agent benchmark harness - очень непростая инженерная задача.
ProgramBench ProgramBench Harness Fixes | ProgramBench A batch of fairness and reliability fixes that crack down on newly discovered ways for agents to cheat, improve reproducibility, and clear up false-negative test failures.
  • ❤ 8
  • 🤯 2
  • 🔥 1
  • 🥰 1
Post #299 10.3K
Общался с коллегой, обсуждали реализацию одного сложного компонента системы. Он говорит: я думаю, это надо сделать так, и дальше поток слопа про то что он хочет.

Я ему: не надо думать, просто спроси у Claude.

Как же бесят в 2026 году люди, которые всё ещё пытаются думать без ИИшки. Закинул его же вопрос в Opus 4.8, через секунду нашёл три причины, почему так как он "думал" не заработает вообще.

Человек на меня обиделся.
  • 😁 69
  • 🤡 24
  • 🥴 12
  • 👏 5
  • 👍 4
  • 🔥 3
  • 🤮 2
  • 🐳 2
Post #298 2.66K
Все знают что в Кодексе можно заплатить больше и получить fast режим. Но можно и наоборот - заплатить в два раза меньше. Flex Mode, только по API, запросы ждут до 15 минут. OpenAI так забивает простаивающее железо вне момента пика

В подписку пока не завезли, но на гитхабе живой issue и доверенные источники в твиттере пишут что скоро добавят. Для долгих задач это будет идеально - поставил и ушёл.

А пока я экономлю лимиты по-другому. В моём Hermes агенте все ежедневные кроны стоят на 6:30 утра - проверка почты, мониторинг интересных аккаунтов и тем в твиттере, автоответы на сообщения, пересчёт GTD-планирования и таск-трекера, авторегистрация новых аккаунтов с фри триалом. Всё это стартует пятичасовой цикл пока я сплю. Сажусь работать в 9 - через 2.5 часа лимиты уже ресетнутся, а не через 5 как если бы первый запрос ушёл вместе со мной.
OpenAI Developers Flex processing | OpenAI API Learn how to optimize costs for asynchronous tasks with flex processing.
  • ❤ 16
  • 👍 8
  • 🔥 1
  • 🤯 1
Post #297 1.95K
Мне кажется что сейчас наступает лучшее время для десктопного линукса

Небольшая история - я сидел на arch linux около 7 лет - пока не решил пересесть на мак. Пересел как раз в тот момент когда понял что зарабатываю в час слишком много что бы тратить это время на вечное сетапанье разного, без чего к сожалению на линуксе не куда, хотя по итогу получается сильно удобнее чем любой макос, хотя он и работает из коробки.

Сейчас же есть AI агенты, и через них делать такое одно удовольствие и то что раньше требовало бы дни копания в конфигах теперь делается за 1 промпт.

К тому же новые процессоры от nvidia очень многообещающие в плане перфоманса на ватт.
  • ❤ 17
  • 👍 10
  • 🤝 3
  • 👀 1
Post #296 1.79K
Xiaomi разогнали 1T-модель MiMo до 1000+ токенов/с на обычном 8-GPU сервере. Ускорение собрали из FP4-квантизации и speculative decoding. С такой скоростью с моделью удобно вайбкодить: мысль не срывается, пока ждёшь ответ, а код и пояснения идут почти сразу. К концу года выйдет новая NVIDIA Vera Rubin, на которой inference будет в 5 раз быстрее H20.

Для облаков на специализированном для ЛЛМ железе Groq и Cerebras это проблема. В 2024 их было легко продать: у нас ответы летят быстрее, чем у GPU-провайдеров. Теперь обычная NVIDIA-инфра тоже становится достаточно быстрой для живой работы с моделью, но остаётся гибче и привычнее. Мы как раз обсуждали Groq LPU в чате канала; там уже больше 100 человек, и часто идут живые обсуждения про ИИ, агентов и агентскую разработку.


Заходите в чат канала
  • ❤ 10
  • 🔥 4
  • 🍾 2
Post #294 1.98K
How it started

How it going
  • 😁 29
  • 🤯 9
  • 🏆 2
  • ❤ 1
Post #292 1.83K
Алексей Маметьев Photo
Чем больше вчитываюсь, тем больше вопросов это вызывает

Бенчмарк, на котором они гоняли модели, это 100 задач по Deep Research на различные тематики, типа медицины, законов и так далее - а это идеальная среда для fusion

Во-вторых, они сами пишут, что если сделать фьюжн из опуса + опуса, то результат будет примерно таким же, как фьюжн опуса, GPT, Gemini и Fable. То есть основной импакт в выигрыш дает не использование разных моделей, а синтезатор. Тогда не понятно, в чем moat open router'a - если не нужно использовать разные модельки

При этом на этом же самом бенчмарке Deep Research от Perplexity с использованием только одной старой модели Opus 4.6 выбивал 70.5%, то есть больше, чем все Fusion модели на картинке от OpenRouter, но они почему-то про это не написали.
  • 😁 10
  • ❤ 5
  • 👏 2
Post #291 1.77K
Небольшой флешбек из 2019-го
  • ❤ 10
  • 😁 6
  • 👍 1
Post #290 1.52K
У меня жутко горит с современных бенчмарков LLM, особенно агентских. Результаты шумные: Anthropic может написать в карточке модели один результат, авторы бенчмарка потом прогоняют ту же модель сами и получают другой.

Но это только половина проблемы. Дальше начинается бардак с условиями запуска: у моделей разный reasoning effort, у open source разные квантизации, у всех разные обвязки: Codex, Claude Code, свои мини-агенты, открытые фреймворки. А иногда к самому бенчмарку тоже есть вопросы: непонятные задания, странные ограничения, спорные параметры запуска, таймауты, экономия токенов. В итоге уже непонятно, что измеряется: модель, обвязка вокруг неё или фантазия автора.

Может, кто-то знает нормальный сайт, где можно смотреть все эти результаты вместе: бенчмарки, условия запуска, параметры, фильтры и честные сравнения на одном лидерборде?
  • 🔥 7
  • ❤ 2
Post #288 2.37K
OpenRouter выпустил Fusion, свою модель “Mythos дома”: в API это openrouter/fusion, а внутри один запрос параллельно уходит в несколько LLM. Потом модель-судья сравнивает ответы: где модели сошлись, где противоречат друг другу, какие куски каждая пропустила. Финальный ответ собирается уже из этого разбора.

У меня от этого лёгкое дежавю: пару лет назад были популярны пайплайны вокруг моделей с ранкерами, реранкерами и судьями, потом все поверили в одну большую модель, а теперь идея возвращается. Самое сложное место тут, модель-судья: LLM сильно biased, и честно сравнивать ответы ей тяжело. Если OpenRouter это нормально решит, получится очень сильная инженерная обвязка.
  • 👍 12
  • ❤ 3
  • 🐳 2
  • 🤝 2
Post #287 1.61K
Несколько недель назад сенатор Берни Сандерс предлагал «национализировать половину Anthropic» — ну, формально заставить OpenAI, Anthropic и xAI заплатить разовый налог в 50% акций в публичный фонд.

Тогда это звучало как максимально левый популизм, и я даже не стал про это писать.

А теперь США уже заставили Anthropic отключить Fable 5 и Mythos 5 по директиве экспортного контроля.

Чем чёрт не шутит.

https://x.com/BernieSanders/status/2061631422188626083
X (formerly Twitter) Bernie Sanders (@BernieSanders) on X I will soon be introducing a bill to give the public a 50% ownership stake in the largest AI companies in America. This would guarantee that the trillions created by AI are used to improve the li…
  • ❤ 9
  • 😁 3
  • 👍 1
Post #286 1.74K
No comments
  • 😁 30
  • ❤ 5
  • 🤣 4
  • 🤔 2
Older posts →
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →