Конечно интересно, чем ответит Антропик, но вообще эта возня меня начинает раздражать.
Вот такие соображения:
- то как делаются современные бенчмарки - во многом «читерство». Особенно лучи гнева arena.ai с их манерой масштабировать барчарты не относительно нуля (это даёт существенное искажение - разоблачение в следующем посте)
- нет особенного смысла в один промт генерить игру-шутер или классическую музыку с неаполитанской гармонией и говорить «о да эта модель сильнее», в таком виде это инфоцыганство; есть несколько разных ролей, в агентской разработке базово их штук 5 по стадиям цикла, и в этих задачах модель типа астры оправдана меньше чем в половине, остальные задачи должны делать быстрые, четкие, недорогие рабочие лошадки
- обвязка, стоимость и скорость (!) для многих ролей важнее модели
- что происходит с китайскими моделями супер-важно, ресерчеры в корпоративных AI-центрах компетенций должны одновременно проверять флагманы американские, ризонинн-флагманы китайские (glm/kimi) и рванувшие по соотношениям скорость/качество/цена qwen/deepseek; и поэтому роутеры тоже рулят
- с локальными моделями всё пока плохо (дорого, медленно), но шаг по сравнению с тем что было полгода назад огромный, и там назревает бум: например, есть прикольный стартап с пересобранным движком для инференса и квеном (пока 3.6) который добивается скорости локальной генерации выше 100 токенов/сек на не-космических маках (называется Mirai Labs; ждем qwen 3.8).
Вот как-то так (и никак иначе). На ходу, конспективно, чуть позже распишу пункты подробнее.
Картинка стырена у Владимира Иванова.
Post #554
4.03K

- 👍 17
- 🔥 8
- 🤔 2