TGViewer
Анализ данных (Data analysis) Анализ данных (Data analysis) @data_analysis_ml · 50.6K subscribers
Post #5727 4.9K
✔️ Qwen выпустил бенчмарк, где агент год управляет бизнесом

Qwen вместе с Taobao & Tmall и сделала E-Commerce Bench, где агенту дают 100 тысяч юаней и 365 виртуальных дней. Он изучает категории, торгуется с поставщиками, назначает цены, следит за календарём распродаж, тянет склад и контролирует денежные потоки, причём одновременно может вести до четырёх магазинов.

Ни потолок спроса, ни себестоимость ему не показаны - до всего нужно докопаться самому.


🟡 Детали экономики

Рабочий день идёт с 8 утра до 6 вечера, и каждый вызов инструмента тратит время: проверить деньги (10 минут), открыть магазин (60), написать поставщику (30).

Расходы списываются сразу, а выручка идёт через комиссию, эскроу, 9 дней ожидания и ручной вывод.

Склад сводится посуточно, товар, не отправленный за двое суток, отменяется, а репутация напрямую множит спрос: магазин на дне её шкалы получает 15% от обычного трафика.

🟡Ядро переговоров

Если бы роль поставщика играла языковая модель, одна и та же стратегия давала бы разные цены, а бенч превратился бы в соревнование по джейлбрейку. Поэтому все уступки и отказы считает жёсткий алгоритм, а модель лишь переводит его решения в речь на виртуальных переговорах.

🟡Что показали тесты

GPT-5.6 Sol - лидер, он закончил год с 1,43 млн юаней, увеличив капитал в 14,3 раза.

Qwen3.8-Max-Preview - лучшая среди моделей с открытыми весами, на конец года у нее было 416 тыс. юаней

Qwen3.5-Plus остался с 1100 юанями.

Кстати, 10 циклов из 90 закончились банкротством, и сценарий почти всегда один - забить склад в январе и не суметь распродать.


🟡Дополнительные оси оценки

Торговаться толком не научился никто.

До себестоимости поставщика не додавил ни один агент. Единственный, кто хоть как-то сбивал цену - Opus 4.7, но по настроению.

Исключение - Qwen3.8-Max-Preview, которая продавливает цену ниже на повторных заказах.


С мошенниками вышло интереснее всего.

Их в реестре 152 из 576 (26,4%), они пишут всем моделям, но у Opus 4.7 деньги получили 4% тех мошенников, с кем он заговорил, у GPT-5.6 Sol - 31,7%.


ИИ-предприниматели категорически не умеют распоряжаться рабочим временем.

Отправки, переходы на следующий день, вывод наличных и выкладка товара съедают 71,8% всех вызовов. На разговоры с поставщиками приходится 6%. На пересмотр цен 0,66%.


Модели заняты обслуживанием процесса, а не экономикой.

Отсюда странность в рейтинге эффективности. Fable5 зарабатывает 479 юаней на вызов против 363 у Sol, тратя при этом почти вдвое меньше вызовов, а по итоговым деньгам идёт позади.



🟡За год почти никто ничему не научился

Измерять обучение на длинной дистанции сложно, но тут у бенча есть линейка.

Ядро переговоров никогда не уходит ниже собственной себестоимости, значит лучшая цена, которую агент однажды выбил, - это верхняя граница того, за сколько поставщик готов отдать товар. Дальше можно сравнивать - следующая закупка у того же поставщика прошла дешевле или дороже уже достигнутого.

На 8647 повторных покупок улучшили свой же результат только 2 модели из 18, а 15 переплачивали настолько, что промахивались мимо случайного порядка больше чем на 2 стандартных отклонения.



📌Лицензирование: Apache 2.0 License


🟡Страница проекта
🟡Arxiv
🖥Github

#AI #ML #Agents #ECommerce #Benchmark #Qwen
  • 🔥 17
  • 👍 9
  • ❤ 8
More from @data_analysis_ml
  1. Sep 22, 2026Один вечер — много возможностей! ⚡️ 25 сентября у тебя будет шанс познакомиться сразу с че…
  2. Sep 22, 2026Xiaomi представила MiMo-V2.6 с открытыми весами 👀 В семейство вошли две MoE-модели: - Fla…
  3. Sep 21, 2026⚡️OpenAI заявила о решении более 100 открытых задач по математике 🤯 28 августа OpenAI нач…
  4. Sep 21, 2026В любом случае, Claude забанил мне два аккаунта, я ставлю на победу Альтмана!
  5. Sep 21, 2026🔥 Один из лучших обучающих курсов на StepiK по SQL SQL можно знать годами и всё равно тер…
  6. Sep 21, 2026«Я хочу отправить их в тюрьму»: по данным Politico, Трамп произнёс это во время конфликта…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →