TGViewer
Нейролента Нейролента @nairolenta · 22 subscribers
Post #312 4
📊 Цена решённой задачи важнее тарифа на токены

На 3 октября в индексе Artificial Analysis Claude Opus 5.5 набрала 58 баллов и заняла первое место среди 224 моделей. Но лидерство не означает, что Opus дешевле всех справится с работой: стоимость задания зависит от расхода выходных токенов, включая токены рассуждений.

Разница видна на максимальном уровне рассуждения: задача у Opus 5.5 стоит $5,98, у Sonnet 5.5 — $7,67, хотя токен Sonnet обходится дешевле. Sonnet выдала 420 млн выходных токенов за запуск против 260 млн у Opus. А GPT-6.1 Sol набрала 52 балла при средней цене задания $0,72 — редкий случай, когда высокая позиция в индексе сочетается с низким расходом.

Сравнивать нужно не только модели, но и настройки: у Opus 5.5 переход с low на max меняет индекс на 16 баллов, а цену задания — в 11 раз. Даже один бенчмарк может давать разные результаты: Terminal-Bench 4.0 для Grok 4.7 показал 37,6% в оценке xAI и 33% у Artificial Analysis. В разборе Habr правильно разделяют рекламные таблицы, независимые замеры и прямые тесты — у каждого типа своя погрешность.

И сводный индекс не отвечает на вопрос, какая модель лучше именно в вашем продукте: он усредняет разные задачи, а прямые сравнения часто опираются на выборку из одного-двух примеров. Для длинных задач в терминале лидируют Claude, а GPT-6.1 Sol выглядит выгоднее по соотношению цены и качества; это ориентиры, не гарантия результата в конкретном рабочем процессе.

Я бы сравнивал связку «модель + уровень рассуждения + лимит вывода», а не название модели отдельно: дешёвый токен легко превращается в дорогой ответ. В закупочном тесте важнее считать стоимость принятого результата на своих задачах, чем стоимость среднего задания в чужом индексе.

#стоимостьзадачи #бенчмарки #инференс #моделиИИ
More from @nairolenta
  1. Oct 4, 2026⚠️ Общий канал может перенести атаку между изолированными агентами 1 октября Simon Williso…
  2. Oct 4, 2026🛠 MCP-сервер пишется за вечер, а работа в рабочей среде начинается после Агент написал MC…
  3. Oct 4, 2026⚠️ Apple ужесточит доступ ИИ-агентов к файлам Mac 2 октября Apple объявила о новых огранич…
  4. Oct 3, 2026🛠 Агент NVIDIA сократил число токенов на 49% в среде GPT-5.6 Sol Сама модель не менялась…
  5. Oct 3, 2026⚠️ GLM-5.3 — открытая модель с автономными киберэксплойтами и слабой защитой Zhipu AI выпу…
  6. Oct 2, 2026⚠️ Grok за месяц до вторжения описал Трампу сценарий захвата Мадуро В декабре 2025-го, при…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →