TGViewer
Data Secrets Data Secrets @data_secrets · 94.3K subscribers
Post #9138 112K
Китайский исследователь создал специальный бенчмарк, с помощью которого можно оценить количество параметров в любой модели

Как мы знаем, закрытые лаборатории не раскрывают количество параметров своих моделей. Есть стандартный метод оценки через экономику инференса, но он дает погрешность в 2× и более из-за неизвестных деталей об инфре.

Так вот: позавчера на архиве появилась статья, в которой автор предлагает принципиально иной подход, через оценку количества знаний модели. Речь именно о знании фактов, а не интеллекте в целом, потому что способность к рассуждению можно дистиллировать и сжимать в меньшие модели, а фактические знания – нет, они ограничены энтропией Шеннона.

Методология такая: автор создал бенчмарк из 1400 фактических вопросов, разбитых на 7 уровней редкости, от широко известных фактов до крайне малоизвестных. Его откалибровали на 89 открытых моделях с известным числом параметров, и оказалось, что есть явная (R²=0.917) лог-линейная зависимость скора на бенче от числа параметров.

Проецируя закрытые модели на калибровочную кривую, автор получает такие оценки*:

– GPT-5.5 ≈ 9.7T параметров
– Claude Opus 4.6 ≈ 5.3T
– Claude Sonnet 4.6 ≈ 1.7T
– Gemini 2.5 Pro ≈ 1.2T


• из-за природы метода и из-за настроек безопасности некоторых моделей (на какие-то вопросы они могут просто отказываться отвечать), эти оценки ближе к нижним границам.

Конечно, точность все равно довольно мала, но числа интересные.

https://arxiv.org/pdf/2604.24827
  • 👍 164
  • 🔥 48
  • ❤ 38
  • 🤔 19
  • 😁 1
More from @data_secrets
  1. Oct 1, 2026FigureAI заставляют своих роботов предыдущего поколения бросаться в лаву, чтобы избавиться…
  2. Sep 30, 2026Gemini 4 Argon, сводка: — По бенчмам все супермощно, на многих тестах это новая SOTA, вклю…
  3. Sep 30, 2026Что, простите? Google только что вернулся в гонку с новой моделью, которая превосходит Ast…
  4. Sep 30, 2026Anthropic призывают ограничить GLM-5.3 В стартапе протестировали модель на способности в о…
  5. Sep 30, 2026Каждую осень у бизнеса просыпается спрос на подрядчиков – бухгалтеров, юристов, маркетолог…
  6. Sep 30, 2026DeepSeek вместе с Huawei разрабатывают альтернативу CUDA Компании выложили в опенсорс набо…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →