TGViewer
Linux Ninja Linux Ninja @linux_ninjas · 3.42K subscribers
Post #1215 444
J-Space, который завирусился в Twitter, сообщество разоблачило как фейк.

За последние два дня он очень быстро привлёк огромное внимание благодаря набору крайне завышенных результатов тестирования DeepSeek V4, а посты о нём распространили многочисленные аккаунты, занимающиеся продвижением ИИ, как в Китае, так и за его пределами.

В проекте автор утверждает:

V4 Flash + J-Space может сравняться с GLM-5.3.

V4 Pro + J-Space напрямую превосходит Fable 5 в нескольких агентных бенчмарках.

Одновременно утверждается, что скорость выросла в 2,53 раза, а эффективность использования токенов — в 2,21 раза.

Если эти данные верны, это означает, что существует способ повысить результаты DeepSeek сразу в нескольких сложных агентных бенчмарках почти до уровня смены поколения модели, при этом вообще не изменяя её веса.

Проблема в том, что сообщество обнаружило, что эти результаты невозможно воспроизвести.

Пользователь GitHub GoForceX провёл тесты с высокой параллельностью на выборке из 87 задач Terminal Bench 2.1 и подтвердил, что загружал skill.md J-Space и другие его модули.

Результаты оказались полностью противоположны официальному отчёту.

После добавления J-Space результаты в бенчмарке немного снизились, а расход токенов и стоимость, наоборот, выросли.

Это не просто ошибка в десятичной запятой.

Результаты напрямую противоречат главным рекламным заявлениям проекта — «рост производительности, рост скорости и рост эффективности использования токенов».

После этого всё больше разработчиков начали требовать от автора опубликовать исходные материалы экспериментов, включая полные настройки оценки, ответы модели, логи запусков DSH, результаты по каждой задаче, исходные замеры времени и расход токенов.

И вот здесь возникает основная проблема.

Так называемый «полный отчёт об оценке» проекта в основном раскрывает только итоговые агрегированные результаты.

Исходных результатов, подтверждающих эти точные цифры, логов запусков по каждой задаче, манифестов запусков или полного набора данных для воспроизведения эксперимента нет.

Особенно примечательно, что улучшения эффективности в проекте указаны не приблизительно, а с очень конкретными числами — 2,53× и 2,21×.

Но когда сообщество потребовало исходные данные, сам автор ответил:

«Эти данные действительно преувеличены».

И заявил, что в целом улучшение можно считать находящимся примерно в диапазоне от 1,6× до 3×.

Это вызывает очень прямой вопрос.

Если 2,53× и 2,21× действительно были рассчитаны по результатам реальных запусков бенчмарков, то где соответствующие исходные данные по времени и расходу токенов?

На данный момент автор не дал официального ответа на сомнения сообщества и вместо этого удалил несколько issues, в которых высказывался скепсис.

Буду продолжать следить за развитием ситуации.

✈️ Linux Ninja
  • 👍 2
More from @linux_ninjas
  1. Oct 6, 2026Linux 7.4 готовится к поддержке Mac на Apple M4. В список также попал MacBook Neo на A18 P…
  2. Oct 3, 2026Linux-совет: сколько места занимают файлы и папки Чтобы проверить место, занимаемое папкой…
  3. Oct 3, 2026Теперь VMware можно заменить неизменяемой Linux-платформой, на которой одновременно работа…
  4. Oct 2, 2026От DNS до Pod: как работает Kubernetes Gateway API Типичная схема с облачным балансировщик…
  5. Oct 2, 2026👩‍💻 Всем программистам посвящается! Вот 14 авторских обучающих IT каналов по самым востр…
  6. Oct 2, 2026Linux-совет: как проверить свободное место на диске Выполните: df -h Команда покажет занят…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →