Что там с китайскими моделями?
Друг скинул мне видео. Не пугайтесь, оно настоящее. Модели пока не научились настолько хорошо воссоздавать реальность, но мне казалось, что они очень хорошо ищут информацию. Не зря же все говорят, о том как хорошо GPT-5.2 Pro находит подтверждения теоремам, которые были доказаны, но таковыми не считались, да? Да ведь?
Ну... кажется, что всё не так просто. Я дал четырём моделям один и тот же промпт: «What's the origin of this video?» с надеждой, что хотя бы одна из них справится.
1. Kimi K2.5 Thinking. Справилась лучше и быстрее всех. Она сразу дала мне ссылку на оригинальное видео в TikTok, а также рассказала, где оно было снято, и даже нашла видео от конюшни, где ребята взяли лошадь!!
2. GPT-5.2 Extended Thinking. Сначала вообще не поняла, что от неё хотят, но после уточнения запроса нашла то же видео от конюшни, что нашла Kimi. Оригинальное видео со смешными комментариями я так и не получил.
3. Opus 4.6 Extended Thinking. Увидела в названии видео метаданные, которые оставил TikTok, но при просьбе найти видео по ним сказала, что на самом деле такое видео не существует. Ну, хотя бы ничего не придумала и на том спасибо.
4. Gemini 3 Pro. Сначала отказалась выполнять задачу, но после вежливой просьбы всё-таки разобраться с тем, что я от неё прошу, написала код на Python, чтобы увидеть, что изображено на кадрах из видео (ну, это тоже своего рода мультимодальность). Подумала, подумала, посжигала токены и придумала, что действие происходит в Уфе в 2021-м году, тогда как на самом деле видео было снято в Речице в 2026-м году. Никаких ссылок не дала, зато придумала несуществующий аккаунт в TikTok, где предложила мне поискать видео самому. 10/10.
По итогу с задачей справилась только Kimi K2.5. Да, GPT-5.2 дала полезную подсказку, но от неё было бы очень сложно раскрутить источник видео, ибо оригинал со смешными комментариями был запощен на совершенно другой, пустой аккаунт, никак не относящийся к Додо.
И вот самый кайф в том, что модель постоянно так отвечает. Это не какая-то разовая акция, где она обошла все американские модели. Я уже проводил пару подобных тестов на других своих задачах, и Kimi K2.5 во всех была стабильно впереди. Можно сказать, что это Opus 4.6 от мира бытовых вопросов. Уже как пару недель пользуюсь только ей, ни разу не пожалел что перешёл.
Post #93
565
- 👍 5
- ❤ 2
- 🔥 1