Ще на початку року різниця становила 15%.
DeepSeek отримала 81,1 бала в рейтингу LiveBench, тоді як найкращий результат Anthropic становить 83,4.
Водночас американські моделі зберігають домінування в рейтингу: 12 із 15 найкращих моделей — американські, тоді як китайських лише три.
LiveBench оцінює ШІ-моделі за тим, як вони відповідають на запитання, аналізують завдання та розв'язують головоломки.
High Bar Journal | Розсилка High Bar Newsletter | Telegram | LinkedIn Newsletter