Post #23182
6

Это, наверно, будет самый скандальный лидерборд в ИИ-индустрии – Arena выпустила Arena Alignment Index – индекс согласованности моделей. Говоря про скандальность я имею введу то, что Anthropic называл свои модели самыми согласованными, утверждая, что модели OpenAI не настолько согласованные, что выглядело неправдоподобно, учитывая бенчмарки в которых оценивается склонность моделей к вранью, но прямой независимой оценке до сих пор не было – теперь она есть. Советую заглянуть в пост, чтобы узнать, какие именно проблемы свойственны конкретным моделям, к примеру, в категории обманчивого завершения (deceptive completion) чаще всего встречается утверждение модель, что она проверила свою работу, хотя на самом деле этого не делала