OpenAI в этом бенчмарке признаёт, что чужая модель (Claude 3.5) показала лучший результат, чем их собственные. Это как минимум добавляет немного доверия к их честности — но всё равно не отменяет, что условия теста они всё равно задавали сами.
Аспиранты ФКН ВШЭ, жду ваши статьи с бенчмарком.
@edtechhacker
Post #478
207

- 🐳 2