Сравниваем модели Claude Sonnet и DeepSeek R1 в кодинге на OpenHands.
Сегодня попробовал переключиться с Claude Sonnet на DeepSeek R1 в OpenHands. Мотив простой: китайская модель дешевле, плюс еще и ризонинг. Гипотеза была, ну как минимум - не хуже. Но увы, DeepSeek R1 во-первых не справилась с задачей совсем, а во-вторых, совсем не "размышляла". Просто молча изменила код, не углубляясь в контекст.
Так что пока вернулся на Claude. Можете сравнить результаты на двух фото.
Слева DeepSeek молча поменяла код. Справа Claude, объясняла что она делает и зачем.
Вот benchmark сравнения разных моделей для OpenHands. Судя по всему ризонинг модели просто еще нормально не адаптировали для OpenHands.
@ai_skillful
Post #83
469


- 🔥 4
- ❤ 3