история моих коммитов про машинное обучение, карьеру и набитые шишки
@ibragim_bad
Post #85
3.99K
Последние месяцы заметно вырос интерес к средам обучения с подкреплением (RL environments) и к сбору проверяемых задач. Вот например, заметка в TechCrunch про рост инетереса.
Одна из проблем масштабирования таких задач — у каждого датасета и бенчмарка свой репозиторий с кодом оценки и свой формат. Чтобы запустить агента на любом бенчмарке, приходится разбираться в скриптах, вносить правки и писать адаптеры.
У terminal-bench как раз есть единый удобный формат и готовые адаптеры для популярных наборов задач. Подробности – в разборе Макса, который я репостнул.
Вообще, я рекомендую канал Макса. Он тоже живёт в Лондоне, занимается кодовыми агентами + у него есть пара постов про собесы в фаанги на ml позиции: какие задают вопросы и какие диапазоны офферов.
Одна из проблем масштабирования таких задач — у каждого датасета и бенчмарка свой репозиторий с кодом оценки и свой формат. Чтобы запустить агента на любом бенчмарке, приходится разбираться в скриптах, вносить правки и писать адаптеры.
У terminal-bench как раз есть единый удобный формат и готовые адаптеры для популярных наборов задач. Подробности – в разборе Макса, который я репостнул.
Вообще, я рекомендую канал Макса. Он тоже живёт в Лондоне, занимается кодовыми агентами + у него есть пара постов про собесы в фаанги на ml позиции: какие задают вопросы и какие диапазоны офферов.
- 👍 10
- ❤🔥 4
- ❤ 2
- ⚡ 2













